2-4 볼츠만 확률분포식의 유도 과정과 머신러닝 Softmax의 출발점

codingart(66)
Published in
#kr
Words
913
Reading
5 min
Listen
Play
8y

총 에너지가 8ΔE이면서 6개의 입자로 이루어진 볼츠만 확률 분포를 고려해 보자. 0∼8ΔE 구간의 이산적 에너지 레벨의 수는 9개이다.
입자들은 identical 하면서 distinguishable 하다고 가정한다. identical 하다는 가정은 고려하는 6개의 입자가 물성이 동일하다면 즉 예를 들어 “모두 같은 크기 및 질량을 가지는 탄소분자로 이루어진다” 라고 가정하면 이미 만족이 된 상태이며 아래 표상에서 더 이상 영향을 주지는 않는다. distinguishable 하다는 가정은 설사 입자들의 에너지 레벨이 같다하더라도 그 입자의 위치와 운동 방향에 따라 운동량 벡터가 다르면 구별이 가능하다고 본다.

※참고로 본문에서는 수학적인 내용이 많이 포함되어 있다. 특히 편미분 개념은 고교에서 함수의 극값을 구하는 조건으로 이해하면 된다. 라그랑즈 승수 기법은 대학을 넘어 대학원 최적 설계 과정에서 많이 다루는 내용임을 참조하고 그렇게 내용적으로만 이해하도록 하자. 아울러 평균속도를 계산하는 적분과정도 대학과정 고학년 수학에 해당하나 과정을 이해하는 선 정도면 충분하다. 따라서 정성적으로 이해가 된다면 이미 머신 러닝의 Softmax를 잘 이해했다고 볼 수 있을 것이다.

noname01.png

6개의 입자를 총 에너지 합이 8ΔE라는 조건 하에 나올 수 있는 경우의 수들은 20이 되며 이 각각의 경우를 Macrostate j 라고 하자. 각 Macrostate j에서 가능한 겨우의 수 즉 microstate 경우의 수 Ω는 multinomial distribution에 의해 계산된다.

noname02.png

N의 값은 6이지만 실제의 통계 물리학에서는 엄청나게 큰 숫자가 됨에 유의하자.
아울러 입자 수가 많아지게 되면 9개로 설정해둔 에너지 레벨 수도 엄청나게 늘어날 수 있을 것이다.

특정한 하나의 Macrostate 상태 즉 Macrostate j 에 주목하자. 예를 들면 위 표에서 j=6인 Macrostate 6은 60개의 microstate 경우의 수를 가진다.
특정한 Macrostate j 상태에서 각 기체 입자들은 운동을 하고 있으므로 에너지 레벨들 사이에 입자 이동이 일어날 수 있을 것이지만 에너지 레벨 전체로 집계하게 되면 입자수 SMS 일정하게 유지 되어야 한다.

noname03.png

한편 입자들이 운동을 하기 때문에 때로는 상호 충돌이 일어날 수도 있는데 충돌 전후로 하여 에너지의 합이 일정하게 보존이 되어야 한다. 그러기 위해서는 입자간의 충돌 방식이 반드시 탄성 충돌이어야 한다. 탄성체에 외력을 가해 일을 해주면 탄성 에너지 형태로 내부 에너지가 축적되며 외력이 제거되면 다시 원래대로 회복이 되면서 탄성 에너지를 토출해 내게 된다. 즉 Macrostste j 의 전체 에너지는 각 에너지 레벨 별로 입자 수 변동이 일어나더라도 항상 일정하게 유지되어야 한다는 점이다. 단 여기서 에너지 레벨 값도 상수이다.

noname04.png

통계물리학에서 다루는 3종류의 시스템이 있다.
noname05.png

그 중에서 볼츠만 확률분포와 관련된 시스템은 가장 단순한 가정을 사용하는 Microcanonical Ensemble 임을 알 수 있으며 위 (1), (2), (3) 식으로 정식화가 가능하다.

한편 볼츠만 확률 분포는 가장 probable 물리상태로서 입자수 분포의 함수인 경우의 수 Ω가 최대값을 가지게 되는 경우이다. 즉 (1)식의 Ω가 특정 에너지 레벨의 입자 수에 대한 편미분 값이 0 이 되어야 한다. 에너지 레벨이 총 9개이므로 경우의 수 Ω의 9개의 편미분이 있을 수 있다. N=6 인 입자수가 대단히 작은 경우에 이 개념이 어색할 수도 있겠지만 실제적인 물리 상황에서 에너지 레벨 별 입자 수가 엄청나게 많기 때문에 이산적이 아니라 조성(composition)또는 농도(concentration)를 나타내는 연속 변수로 설정이 가능하면 Ω라는 함수의 편미분이 자연스러워 보일 수 있을 것이다.

noname06.png

(2)식의 총 입자 수 보존식은 각 에너지 레벨에서 들어오고 나가는 입자 수의 변화가 있을 수 있으나 에너지 레벨 전체로 집계하면 변동이 없어야 한다는 점이다.

noname07.png

(3)식의 총 에너지 보존시은 각 에너지 레벨에서 들어오고 나가는 입자 수의 변화가 있을 수 있으나 에너지 레벨 전체로 에너지 값을 집계하면 변동이 없어야 한다는 점이다.

noname08.png

복잡할 수도 있는 (4),(5),(6) 식을 묶어서 풀어내는 과정에 Stirling‘s Formula 에 의한 도움이 필요하다. 스털링의 공식에 의하면 대단히 큰 수의 팩토리얼 값을 다음과 같이 근사적으로 계산할 수 있다. 즉 x 값이 커질수록 잘 맞는다. 통계물리학에서 입자 수는 1몰에 담겨 있는 아보가드로 수 만큼의 입자를 생각한다면 얼마나 큰 숫자일지 상상이 안될 정도이다.

(5)식을 활용하면서 (4)식을 편미분하여 간략화 해보자.

noname09.png

(5)식과 (6)식의 조건을 만족함과 동시에 볼츠만의 확률분포에서 물리적으로 가장 probable 한 다시 말하면 일어날 가능성이 높은 경우의 수 Ω가 최대값을 가지게 될 조건이 (7)식의 간략한 표현으로 얻어졌다.

이와 같이 2개의 구속조건을 가지면서 Ω가 최대값을 가지게 되는 조건은 (7)식에 대하여 (5)식과 (6)식에 각각의 라그랑즈 상수를 곱하여 (7)식에 더한 후 풀면 된다.

noname10.png

이때에 도입되는 2개의 라즈랑즈 상수 중 λ는 확률 분포식에 nomralization 조건을 부과하여 결정하고 나머지 하나는 에너지 단위를 가지는 상수로서 ε=kT 로 결정된다. k는 볼츠만 상수이며 T는 절대 온도를 나타낸다.
최종적으로 볼츠만의 확률 분포는 다음과 같이 표현된다.

noname11.png

Z는 partition 함수라고 하며 볼츠만 분포가 아닌 Fermi-Dirac 분포라든지 Bose-Einstein 분포를 사용할 때 다시 사용됨에 유의하자.
여기까지의 유도과정을 통해 입자들의 identical 하면서 distinguishable 한 가정들이 요소 요소에 스며들어 있음을 이해하자.

볼츠만 확률 분포식에서 에너지 레벨은 결국 기체 입자들의 운동이므로 이 확률 분포에 의해서 용기 내의 입자들의 평균 운동 속도를 통계적으로 산출할 수 있다.

noname12.png

이 식에 속도 v를 곱하여 0에서 +∞까지 적분하면 기체 입자의 평균속도가 얻어진다.

noname13.png

통계물리학에서는 rms 속도를 계산하기도 한다. 윗 식에서 확률 분포 앞 부분에 v 의 제곱 항을 넣고 적분하면 된다. 즉 통계 물리학에서 필요로 하는 내용은 기체 입자들의 평균 속도 까지다.

통계 물리학과 일반 통계학이나 머신 러닝과는 통계 물리학에서는 분포식의 지수에 랜덤한 기체 입자들의 속도에 의한 운동에너지를 용기내 절대 온도로 나눈 항의 음의 값이 엑스포넨트로 사용이 된다. 반면에 여기서부터 서로 다른 길을 가게 되는 머신 러닝에서는 역시 랜덤한 성격을 가지는 Classifier로부터 계산되는 Hypothesis 가 그 역할을 대신하게 되는 것이다. 그것이 가능한 이유는 볼츠만 확률분포 유도 전체에 걸쳐 적용되고 있는 identical 하면서 distinguishable 한 입자의 특성이 운동에너지와 용기 온도에 의해 환산되어 사용되듯이 머신 러닝의 Hypothesis 레벨 값도 identical 하면서 distinguishable 한 특성을 만족시키는 랜덤한 이미지의 픽셀 데이타에서 출발하여 Classifier 적용에 따라 얻어지기 때문이다.

이 문제에 관해서는 이미 필자의 최근 저서인 “파이선 코딩 초보자를 위한 텐서플로우∙OpenCV 머신러닝” 75∼91 페이지에 걸쳐 이미 어느 정도 다루었던 내용이기도 하다. 하지만 다시 그 내용을 다시 거론하는 이유는 그 간에 볼츠만 확률분포 공식을 머신 러닝에서 차용해 쓰기 위한 필요충분 조건들이 무엇인지를 탐구해 본 결과를 다시 정리하게 되었다. 하지만 여기까지의 정리로 끝나는 것이 아니라 머신 러닝을 제대로 하기 위해서 다시 말하자면 Softmax를 제대로 활용하기 위해서 반드시 필요할 수도 있는 통계학적 가정 및 지표(평균, 분산 및 상관관계) 문제를 어떻게 다루어야 할 것이지에 대한 방법론을 제시할 예정이다.

다음 url 주소에서 본서의 pdf 목차 파일을 무료로 다운받을 수 있으므로 참고하도록 하자.
https://steemit.com/kr/@codingart/pryx1-opencv

noname14.png

2-4 볼츠만 확률분포식의 유도 과정과 머신러닝 Softmax의 출발점 | Ecency