엔트로피와 교차엔트로피 설명
엔트로피는 무작위 사건 결과와 관련된 놀라움을 정량화합니다. 예측 불가능한 결과를 가진 공정한 동전은 높은 엔트로피를 나타내는 반면, 대부분 예측 가능한 결과를 가진 조작된 동전은 낮은 엔트로피를 가집니다. 수학적으로 엔트로피는 놀라움의 기댓값이며, 각 결과의 확률에 해당 확률의 음수 로그를 곱한 값의 합으로 계산됩니다. 확률의 로그는 놀라움을 나타내며, 희귀한 사건은 더 작은 확률로 인해 더 큰 놀라움을 유발합니다. 음수 부호는 양수 "놀라움 점수"를 보장하며, 확률을 곱하고 합산하면 여러 시도에 걸친 평균 놀라움이 나옵니다.교차 엔트로피는 기계 학습에서 흔히 발생하는 실제 확률 분포를 알 수 없는 상황에 이 개념을 확장합니다. 이는 실제 분포를 기반으로 확률을 계산하기 위해 예측된 분포를 사용할 때 발생하는 놀라움을 측정합니다. 핵심 차이점은 합계에서 실제 확률(p(x))로 가중치를 부여하면서도 예측된 확률(q(x))의 로그를 사용한다는 것입니다. 예측된 분포가 실제 분포와 밀접하게 일치하면 교차 엔트로피는 낮아집니다. 반대로, 모델이 자신 있게 틀렸다면 예측된 확률의 로그는 큰 음수가 되어 높은 교차 엔트로피 값을 초래합니다. 이러한 특성은 교차 엔트로피를 기계 학습 모델에 이상적인 손실 함수로 만듭니다.신경망 분류에서 모델은 잠재적 클래스에 대한 확률 분포를 출력합니다. 교차 엔트로피 손실은 이 예측된 분포를 실제 클래스 레이블과 효과적으로 비교하며, 이는 종종 원-핫 벡터로 표현됩니다. 원-핫 인코딩된 실제 레이블의 경우, 교차 엔트로피 공식이 단순화되어 올바른 클래스의 예측 확률에만 집중됩니다. 훈련 중에 신경망은 올바른 클래스의 예측 확률을 최대화하여 교차 엔트로피 손실을 0으로 최소화하는 것을 목표로 합니다. 이 과정은 모델이 점점 더 정확하고 자신감 있는 예측을 하도록 이끕니다.