DEV Community 日本語
フォロー
エントロピーと交差エントロピーの説明
エントロピーは、ランダムな事象の結果に伴う驚きを定量化します。予測不可能な結果をもたらす公正なコインは高いエントロピーを示しますが、ほとんど予測可能な結果をもたらす不正なコインは低いエントロピーを示します。数学的には、エントロピーは驚きの期待値であり、各結果の確率にその確率の負の対数を掛けたものの合計として計算されます。確率の対数は驚きを表し、よりまれな事象はより小さな確率のために、より大きな驚きを引き起こします。負の符号は正の「驚きのスコア」を保証し、確率で乗算して合計すると、多くの試行にわたる平均の驚きが得られます。クロスエントロピーは、真の確率分布が不明である状況にこの概念を拡張します。これは機械学習で一般的です。真の分布に基づいて確率を計算するために予測された分布を使用する際に遭遇する驚きを測定します。主な違いは、合計で真の確率 (p(x)) で重み付けしながら、予測された確率 (q(x)) の対数を使用することにあります。予測された分布が真の分布に密接に一致する場合、クロスエントロピーは低くなります。逆に、モデルが自信を持って間違っている場合、予測された確率の対数は大きな負の数になり、高いクロスエントロピー値につながります。この動作により、クロスエントロピーは機械学習モデルに理想的な損失関数となります。ニューラルネットワーク分類では、モデルは潜在的なクラスの確率分布を出力します。クロスエントロピー損失は、この予測された分布を真のクラスラベルと比較します。真のクラスラベルは、多くの場合、ワンホットベクトルとして表されます。ワンホットエンコードされた真のラベルの場合、クロスエントロピーの式は単純化され、正しいクラスの予測確率のみに焦点を当てます。トレーニング中、ニューラルネットワークは正しいクラスの予測確率を最大化することを目指し、それによってクロスエントロピー損失をゼロに最小化します。このプロセスにより、モデルはますます正確で自信のある予測を行うようになります。