熵与交叉熵的解释 笔记

熵与交叉熵的解释

熵量化了随机事件结果所关联的惊讶程度。一枚公平的硬币因其结果不可预测而具有高熵,而一枚被操纵的硬币由于结果大多可预测则具有低熵。从数学上讲,熵是惊讶度的期望值,计算方式为各结果概率与其概率负对数之积的总和。概率的对数代表惊讶度,概率越小的罕见事件引发的惊讶度越高。负号确保“惊讶得分”为正,再乘以概率并求和,即得到多次试验中的平均惊讶度。交叉熵将这一概念扩展至真实概率分布未知的情况,这在机器学习中十分常见。它衡量的是使用预测分布来计算基于真实分布的概率时所遭遇的惊讶度。关键区别在于,求和时使用的是预测概率的对数 q(x),但仍以真实概率 p(x) 作为权重。如果预测分布与真实分布高度吻合,交叉熵将较低;反之,若模型自信地做出错误预测,预测概率的对数将是一个较大的负数,从而导致较高的交叉熵值。这种行为使得交叉熵成为机器学习模型理想的损失函数。在神经网络的分类任务中,模型输出一个关于潜在类别的概率分布。交叉熵损失有效地将该预测分布与真实类别标签进行比较,真实标签通常表示为独热向量。对于独热编码的真实标签,交叉熵公式得以简化,仅关注正确类别的预测概率。在训练过程中,神经网络旨在最大化正确类别的预测概率,从而将交叉熵损失最小化至零。这一过程驱动模型做出越来越准确且自信的预测。