Энтропия и перекрёстная энтроп... Заметка
DEV Community на русском

Энтропия и перекрёстная энтропия, объяснение

Энтропия количественно определяет неожиданность, связанную с исходом случайного события. Справедливая монета с ее непредсказуемыми результатами обладает высокой энтропией, в то время как подтасованная монета с в основном предсказуемыми исходами имеет низкую энтропию. Математически энтропия — это математическое ожидание неожиданности, рассчитываемое как сумма вероятностей каждого исхода, умноженная на отрицательный логарифм его вероятности. Логарифм вероятности представляет собой неожиданность, причем более редкие события вызывают большее удивление из-за их меньших вероятностей. Отрицательный знак обеспечивает положительную "оценку неожиданности", а умножение на вероятность и суммирование дает среднюю неожиданность за множество испытаний.Кросс-энтропия расширяет это понятие на ситуации, когда истинное распределение вероятностей неизвестно, что часто встречается в машинном обучении. Она измеряет неожиданность, возникающую при использовании предсказанного распределения для расчета вероятностей на основе истинного распределения. Ключевое отличие заключается в использовании логарифма предсказанной вероятности (q(x)), при этом в сумме она взвешивается истинной вероятностью (p(x)). Если предсказанное распределение точно соответствует истинному распределению, кросс-энтропия будет низкой. И наоборот, если модель уверенно ошибается, логарифм предсказанной вероятности будет большим отрицательным числом, что приведет к высокому значению кросс-энтропии. Такое поведение делает кросс-энтропию идеальной функцией потерь для моделей машинного обучения.В классификации нейронных сетей модель выдает распределение вероятностей по возможным классам. Кросс-энтропийные потери эффективно сравнивают это предсказанное распределение с истинной меткой класса, часто представленной в виде one-hot вектора. Для истинной метки, закодированной в one-hot формате, формула кросс-энтропии упрощается, фокусируясь исключительно на предсказанной вероятности правильного класса. Во время обучения нейронная сеть стремится максимизировать предсказанную вероятность правильного класса, тем самым минимизируя кросс-энтропийные потери до нуля. Этот процесс побуждает модель делать все более точные и уверенные предсказания.