Исследование самодистиллирован... Заметка

Исследование самодистиллированного рассуждения для дообучения под наблюдением с помощью Amazon Nova

В этом посте мы исследуем идею генерации "мыслительных токенов" для наборов данных, в которых отсутствуют следы рассуждений при настройке SFT. Сначала мы рассмотрим проблему подавления рассуждений, затем представим Self-Distilled Reasoning (SDR), проверим его на трех бенчмарках и дадим практические рекомендации.
CdXz5zHNQW_7LgEP0LAlu.png