AWS Machine Learning Blog на русском
Подписаться
Исследование самодистиллированного рассуждения для дообучения под наблюдением с помощью Amazon Nova
В этом посте мы исследуем идею генерации "мыслительных токенов" для наборов данных, в которых отсутствуют следы рассуждений при настройке SFT. Сначала мы рассмотрим проблему подавления рассуждений, затем представим Self-Distilled Reasoning (SDR), проверим его на трех бенчмарках и дадим практические рекомендации.