AWS Machine Learning Blog 日本語 フォロー Amazon Nova を用いた教師ありファインチューニングのためのセルフ蒸留推論の探求 この投稿では、SFTカスタマイズにおいて推論トレースが不足しているデータセットの思考トークン生成に関するアイデアを探求します。まず、推論抑制問題について検討し、次にSelf-Distilled Reasoning (SDR)を紹介し、3つのベンチマークで検証し、実践的な推奨事項を提供します。 Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova aws.amazon.com