99% トークン精度、学習ゼロ。RLによるビジョンモデルのフ... ノート

99% トークン精度、学習ゼロ。RLによるビジョンモデルのファインチューニングからのフィールドノート。

著者は、ビジョン・言語モデルのファインチューニングの経験を回想し、多くの失敗はアルゴリズムの欠陥ではなく、運用上の問題に起因することを強調しています。18時間の教師ありファインチューニングでは99%のトークン精度を示しましたが、実際の評価指標である多肢選択問題の正答率は変化しませんでした。これは、自由形式の推論を教師ありで学習させている一方で、単一の抽出された回答を評価していたため、プロキシ指標のドリフトが発生したことを示しています。GRPOトレーナーは、2つのライブラリがシーケンス長について意見が一致せず、画像パディングトークンが2回カウントされたためにクラッシュしました。これは、コンポーネントの境界における統合バグを示唆しています。著者は、このようなモンキーパッチには、バグが静かに再導入されるのを防ぐための安価な回帰テストが必要であることを学びました。重要なRLループでは、長期間にわたって学習が停滞しましたが、これは最終的に報酬パイプラインのラベルノイズと逆転したアドバンテージ信号に起因することが判明しました。この「静かな」失敗は、クラッシュを示さず、学習の欠如のみを示しており、報酬計算の徹底的な監査の必要性を強調しています。これらの経験から、すべてのトレーニング実行に不可欠な「ハーネスルール」が生まれました。これらには、コンピューティングリソースをコミットする前にスモークテストを実行すること、スコアリングされていない実行がスコアリングされた実行と誤解されないように実行がフェイルクローズでゲートされることを保証すること、インフラストラクチャの障害とモデルのパフォーマンスの低下を厳密に分離することが含まれます。決定的なのは、保持された評価指標のみが真の決定要因と見なされ、他のすべての指標は単なるテレメトリとして機能することです。著者は、これらの「退屈な」ルールが信頼できる結果を得るために不可欠であることを強調しています。