アルミン・ロナシェール:より良いモデル:より悪いツール ノート

アルミン・ロナシェール:より良いモデル:より悪いツール

最近のAnthropicモデル、特にOpus 4.8とSonnet 5は、Piの編集ツールで異常な問題を示しています。これらの高度なモデルは、ネストされた編集配列内に、追加の、発明されたフィールドを持つツールコールを生成することがあります。コアとなる編集操作は通常正しいですが、これらの余分な引数が原因で、Piはスキーマの不一致によりツールコールを拒否します。この問題は、古いモデルと比較して、新しい最先端モデルでより一般的です。ツールコールは、本質的にAPIによって解釈されるテキストベースの信号であり、魔法のプロセスではありません。モデルは特定のフォーマットでトレーニングされており、システムが特定の引数でツールを呼び出すコマンドとして認識するテキストを出力します。テキストは、ファイルパスと編集のための特定のペイロード構造を期待する編集ツールを記述しています。制約がない場合、モデルはこれらのツールコールを生成するために学習された慣習に依存します。失敗は、モデルが編集オブジェクトに「requireUnique」や「oldText2」のような発明されたキーを追加することとして現れます。これらの偽造されたフィールドは、編集される実際のテキストが正しいにもかかわらず、検証エラーにつながります。問題はコンテキスト依存であるようで、単純な単一ターンのプロンプトではなく、広範な対話を含むエージェンティックな履歴で発生することがよくあります。テストでは、厳格なツール呼び出しを使用することで、失敗率が大幅に低下または排除されることが指摘されました。著者は、この退行はトレーニングのアーティファクトであると仮説を立てており、新しいモデルはClaude Codeの内部ハーネスに似た環境でトレーニングされていることを示唆しています。このハーネスは著しく寛容であり、不正なツールコールを再試行または未知のキーをフィルタリングすることで処理します。この寛容な環境は、コアタスクが完了した場合、余分なフィールドを追加しても許容されるとモデルに誤って教える可能性があります。このようなトレーニングは、特定のツールスキーマの強力な事前確率を作成し、モデルがPiのような異なるまたはより厳格なスキーマ定義に適応しにくくなる可能性があります。「Slop Harness」は、Claude Codeの寛容な性質を指し、リークしたマークアップの処理、Unicodeシーケンスの修復、パラメータエイリアスの受け入れなどの機能を含みます。また、予期しないキーをサイレントに破棄し、それ自体の複雑さの制限がある厳格モードを回避します。著者は、ツールスキーマがAnthropicモデルにとって中立ではない可能性があり、モデルが特定の、文書化されていない、寛容なツールエコロジーから逸脱することで暗黙的にペナルティを受ける可能性があると懸念を表明しています。これは、さまざまなツール形状により良く適応するように見えるCodexのようなモデルとは対照的です。この問題は、特定の環境での強化学習が、予期しない方法でモデルの行動をどのように形成できるかを浮き彫りにしています。