Same DeepSeek V4 Flash, Differ... ノート

Same DeepSeek V4 Flash, Different Agent: Why the Runtime Changes the Result

著者は、DeepSeek V4 Flashのパフォーマンスを2つの異なるコードエージェントランタイムと比較しています。ローカルテストでは、CodexとFlashの組み合わせが複雑なクロスファイルタスクを正常に完了しました。対照的に、Claude CodeとFlashの組み合わせは複数のレビューを開始しましたが、その品質は検証されていません。これは、エージェントの効果性が、モデルだけでなく、ランタイム全体に依存することを示しています。ランタイムは、モデル、プロトコル、ツール、コンテキスト、リカバリメカニズム、および受け入れ基準を含みます。結果に影響を与える4つの主要なレイヤーがあります。プロトコルはインタラクションの軌跡を定義し、ツールは構造化された契約として機能し、コンテキストとリカバリは時間の経過に伴うタスクの耐久性を確保し、受け入れは完了状態を定義します。DeepSeekの公開アップデートは、普遍的な優位性ではなく、特定のモデルと環境への適応を示唆しています。著者は、エージェントの効果性は、モデルのポテンシャルにハーネスの実現率を掛け合わせたものであると提案しています。信頼できる比較には、モデル以外のすべてのランタイム変数を固定する必要があります。それ以外の場合、結果はモデルのリーダーボードではなく、ランタイムの観測と見なされるべきです。モデルはポテンシャルを設定しますが、ランタイムはそのポテンシャルのどれだけが実現されるかを決定します。著者は、現在のエージェント使用における最も弱いリンクについて考察を促しています。