DEV Community 日本語
フォロー
コーディングエージェントにもっと時間を与えることはほとんど助けになりません
Real-SWE は、ライセンスされたプライベートエンタープライズコードベース(請求、税金、マルチサービス業務)に対してフロンティアモデルを実行しましたが、1つの数字が際立っていました。ロールアウト期間は、解決率にほとんど影響を与えませんでした。10分未満で完了したロールアウトの71.4%が失敗しました。10分以上実行されたロールアウトの73.4%も失敗しました。合格率はどちらの場合も27〜29%で横ばいです。実行時間を数分から長時間ロールアウトに延長しても、結果は2パーセントポイント程度しか変化せず、これはノイズです。リーダーであるFable 5.1(Claude Code上)は、わずか38.8%の解決率しか達成していません。GPT-6 Astra(Codex CLI上)は33.8%です。トップモデルでも、プライベートエンタープライズタスクの約10件中6件が失敗します。これはベンダーデモがスキップする部分です。簡単なタスクはすぐに解決されるため、短いロールアウトでは高い見かけのスループットが見られます。しかし、重要なタスク、つまり実際の給与計算、税金、統合コードに埋もれているタスクは、構造的な壁にぶつかります。エージェントはそれらのタスクでコンピューティング能力を使い果たすわけではありません。理解力やコンテキストを使い果たすか、ハーネスが適切なエントリーポイントを与えません。さらに10分間のループ再試行でも、それらのいずれも修正されません。Real-SWE が正しく行っているもう1つの点は、各スコアをモデル単体ではなく、モデル+ハーネスとして扱うことです。Fable 5.1 は、Claude Code の足場とペアリングされても 38.8%にしかなりません。これはプライベートコード上のハーネスの結果であり、真空中のモデルに関する声明ではありません。多くのリーダーボードは、ハーネスが固定されていないモデル名を公開し続けており、人々は完全に異なる足場間でそれらを比較して、無意味な結論を導き出しています。エージェントを購入する際の注意点:ベンダーが合格率を示した場合、その数字がどのスライスから来たのか尋ねてください。短く浅いタスクをクリアするためによく見えるモデルは、実際に解決する必要があるタスクセットを隠しています。ベンチマークソース:withspecific.com/benchmarks/real-swe