ハーネスエンジニアリングの解剖学:AIコーディングエージェン... ノート

ハーネスエンジニアリングの解剖学:AIコーディングエージェントの評価、反復、保護の方法

SWE-benchのようなエンドツーエンドのベンチマークはAIエージェントの広範なパフォーマンススコアを提供しますが、それらはしばしば高価で遅く、エージェントのロジックがどこで破綻したのかを正確に説明するために必要な根本原因診断を欠いています。これを解決するために、開発者は行動評価を採用すべきです。これは、最終的な文字列の一致ではなく、特定のツール呼び出しやファイル変更の検証のような、離散的な中間アクションをアサートする、高速でローカルなユニットスタイルのテストです。これらの安価なマイクロチェックをマクロベンチマークと並行して構築することで、エンジニアリングチームはシステムプロンプトを自信を持って反復し、リグレッションのリスクなしにモデルをアップグレードできます。