エージェント評価のギャップ:エンタープライズAI組織は、カバ... ノート
VentureBeat 日本語

エージェント評価のギャップ:エンタープライズAI組織は、カバレッジの問題ではなく、現実との整合性の問題を抱えている――そしてほとんどは、それでも本番環境にデプロイしている

組織はAIエージェントにますます多くの自律性を付与していますが、その自律性を制御するために設計された評価に対する信頼を失っています。企業の実に50%は、内部評価を通過したものの、本番環境で顧客に対して失敗したAIエージェントを展開しています。現在、組織のわずか5%しか自動化された評価プロセスを完全に信頼していません。主な特定された弱点は、これらの評価が現実世界の成果を正確に反映していないことです。それにもかかわらず、企業の3分の2は、人間の監督なしに、自動化された評価のみに基づいてエージェントの変更を直接本番環境に展開することを許可しているか、または許可するシステムを開発しています。この乖離は、「評価ギャップ」を生み出し、エージェントに付与された自律性と、それらを監視するためのテストに対する不十分な信頼との差を示しています。この研究は、リーダーがエージェントのパフォーマンスをどのように測定するか、使用するプラットフォーム、および監督なしのエージェント運用を許可する意欲を調査します。組織の半数は、内部チェックを通過したエージェントによる顧客対応の失敗を経験しており、4分の1はこれが複数回発生したのを見ています。自動化された評価を完全に信頼しているのは5%のみであり、主に現実世界の成果との整合性が低いことが原因です。それにもかかわらず、組織の66%は、エージェントのゼロヒューマンインザループ展開に向けて進んでいるか、すでに許可しています。評価および信頼性ツールの状況は断片的であり、プロバイダーネイティブツールと「専用ツールなし」が最も一般的です。さらに、企業の約4分の1しかライブ本番トラフィックに対してリアルタイムの品質チェックを実施しておらず、エージェントの出力の正確性を監視する上で重大な盲点となっています。企業は、コストと統合に基づいて評価ツールを選択しており、一貫性が成功の主要な尺度となっています。将来の投資は、AIエージェントの人間による監督とオブザーバビリティの両方で増加すると予想されます。