LangChain、Conviva、CoreWeaveのリー... ノート
VentureBeat 日本語

LangChain、Conviva、CoreWeaveのリーダーがVB Transform 2026で述べたところによると、単一のAIエージェントの会話は完璧に見えても壊れている可能性がある

AI業界は、エージェントの評価方法を、個々の会話のスコアリングから、ユーザーグループをベースラインと比較する方法へと移行させています。この変更は、単一の会話がうまくスコアリングされても、製品の問題を示す可能性があるというギャップに対処するものです。専門家は、孤立したトレースではなく、ユーザーコホートに基づいてAIエージェントを評価することを提唱しています。この新しいアプローチは、評価基準を、製品要件定義書と同様の動的な製品仕様として扱います。チームは、ローンチ前の徹底的なテストでも、現実世界のすべての障害を捉えることはできないことに気づいています。代わりに、問題が発生したときに特定するために、継続的で広範な監視が不可欠です。ユーザーグループをベースラインと比較する対照分析は、単一のインタラクションを評価することでは見逃される問題点を明らかにします。例えば、明確化のための質問の増加や、会話外での購入などが、そうでなければ見過ごされる可能性があります。この分析は、特定のカテゴリに関連する問題を特定するのに役立ちます。業界はまた、AIエージェントの評価のために、より小さく安価なジャッジモデルを使用する方向にも進んでいます。これらの評価は、解決可能性を確認するために最も有能なモデルから開始し、徐々に小さいモデルを使用する必要があります。さらに、ガードレールは、複雑なAIモデルだけでなく、正規表現のようなより単純な方法を使用して実装できます。AIジャッジングの進歩にもかかわらず、人間の監督の必要性は依然として重要です。人間は、特に法律、金融、医療などの機密性の高い分野において、説明責任のために不可欠です。人間のレビューは、信頼を構築し、AIシステム内の記憶と学習を促進します。