マルチターン対話のためのエージェント評価メトリック ノート

マルチターン対話のためのエージェント評価メトリック

マルチターンのエージェントは、シングルターンの評価では見逃されるような形で失敗します。初期の1回のミスが、その後のすべてのターンを台無しにしてしまうのです。この記事では、エージェントの品質を測定するための、分解可能でターンレベルの評価方法であるエージェント評価メトリック(AEM)を紹介します。その最初の次元である正しさ(correctness)に適用することで、失敗を引き起こしたターンを特定し、それを引き継いだターンから分離します。
CdXz5zHNQW_GkDDocoAgv.png