AWS Machine Learning Blog 日本語 フォロー マルチターン対話のためのエージェント評価メトリック マルチターンのエージェントは、シングルターンの評価では見逃されるような形で失敗します。初期の1回のミスが、その後のすべてのターンを台無しにしてしまうのです。この記事では、エージェントの品質を測定するための、分解可能でターンレベルの評価方法であるエージェント評価メトリック(AEM)を紹介します。その最初の次元である正しさ(correctness)に適用することで、失敗を引き起こしたターンを特定し、それを引き継いだターンから分離します。 Agent Evaluation Metric for multi-turn conversations aws.amazon.com AWS Machine Learning Blog 日本語 RSS thenote.app