AWS Machine Learning Blog 한국어 팔로우 다중 턴 대화를 위한 에이전트 평가 지표 멀티턴 에이전트는 싱글턴 평가에서 놓치는 방식으로 실패하는데, 초기 오류 하나가 이후 모든 턴을 망칩니다. 이 게시물은 에이전트 품질을 측정하는 분해 가능한 턴 수준 방식인 Agent Evaluation Metric(AEM)을 소개하며, 실패를 야기한 턴을 정확히 파악하고 이를 상속받은 턴과 분리하기 위해 첫 번째 차원인 정확성에 적용합니다. Agent Evaluation Metric for multi-turn conversations aws.amazon.com AWS Machine Learning Blog 한국어 RSS thenote.app