에이전트 평가 격차: 엔터프라이즈 AI 조직은 커버리지... 노트

에이전트 평가 격차: 엔터프라이즈 AI 조직은 커버리지 문제가 아니라 현실 정렬 문제가 있으며, 대부분은 어쨌든 프로덕션으로 출시하고 있습니다.

조직들은 AI 에이전트에게 점점 더 많은 자율성을 부여하고 있지만, 그 자율성을 통제하기 위해 설계된 평가에 대한 신뢰는 잃어가고 있습니다. 기업의 상당수인 50%는 내부 평가를 성공적으로 통과했지만 이후 프로덕션 환경에서 고객에게 실패한 AI 에이전트를 배포했습니다. 현재 조직의 겨우 5%만이 자동화된 평가 프로세스를 완전히 신뢰하고 있습니다. 주요 식별된 약점은 이러한 평가가 실제 결과를 정확하게 반영하지 못한다는 것입니다. 그럼에도 불구하고, 기업의 상당수인 3분의 2는 이미 인간의 감독 없이 자동화된 평가만을 기반으로 에이전트 변경 사항을 프로덕션에 직접 배포하는 것을 허용하거나 그러한 시스템을 개발하고 있습니다. 이러한 불일치는 "평가 격차"를 만들어내며, 이는 에이전트에게 부여된 자율성과 이를 모니터링하기 위한 테스트에 대한 불충분한 신뢰 사이의 차이를 의미합니다. 본 연구는 리더들이 에이전트 성능을 어떻게 측정하는지, 어떤 플랫폼을 사용하는지, 그리고 감독 없는 에이전트 운영을 허용하려는 의지를 조사합니다. 조직의 절반은 내부 검사를 통과한 에이전트로 인해 고객 대면 실패를 경험했으며, 4분의 1은 이러한 일이 여러 번 발생했습니다. 자동화된 평가를 완전히 신뢰하는 곳은 5%에 불과하며, 이는 주로 실제 결과와의 불일치 때문입니다. 그럼에도 불구하고, 조직의 66%는 에이전트에 대한 제로 휴먼 인 더 루프(zero-human-in-the-loop) 배포를 향해 나아가고 있거나 이미 허용하고 있습니다. 평가 및 신뢰성 도구 환경은 파편화되어 있으며, 제공업체 네이티브 도구와 "전용 도구 없음"이 가장 일반적입니다. 또한, 기업의 약 4분의 1만이 실시간 프로덕션 트래픽에 대한 실시간 품질 검사를 수행하고 있어 에이전트 출력 정확성을 모니터링하는 데 상당한 맹점이 존재합니다. 기업은 비용과 통합을 기준으로 평가 도구를 선택하며, 일관성이 성공의 핵심 척도입니다. 향후 AI 에이전트에 대한 인간 감독과 관찰 가능성 모두에 대한 투자가 증가할 것으로 예상됩니다.