LangChain, Conviva, CoreWeave의... 노트

LangChain, Conviva, CoreWeave의 리더들이 VB Transform 2026에서 단일 AI 에이전트 대화는 완벽해 보여도 여전히 문제가 있을 수 있다고 말했다.

AI 산업은 개별 대화를 평가하는 것에서 기준선 대비 사용자 그룹을 비교하는 방식으로 에이전트 평가 방식을 전환하고 있습니다. 이러한 변화는 단일 대화가 잘 평가되더라도 제품 문제를 나타낼 수 있는 격차를 해소합니다. 전문가들은 개별적인 흔적보다는 사용자 코호트를 기반으로 AI 에이전트를 평가할 것을 옹호합니다. 이 새로운 접근 방식은 평가 기준을 제품 요구사항 문서와 유사한 동적인 제품 사양으로 취급합니다. 팀들은 출시 전 철저한 테스트가 실제 모든 실패를 잡아내지 못할 수 있다는 것을 깨닫고 있습니다. 대신, 지속적이고 광범위한 모니터링이 발생하는 문제를 식별하는 데 중요합니다. 사용자 그룹을 기준선과 비교하는 대조 분석은 단일 상호 작용을 평가함으로써 놓치는 문제를 드러냅니다. 예를 들어, 명확화 질문 증가 또는 대화 외부에서 이루어진 구매는 그렇지 않으면 간과될 수 있습니다. 이 분석은 특정, 범주 관련 문제를 정확히 찾아내는 데 도움이 됩니다. 업계는 또한 AI 에이전트 평가를 위해 더 작고 저렴한 판정 모델을 사용하는 방향으로 나아가고 있습니다. 이러한 평가는 해결 가능성을 확인하기 위해 가장 유능한 모델로 시작한 다음 점진적으로 더 작은 모델을 사용해야 합니다. 또한, 가드레일은 복잡한 AI 모델뿐만 아니라 정규 표현식과 같은 더 간단한 방법을 사용하여 구현할 수 있습니다. AI 판정의 발전에도 불구하고 인간의 감독 필요성은 여전히 중요합니다. 인간은 법률, 금융, 의료와 같은 민감한 분야에서 특히 책임성을 위해 필수적입니다. 인간 검토는 또한 신뢰를 구축하고 AI 시스템 내에서 기억 및 학습을 촉진합니다.