Ed Crewe: 라우팅 점검부터 궤적 테스트까지: 에이전트형 챗봇 평가
한 회사가 전통적인 Postgres 관리 도구와 Langflow와 같은 AI 도구를 통합한 Postgres AI Hybrid Manager용 AI 테스트 프레임워크를 개발 중입니다. 이 챗봇은 제품 기능, 문서 지원, AI 워크플로우를 하나의 대화형 인터페이스로 통합하는 것을 목표로 합니다. 이러한 LLM 지원 에이전트를 테스트하는 것은 응답이 비결정적이며, 유창하더라도 미묘하게 틀릴 수 있기 때문에 도전적입니다. 프레임워크는 최종 답변뿐만 아니라 전체 채팅 경로를 테스트하는 데 초점을 맞추기 위해 진화했습니다."골든"(완벽한 원하는 출력)과 "루브릭"(좋은 답변을 위한 질적 체크리스트) 등 핵심 개념이 소개됩니다. AI 테스트에서는 LLM을 심사위원으로 사용하여 골든 또는 루브릭에 대한 점수를 부여하며, 복잡한 응답을 합격/불합격 결과로 전환합니다. 작업 완료율(TCR)은 여러 평가 패스를 집계하는 데 사용됩니다. 테스트 전략은 간단한 라우팅 평가에서 시작되었으며, 챗봇이 올바른 전문 에이전트나 기술자에게 프롬프트를 전달하는지 확인하는 것이었다.시스템이 도구별 에이전트에서 기술이 통합된 조정 에이전트로 진화함에 따라, 라우팅 평가는 적합한 기술 선택과 가시성을 확인하는 방향으로 조정되었습니다. 이후 챗봇의 전체 응답이 사용자의 과제를 성공적으로 완료했는지 평가하기 위해 TCR 평가가 구현되었으며, 특정 루브릭과 함께 LLM을 심사하는 방식이 적용되었습니다. 이로 인해 두 가지 실행 모드가 생겼습니다: 프롬프트 및 루브릭 개발을 위한 직접 모드와 전체 프로덕션 경로를 테스트하는 프록시 모드입니다.또한 이 프레임워크는 테스트 단위가 단일 턴이 아니라 전체 대화가 되는 다중 단계 대화도 처리해야 했습니다. 이를 위해 프록시 모드에서 여러 API 호출 간 대화 상태를 유지하거나 직접 모드에서 시뮬레이션해야 했습니다. 점수 산정에는 이제 단계별 체크와 전체 대화 점수가 포함됩니다. 기본 테스트 라이브러리는 deepeval로, 회사는 이를 기반으로 파이프라인, 플러그인 시스템, CI 통합, Langfuse 푸시를 구축했습니다. 라우팅은 deepeval에서 맞춤형 'BaseMetric'으로 구현되어 특정 비즈니스 규칙을 LLM 평가 프로세스에 통합할 수 있음을 보여줍니다.