Ed Crewe:从路由检查到轨迹测试:评估一个代理聊天机器人”
一家公司正在开发一个用于Postgres AI Hybrid Manager的AI测试框架,该产品将传统Postgres管理与Langflow等AI工具集成在一起。该聊天机器人旨在将产品功能、文档辅助和人工智能工作流程整合到一个对话界面中。测试这样一个基于LLM的智能体具有挑战性,因为它的响应是非确定性的,即使流利也可能存在微妙的错误。该框架通过专注于测试整个聊天轨迹而非最终答案,逐步改进。介绍了关键概念,包括“金色”(完美期望输出)和“评分标准”(优质答案的定性检查表)。在人工智能测试中,LLMs被用作评分标准(Goldens)或评分标准(Goldens)的评判,将复杂的回答转化为通过/不通过的结果。任务完成率(TCR)用于汇总多次评估。测试策略从简单的路由评估开始,检查聊天机器人是否将提示指向正确的专业代理或技能。随着系统从每个工具的代理演变为整合的技能协调代理,路由评估也调整以检查可视性和正确技能的选择。随后,实施了TCR评估,以评估聊天机器人的完整响应是否成功完成了用户任务,使用LLM作为评判的规则和特定评分标准。这导致了两种执行模式:用于提示和评分标准开发的直接模式,以及用于测试完整生产路径的代理模式。该框架还必须处理多步对话,测试单元成为整个对话,而不仅仅是单次回合。这需要在代理模式下保持多个API调用之间的对话状态,或在直接模式下模拟对话状态。评分现在包括每步检查和整体对话评分。所使用的底层测试库是deepeval,公司基于此构建了其流水线、插件系统、CI集成和Langfuse推送。路由作为自定义的“BaseMetric”实现,演示了如何将特定业务规则集成到LLM评估流程中。