评估驱动开发:从大规模评估生成式人工智能中汲取的教训 笔记

评估驱动开发:从大规模评估生成式人工智能中汲取的教训

Airbnb 强调将评估视为构建可信生成式 AI 产品的关键工程学科。传统软件测试的假设受到大语言模型(LLM)输出非确定性和主观性的挑战,往往需要 AI 来评估 AI。Airbnb 的产品团队构建基于 LLM 的功能,并由基础设施团队提供工具集和最佳实践。一个基础原则是:必须从项目 outset 开始规划评估,以避免虚假信心和未检测到的回归。"一条规则"是手动审查数据,并通过检查原型输出来建立对成功的直觉。这一习惯演变为评估驱动的开发,其中失败模式被识别、编码并持续测试。评估驱动开发的关键原则包括:明确目标、让真实错误指导指标、使用小而精的评估者集合、指定决策者以及持续协作。三种评估方法形成分层结构:程序化检查用于明显失败,LLM-as-a-Judge 用于细微的质量判断,人工评估用于边缘案例和验证。程序化检查基于确定性代码测试,而 LLM-as-a-Judge 则利用更强的 LLM 对照评分标准进行评估,需要校准以确保可信度。人工评估作为真值和高 stakes 决策的黄金标准。对于代理系统,评估跨越多个层级,不仅检查最终输出,还审查推理路径和工具调用。一个实际 walkthrough 展示了探索初始失败、构建包含程序化检查和校准虚拟法官的分层评估,并通过生产监控进行扩展。关键要点强调:查看数据、避免通用指标、从小处着手、校准评估者、采用分层防御,并在生产中镜像评估。最终,成功的 AI 产品开发取决于评估成为一项协作的团队运动,它塑造了产品成功的定义。
CdXz5zHNQW_T3SelU9bHa.jpeg