Google Developers Blog 中文 关注 《驾驭工程解剖学:如何评估、迭代并守护 AI 编程代理》 虽然端到端基准测试(如 SWE-bench)能为 AI 代理提供广泛的性能评分,但它们往往成本高昂、耗时较长,且缺乏用于解释代理逻辑具体在何处失效的根因诊断能力。为解决这一问题,开发者应采用行为评估——即快速、局部的单元测试式评估,其对离散的中间动作进行断言,例如验证特定的工具调用或文件修改,而非最终的字符串相等性。通过在宏观基准测试旁构建这些低成本微检查,工程团队可自信地对系统提示词进行迭代并升级模型,而无需担心出现回归问题。 The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents developers.googleblog.com Google Developers Blog 中文 RSS thenote.app