1Password 的 AI 补丁基准测试具有误导性” 笔记

1Password 的 AI 补丁基准测试具有误导性”

1Password 近期关于 AI 补丁修复的报告存在缺陷,其宣称的 26% 完美修复率具有误导性。该数据因实验设计偏差而失真:部分实验刻意指示 AI 代理应用错误修复,另有部分试验中代理无法编译或测试其补丁。该报告的 methodology 选取了高难度的漏洞样本,22% 的提示词要求代理应用错误修复,三分之一试验禁止进行测试。此外,模型推理设置不一致,且在评分阶段对预期的行为变更进行了惩罚。我们对 1Password 数据进行了重新分析,排除了指令不当或未进行测试的试验,结果显示 86% 的补丁成功阻断了提供的漏洞利用代码,证明了其具备有效的补丁修复能力。这一结果与报告的标题相悖,表明在合理条件下 AI 具有显著的补丁修复能力。自动化评分同样存在问题,与人类评审者的意见一致性较低,且存在接受不完整修复或将有效修复标记为回归的情况。人类开发者即使在理想条件下(拥有详细报告和专业评审)也会犯错。在 Trail of Bits 的安全评估中,其首次修复中有 12.5% 未能完全解决问题。在真实世界项目中,我们与 OpenAI 及 Patch the Planet 合作的联合倡议显示,维护者合并了 67.7% 的 AI 辅助拉取请求,其中 72.2% 的合并无需进行与安全相关的修订。值得注意的是,在一例中,维护者和 AI 代理在修复 freenginx 内存安全漏洞时,独立引入了相同的崩溃,凸显了常见的陷阱。此后,我们审查了 Patch the Planet 项目中 33,500 个后续提交,发现我们的补丁引入了功能缺陷、构建/测试/发布自动化缺陷以及性能问题,但未发现可利用的安全漏洞。为改进 AI 补丁修复,我们发布了两种新的代理技能:"补丁后验证"(post-patch-validation)和"评审 walkthrough"(review-walkthrough)。"补丁后验证"技能指导代理重现原始漏洞、测试替代的失败路径并检查回归,旨在更早地捕获不完整的修复。
CdXz5zHNQW_Lgu2ORz1CG.webp