多轮攻击以 88% 的比率突破了 AI 模型——单轮测试未能发现该问题,Cisco AI 安全负责人在 VB Transform 2026 上发出警告
思科的研究显示,攻击者在多轮对话中突破 AI 模型的成功率高达 88.3%,显著高于单轮红队测试。这一发现凸显了当前企业 AI 安全的关键缺口:超过半数的受访企业已遭遇 AI 安全事件或险些发生。许多组织仍缺乏对 AI 代理的强健身份管理与隔离机制,主要依赖提供商原生的控制措施。主要安全厂商正积极收购公司以增强其在代理身份与隔离方面的能力,承认企业在此方面存在不足。AI 威胁情报领域的领导者 Amy Chang 强调,理解模型如何易受各类攻击,对于识别失效点至关重要。多轮攻击真实模拟了人类与 AI 的交互方式,揭示了快照测试所遗漏的有害输出。思科倡导采用自我评估的代理框架来开发和执行攻击,发现基础、根本的安全原则仍是最高效的防御手段。Box 的首席信息安全官 Heather Ceylan 同样强调了多轮对抗模拟的必要性,指出即使拥有较强的信任基础,单个代理的失误也可能抹去累积的信心。Box 采用分层安全架构,实施严格的权限控制、临时沙箱以及运行时执行控制,以遏制风险。Intuit 的 AI 与机器学习副总裁 Rajesh Parekh 介绍了其 GenOS 平台,该平台集中管理 AI 代理的安全与风险管理,提供范围明确且可审计的任务权限。Ceylan 预测,随着代理在识别和修复漏洞方面日益成熟,传统的人工代码审查终将终结,尽管这仍是未来的目标。Ceylan 和 Parekh 均强调,为 AI 代理实施最小权限访问对于防止过度越权至关重要。AI 代理不断增强的能力与访问范围扩大了攻击面,因此必须持续测试并自动化常见漏洞模式的检测。在 AI 交互中检测真实意图与概率之间的复杂性,仍是行业面临的重大挑战。思科的研究表明,当前模型难以可靠地推导意图,因此确定性控制与行为代理至关重要。最终,企业必须跨完整对话持续测试 AI 代理,模拟攻击者的方法论,以避免在生产环境中出现关键故障。