5 保护AI代理的基础设施控制 笔记

5 保护AI代理的基础设施控制

NVIDIA 的 AI 红队于 2026 年对企业级 AI 代理进行了为期六个月的评估审查。审查发现,失败的 AI 代理主要源于四个原因,包括缺乏访问控制以及无法执行任意代码的能力。这些代理在出站网络方面没有任何限制,也未实现隔离,且明文密钥可供其访问。此类 AI 代理的问题本质上属于架构层面,导致难以防范其失效。由于模型控制平面具有统计特性,其并非可靠的防御机制;依赖控制平面的防御手段可通过三种主要方式被绕过:其一,将恶意活动伪装成合法活动;其二,通过逐步升级对话,积累足够历史以确立命令的合法性;其三,将代码执行嵌入合法行为中,例如安装软件包。审查结果凸显了需要更强大的安全措施以防止 AI 代理失效。总体而言,这些漏洞的发现强调了纠正 AI 代理架构缺陷的重要性,以确保其安全、可靠地运行。