Agent 治理工具包:为 AI 智能体制定行路规则
组织正越来越多地部署具有生产系统访问权限和敏感数据访问权的自主 AI 代理。尽管这些代理效率高,但由于提示注入(prompt injection)和大语言模型(LLM)非确定性(non-determinism)等潜在漏洞,它们带来了显著的安全风险。仅依赖系统提示(system prompts)进行安全防护是不够的,因为它们仅提供软性边界,缺乏确定性执行能力。为此,微软推出了代理治理工具包(Agent Governance Toolkit,简称 AGT),这是一个面向生产级代理治理的开源解决方案。AGT 充当 AI 代理决策与实际工具执行之间的拦截层。它执行确定性策略,在未经授权或破坏性操作发生之前将其阻止。与传统无法检查下游意图的安全措施不同,AGT 能够审查并控制代理的操作。鉴于威胁格局不断演变,包括 OWASP 代理式 AI 十大漏洞(OWASP Top 10 for Agentic AI)以及欧盟《人工智能法案》(EU AI Act)等监管要求,这种方法至关重要。代理治理工具包包含多个组件,包括策略执行引擎(Policy Enforcement Engine)、密码学身份层(Cryptographic Identity layer)、运行时隔离(Runtime Isolation)和防篡改日志(Tamper-Evident Logging)。它作为一个模块化控制平面运行,将策略执行与代理框架解耦。AGT 支持多种软件开发工具包(SDK),并与流行的代理框架集成,从而支持对现有系统进行改造。一次动手演示展示了 AGT 在 Python 中的实时策略执行。开发者可以通过简单的 YAML 文件定义规则,将工具函数封装起来,以自动拦截并拒绝禁止的操作。这确保了诸如“删除”(delete)等操作在没有适当授权的情况下在结构上无法执行,且独立于大语言模型的逻辑。AGT 还提供验证命令以生成合规报告和安全徽章,为安全态势审查提供证据。