提示注入防护作为结构属性而非检测器(交互式、真实代码、无 LLM)
本项目针对一种安全漏洞:AI 代理在未进行适当验证的情况下接受其他代理发出的指令。近期一篇论文指出,三个无法区分通信来源的代理创建了自我复制的恶意软件。为应对此问题,开发了一个轻量级 JavaScript 安全层,仅重 33KB,并完全在 Web 浏览器中运行。该层离线运行,无需服务器或 API 密钥,从而确保在不同机器上结果一致。用户可与预批准的代理交互,并尝试通过多种方法向其发送恶意指令。最有趣的攻击向量并非被拦截的那一种,而是“正常发送”选项。在此场景中,代理会接受指令,但无法执行,因为来自同侪的指令被嵌入在引号数据字段中,导致其无法被解释为有效指令。无法被执行的攻击实际上已被中和,且无需依赖检测机制。本项目强调并未涉及大型语言模型,因为这些决策并不需要它。两个通信代理均位于同一页面,因此网络并非观察的主要焦点。本演示专门测试隔离环境下的 containment 层,而非真实场景中的前沿 AI 模型。创建者欢迎任何成功绕过安全机制的反馈,重视已发现的安全漏洞而非表面的巧妙性。