野外中的 AI 威胁:当前网络提示注入的现状 笔记

野外中的 AI 威胁:当前网络提示注入的现状

谷歌威胁情报团队正积极监控间接提示注入(Indirect Prompt Injection, IPI)攻击,这是人工智能系统面临的主要安全威胁之一。他们利用 Common Crawl(一个大型网络存档)扫描公共网页,调查了现实中 IPI 攻击的实际利用情况,旨在识别威胁行为者如何使用 IPI。该团队开发了一种多阶段方法,包括模式匹配、使用 Gemini 模型进行分类以及人工审查,以过滤误报。分析结果显示,存在多种试图操纵人工智能的行为,包括无害的恶作剧、搜索引擎优化(SEO)以及恶意活动。恶意尝试涉及数据窃取和破坏,但整体而言技术较为初级。研究结果表明,IPI 攻击的复杂程度目前较低但呈上升趋势,恶意尝试数量增加了 32%。谷歌预计未来 IPI 攻击的规模和复杂程度都将进一步提升。为此,谷歌正加大对模型加固和红队演练的投入,并通过漏洞奖励计划引入外部研究人员参与。凭借实时数据处理能力,谷歌能够识别并中和相关威胁。此外,谷歌还提供了资源,支持进一步探索其在生成式人工智能安全领域的研究成果。