AI 内存安全蓝图
前沿大语言模型可通过检索增强生成(RAG)系统被显著操纵。向大型语料库中注入仅五份恶意文档,即可让研究人员几乎始终控制大语言模型的输出。此类攻击被称为 PoisonedRAG,它无需直接访问模型或检索器代码,攻击者只需引入一份会被索引的投毒文档即可。后续研究 CorruptRAG 表明,单份投毒文档即可实现高成功率。这使得威胁更具现实性,因为感染少量文档比感染大量文档更为可行。即使仅 0.04% 的语料库被投毒,攻击成功率也可超过 98%。此类投毒攻击可能导致相当比例的实例出现系统故障。研究结果凸显,仅为了提升准确性而引入 RAG 并非无风险之举。企业级 RAG 系统必须具备健全的安全措施。