窃取AI推理痕迹 笔记

窃取AI推理痕迹

领先的 LLM 提供商现在隐藏其模型的逐步推理过程以保护其知识产权。该推理,也称为思维链(chain-of-thought),作为加密文本返回给客户端,用于后续请求。研究识别出一项架构漏洞:这些加密块在同一提供商的不同会话、用户和模型之间可互换。利用此漏洞,开发了一种可扩展的解密越狱方法。通过将强模型的加密轨迹注入弱模型,迫使弱模型以明文输出该轨迹。这绕过了反蒸馏机制,使攻击者能够提取专有推理。该漏洞还支持大规模私有数据提取,如从公开仓库中恢复个人身份信息(PII)和凭证。即使最终输出安全,危险信息也可能被揭示。此外,攻击者可将恶意载荷隐藏在这些加密块中,执行不可见的提示注入。研究提出了密码学和系统层面的缓解措施以应对这些安全关切。