我们仍然无法确保大型语言模型(LLMs)免受恶意输入的影响 笔记

我们仍然无法确保大型语言模型(LLMs)免受恶意输入的影响

巧妙的间接提示注入攻击:Bargury 的攻击始于一份被污染的文档,该文档被分享给潜在受害者的 Google Drive。(Bargury 表示,受害者也可以将受损文件上传到自己的账户。)它看起来像一份关于公司会议政策的官方文件。但在文档中,Bargury 隐藏了一个包含 ChatGPT 指令的 300 字恶意提示。该提示用白色文本以一号字体书写,人类不太可能看到,但机器仍然会读取。在攻击的概念验证视频中……