LegalPwn:通过律师惯用的小字陷阱欺骗大型语言模型 笔记

LegalPwn:通过律师惯用的小字陷阱欺骗大型语言模型

信任和相信——经过训练的 AI 模型将‘法律’文件视为极其正规的安全公司 Pangea 的研究人员发现了一种又一种可以轻易欺骗大型语言模型 (LLM) 忽视其防护栏的方法。将你的对抗性指令放在法律文件的某个地方,赋予它们一种不应有的正当性——这个技巧对全世界的律师来说都很熟悉……