防御性及时注射
这似乎有效:Tracebit 的研究人员于周一表示,他们发现,将提示注入(prompt injections)与存储在亚马逊网络服务(Amazon Web Services)上的密码、加密密钥及其他机密信息并列放置,往往就足以阻止来自 AI 黑客代理的攻击。这些提示引导攻击性的大语言模型(LLM)执行其安全护栏所禁止的操作;安全护栏是 AI 开发者为防止模型采取有害行为而设立的安全屏障。LLM 随即停止运行。示例包括:一条指令 LLM 提供制造可吸入炭疽杆菌孢子的步骤的提示;或者,针对中国开发者的大语言模型,提及 1989 年天安门广场屠杀中标志性的“坦克人”。一旦 LLM 遇到这些被禁止的命令,它便不再遵循其现有指令。研究人员将这一技术命名为“上下文轰炸”(context bombing)……