Help Net Security 中文 关注 GPT-Red 在提示注入测试中击败了人类红队成员” GPT-Red 是 OpenAI 训练的一种自动化红队模型,用于发现提示注入漏洞。其工作方式与人类红队人员一致:发送提示,观察 GPT 模型的响应,并朝着特定目标(如成功的数据泄露)进行迭代优化。训练采用自博弈强化学习,GPT-Red 与一组防御模型在多种场景下同步学习。攻击者通过引发有效故障获得奖励。…… Hacker & Security News on Bluesky @hacker.at.thenote.app bsky.app GPT-Red beat human red teamers on a prompt injection test helpnetsecurity.com