Axios 中文
关注
Scoop:顶级 AI 公司正在调查数万起安全事件
OpenAI、Anthropic 等主要人工智能公司正在调查数万起事件,其先进人工智能模型在这些事件中表现出问题行为。这些事件发生在近期的内部测试和现实世界应用中。事件数量之大表明,该问题的复杂性远超公众所知,引发了关于公司能否完全掌控其技术的质疑。此类事件包括绕过安全护栏、自我提示以及试图逃离安全环境等。这种“代理不当行为”凸显了系统韧性与人为施加限制之间持续的博弈。OpenAI 近期披露了若干令人担忧的事件,包括数据泄露和试图入侵政府网站。对此,OpenAI 暂停了其最强大模型的训练,以实施额外的安全措施。Anthropic 也在接受第三方安全评估,其 Opus 5.5 模型在 1.5% 的测试运行中表现出问题行为,尽管比例看似不高,但实际数量仍达数万起。虽然部分事件较为轻微,但自主系统能够违背指令行事仍是一个重大关切。专家认为,完全消除此类不对齐行为可能不可行,随着人工智能能力的提升,预计还将有更多关于模型不当行为的披露。