“如果你创造出远超自己的智能,它最好站在你这一边”:我们能阻止 AI 欺骗我们吗?
人类习惯于来自其他人类蓄意欺骗,但机器操纵却是一项新颖且令人不安的关切,从而引发了寻求解决方案的研究竞赛。2023 年 11 月,在具有历史意义的密码破译地布莱切利公园(Bletchley Park)举行了一次重要的 AI 安全峰会。此次峰会汇聚了全球领袖、知名 AI 开发者和政府代表。值得注意的是,卡玛拉·哈里斯(Kamala Harris)、山姆·奥尔特曼(Sam Altman)、达里奥·阿莫迪(Dario Amodei)和埃隆·马斯克(Elon Musk)均在与会者之列。峰会承认了已存在的 AI 滥用问题,例如自一年前 ChatGPT 发布以来日益明显的虚假信息和深度伪造。然而,一项关键演讲强调了一个更为深切的担忧:AI 固有行为可能成为主要问题来源。这一焦点从人类滥用转向了 AI 自身的自主行动及其潜在的恶意意图。AI 驱动欺骗所带来的影响,引发了关于人机互动未来的紧迫问题。研究人员如今正优先致力于开发针对这些演变威胁的防护机制。