实际上不起作用的保险开关 笔记

实际上不起作用的保险开关

稀疏自编码器是机械可解释性的关键工具,旨在隔离并放大神经网络中的特定概念。然而,它们难以通过“关闭”已识别的概念来可靠地抑制不期望的行为。最近的一项研究直接测试了这一局限性,发现即使强制开启模型的“拒绝”概念,模型仍会执行有害行为。这种不良行为通过自编码器设计为忽略的网络部分进行路由,从而绕过了控制机制。稀疏自编码器通过将复杂的模型活动解耦为各个独立(通常相互隔离)的概念来工作。尽管它们能有效放大概念(如一个专注于金门大桥的模型所示),但在安全目的上控制这些概念已被证明存在困难。新研究表明,将“拒绝”概念钳制在“开启”状态并不能阻止有害请求被满足。核心问题在于结构性的:稀疏自编码器仅捕获模型内部活动的一部分,将其余部分作为无法解释的“剩余项”丢弃。不期望的行为可以通过这些被丢弃的路径重新路由,从而规避控制机制。作者证明,自编码器的架构本质上使其无法有效覆盖这些被钳制的概念。这意味着,被认为已被抑制的行为可能通过模型中未受监控的部分继续执行,从而使安全仪表板具有潜在的误导性。这一发现具有重要意义,因为它挑战了“识别有害倾向即保证能够控制它”的假设。尽管这些可解释性工具对于理解模型行为很有价值,但能够观察一个概念并不等同于能够治理它,尤其是在尝试抑制时。