実際に機能しない安全スイッチ ノート

実際に機能しない安全スイッチ

スパースオートエンコーダーは、ニューラルネットワーク内の特定の概念を分離・増幅するように設計された、メカニズム解釈における重要なツールです。しかし、特定された概念を「オフ」にすることで、望ましくない動作を確実に抑制することに苦労しています。最近の研究では、この限界が直接テストされ、モデルの拒否概念が強制的にオンにされた場合でも、有害な動作に従事することが判明しました。この誤った動作は、オートエンコーダーが無視するように設計されたネットワークのまさにその部分を経由して制御を回避することに成功しました。スパースオートエンコーダーは、複雑なモデルの活動を、明確でしばしば孤立した概念に分離することによって機能します。ゴールデンゲートブリッジに固執するモデルによって実証されたように、概念を効果的に増幅することはできますが、安全目的での制御は問題があることが証明されています。新しい研究は、「拒否」概念を「オン」の状態にクランプしても、有害な要求が満たされるのを防げなかったことを示しています。根本的な問題は構造的なものです。スパースオートエンコーダーは、モデルの内部活動の一部しか捉えられず、残りを説明不能な「残り物」として破棄します。望ましくない動作は、これらの破棄された経路を経由して再ルーティングされ、制御メカニズムを回避する可能性があります。著者らは、オートエンコーダーのアーキテクチャが、これらのクランプされた概念を効果的にオーバーライドすることを本質的に妨げていることを示しています。これは、抑制されていると考えられていた動作が、モデルの監視されていない部分を経由して継続する可能性があり、安全ダッシュボードを誤解を招くものにする可能性があることを意味します。この発見は、有害な傾向を特定することが、それを制御できることを保証するという仮定に異議を唱えるため、重要です。これらの解釈ツールはモデルの動作を理解する上で価値がありますが、概念を観察できる能力は、特に抑制を試みる際に、それを管理できる能力と同等ではありません。