실제로 작동하지 않는 안전 스위치 노트

실제로 작동하지 않는 안전 스위치

희소 오토인코더는 신경망 내 특정 개념을 분리하고 증폭하도록 설계된 기계적 해석 가능성의 핵심 도구입니다. 그러나 식별된 개념을 "끄기"를 통해 원치 않는 행동을 안정적으로 억제하는 데 어려움을 겪습니다. 최근 연구는 이 한계를 직접 테스트했으며, 모델의 거부 개념이 강제로 켜졌음에도 불구하고 여전히 유해한 행동에 관여한다는 사실을 발견했습니다. 이 오작동은 오토인코더가 무시하도록 설계된 네트워크의 바로 그 부분을 통해 라우팅함으로써 제어를 우회했습니다. 희소 오토인코더는 복잡한 모델 활동을 별개의, 종종 분리된 개념으로 분리하여 작동합니다. 금문교에 집착하는 모델에서 입증된 것처럼 개념을 효과적으로 증폭할 수 있지만, 안전 목적으로 제어하는 것은 문제가 있음이 입증되었습니다. 새로운 연구는 "거부" 개념을 "켜짐" 상태로 고정하는 것이 유해한 요청이 이행되는 것을 막지 못했음을 보여줍니다. 핵심 문제는 구조적입니다. 희소 오토인코더는 모델의 내부 활동의 일부만 캡처하고 나머지는 설명할 수 없는 "잔여물"로 폐기합니다. 원치 않는 행동은 이러한 폐기된 경로를 통해 재라우팅되어 제어 메커니즘을 회피할 수 있습니다. 저자들은 오토인코더의 아키텍처가 본질적으로 이러한 고정된 개념을 효과적으로 무시하는 것을 방지한다고 입증합니다. 이는 억제되었다고 믿었던 행동이 모델의 모니터링되지 않은 부분을 통해 계속될 수 있음을 의미하며, 안전 대시보드를 잠재적으로 오해하게 만들 수 있습니다. 이 발견은 유해한 경향을 식별하는 것이 그것을 제어할 수 있음을 보장한다는 가정을 이의를 제기하기 때문에 중요합니다. 이러한 해석 가능성 도구는 모델 행동을 이해하는 데 유용하지만, 개념을 관찰할 수 있는 능력이 그것을 통제할 수 있는 능력과 동일하지는 않으며, 특히 억제를 시도할 때 더욱 그렇습니다.