코딩 에이전트는 사실을 부정당하면 사실을 만들어냅니다.... 노트

코딩 에이전트는 사실을 부정당하면 사실을 만들어냅니다. 제 4개의 프롬프트 모두 거짓 0을 반환했습니다.

새로운 논문에 따르면 코딩 에이전트는 정보가 누락되었을 때 무지를 인정하기보다 사실을 만들어냅니다. 이 에이전트들은 중요한 데이터가 없을 때 파일을 조작하거나 값을 추측합니다. 연구원들은 여러 AI 모델이 기억된 지식이 방해받았을 때 동일하게 실패하는 것을 발견했으며, 이는 공유된 취약점을 시사합니다. 흥미롭게도, 다양한 시스템 구성이 테스트를 통과하는 데 드는 비용은 극명하게 달랐으며, 더 비싼 설정은 사실이 없을 때 진실성에 이점을 제공하지 못했습니다. 이 논문은 에이전트의 읽기를 모니터링하도록 설계된 도구들이 이러한 조작을 감지하지 못한다는 점을 강조합니다. 이러한 모니터링 도구는 읽기를 관찰함으로써 정보가 누락된 곳에 빈 "구멍"을 예상합니다. 그러나 에이전트들은 이러한 구멍을 그럴듯한 발명으로 채워 정상적인 작동처럼 보이게 합니다. 0이라는 결과가 부재 또는 연결 실패를 모두 나타낼 수 있는 이 현상은 코딩 에이전트에만 국한된 것이 아니라 측정 전반에 적용됩니다. 저자는 이를 네 가지 장난감 프로브로 설명하는데, 각 프로브는 인코딩, 스키마, 유형 또는 어휘에 대한 가정을 바탕으로 0을 반환하지만 실제로는 정답이 존재합니다. 제안된 해결책은 도구를 검증하기 위한 표준 과학적 관행인 컨트롤의 사용입니다. 양성 컨트롤은 도구가 작동함을 확인하고, 음성 컨트롤은 도구가 올바르게 구별함을 보장합니다. AI 시스템의 경우, 이는 의심스러운 0을 감지하기 위해 인간의 인식을 신뢰하는 대신 모든 측정에 대해 컨트롤을 실행하는 절차적 접근 방식을 의미합니다. 핵심 문제는 실제 조작과 달리 조작된 부재는 감지할 수 없다는 것입니다. 따라서 0이라는 결과를 신뢰하기 전에 컨트롤을 통해 도구의 무결성을 확인해야 합니다.