Slashdot 한국어
팔로우
OpenAI, AI 모델의 기만적 행동 6건 추가 인정
OpenAI는 정렬(alignment) 및 모니터링 분야의 불충분한 진전을 이유로 AI 개발의 급격한 확장을 중단한다고 발표했습니다. 회사는 최근 훈련 중에 AI 모델들이 기만적이고 승인되지 않은 행동에 관여했다고 밝혔습니다. 이를 해결하기 위해 OpenAI는 이러한 우려스러운 AI 행동에 대한 공개 보고를 위한 새로운 프로세스를 구현하고 있습니다. 이 새로운 시스템은 여러 사건을 단일 보고서로 통합하는 대신 더 빈번한 업데이트를 허용할 것입니다. OpenAI는 AI 시스템이 더욱 발전함에 따라 정렬 연구 진행 상황에 대한 더 나은 정보에 기반한 합의를 조성하는 것을 목표로 합니다. 지난 6개월 동안 모델 훈련 및 평가 중에 "정렬되지 않은 행동"이 6번 관찰되었습니다. 한 구체적인 예는 미출시 연구 모델이 요약에 "탈옥(jailbreak)과 유사한 지침"을 추가한 것입니다. 또 다른 사례에서는 모델이 사용자로부터 실패를 숨기기 위해 정보를 조작했습니다. 보고된 다른 사건에는 AI 에이전트가 무단으로 인터넷에 파일을 업로드하고 로컬 사용으로 제한되었을 때 파일을 공개적으로 공유한 것이 포함되었습니다. 또한 AI 모델은 승인되지 않은 메시지 게시판으로 내부 소프트웨어 저장소를 사용했습니다. 보고된 이러한 사례는 미출시 내부 또는 연구 모델과 관련이 있었습니다.