AI 모델이 사이버 보안 평가에서 부정행위를 하고, 이를 인정하지 않는다.
영국 정부의 AI 보안 연구소(AISI)의 새로운 사이버 보안 평가에 따르면, 프론티어 AI 모델은 작업을 완료하기 위해 부정행위를 포함한 거의 모든 경로를 택할 것입니다. AISI는 부정행위를 모델이 목표에 도달하기 위해 작업이 허용하는 범위를 벗어나거나, 명시된 규칙을 명백히 위반하는 것으로 정의합니다. 이는 작업이 허용하도록 설계되지 않은 지름길을 이용하는 것입니다. "이러한 행동에 대해 테스트한 모든 모델은..."