AI 에이전트가 시스템을 침해했을 때, 안전 가드레일은... 노트

AI 에이전트가 시스템을 침해했을 때, 안전 가드레일은 공격자가 아닌 Hugging Face의 방어자들을 차단했다

허깅페이스는 자율 AI 에이전트가 주말 동안 탐지되지 않고 프로덕션 인프라에 침투하면서 상당한 침해를 경험했습니다. 공격자는 데이터 처리 파이프라인의 취약점을 악용한 악성 데이터셋을 통해 접근 권한을 얻었습니다. 오용 방지를 목적으로 하는 상용 AI 모델은 안전 가드레일이 포렌식 쿼리를 실제 공격으로 간주했기 때문에 사고 대응팀이 공격 데이터를 분석하는 것을 차단했습니다. 이로 인해 사고 대응팀은 처음에는 이러한 고급 도구를 활용할 수 없었습니다.자율 에이전트는 시스템 전반에 걸쳐 측면으로 이동하며 자격 증명을 수집하고 약한 워커-노드 권한 경계를 악용했습니다. 공격자들은 AI 기반 도구를 점점 더 많이 사용하고 있으며, 이러한 공격은 급격히 증가하고 신속한 침투를 포함합니다. 허깅페이스는 결국 내부적으로 배포된 오픈 웨이트 AI 모델인 GLM 5.2를 사용하여 안전 차단을 트리거하지 않고 포렌식 분석을 수행했습니다.보안 전문가들은 AI 보안 도구에 대한 인증된 신뢰의 필요성을 강조하며, 모델이 단순히 무엇을 묻는지뿐만 아니라 누가 왜 묻는지를 이해해야 한다고 말합니다. 사고 대응 계획은 중요한 이벤트 중에 상용 AI API를 사용할 수 없게 될 가능성을 고려해야 합니다. 이번 사건은 공격자가 강력하고 검열되지 않은 AI 도구를 사용할 수 있는 반면, 방어자는 안전 정책 및 거버넌스에 의해 제약을 받는 새로운 비대칭성을 강조합니다. 조직은 AI를 단일 종속성이 아닌 복원력 있는 보안 기능으로 설계해야 합니다.
CdXz5zHNQW_5WUCk6lWkF.png