다중 턴 공격이 AI 모델을 88%의 경우 무력화시켰으... 노트

다중 턴 공격이 AI 모델을 88%의 경우 무력화시켰으며, 단일 턴 테스트로는 이를 놓쳤다고 VB Transform 2026에서 Cisco AI 보안 책임자가 경고했습니다.

시스코의 연구에 따르면 공격자는 다중 턴 대화에서 최대 88.3%의 확률로 AI 모델을 침해할 수 있으며, 이는 단일 턴 레드팀 노력보다 훨씬 앞서는 결과입니다. 이 발견은 현재 기업 AI 보안의 중요한 격차를 강조하며, 설문 조사에 참여한 기업의 절반 이상이 AI 보안 사고 또는 아차 사고를 경험한 것으로 나타났습니다. 많은 조직은 여전히 AI 에이전트에 대한 강력한 ID 관리 및 격리가 부족하며, 주로 공급업체 고유의 제어 기능에 의존하고 있습니다. 주요 보안 공급업체들은 에이전트 ID 및 격리 분야의 역량을 강화하기 위해 기업의 이러한 부족함을 인정하며 적극적으로 회사를 인수하고 있습니다.AI 위협 인텔리전스 분야의 리더인 에이미 창(Amy Chang)은 모델이 다양한 공격에 얼마나 취약한지를 이해하는 것이 실패 지점을 식별하는 데 중요하다고 강조했습니다. 다중 턴 공격은 인간이 AI와 상호 작용하는 방식을 현실적으로 모방하여 스냅샷 테스트에서 놓친 유해한 출력을 발견합니다. 시스코는 공격을 개발하고 실행하기 위한 자체 평가 에이전트 프레임워크를 옹호하며, 근본적이고 기본적인 보안 원칙이 가장 효과적인 방어 수단으로 남아 있다고 밝혔습니다.박스(Box)의 CISO인 헤더 셀란(Heather Ceylan)은 다중 턴 적대적 시뮬레이션의 필요성을 재차 강조하며, 강력한 신뢰가 있더라도 단일 에이전트의 실수로 인해 축적된 신뢰가 사라질 수 있다고 언급했습니다. 박스는 위험을 억제하기 위해 계층적 보안과 엄격한 권한 부여, 임시 샌드박스, 런타임 실행 제어를 사용합니다. 인투잇(Intuit)의 AI 및 ML 부사장인 라제쉬 파레크(Rajesh Parekh)는 AI 에이전트의 보안 및 위험 관리를 중앙 집중화하여 엄격하게 범위가 지정되고 감사 가능한 작업 권한을 제공하는 GenOS 플랫폼에 대해 논의했습니다.셀란은 에이전트가 취약점을 식별하고 수정하는 데 능숙해짐에 따라 전통적인 인간 코드 검토의 시대가 끝날 것이라고 예측했지만, 이는 아직 미래의 목표입니다. 셀란과 파레크 모두 AI 에이전트가 광범위한 권한 남용을 방지하기 위해 최소 권한 액세스의 중요성을 강조했습니다. AI 에이전트의 기능과 액세스가 증가함에 따라 공격 표면이 확장되어 일반적인 취약점 패턴에 대한 지속적인 테스트와 자동화가 필요합니다.AI 상호 작용에서 실제 의도와 확률을 구별하는 것의 복잡성은 여전히 중요한 산업 과제로 남아 있습니다. 시스코의 연구에 따르면 현재 모델은 의도를 안정적으로 파악하는 데 어려움을 겪고 있어 결정론적 제어와 행동 프록시가 필수적입니다. 궁극적으로 기업은 프로덕션 환경에서 치명적인 실패를 피하기 위해 공격자 방법론을 모방하여 전체 대화에 걸쳐 AI 에이전트를 지속적으로 테스트해야 합니다.