야생의 AI 위협: 웹 상의 현재 프롬프트 주입 상태
구글의 위협 인텔리전스 팀은 AI 시스템의 주요 보안 문제인 간접 프롬프트 주입(IPI) 공격을 적극적으로 모니터링하고 있습니다. 이들은 대규모 웹 아카이브인 Common Crawl을 사용하여 공개 웹을 스캔하여 실제 IPI 악용 사례를 조사했습니다. 이들의 연구는 위협 행위자들이 IPI를 어떻게 사용하는지 파악하는 것을 목표로 했습니다. 팀은 패턴 매칭, Gemini를 이용한 분류, 수동 검토를 포함하는 다단계 접근 방식을 개발하여 오탐을 걸러냈습니다. 분석 결과, 무해한 장난, SEO, 악의적인 활동 등 AI 조작 시도가 드러났습니다. 악의적인 시도에는 데이터 유출 및 파괴가 포함되었지만, 일반적으로 정교하지 않았습니다. 연구 결과에 따르면 IPI 공격의 정교함은 낮지만 증가하고 있으며, 악의적인 시도가 32% 증가했습니다. 구글은 향후 IPI 공격의 규모와 정교함이 모두 증가할 것으로 예상합니다. 이들은 모델 강화 및 레드 팀에 투자하고 있으며, 취약점 보상 프로그램을 통해 외부 연구원의 참여를 포함하고 있습니다. 구글의 실시간 데이터 처리 능력은 위협을 식별하고 무력화할 수 있게 해줍니다. 이들은 GenAI 보안 연구에 대한 추가 탐구를 위한 자료를 제공했습니다.