다층 방어 전략을 통한 프롬프트 주입 공격 완화
생성 AI의 부상은 외부 데이터 소스 seperti 이메일에 숨겨진 악의적인 지시를 숨기는 간접적인 프롬프트 주입을 초래합니다. 이러한 공격은 AI 시스템을 조작하고 데이터를 유출하며 악의적인 행동을 강요하여 강력한 보안 대책을 요구합니다. Google은 Gemini에 대한 다층 방어를 구현하여 모델을 강화하고 기계 학습을 사용하여 악의적인 지시를 감지합니다. 프롬프트 주입 콘텐츠 분류기는 유해한 데이터를 필터링하고, 보안 생각 강화는 AI가 적대적인 명령을 무시하도록 유도합니다. 마크다운 정제 및 의심스러운 URL 삭제는 이미지 및 안전하지 않은 링크를 통해 데이터 유출을 방지합니다. 위험한 작업에 대한 사용자 확인 프레임워크는 명시적인 동의를 요구하여 보안에 인간 요소를 추가합니다. 최종 사용자 보안 완화 알림은 사용자에게 중단된 공격에 대해 통보하고 학습 리소스를 제공합니다. Google은 연구원과 위협 정보를 공유하여 AI 보안을 강화합니다. 회사는 레드 팀, BugSWAT 이벤트, SAIF 프레임워크와 같은 프레임워크를 사용하여 방어를 테스트하고 개선합니다. 향후 Gemini 모델은 향상된 내구성 및 추가 프롬프트 주입 방어 기능을 특징으로 하게 됩니다. Google의 접근 방식은 AI 보안 위협 및 완화 전략을 이해하려는 사람들을 위한 다양한 리소스에 자세히 설명되어 있습니다.