Google Workspace의 간접 프롬프트 주입 완... 노트

Google Workspace의 간접 프롬프트 주입 완화에 대한 지속적인 접근 방식

간접 프롬프트 주입(IPI)은 Workspace with Gemini와 같은 AI 애플리케이션에 심각하고 진화하는 보안 위협을 제기합니다. 공격자는 LLM이 사용하는 데이터에 악성 지침을 주입하여 사용자의 직접적인 입력 없이도 LLM의 동작에 영향을 미칠 수 있습니다. Google은 다면적이고 지속적인 방어 전략을 통해 IPI에 대응합니다. 여기에는 내부 및 외부 프로그램을 사용하여 새로운 공격 벡터를 사전에 발견하고 분류하는 것이 포함됩니다. 사람과 자동화된 레드팀 훈련은 공격을 시뮬레이션하고 취약점을 테스트합니다. Google AI 취약점 보상 프로그램(VRP)은 외부 보안 연구원과의 협업을 가능하게 합니다. 오픈 소스 인텔리전스 피드는 공개적으로 공개된 AI 공격을 추적하는 데 도움이 됩니다. 새롭게 발견된 취약점은 철저한 분석을 거쳐 취약점 카탈로그에 추가됩니다. 합성 데이터 생성은 포괄적인 테스트를 위해 공격 시나리오를 확장합니다. Google은 신속한 대응을 위해 결정론적 방어를 사용하고, 모델 재훈련을 통해 ML 기반 방어를 사용합니다. LLM 기반 방어는 프롬프트 엔지니어링을 통해 개선됩니다. 모델 강화는 Gemini 모델의 복원력을 향상시킵니다. 방어 효과는 시뮬레이션된 공격과 비교 테스트를 통해 측정됩니다. Google은 보안 연구, 자동화된 파이프라인, 고급 ML/LLM 모델을 결합하여 안전하고 신뢰할 수 있는 AI 경험을 제공하기 위해 노력하고 있습니다. 이 반복적인 프레임워크는 IPI 환경에서 진화하는 위협에 앞서 나갈 수 있도록 보장합니다.