Google Online Security Blog на русском
Подписаться
Как мы оцениваем риск от атак методом инъекции запросов на системы искусственного интеллекта
"Современные системы ИИ уязвимы для атак "косвенного внедрения инструкций", где злонамеренные инструкции, скрытые в внешних данных, могут манипулировать поведением ИИ. Для уменьшения этих рисков Agentic AI разрабатывает средства защиты и инструменты измерения. Их рамочная модель оценки использует гипотетические сценарии для тестирования уязвимости ИИ, фокусируясь на несанкционированном раскрытии данных. Три техники атаки используются в рамках модели: Actor Critic, Beam Search и Tree of Attacks с обрезкой. Эти атаки направлены на генерацию успешных внедрений инструкций, которые эксплуатируют системы ИИ, несмотря на различные истории разговора. Модель измеряет коэффициент успеха атак, чтобы отслеживать улучшения безопасности. Сочетание рамочных моделей оценки, автоматизированного красного командования, мониторинга, эвристических защит и стандартных практик безопасности считается наиболее эффективной стратегией защиты."