Как мы оцениваем риск от атак ... Заметка

Как мы оцениваем риск от атак методом инъекции запросов на системы искусственного интеллекта

"Современные системы ИИ уязвимы для атак "косвенного внедрения инструкций", где злонамеренные инструкции, скрытые в внешних данных, могут манипулировать поведением ИИ. Для уменьшения этих рисков Agentic AI разрабатывает средства защиты и инструменты измерения. Их рамочная модель оценки использует гипотетические сценарии для тестирования уязвимости ИИ, фокусируясь на несанкционированном раскрытии данных. Три техники атаки используются в рамках модели: Actor Critic, Beam Search и Tree of Attacks с обрезкой. Эти атаки направлены на генерацию успешных внедрений инструкций, которые эксплуатируют системы ИИ, несмотря на различные истории разговора. Модель измеряет коэффициент успеха атак, чтобы отслеживать улучшения безопасности. Сочетание рамочных моделей оценки, автоматизированного красного командования, мониторинга, эвристических защит и стандартных практик безопасности считается наиболее эффективной стратегией защиты."