Непрерывный подход Google Work... Заметка

Непрерывный подход Google Workspace к смягчению косвенных инъекций подсказок

Косвенная инъекция запросов (IPI) представляет собой серьезную и развивающуюся угрозу безопасности для приложений ИИ, в частности, таких как Workspace с Gemini. Злоумышленники могут внедрять вредоносные инструкции в данные, используемые LLM, влияя на ее поведение без прямого ввода данных пользователем. Google решает проблему IPI с помощью многогранной и непрерывной стратегии защиты. Это включает в себя активное обнаружение и категоризацию новых векторов атак с использованием внутренних и внешних программ. Учения по красному тестированию с участием людей и автоматизированные учения имитируют атаки и проверяют на наличие уязвимостей. Программа вознаграждения за уязвимости Google AI (VRP) позволяет сотрудничать с внешними исследователями безопасности. Каналы разведки с открытым исходным кодом помогают отслеживать публично раскрытые атаки на ИИ. Недавно обнаруженные уязвимости подвергаются тщательному анализу и добавляются в каталог уязвимостей. Генерация синтетических данных расширяет сценарии атак для всестороннего тестирования. Google использует детерминированные средства защиты для быстрого реагирования и средства защиты на основе машинного обучения посредством переобучения модели. Средства защиты на основе LLM улучшаются за счет разработки запросов. Усиление модели повышает устойчивость модели Gemini. Эффективность защиты измеряется путем имитации атак и сравнительного тестирования. Google стремится обеспечить безопасный и надежный опыт работы с ИИ, сочетая исследования в области безопасности, автоматизированные конвейеры и передовые модели ML/LLM. Эта итеративная структура гарантирует, что они будут опережать развивающиеся угрозы в сфере IPI.