Смягчение атак с инъекцией под... Заметка

Смягчение атак с инъекцией подсказок с помощью многоуровневой стратегии защиты

Возникновение генеративного ИИ приводит к появлению косвенных инъекций запросов, когда вредоносные инструкции скрываются во внешних источниках данных, таких как электронные письма. Эти атаки могут манипулировать системами ИИ, осуществлять утечку данных и выполнять вредоносные действия, требуя применения надежных мер безопасности. Google использует многоуровневую защиту для Gemini, укрепляя модели и применяя машинное обучение для обнаружения вредоносных инструкций. Классификаторы контента инъекций запросов фильтруют вредоносные данные, а усиление безопасности посредством обучения направляет ИИ на игнорирование враждебных команд. Очистка Markdown и удаление подозрительных URL-адресов предотвращают утечку данных через изображения и небезопасные ссылки. Фреймворк подтверждения пользователя требует явного согласия на рискованные действия, добавляя человеческий фактор в систему безопасности. Уведомления о смягчении угроз для конечных пользователей информируют пользователей о предотвращенных атаках и предоставляют обучающие ресурсы. Google сотрудничает с исследователями и обменивается разведывательными данными о угрозах для укрепления безопасности ИИ. Компания использует методы красного тестирования, мероприятия BugSWAT и такие фреймворки, как SAIF, для тестирования и улучшения защиты. Будущие модели Gemini будут обладать повышенной устойчивостью и дополнительными средствами защиты от инъекций запросов. Подробное описание подхода Google содержится в различных ресурсах для тех, кто хочет понять угрозы безопасности ИИ и стратегии их смягчения.