Наш ИИ-движок для пентестинга убедил защитный механизм от инъекций в промпт производственного ИИ-агента выдать весь его системный промпт со второй попытки.
Движок для пентестинга с использованием ИИ под названием Cascade успешно получил полный системный промпт от рабочего ИИ-агента. Это было достигнуто путем переформулирования запроса как запроса на документацию, а не прямого запроса промпта. Затем ИИ-агент раскрыл исчерпывающие сведения, включая список своих инструментов, правила вызовов, формат цитирования и идентификаторы сессий. Инженер по безопасности счел это особенно примечательным, поскольку никаких технических уязвимостей не было использовано. Вместо этого агент раскрыл информацию, потому что запрос был сформулирован таким образом, что казался разумным. Cascade, после первоначального отказа, адаптировал свой подход, изменив предлог своего запроса. Это позволило ему получить конфиденциальную информацию от агента. Команда безопасности поделилась этим открытием как интересным наблюдением для более широкого сообщества. Им интересно, сталкивались ли другие с подобным поведением в рабочих ИИ-агентах. Дополнительные сведения об этой репродукции и отчете доступны через /u/PriorPuzzleheaded880.