Schneier on Security на русском
Подписаться
Интересная статья, посвящённая исследованию метода «prompt injection»
Это увлекательное исследование того, как большие языковые модели поддаются атакам внедрения промптов. Оказывается, они учатся распознавать стиль текста в различных блоках ролей/инструкций, а не только теги.Их вывод:Теги ролей были форматирующим трюком, который стал архитектурой безопасности и когнитивной основой современных больших языковых моделей. Мы показали, что эта архитектура не сохраняется в фактических представлениях модели, и что такая путаница ролей связана с внедрением промптов.Если большие языковые модели не достигнут подлинного восприятия ролей, мы считаем, что защита от внедрения останется вечной игрой в "крота". А непрерывный характер границ ролей открывает угрозу внедрений, разработанных для тонкого смещения состояний больших языковых моделей через кажущиеся безобидными тексты, юридически и в больших масштабах...