Интересная статья, посвящённая... Заметка

Интересная статья, посвящённая исследованию метода «prompt injection»

Это увлекательное исследование того, как большие языковые модели поддаются атакам внедрения промптов. Оказывается, они учатся распознавать стиль текста в различных блоках ролей/инструкций, а не только теги.Их вывод:Теги ролей были форматирующим трюком, который стал архитектурой безопасности и когнитивной основой современных больших языковых моделей. Мы показали, что эта архитектура не сохраняется в фактических представлениях модели, и что такая путаница ролей связана с внедрением промптов.Если большие языковые модели не достигнут подлинного восприятия ролей, мы считаем, что защита от внедрения останется вечной игрой в "крота". А непрерывный характер границ ролей открывает угрозу внедрений, разработанных для тонкого смещения состояний больших языковых моделей через кажущиеся безобидными тексты, юридически и в больших масштабах...