Schneier on Security на русском
Подписаться
Кража следов рассуждений ИИ
Ведущие поставщики больших языковых моделей теперь скрывают пошаговое рассуждение своих моделей для защиты своей интеллектуальной собственности. Это рассуждение, также известное как цепочка мыслей, возвращается клиенту в виде зашифрованного текста для последующих запросов. Исследование выявляет архитектурную уязвимость, при которой эти зашифрованные блоки взаимозаменяемы между сессиями, пользователями и моделями от одного и того же поставщика. Используя это, разработан масштабируемый джейлбрейк для дешифровки. Внедряя зашифрованный след из сильной модели в более слабую, более слабая модель вынуждена выводить след в открытом тексте. Это обходит механизмы защиты от дистилляции, позволяя злоумышленникам извлекать проприетарные рассуждения. Уязвимость также позволяет извлекать частные данные в больших масштабах, как показано восстановлением персональных данных и учетных данных из общедоступных репозиториев. Также может быть раскрыта опасная информация, даже если конечный результат безопасен. Кроме того, злоумышленники могут выполнять невидимые инъекции промптов, скрывая вредоносные полезные нагрузки внутри этих зашифрованных блоков. Исследование предлагает криптографические и системные меры для устранения этих проблем безопасности.