The Register | Security на русском
Подписаться
LegalPwn: Обман больших языковых моделей путем сокрытия вредоносного содержимого в мелком шрифте юридических документов
«Доверяй и верь – модели ИИ, обученные видеть «юридический» документ как сверхлегитимный.
Исследователи из охранной фирмы Pangea обнаружили еще один способ легко обмануть большие языковые модели (LLM), заставив их игнорировать свои предохранители. Вставьте свои враждебные инструкции куда-нибудь в юридический документ, чтобы придать им вид незаслуженной легитимности – трюк, знакомый юристам всего мира...»