Исследователи безопасности обм... Заметка

Исследователи безопасности обманом заставили большие языковые модели выдать им рецепты кокаина, злоупотребляя ролевыми моделями для внедрения подсказок.

Если вы хотите представить себе картину будущего безопасности больших языковых моделей, вообразите "Ударь крота" вперемешку с "Днем сурка".
CdXz5zHNQW_R7czVeVByx.jpeg