The Register | Security на русском
Подписаться
Отравление больших языковых моделей, чтобы они выдавали чушь, тривиально легко, говорит Anthropic
Всего 250 вредоносных обучающих документов могут "отравить" модель с 13 миллиардами параметров — это 0,00016% от всего набора данных.
"Отравление" ИИ-моделей может оказаться намного проще, чем считалось ранее, если судить по исследованию Anthropic.