Отравление больших языковых мо... Заметка

Отравление больших языковых моделей, чтобы они выдавали чушь, тривиально легко, говорит Anthropic

Всего 250 вредоносных обучающих документов могут "отравить" модель с 13 миллиардами параметров — это 0,00016% от всего набора данных. "Отравление" ИИ-моделей может оказаться намного проще, чем считалось ранее, если судить по исследованию Anthropic.