Anthropic에 따르면 LLM에 헛소리를 토해내도록... 노트

Anthropic에 따르면 LLM에 헛소리를 토해내도록 만드는 것은 아주 쉬운 일입니다.

단 250개의 악성 훈련 문서만으로도 130억 개의 매개변수를 가진 모델을 오염시킬 수 있습니다. 이는 전체 데이터셋의 0.00016%에 불과합니다.Anthropic의 연구에 따르면 AI 모델을 오염시키는 것이 이전에 생각했던 것보다 훨씬 쉬울 수 있습니다. ...