LLMにゴミを出させるのは、取るに足らないほど簡単だ、とAn... ノート

LLMにゴミを出させるのは、取るに足らないほど簡単だ、とAnthropicは言う

わずか250個の悪意のあるトレーニング文書で、130億パラメータのモデルを汚染できる。これはデータセット全体の0.00016%にすぎない。 Anthropicの研究が示唆するように、AIモデルの汚染は以前考えられていたよりもはるかに容易かもしれない。