Es ist trivial einfach, LLMs d... Notiz

Es ist trivial einfach, LLMs dazu zu bringen, Kauderwelsch von sich zu geben, sagt Anthropic

Nur 250 bösartige Trainingsdokumente können ein Modell mit 13 Milliarden Parametern vergiften – das sind 0,00016 % eines gesamten Datensatzes. Das Vergiften von KI-Modellen könnte viel einfacher sein als bisher angenommen, wenn eine Studie von Anthropic Anhaltspunkte liefert. …