Es ist trivial einfach, LLMs dazu zu bringen, Kauderwelsch von sich zu geben, sagt Anthropic
Nur 250 bösartige Trainingsdokumente können ein Modell mit 13 Milliarden Parametern vergiften – das sind 0,00016 % eines gesamten Datensatzes.
Das Vergiften von KI-Modellen könnte viel einfacher sein als bisher angenommen, wenn eine Studie von Anthropic Anhaltspunkte liefert. …