Wie wir das Risiko von Prompt-Injektions-Angriffen auf KI-Systeme einschätzen
"Moderne KI-Systeme sind anfällig für "indirekte Prompt-Injektions"-Angriffe, bei denen böswillige Anweisungen in externen Daten die KI-Verhaltensweise manipulieren können. Um diese Risiken zu minimieren, entwickelt Agentic AI Verteidigungs- und Messwerkzeuge. Ihr Bewertungsrahmen verwendet hypothetische Szenarien, um die Anfälligkeit von KI zu testen, mit dem Schwerpunkt auf unautorisierte Datenoffenlegung. Drei Angriffstechniken werden im Rahmen verwendet: Actor Critic, Beam Search und Tree of Attacks mit Beschneidung. Diese Angriffe zielen darauf ab, erfolgreiche Prompt-Injektionen zu generieren, die KI-Systeme trotz unterschiedlicher Konversationshistorien ausnutzen. Der Rahmen misst die Erfolgsraten der Angriffe, um Sicherheitsverbesserungen zu verfolgen. Eine Kombination von Bewertungsrahmen, automatisiertem Red-Teaming, Überwachung, heuristischen Verteidigungen und standardmäßigen Sicherheitspraktiken gilt als die effektivste Verteidigungsstrategie."