Unterscheiden Sie zwischen Prompt Injection, also dem Kapern des Modellverhaltens durch bösartige Eingaben, und Jailbreaking, also dem Umgehen von Sicherheitsleitplanken zur Erzeugung eingeschränkter Inhalte. Beide sind LLM-Sicherheitsbedrohungen, unterscheiden sich jedoch in Mechanismus und Ziel.
Kurzes Urteil: Prompt Injection kapert die Aufgabe des Modells; Jailbreaking umgeht seine Sicherheitsregeln. Injection betrifft Kontrolle, Jailbreaking betrifft Zugriff.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.
| Aspekt | Prompt Injection | Jailbreak |
|---|---|---|
| Ziel | Das Modell dazu bringen, eine unbeabsichtigte Aufgabe auszuführen, etwa Datenexfiltration oder unautorisierte Aktionen. | Das Modell dazu bringen, Inhalte zu erzeugen, deren Ausgabe es verweigern sollte, etwa schädliche, illegale oder eingeschränkte Inhalte. |
| Mechanismus | Überschreibt den Systemprompt oder injiziert Anweisungen über Nutzereingaben oder abgerufene Daten. | Nutzt Schwächen im Sicherheitstraining durch Rollenspiel, Kodierungstricks oder Manipulation der Persona aus. |
| Angriffsfläche | Jeder Eingabekanal: Nutzernachrichten, Tool-Ausgaben, abgerufene Dokumente, API-Aufrufe. | Primär die nutzerseitige Gesprächsschnittstelle. |
| Absicht des Angreifers | Kontrolle — das Modell etwas tun lassen, wofür es nicht vorgesehen war. | Zugriff — das Modell etwas sagen lassen, was es nicht sagen sollte. |
| Minderung | Eingabesäuberung, Anweisungshierarchie, Trennzeichen-Tokens, Output-Monitoring. | Sicherheitstraining (RLHF), Constitutional AI, Inhaltsklassifikatoren, Refusal-Tuning. |
Prompt Injection ist in Produktionssystemen die gefährlichere der beiden Bedrohungen, insbesondere bei agentischer KI. Ein Jailbreak erzeugt schädlichen Text; eine Prompt Injection kann durch Tool-Nutzung unautorisierte Handlungen in der realen Welt auslösen.
„Jailbreak“ und „Prompt Injection“ austauschbar zu verwenden — sie haben unterschiedliche Ziele und Mechanismen.
Jailbreaks für harmlosen Spaß zu halten — sie können Trainingsdaten extrahieren oder illegale Inhalte erzeugen.
Indirekte Prompt Injection über von RAG abgerufene Dokumente zu ignorieren.
Anzunehmen, dass Sicherheitstraining allein Prompt Injection verhindert — es adressiert hauptsächlich Jailbreaks.
Verwenden Sie „Prompt Injection“, wenn Angriffe diskutiert werden, die Modellverhalten manipulieren, um unautorisierte Aktionen auszuführen, insbesondere in agentischen oder tool-nutzenden KI-Systemen.
Verwenden Sie „Jailbreak“, wenn Versuche diskutiert werden, Inhaltssicherheitsfilter zu umgehen und eingeschränkte Ausgaben zu erzeugen, insbesondere in verbraucherorientierten Chat-Anwendungen.
Beide Angriffstypen sind für Anforderungen des EU AI Act an Robustheit und Cybersicherheit von Hochrisiko-KI-Systemen relevant. Systeme müssen Widerstandsfähigkeit gegen adversarielle Manipulation nachweisen.
Das kann er sein. Viele Jailbreaks verwenden Prompt-Injection-Techniken, aber nicht alle Prompt Injections sind Jailbreaks. Prompt Injection ist die breitere Angriffskategorie.
Prompt Injection — insbesondere indirekte Injection in agentischen Systemen, in denen das Modell Tools ausführen, auf Datenbanken zugreifen oder Nachrichten im Namen von Nutzern senden kann.
No recently viewed comparisons yet.