Caesar AI Atlas
Hierarchie • Fortgeschritten

Prompt Injection vs Jailbreak

Unterscheiden Sie zwischen Prompt Injection, also dem Kapern des Modellverhaltens durch bösartige Eingaben, und Jailbreaking, also dem Umgehen von Sicherheitsleitplanken zur Erzeugung eingeschränkter Inhalte. Beide sind LLM-Sicherheitsbedrohungen, unterscheiden sich jedoch in Mechanismus und Ziel.

Kurzes Urteil: Prompt Injection kapert die Aufgabe des Modells; Jailbreaking umgeht seine Sicherheitsregeln. Injection betrifft Kontrolle, Jailbreaking betrifft Zugriff.

Auf einen Blick

Prompt Injection

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

VS
Jailbreak

Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.

Wesentliche Unterschiede

AspektPrompt InjectionJailbreak
ZielDas Modell dazu bringen, eine unbeabsichtigte Aufgabe auszuführen, etwa Datenexfiltration oder unautorisierte Aktionen.Das Modell dazu bringen, Inhalte zu erzeugen, deren Ausgabe es verweigern sollte, etwa schädliche, illegale oder eingeschränkte Inhalte.
MechanismusÜberschreibt den Systemprompt oder injiziert Anweisungen über Nutzereingaben oder abgerufene Daten.Nutzt Schwächen im Sicherheitstraining durch Rollenspiel, Kodierungstricks oder Manipulation der Persona aus.
AngriffsflächeJeder Eingabekanal: Nutzernachrichten, Tool-Ausgaben, abgerufene Dokumente, API-Aufrufe.Primär die nutzerseitige Gesprächsschnittstelle.
Absicht des AngreifersKontrolle — das Modell etwas tun lassen, wofür es nicht vorgesehen war.Zugriff — das Modell etwas sagen lassen, was es nicht sagen sollte.
MinderungEingabesäuberung, Anweisungshierarchie, Trennzeichen-Tokens, Output-Monitoring.Sicherheitstraining (RLHF), Constitutional AI, Inhaltsklassifikatoren, Refusal-Tuning.
Caesar AI Hinweis

Prompt Injection ist in Produktionssystemen die gefährlichere der beiden Bedrohungen, insbesondere bei agentischer KI. Ein Jailbreak erzeugt schädlichen Text; eine Prompt Injection kann durch Tool-Nutzung unautorisierte Handlungen in der realen Welt auslösen.

Hinweise

Häufige Fehler

1

„Jailbreak“ und „Prompt Injection“ austauschbar zu verwenden — sie haben unterschiedliche Ziele und Mechanismen.

2

Jailbreaks für harmlosen Spaß zu halten — sie können Trainingsdaten extrahieren oder illegale Inhalte erzeugen.

3

Indirekte Prompt Injection über von RAG abgerufene Dokumente zu ignorieren.

4

Anzunehmen, dass Sicherheitstraining allein Prompt Injection verhindert — es adressiert hauptsächlich Jailbreaks.

Wann verwenden

prompt-injection

Verwenden Sie „Prompt Injection“, wenn Angriffe diskutiert werden, die Modellverhalten manipulieren, um unautorisierte Aktionen auszuführen, insbesondere in agentischen oder tool-nutzenden KI-Systemen.

prompt-injection-jailbreak

Verwenden Sie „Jailbreak“, wenn Versuche diskutiert werden, Inhaltssicherheitsfilter zu umgehen und eingeschränkte Ausgaben zu erzeugen, insbesondere in verbraucherorientierten Chat-Anwendungen.

Compliance-Hinweis

Beide Angriffstypen sind für Anforderungen des EU AI Act an Robustheit und Cybersicherheit von Hochrisiko-KI-Systemen relevant. Systeme müssen Widerstandsfähigkeit gegen adversarielle Manipulation nachweisen.

Häufige Fragen

Ist ein Jailbreak eine Art Prompt Injection?+

Das kann er sein. Viele Jailbreaks verwenden Prompt-Injection-Techniken, aber nicht alle Prompt Injections sind Jailbreaks. Prompt Injection ist die breitere Angriffskategorie.

Was ist in der Produktion gefährlicher?+

Prompt Injection — insbesondere indirekte Injection in agentischen Systemen, in denen das Modell Tools ausführen, auf Datenbanken zugreifen oder Nachrichten im Namen von Nutzern senden kann.

Verwandte Vergleiche

Zuletzt angesehen

No recently viewed comparisons yet.