Caesar AI Atlas
Angriff / Ausfall • Fortgeschritten

Prompt Injection vs Data Poisoning

Ein direkter Vergleich von Prompt Injection und Data Poisoning. Verstehen Sie, wie sich Manipulation von Anweisungen zur Laufzeit von Angriffen auf Trainingsdaten oder den Trainingsprozess unterscheidet.

Kurzes Urteil: Verwenden Sie Prompt Injection für bösartige Anweisungen, die von einem Sprachmodell zur Laufzeit verarbeitet werden; verwenden Sie Data Poisoning für Angriffe, die Trainingsdaten oder den Trainingsprozess korrumpieren.

Auf einen Blick

Prompt Injection

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

Hauptmerkmale
  • • Manipuliert ein Sprachmodell durch bösartige oder unbeabsichtigte Anweisungen
  • • Kann in Nutzereingaben, Dokumenten, Webseiten oder anderen verarbeiteten Inhalten platziert werden
  • • Kann Anweisungsüberschreibung, Offenlegung eingeschränkter Informationen, veränderte Ausgaben oder unautorisierte Handlungen verursachen
Achtung
  • • Indirekte Inhalte können Anweisungen tragen, selbst wenn der Nutzerprompt harmlos wirkt
  • • Prompt-Kontrollen allein können unzureichend sein, wenn das Modell Tools verwenden oder auf Daten zugreifen kann

Kontext: Am relevantesten für LLM-Anwendungen, die nicht vertrauenswürdigen Text, abgerufene Dokumente, Webinhalte oder toolbezogene Anweisungen verarbeiten.

VS
Data Poisoning

Data Poisoning summarizes adversarial attack in which a malicious actor interferes with the data or training process used to build a model.

Hauptmerkmale
  • • Greift in die Daten oder den Trainingsprozess ein, mit denen ein Modell aufgebaut wird
  • • Verwendet eingefügte, veränderte oder korrumpierte Trainingsbeispiele
  • • Zielt darauf ab, Leistung zu verschlechtern, Verhalten zu manipulieren oder gezielte Fehler zu erzeugen
Achtung
  • • Poisoning kann nach dem Training schwer zu erkennen sein, wenn Datenabstammung schwach ist
  • • Kleine gezielte Änderungen können in sensiblen Anwendungsfällen ernsthafte Auswirkungen haben

Kontext: Am relevantesten bei der Bewertung von Modelltrainingspipelines, Trainingsdatenherkunft, Datensatzqualität und Risiken adversarialer Manipulation.

Wesentliche Unterschiede

AspektPrompt InjectionData Poisoning
BedrohungsmodellPrompt Injection zielt auf das Anweisungsfolge-Verhalten des Modells durch Inhalte, die es verarbeitet.Data Poisoning zielt auf den Modellbildungsprozess durch Korrumpierung von Daten oder Trainingseingaben.
AngriffspfadDer Angreifer platziert bösartige oder widersprüchliche Anweisungen in Prompts, Dokumenten, Webseiten oder anderen Laufzeitinhalten.Der Angreifer fügt Trainingsbeispiele ein, verändert oder korrumpiert sie oder greift in den Trainingsprozess ein.
AuswirkungAuswirkungen können das Ignorieren früherer Anweisungen, Leaken eingeschränkter Informationen, veränderte Ausgaben oder das Auslösen unautorisierter Handlungen umfassen.Auswirkungen können verschlechterte Leistung, manipuliertes Verhalten oder gezielte Modellfehler umfassen.
KontrollenKontrollen umfassen Eingabeisolation, Anweisungshierarchie, Tool-Berechtigungen, Ausgabevalidierung, Retrieval-Filterung und Protokollierung.Kontrollen umfassen Datenherkunft, Datensatzvalidierung, Sicherheit der Trainingspipeline, Anomalieerkennung und kontrollierte Datenänderungen.
ErkennungsnachweiseNachweise können Prompt-Protokolle, abgerufene Inhalte, Tool-Call-Traces, Policy-Verstöße und Red-Team-Ergebnisse umfassen.Nachweise können Datensatz-Diffs, Datenabstammungsaufzeichnungen, Trainingslogs, Leistungsanomalien und Validierungsergebnisse umfassen.
TimingPrompt Injection tritt normalerweise während Inferenz oder Anwendungslaufzeit auf.Data Poisoning erfolgt normalerweise vor oder während des Trainings, auch wenn seine Wirkungen später in der Bereitstellung sichtbar werden.
Caesar AI Hinweis

In der Praxis verteidigen Teams oft Prompts und ignorieren Datenabstammung, oder sichern Datensätze, lassen Modelle aber nicht vertrauenswürdige Dokumente als Anweisungen verarbeiten. Reife KI-Sicherheit behandelt beides als getrennte Kontrollfamilien.

Hinweise

Häufige Fehler

1

Prompt Injection als Trainingsdatenproblem zu behandeln.

2

Anzunehmen, Data Poisoning betreffe nur Modellgenauigkeit und nicht gezieltes Verhalten.

3

Sich nur auf Systemprompts zu verlassen, um Injection-Angriffe zu stoppen.

4

Datensatzherkunft zu überspringen, weil das Modell in normalen Tests gut zu funktionieren scheint.

Wann verwenden

prompt-injection

Verwenden Sie Prompt Injection, wenn ein Sprachmodell durch Anweisungen manipuliert wird, die in Eingaben oder externen Inhalten eingebettet sind. Der Begriff ist besonders wichtig für LLM-Apps mit Retrieval, Browsing, Dokumentenanalyse, Agenten oder Tool-Nutzung.

data-poisoning

Verwenden Sie Data Poisoning, wenn der Angriff korrumpierte oder manipulierte Daten betrifft, die zum Aufbau des Modells verwendet werden. Der Begriff gehört in Datensatz-Governance, Modelltrainingskontrollen, Herkunftsprüfungen und adversariale ML-Risikoanalyse.

Compliance-Hinweis

KI-Sicherheits-Governance nach ISO/IEC 42001 und NIST AI RMF sollte Laufzeitangriffe auf LLMs von Trainingsdatenangriffen unterscheiden, weil Nachweise, Kontrollen und Verantwortliche unterschiedlich sind. Für Hochrisiko-KI-Systeme macht der EU AI Act robustes Risikomanagement und technische Dokumentation auch für sicherheitsbezogene Risiken wichtig.

Häufige Fragen

Ist Prompt Injection eine Art Data Poisoning?+

Nein. Prompt Injection manipuliert das Modell durch Inhalte, die zur Laufzeit verarbeitet werden, während Data Poisoning die Daten oder den Trainingsprozess manipuliert, mit denen das Modell gebaut wird.

Welche Bedrohung ist für RAG-Systeme relevanter?+

Prompt Injection ist für RAG-Systeme häufig zentral, weil abgerufene Dokumente bösartige Anweisungen enthalten können. Data Poisoning kann ebenfalls relevant sein, wenn der Retrieval-Korpus oder Trainingsdaten korrumpiert sind.

Welche Nachweise helfen bei der Untersuchung dieser Angriffe?+

Prompt-Injection-Untersuchungen stützen sich auf Prompts, abgerufene Inhalte, Tool-Traces und Ausgaben. Data-Poisoning-Untersuchungen stützen sich stärker auf Datensatzabstammung, Datensatz-Diffs, Trainingslogs und Validierungsanomalien.

Zuletzt angesehen

No recently viewed comparisons yet.