Ein sicherheitsorientierter Hub zu Risiken und Kontrollen rund um große Sprachmodelle, Retrieval-Systeme, Prompts, Guardrails und Modellausgaben.
34
Begriffe
9
Vergleiche
8
Fragen
LLM-Sicherheit umfasst die Wege, auf denen Anwendungen mit Sprachmodellen angegriffen, missbraucht oder falsch konfiguriert werden können. Sie verbindet klassische Anwendungssicherheit mit Prompt-Kontrollen, Retrieval-Governance, Zugriffskontrolle und Bewertung von Ausgaben.
LLM-Fehler können vertrauliche Dateien offenlegen, unsichere Ratschläge erzeugen, Daten über Prompts preisgeben oder das Vertrauen in automatisierte Workflows untergraben. Sicherheitsteams benötigen ein Vokabular, das Modellverhalten mit praktischen Kontrollen verbindet.
Relevant für Vendor Due Diligence, Prüfungen sicherer Bereitstellung, KI-Audit-Nachweise, Red-Team-Programme und Incident Response für LLM-Anwendungen.
Zentrale Modell- und Anpassungskonzepte, die Sicherheits- und Governance-Entscheidungen prägen.
Sicherheitsrisiken, die Anweisungen, Daten, Retrieval-Kontext und Modellverhalten angreifen.
Kontrollen, mit denen unsichere Ausgaben reduziert, Fehler gemessen und Systeme auditierbar gemacht werden.
Ein direkter Vergleich von Retrieval-Augmented Generation und Fine-Tuning. Verstehen Sie, wann externer Kontext zur Laufzeit abgerufen werden sollte und wann ein vortrainiertes Modell durch zusätzliches Training angepasst werden sollte.
Unterscheiden Sie zwischen Prompt Injection, also dem Kapern des Modellverhaltens durch bösartige Eingaben, und Jailbreaking, also dem Umgehen von Sicherheitsleitplanken zur Erzeugung eingeschränkter Inhalte. Beide sind LLM-Sicherheitsbedrohungen, unterscheiden sich jedoch in Mechanismus und Ziel.
Ein direkter Vergleich von Prompt Injection und Data Poisoning. Verstehen Sie, wie sich Manipulation von Anweisungen zur Laufzeit von Angriffen auf Trainingsdaten oder den Trainingsprozess unterscheidet.
Ein direkter Vergleich von Guardrails und Content Moderation / Safety Filters. Verstehen Sie den Unterschied zwischen breiten KI-Systemgrenzen und spezifischen Kontrollen für schädliche oder unzulässige Inhalte.
Ein direkter Vergleich von System Prompt und User Prompt. Er erklärt, wie sich anwendungsbezogene Verhaltensanweisungen von der unmittelbaren Aufgabe oder Frage unterscheiden, die ein Nutzer liefert.
Ein direkter Vergleich von Red Teaming und KI-Audit. Er erklärt, wie sich ein strukturierter adversarialer Testprozess zur Identifikation von Schwächen, unsicherem Verhalten oder schädlichen Ausgaben von eine strukturierte Bewertung eines KI-Systems, Modells oder Governance-Prozesses anhand definierter Kriterien unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.
Ein direkter Vergleich von Security by Design und Guardrails. Er erklärt, wie sich ein Entwicklungsansatz, bei dem Sicherheit von Beginn an in Architektur, Daten, Zugriff, Monitoring und Resilienz integriert wird von technische, prozedurale oder policybezogene Kontrollen, die KI-Verhalten in akzeptablen Grenzen halten unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.
Ein direkter Vergleich von Halluzination und Konfabulation. Verstehen Sie, wie beide plausible, aber unbelegte oder erfundene KI-Ausgaben beschreiben und warum Halluzination häufig als breiterer operativer Begriff verwendet wird.
Ein direkter Vergleich von Grounding und Groundedness. Verstehen Sie den Unterschied zwischen dem Prozess, Ausgaben mit Quellen zu verbinden, und der Eigenschaft, dass eine Ausgabe durch Nachweise gestützt ist.
Retrieval Augmented Generation (RAG) ist eine Technik, die generative KI mit dem Abruf aus externen Datenquellen kombiniert. Das Modell nutzt abgerufene Dokumente, Textpassagen oder Datensätze als Kontextgrundlage, um aktuellere, spezifischere und überprüfbarere Antworten zu erzeugen.
Guardrails sind technische, prozedurale oder richtlinienbasierte Kontrollen, die KI-Systeme innerhalb akzeptabler Grenzen halten sollen. Sie können Risiken wie schädliche Ausgaben, Datenlecks, unbefugten Zugriff, Richtlinienverstöße oder unsicheres Verhalten reduzieren.
Grounding ist der Prozess, bei dem die Ausgabe eines KI-Modells zur Inferenzzeit mit vertrauenswürdigen, überprüfbaren Informationsquellen verbunden wird. In generativer KI hilft es, die faktische Zuverlässigkeit zu verbessern, indem relevanter Kontext bereitgestellt wird, ohne die zugrunde liegenden Gewichte des Modells zu verändern.
Eine Halluzination ist eine von KI erzeugte Ausgabe, die plausibel oder selbstsicher wirkt, aber falsch, unbelegt, irreführend oder erfunden ist. In generativer KI können Halluzinationen falsche Fakten, erfundene Quellen, falsche Zitate oder Schlussfolgerungen umfassen, die nicht auf verlässlichen Nachweisen beruhen.
Verwende einen System-Prompt für dauerhafte Anwendungsanweisungen und Einschränkungen; verwende einen Nutzer-Prompt für die unmittelbare Anfrage, den Kontext und das gewünschte Ergebnis des Nutzers.
Red Teaming ist ein strukturierter adversarialer Testprozess, der dazu dient, Schwachstellen, unsicheres Verhalten oder schädliche Ausgaben in einem KI-System zu identifizieren. Dabei wird das System gezielt mit schwierigen, bösartigen oder Grenzfall-Eingaben geprüft, damit Entwickler Schutzmaßnahmen bewerten und verbessern können.
Data Poisoning ist ein adversarialer Angriff, bei dem ein böswilliger Akteur in die Daten oder den Trainingsprozess eingreift, die zum Aufbau eines Modells verwendet werden. Durch Einfügen, Verändern oder Verfälschen von Trainingsbeispielen versucht der Angreifer, Modellverhalten zu manipulieren, Leistung zu verschlechtern oder gezielte Fehler zu erzeugen.
Inhaltsmoderation und Sicherheitsfilter sind Kontrollen, die darauf ausgelegt sind, schädliche, illegale oder durch Richtlinien untersagte Inhalte zu erkennen, zu blockieren, zu verringern oder zu eskalieren. In KI-Systemen werden sie häufig mit Richtlinienregeln, modellbasierten Klassifikatoren, Protokollierung und menschlicher Prüfung für Fälle mit höherem Risiko kombiniert.