Caesar AI Atlas

LLM-Sicherheit

Ein sicherheitsorientierter Hub zu Risiken und Kontrollen rund um große Sprachmodelle, Retrieval-Systeme, Prompts, Guardrails und Modellausgaben.

security teamsdevelopersAI governance leadslegal and compliance teams

34

Begriffe

9

Vergleiche

8

Fragen

Über dieses Thema

Übersicht

LLM-Sicherheit umfasst die Wege, auf denen Anwendungen mit Sprachmodellen angegriffen, missbraucht oder falsch konfiguriert werden können. Sie verbindet klassische Anwendungssicherheit mit Prompt-Kontrollen, Retrieval-Governance, Zugriffskontrolle und Bewertung von Ausgaben.

Warum das wichtig ist

LLM-Fehler können vertrauliche Dateien offenlegen, unsichere Ratschläge erzeugen, Daten über Prompts preisgeben oder das Vertrauen in automatisierte Workflows untergraben. Sicherheitsteams benötigen ein Vokabular, das Modellverhalten mit praktischen Kontrollen verbindet.

Compliance-Kontext

Relevant für Vendor Due Diligence, Prüfungen sicherer Bereitstellung, KI-Audit-Nachweise, Red-Team-Programme und Incident Response für LLM-Anwendungen.

Wichtige Erkenntnisse

  • 1Prompt Injection ist nicht dasselbe wie ein Jailbreak.
  • 2RAG verbessert Grounding nur, wenn Retrieval und Zugriffskontrolle gesteuert werden.
  • 3Guardrails sind nützlich, ersetzen aber kein sicheres Design.
  • 4Sicherheitsprüfungen müssen Prompts, Tools, Retrieval-Quellen, Logs und menschliche Eskalation abdecken.

Schlüsselbegriffe

Verwandte Vergleiche

Technische Alternative

RAG vs Fine-Tuning

Ein direkter Vergleich von Retrieval-Augmented Generation und Fine-Tuning. Verstehen Sie, wann externer Kontext zur Laufzeit abgerufen werden sollte und wann ein vortrainiertes Modell durch zusätzliches Training angepasst werden sollte.

Hierarchie

Prompt Injection vs Jailbreak

Unterscheiden Sie zwischen Prompt Injection, also dem Kapern des Modellverhaltens durch bösartige Eingaben, und Jailbreaking, also dem Umgehen von Sicherheitsleitplanken zur Erzeugung eingeschränkter Inhalte. Beide sind LLM-Sicherheitsbedrohungen, unterscheiden sich jedoch in Mechanismus und Ziel.

Angriff / Ausfall

Prompt Injection vs Data Poisoning

Ein direkter Vergleich von Prompt Injection und Data Poisoning. Verstehen Sie, wie sich Manipulation von Anweisungen zur Laufzeit von Angriffen auf Trainingsdaten oder den Trainingsprozess unterscheidet.

Risiko vs. Kontrolle

Guardrails vs Content Moderation / Safety Filters

Ein direkter Vergleich von Guardrails und Content Moderation / Safety Filters. Verstehen Sie den Unterschied zwischen breiten KI-Systemgrenzen und spezifischen Kontrollen für schädliche oder unzulässige Inhalte.

Architektur

System Prompt vs User Prompt

Ein direkter Vergleich von System Prompt und User Prompt. Er erklärt, wie sich anwendungsbezogene Verhaltensanweisungen von der unmittelbaren Aufgabe oder Frage unterscheiden, die ein Nutzer liefert.

Governance

Red Teaming vs KI-Audit

Ein direkter Vergleich von Red Teaming und KI-Audit. Er erklärt, wie sich ein strukturierter adversarialer Testprozess zur Identifikation von Schwächen, unsicherem Verhalten oder schädlichen Ausgaben von eine strukturierte Bewertung eines KI-Systems, Modells oder Governance-Prozesses anhand definierter Kriterien unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.

Risiko vs. Kontrolle

Security by Design vs Guardrails

Ein direkter Vergleich von Security by Design und Guardrails. Er erklärt, wie sich ein Entwicklungsansatz, bei dem Sicherheit von Beginn an in Architektur, Daten, Zugriff, Monitoring und Resilienz integriert wird von technische, prozedurale oder policybezogene Kontrollen, die KI-Verhalten in akzeptablen Grenzen halten unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.

Häufige Verwechslung

Halluzination vs Konfabulation

Ein direkter Vergleich von Halluzination und Konfabulation. Verstehen Sie, wie beide plausible, aber unbelegte oder erfundene KI-Ausgaben beschreiben und warum Halluzination häufig als breiterer operativer Begriff verwendet wird.

Häufige Verwechslung

Grounding vs Groundedness

Ein direkter Vergleich von Grounding und Groundedness. Verstehen Sie den Unterschied zwischen dem Prozess, Ausgaben mit Quellen zu verbinden, und der Eigenschaft, dass eine Ausgabe durch Nachweise gestützt ist.

Häufige Fragen

Warum kann RAG Datenschutz- und Sicherheitsrisiken schaffen?

Retrieval Augmented Generation (RAG) ist eine Technik, die generative KI mit dem Abruf aus externen Datenquellen kombiniert. Das Modell nutzt abgerufene Dokumente, Textpassagen oder Datensätze als Kontextgrundlage, um aktuellere, spezifischere und überprüfbarere Antworten zu erzeugen.

1 verwandte Begriffeintermediate

Was sind Guardrails in einem LLM-System?

Guardrails sind technische, prozedurale oder richtlinienbasierte Kontrollen, die KI-Systeme innerhalb akzeptabler Grenzen halten sollen. Sie können Risiken wie schädliche Ausgaben, Datenlecks, unbefugten Zugriff, Richtlinienverstöße oder unsicheres Verhalten reduzieren.

1 verwandte Begriffeintermediate

Was ist Grounding in generativer KI?

Grounding ist der Prozess, bei dem die Ausgabe eines KI-Modells zur Inferenzzeit mit vertrauenswürdigen, überprüfbaren Informationsquellen verbunden wird. In generativer KI hilft es, die faktische Zuverlässigkeit zu verbessern, indem relevanter Kontext bereitgestellt wird, ohne die zugrunde liegenden Gewichte des Modells zu verändern.

1 verwandte Begriffeintermediate

Was ist eine Halluzination in einem KI-System?

Eine Halluzination ist eine von KI erzeugte Ausgabe, die plausibel oder selbstsicher wirkt, aber falsch, unbelegt, irreführend oder erfunden ist. In generativer KI können Halluzinationen falsche Fakten, erfundene Quellen, falsche Zitate oder Schlussfolgerungen umfassen, die nicht auf verlässlichen Nachweisen beruhen.

1 verwandte Begriffeintermediate

Wie unterscheidet sich ein System-Prompt von einem Nutzer-Prompt?

Verwende einen System-Prompt für dauerhafte Anwendungsanweisungen und Einschränkungen; verwende einen Nutzer-Prompt für die unmittelbare Anfrage, den Kontext und das gewünschte Ergebnis des Nutzers.

1 verwandte Begriffeintermediate

Was ist Red Teaming für LLMs?

Red Teaming ist ein strukturierter adversarialer Testprozess, der dazu dient, Schwachstellen, unsicheres Verhalten oder schädliche Ausgaben in einem KI-System zu identifizieren. Dabei wird das System gezielt mit schwierigen, bösartigen oder Grenzfall-Eingaben geprüft, damit Entwickler Schutzmaßnahmen bewerten und verbessern können.

1 verwandte Begriffeintermediate

Was ist Data Poisoning in KI-Systemen?

Data Poisoning ist ein adversarialer Angriff, bei dem ein böswilliger Akteur in die Daten oder den Trainingsprozess eingreift, die zum Aufbau eines Modells verwendet werden. Durch Einfügen, Verändern oder Verfälschen von Trainingsbeispielen versucht der Angreifer, Modellverhalten zu manipulieren, Leistung zu verschlechtern oder gezielte Fehler zu erzeugen.

1 verwandte Begriffeadvanced

Was ist Inhaltsmoderation für KI-Ausgaben?

Inhaltsmoderation und Sicherheitsfilter sind Kontrollen, die darauf ausgelegt sind, schädliche, illegale oder durch Richtlinien untersagte Inhalte zu erkennen, zu blockieren, zu verringern oder zu eskalieren. In KI-Systemen werden sie häufig mit Richtlinienregeln, modellbasierten Klassifikatoren, Protokollierung und menschlicher Prüfung für Fälle mit höherem Risiko kombiniert.

1 verwandte Begriffeadvanced