Anfänger
Was ist LLM-Sicherheit?
LLM-Sicherheit ist die Disziplin, Anwendungen mit großen Sprachmodellen vor Angriffen, Missbrauch, Datenabfluss, unsicheren Ausgaben und unbeabsichtigten Handlungen zu schützen.
Was ist Prompt Injection?
Prompt Injection ist eine adversariale Technik, bei der ein Sprachmodell durch bösartige oder unbeabsichtigte Anweisungen in Nutzereingaben, Dokumenten, Webseiten oder anderen verarbeiteten Inhalten manipuliert wird.
Was ist ein Jailbreak in einem LLM-System?
Prompt Injection oder Jailbreak bezeichnet adversariale Eingaben, die darauf abzielen, Anweisungen, Sicherheitsrichtlinien oder operative Kontrollen eines Modells zu umgehen. Gegenmaßnahmen umfassen Eingabefilterung, Retrieval-Isolation, Tool-Zugriff nach dem Least-Privilege-Prinzip, Richtliniendurchsetzung und mehrschichtige Guardrails.
Wie unterscheidet sich RAG von Fine-Tuning?
Verwenden Sie RAG, wenn das Modell aktuelle, quellenbasierte Informationen benötigt; verwenden Sie Fine-Tuning, wenn das Modell spezialisiertes Verhalten, Aufgabenleistung, Domänenanpassung oder einen aus Daten erlernten Stil benötigt.
Fortgeschritten
Warum kann RAG Datenschutz- und Sicherheitsrisiken schaffen?
Retrieval Augmented Generation (RAG) ist eine Technik, die generative KI mit dem Abruf aus externen Datenquellen kombiniert. Das Modell nutzt abgerufene Dokumente, Textpassagen oder Datensätze als Kontextgrundlage, um aktuellere, spezifischere und überprüfbarere Antworten zu erzeugen.
Was sind Guardrails in einem LLM-System?
Guardrails sind technische, prozedurale oder richtlinienbasierte Kontrollen, die KI-Systeme innerhalb akzeptabler Grenzen halten sollen. Sie können Risiken wie schädliche Ausgaben, Datenlecks, unbefugten Zugriff, Richtlinienverstöße oder unsicheres Verhalten reduzieren.
Was ist Grounding in generativer KI?
Grounding ist der Prozess, bei dem die Ausgabe eines KI-Modells zur Inferenzzeit mit vertrauenswürdigen, überprüfbaren Informationsquellen verbunden wird. In generativer KI hilft es, die faktische Zuverlässigkeit zu verbessern, indem relevanter Kontext bereitgestellt wird, ohne die zugrunde liegenden Gewichte des Modells zu verändern.
Was ist eine Halluzination in einem KI-System?
Eine Halluzination ist eine von KI erzeugte Ausgabe, die plausibel oder selbstsicher wirkt, aber falsch, unbelegt, irreführend oder erfunden ist. In generativer KI können Halluzinationen falsche Fakten, erfundene Quellen, falsche Zitate oder Schlussfolgerungen umfassen, die nicht auf verlässlichen Nachweisen beruhen.
Wie unterscheidet sich ein System-Prompt von einem Nutzer-Prompt?
Verwende einen System-Prompt für dauerhafte Anwendungsanweisungen und Einschränkungen; verwende einen Nutzer-Prompt für die unmittelbare Anfrage, den Kontext und das gewünschte Ergebnis des Nutzers.
Was ist Red Teaming für LLMs?
Red Teaming ist ein strukturierter adversarialer Testprozess, der dazu dient, Schwachstellen, unsicheres Verhalten oder schädliche Ausgaben in einem KI-System zu identifizieren. Dabei wird das System gezielt mit schwierigen, bösartigen oder Grenzfall-Eingaben geprüft, damit Entwickler Schutzmaßnahmen bewerten und verbessern können.
Experte
Was ist Data Poisoning in KI-Systemen?
Data Poisoning ist ein adversarialer Angriff, bei dem ein böswilliger Akteur in die Daten oder den Trainingsprozess eingreift, die zum Aufbau eines Modells verwendet werden. Durch Einfügen, Verändern oder Verfälschen von Trainingsbeispielen versucht der Angreifer, Modellverhalten zu manipulieren, Leistung zu verschlechtern oder gezielte Fehler zu erzeugen.
Was ist Inhaltsmoderation für KI-Ausgaben?
Inhaltsmoderation und Sicherheitsfilter sind Kontrollen, die darauf ausgelegt sind, schädliche, illegale oder durch Richtlinien untersagte Inhalte zu erkennen, zu blockieren, zu verringern oder zu eskalieren. In KI-Systemen werden sie häufig mit Richtlinienregeln, modellbasierten Klassifikatoren, Protokollierung und menschlicher Prüfung für Fälle mit höherem Risiko kombiniert.