Caesar AI Atlas
Hohe Priorität • Anfänger

Was sind personenbezogene Daten in KI?

Wonach Sie suchen

Der Nutzer möchte personenbezogene Daten im Kontext von Datenschutz in KI verstehen und auf praktische Arbeit in KI-Governance oder Compliance anwenden.

Kurze Antwort

Personenbezogene Daten sind Informationen, die sich nach Datenschutzrecht auf eine identifizierte oder identifizierbare natürliche Person beziehen. Im EU-Kontext ist die Bedeutung an Artikel 4 Absatz 1 der Verordnung (EU) 2016/679 und die dazugehörige rechtliche Auslegung geknüpft.

Was Sie lernen werden

  1. 1Direkte Abgrenzung
  2. 2Einfache Erklärung
  3. 3Technische oder rechtliche Grenze
  4. 4Compliance-Relevanz
  5. 5Häufige Fehler
  6. 6Verwandte Atlas-Begriffe

Ausführliche Antwort

Direkte Antwort

Personenbezogene Daten in KI sind Informationen, die sich auf eine identifizierte oder identifizierbare natürliche Person beziehen, wenn diese Informationen in einem KI-Kontext verwendet, erzeugt, abgeleitet, gespeichert oder anderweitig verarbeitet werden. Sie können in Trainingsdaten, Prompts, Embeddings, Protokollen, Modellausgaben, Nutzerprofilen, Evaluationen, Feedbackaufzeichnungen oder Monitoring-Daten auftreten. Im EU-Recht stammt das Kernkonzept aus Artikel 4 Absatz 1 DSGVO: Personenbezogene Daten sind alle Informationen, die sich auf eine identifizierte oder identifizierbare natürliche Person beziehen. KI hebt diesen Status nicht einfach dadurch auf, dass Daten transformiert, tokenisiert, eingebettet oder statistisch verwendet werden.

Einfach erklärt

Personenbezogene Daten sind nicht auf den Namen oder die Passnummer einer Person beschränkt. In KI-Systemen können dazu E-Mail-Texte, Chatprotokolle, Bilder, Stimme, Standortmuster, Mitarbeiterunterlagen, Kundensupport-Tickets, Verhaltenssignale, Gerätekennungen oder Modellausgaben gehören, die auf eine Person zurückverweisen. Selbst wenn das System die Daten als Trainingsmaterial oder Kontext verwendet, bleibt die Datenschutzfrage bestehen: Können die Informationen sich auf jemanden beziehen, der identifiziert oder identifizierbar ist?

Analogie

Personenbezogene Daten sind alle Informationen, die vernünftigerweise zu einer Person zurückführen können, selbst wenn sie in einem KI-Datensatz oder einer KI-Ausgabe erscheinen.

Warum es wichtig ist

Personenbezogene Daten sind in KI wichtig, weil KI-Systeme Informationen auf Arten sammeln, kombinieren, ableiten und reproduzieren können, die zum Zeitpunkt der Erhebung nicht offensichtlich sind. Trainingsdaten können personenbezogene Daten enthalten, die von Webseiten gescrapt, aus Dokumenten kopiert oder von Nutzern hochgeladen wurden. RAG-Systeme können personenbezogene Aufzeichnungen in Prompts abrufen. Chatbots können Gesprächsprotokolle speichern. Monitoring-Systeme können Verhaltensprofile erzeugen. Diese Aktivitäten können DSGVO-Pflichten zu Rechtsgrundlage, Transparenz, Zweckbindung, Datenminimierung, Speicherbegrenzung, Sicherheit, Betroffenenrechten und Datenschutz-Folgenabschätzungen auslösen.

Dringlichkeit

Die Datenschutzprüfung muss erfolgen, bevor KI-Daten aufgenommen, indexiert, feinabgestimmt, protokolliert oder über Modellausgaben offengelegt werden.

Wichtige Verpflichtungen

Eine praktische Datenschutzprüfung sollte erfassen, wo personenbezogene Daten in den KI-Lebenszyklus eintreten und wo sie ihn verlassen. Teams sollten identifizieren, ob personenbezogene Daten in Trainingsdaten, Validierungsdaten, Prompts, Embeddings, Protokollen, Ausgaben, Evaluationssets oder Nutzerfeedback vorkommen. Sie sollten Rechtsgrundlage, Zweck, Aufbewahrungsfrist, Zugriffskontrollen, Sicherheitsmaßnahmen, Verfahren für Betroffenenrechte und Lösch- oder Unterdrückungsmechanismen definieren. Bei risikoreicherer Verarbeitung kann eine Datenschutz-Folgenabschätzung erforderlich sein. Besondere Sorgfalt ist nötig, wenn KI sensible Merkmale ableitet, Daten von Kindern verarbeitet, biometrische Informationen nutzt oder Daten für einen anderen Kontext weiterverwendet, als für den sie ursprünglich erhoben wurden.

  • Schritt 1: Personenbezogene Daten über Training, Prompting, Retrieval, Protokollierung, Monitoring und Ausgaben hinweg kartieren.
  • Schritt 2: Rechtsgrundlage, Zweckbindung, Minimierung, Aufbewahrung, Zugriffskontrolle und Transparenzpflichten bestätigen.
  • Schritt 3: Testen, ob Ausgaben, Embeddings oder Protokolle personenbezogene Daten offenlegen, reproduzieren oder re-identifizieren können.

Häufige Fehler

Teams nehmen oft an, dass KI-Daten anonym sind, weil sie in einem Datensatz, einer Vektordatenbank, einem Tokenstrom oder einem Modellkontext gespeichert sind. Das ist riskant. Pseudonymisierte Daten können weiterhin personenbezogene Daten sein, wenn eine Re-Identifizierung vernünftigerweise möglich ist. Ein weiterer Fehler besteht darin, sich nur auf Trainingsdaten zu konzentrieren und Prompts, Protokolle, Embeddings, RAG-Dokumente, Evaluationsdatensätze und generierte Ausgaben zu ignorieren. Teams verwechseln außerdem nicht personenbezogene Daten mit Daten, denen lediglich offensichtliche Namen fehlen. In KI können Kombinationen von Signalen eine Person identifizierbar machen.

Fehler 1: Embeddings oder Modellprotokolle standardmäßig als nicht personenbezogen zu behandeln, ohne Identifizierbarkeit oder Zugriffsrisiko zu prüfen.

Fehler 2: Anzunehmen, dass öffentlich zugängliche Webdaten immer ohne Rechtsgrundlage, Transparenz- oder Zweckanalyse für KI-Training wiederverwendet werden können.

Related Atlas Content

Diese Seite sollte auf non-personal-data und training-data verlinken, weil viele Datenschutzfragen in KI von der Grenze zwischen personenbezogenen und nicht personenbezogenen Datensätzen abhängen. Der stärkste Vergleich ist personal-data-vs-non-personal-data. Der nächste Lernpfad sollte zu what-is-special-category-data-in-ai führen, weil Daten besonderer Kategorien eine engere und risikoreichere Untergruppe personenbezogener Daten sind.

Schlüsselbegriffe

Quellen

  • Caesar AI Atlas glossary