Caesar AI Atlas
Haute prioritéDébutant

Qu’est-ce qu’une donnée de catégorie particulière en IA ?

Ce que vous cherchez

L’utilisateur veut comprendre les catégories particulières de données personnelles dans le contexte de la confidentialité des données en IA et l’appliquer à un travail pratique de gouvernance ou de conformité IA.

Réponse rapide

Les catégories particulières de données personnelles sont des types très sensibles de données personnelles identifiés par le droit européen de la protection des données.

Ce que vous apprendrez

  1. 1Distinction directe
  2. 2Explication en langage clair
  3. 3Frontière technique ou juridique
  4. 4Pertinence pour la conformité
  5. 5Erreurs fréquentes
  6. 6Termes Atlas associés

Réponse détaillée

Réponse directe

Les données de catégorie particulière en IA désignent les catégories sensibles de données personnelles bénéficiant d’une protection renforcée au titre du droit européen de la protection des données lorsqu’elles apparaissent dans des jeux de données IA, prompts, journaux, sorties ou profils inférés. En vertu de l’article 9 du RGPD, cela inclut les données révélant l’origine raciale ou ethnique, les opinions politiques, les convictions religieuses ou philosophiques, l’appartenance syndicale, les données génétiques, les données biométriques utilisées aux fins d’identification unique, les données de santé et les données concernant la vie sexuelle ou l’orientation sexuelle d’une personne. En IA, la catégorie peut résulter à la fois de données collectées et d’inférences du modèle.

En termes simples

Les données de catégorie particulière sont des données personnelles susceptibles de causer un préjudice particulièrement grave en cas de mésusage. Un système d’IA qui traite des questions ordinaires de clients pose un type de problème de confidentialité. Un système d’IA qui traite des symptômes de santé, identifiants biométriques, opinions politiques, appartenance syndicale ou orientation sexuelle inférée pose un problème beaucoup plus sensible. Le seuil juridique ne dépend pas seulement du fait que le système stocke une étiquette ; il peut aussi dépendre du fait qu’il révèle ou infère des caractéristiques protégées.

Analogie

Une couche de données personnelles à haute sensibilité qui exige une justification, des contrôles et une revue plus stricts.

Pourquoi c'est important

Les données de catégorie particulière sont importantes parce que de nombreux systèmes d’IA peuvent exposer ou inférer des attributs sensibles involontairement. Un modèle de recrutement peut inférer des informations liées au handicap à partir d’un parcours professionnel. Un système de recommandation de contenus peut inférer des intérêts politiques ou religieux. Un système de reconnaissance faciale ou d’identification vocale peut traiter des données biométriques. Un assistant de santé peut traiter des symptômes, diagnostics ou antécédents médicaux. Ces usages peuvent accroître les risques de discrimination, surveillance, exclusion, effets dissuasifs et traitement illicite. Les équipes conformité doivent traiter les données de catégorie particulière comme un signal d’alerte pour la base juridique, la nécessité, la proportionnalité, la transparence, la sécurité, les tests de biais et la supervision humaine.

Urgence

Les données sensibles doivent être identifiées avant le début de l’entraînement du modèle, de l’indexation RAG, du fine-tuning, des analyses ou de la journalisation en production.

Obligations clés

Une revue doit d’abord confirmer si les données sont personnelles, puis si elles relèvent d’une catégorie particulière, et enfin si une exception ou condition valide autorise le traitement. L’équipe doit documenter la finalité, la nécessité, la proportionnalité, la minimisation, les contrôles d’accès, la conservation, la sécurité, la transparence utilisateur et les droits des personnes concernées. Pour les systèmes d’IA, la revue doit aussi examiner si les attributs sensibles sont collectés directement, dérivés de variables proxy, inférés par le modèle ou exposés dans les sorties. Si des contextes biométriques, de santé, d’emploi, d’éducation, de crédit, d’application de la loi ou de services publics sont concernés, le système peut nécessiter une revue renforcée au titre de plusieurs cadres.

  • Étape 1 : Identifier si des données de catégorie particulière sont collectées, inférées, récupérées, journalisées ou générées.
  • Étape 2 : Confirmer une condition licite de traitement et documenter la nécessité, la proportionnalité, la minimisation et les garanties.
  • Étape 3 : Tester les variables proxy, les résultats biaisés, les inférences sensibles et les fuites dans les sorties.

Erreurs courantes

La plus grande erreur consiste à considérer les données de catégorie particulière comme pertinentes uniquement lorsqu’une base de données contient un champ explicite comme religion, diagnostic ou origine ethnique. Les systèmes d’IA peuvent inférer des caractéristiques sensibles à partir du langage, des images, du comportement, de la localisation, des achats ou du contexte social. Une autre erreur consiste à supposer que le consentement suffit toujours. Le consentement doit répondre à des exigences strictes et peut être inadapté dans l’emploi, le secteur public ou les relations déséquilibrées. Les équipes négligent aussi les sorties de modèle : un système peut générer ou révéler des données sensibles même si l’entrée d’origine ne les étiquetait pas clairement.

Erreur 1 : Ignorer les variables proxy qui permettent à un modèle d’inférer des caractéristiques protégées.

Erreur 2 : Traiter les gabarits biométriques, prompts liés à la santé ou journaux de chat sensibles comme de simples analytics produit.

Related Atlas Content

Cette page doit se connecter à personal-data et biometric-data, car les données de catégorie particulière sont un sous-ensemble protégé des données personnelles et le traitement biométrique est un déclencheur fréquent de gouvernance IA. Les comparaisons les plus fortes sont personal-data-vs-special-categories-of-personal-data et biometric-data-vs-special-categories-of-personal-data. Les questions associées doivent inclure what-is-personal-data-in-ai et is-biometric-data-personal-data.

Termes clés

Sources

  • Caesar AI Atlas glossary