El usuario quiere comprender los datos personales en el contexto de la privacidad de datos en IA y aplicarlos a trabajos prácticos de gobernanza o cumplimiento de IA.
Los datos personales son información relativa a una persona física identificada o identificable conforme al derecho de protección de datos. En contextos de la UE, su significado está vinculado al artículo 4(1) del Reglamento (UE) 2016/679 y a la interpretación jurídica relacionada.
Los datos personales en IA son información relativa a una persona física identificada o identificable cuando esa información se utiliza, genera, infiere, almacena o procesa de otro modo en un contexto de IA. Pueden aparecer en datos de entrenamiento, prompts, embeddings, registros, salidas del modelo, perfiles de usuario, evaluaciones, registros de feedback o datos de monitoreo. En el derecho de la UE, el concepto central proviene del artículo 4(1) del RGPD: los datos personales son cualquier información relativa a una persona física identificada o identificable. La IA no elimina esa condición simplemente porque los datos se transformen, tokenicen, inserten en embeddings o se usen estadísticamente.
Los datos personales no se limitan al nombre o número de pasaporte de una persona. En sistemas de IA, pueden incluir texto de correos electrónicos, registros de chat, imágenes, voz, patrones de ubicación, expedientes de empleados, tickets de atención al cliente, señales de comportamiento, identificadores de dispositivos o salidas del modelo que remitan a una persona. Incluso si el sistema usa los datos como material de entrenamiento o contexto, la pregunta de privacidad sigue siendo: ¿puede la información relacionarse con alguien identificado o identificable?
Analogía
Los datos personales son cualquier información que pueda conectarse razonablemente con una persona, incluso si aparece dentro de un conjunto de datos o salida de IA.
Los datos personales importan en IA porque los sistemas de IA pueden recopilar, combinar, inferir y reproducir información de maneras que no son obvias en el momento de la recogida. Los datos de entrenamiento pueden contener datos personales extraídos de sitios web, copiados de documentos o subidos por usuarios. Los sistemas RAG pueden recuperar registros personales dentro de prompts. Los chatbots pueden almacenar registros de conversación. Los sistemas de monitoreo pueden crear perfiles de comportamiento. Estas actividades pueden activar deberes del RGPD en torno a base jurídica, transparencia, limitación de finalidad, minimización, conservación, seguridad, derechos de los interesados y evaluaciones de impacto en protección de datos.
Urgencia
La revisión de privacidad debe realizarse antes de que los datos de IA se ingieran, indexen, usen para fine-tuning, registren o expongan mediante salidas del modelo.
Una revisión práctica de privacidad debe mapear dónde entran y salen los datos personales a lo largo del ciclo de vida de la IA. Los equipos deben identificar si aparecen datos personales en datos de entrenamiento, datos de validación, prompts, embeddings, registros, salidas, conjuntos de evaluación o feedback de usuarios. Deben definir base jurídica, finalidad, periodo de conservación, controles de acceso, medidas de seguridad, proceso de derechos de los interesados y mecanismos de eliminación o supresión. Para tratamientos de mayor riesgo, puede requerirse una evaluación de impacto en protección de datos. Se necesita especial cuidado cuando la IA infiere atributos sensibles, procesa datos de menores, utiliza información biométrica o reutiliza datos originalmente recogidos para otro contexto.
Los equipos suelen asumir que los datos de IA son anónimos porque se almacenan en un conjunto de datos, base de datos vectorial, flujo de tokens o contexto del modelo. Eso no es seguro. Los datos seudonimizados aún pueden ser datos personales si la reidentificación es razonablemente posible. Otro error es centrarse solo en los datos de entrenamiento e ignorar prompts, registros, embeddings, documentos RAG, conjuntos de evaluación y salidas generadas. Los equipos también pueden confundir datos no personales con datos que simplemente no tienen nombres evidentes. En IA, las combinaciones de señales pueden hacer que una persona sea identificable.
Error 1: Tratar embeddings o registros de modelo como no personales por defecto sin probar la identificabilidad o el riesgo de acceso.
Error 2: Suponer que los datos web públicos siempre pueden reutilizarse para entrenamiento de IA sin base jurídica, transparencia o análisis de finalidad.
Esta página debería enlazar con non-personal-data y training-data, porque muchas preguntas de privacidad en IA dependen del límite entre conjuntos de datos personales y no personales. La comparación más sólida es personal-data-vs-non-personal-data. La siguiente ruta de aprendizaje debería llevar a what-is-special-category-data-in-ai, porque los datos de categorías especiales son un subconjunto más estrecho y de mayor riesgo de los datos personales.