Пользователь хочет понять Personal Data в контексте Data Privacy in AI и применить это к практической работе по управлению ИИ или compliance.
Персональные данные — это информация, относящаяся к идентифицированному или идентифицируемому физическому лицу по праву защиты данных. В контексте ЕС значение связано со статьёй 4(1) Регламента (EU) 2016/679 и соответствующим правовым толкованием.
Персональные данные в ИИ — это информация, относящаяся к идентифицированному или идентифицируемому физическому лицу, когда такая информация используется, генерируется, выводится, хранится или иным образом обрабатывается в AI-контексте. Она может появляться в training data, prompts, embeddings, logs, model outputs, user profiles, evaluation records, feedback records или monitoring data. В праве ЕС базовая концепция содержится в статье 4(1) GDPR: персональные данные — это любая информация, относящаяся к идентифицированному или идентифицируемому физическому лицу. ИИ не снимает этот статус просто потому, что данные были преобразованы, токенизированы, embedded или использованы статистически.
Персональные данные не ограничиваются именем человека или номером паспорта. В ИИ-системах это могут быть тексты email, chat logs, изображения, голос, паттерны локации, employee records, customer support tickets, behavioral signals, device identifiers или model outputs, которые указывают на конкретного человека. Даже если система использует данные как training material или context, privacy-вопрос остаётся тем же: может ли информация относиться к человеку, который идентифицирован или идентифицируем?
Аналогия
Персональные данные — это любая информация, которую разумно связать с человеком, даже если она находится внутри AI-датасета или вывода модели.
Персональные данные важны в ИИ, потому что AI-системы могут собирать, объединять, выводить и воспроизводить информацию способами, которые не очевидны в момент сбора. Training data может содержать персональные данные, scraped с веб-сайтов, скопированные из документов или загруженные пользователями. RAG-системы могут извлекать персональные записи в prompts. Чат-боты могут хранить conversation logs. Monitoring systems могут создавать behavioral profiles. Эти активности могут запускать обязанности GDPR по legal basis, transparency, purpose limitation, minimization, retention, security, data subject rights и data protection impact assessments.
Срочность
Privacy review должен проводиться до того, как AI-данные будут ingest, indexed, fine-tuned, logged или раскрыты через outputs модели.
Практический privacy review должен картировать, где персональные данные входят в AI lifecycle и где выходят из него. Команды должны определить, появляются ли персональные данные в training data, validation data, prompts, embeddings, logs, outputs, evaluation sets или user feedback. Они должны определить legal basis, purpose, retention period, access controls, security measures, процесс data subject rights и механизмы deletion или suppression. Для более рискованной обработки может потребоваться data protection impact assessment. Особая осторожность нужна, когда ИИ выводит sensitive attributes, обрабатывает данные детей, использует biometric information или переиспользует данные, изначально собранные для другого контекста.
Команды часто считают, что AI-данные анонимны, потому что они хранятся в dataset, vector database, token stream или model context. Это небезопасно. Псевдонимизированные данные всё ещё могут быть персональными данными, если re-identification разумно возможна. Другая ошибка — фокусироваться только на training data и игнорировать prompts, logs, embeddings, RAG documents, evaluation datasets и generated outputs. Команды также путают non-personal data с данными, в которых просто нет очевидных имён. В ИИ сочетания сигналов могут сделать человека идентифицируемым.
Ошибка 1: Считать embeddings или model logs неперсональными по умолчанию без проверки идентифицируемости или access risk.
Ошибка 2: Предполагать, что публичные web data всегда можно повторно использовать для AI training без анализа legal basis, transparency или purpose.
Эта страница должна ссылаться на non-personal-data и training-data, потому что многие AI privacy вопросы зависят от границы между personal и non-personal datasets. Самое сильное сравнение — personal-data-vs-non-personal-data. Следующий маршрут обучения должен вести к what-is-special-category-data-in-ai, потому что special-category data — более узкое и высокорисковое подмножество personal data.