Privacy и data governance хаб для понимания того, как системы ИИ используют, преобразуют, защищают и раскрывают данные.
25
Термины
9
Сравнения
8
Вопросы
Защита данных в ИИ фокусируется на том, какие данные входят в систему, как они преобразуются, остаются ли люди идентифицируемыми и какие контроли защищают данные на протяжении всего жизненного цикла. Эта тема соединяет privacy law, data engineering, обучение моделей и надзор за поставщиками.
Системы ИИ могут создавать privacy risk даже тогда, когда output выглядит безвредным, потому что training data, prompts, logs, embeddings и retrieved documents могут раскрывать чувствительную информацию.
Полезно для GDPR-анализа, data governance reviews по Регламенту об ИИ, DPIA или PIA, vendor assessments, governance источников RAG и incident response.
Категории данных, которые определяют privacy-обязанности и усиленные safeguards в системах ИИ.
Техники и governance-концепции, используемые для снижения идентифицируемости и риска раскрытия.
Контроли для понимания того, откуда пришли данные, как они используются и где они хранятся.
Сравнение персональных и неперсональных данных. Помогает понять, как идентифицируемость меняет анализ приватности, законное использование и контроли управления ИИ.
Сравнение персональных данных и специальных категорий персональных данных. Помогает понять, почему все данные специальных категорий являются персональными данными, но не все персональные данные получают одинаково усиленную защиту.
Сравнение анонимизации / деидентификации и псевдонимизации. Помогает понять разницу между снижением идентифицируемости и заменой идентификаторов при сохранении возможности повторной идентификации через отдельную информацию.
Сравнение биометрических данных и специальных категорий персональных данных. Помогает понять, как биометрические идентификаторы соотносятся с более широким набором чувствительных персональных данных, защищаемых в анализе приватности ЕС.
Параллельное сравнение анонимизация данных и differential приватность. Помогает понять, как reducing идентифицируемость в данные differs из limiting что может быть inferred из computation или модель выводы.
Сравнение синтетических данных и персональных данных. Разберите, чем искусственно сгенерированные данные отличаются от информации, относящейся к идентифицированному или идентифицируемому лицу.
Сравнение GDPR и EU AI Act. Разберите, чем обязанности защиты персональных данных отличаются от risk-based обязанностей для AI-систем и general-purpose AI models.
Параллельное сравнение Production Data и Training Data. Объясняет, чем отличаются понятия, когда применяется каждый термин и почему различие важно для AI governance, оценки и проектирования систем.
Параллельное сравнение Data Provenance и Data Source Register. Объясняет, чем отличаются понятия, когда применяется каждый термин и почему различие важно для AI governance, оценки и проектирования систем.
Используйте anonymisation / de-identification, когда речь идет о сниженной или удаленной идентифицируемости; используйте pseudonymisation, когда персональные данные все еще могут быть отнесены к человеку с помощью защищенной дополнительной информации.
Используйте data anonymisation, когда изменяете данные для снижения идентифицируемости; используйте differential privacy, когда ограничиваете выводы об отдельных людях из outputs через privacy framework.
Synthetic data — это искусственно сгенерированные данные, созданные так, чтобы напоминать выбранные patterns, structures или statistical properties реальных данных.
Data provenance — это записанная история данных, включая их происхождение, создание, преобразования, перемещения и изменения во времени. В AI governance provenance помогает проверять lineage датасетов, оценивать надежность, поддерживать audits и понимать, как были произведены digital content или model inputs.
Data residency и sovereignty касаются того, где данные хранятся, обрабатываются и регулируются, а также какие правовые режимы к ним применяются. Для регулируемого использования AI эти понятия влияют на выбор cloud region, cross-border transfers, contractual controls и соблюдение отраслевых или национальных требований.
Используйте GDPR, когда вопрос касается обработки personal data; используйте EU AI Act, когда вопрос касается risk category AI-системы, safety, transparency, governance или conformity obligations.
Training data — это dataset, используемый для обучения или настройки machine learning модели путем изменения ее обучаемых параметров. Его качество, объем, разнообразие, разметка и provenance сильно влияют на performance, reliability и compliance posture итоговой модели.
Data encryption — это преобразование читаемых данных в закодированную форму, непонятную без авторизованного ключа или процесса decryption. Она используется для защиты sensitive information от несанкционированного доступа при хранении, передаче или обработке.