Хаб по рискам и безопасности для понимания того, как системы ИИ отказывают, как возникают harms и как контроли снижают небезопасное поведение.
30
Термины
7
Сравнения
8
Вопросы
Безопасность и риски ИИ фокусируются на предотвращении, обнаружении и реагировании на сбои, которые могут причинить вред людям, организациям или общественному доверию. Тема охватывает техническую надёжность, организационные контроли, предсказуемое неправильное использование, monitoring и escalation инцидентов.
Safety failures часто проявляются после deployment, когда реальные пользователи, меняющиеся данные и неожиданные контексты выявляют слабые места, которые не были видны в benchmark.
Полезно для safety cases, AI risk assessments, incident playbooks, post-market monitoring, AI reviews в здравоохранении и публичном секторе, а также governance высокорисковых deployments.
Ключевые концепции для различения safety, ethics, risk, harm и проблем alignment.
Термины, описывающие, как системы деградируют, становятся ненадёжными или начинают вести себя иначе после deployment.
Методы, используемые для тестирования, мониторинга и реагирования на safety issues на протяжении жизненного цикла ИИ.
Сравнение AI safety и AI ethics. Разберите, как harm prevention practices связаны с более широкими вопросами human values, rights и responsible design.
Параллельное сравнение Риск и Вред. Оно объясняет, чем оценка вероятности и тяжести отличается от неблагоприятного воздействия на человека, группу, организацию или систему.
Сравнение дрейфа данных и дрейфа модели. Разберите, чем изменения распределения входных данных отличаются от изменений или деградации качества модели со временем.
Сравнение data drift и concept drift. Разберите, вызвана ли проблема модели изменением input distributions или изменением связи между inputs and outcomes.
Параллельное сравнение Дрейф модели и Дрейф концепта. Оно объясняет, чем деградация производительности со временем отличается от изменения статистической связи между входами и целевыми результатами.
Параллельное сравнение Safety Case и AI Risk Assessment. Объясняет, чем отличаются понятия, когда применяется каждый термин и почему различие важно для AI governance, оценки и проектирования систем.
Различайте промпт-инъекцию — перехват поведения модели через вредоносный ввод — и джейлбрейк — обход защитных ограничений для генерации запрещённого контента. Оба являются угрозами безопасности LLM, но различаются механизмом и целью.
Используйте data drift, когда меняется распределение входных данных; используйте concept drift, когда меняется связь между inputs и целевым outcome.
Alignment — это практика проектирования, обучения и управления AI-системой так, чтобы ее цели, outputs и поведение оставались согласованными с человеческими намерениями, ценностями и acceptable use constraints.
AI Incident — это событие или серия событий, при которых разработка, deployment, использование или malfunction AI-системы причиняет или может причинить вред. Такой вред может касаться safety, discrimination, privacy, legal compliance, critical infrastructure, property, communities или environment.
HITL, или human-in-the-loop, — это подход, при котором люди остаются вовлеченными в формирование, review, approval или улучшение outputs или decisions AI-системы. Он используется для сочетания machine efficiency с human judgment, особенно в higher-risk или context-sensitive tasks.
AI Toxicity — это harmful, offensive, false, biased или otherwise inappropriate output, созданный или усиленный AI-системой. Он может возникать из training data, system design, prompt context, misalignment или inadequate safeguards.
Post-market monitoring system состоит из действий провайдеров AI-систем по сбору и анализу опыта использования систем, размещенных на рынке или введенных в эксплуатацию. Его цель — определить, нужны ли corrective или preventive actions после deployment.
Anomaly detection — это процесс выявления observations, events или patterns, которые значительно отличаются от ожидаемого поведения. В AI и data analysis он используется для flagging outliers, которые могут указывать на errors, fraud, security incidents, system faults или другие unusual conditions.
Security by design — это подход, при котором security requirements и safeguards интегрируются с самого начала разработки системы. Для AI-систем он включает anticipation of misuse, protection of data and models и embedding access controls, monitoring и resilience на протяжении всего lifecycle.