Caesar AI Atlas

Безопасность LLM

Хаб, сфокусированный на рисках и контролях вокруг больших языковых моделей, retrieval-систем, prompts, guardrails и выходных данных моделей.

security teamsdevelopersAI governance leadslegal and compliance teams

34

Термины

9

Сравнения

8

Вопросы

О разделе

Обзор

Безопасность LLM охватывает способы, которыми приложения на языковых моделях могут быть атакованы, использованы неправильно или некорректно настроены. Она объединяет обычную application security с контролями prompts, retrieval governance, управлением доступом и оценкой output’ов.

Почему это важно

Сбои LLM могут раскрыть конфиденциальные файлы, выдать небезопасные рекомендации, привести к утечке данных через prompts или подорвать доверие к автоматизированным workflows. Командам безопасности нужен словарь, который связывает поведение модели с практическими контролями.

Контекст соответствия

Актуально для vendor due diligence, проверок secure deployment, доказательств AI audit, red-team программ и incident response для LLM-приложений.

Ключевые выводы

  • 1Prompt injection — это не то же самое, что jailbreak.
  • 2RAG улучшает grounding только тогда, когда retrieval и управление доступом находятся под governance.
  • 3Guardrails полезны, но не заменяют secure design.
  • 4Security review должен охватывать prompts, tools, retrieval-источники, logs и human escalation.

Ключевые термины

Связанные сравнения

Техническая альтернатива

RAG и тонкая настройка

Сравнение генерации с дополненным извлечением (RAG) и тонкой настройки. Помогает понять, когда следует извлекать внешний контекст во время выполнения, а когда — адаптировать предварительно обученную модель через дополнительное обучение.

Иерархия

Промпт-инъекция и джейлбрейк

Различайте промпт-инъекцию — перехват поведения модели через вредоносный ввод — и джейлбрейк — обход защитных ограничений для генерации запрещённого контента. Оба являются угрозами безопасности LLM, но различаются механизмом и целью.

Атаки и сбои

Prompt injection vs данные poisoning

Параллельное сравнение промпт injection и данные poisoning. Помогает понять, как во время выполнения instruction manipulation differs из атаки на обучающие данные или процесс обучения.

Риск и контроль

Guardrails vs content moderation / safety filters

Сравнение guardrails и content moderation / safety filters. Разберите отличие broad AI system boundaries от specific controls для harmful or disallowed content.

Архитектура

System prompt vs user prompt

Сравнение system prompt и user prompt. Разберите, чем application-level behavior instructions отличаются от immediate task or question supplied by user.

Управление

Red teaming vs AI-аудит

Параллельное сравнение Red teaming и AI-аудит. Помогает понять, чем отличаются термины, когда применяется каждый из них и что это различие означает для AI governance, проектирования систем или доказательств assurance.

Риск и контроль

Безопасность на этапе проектирования vs Ограничители

Параллельное сравнение Безопасность на этапе проектирования и Ограничители. Помогает понять, how lifecycle security planning differs от конкретный контроли который keep AI системы сin acceptable boundaries.

Часто путают

Галлюцинация vs конфабуляция

Сравнение hallucination и confabulation. Разберите, как оба термина описывают plausible but unsupported or fabricated AI output, и почему hallucination часто используется как broader operational term.

Часто путают

Grounding vs groundedness

Сравнение grounding и groundedness. Разберите отличие процесса связывания outputs с источниками от свойства output быть supported by evidence.

Популярные вопросы

Почему RAG может создавать риски для приватности и безопасности?

Retrieval Augmented Generation (RAG) — это метод, который сочетает генеративный AI с извлечением данных из внешних источников. Модель использует найденные документы, фрагменты или записи как контекст для формирования более актуальных, конкретных и проверяемых ответов.

Связанных терминов: 1intermediate

Что такое guardrails в LLM-системе?

Guardrails — это технические, процедурные или политические меры контроля, предназначенные для удержания AI-систем в приемлемых границах. Они могут снижать такие риски, как вредные выходные данные, утечка данных, несанкционированный доступ, нарушения политики или небезопасное поведение.

Связанных терминов: 1intermediate

Что такое grounding в генеративном AI?

Grounding — это процесс привязки выходных данных AI-модели к надежным и проверяемым источникам информации во время inference. В генеративном AI он помогает повысить фактическую надежность, предоставляя релевантный контекст без изменения базовых весов модели.

Связанных терминов: 1intermediate

Что такое hallucination в AI-системе?

Hallucination — это сгенерированный AI результат, который выглядит правдоподобным или уверенным, но является ложным, неподтвержденным, вводящим в заблуждение или вымышленным. В генеративном AI hallucinations могут включать неверные факты, вымышленные источники, ложные цитаты или рассуждения, не основанные на надежных доказательствах.

Связанных терминов: 1intermediate

Чем системный промпт отличается от пользовательского промпта?

Используйте системный промпт для устойчивых инструкций и ограничений приложения; используйте пользовательский промпт для текущего запроса пользователя, контекста и желаемого результата.

Связанных терминов: 1intermediate

Что такое red teaming для LLM?

Red teaming — это структурированный процесс adversarial testing, используемый для выявления слабых мест, небезопасного поведения или вредных выходных данных в AI-системе. Он включает намеренное тестирование системы сложными, вредоносными или пограничными входными данными, чтобы разработчики могли оценить и улучшить защитные меры.

Связанных терминов: 1intermediate

Что такое data poisoning в AI-системах?

Data poisoning — это adversarial attack, при которой злоумышленник вмешивается в данные или процесс обучения, используемые для создания модели. Вставляя, изменяя или повреждая обучающие примеры, атакующий стремится манипулировать поведением модели, ухудшить ее производительность или создать целевые сбои.

Связанных терминов: 1advanced

Что такое модерация контента для AI-выводов?

Content moderation и safety filters — это controls, предназначенные для обнаружения, блокировки, снижения или эскалации вредного, незаконного или запрещенного политикой контента. В AI-системах они часто сочетаются с policy rules, model-based classifiers, логированием и human review для более рискованных случаев.

Связанных терминов: 1advanced