Хаб, сфокусированный на рисках и контролях вокруг больших языковых моделей, retrieval-систем, prompts, guardrails и выходных данных моделей.
34
Термины
9
Сравнения
8
Вопросы
Безопасность LLM охватывает способы, которыми приложения на языковых моделях могут быть атакованы, использованы неправильно или некорректно настроены. Она объединяет обычную application security с контролями prompts, retrieval governance, управлением доступом и оценкой output’ов.
Сбои LLM могут раскрыть конфиденциальные файлы, выдать небезопасные рекомендации, привести к утечке данных через prompts или подорвать доверие к автоматизированным workflows. Командам безопасности нужен словарь, который связывает поведение модели с практическими контролями.
Актуально для vendor due diligence, проверок secure deployment, доказательств AI audit, red-team программ и incident response для LLM-приложений.
Ключевые модельные и адаптационные концепции, которые формируют решения по безопасности и governance.
Риски безопасности, нацеленные на инструкции, данные, retrieval-контекст и поведение модели.
Контроли, используемые для снижения небезопасных outputs, измерения сбоев и обеспечения auditability систем.
Сравнение генерации с дополненным извлечением (RAG) и тонкой настройки. Помогает понять, когда следует извлекать внешний контекст во время выполнения, а когда — адаптировать предварительно обученную модель через дополнительное обучение.
Различайте промпт-инъекцию — перехват поведения модели через вредоносный ввод — и джейлбрейк — обход защитных ограничений для генерации запрещённого контента. Оба являются угрозами безопасности LLM, но различаются механизмом и целью.
Параллельное сравнение промпт injection и данные poisoning. Помогает понять, как во время выполнения instruction manipulation differs из атаки на обучающие данные или процесс обучения.
Сравнение guardrails и content moderation / safety filters. Разберите отличие broad AI system boundaries от specific controls для harmful or disallowed content.
Сравнение system prompt и user prompt. Разберите, чем application-level behavior instructions отличаются от immediate task or question supplied by user.
Параллельное сравнение Red teaming и AI-аудит. Помогает понять, чем отличаются термины, когда применяется каждый из них и что это различие означает для AI governance, проектирования систем или доказательств assurance.
Параллельное сравнение Безопасность на этапе проектирования и Ограничители. Помогает понять, how lifecycle security planning differs от конкретный контроли который keep AI системы сin acceptable boundaries.
Сравнение hallucination и confabulation. Разберите, как оба термина описывают plausible but unsupported or fabricated AI output, и почему hallucination часто используется как broader operational term.
Сравнение grounding и groundedness. Разберите отличие процесса связывания outputs с источниками от свойства output быть supported by evidence.
Retrieval Augmented Generation (RAG) — это метод, который сочетает генеративный AI с извлечением данных из внешних источников. Модель использует найденные документы, фрагменты или записи как контекст для формирования более актуальных, конкретных и проверяемых ответов.
Guardrails — это технические, процедурные или политические меры контроля, предназначенные для удержания AI-систем в приемлемых границах. Они могут снижать такие риски, как вредные выходные данные, утечка данных, несанкционированный доступ, нарушения политики или небезопасное поведение.
Grounding — это процесс привязки выходных данных AI-модели к надежным и проверяемым источникам информации во время inference. В генеративном AI он помогает повысить фактическую надежность, предоставляя релевантный контекст без изменения базовых весов модели.
Hallucination — это сгенерированный AI результат, который выглядит правдоподобным или уверенным, но является ложным, неподтвержденным, вводящим в заблуждение или вымышленным. В генеративном AI hallucinations могут включать неверные факты, вымышленные источники, ложные цитаты или рассуждения, не основанные на надежных доказательствах.
Используйте системный промпт для устойчивых инструкций и ограничений приложения; используйте пользовательский промпт для текущего запроса пользователя, контекста и желаемого результата.
Red teaming — это структурированный процесс adversarial testing, используемый для выявления слабых мест, небезопасного поведения или вредных выходных данных в AI-системе. Он включает намеренное тестирование системы сложными, вредоносными или пограничными входными данными, чтобы разработчики могли оценить и улучшить защитные меры.
Data poisoning — это adversarial attack, при которой злоумышленник вмешивается в данные или процесс обучения, используемые для создания модели. Вставляя, изменяя или повреждая обучающие примеры, атакующий стремится манипулировать поведением модели, ухудшить ее производительность или создать целевые сбои.
Content moderation и safety filters — это controls, предназначенные для обнаружения, блокировки, снижения или эскалации вредного, незаконного или запрещенного политикой контента. В AI-системах они часто сочетаются с policy rules, model-based classifiers, логированием и human review для более рискованных случаев.