Начальный
Что такое LLM security?
LLM, или large language model, — это языковая модель с большим числом параметров, обученная на широких текстовых или мультимодальных данных для понимания и генерации языка.
Что такое prompt injection?
Prompt injection — это состязательный приём, при котором языковую модель заставляют следовать вредоносным или непредусмотренным инструкциям, помещённым во ввод пользователя, документы, веб-страницы или другой обрабатываемый контент.
Что такое jailbreak в LLM-системе?
Prompt injection или jailbreak означает состязательный ввод, предназначенный для обхода инструкций модели, safety-политик или операционных мер контроля. Меры снижения риска включают фильтрацию ввода, изоляцию retrieval-слоя, доступ инструментов по принципу минимальных привилегий, enforcement политик и многоуровневые guardrails.
Чем RAG отличается от fine-tuning?
Используйте RAG, когда модели нужна актуальная, основанная на источниках информация; используйте fine-tuning, когда модели нужно специализированное поведение, выполнение задач, адаптация к домену или стиль, усвоенный из данных.
Средний
Почему RAG может создавать риски для приватности и безопасности?
Retrieval Augmented Generation (RAG) — это метод, который сочетает генеративный AI с извлечением данных из внешних источников. Модель использует найденные документы, фрагменты или записи как контекст для формирования более актуальных, конкретных и проверяемых ответов.
Что такое guardrails в LLM-системе?
Guardrails — это технические, процедурные или политические меры контроля, предназначенные для удержания AI-систем в приемлемых границах. Они могут снижать такие риски, как вредные выходные данные, утечка данных, несанкционированный доступ, нарушения политики или небезопасное поведение.
Что такое grounding в генеративном AI?
Grounding — это процесс привязки выходных данных AI-модели к надежным и проверяемым источникам информации во время inference. В генеративном AI он помогает повысить фактическую надежность, предоставляя релевантный контекст без изменения базовых весов модели.
Что такое hallucination в AI-системе?
Hallucination — это сгенерированный AI результат, который выглядит правдоподобным или уверенным, но является ложным, неподтвержденным, вводящим в заблуждение или вымышленным. В генеративном AI hallucinations могут включать неверные факты, вымышленные источники, ложные цитаты или рассуждения, не основанные на надежных доказательствах.
Чем системный промпт отличается от пользовательского промпта?
Используйте системный промпт для устойчивых инструкций и ограничений приложения; используйте пользовательский промпт для текущего запроса пользователя, контекста и желаемого результата.
Что такое red teaming для LLM?
Red teaming — это структурированный процесс adversarial testing, используемый для выявления слабых мест, небезопасного поведения или вредных выходных данных в AI-системе. Он включает намеренное тестирование системы сложными, вредоносными или пограничными входными данными, чтобы разработчики могли оценить и улучшить защитные меры.
Продвинутый
Что такое data poisoning в AI-системах?
Data poisoning — это adversarial attack, при которой злоумышленник вмешивается в данные или процесс обучения, используемые для создания модели. Вставляя, изменяя или повреждая обучающие примеры, атакующий стремится манипулировать поведением модели, ухудшить ее производительность или создать целевые сбои.
Что такое модерация контента для AI-выводов?
Content moderation и safety filters — это controls, предназначенные для обнаружения, блокировки, снижения или эскалации вредного, незаконного или запрещенного политикой контента. В AI-системах они часто сочетаются с policy rules, model-based classifiers, логированием и human review для более рискованных случаев.