Caesar AI Atlas
ИерархияСредний

Промпт-инъекция и джейлбрейк

Различайте промпт-инъекцию — перехват поведения модели через вредоносный ввод — и джейлбрейк — обход защитных ограничений для генерации запрещённого контента. Оба являются угрозами безопасности LLM, но различаются механизмом и целью.

Краткий вердикт: Промпт-инъекция перехватывает задачу модели; джейлбрейк обходит её правила безопасности. Инъекция — про контроль, джейлбрейк — про доступ.

Обзор терминов

Промпт-инъекция

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

VS
Джейлбрейк

Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.

Ключевые отличия

АспектPrompt InjectionJailbreak
ЦельПерехватить модель, чтобы она выполнила непредусмотренную задачу: эксфильтрацию данных или несанкционированные действия.Заставить модель сгенерировать контент, который она обучена отклонять: вредный, незаконный или ограниченный.
МеханизмПереопределяет системный промпт или внедряет инструкции через пользовательский ввод либо извлечённые данные.Эксплуатирует слабости в обучении безопасности через ролевые сценарии, трюки с кодированием или манипуляцию персоной.
Поверхность атакиЛюбой канал ввода: сообщения пользователей, выходы инструментов, извлечённые документы, API-вызовы.Преимущественно пользовательский разговорный интерфейс.
Намерение атакующегоКонтроль — заставить модель делать то, для чего она не была предназначена.Доступ — заставить модель сказать то, что она была настроена не говорить.
Снижение рискаСанитизация ввода, иерархия инструкций, токены-разделители, мониторинг вывода.Обучение безопасности (RLHF), constitutional AI, классификаторы контента, настройка отказов.
Заметка Caesar AI

Промпт-инъекция опаснее в производственных системах, особенно при агентном ИИ. Джейлбрейк создаёт вредный текст; промпт-инъекция может запускать несанкционированные действия в реальном мире через использование инструментов.

Заметки

Частые ошибки

1

Использовать «джейлбрейк» и «промпт-инъекция» как взаимозаменяемые термины — у них разные цели и механизмы.

2

Считать джейлбрейки безобидным развлечением — они могут извлекать обучающие данные или генерировать незаконный контент.

3

Игнорировать непрямую промпт-инъекцию через документы, извлечённые RAG.

4

Предполагать, что одного обучения безопасности достаточно для предотвращения промпт-инъекций — оно прежде всего адресует джейлбрейки.

Когда использовать

prompt-injection

Используйте «промпт-инъекция», когда обсуждаете атаки, которые манипулируют поведением модели для выполнения несанкционированных действий, особенно в агентных или использующих инструменты ИИ-системах.

prompt-injection-jailbreak

Используйте «джейлбрейк», когда обсуждаете попытки обойти фильтры безопасности контента и сгенерировать ограниченные выходы, особенно в чат-приложениях для потребителей.

Примечание о соответствии

Оба типа атак релевантны требованиям EU AI Act к устойчивости и кибербезопасности высокорисковых ИИ-систем. Системы должны демонстрировать сопротивляемость враждебным манипуляциям.

Вопросы и ответы

Является ли джейлбрейк типом промпт-инъекции?+

Может являться. Многие джейлбрейки используют техники промпт-инъекции, но не все промпт-инъекции являются джейлбрейками. Промпт-инъекция — более широкая категория атак.

Что опаснее в производственных системах?+

Промпт-инъекция — особенно непрямая инъекция в агентных системах, где модель может выполнять инструменты, обращаться к базам данных или отправлять сообщения от имени пользователей.

Связанные сравнения

Недавно просмотренные

No recently viewed comparisons yet.