Различайте промпт-инъекцию — перехват поведения модели через вредоносный ввод — и джейлбрейк — обход защитных ограничений для генерации запрещённого контента. Оба являются угрозами безопасности LLM, но различаются механизмом и целью.
Краткий вердикт: Промпт-инъекция перехватывает задачу модели; джейлбрейк обходит её правила безопасности. Инъекция — про контроль, джейлбрейк — про доступ.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.
| Аспект | Prompt Injection | Jailbreak |
|---|---|---|
| Цель | Перехватить модель, чтобы она выполнила непредусмотренную задачу: эксфильтрацию данных или несанкционированные действия. | Заставить модель сгенерировать контент, который она обучена отклонять: вредный, незаконный или ограниченный. |
| Механизм | Переопределяет системный промпт или внедряет инструкции через пользовательский ввод либо извлечённые данные. | Эксплуатирует слабости в обучении безопасности через ролевые сценарии, трюки с кодированием или манипуляцию персоной. |
| Поверхность атаки | Любой канал ввода: сообщения пользователей, выходы инструментов, извлечённые документы, API-вызовы. | Преимущественно пользовательский разговорный интерфейс. |
| Намерение атакующего | Контроль — заставить модель делать то, для чего она не была предназначена. | Доступ — заставить модель сказать то, что она была настроена не говорить. |
| Снижение риска | Санитизация ввода, иерархия инструкций, токены-разделители, мониторинг вывода. | Обучение безопасности (RLHF), constitutional AI, классификаторы контента, настройка отказов. |
Промпт-инъекция опаснее в производственных системах, особенно при агентном ИИ. Джейлбрейк создаёт вредный текст; промпт-инъекция может запускать несанкционированные действия в реальном мире через использование инструментов.
Использовать «джейлбрейк» и «промпт-инъекция» как взаимозаменяемые термины — у них разные цели и механизмы.
Считать джейлбрейки безобидным развлечением — они могут извлекать обучающие данные или генерировать незаконный контент.
Игнорировать непрямую промпт-инъекцию через документы, извлечённые RAG.
Предполагать, что одного обучения безопасности достаточно для предотвращения промпт-инъекций — оно прежде всего адресует джейлбрейки.
Используйте «промпт-инъекция», когда обсуждаете атаки, которые манипулируют поведением модели для выполнения несанкционированных действий, особенно в агентных или использующих инструменты ИИ-системах.
Используйте «джейлбрейк», когда обсуждаете попытки обойти фильтры безопасности контента и сгенерировать ограниченные выходы, особенно в чат-приложениях для потребителей.
Оба типа атак релевантны требованиям EU AI Act к устойчивости и кибербезопасности высокорисковых ИИ-систем. Системы должны демонстрировать сопротивляемость враждебным манипуляциям.
Может являться. Многие джейлбрейки используют техники промпт-инъекции, но не все промпт-инъекции являются джейлбрейками. Промпт-инъекция — более широкая категория атак.
Промпт-инъекция — особенно непрямая инъекция в агентных системах, где модель может выполнять инструменты, обращаться к базам данных или отправлять сообщения от имени пользователей.
No recently viewed comparisons yet.