Caesar AI Atlas
Атаки и сбоиСредний

Prompt injection vs данные poisoning

Параллельное сравнение промпт injection и данные poisoning. Помогает понять, как во время выполнения instruction manipulation differs из атаки на обучающие данные или процесс обучения.

Краткий вердикт: Используйте промпт injection для вредоносный instructions processed посредством язык модель в во время выполнения; используйте данные poisoning для атаки что corrupt обучающие данные или процесс обучения.

Обзор терминов

Prompt injection

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

Ключевые характеристики
  • Manipulates язык модель через вредоносный или unintended instructions
  • Может быть placed в user вход, документирует, web pages, или другие processed контент
  • Может caиспользуйте instruction override, restricted information disclosure, altered выводы, или unauthorized действия
Обратите внимание
  • Indirect контент может carry instructions even когда user промпт looks вредless
  • Prompt контроли alone может быть insufficient когда модель может используйте инструменты или access данные

Контекст: Наиболее уместно для LLM-приложения что процесс недоверенный текст, retrieved документирует, web контент, илинструмент-related instructions.

VS
Data poisoning

Data Poisoning summarizes adversarial attack in which a malicious actor interferes with the data or training process used to build a model.

Ключевые характеристики
  • Interferes с данные или процесс обучения используется для build модель
  • Uses inserted, modified, или corrupted обучение примеры
  • Направлена на degrade производительность, manipulate поведение, или create targeted failures
Обратите внимание
  • Poisoning может быть difficult для detect после обучение если происхождение данных является слабый
  • Small targeted изменения может have serious эффекты в sensitive варианты использования

Контекст: Наиболее уместно когда assessing модель пайплайн обученияs, обучение-происхождение данных, dataset качество, и adversarial manipulation риски.

Ключевые отличия

АспектPrompt InjectionData Poisoning
Модель угрозPrompt injection targets модель's instruction-following поведение через контент it процессы.Data poisoning targets модель-building процесс посредством corrupting данные или обучение входные данные.
Путь атакиАтакаer размещает вредоносный или conflicting instructions в промпты, документирует, web pages, или другие во время выполнения контент.Атакаer inserts, modifies, или corrupts обучение примеры или interferes с процесс обучения.
ВоздействиеImpacts может включают ignoring prior instructions, leaking restricted information, changing выводы, или triggering unauthorized действия.Impacts может включают degraded производительность, manipulated поведение, или targeted модель failures.
КонтролиControls включают изоляция входов, иерархия инструкций, инструмент управление разрешениями, валидация вывода, фильтрация поиска, и логирование.Controls включают происхождение данных, валидация датасета, пайплайн обучения безопасность, обнаружение аномалий, и контрольled данные изменения.
Доказательства обнаруженияEvidence может включают логи промптов, извлечённый контент, трассы вызовов инструментов, нарушения политики, и результаты red-team.Evidence может включают различия датасета, происхождение данных записи, логи обучения, аномалии производительности, и валидация results.
ТаймингPrompt injection обычно appears во время выведение или application во время выполнения.Data poisoning обычно occurs до или во время обучение, although its эффекты может appear later в развёртывание.
Заметка Caesar AI

В practice, команды often defend промпты а ignoring происхождение данных, или secure datasets а allowing модели для процесс недоверенный документирует как instructions. Mature AI безопасность treats both как separate контроль families.

Заметки

Частые ошибки

1

Рассматривать промпт injection как обучение-данные problem.

2

Предполагать данные poisoning только affects модель accuracy и не targeted поведение.

3

Relying только на система промпты для stop injection атаки.

4

Skipping dataset provenance потому что модель appears для perform well в normal tests.

Когда использовать

prompt-injection

Используйте промпт injection когда язык модель является manipulated через instructions embedded в входные данные или внешний контент. term является особенно важный для LLM apps с поиск, browsing, document анализ, агенты, илинструмент использовать.

data-poisoning

Используйте данные poisoning когда атака concerns corrupted или manipulated данные используется для build модель. It belongs в dataset governance, модель обучение контроли, provenance checks, и adversarial ML риск анализ.

Примечание о соответствии

AI безопасность governance в рамках ISO/IEC 42001 и NIST AI RMF должна distinguish во время выполнения LLM атакиз обучение-данные атаки потому что доказательства, контроли, и владельцы differ. для высокорисковый AI-системы, EU AI Act also делает robust управление рисками техническая документация важный для безопасность-related риски.

Вопросы и ответы

Является промпт injection type данные poisoning?+

Нет. Prompt injection manipulates модель через контент processed в во время выполнения, а данные poisoning manipulates данные или процесс обучения используется для build модель.

Which угроза является более релевантный для RAG системы?+

Prompt injection является often центральный для RAG системы потому что retrieved документирует может contain вредоносный instructions. Data poisoning может also matter если поиск corpus или обучающие данные является corrupted.

What доказательства helps investigate these атаки?+

Prompt injection investigations rely на промпты, извлечённый контент, инструмент traces, и выводы. Data poisoning investigations rely более на dataset lineage, различия датасета, логи обучения, и валидация anomalies.

Недавно просмотренные

No recently viewed comparisons yet.