Caesar AI Atlas
Attaque / DéfaillanceIntermédiaire

Injection de prompt vs empoisonnement des données

Comparaison côte à côte entre l’injection de prompt et l’empoisonnement des données. Comprendre comment la manipulation d’instructions à l’exécution diffère des attaques visant les données d’entraînement ou le processus d’entraînement.

Verdict rapide: Utilisez Injection de prompt pour des instructions malveillantes traitées par un modèle de langage à l’exécution ; utilisez Empoisonnement des données pour des attaques qui corrompent les données d’entraînement ou le processus d’entraînement.

En un coup d'œil

Injection de prompt

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

Caractéristiques clés
  • Manipule un modèle de langage au moyen d’instructions malveillantes ou non prévues
  • Peut être placée dans une entrée utilisateur, des documents, des pages web ou d’autres contenus traités
  • Peut provoquer une substitution d’instructions, la divulgation d’informations restreintes, des sorties modifiées ou des actions non autorisées
Points d'attention
  • Un contenu indirect peut contenir des instructions même lorsque le prompt utilisateur semble inoffensif
  • Les contrôles de prompt seuls peuvent être insuffisants lorsque le modèle peut utiliser des outils ou accéder à des données

Contexte : Le plus pertinent pour les applications LLM qui traitent du texte non fiable, des documents récupérés, du contenu web ou des instructions liées aux outils.

VS
Empoisonnement des données

Data Poisoning summarizes adversarial attack in which a malicious actor interferes with the data or training process used to build a model.

Caractéristiques clés
  • Interfère avec les données ou le processus d’entraînement utilisés pour construire un modèle
  • Utilise des exemples d’entraînement insérés, modifiés ou corrompus
  • Vise à dégrader la performance, manipuler le comportement ou créer des défaillances ciblées
Points d'attention
  • L’empoisonnement peut être difficile à détecter après l’entraînement si la lignée des données est faible
  • De petites modifications ciblées peuvent avoir des effets graves dans des cas d’utilisation sensibles

Contexte : Le plus pertinent lors de l’évaluation des pipelines d’entraînement, de la provenance des données d’entraînement, de la qualité des jeux de données et des risques de manipulation adversariale.

Différences clés

AspectPrompt InjectionData Poisoning
Modèle de menaceL’injection de prompt cible le comportement de suivi d’instructions du modèle au moyen du contenu qu’il traite.L’empoisonnement des données cible le processus de construction du modèle en corrompant les données ou les entrées d’entraînement.
Chemin d’attaqueL’attaquant place des instructions malveillantes ou conflictuelles dans des prompts, documents, pages web ou autres contenus d’exécution.L’attaquant insère, modifie ou corrompt des exemples d’entraînement ou interfère avec le processus d’entraînement.
ImpactLes impacts peuvent inclure l’ignorance d’instructions antérieures, la fuite d’informations restreintes, la modification des sorties ou le déclenchement d’actions non autorisées.Les impacts peuvent inclure une performance dégradée, un comportement manipulé ou des défaillances ciblées du modèle.
ContrôlesLes contrôles incluent l’isolation des entrées, la hiérarchie des instructions, la gestion des permissions d’outils, la validation des sorties, le filtrage de récupération et la journalisation.Les contrôles incluent la provenance des données, la validation des jeux de données, la sécurité du pipeline d’entraînement, la détection d’anomalies et les changements de données contrôlés.
Preuves de détectionLes preuves peuvent inclure les journaux de prompts, les contenus récupérés, les traces d’appels d’outils, les violations de politiques et les résultats de red team.Les preuves peuvent inclure les diffs de jeux de données, les dossiers de lignée des données, les journaux d’entraînement, les anomalies de performance et les résultats de validation.
MomentL’injection de prompt apparaît généralement pendant l’inférence ou l’exécution de l’application.L’empoisonnement des données se produit généralement avant ou pendant l’entraînement, même si ses effets peuvent apparaître plus tard en déploiement.
Note Caesar AI

En pratique, les équipes défendent souvent les prompts tout en ignorant la lignée des données, ou sécurisent les jeux de données tout en permettant aux modèles de traiter des documents non fiables comme des instructions. Une sécurité IA mature traite les deux comme des familles de contrôles distinctes.

Notes

Erreurs courantes

1

Traiter l’injection de prompt comme un problème de données d’entraînement.

2

Supposer que l’empoisonnement des données n’affecte que l’exactitude du modèle et non un comportement ciblé.

3

S’appuyer uniquement sur les prompts système pour arrêter les attaques par injection.

4

Omettre la provenance des jeux de données parce que le modèle semble bien fonctionner dans les tests normaux.

Quand utiliser

prompt-injection

Utilisez Injection de prompt lorsqu’un modèle de langage est manipulé au moyen d’instructions intégrées dans des entrées ou des contenus externes. Le terme est particulièrement important pour les applications LLM avec récupération, navigation, analyse de documents, agents ou utilisation d’outils.

data-poisoning

Utilisez Empoisonnement des données lorsque l’attaque concerne des données corrompues ou manipulées utilisées pour construire le modèle. Le terme relève de la gouvernance des jeux de données, des contrôles d’entraînement, des vérifications de provenance et de l’analyse des risques de ML adversarial.

Note de conformité

La gouvernance de la sécurité de l’IA selon l’ISO/IEC 42001 et le NIST AI RMF devrait distinguer les attaques LLM à l’exécution des attaques sur les données d’entraînement, car les preuves, les contrôles et les responsables diffèrent. Pour les systèmes d’IA à haut risque, l’EU AI Act rend également importante une gestion robuste des risques et une documentation technique pour les risques liés à la sécurité.

FAQ

L’injection de prompt est-elle un type d’empoisonnement des données ?+

Non. L’injection de prompt manipule le modèle par du contenu traité à l’exécution, tandis que l’empoisonnement des données manipule les données ou le processus d’entraînement utilisés pour construire le modèle.

Quelle menace est la plus pertinente pour les systèmes RAG ?+

L’injection de prompt est souvent centrale pour les systèmes RAG parce que les documents récupérés peuvent contenir des instructions malveillantes. L’empoisonnement des données peut aussi compter si le corpus de récupération ou les données d’entraînement sont corrompus.

Quelles preuves aident à enquêter sur ces attaques ?+

Les enquêtes sur l’injection de prompt reposent sur les prompts, les contenus récupérés, les traces d’outils et les sorties. Les enquêtes sur l’empoisonnement des données reposent davantage sur la lignée des jeux de données, les diffs de données, les journaux d’entraînement et les anomalies de validation.

Consultés récemment

No recently viewed comparisons yet.