Comparaison côte à côte entre l’injection de prompt et l’empoisonnement des données. Comprendre comment la manipulation d’instructions à l’exécution diffère des attaques visant les données d’entraînement ou le processus d’entraînement.
Verdict rapide: Utilisez Injection de prompt pour des instructions malveillantes traitées par un modèle de langage à l’exécution ; utilisez Empoisonnement des données pour des attaques qui corrompent les données d’entraînement ou le processus d’entraînement.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Contexte : Le plus pertinent pour les applications LLM qui traitent du texte non fiable, des documents récupérés, du contenu web ou des instructions liées aux outils.
Data Poisoning summarizes adversarial attack in which a malicious actor interferes with the data or training process used to build a model.
Contexte : Le plus pertinent lors de l’évaluation des pipelines d’entraînement, de la provenance des données d’entraînement, de la qualité des jeux de données et des risques de manipulation adversariale.
| Aspect | Prompt Injection | Data Poisoning |
|---|---|---|
| Modèle de menace | L’injection de prompt cible le comportement de suivi d’instructions du modèle au moyen du contenu qu’il traite. | L’empoisonnement des données cible le processus de construction du modèle en corrompant les données ou les entrées d’entraînement. |
| Chemin d’attaque | L’attaquant place des instructions malveillantes ou conflictuelles dans des prompts, documents, pages web ou autres contenus d’exécution. | L’attaquant insère, modifie ou corrompt des exemples d’entraînement ou interfère avec le processus d’entraînement. |
| Impact | Les impacts peuvent inclure l’ignorance d’instructions antérieures, la fuite d’informations restreintes, la modification des sorties ou le déclenchement d’actions non autorisées. | Les impacts peuvent inclure une performance dégradée, un comportement manipulé ou des défaillances ciblées du modèle. |
| Contrôles | Les contrôles incluent l’isolation des entrées, la hiérarchie des instructions, la gestion des permissions d’outils, la validation des sorties, le filtrage de récupération et la journalisation. | Les contrôles incluent la provenance des données, la validation des jeux de données, la sécurité du pipeline d’entraînement, la détection d’anomalies et les changements de données contrôlés. |
| Preuves de détection | Les preuves peuvent inclure les journaux de prompts, les contenus récupérés, les traces d’appels d’outils, les violations de politiques et les résultats de red team. | Les preuves peuvent inclure les diffs de jeux de données, les dossiers de lignée des données, les journaux d’entraînement, les anomalies de performance et les résultats de validation. |
| Moment | L’injection de prompt apparaît généralement pendant l’inférence ou l’exécution de l’application. | L’empoisonnement des données se produit généralement avant ou pendant l’entraînement, même si ses effets peuvent apparaître plus tard en déploiement. |
En pratique, les équipes défendent souvent les prompts tout en ignorant la lignée des données, ou sécurisent les jeux de données tout en permettant aux modèles de traiter des documents non fiables comme des instructions. Une sécurité IA mature traite les deux comme des familles de contrôles distinctes.
Traiter l’injection de prompt comme un problème de données d’entraînement.
Supposer que l’empoisonnement des données n’affecte que l’exactitude du modèle et non un comportement ciblé.
S’appuyer uniquement sur les prompts système pour arrêter les attaques par injection.
Omettre la provenance des jeux de données parce que le modèle semble bien fonctionner dans les tests normaux.
Utilisez Injection de prompt lorsqu’un modèle de langage est manipulé au moyen d’instructions intégrées dans des entrées ou des contenus externes. Le terme est particulièrement important pour les applications LLM avec récupération, navigation, analyse de documents, agents ou utilisation d’outils.
Utilisez Empoisonnement des données lorsque l’attaque concerne des données corrompues ou manipulées utilisées pour construire le modèle. Le terme relève de la gouvernance des jeux de données, des contrôles d’entraînement, des vérifications de provenance et de l’analyse des risques de ML adversarial.
La gouvernance de la sécurité de l’IA selon l’ISO/IEC 42001 et le NIST AI RMF devrait distinguer les attaques LLM à l’exécution des attaques sur les données d’entraînement, car les preuves, les contrôles et les responsables diffèrent. Pour les systèmes d’IA à haut risque, l’EU AI Act rend également importante une gestion robuste des risques et une documentation technique pour les risques liés à la sécurité.
Non. L’injection de prompt manipule le modèle par du contenu traité à l’exécution, tandis que l’empoisonnement des données manipule les données ou le processus d’entraînement utilisés pour construire le modèle.
L’injection de prompt est souvent centrale pour les systèmes RAG parce que les documents récupérés peuvent contenir des instructions malveillantes. L’empoisonnement des données peut aussi compter si le corpus de récupération ou les données d’entraînement sont corrompus.
Les enquêtes sur l’injection de prompt reposent sur les prompts, les contenus récupérés, les traces d’outils et les sorties. Les enquêtes sur l’empoisonnement des données reposent davantage sur la lignée des jeux de données, les diffs de données, les journaux d’entraînement et les anomalies de validation.
No recently viewed comparisons yet.