Distinguer l’injection de prompt, qui détourne le comportement du modèle au moyen d’une entrée malveillante, du jailbreak, qui contourne les garde-fous de sécurité pour produire du contenu restreint. Les deux sont des menaces de sécurité pour les LLM, mais diffèrent par leur mécanisme et leur objectif.
Verdict rapide: L’injection de prompt détourne la tâche du modèle ; le jailbreak contourne ses règles de sécurité. L’injection concerne le contrôle, le jailbreak concerne l’accès.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.
| Aspect | Prompt Injection | Jailbreak |
|---|---|---|
| Objectif | Détourner le modèle pour lui faire accomplir une tâche non prévue, comme l’exfiltration de données ou des actions non autorisées. | Faire produire au modèle du contenu qu’il a été entraîné à refuser, par exemple du contenu nuisible, illégal ou restreint. |
| Mécanisme | Remplace le prompt système ou injecte des instructions par l’entrée utilisateur ou les données récupérées. | Exploite les faiblesses de l’entraînement de sécurité au moyen de jeux de rôle, d’astuces d’encodage ou de manipulation de persona. |
| Surface d’attaque | Tout canal d’entrée : messages utilisateur, sorties d’outils, documents récupérés, appels d’API. | Principalement l’interface conversationnelle destinée aux utilisateurs. |
| Intention de l’attaquant | Contrôle — faire faire au modèle quelque chose pour lequel il n’a pas été conçu. | Accès — faire dire au modèle quelque chose qu’il a été conçu pour ne pas dire. |
| Atténuation | Nettoyage des entrées, hiérarchie des instructions, jetons délimiteurs, surveillance des sorties. | Entraînement de sécurité (RLHF), IA constitutionnelle, classificateurs de contenu, réglage des refus. |
L’injection de prompt est la plus dangereuse des deux dans les systèmes de production, surtout avec l’IA agentique. Un jailbreak produit du texte nuisible ; une injection de prompt peut déclencher des actions réelles non autorisées par l’utilisation d’outils.
Utiliser « jailbreak » et « injection de prompt » de manière interchangeable — leurs objectifs et mécanismes diffèrent.
Penser que les jailbreaks sont un jeu sans conséquence — ils peuvent extraire des données d’entraînement ou produire du contenu illégal.
Ignorer l’injection de prompt indirecte par des documents récupérés via RAG.
Supposer que l’entraînement de sécurité suffit à empêcher l’injection de prompt — il traite principalement les jailbreaks.
Utilisez « injection de prompt » lorsque vous discutez d’attaques qui manipulent le comportement du modèle pour accomplir des actions non autorisées, en particulier dans des systèmes d’IA agentiques ou utilisant des outils.
Utilisez « jailbreak » lorsque vous discutez de tentatives de contournement des filtres de sécurité de contenu pour générer des sorties restreintes, en particulier dans les applications de chat destinées aux consommateurs.
Les deux types d’attaque sont pertinents pour les exigences du règlement européen sur l’IA relatives à la robustesse et à la cybersécurité des systèmes d’IA à haut risque. Les systèmes doivent démontrer une résistance à la manipulation adversariale.
Il peut l’être. De nombreux jailbreaks utilisent des techniques d’injection de prompt, mais toutes les injections de prompt ne sont pas des jailbreaks. L’injection de prompt est la catégorie d’attaque plus large.
L’injection de prompt — en particulier l’injection indirecte dans les systèmes agentiques où le modèle peut exécuter des outils, accéder à des bases de données ou envoyer des messages au nom des utilisateurs.
No recently viewed comparisons yet.