Caesar AI Atlas
HiérarchieIntermédiaire

Injection de prompt vs jailbreak

Distinguer l’injection de prompt, qui détourne le comportement du modèle au moyen d’une entrée malveillante, du jailbreak, qui contourne les garde-fous de sécurité pour produire du contenu restreint. Les deux sont des menaces de sécurité pour les LLM, mais diffèrent par leur mécanisme et leur objectif.

Verdict rapide: L’injection de prompt détourne la tâche du modèle ; le jailbreak contourne ses règles de sécurité. L’injection concerne le contrôle, le jailbreak concerne l’accès.

En un coup d'œil

Injection de prompt

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

VS
Jailbreak

Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.

Différences clés

AspectPrompt InjectionJailbreak
ObjectifDétourner le modèle pour lui faire accomplir une tâche non prévue, comme l’exfiltration de données ou des actions non autorisées.Faire produire au modèle du contenu qu’il a été entraîné à refuser, par exemple du contenu nuisible, illégal ou restreint.
MécanismeRemplace le prompt système ou injecte des instructions par l’entrée utilisateur ou les données récupérées.Exploite les faiblesses de l’entraînement de sécurité au moyen de jeux de rôle, d’astuces d’encodage ou de manipulation de persona.
Surface d’attaqueTout canal d’entrée : messages utilisateur, sorties d’outils, documents récupérés, appels d’API.Principalement l’interface conversationnelle destinée aux utilisateurs.
Intention de l’attaquantContrôle — faire faire au modèle quelque chose pour lequel il n’a pas été conçu.Accès — faire dire au modèle quelque chose qu’il a été conçu pour ne pas dire.
AtténuationNettoyage des entrées, hiérarchie des instructions, jetons délimiteurs, surveillance des sorties.Entraînement de sécurité (RLHF), IA constitutionnelle, classificateurs de contenu, réglage des refus.
Note Caesar AI

L’injection de prompt est la plus dangereuse des deux dans les systèmes de production, surtout avec l’IA agentique. Un jailbreak produit du texte nuisible ; une injection de prompt peut déclencher des actions réelles non autorisées par l’utilisation d’outils.

Notes

Erreurs courantes

1

Utiliser « jailbreak » et « injection de prompt » de manière interchangeable — leurs objectifs et mécanismes diffèrent.

2

Penser que les jailbreaks sont un jeu sans conséquence — ils peuvent extraire des données d’entraînement ou produire du contenu illégal.

3

Ignorer l’injection de prompt indirecte par des documents récupérés via RAG.

4

Supposer que l’entraînement de sécurité suffit à empêcher l’injection de prompt — il traite principalement les jailbreaks.

Quand utiliser

prompt-injection

Utilisez « injection de prompt » lorsque vous discutez d’attaques qui manipulent le comportement du modèle pour accomplir des actions non autorisées, en particulier dans des systèmes d’IA agentiques ou utilisant des outils.

prompt-injection-jailbreak

Utilisez « jailbreak » lorsque vous discutez de tentatives de contournement des filtres de sécurité de contenu pour générer des sorties restreintes, en particulier dans les applications de chat destinées aux consommateurs.

Note de conformité

Les deux types d’attaque sont pertinents pour les exigences du règlement européen sur l’IA relatives à la robustesse et à la cybersécurité des systèmes d’IA à haut risque. Les systèmes doivent démontrer une résistance à la manipulation adversariale.

FAQ

Un jailbreak est-il un type d’injection de prompt ?+

Il peut l’être. De nombreux jailbreaks utilisent des techniques d’injection de prompt, mais toutes les injections de prompt ne sont pas des jailbreaks. L’injection de prompt est la catégorie d’attaque plus large.

Lequel est le plus dangereux en production ?+

L’injection de prompt — en particulier l’injection indirecte dans les systèmes agentiques où le modèle peut exécuter des outils, accéder à des bases de données ou envoyer des messages au nom des utilisateurs.

Comparaisons liées

Consultés récemment

No recently viewed comparisons yet.