Caesar AI Atlas
JerarquíaIntermedio

Inyección de prompts vs Jailbreak

Distinga entre inyección de prompts, que secuestra el comportamiento del modelo mediante entrada maliciosa, y jailbreak, que elude barreras de seguridad para producir contenido restringido. Ambas son amenazas de seguridad para LLM, pero difieren en mecanismo y objetivo.

Veredicto rápido: La inyección de prompts secuestra la tarea del modelo; el jailbreak elude sus reglas de seguridad. La inyección trata sobre control; el jailbreak trata sobre acceso.

De un vistazo

Inyección de prompts

Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.

VS
Jailbreak

Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.

Diferencias clave

AspectoPrompt InjectionJailbreak
ObjetivoSecuestrar el modelo para que realice una tarea no prevista, como exfiltración de datos o acciones no autorizadas.Hacer que el modelo produzca contenido que fue entrenado para rechazar, como contenido dañino, ilegal o restringido.
MecanismoSobrescribe el prompt de sistema o inyecta instrucciones mediante entrada del usuario o datos recuperados.Explota debilidades del entrenamiento de seguridad mediante juegos de rol, trucos de codificación o manipulación de personalidad.
Superficie de ataqueCualquier canal de entrada: mensajes de usuario, salidas de herramientas, documentos recuperados, llamadas API.Principalmente la interfaz conversacional de cara al usuario.
Intención del atacanteControl: hacer que el modelo haga algo para lo que no fue diseñado.Acceso: hacer que el modelo diga algo que fue diseñado para no decir.
MitigaciónSaneamiento de entradas, jerarquía de instrucciones, tokens delimitadores y monitoreo de salidas.Entrenamiento de seguridad (RLHF), IA constitucional, clasificadores de contenido y ajuste de negativas.
Nota Caesar AI

La inyección de prompts es la más peligrosa de las dos en sistemas de producción, especialmente con IA agéntica. Un jailbreak produce texto dañino; una inyección de prompts puede activar acciones reales no autorizadas mediante el uso de herramientas.

Notas

Errores comunes

1

Usar 'jailbreak' e 'inyección de prompts' indistintamente: tienen objetivos y mecanismos diferentes.

2

Pensar que los jailbreaks son diversión inocua: pueden extraer datos de entrenamiento o producir contenido ilegal.

3

Ignorar la inyección indirecta de prompts mediante documentos recuperados por RAG.

4

Suponer que el entrenamiento de seguridad por sí solo evita la inyección de prompts: aborda principalmente los jailbreaks.

Cuándo usar cada uno

prompt-injection

Use 'Inyección de prompts' cuando hable de ataques que manipulan el comportamiento del modelo para realizar acciones no autorizadas, especialmente en sistemas de IA agénticos o que usan herramientas.

prompt-injection-jailbreak

Use 'Jailbreak' cuando hable de intentos de eludir filtros de seguridad de contenido y generar salidas restringidas, especialmente en aplicaciones de chat orientadas a consumidores.

Nota de cumplimiento

Ambos tipos de ataque son relevantes para los requisitos del Reglamento de IA de la UE sobre robustez y ciberseguridad de sistemas de IA de alto riesgo. Los sistemas deben demostrar resistencia a la manipulación adversarial.

Preguntas frecuentes

¿Un jailbreak es un tipo de inyección de prompts?+

Puede serlo. Muchos jailbreaks usan técnicas de inyección de prompts, pero no todas las inyecciones de prompts son jailbreaks. La inyección de prompts es la categoría de ataque más amplia.

¿Cuál es más peligrosa en producción?+

La inyección de prompts, especialmente la inyección indirecta en sistemas agénticos donde el modelo puede ejecutar herramientas, acceder a bases de datos o enviar mensajes en nombre de los usuarios.

Comparaciones relacionadas

Vistos recientemente

No recently viewed comparisons yet.