Distinga entre inyección de prompts, que secuestra el comportamiento del modelo mediante entrada maliciosa, y jailbreak, que elude barreras de seguridad para producir contenido restringido. Ambas son amenazas de seguridad para LLM, pero difieren en mecanismo y objetivo.
Veredicto rápido: La inyección de prompts secuestra la tarea del modelo; el jailbreak elude sus reglas de seguridad. La inyección trata sobre control; el jailbreak trata sobre acceso.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Prompt Injection and Jailbreak describes adversarial input intended to bypass a model's instructions, safety policies, or operational controls.
| Aspecto | Prompt Injection | Jailbreak |
|---|---|---|
| Objetivo | Secuestrar el modelo para que realice una tarea no prevista, como exfiltración de datos o acciones no autorizadas. | Hacer que el modelo produzca contenido que fue entrenado para rechazar, como contenido dañino, ilegal o restringido. |
| Mecanismo | Sobrescribe el prompt de sistema o inyecta instrucciones mediante entrada del usuario o datos recuperados. | Explota debilidades del entrenamiento de seguridad mediante juegos de rol, trucos de codificación o manipulación de personalidad. |
| Superficie de ataque | Cualquier canal de entrada: mensajes de usuario, salidas de herramientas, documentos recuperados, llamadas API. | Principalmente la interfaz conversacional de cara al usuario. |
| Intención del atacante | Control: hacer que el modelo haga algo para lo que no fue diseñado. | Acceso: hacer que el modelo diga algo que fue diseñado para no decir. |
| Mitigación | Saneamiento de entradas, jerarquía de instrucciones, tokens delimitadores y monitoreo de salidas. | Entrenamiento de seguridad (RLHF), IA constitucional, clasificadores de contenido y ajuste de negativas. |
La inyección de prompts es la más peligrosa de las dos en sistemas de producción, especialmente con IA agéntica. Un jailbreak produce texto dañino; una inyección de prompts puede activar acciones reales no autorizadas mediante el uso de herramientas.
Usar 'jailbreak' e 'inyección de prompts' indistintamente: tienen objetivos y mecanismos diferentes.
Pensar que los jailbreaks son diversión inocua: pueden extraer datos de entrenamiento o producir contenido ilegal.
Ignorar la inyección indirecta de prompts mediante documentos recuperados por RAG.
Suponer que el entrenamiento de seguridad por sí solo evita la inyección de prompts: aborda principalmente los jailbreaks.
Use 'Inyección de prompts' cuando hable de ataques que manipulan el comportamiento del modelo para realizar acciones no autorizadas, especialmente en sistemas de IA agénticos o que usan herramientas.
Use 'Jailbreak' cuando hable de intentos de eludir filtros de seguridad de contenido y generar salidas restringidas, especialmente en aplicaciones de chat orientadas a consumidores.
Ambos tipos de ataque son relevantes para los requisitos del Reglamento de IA de la UE sobre robustez y ciberseguridad de sistemas de IA de alto riesgo. Los sistemas deben demostrar resistencia a la manipulación adversarial.
Puede serlo. Muchos jailbreaks usan técnicas de inyección de prompts, pero no todas las inyecciones de prompts son jailbreaks. La inyección de prompts es la categoría de ataque más amplia.
La inyección de prompts, especialmente la inyección indirecta en sistemas agénticos donde el modelo puede ejecutar herramientas, acceder a bases de datos o enviar mensajes en nombre de los usuarios.
No recently viewed comparisons yet.