Una comparación lado a lado entre inyección de prompt y envenenamiento de datos. Comprenda cómo la manipulación de instrucciones en tiempo de ejecución se diferencia de ataques a datos de entrenamiento o al proceso de entrenamiento.
Veredicto rápido: Use Inyección de prompt para instrucciones maliciosas procesadas por un modelo de lenguaje en tiempo de ejecución; use Envenenamiento de datos para ataques que corrompen datos de entrenamiento o el proceso de entrenamiento.
Prompt Injection summarizes adversarial technique that manipulates a language model by placing malicious or unintended instructions in user input, documents, web pages, or other content.
Contexto: Más relevante para aplicaciones LLM que procesan texto no confiable, documentos recuperados, contenido web o instrucciones relacionadas con herramientas.
Data Poisoning summarizes adversarial attack in which a malicious actor interferes with the data or training process used to build a model.
Contexto: Más relevante al evaluar pipelines de entrenamiento de modelos, procedencia de datos de entrenamiento, calidad de datasets y riesgos de manipulación adversaria.
| Aspecto | Prompt Injection | Data Poisoning |
|---|---|---|
| Modelo de amenaza | La inyección de prompt apunta al comportamiento de seguimiento de instrucciones del modelo mediante contenido que procesa. | El envenenamiento de datos apunta al proceso de construcción del modelo corrompiendo datos o entradas de entrenamiento. |
| Ruta de ataque | El atacante coloca instrucciones maliciosas o conflictivas en prompts, documentos, páginas web u otro contenido en tiempo de ejecución. | El atacante inserta, modifica o corrompe ejemplos de entrenamiento o interfiere con el proceso de entrenamiento. |
| Impacto | Los impactos pueden incluir ignorar instrucciones previas, filtrar información restringida, cambiar salidas o activar acciones no autorizadas. | Los impactos pueden incluir rendimiento degradado, comportamiento manipulado o fallos dirigidos del modelo. |
| Controles | Los controles incluyen aislamiento de entradas, jerarquía de instrucciones, permisos de herramientas, validación de salidas, filtrado de recuperación y registro. | Los controles incluyen procedencia de datos, validación de datasets, seguridad del pipeline de entrenamiento, detección de anomalías y cambios de datos controlados. |
| Evidencia de detección | La evidencia puede incluir registros de prompts, contenido recuperado, trazas de llamadas a herramientas, infracciones de políticas y resultados de red team. | La evidencia puede incluir diferencias entre datasets, registros de linaje de datos, logs de entrenamiento, anomalías de rendimiento y resultados de validación. |
| Momento | La inyección de prompt suele aparecer durante la inferencia o el tiempo de ejecución de la aplicación. | El envenenamiento de datos suele ocurrir antes o durante el entrenamiento, aunque sus efectos pueden aparecer más tarde en despliegue. |
En la práctica, los equipos a menudo defienden prompts mientras ignoran el linaje de datos, o aseguran datasets mientras permiten que modelos procesen documentos no confiables como instrucciones. Una seguridad de IA madura trata ambos como familias de controles separadas.
Tratar la inyección de prompt como un problema de datos de entrenamiento.
Suponer que el envenenamiento de datos solo afecta la exactitud del modelo y no comportamiento dirigido.
Confiar solo en prompts de sistema para detener ataques de inyección.
Omitir la procedencia de datasets porque el modelo parece funcionar bien en pruebas normales.
Use Inyección de prompt cuando un modelo de lenguaje sea manipulado mediante instrucciones embebidas en entradas o contenido externo. El término es especialmente importante para apps LLM con recuperación, navegación, análisis de documentos, agentes o uso de herramientas.
Use Envenenamiento de datos cuando el ataque se refiera a datos corruptos o manipulados usados para construir el modelo. Pertenece a gobernanza de datasets, controles de entrenamiento de modelos, comprobaciones de procedencia y análisis de riesgo de ML adversario.
La gobernanza de seguridad de IA bajo ISO/IEC 42001 y NIST AI RMF debe distinguir ataques LLM en tiempo de ejecución de ataques a datos de entrenamiento porque la evidencia, los controles y los responsables difieren. Para sistemas de IA de alto riesgo, el Reglamento de IA de la UE también hace importante una gestión de riesgos sólida y documentación técnica para riesgos relacionados con seguridad.
No. La inyección de prompt manipula el modelo mediante contenido procesado en tiempo de ejecución, mientras que el envenenamiento de datos manipula los datos o el proceso de entrenamiento usado para construir el modelo.
La inyección de prompt suele ser central en sistemas RAG porque los documentos recuperados pueden contener instrucciones maliciosas. El envenenamiento de datos también puede importar si el corpus de recuperación o los datos de entrenamiento están corrompidos.
Las investigaciones de inyección de prompt dependen de prompts, contenido recuperado, trazas de herramientas y salidas. Las investigaciones de envenenamiento de datos dependen más de linaje de datasets, diferencias de datasets, logs de entrenamiento y anomalías de validación.
No recently viewed comparisons yet.