Caesar AI Atlas

Seguridad de LLM

Un hub centrado en seguridad sobre riesgos y controles en torno a grandes modelos de lenguaje, sistemas de recuperación, prompts, guardrails y salidas de modelos.

security teamsdevelopersAI governance leadslegal and compliance teams

34

Términos

9

Comparaciones

8

Preguntas

Sobre este tema

Resumen

La seguridad de LLM abarca las formas en que las aplicaciones basadas en modelos de lenguaje pueden ser atacadas, mal utilizadas o mal configuradas. Combina la seguridad ordinaria de aplicaciones con controles de prompts, gobernanza de recuperación, control de acceso y evaluación de salidas.

Por qué es importante

Los fallos de LLM pueden exponer archivos confidenciales, producir asesoramiento inseguro, filtrar datos a través de prompts o socavar la confianza en flujos de trabajo automatizados. Los equipos de seguridad necesitan un vocabulario que conecte el comportamiento del modelo con controles prácticos.

Contexto de cumplimiento

Relevante para due diligence de proveedores, revisiones de despliegue seguro, evidencia de auditoría de IA, programas de red team y respuesta a incidentes en aplicaciones LLM.

Conclusiones clave

  • 1Prompt injection no es lo mismo que un jailbreak.
  • 2RAG mejora el grounding solo cuando la recuperación y el control de acceso están gobernados.
  • 3Los guardrails son útiles, pero no sustituyen el diseño seguro.
  • 4La revisión de seguridad debe cubrir prompts, herramientas, fuentes de recuperación, logs y escalamiento humano.

Términos clave

Comparaciones relacionadas

Alternativa técnica

RAG vs Ajuste fino

Una comparación lado a lado entre la generación aumentada por recuperación y el ajuste fino. Comprenda cuándo recuperar contexto externo en tiempo de ejecución y cuándo adaptar un modelo preentrenado mediante entrenamiento adicional.

Jerarquía

Inyección de prompts vs Jailbreak

Distinga entre inyección de prompts, que secuestra el comportamiento del modelo mediante entrada maliciosa, y jailbreak, que elude barreras de seguridad para producir contenido restringido. Ambas son amenazas de seguridad para LLM, pero difieren en mecanismo y objetivo.

Ataque / Fallo

Inyección de prompt vs Envenenamiento de datos

Una comparación lado a lado entre inyección de prompt y envenenamiento de datos. Comprenda cómo la manipulación de instrucciones en tiempo de ejecución se diferencia de ataques a datos de entrenamiento o al proceso de entrenamiento.

Riesgo vs Control

Guardrails vs moderación de contenido / filtros de seguridad

Comparación lado a lado entre guardrails y moderación de contenido / filtros de seguridad. Entienda la diferencia entre límites amplios del sistema de IA y controles específicos para contenido dañino o no permitido.

Arquitectura

Prompt de sistema vs prompt de usuario

Comparación lado a lado entre prompt de sistema y prompt de usuario. Explica cómo las instrucciones de comportamiento a nivel de aplicación difieren de la tarea o pregunta inmediata proporcionada por un usuario.

Gobernanza

Red teaming vs auditoría de IA

Comparación lado a lado entre red teaming y auditoría de IA. Explica cómo difieren los términos, cuándo aplica cada uno y qué significa la distinción para la gobernanza, el diseño de sistemas o la evidencia de assurance.

Riesgo vs Control

Seguridad desde el diseño vs guardrails

Comparación lado a lado entre seguridad desde el diseño y guardrails. Explica cómo la planificación de seguridad durante el ciclo de vida difiere de controles específicos que mantienen los sistemas de IA dentro de límites aceptables.

Confusión común

Alucinación vs confabulación

Comparación lado a lado entre alucinación y confabulación. Entienda cómo ambos describen salidas de IA plausibles pero no respaldadas o fabricadas, y por qué alucinación suele usarse como término operativo más amplio.

Confusión común

Grounding vs groundedness

Comparación lado a lado entre grounding y groundedness. Entienda la diferencia entre el proceso de conectar salidas con fuentes y la propiedad de que una salida esté respaldada por evidencia.

Preguntas frecuentes

¿Por qué RAG puede crear riesgos de privacidad y seguridad?

La generación aumentada por recuperación (RAG) es una técnica que combina IA generativa con recuperación desde fuentes de datos externas. El modelo utiliza documentos, pasajes o registros recuperados como contexto de base para producir respuestas más actuales, específicas y verificables.

1 términos relacionadosintermediate

¿Qué son los guardrails en un sistema LLM?

Los guardrails son controles técnicos, procedimentales o de política diseñados para mantener los sistemas de IA dentro de límites aceptables. Pueden reducir riesgos como resultados dañinos, filtración de datos, acceso no autorizado, infracciones de políticas o comportamiento inseguro.

1 términos relacionadosintermediate

¿Qué es el grounding en la IA generativa?

El grounding es el proceso de conectar la salida de un modelo de IA con fuentes de información fiables y verificables en el momento de la inferencia. En la IA generativa, ayuda a mejorar la fiabilidad factual al aportar contexto relevante sin cambiar los pesos subyacentes del modelo.

1 términos relacionadosintermediate

¿Qué es una alucinación en un sistema de IA?

Una alucinación es una salida generada por IA que parece plausible o segura, pero es falsa, no respaldada, engañosa o fabricada. En la IA generativa, las alucinaciones pueden incluir hechos incorrectos, fuentes inventadas, citas falsas o razonamientos que no están fundamentados en evidencia fiable.

1 términos relacionadosintermediate

¿En qué se diferencia un prompt de sistema de un prompt de usuario?

Usa el prompt de sistema para instrucciones y restricciones duraderas de la aplicación; usa el prompt de usuario para la solicitud inmediata, el contexto y el resultado deseado del usuario.

1 términos relacionadosintermediate

¿Qué es el red teaming para LLM?

El red teaming es un proceso estructurado de pruebas adversariales utilizado para identificar debilidades, comportamientos inseguros o salidas dañinas en un sistema de IA. Consiste en sondear deliberadamente el sistema con entradas difíciles, maliciosas o de casos límite para que los desarrolladores puedan evaluar y mejorar las salvaguardas.

1 términos relacionadosintermediate

¿Qué es el envenenamiento de datos en sistemas de IA?

El envenenamiento de datos es un ataque adversarial en el que un actor malicioso interfiere con los datos o el proceso de entrenamiento usados para construir un modelo. Al insertar, modificar o corromper ejemplos de entrenamiento, el atacante busca manipular el comportamiento del modelo, degradar su rendimiento o crear fallos dirigidos.

1 términos relacionadosadvanced

¿Qué es la moderación de contenido para salidas de IA?

La moderación de contenido y los filtros de seguridad son controles diseñados para detectar, bloquear, reducir o escalar contenido dañino, ilegal o no permitido por las políticas. En los sistemas de IA, suelen combinarse con reglas de política, clasificadores basados en modelos, registros y revisión humana para casos de mayor riesgo.

1 términos relacionadosadvanced