Un hub centrado en seguridad sobre riesgos y controles en torno a grandes modelos de lenguaje, sistemas de recuperación, prompts, guardrails y salidas de modelos.
34
Términos
9
Comparaciones
8
Preguntas
La seguridad de LLM abarca las formas en que las aplicaciones basadas en modelos de lenguaje pueden ser atacadas, mal utilizadas o mal configuradas. Combina la seguridad ordinaria de aplicaciones con controles de prompts, gobernanza de recuperación, control de acceso y evaluación de salidas.
Los fallos de LLM pueden exponer archivos confidenciales, producir asesoramiento inseguro, filtrar datos a través de prompts o socavar la confianza en flujos de trabajo automatizados. Los equipos de seguridad necesitan un vocabulario que conecte el comportamiento del modelo con controles prácticos.
Relevante para due diligence de proveedores, revisiones de despliegue seguro, evidencia de auditoría de IA, programas de red team y respuesta a incidentes en aplicaciones LLM.
Conceptos centrales de modelos y adaptación que influyen en las decisiones de seguridad y gobernanza.
Riesgos de seguridad que atacan instrucciones, datos, contexto de recuperación y comportamiento del modelo.
Controles utilizados para reducir salidas inseguras, medir fallos y hacer que los sistemas sean auditables.
Una comparación lado a lado entre la generación aumentada por recuperación y el ajuste fino. Comprenda cuándo recuperar contexto externo en tiempo de ejecución y cuándo adaptar un modelo preentrenado mediante entrenamiento adicional.
Distinga entre inyección de prompts, que secuestra el comportamiento del modelo mediante entrada maliciosa, y jailbreak, que elude barreras de seguridad para producir contenido restringido. Ambas son amenazas de seguridad para LLM, pero difieren en mecanismo y objetivo.
Una comparación lado a lado entre inyección de prompt y envenenamiento de datos. Comprenda cómo la manipulación de instrucciones en tiempo de ejecución se diferencia de ataques a datos de entrenamiento o al proceso de entrenamiento.
Comparación lado a lado entre guardrails y moderación de contenido / filtros de seguridad. Entienda la diferencia entre límites amplios del sistema de IA y controles específicos para contenido dañino o no permitido.
Comparación lado a lado entre prompt de sistema y prompt de usuario. Explica cómo las instrucciones de comportamiento a nivel de aplicación difieren de la tarea o pregunta inmediata proporcionada por un usuario.
Comparación lado a lado entre red teaming y auditoría de IA. Explica cómo difieren los términos, cuándo aplica cada uno y qué significa la distinción para la gobernanza, el diseño de sistemas o la evidencia de assurance.
Comparación lado a lado entre seguridad desde el diseño y guardrails. Explica cómo la planificación de seguridad durante el ciclo de vida difiere de controles específicos que mantienen los sistemas de IA dentro de límites aceptables.
Comparación lado a lado entre alucinación y confabulación. Entienda cómo ambos describen salidas de IA plausibles pero no respaldadas o fabricadas, y por qué alucinación suele usarse como término operativo más amplio.
Comparación lado a lado entre grounding y groundedness. Entienda la diferencia entre el proceso de conectar salidas con fuentes y la propiedad de que una salida esté respaldada por evidencia.
La generación aumentada por recuperación (RAG) es una técnica que combina IA generativa con recuperación desde fuentes de datos externas. El modelo utiliza documentos, pasajes o registros recuperados como contexto de base para producir respuestas más actuales, específicas y verificables.
Los guardrails son controles técnicos, procedimentales o de política diseñados para mantener los sistemas de IA dentro de límites aceptables. Pueden reducir riesgos como resultados dañinos, filtración de datos, acceso no autorizado, infracciones de políticas o comportamiento inseguro.
El grounding es el proceso de conectar la salida de un modelo de IA con fuentes de información fiables y verificables en el momento de la inferencia. En la IA generativa, ayuda a mejorar la fiabilidad factual al aportar contexto relevante sin cambiar los pesos subyacentes del modelo.
Una alucinación es una salida generada por IA que parece plausible o segura, pero es falsa, no respaldada, engañosa o fabricada. En la IA generativa, las alucinaciones pueden incluir hechos incorrectos, fuentes inventadas, citas falsas o razonamientos que no están fundamentados en evidencia fiable.
Usa el prompt de sistema para instrucciones y restricciones duraderas de la aplicación; usa el prompt de usuario para la solicitud inmediata, el contexto y el resultado deseado del usuario.
El red teaming es un proceso estructurado de pruebas adversariales utilizado para identificar debilidades, comportamientos inseguros o salidas dañinas en un sistema de IA. Consiste en sondear deliberadamente el sistema con entradas difíciles, maliciosas o de casos límite para que los desarrolladores puedan evaluar y mejorar las salvaguardas.
El envenenamiento de datos es un ataque adversarial en el que un actor malicioso interfiere con los datos o el proceso de entrenamiento usados para construir un modelo. Al insertar, modificar o corromper ejemplos de entrenamiento, el atacante busca manipular el comportamiento del modelo, degradar su rendimiento o crear fallos dirigidos.
La moderación de contenido y los filtros de seguridad son controles diseñados para detectar, bloquear, reducir o escalar contenido dañino, ilegal o no permitido por las políticas. En los sistemas de IA, suelen combinarse con reglas de política, clasificadores basados en modelos, registros y revisión humana para casos de mayor riesgo.