Principiante
¿Qué es la seguridad de LLM?
La seguridad de LLM es la disciplina de proteger aplicaciones basadas en modelos de lenguaje grandes frente a ataques, uso indebido, fuga de datos, salidas inseguras y acciones no previstas.
¿Qué es la inyección de prompts?
La inyección de prompts es una técnica adversarial que manipula un modelo de lenguaje colocando instrucciones maliciosas o no previstas en entradas de usuario, documentos, páginas web u otro contenido que el modelo procesa.
¿Qué es un jailbreak en un sistema LLM?
La inyección de prompts o jailbreak se refiere a una entrada adversarial destinada a eludir las instrucciones, políticas de seguridad o controles operativos de un modelo. Las mitigaciones incluyen filtrado de entradas, aislamiento de recuperación, acceso a herramientas con privilegio mínimo, aplicación de políticas y guardrails por capas.
¿En qué se diferencia RAG del fine-tuning?
Usa RAG cuando el modelo necesita información actual, fundamentada en fuentes; usa fine-tuning cuando el modelo necesita comportamiento especializado, rendimiento en tareas, adaptación de dominio o estilo aprendido a partir de datos.
Intermedio
¿Por qué RAG puede crear riesgos de privacidad y seguridad?
La generación aumentada por recuperación (RAG) es una técnica que combina IA generativa con recuperación desde fuentes de datos externas. El modelo utiliza documentos, pasajes o registros recuperados como contexto de base para producir respuestas más actuales, específicas y verificables.
¿Qué son los guardrails en un sistema LLM?
Los guardrails son controles técnicos, procedimentales o de política diseñados para mantener los sistemas de IA dentro de límites aceptables. Pueden reducir riesgos como resultados dañinos, filtración de datos, acceso no autorizado, infracciones de políticas o comportamiento inseguro.
¿Qué es el grounding en la IA generativa?
El grounding es el proceso de conectar la salida de un modelo de IA con fuentes de información fiables y verificables en el momento de la inferencia. En la IA generativa, ayuda a mejorar la fiabilidad factual al aportar contexto relevante sin cambiar los pesos subyacentes del modelo.
¿Qué es una alucinación en un sistema de IA?
Una alucinación es una salida generada por IA que parece plausible o segura, pero es falsa, no respaldada, engañosa o fabricada. En la IA generativa, las alucinaciones pueden incluir hechos incorrectos, fuentes inventadas, citas falsas o razonamientos que no están fundamentados en evidencia fiable.
¿En qué se diferencia un prompt de sistema de un prompt de usuario?
Usa el prompt de sistema para instrucciones y restricciones duraderas de la aplicación; usa el prompt de usuario para la solicitud inmediata, el contexto y el resultado deseado del usuario.
¿Qué es el red teaming para LLM?
El red teaming es un proceso estructurado de pruebas adversariales utilizado para identificar debilidades, comportamientos inseguros o salidas dañinas en un sistema de IA. Consiste en sondear deliberadamente el sistema con entradas difíciles, maliciosas o de casos límite para que los desarrolladores puedan evaluar y mejorar las salvaguardas.
Avanzado
¿Qué es el envenenamiento de datos en sistemas de IA?
El envenenamiento de datos es un ataque adversarial en el que un actor malicioso interfiere con los datos o el proceso de entrenamiento usados para construir un modelo. Al insertar, modificar o corromper ejemplos de entrenamiento, el atacante busca manipular el comportamiento del modelo, degradar su rendimiento o crear fallos dirigidos.
¿Qué es la moderación de contenido para salidas de IA?
La moderación de contenido y los filtros de seguridad son controles diseñados para detectar, bloquear, reducir o escalar contenido dañino, ilegal o no permitido por las políticas. En los sistemas de IA, suelen combinarse con reglas de política, clasificadores basados en modelos, registros y revisión humana para casos de mayor riesgo.