Un hub de riesgo y seguridad para comprender cómo fallan los sistemas de IA, cómo emergen los daños y cómo los controles reducen comportamientos inseguros.
30
Términos
7
Comparaciones
8
Preguntas
La seguridad y el riesgo de IA se centran en prevenir, detectar y responder a fallos que pueden dañar a personas, organizaciones o la confianza pública. Abarca fiabilidad técnica, controles organizativos, uso indebido previsible, monitoreo y escalamiento de incidentes.
Los fallos de seguridad suelen aparecer después del despliegue, cuando usuarios reales, datos cambiantes y contextos inesperados exponen debilidades que no eran visibles en un benchmark.
Útil para safety cases, evaluaciones de riesgo de IA, playbooks de incidentes, monitoreo posterior a la comercialización, revisiones de IA en sanidad y sector público, y gobernanza de despliegues de alto riesgo.
Conceptos centrales para distinguir problemas de seguridad, ética, riesgo, daño y alineación.
Términos que describen cómo los sistemas se degradan, se vuelven poco fiables o se comportan de forma diferente después del despliegue.
Métodos utilizados para probar, monitorear y responder a problemas de seguridad durante el ciclo de vida de la IA.
Comparación lado a lado entre seguridad de IA y ética de IA. Entienda cómo las prácticas de prevención de daños se relacionan con preguntas más amplias sobre valores humanos, derechos y diseño responsable.
Comparación lado a lado entre riesgo y daño. Explica cómo una evaluación de probabilidad y gravedad difiere del efecto adverso experimentado por una persona, grupo, organización o sistema.
Comparación lado a lado entre deriva de datos y deriva del modelo. Entienda en qué se diferencian los cambios en la distribución de datos de entrada de los cambios o degradación del rendimiento del modelo con el tiempo.
Comparación lado a lado entre deriva de datos y deriva de concepto. Entienda si un problema del modelo proviene de distribuciones de entrada cambiantes o de relaciones cambiantes entre entradas y resultados.
Comparación lado a lado entre deriva del modelo y deriva conceptual. Explica cómo la degradación del rendimiento con el tiempo difiere de un cambio en la relación estadística entre entradas y resultados objetivo.
Comparación lado a lado entre Caso de seguridad y Evaluación de riesgos de IA. Explica las diferencias clave, cuándo usar cada concepto y qué implica la distinción para la gobernanza, el diseño del sistema o la evidencia de aseguramiento de IA.
Distinga entre inyección de prompts, que secuestra el comportamiento del modelo mediante entrada maliciosa, y jailbreak, que elude barreras de seguridad para producir contenido restringido. Ambas son amenazas de seguridad para LLM, pero difieren en mecanismo y objetivo.
Usa deriva de datos cuando cambia la distribución de los datos de entrada; usa deriva de concepto cuando cambia la relación entre las entradas y el resultado objetivo.
El alineamiento es la práctica de diseñar, entrenar y gobernar un sistema de IA para que sus objetivos, salidas y comportamiento sigan siendo coherentes con las intenciones humanas, los valores y las restricciones de uso aceptable.
Un incidente de IA es un evento o serie de eventos en los que el desarrollo, despliegue, uso o mal funcionamiento de un sistema de IA causa o podría causar daño. Ese daño puede afectar a la seguridad, la discriminación, la privacidad, el cumplimiento legal, infraestructuras críticas, propiedad, comunidades o el medio ambiente.
HITL, o humano en el circuito, es un enfoque en el que las personas siguen participando en la configuración, revisión, aprobación o mejora de salidas o decisiones de sistemas de IA. Se usa para combinar la eficiencia de la máquina con el juicio humano, especialmente en tareas de mayor riesgo o sensibles al contexto.
La toxicidad de IA es una salida dañina, ofensiva, falsa, sesgada o de otro modo inapropiada generada o amplificada por un sistema de IA. Puede surgir de los datos de entrenamiento, el diseño del sistema, el contexto del prompt, la falta de alineamiento o salvaguardas inadecuadas.
Un sistema de seguimiento poscomercialización consiste en actividades realizadas por proveedores de sistemas de IA para recopilar y revisar la experiencia de sistemas introducidos en el mercado o puestos en servicio. Su finalidad es identificar si se necesitan acciones correctivas o preventivas después del despliegue.
La detección de anomalías es el proceso de identificar observaciones, eventos o patrones que difieren significativamente del comportamiento esperado. En IA y análisis de datos, se usa para señalar valores atípicos que pueden indicar errores, fraude, incidentes de seguridad, fallos del sistema u otras condiciones inusuales.
La seguridad desde el diseño es un enfoque en el que los requisitos y salvaguardas de seguridad se integran desde el inicio del desarrollo del sistema. Para sistemas de IA, incluye anticipar usos indebidos, proteger datos y modelos, e incorporar controles de acceso, monitorización y resiliencia durante todo el ciclo de vida.