Caesar AI Atlas

Evaluación y monitoreo de modelos

Un hub de evaluación para medir la calidad del modelo antes del despliegue y monitorear su comportamiento después del despliegue.

ML engineersAI auditorsrisk teamsproduct teamscompliance teams

31

Términos

10

Comparaciones

8

Preguntas

Sobre este tema

Resumen

La evaluación y el monitoreo de modelos ayudan a los equipos a decidir si un sistema es suficientemente bueno para desplegarse y si sigue siendo seguro y útil tras su lanzamiento. El tema cubre métricas, benchmarks, diseño de pruebas, umbrales, drift y evidencia posterior al despliegue.

Por qué es importante

Una evaluación deficiente puede ocultar resultados discriminatorios, falsas alarmas, recomendaciones inseguras o afirmaciones exageradas de proveedores. El monitoreo cierra la brecha entre los resultados de laboratorio y el rendimiento en el mundo real.

Contexto de cumplimiento

Útil para model cards, evidencia de auditoría, revisión de compras, controles de sistemas de alto riesgo, monitoreo posterior a la comercialización e investigación de incidentes.

Conclusiones clave

  • 1Ninguna métrica por sí sola demuestra que un modelo sea seguro o conforme.
  • 2Los datos de validación y los conjuntos de prueba cumplen propósitos diferentes.
  • 3La elección de umbrales es una decisión de gobernanza, no solo ajuste técnico.
  • 4El monitoreo es necesario porque los datos y el comportamiento cambian después del despliegue.

Términos clave

Comparaciones relacionadas

Métricas

Precisión vs Exhaustividad

Una comparación lado a lado entre precisión y exhaustividad. Comprenda cómo la precisión evalúa la corrección de los positivos predichos, mientras que la exhaustividad evalúa cuántos positivos reales fueron encontrados.

Métricas

Exactitud vs Precisión

Una comparación lado a lado entre exactitud y precisión. Comprenda por qué la corrección global puede ocultar un desempeño débil en la clase positiva y por qué la precisión importa cuando los falsos positivos son costosos.

Métricas

Exactitud vs Puntuación F1

Una comparación lado a lado entre exactitud y puntuación F1. Comprenda cómo la corrección global se diferencia de una medida equilibrada de precisión y exhaustividad.

Métricas

Puntuación F1 vs Área bajo la curva ROC

Una comparación lado a lado entre puntuación F1 y área bajo la curva ROC. Comprenda cómo un equilibrio dependiente del umbral entre precisión y exhaustividad se diferencia de la discriminación de ranking a través de umbrales.

Métricas

Falso positivo vs falso negativo

Comparación lado a lado entre falso positivo y falso negativo. Entienda qué tipo de error marca algo que está ausente y qué tipo de error omite algo que está presente.

Confusión común

Métrica vs Benchmark

Comparación lado a lado entre Métrica y Benchmark. Explica las diferencias clave, cuándo usar cada concepto y qué implica la distinción para la gobernanza, el diseño del sistema o la evidencia de aseguramiento de IA.

Confusión común

Evaluación vs Benchmark

Comparación lado a lado entre Evaluación y Benchmark. Explica las diferencias clave, cuándo usar cada concepto y qué implica la distinción para la gobernanza, el diseño del sistema o la evidencia de aseguramiento de IA.

Métricas

Classification Threshold vs Decision Threshold

A side-by-side comparison of Classification Threshold and Decision Threshold. Understand how threshold language applies to class prediction and broader discrete model decisions.

Gobernanza

Monitorización de modelos vs evaluación

Comparación lado a lado entre monitorización de modelos y evaluación. Explica cómo la observación continua de un modelo desplegado difiere de medir un modelo, sistema o cambio frente a criterios definidos.

Confusión común

Deriva de datos vs deriva del modelo

Comparación lado a lado entre deriva de datos y deriva del modelo. Entienda en qué se diferencian los cambios en la distribución de datos de entrada de los cambios o degradación del rendimiento del modelo con el tiempo.

Preguntas frecuentes

¿Qué es una puntuación F1?

La puntuación F1 es la media armónica de la precisión y la exhaustividad, utilizada para evaluar el rendimiento en clasificación y extracción de información. Va de 0 a 1, donde los valores más altos indican un mejor equilibrio entre positivos correctamente identificados y positivos omitidos.

1 términos relacionadosintermediate

¿En qué se diferencian los falsos positivos y los falsos negativos?

Usa falso positivo para una marca positiva incorrecta; usa falso negativo para una omisión incorrecta al no detectar una condición positiva real.

1 términos relacionadosintermediate

¿Qué es un umbral de clasificación?

Un umbral de clasificación es un valor de corte elegido para convertir la puntuación o probabilidad de un modelo en una predicción de clase. Cambiar el umbral puede alterar el equilibrio entre falsos positivos y falsos negativos, por lo que la selección del umbral es una decisión importante de gobernanza y rendimiento.

1 términos relacionadosintermediate

¿Qué son los datos de validación?

Los datos de validación son datos usados para evaluar un modelo durante el desarrollo y ajustar decisiones como hiperparámetros, umbrales o procesos de aprendizaje. Deben ser distintos de los datos de entrenamiento y prueba para ayudar a detectar subajuste, sobreajuste y problemas de generalización.

1 términos relacionadosintermediate

¿Qué es un conjunto de prueba?

Un conjunto de prueba es un conjunto de datos reservado que se usa para proporcionar una evaluación independiente de un modelo entrenado o sistema de IA. Debe separarse de los datos de entrenamiento y validación para que las estimaciones de rendimiento reflejen mejor el comportamiento sobre datos no vistos antes del despliegue o lanzamiento.

1 términos relacionadosintermediate

¿Qué es la supervisión de modelos?

La supervisión de modelos es la observación continua del rendimiento, las entradas, las salidas, la deriva, los errores, la latencia y la salud operativa de un modelo desplegado. Ayuda a detectar degradación, uso indebido, sesgo, problemas de seguridad y condiciones que requieren reentrenamiento o intervención.

1 términos relacionadosintermediate

¿Qué es la fundamentación en la evaluación de LLM?

La fundamentación es la propiedad de que la salida de un modelo esté respaldada por material fuente específico o por el contexto proporcionado. En la IA generativa, la fundamentación ayuda a evaluar si una respuesta es trazable a evidencia en lugar de ser generación no respaldada del modelo.

1 términos relacionadosadvanced

¿Qué es la tasa de afirmaciones no respaldadas?

La UCR, o tasa de afirmaciones no respaldadas, es el porcentaje de afirmaciones en una respuesta del modelo que no están fundamentadas en evidencia de apoyo. Una UCR alta indica que el sistema puede estar produciendo demasiadas afirmaciones no respaldadas o alucinadas.

1 términos relacionadosadvanced