Un hub de evaluación para medir la calidad del modelo antes del despliegue y monitorear su comportamiento después del despliegue.
31
Términos
10
Comparaciones
8
Preguntas
La evaluación y el monitoreo de modelos ayudan a los equipos a decidir si un sistema es suficientemente bueno para desplegarse y si sigue siendo seguro y útil tras su lanzamiento. El tema cubre métricas, benchmarks, diseño de pruebas, umbrales, drift y evidencia posterior al despliegue.
Una evaluación deficiente puede ocultar resultados discriminatorios, falsas alarmas, recomendaciones inseguras o afirmaciones exageradas de proveedores. El monitoreo cierra la brecha entre los resultados de laboratorio y el rendimiento en el mundo real.
Útil para model cards, evidencia de auditoría, revisión de compras, controles de sistemas de alto riesgo, monitoreo posterior a la comercialización e investigación de incidentes.
Conceptos fundamentales para medir la calidad del modelo y seleccionar evidencia.
Términos para separar entrenamiento, validación, pruebas y evidencia de generalización.
Conceptos para el monitoreo posterior al despliegue y la evaluación de respuestas generadas.
Una comparación lado a lado entre precisión y exhaustividad. Comprenda cómo la precisión evalúa la corrección de los positivos predichos, mientras que la exhaustividad evalúa cuántos positivos reales fueron encontrados.
Una comparación lado a lado entre exactitud y precisión. Comprenda por qué la corrección global puede ocultar un desempeño débil en la clase positiva y por qué la precisión importa cuando los falsos positivos son costosos.
Una comparación lado a lado entre exactitud y puntuación F1. Comprenda cómo la corrección global se diferencia de una medida equilibrada de precisión y exhaustividad.
Una comparación lado a lado entre puntuación F1 y área bajo la curva ROC. Comprenda cómo un equilibrio dependiente del umbral entre precisión y exhaustividad se diferencia de la discriminación de ranking a través de umbrales.
Comparación lado a lado entre falso positivo y falso negativo. Entienda qué tipo de error marca algo que está ausente y qué tipo de error omite algo que está presente.
Comparación lado a lado entre Métrica y Benchmark. Explica las diferencias clave, cuándo usar cada concepto y qué implica la distinción para la gobernanza, el diseño del sistema o la evidencia de aseguramiento de IA.
Comparación lado a lado entre Evaluación y Benchmark. Explica las diferencias clave, cuándo usar cada concepto y qué implica la distinción para la gobernanza, el diseño del sistema o la evidencia de aseguramiento de IA.
A side-by-side comparison of Classification Threshold and Decision Threshold. Understand how threshold language applies to class prediction and broader discrete model decisions.
Comparación lado a lado entre monitorización de modelos y evaluación. Explica cómo la observación continua de un modelo desplegado difiere de medir un modelo, sistema o cambio frente a criterios definidos.
Comparación lado a lado entre deriva de datos y deriva del modelo. Entienda en qué se diferencian los cambios en la distribución de datos de entrada de los cambios o degradación del rendimiento del modelo con el tiempo.
La puntuación F1 es la media armónica de la precisión y la exhaustividad, utilizada para evaluar el rendimiento en clasificación y extracción de información. Va de 0 a 1, donde los valores más altos indican un mejor equilibrio entre positivos correctamente identificados y positivos omitidos.
Usa falso positivo para una marca positiva incorrecta; usa falso negativo para una omisión incorrecta al no detectar una condición positiva real.
Un umbral de clasificación es un valor de corte elegido para convertir la puntuación o probabilidad de un modelo en una predicción de clase. Cambiar el umbral puede alterar el equilibrio entre falsos positivos y falsos negativos, por lo que la selección del umbral es una decisión importante de gobernanza y rendimiento.
Los datos de validación son datos usados para evaluar un modelo durante el desarrollo y ajustar decisiones como hiperparámetros, umbrales o procesos de aprendizaje. Deben ser distintos de los datos de entrenamiento y prueba para ayudar a detectar subajuste, sobreajuste y problemas de generalización.
Un conjunto de prueba es un conjunto de datos reservado que se usa para proporcionar una evaluación independiente de un modelo entrenado o sistema de IA. Debe separarse de los datos de entrenamiento y validación para que las estimaciones de rendimiento reflejen mejor el comportamiento sobre datos no vistos antes del despliegue o lanzamiento.
La supervisión de modelos es la observación continua del rendimiento, las entradas, las salidas, la deriva, los errores, la latencia y la salud operativa de un modelo desplegado. Ayuda a detectar degradación, uso indebido, sesgo, problemas de seguridad y condiciones que requieren reentrenamiento o intervención.
La fundamentación es la propiedad de que la salida de un modelo esté respaldada por material fuente específico o por el contexto proporcionado. En la IA generativa, la fundamentación ayuda a evaluar si una respuesta es trazable a evidencia en lugar de ser generación no respaldada del modelo.
La UCR, o tasa de afirmaciones no respaldadas, es el porcentaje de afirmaciones en una respuesta del modelo que no están fundamentadas en evidencia de apoyo. Una UCR alta indica que el sistema puede estar produciendo demasiadas afirmaciones no respaldadas o alucinadas.