Principiante
¿Qué es la evaluación de modelos?
La evaluación es el proceso de medir la calidad, el comportamiento o el rendimiento de un modelo, sistema o cambio frente a criterios definidos. En aprendizaje automático puede usar datos de validación y prueba, mientras que la evaluación de LLM también puede incluir seguridad, factualidad, robustez y evaluaciones de impacto en usuarios.
¿Qué es un benchmark en la evaluación de IA?
Un benchmark es una prueba, conjunto de datos, tarea o procedimiento de evaluación estandarizado utilizado para medir y comparar el rendimiento de sistemas de IA.
¿En qué se diferencian precision y recall?
Usa Precision cuando los falsos positivos son costosos; usa Recall cuando los positivos omitidos son costosos.
¿Por qué la accuracy puede ser engañosa?
Accuracy es una métrica de clasificación igual a la proporción de predicciones correctas entre todas las predicciones realizadas. Es útil en algunos entornos de evaluación, pero puede ser engañosa cuando las clases están desequilibradas, donde precision, recall u otras métricas pueden reflejar mejor el rendimiento del modelo.
Intermedio
¿Qué es una puntuación F1?
La puntuación F1 es la media armónica de la precisión y la exhaustividad, utilizada para evaluar el rendimiento en clasificación y extracción de información. Va de 0 a 1, donde los valores más altos indican un mejor equilibrio entre positivos correctamente identificados y positivos omitidos.
¿En qué se diferencian los falsos positivos y los falsos negativos?
Usa falso positivo para una marca positiva incorrecta; usa falso negativo para una omisión incorrecta al no detectar una condición positiva real.
¿Qué es un umbral de clasificación?
Un umbral de clasificación es un valor de corte elegido para convertir la puntuación o probabilidad de un modelo en una predicción de clase. Cambiar el umbral puede alterar el equilibrio entre falsos positivos y falsos negativos, por lo que la selección del umbral es una decisión importante de gobernanza y rendimiento.
¿Qué son los datos de validación?
Los datos de validación son datos usados para evaluar un modelo durante el desarrollo y ajustar decisiones como hiperparámetros, umbrales o procesos de aprendizaje. Deben ser distintos de los datos de entrenamiento y prueba para ayudar a detectar subajuste, sobreajuste y problemas de generalización.
¿Qué es un conjunto de prueba?
Un conjunto de prueba es un conjunto de datos reservado que se usa para proporcionar una evaluación independiente de un modelo entrenado o sistema de IA. Debe separarse de los datos de entrenamiento y validación para que las estimaciones de rendimiento reflejen mejor el comportamiento sobre datos no vistos antes del despliegue o lanzamiento.
¿Qué es la supervisión de modelos?
La supervisión de modelos es la observación continua del rendimiento, las entradas, las salidas, la deriva, los errores, la latencia y la salud operativa de un modelo desplegado. Ayuda a detectar degradación, uso indebido, sesgo, problemas de seguridad y condiciones que requieren reentrenamiento o intervención.
Avanzado
¿Qué es la fundamentación en la evaluación de LLM?
La fundamentación es la propiedad de que la salida de un modelo esté respaldada por material fuente específico o por el contexto proporcionado. En la IA generativa, la fundamentación ayuda a evaluar si una respuesta es trazable a evidencia en lugar de ser generación no respaldada del modelo.
¿Qué es la tasa de afirmaciones no respaldadas?
La UCR, o tasa de afirmaciones no respaldadas, es el porcentaje de afirmaciones en una respuesta del modelo que no están fundamentadas en evidencia de apoyo. Una UCR alta indica que el sistema puede estar produciendo demasiadas afirmaciones no respaldadas o alucinadas.