Principiante
¿Qué es la evaluación de modelos?
La evaluación es el proceso de medir la calidad, el comportamiento o el rendimiento de un modelo, sistema o cambio frente a criterios definidos. En aprendizaje automático puede usar datos de validación y prueba, mientras que la evaluación de LLM también puede incluir seguridad, factualidad, robustez y evaluaciones de impacto en usuarios.
¿Qué es un benchmark en la evaluación de IA?
Un benchmark es una prueba, conjunto de datos, tarea o procedimiento de evaluación estandarizado utilizado para medir y comparar el rendimiento de sistemas de IA.
¿En qué se diferencian precision y recall?
Usa Precision cuando los falsos positivos son costosos; usa Recall cuando los positivos omitidos son costosos.
¿Por qué la accuracy puede ser engañosa?
Accuracy es una métrica de clasificación igual a la proporción de predicciones correctas entre todas las predicciones realizadas. Es útil en algunos entornos de evaluación, pero puede ser engañosa cuando las clases están desequilibradas, donde precision, recall u otras métricas pueden reflejar mejor el rendimiento del modelo.