La evaluación humana es el proceso de hacer que personas juzguen la calidad, seguridad, utilidad o corrección de las salidas de un modelo. Es especialmente importante para tareas donde no existe una única respuesta correcta, como calidad de traducción, resumen, diálogo o generación creativa.
A process in which people judge the quality of an ML model's output; for example, having bilingual people judge the quality of an ML translation model. Human evaluation is particularly useful for judging models that have no one right answer. Contrast with automatic evaluation and autorater evaluation.