L’évaluation humaine est le processus consistant à faire juger par des personnes la qualité, la sûreté, l’utilité ou la correction des sorties d’un modèle. Elle est particulièrement importante pour les tâches où il n’existe pas une seule réponse correcte, comme la qualité de traduction, le résumé, le dialogue ou la génération créative.
A process in which people judge the quality of an ML model's output; for example, having bilingual people judge the quality of an ML translation model. Human evaluation is particularly useful for judging models that have no one right answer. Contrast with automatic evaluation and autorater evaluation.