Caesar AI Atlas

Автоматическая оценка

Caesar AI Atlas Definition

Автоматическая оценка — использование программного обеспечения или моделей для оценки качества, корректности, безопасности или полезности выходов системы. Она может опираться на программные проверки, эталонные ответы, метрики вроде BLEU или ROUGE либо модельные оценщики, называемые autoraters. Автоматическая оценка часто используется вместе с человеческой оценкой, когда выходы сложны или зависят от контекста.

Other Definitions

Автоматическая оценка Source

Using software to judge the quality of a model's output. When model output is relatively straightforward, a script or program can compare the model's output to a golden response. This type of automatic evaluation is sometimes called programmatic evaluation . Metrics such as ROUGE or BLEU are often useful for programmatic evaluation. When model output is complex or has no one right answer, a separate ML program called an autorater sometimes performs the automatic evaluation. Contrast with human evaluation.

Related Terms