Also known as: Evals (Evaluation)
Evals — это структурированные оценки, используемые для измерения качества, безопасности, робастности или производительности ИИ-системы. Термин часто используется для оценок LLM, но также может шире обозначать повторяемые тесты и метрики для любой модели или системы.
Systematic tests for quality, safety and robustness (e.g., accuracy, bias, jailbreak resistance). Should be repeatable and linked to risk level.