Caesar AI Atlas

Evaluaciones de LLM

Also known as: LLM Evaluations (evals) · LLM Evaluations evals

Caesar AI Atlas Definition

Las evaluaciones de LLM, o evals, son métodos estructurados para evaluar el rendimiento, la seguridad, la fiabilidad y la idoneidad para tareas de large language models. Pueden usar benchmarks, métricas, revisión humana, pruebas adversarias o conjuntos de prueba específicos del dominio para comparar modelos y detectar regresiones.

Other Definitions

Evaluaciones de LLM [evals] Source

A set of metrics and benchmarks for assessing the performance of large language models (LLMs). At a high level, LLM evaluations: - Help researchers identify areas where LLMs need improvement. - Are useful in comparing different LLMs and identifying the best LLM for a particular task. - Help ensure that LLMs are safe and ethical to use. See Large language models (LLMs) in Machine Learning Crash Course for more information.

Related Terms