Средний
Что такое F1 score?
F1 score — это гармоническое среднее precision и recall, используемое для оценки качества классификации и извлечения информации. Значение находится в диапазоне от 0 до 1: чем оно выше, тем лучше баланс между правильно найденными положительными случаями и пропущенными положительными случаями.
Чем false positives отличаются от false negatives?
Используйте False Positive для ошибочного положительного флага; используйте False Negative для ошибочного непризнания реально существующего положительного условия.
Что такое classification threshold?
Classification threshold — это выбранное пороговое значение, используемое для преобразования score или probability модели в prediction класса. Изменение threshold может менять баланс между false positives и false negatives, поэтому выбор threshold является важным governance- и performance-решением.
Что такое validation data?
Validation data — это данные, используемые для оценки модели во время разработки и настройки таких решений, как hyperparameters, thresholds или learning processes. Они должны быть отделены от training и test data, чтобы помогать выявлять underfitting, overfitting и проблемы generalization.
Что такое test set?
Test set — это зарезервированный dataset, используемый для независимой оценки обученной модели или AI-системы. Он должен быть отделен от training и validation data, чтобы performance estimates лучше отражали поведение на unseen data до deployment или release.
Что такое model monitoring?
Model monitoring — это непрерывное наблюдение за performance, inputs, outputs, drift, errors, latency и operational health deployed model. Оно помогает обнаруживать degradation, misuse, bias, security issues и условия, требующие retraining или intervention.
Продвинутый
Что такое groundedness в LLM evaluation?
Groundedness — это свойство model output быть поддержанным конкретным source material или provided context. В генеративном AI groundedness помогает оценить, является ли ответ traceable to evidence, а не просто unsupported model generation.
Что такое unsupported-claim rate?
UCR (unsupported-claim rate) — это процент утверждений в model response, которые не grounded in supporting evidence. Высокий UCR указывает, что система может производить слишком много unsupported или hallucinated assertions.