Evaluation-хаб для измерения качества модели до deployment и мониторинга поведения модели после deployment.
31
Термины
10
Сравнения
8
Вопросы
Оценка и мониторинг моделей помогают командам решить, достаточно ли система хороша для deployment и остаётся ли она безопасной и полезной после release. Тема охватывает metrics, benchmarks, test design, thresholds, drift и post-deployment evidence.
Плохая evaluation может скрывать дискриминационные outcomes, false alarms, небезопасные рекомендации или преувеличенные заявления поставщиков. Monitoring закрывает разрыв между лабораторными результатами и реальной performance.
Полезно для model cards, audit evidence, procurement review, controls для high-risk systems, post-market monitoring и расследования инцидентов.
Базовые концепции для измерения качества модели и выбора evidence.
Термины для разделения training, validation, testing и evidence по generalization.
Концепции для post-deployment monitoring и оценки generated answers.
Параллельное сравнение precision и recall. Помогает понять, как precision оценивает корректность предсказанные положительные случаи, а recall оценивает как много фактические положительные случаи were found.
Параллельное сравнение accuracy и precision. Помогает понять, почему общий корректность может hide слабый положительный-class производительность и почему precision matters когда ложноположительные результаты являются стоимостьly.
Параллельное сравнение accuracy и F1 Score. Помогает понять, как общий корректность differs из сбалансированная мера precision и recall.
Параллельное сравнение F1 Score и площадь под ROC-кривой. Помогает понять, как порог-dependent balance precision и recall differs из ранжироватьing дискриминационная способность across пороги.
Сравнение false positive и false negative. Разберите, какой тип ошибки ошибочно помечает отсутствующее условие как присутствующее, а какой пропускает реально присутствующее условие.
Параллельное сравнение Метрика и бенчмарк. Объясняет, чем отличаются понятия, когда применяется каждый термин и почему различие важно для AI governance, оценки и проектирования систем.
Параллельное сравнение Оценка и бенчмарк. Объясняет, чем отличаются понятия, когда применяется каждый термин и почему различие важно для AI governance, оценки и проектирования систем.
Параллельное сравнение Classification Threshold и Decision Threshold. Разбирает, как threshold language применяется к class prediction и более широким discrete model decisions.
Параллельное сравнение Мониторинг модели и Оценка. Оно объясняет, чем непрерывное наблюдение за внедрённой моделью отличается от измерения модели, системы или изменения по заданным критериям.
Сравнение дрейфа данных и дрейфа модели. Разберите, чем изменения распределения входных данных отличаются от изменений или деградации качества модели со временем.
F1 score — это гармоническое среднее precision и recall, используемое для оценки качества классификации и извлечения информации. Значение находится в диапазоне от 0 до 1: чем оно выше, тем лучше баланс между правильно найденными положительными случаями и пропущенными положительными случаями.
Используйте False Positive для ошибочного положительного флага; используйте False Negative для ошибочного непризнания реально существующего положительного условия.
Classification threshold — это выбранное пороговое значение, используемое для преобразования score или probability модели в prediction класса. Изменение threshold может менять баланс между false positives и false negatives, поэтому выбор threshold является важным governance- и performance-решением.
Validation data — это данные, используемые для оценки модели во время разработки и настройки таких решений, как hyperparameters, thresholds или learning processes. Они должны быть отделены от training и test data, чтобы помогать выявлять underfitting, overfitting и проблемы generalization.
Test set — это зарезервированный dataset, используемый для независимой оценки обученной модели или AI-системы. Он должен быть отделен от training и validation data, чтобы performance estimates лучше отражали поведение на unseen data до deployment или release.
Model monitoring — это непрерывное наблюдение за performance, inputs, outputs, drift, errors, latency и operational health deployed model. Оно помогает обнаруживать degradation, misuse, bias, security issues и условия, требующие retraining или intervention.
Groundedness — это свойство model output быть поддержанным конкретным source material или provided context. В генеративном AI groundedness помогает оценить, является ли ответ traceable to evidence, а не просто unsupported model generation.
UCR (unsupported-claim rate) — это процент утверждений в model response, которые не grounded in supporting evidence. Высокий UCR указывает, что система может производить слишком много unsupported или hallucinated assertions.