Caesar AI Atlas

База знаний

Вопросы: Model Evaluation & Monitoring

Авторитетные ответы на вопросы о соответствии ИИ, управлении и технических аспектах. Написано для юридических команд, специалистов по комплаенсу и разработчиков.

40

Полные руководства

120

Всего вопросов

Все вопросы (120)Полные руководства (40)Только FAQ (80)Сбросить фильтр
Фильтр по сложности:

Начальный

Высокий приоритетНачальный

Что такое оценка модели?

Оценка — это процесс измерения качества, поведения или performance модели, системы либо изменения по заданным критериям. В машинном обучении она может использовать validation и test data, а оценка LLM также может включать безопасность, factuality, robustness и влияние на пользователей.

1 термин1 тема
Высокий приоритетНачальный

Что такое benchmark в оценке AI?

Benchmark — это стандартизированный тест, набор данных, задача или процедура оценки, используемые для измерения и сравнения performance AI-систем.

1 термин1 тема
Высокий приоритетНачальный

Чем отличаются precision и recall?

Используйте Precision, когда false positives стоят дорого; используйте Recall, когда дорого обходятся пропущенные positives.

1 термин1 тема
Высокий приоритетНачальный

Почему accuracy может вводить в заблуждение?

Accuracy — это classification metric, равная доле правильных предсказаний среди всех сделанных предсказаний. Она полезна в некоторых сценариях evaluation, но может вводить в заблуждение при imbalanced classes, где precision, recall или другие метрики лучше отражают performance модели.

1 термин1 тема

Средний

Высокий приоритетСредний

Что такое F1 score?

F1 score — это гармоническое среднее precision и recall, используемое для оценки качества классификации и извлечения информации. Значение находится в диапазоне от 0 до 1: чем оно выше, тем лучше баланс между правильно найденными положительными случаями и пропущенными положительными случаями.

1 термин1 тема
Средний приоритетСредний

Чем false positives отличаются от false negatives?

Используйте False Positive для ошибочного положительного флага; используйте False Negative для ошибочного непризнания реально существующего положительного условия.

1 термин1 тема
Средний приоритетСредний

Что такое classification threshold?

Classification threshold — это выбранное пороговое значение, используемое для преобразования score или probability модели в prediction класса. Изменение threshold может менять баланс между false positives и false negatives, поэтому выбор threshold является важным governance- и performance-решением.

1 термин1 тема
Средний приоритетСредний

Что такое validation data?

Validation data — это данные, используемые для оценки модели во время разработки и настройки таких решений, как hyperparameters, thresholds или learning processes. Они должны быть отделены от training и test data, чтобы помогать выявлять underfitting, overfitting и проблемы generalization.

1 термин1 тема
Средний приоритетСредний

Что такое test set?

Test set — это зарезервированный dataset, используемый для независимой оценки обученной модели или AI-системы. Он должен быть отделен от training и validation data, чтобы performance estimates лучше отражали поведение на unseen data до deployment или release.

1 термин1 тема
Средний приоритетСредний

Что такое model monitoring?

Model monitoring — это непрерывное наблюдение за performance, inputs, outputs, drift, errors, latency и operational health deployed model. Оно помогает обнаруживать degradation, misuse, bias, security issues и условия, требующие retraining или intervention.

1 термин1 тема

Продвинутый