Пользователь хочет понять Precision в контексте Model Evaluation & Monitoring и применить это к практической работе по AI governance или compliance.
Используйте Precision, когда false positives стоят дорого; используйте Recall, когда дорого обходятся пропущенные positives.
Precision и recall — это classification metrics, отвечающие на разные вопросы. Precision спрашивает: когда модель предсказывает положительный результат, как часто она права? Recall спрашивает: из всех реальных положительных случаев сколько модель нашла? Используйте precision, когда false positives особенно затратны; используйте recall, когда особенно затратны missed positives. В Caesar AI Atlas эта страница должна быть связана с precision, recall и F1 score.
Precision — про избежание ложных тревог. Recall — про то, чтобы не пропустить важные случаи. Spam filter с высоким precision редко помечает нормальные письма как спам. Medical screening tool с высоким recall находит большинство пациентов, которым может понадобиться внимание, даже если также помечает некоторых людей, у которых в итоге нет заболевания.
Аналогия
Precision — это осторожная сигнализация; recall — широкая сеть.
Разница важна, потому что многие governance decisions зависят от стоимости разных ошибок. В hiring, lending, fraud detection, medical triage, content moderation и compliance screening false positives и false negatives создают разные юридические, операционные и человеческие последствия. Модель может выглядеть сильной по одной метрике и при этом создавать неприемлемый вред по другой.
Срочность
Команды должны выбрать precision, recall или баланс между ними до deployment, исходя из реальных последствий каждого типа ошибки.
Практическая evaluation должна определить positive class, выявить последствия false positives и false negatives и соответствующим образом выбрать thresholds. Команды должны сообщать precision и recall вместе, особенно при class imbalance. Нужно оценивать subgroups, edge cases и capacity для downstream human review. Когда thresholds меняются, governance records должны объяснять, почему выбранная operating point приемлема и какие compensating controls существуют. F1 score может быть полезен, когда нужна одна combined metric, но он не должен скрывать asymmetric risks.
Распространённая ошибка — говорить, что модель хорошая, потому что у неё высокий precision, не проверяя, не слишком ли низкий recall. Обратная ситуация тоже рискованна: модель с высоким recall может перегрузить human reviewers ложными positives. Команды также путают precision с accuracy, игнорируют base rates или сообщают метрики, не объясняя, какой класс считается positive.
Fraud systems, которые пропускают много реальных случаев мошенничества
Safety filters, которые чрезмерно блокируют легитимный контент
Medical screening tools, настроенные только на чистые validation data
Compliance alerts без достаточной review capacity
Этот ответ должен ссылаться на страницы Atlas о precision, recall, F1 score, accuracy, metric, evaluation, benchmark и confusion matrix. Он также должен связываться со страницами, объясняющими, почему accuracy может вводить в заблуждение. Эти ссылки помогают пользователям понимать выбор метрик как governance decision, а не как чисто математическое предпочтение.