Caesar AI Atlas
Высокий приоритетНачальный

Чем отличаются precision и recall?

Что вы ищете

Пользователь хочет понять Precision в контексте Model Evaluation & Monitoring и применить это к практической работе по AI governance или compliance.

Краткий ответ

Используйте Precision, когда false positives стоят дорого; используйте Recall, когда дорого обходятся пропущенные positives.

Что вы узнаете

  1. 1Прямое различие
  2. 2Объяснение простым языком
  3. 3Техническая или правовая граница
  4. 4Значение для compliance
  5. 5Распространённые ошибки
  6. 6Связанные термины Atlas

Подробный ответ

Прямой ответ

Precision и recall — это classification metrics, отвечающие на разные вопросы. Precision спрашивает: когда модель предсказывает положительный результат, как часто она права? Recall спрашивает: из всех реальных положительных случаев сколько модель нашла? Используйте precision, когда false positives особенно затратны; используйте recall, когда особенно затратны missed positives. В Caesar AI Atlas эта страница должна быть связана с precision, recall и F1 score.

Простыми словами

Precision — про избежание ложных тревог. Recall — про то, чтобы не пропустить важные случаи. Spam filter с высоким precision редко помечает нормальные письма как спам. Medical screening tool с высоким recall находит большинство пациентов, которым может понадобиться внимание, даже если также помечает некоторых людей, у которых в итоге нет заболевания.

Аналогия

Precision — это осторожная сигнализация; recall — широкая сеть.

Почему это важно

Разница важна, потому что многие governance decisions зависят от стоимости разных ошибок. В hiring, lending, fraud detection, medical triage, content moderation и compliance screening false positives и false negatives создают разные юридические, операционные и человеческие последствия. Модель может выглядеть сильной по одной метрике и при этом создавать неприемлемый вред по другой.

Срочность

Команды должны выбрать precision, recall или баланс между ними до deployment, исходя из реальных последствий каждого типа ошибки.

Ключевые обязательства

Практическая evaluation должна определить positive class, выявить последствия false positives и false negatives и соответствующим образом выбрать thresholds. Команды должны сообщать precision и recall вместе, особенно при class imbalance. Нужно оценивать subgroups, edge cases и capacity для downstream human review. Когда thresholds меняются, governance records должны объяснять, почему выбранная operating point приемлема и какие compensating controls существуют. F1 score может быть полезен, когда нужна одна combined metric, но он не должен скрывать asymmetric risks.

  • Определить positive class
  • Сопоставить costs false positives
  • Сопоставить costs false negatives
  • Проверить threshold trade-offs
  • Отчитаться о subgroup performance

Частые ошибки

Распространённая ошибка — говорить, что модель хорошая, потому что у неё высокий precision, не проверяя, не слишком ли низкий recall. Обратная ситуация тоже рискованна: модель с высоким recall может перегрузить human reviewers ложными positives. Команды также путают precision с accuracy, игнорируют base rates или сообщают метрики, не объясняя, какой класс считается positive.

Fraud systems, которые пропускают много реальных случаев мошенничества

Safety filters, которые чрезмерно блокируют легитимный контент

Medical screening tools, настроенные только на чистые validation data

Compliance alerts без достаточной review capacity

Related Atlas Content

Этот ответ должен ссылаться на страницы Atlas о precision, recall, F1 score, accuracy, metric, evaluation, benchmark и confusion matrix. Он также должен связываться со страницами, объясняющими, почему accuracy может вводить в заблуждение. Эти ссылки помогают пользователям понимать выбор метрик как governance decision, а не как чисто математическое предпочтение.

Ключевые термины

Источники

  • Caesar AI Atlas glossary