Caesar AI Atlas
Haute prioritéDébutant

Pourquoi l’accuracy peut-elle être trompeuse ?

Ce que vous cherchez

L’utilisateur veut comprendre l’accuracy dans le contexte de l’évaluation et du suivi des modèles, et l’appliquer à un travail pratique de gouvernance ou de conformité de l’IA.

Réponse rapide

L’accuracy est une métrique de classification égale à la proportion de prédictions correctes parmi toutes les prédictions effectuées. Elle est utile dans certains contextes d’évaluation, mais peut être trompeuse lorsque les classes sont déséquilibrées, où la précision, le rappel ou d’autres métriques peuvent mieux refléter la performance du modèle.

Ce que vous apprendrez

  1. 1Distinction directe
  2. 2Explication en langage clair
  3. 3Frontière technique ou juridique
  4. 4Pertinence pour la conformité
  5. 5Erreurs fréquentes
  6. 6Termes Atlas liés

Réponse détaillée

Réponse directe

L’accuracy peut être trompeuse parce qu’elle mesure la part de toutes les prédictions qui sont correctes, sans montrer quels types d’erreurs le modèle commet. Un modèle peut avoir une accuracy élevée tout en manquant des cas rares mais importants, surtout lorsqu’une classe est beaucoup plus fréquente qu’une autre. L’accuracy est utile dans certaines tâches équilibrées, mais elle est souvent insuffisante pour l’évaluation d’IA sensible au risque. Dans Caesar AI Atlas, cette page doit relier accuracy, précision, rappel et score F1.

En termes simples

Si 99 % des transactions sont légitimes, un modèle qui dit que chaque transaction est légitime peut avoir 99 % d’accuracy tout en ne détectant aucune fraude. Le score semble impressionnant, mais le système échoue dans la tâche qui compte vraiment. C’est pourquoi l’accuracy doit être interprétée avec la distribution des classes et le coût des erreurs.

Analogie

L’accuracy peut ressembler à une note scolaire qui cache le fait que l’élève a évité la question la plus importante.

Pourquoi c'est important

L’accuracy est importante pour la conformité parce que les métriques mises en avant peuvent créer une fausse confiance. Dans les contextes réglementés ou à fort impact, les positifs manqués et les faux positifs peuvent affecter les droits, la sécurité, l’accès aux services, les résultats financiers ou la résilience opérationnelle. Si les équipes se fient uniquement à l’accuracy, elles peuvent approuver des systèmes qui fonctionnent mal pour les classes minoritaires, les événements rares, les utilisateurs vulnérables ou les résultats à fort enjeu.

Urgence

Les équipes devraient examiner l’accuracy avec l’équilibre des classes, la matrice de confusion, la précision, le rappel, les résultats par sous-groupe et les choix de seuil avant de l’utiliser dans des décisions de gouvernance.

Obligations clés

Une revue pratique des métriques doit commencer par vérifier la distribution des classes et définir la classe positive. Les équipes doivent calculer les valeurs de la matrice de confusion, la précision, le rappel, le score F1, le taux de faux positifs, le taux de faux négatifs et, le cas échéant, la performance par sous-groupe. Elles doivent examiner si l’accuracy cache une mauvaise performance sur les classes rares, les cas limites, les groupes protégés ou les événements opérationnellement importants. Pour la documentation de gouvernance, l’équipe doit expliquer pourquoi les métriques choisies correspondent à l’usage prévu et quels risques résiduels demeurent.

  • Vérifier le déséquilibre des classes
  • Examiner la matrice de confusion
  • Présenter la précision et le rappel
  • Évaluer la performance par sous-groupe
  • Documenter pourquoi les métriques conviennent au cas d’usage

Erreurs courantes

L’erreur la plus fréquente consiste à présenter l’accuracy comme la principale preuve de fiabilité d’un modèle. Une autre erreur consiste à comparer l’accuracy entre des jeux de données ayant des distributions de classes différentes. Les équipes peuvent aussi utiliser l’accuracy pour des tâches de classement, de filtrage ou de sécurité où les faux négatifs et les faux positifs ont des conséquences très différentes. Dans l’évaluation des LLM, une erreur analogue consiste à utiliser un taux de réussite global sans vérifier la factualité, les échecs de refus, les sorties nuisibles ou les erreurs d’ancrage dans les sources.

Modèle de fraude avec accuracy élevée mais faible rappel de fraude

Classificateur médical peu performant sur les affections rares

Modèle de recrutement qui masque les erreurs par sous-groupe

Système de sécurité évalué uniquement par un taux de réussite moyen

Related Atlas Content

Cette réponse doit renvoyer aux pages Atlas sur l’accuracy, la précision, le rappel, le score F1, les métriques, les benchmarks et l’évaluation de modèle. Elle doit aussi se connecter à des exemples d’incidents où une mesure faible, une validation insuffisante ou des schémas d’erreur cachés ont contribué à un préjudice réel. L’objectif est de présenter l’accuracy comme une métrique parmi d’autres, et non comme un argument d’assurance complet.

Termes clés

Sources

  • Caesar AI Atlas glossary
  • AI Incident Database curated records