Caesar AI Atlas

Évaluation et monitoring des modèles

Un hub d’évaluation pour mesurer la qualité des modèles avant déploiement et surveiller leur comportement après déploiement.

ML engineersAI auditorsrisk teamsproduct teamscompliance teams

31

Termes

10

Comparaisons

8

Questions

À propos de ce sujet

Aperçu

L’évaluation et le monitoring des modèles aident les équipes à décider si un système est suffisamment robuste pour être déployé et s’il demeure sûr et utile après son lancement. Le thème couvre les métriques, benchmarks, plans de test, seuils, drift et preuves post-déploiement.

Pourquoi c'est important

Une mauvaise évaluation peut masquer des résultats discriminatoires, des fausses alertes, des recommandations dangereuses ou des affirmations fournisseurs exagérées. Le monitoring comble l’écart entre les résultats de laboratoire et les performances réelles.

Contexte de conformité

Utile pour les model cards, les preuves d’audit, les revues d’achat, les contrôles des systèmes à haut risque, le monitoring post-commercialisation et les investigations d’incident.

Points clés

  • 1Aucune métrique unique ne prouve qu’un modèle est sûr ou conforme.
  • 2Les données de validation et les jeux de test servent des objectifs différents.
  • 3Le choix des seuils est une décision de gouvernance, pas seulement un réglage technique.
  • 4Le monitoring est nécessaire parce que les données et les comportements changent après le déploiement.

Termes clés

Comparaisons associées

Métriques

Précision vs rappel

Comparaison côte à côte entre la précision et le rappel. Comprendre comment la précision évalue la justesse des positifs prédits, tandis que le rappel évalue combien de positifs réels ont été trouvés.

Métriques

Exactitude vs précision

Comparaison côte à côte entre l’exactitude et la précision. Comprendre pourquoi la justesse globale peut masquer une faible performance sur la classe positive et pourquoi la précision compte lorsque les faux positifs sont coûteux.

Métriques

Exactitude vs score F1

Comparaison côte à côte entre l’exactitude et le score F1. Comprendre comment la justesse globale diffère d’une mesure équilibrée de la précision et du rappel.

Métriques

Score F1 vs aire sous la courbe ROC

Comparaison côte à côte entre le score F1 et l’aire sous la courbe ROC. Comprendre comment un équilibre précision-rappel dépendant d’un seuil diffère d’une discrimination de classement sur plusieurs seuils.

Métriques

Faux positif vs faux négatif

Comparaison côte à côte du faux positif et du faux négatif. Comprendre quel type d’erreur signale à tort quelque chose d’absent et quel type d’erreur manque quelque chose de présent.

Confusion fréquente

Métrique vs Benchmark

Comparaison côte à côte d’une métrique et d’un benchmark. Elle explique en quoi les concepts diffèrent, quand chaque terme s’applique et pourquoi cette distinction compte pour la gouvernance, l’évaluation ou la conception des systèmes d’IA.

Confusion fréquente

Évaluation vs Benchmark

Comparaison côte à côte de l’évaluation et du benchmark. Elle explique en quoi les concepts diffèrent, quand chaque terme s’applique et pourquoi cette distinction compte pour la gouvernance, l’évaluation ou la conception des systèmes d’IA.

Métriques

Seuil de classification vs Seuil de décision

Comparaison côte à côte du seuil de classification et du seuil de décision. Comprenez comment le langage des seuils s’applique à la prédiction de classes et aux décisions discrètes plus larges du modèle.

Gouvernance

Surveillance du modèle vs Évaluation

Comparaison côte à côte entre la surveillance du modèle et l’évaluation. Elle explique en quoi l’observation continue d’un modèle déployé diffère de la mesure d’un modèle, d’un système ou d’un changement par rapport à des critères définis.

Confusion fréquente

Dérive des données vs dérive du modèle

Comparaison côte à côte de la dérive des données et de la dérive du modèle. Comprendre en quoi les changements de distribution des données d’entrée diffèrent des changements ou de la dégradation des performances du modèle au fil du temps.

Questions fréquentes

Qu’est-ce qu’un score F1 ?

Le score F1 est la moyenne harmonique de la précision et du rappel, utilisée pour évaluer les performances de classification et d’extraction d’informations. Il va de 0 à 1, les valeurs plus élevées indiquant un meilleur équilibre entre les positifs correctement identifiés et les positifs manqués.

1 termes associésintermediate

En quoi les faux positifs et les faux négatifs sont-ils différents ?

Utilisez faux positif pour un signalement positif incorrect ; utilisez faux négatif pour une absence incorrecte de détection d’une condition réellement positive.

1 termes associésintermediate

Qu’est-ce qu’un seuil de classification ?

Un seuil de classification est une valeur limite choisie pour convertir le score ou la probabilité d’un modèle en prédiction de classe. Modifier le seuil peut changer l’équilibre entre faux positifs et faux négatifs, ce qui fait du choix du seuil une décision importante de gouvernance et de performance.

1 termes associésintermediate

Qu’est-ce que les données de validation ?

Les données de validation sont des données utilisées pour évaluer un modèle pendant le développement et ajuster des choix tels que les hyperparamètres, les seuils ou les processus d’apprentissage. Elles doivent être distinctes des données d’entraînement et de test afin d’aider à détecter le sous-apprentissage, le surapprentissage et les problèmes de généralisation.

1 termes associésintermediate

Qu’est-ce qu’un jeu de test ?

Un jeu de test est un jeu de données réservé utilisé pour fournir une évaluation indépendante d’un modèle entraîné ou d’un système d’IA. Il doit être séparé des données d’entraînement et de validation afin que les estimations de performance reflètent mieux le comportement sur des données inédites avant le déploiement ou la publication.

1 termes associésintermediate

Qu’est-ce que la surveillance des modèles ?

La surveillance des modèles est l’observation continue des performances, entrées, sorties, dérives, erreurs, latence et santé opérationnelle d’un modèle déployé. Elle aide à détecter la dégradation, les mauvais usages, les biais, les problèmes de sécurité et les conditions nécessitant un réentraînement ou une intervention.

1 termes associésintermediate

Qu’est-ce que l’ancrage des réponses dans l’évaluation des LLM ?

L’ancrage des réponses est la propriété d’une sortie de modèle consistant à être soutenue par un matériau source précis ou par le contexte fourni. Dans l’IA générative, il aide à évaluer si une réponse est traçable à des preuves plutôt qu’à une génération non étayée du modèle.

1 termes associésadvanced

Qu’est-ce que le taux d’affirmations non étayées ?

L’UCR, ou taux d’affirmations non étayées, est le pourcentage d’affirmations dans une réponse de modèle qui ne sont pas ancrées dans des preuves de soutien. Un UCR élevé indique que le système peut produire trop d’affirmations non étayées ou hallucinées.

1 termes associésadvanced