Intermédiaire
Qu’est-ce qu’un score F1 ?
Le score F1 est la moyenne harmonique de la précision et du rappel, utilisée pour évaluer les performances de classification et d’extraction d’informations. Il va de 0 à 1, les valeurs plus élevées indiquant un meilleur équilibre entre les positifs correctement identifiés et les positifs manqués.
En quoi les faux positifs et les faux négatifs sont-ils différents ?
Utilisez faux positif pour un signalement positif incorrect ; utilisez faux négatif pour une absence incorrecte de détection d’une condition réellement positive.
Qu’est-ce qu’un seuil de classification ?
Un seuil de classification est une valeur limite choisie pour convertir le score ou la probabilité d’un modèle en prédiction de classe. Modifier le seuil peut changer l’équilibre entre faux positifs et faux négatifs, ce qui fait du choix du seuil une décision importante de gouvernance et de performance.
Qu’est-ce que les données de validation ?
Les données de validation sont des données utilisées pour évaluer un modèle pendant le développement et ajuster des choix tels que les hyperparamètres, les seuils ou les processus d’apprentissage. Elles doivent être distinctes des données d’entraînement et de test afin d’aider à détecter le sous-apprentissage, le surapprentissage et les problèmes de généralisation.
Qu’est-ce qu’un jeu de test ?
Un jeu de test est un jeu de données réservé utilisé pour fournir une évaluation indépendante d’un modèle entraîné ou d’un système d’IA. Il doit être séparé des données d’entraînement et de validation afin que les estimations de performance reflètent mieux le comportement sur des données inédites avant le déploiement ou la publication.
Qu’est-ce que la surveillance des modèles ?
La surveillance des modèles est l’observation continue des performances, entrées, sorties, dérives, erreurs, latence et santé opérationnelle d’un modèle déployé. Elle aide à détecter la dégradation, les mauvais usages, les biais, les problèmes de sécurité et les conditions nécessitant un réentraînement ou une intervention.
Avancé
Qu’est-ce que l’ancrage des réponses dans l’évaluation des LLM ?
L’ancrage des réponses est la propriété d’une sortie de modèle consistant à être soutenue par un matériau source précis ou par le contexte fourni. Dans l’IA générative, il aide à évaluer si une réponse est traçable à des preuves plutôt qu’à une génération non étayée du modèle.
Qu’est-ce que le taux d’affirmations non étayées ?
L’UCR, ou taux d’affirmations non étayées, est le pourcentage d’affirmations dans une réponse de modèle qui ne sont pas ancrées dans des preuves de soutien. Un UCR élevé indique que le système peut produire trop d’affirmations non étayées ou hallucinées.