Débutant
Qu’est-ce que l’évaluation de modèle ?
L’évaluation est le processus qui consiste à mesurer la qualité, le comportement ou la performance d’un modèle, d’un système ou d’un changement par rapport à des critères définis. En apprentissage automatique, elle peut utiliser des données de validation et de test, tandis que l’évaluation des LLM peut aussi inclure la sécurité, la factualité, la robustesse et l’impact sur les utilisateurs.
Qu’est-ce qu’un benchmark en évaluation de l’IA ?
Un benchmark est un test, un jeu de données, une tâche ou une procédure d’évaluation standardisés utilisés pour mesurer et comparer les performances de systèmes d’IA.
Quelle est la différence entre précision et rappel ?
Utilisez la précision lorsque les faux positifs sont coûteux ; utilisez le rappel lorsque les positifs manqués sont coûteux.
Pourquoi l’accuracy peut-elle être trompeuse ?
L’accuracy est une métrique de classification égale à la proportion de prédictions correctes parmi toutes les prédictions effectuées. Elle est utile dans certains contextes d’évaluation, mais peut être trompeuse lorsque les classes sont déséquilibrées, où la précision, le rappel ou d’autres métriques peuvent mieux refléter la performance du modèle.
Intermédiaire
Qu’est-ce qu’un score F1 ?
Le score F1 est la moyenne harmonique de la précision et du rappel, utilisée pour évaluer les performances de classification et d’extraction d’informations. Il va de 0 à 1, les valeurs plus élevées indiquant un meilleur équilibre entre les positifs correctement identifiés et les positifs manqués.
En quoi les faux positifs et les faux négatifs sont-ils différents ?
Utilisez faux positif pour un signalement positif incorrect ; utilisez faux négatif pour une absence incorrecte de détection d’une condition réellement positive.
Qu’est-ce qu’un seuil de classification ?
Un seuil de classification est une valeur limite choisie pour convertir le score ou la probabilité d’un modèle en prédiction de classe. Modifier le seuil peut changer l’équilibre entre faux positifs et faux négatifs, ce qui fait du choix du seuil une décision importante de gouvernance et de performance.
Qu’est-ce que les données de validation ?
Les données de validation sont des données utilisées pour évaluer un modèle pendant le développement et ajuster des choix tels que les hyperparamètres, les seuils ou les processus d’apprentissage. Elles doivent être distinctes des données d’entraînement et de test afin d’aider à détecter le sous-apprentissage, le surapprentissage et les problèmes de généralisation.
Qu’est-ce qu’un jeu de test ?
Un jeu de test est un jeu de données réservé utilisé pour fournir une évaluation indépendante d’un modèle entraîné ou d’un système d’IA. Il doit être séparé des données d’entraînement et de validation afin que les estimations de performance reflètent mieux le comportement sur des données inédites avant le déploiement ou la publication.
Qu’est-ce que la surveillance des modèles ?
La surveillance des modèles est l’observation continue des performances, entrées, sorties, dérives, erreurs, latence et santé opérationnelle d’un modèle déployé. Elle aide à détecter la dégradation, les mauvais usages, les biais, les problèmes de sécurité et les conditions nécessitant un réentraînement ou une intervention.
Avancé
Qu’est-ce que l’ancrage des réponses dans l’évaluation des LLM ?
L’ancrage des réponses est la propriété d’une sortie de modèle consistant à être soutenue par un matériau source précis ou par le contexte fourni. Dans l’IA générative, il aide à évaluer si une réponse est traçable à des preuves plutôt qu’à une génération non étayée du modèle.
Qu’est-ce que le taux d’affirmations non étayées ?
L’UCR, ou taux d’affirmations non étayées, est le pourcentage d’affirmations dans une réponse de modèle qui ne sont pas ancrées dans des preuves de soutien. Un UCR élevé indique que le système peut produire trop d’affirmations non étayées ou hallucinées.