Débutant
Qu’est-ce que l’évaluation de modèle ?
L’évaluation est le processus qui consiste à mesurer la qualité, le comportement ou la performance d’un modèle, d’un système ou d’un changement par rapport à des critères définis. En apprentissage automatique, elle peut utiliser des données de validation et de test, tandis que l’évaluation des LLM peut aussi inclure la sécurité, la factualité, la robustesse et l’impact sur les utilisateurs.
Qu’est-ce qu’un benchmark en évaluation de l’IA ?
Un benchmark est un test, un jeu de données, une tâche ou une procédure d’évaluation standardisés utilisés pour mesurer et comparer les performances de systèmes d’IA.
Quelle est la différence entre précision et rappel ?
Utilisez la précision lorsque les faux positifs sont coûteux ; utilisez le rappel lorsque les positifs manqués sont coûteux.
Pourquoi l’accuracy peut-elle être trompeuse ?
L’accuracy est une métrique de classification égale à la proportion de prédictions correctes parmi toutes les prédictions effectuées. Elle est utile dans certains contextes d’évaluation, mais peut être trompeuse lorsque les classes sont déséquilibrées, où la précision, le rappel ou d’autres métriques peuvent mieux refléter la performance du modèle.