Comparaison côte à côte entre les données d’entraînement et les données de validation. Comprendre comment les données utilisées pour ajuster le modèle diffèrent des données utilisées pendant le développement pour régler les choix et détecter les problèmes de généralisation.
Verdict rapide: Utilisez Données d’entraînement pour ajuster les paramètres du modèle ; utilisez Données de validation pour régler les choix de développement et détecter le surapprentissage ou le sous-apprentissage.
Training Data defines dataset used to teach or fit a machine learning model by adjusting its learnable parameters.
Contexte : Le plus pertinent pour les exemples qui façonnent directement l’apprentissage du modèle.
Validation Data defines data used to evaluate a model during development and tune choices such as hyperparameters, thresholds, or learning processes.
Contexte : Le plus pertinent pendant le développement, lors du choix des paramètres du modèle et de l’évaluation de la généralisation avant le test final.
| Aspect | Training Data | Validation Data |
|---|---|---|
| Objectif | Les données d’entraînement ajustent le modèle en modifiant les paramètres apprenables. | Les données de validation évaluent le modèle pendant le développement et soutiennent les choix de réglage. |
| Utilisation dans le cycle de vie | Utilisées dans le processus d’apprentissage lui-même. | Utilisées pendant le développement pour comparer, régler et diagnostiquer les modèles. |
| Risque de fuite de données | Le risque apparaît si les données de validation ou de test sont incluses dans l’entraînement. | Le risque apparaît si les données de validation sont trop utilisées jusqu’à ne plus refléter la généralisation. |
| Preuve de gouvernance | Soutiennent les preuves sur les données qui ont façonné le modèle. | Soutiennent les preuves sur les décisions de développement, seuils, hyperparamètres et contrôles de généralisation. |
| Erreur courante | Supposer que davantage de données d’entraînement améliore toujours la qualité de gouvernance, indépendamment de la provenance ou de l’étiquetage. | Traiter les résultats de validation comme des preuves finales de performance indépendante. |
En pratique, les données de validation sont l’endroit où de nombreux choix de conception cachés se produisent ; documenter ces choix est essentiel pour l’auditabilité.
Utiliser les données de validation comme données d’entraînement après que les décisions de réglage ont été prises.
Rapporter les résultats de validation comme s’il s’agissait de résultats de test finaux.
Ne pas documenter les décisions d’hyperparamètres, de seuils ou de sélection de modèle appuyées par les données de validation.
Utilisez Données d’entraînement lorsque vous discutez des exemples utilisés pour enseigner ou ajuster le modèle. Elles devraient être gouvernées pour leur qualité, quantité, diversité, étiquetage, provenance et impact sur la conformité.
Utilisez Données de validation lorsque vous discutez de l’évaluation pendant le développement utilisée pour régler les hyperparamètres, les seuils ou les choix d’apprentissage. Elles devraient être distinctes des données d’entraînement et de test pour soutenir les contrôles de généralisation.
Les preuves de validation soutiennent des contrôles défendables de développement de modèles, mais ne remplacent pas un test indépendant. La documentation de l’EU AI Act et de l’assurance IA devrait consigner la logique de partition des données, les décisions de réglage et la prévention des fuites.
Pas directement de la même manière que les données d’entraînement. Elles servent à évaluer le modèle pendant le développement et à guider les choix de réglage.
Les données de validation soutiennent les décisions de développement, tandis qu’un jeu de test est réservé à une évaluation plus indépendante après entraînement et réglage.
Elles créent des preuves pour les décisions de sélection du modèle, de réglage, de seuil et de généralisation susceptibles d’affecter les risques et les affirmations de performance.
No recently viewed comparisons yet.