Comparaison côte à côte de l’apprentissage supervisé et de l’apprentissage semi-supervisé. Comprendre en quoi l’apprentissage à partir d’exemples étiquetés diffère de la combinaison de données étiquetées et non étiquetées.
Verdict rapide: Utilisez l’apprentissage supervisé lorsque des exemples entrée-sortie étiquetés sont disponibles ; utilisez l’apprentissage semi-supervisé lorsque les étiquettes sont limitées mais que des données non étiquetées peuvent améliorer l’entraînement.
Supervised Learning describes machine learning approach in which a model learns from examples that pair inputs with known target outputs or labels.
Contexte : Particulièrement pertinent lorsque des exemples étiquetés fiables sont disponibles pour la tâche.
Semi-Supervised Learning summarizes machine learning approach that uses both labeled and unlabeled data during training.
Contexte : Particulièrement pertinent lorsqu’un petit jeu de données étiquetées peut être combiné à un plus grand volume de données non étiquetées pour améliorer les performances.
| Aspect | Supervised Learning | Semi-Supervised Learning |
|---|---|---|
| Objectif | L’apprentissage supervisé apprend des correspondances entre des entrées et des étiquettes ou sorties cibles connues. | L’apprentissage semi-supervisé utilise ensemble des données étiquetées et non étiquetées afin d’améliorer la représentation, la classification ou la prédiction. |
| Quand l’utiliser | À utiliser lorsque suffisamment d’exemples étiquetés fiables sont disponibles pour la tâche. | À utiliser lorsque les étiquettes sont coûteuses ou limitées, mais que de grands volumes de données non étiquetées pertinentes sont disponibles. |
| Exigences en matière de données | Nécessite des exemples étiquetés associant les entrées à des sorties cibles ou à des étiquettes. | Nécessite quelques exemples étiquetés ainsi que des données non étiquetées capables d’aider le modèle à apprendre une structure utile. |
| Compromis | Il peut être plus facile à valider parce que les étiquettes définissent la cible d’apprentissage, mais l’étiquetage peut être coûteux. | Il peut réduire la charge d’étiquetage, mais introduit des hypothèses supplémentaires sur la qualité et la représentativité des données non étiquetées. |
| Erreur fréquente | Une erreur fréquente consiste à ignorer la qualité des étiquettes et à les traiter comme une vérité de référence sans examen. | Une erreur fréquente consiste à supposer que n’importe quelles données non étiquetées amélioreront les performances. |
| Implication de gouvernance | La gouvernance doit se concentrer sur la provenance des étiquettes, leur qualité, la définition de la tâche et la validation des performances. | La gouvernance doit aussi évaluer les sources de données non étiquetées, leur représentativité et leur effet sur le comportement du modèle. |
En pratique, l’apprentissage semi-supervisé est attractif lorsque l’étiquetage est coûteux, mais ce n’est pas un raccourci pour contourner la gouvernance des données. Les données non étiquetées influencent tout de même le modèle et doivent être traitées comme une partie de la base probatoire.
Supposer que l’apprentissage supervisé est fiable simplement parce que des étiquettes existent.
Utiliser des données non étiquetées en apprentissage semi-supervisé sans vérification de représentativité.
Ne pas documenter la manière dont les données étiquetées et non étiquetées ont été sélectionnées.
Comparer des modèles sans tenir compte des différentes sources de données.
Utilisez l’apprentissage supervisé lorsque le processus d’entraînement repose sur des exemples étiquetés qui définissent les sorties attendues. Il convient aux tâches de classification, de régression et de prédiction disposant d’étiquettes cibles fiables.
Utilisez l’apprentissage semi-supervisé lorsque les données étiquetées sont limitées mais que les données non étiquetées peuvent aider le modèle à apprendre des représentations utiles ou à améliorer ses prédictions. Il doit être étayé par des preuves montrant que les données non étiquetées sont pertinentes et non préjudiciables.
La gouvernance des données et les preuves de validation sont importantes pour les deux approches. Dans le cadre de contrôles de type ISO/IEC 42001 et NIST AI RMF, les équipes doivent documenter la qualité des étiquettes, la provenance des données, les limites des jeux de données et les preuves de performance.
L’apprentissage supervisé utilise des exemples étiquetés avec des sorties connues. L’apprentissage semi-supervisé utilise à la fois des données étiquetées et non étiquetées pendant l’entraînement.
Il est utile lorsque les exemples étiquetés sont coûteux ou limités, mais que des données non étiquetées disponibles sont pertinentes. Ces données peuvent aider à améliorer la représentation, la classification ou la prédiction.
Non. Il utilise toujours des données étiquetées, mais les combine avec des données non étiquetées. Les exemples étiquetés aident à guider le processus d’apprentissage.
No recently viewed comparisons yet.