Un hub de fondamentaux pour les concepts centraux du machine learning dont les équipes juridiques, compliance et produit ont besoin avant d’examiner des systèmes d’IA.
30
Termes
10
Comparaisons
8
Questions
Les fondamentaux du machine learning expliquent comment les modèles apprennent à partir des données, comment les jeux de données sont séparés et pourquoi le comportement d’un modèle dépend des choix d’entraînement. Ce thème aide les non-spécialistes à comprendre suffisamment le contexte technique pour poser de meilleures questions de conformité.
De nombreux litiges juridiques et problèmes de gouvernance naissent de malentendus fondamentaux sur les données d’entraînement, le comportement des modèles, la validation, les biais et la généralisation.
Utile pour l’acculturation à l’IA, les revues d’achat, la documentation des modèles, l’analyse des biais, la préparation d’audits et la formation transverse.
Approches centrales décrivant comment les systèmes apprennent à partir de labels, de données, de feedback ou d’interactions.
Familles de modèles courantes et briques algorithmiques utilisées dans les systèmes d’IA.
Concepts de jeux de données et d’entraînement qui influencent la qualité des modèles et les risques de gouvernance.
Comparaison côte à côte entre l’apprentissage supervisé et l’apprentissage non supervisé. Comprendre comment l’apprentissage à partir d’exemples étiquetés diffère de la découverte de motifs dans des données sans étiquettes préexistantes.
Comparaison côte à côte de l’apprentissage par renforcement et de l’apprentissage supervisé. Elle explique comment l’apprentissage à partir de récompenses dans un environnement diffère de l’apprentissage de correspondances à partir d’exemples étiquetés.
Comparaison côte à côte de l’apprentissage supervisé et de l’apprentissage semi-supervisé. Comprendre en quoi l’apprentissage à partir d’exemples étiquetés diffère de la combinaison de données étiquetées et non étiquetées.
Comparaison côte à côte de l’apprentissage auto-supervisé et de l’apprentissage semi-supervisé. Comprendre comment chacun utilise des données non étiquetées et pourquoi le rôle des étiquettes diffère.
Comparaison côte à côte entre l’apprentissage automatique et l’apprentissage profond. Comprendre comment le domaine plus large de l’apprentissage à partir des données diffère des méthodes de réseaux neuronaux à couches multiples.
Comparaison côte à côte entre les données d’entraînement et le jeu de test. Comprendre pourquoi les données utilisées pour ajuster un modèle doivent être séparées des données réservées pour l’évaluer.
Comparaison côte à côte entre les données d’entraînement et les données de validation. Comprendre comment les données utilisées pour ajuster le modèle diffèrent des données utilisées pendant le développement pour régler les choix et détecter les problèmes de généralisation.
Comparaison côte à côte entre le surapprentissage et le sous-apprentissage. Elle explique en quoi apprendre trop étroitement les données d’entraînement diffère de ne pas apprendre de schémas significatifs dans les données.
Comparaison côte à côte de la classification et de la régression. Comprenez en quoi prédire des catégories discrètes diffère de prédire des valeurs continues ou numériques.
Comparaison côte à côte entre arbre de décision et forêt aléatoire. Elle explique comment un modèle supervisé interprétable en structure arborescente diffère d’une méthode ensembliste qui agrège de nombreux arbres de décision.
L’apprentissage auto-supervisé est une approche d’apprentissage automatique qui crée des signaux d’entraînement à partir des données non étiquetées elles-mêmes. Il convertit certains aspects d’un problème non supervisé en apprentissage supervisé en générant des étiquettes de substitution, ce qui le rend utile lorsque les données étiquetées sont rares mais que les données non étiquetées sont abondantes.
L’apprentissage semi-supervisé est une approche d’apprentissage automatique qui utilise à la fois des données étiquetées et non étiquetées pendant l’entraînement. Il est utile lorsque les exemples étiquetés sont coûteux ou limités, mais que des volumes plus importants de données non étiquetées peuvent aider à améliorer la représentation, la classification ou la prédiction.
Les données d’entraînement sont le jeu de données utilisé pour enseigner ou ajuster un modèle d’apprentissage automatique en modifiant ses paramètres apprenables. Leur qualité, quantité, diversité, étiquetage et provenance influencent fortement les performances, la fiabilité et la posture de conformité du modèle obtenu.
Le surapprentissage se produit lorsqu’un modèle apprend les données d’entraînement de trop près, y compris le bruit ou les détails idiosyncratiques, et fonctionne mal sur de nouvelles données. Il est généralement indiqué par de très bonnes performances à l’entraînement, mais des performances plus faibles en validation ou en test.
Le sous-apprentissage se produit lorsqu’un modèle est trop simple ou insuffisamment entraîné pour capturer des motifs significatifs dans les données. Un modèle sous-appris fonctionne mal à la fois sur les données d’entraînement et sur les nouvelles données, car il n’a pas appris les relations sous-jacentes nécessaires à la tâche.
Un arbre de décision est un modèle d’apprentissage supervisé interprétable qui représente les règles de décision sous forme d’arbre. L’inférence suit un chemin depuis un nœud racine, à travers des conditions fondées sur les caractéristiques, jusqu’à une feuille qui fournit la classe ou la valeur prédite.
Le deep learning est un sous-domaine de l’apprentissage automatique qui utilise des réseaux de neurones à plusieurs couches pour apprendre des représentations et des motifs à partir des données.
Utilisez la classification lorsque la cible est une catégorie ; utilisez la régression lorsque la cible est une valeur continue ou numérique.