Ein Grundlagen-Hub für zentrale Konzepte des maschinellen Lernens, die Rechts-, Compliance- und Produktteams benötigen, bevor sie KI-Systeme prüfen.
30
Begriffe
10
Vergleiche
8
Fragen
Die Grundlagen des maschinellen Lernens erklären, wie Modelle aus Daten lernen, wie Datensätze aufgeteilt werden und warum Modellverhalten von Trainingsentscheidungen abhängt. Dieses Thema hilft Nicht-Spezialistinnen und Nicht-Spezialisten, genügend technischen Kontext zu verstehen, um bessere Compliance-Fragen zu stellen.
Viele rechtliche und Governance-Konflikte entstehen aus grundlegenden Missverständnissen über Trainingsdaten, Modellverhalten, Validierung, Bias und Generalisierung.
Nützlich für KI-Kompetenz, Beschaffungsprüfung, Modelldokumentation, Bias-Analyse, Auditvorbereitung und funktionsübergreifende Schulungen.
Zentrale Ansätze, die beschreiben, wie Systeme aus Labels, Daten, Feedback oder Interaktion lernen.
Gängige Modellfamilien und algorithmische Bausteine, die in KI-Systemen verwendet werden.
Datensatz- und Trainingskonzepte, die Modellqualität und Governance-Risiken prägen.
Ein direkter Vergleich von überwachtem Lernen und unüberwachtem Lernen. Verstehen Sie, wie sich Lernen aus gelabelten Beispielen davon unterscheidet, Muster in Daten ohne vorhandene Labels zu finden.
Ein direkter Vergleich von Reinforcement Learning und überwachtem Lernen. Er erklärt, wie sich Lernen aus Belohnungen in einer Umgebung vom Lernen von Abbildungen aus gelabelten Beispielen unterscheidet.
Ein direkter Vergleich von überwachtem Lernen und semi-überwachtem Lernen. Verstehen Sie, wie sich Lernen aus gelabelten Beispielen von der Kombination gelabelter und ungelabelter Daten unterscheidet.
Ein direkter Vergleich von selbstüberwachtem Lernen und semi-überwachtem Lernen. Verstehen Sie, wie beide ungelabelte Daten nutzen und warum sich die Rolle von Labels unterscheidet.
Ein direkter Vergleich von Machine Learning und Deep Learning. Verstehen Sie, wie sich das breitere Feld des Lernens aus Daten von neuronalen Netzwerkmethoden mit mehreren Schichten unterscheidet.
Ein direkter Vergleich von Trainingsdaten und Testdatensatz. Verstehen Sie, warum die Daten, mit denen ein Modell angepasst wird, von den reservierten Daten getrennt werden müssen, mit denen es bewertet wird.
Ein direkter Vergleich von Trainingsdaten und Validierungsdaten. Verstehen Sie, wie sich Daten, die zur Anpassung des Modells verwendet werden, von Daten unterscheiden, die während der Entwicklung zur Abstimmung von Entscheidungen und zur Erkennung von Generalisierungsproblemen genutzt werden.
Ein direkter Vergleich von Overfitting und Underfitting. Er erklärt, wie sich das zu enge Lernen von Trainingsdaten einschließlich Rauschen oder zufälliger Details von das unzureichende Lernen aussagekräftiger Muster aus den Daten unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.
Ein direkter Vergleich von Klassifikation und Regression. Er erklärt, wie sich die Vorhersage diskreter Kategorien von die Vorhersage kontinuierlicher oder numerischer Werte unterscheidet und was diese Unterscheidung für KI-Governance, Systemdesign und Nachweise bedeutet.
Ein direkter Vergleich von Entscheidungsbaum und Random Forest. Er erklärt, wie sich ein interpretierbares überwachtes Lernmodell, das Entscheidungsregeln in einer Baumstruktur abbildet von ein Ensemble-Verfahren, das viele Entscheidungsbäume bildet und deren Ergebnisse aggregiert unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.
Selbstüberwachtes Lernen ist ein Machine-Learning-Ansatz, der Trainingssignale aus unbeschrifteten Daten selbst erzeugt. Er wandelt Aspekte eines unüberwachten Problems durch Erzeugung von Ersatzlabels in überwachtes Lernen um und ist nützlich, wenn beschriftete Daten knapp, aber unbeschriftete Daten reichlich vorhanden sind.
Semi-überwachtes Lernen ist ein Machine-Learning-Ansatz, der beim Training sowohl beschriftete als auch unbeschriftete Daten verwendet. Er ist nützlich, wenn beschriftete Beispiele teuer oder begrenzt sind, aber größere Mengen unbeschrifteter Daten helfen können, Repräsentation, Klassifikation oder Vorhersage zu verbessern.
Trainingsdaten sind der Datensatz, mit dem ein Machine-Learning-Modell durch Anpassung seiner lernbaren Parameter trainiert oder angepasst wird. Qualität, Menge, Vielfalt, Labeling und Provenienz beeinflussen stark die Leistung, Zuverlässigkeit und Compliance-Position des entstehenden Modells.
Overfitting tritt auf, wenn ein Modell die Trainingsdaten zu genau lernt, einschließlich Rauschen oder idiosynkratischer Details, und auf neuen Daten schlecht abschneidet. Es zeigt sich häufig durch hohe Trainingsleistung, aber schwächere Validierungs- oder Testleistung.
Underfitting tritt auf, wenn ein Modell zu einfach oder unzureichend trainiert ist, um sinnvolle Muster in den Daten zu erfassen. Ein underfittetes Modell schneidet sowohl auf Trainingsdaten als auch auf neuen Daten schlecht ab, weil es die für die Aufgabe erforderlichen zugrunde liegenden Beziehungen nicht gelernt hat.
Ein Entscheidungsbaum ist ein interpretierbares überwachtes Lernmodell, das Entscheidungsregeln in einer baumartigen Struktur darstellt. Die Inferenz folgt einem Pfad vom Wurzelknoten über merkmalbasierte Bedingungen zu einem Blattknoten, der die vorhergesagte Klasse oder den vorhergesagten Wert liefert.
Deep Learning ist ein Teilgebiet des maschinellen Lernens, das neuronale Netze mit mehreren Schichten verwendet, um Repräsentationen und Muster aus Daten zu lernen.
Verwende Klassifikation, wenn das Ziel eine Kategorie ist; verwende Regression, wenn das Ziel ein kontinuierlicher oder numerischer Wert ist.