Ein Evaluations-Hub zur Messung der Modellqualität vor der Bereitstellung und zur Überwachung des Modellverhaltens nach der Bereitstellung.
31
Begriffe
10
Vergleiche
8
Fragen
Modellevaluation und Monitoring helfen Teams zu entscheiden, ob ein System gut genug für die Bereitstellung ist und ob es nach dem Release sicher und nützlich bleibt. Das Thema umfasst Metriken, Benchmarks, Testdesign, Schwellenwerte, Drift und Nachweise nach der Bereitstellung.
Schlechte Evaluation kann diskriminierende Ergebnisse, Fehlalarme, unsichere Empfehlungen oder übertriebene Anbieterbehauptungen verdecken. Monitoring schließt die Lücke zwischen Laborergebnissen und Leistung in der realen Welt.
Nützlich für Model Cards, Audit-Nachweise, Beschaffungsprüfung, Kontrollen für Hochrisikosysteme, Post-Market-Monitoring und Incident-Untersuchungen.
Grundlegende Konzepte zur Messung der Modellqualität und zur Auswahl von Nachweisen.
Begriffe zur Trennung von Trainings-, Validierungs-, Test- und Generalisierungsnachweisen.
Konzepte für Monitoring nach der Bereitstellung und die Bewertung generierter Antworten.
Ein direkter Vergleich von Precision und Recall. Verstehen Sie, wie Precision die Korrektheit vorhergesagter positiver Fälle bewertet, während Recall misst, wie viele tatsächliche positive Fälle gefunden wurden.
Ein direkter Vergleich von Accuracy und Precision. Verstehen Sie, warum Gesamt-Korrektheit schwache Leistung in der positiven Klasse verbergen kann und warum Precision wichtig ist, wenn False Positives teuer sind.
Ein direkter Vergleich von Accuracy und F1 Score. Verstehen Sie, wie sich Gesamt-Korrektheit von einem ausgewogenen Maß aus Precision und Recall unterscheidet.
Ein direkter Vergleich von F1 Score und Area Under the ROC Curve. Verstehen Sie, wie sich ein schwellenwertabhängiges Gleichgewicht aus Precision und Recall von Ranking-Diskriminierung über Schwellenwerte hinweg unterscheidet.
Ein direkter Vergleich von False Positive und False Negative. Verstehen Sie, welcher Fehlertyp etwas markiert, das nicht vorhanden ist, und welcher Fehlertyp etwas Vorhandenes übersieht.
Ein direkter Vergleich von Metrik und Benchmark. Er erklärt, wie sich das gemessene quantitative Maß vom standardisierten Test- oder Datensatzrahmen für Leistungsvergleiche unterscheidet.
Ein direkter Vergleich von Evaluierung und Benchmark. Er erklärt, wie sich der übergreifende Messprozess von einem standardisierten Test innerhalb oder zwischen Evaluierungen unterscheidet.
Ein direkter Vergleich von Klassifikationsschwelle und Entscheidungsschwelle. Er erklärt, wie sich den Cutoff, der Scores in Klassenvorhersagen umwandelt von den Cutoff, der Scores in operative Entscheidungen oder Klassen umwandelt unterscheidet und was diese Unterscheidung für KI-Governance, Systemdesign und Nachweise bedeutet.
Ein direkter Vergleich von Modellmonitoring und Evaluierung. Er erklärt, wie sich die laufende Beobachtung eines bereitgestellten Modells hinsichtlich Leistung, Inputs, Outputs, Drift, Fehlern und Gesundheit von die Messung von Qualität, Verhalten oder Leistung anhand definierter Kriterien unterscheidet und welche Folgen dies für Governance, Systemdesign und Nachweise hat.
Ein direkter Vergleich von Data Drift und Model Drift. Verstehen Sie, wie sich Änderungen in der Eingabedatenverteilung von Änderungen oder Verschlechterungen der Modellleistung über die Zeit unterscheiden.
Der F1-Score ist das harmonische Mittel aus Precision und Recall und wird verwendet, um die Leistung bei Klassifikation und Informationsextraktion zu bewerten. Er reicht von 0 bis 1; höhere Werte zeigen ein besseres Gleichgewicht zwischen korrekt erkannten positiven Fällen und übersehenen positiven Fällen an.
Verwende False Positive für eine falsche positive Markierung; verwende False Negative für das falsche Nicht-Erkennen eines tatsächlich positiven Zustands.
Ein Klassifikationsschwellenwert ist ein gewählter Grenzwert, mit dem ein Modellscore oder eine Wahrscheinlichkeit in eine Klassenvorhersage umgewandelt wird. Eine Änderung des Schwellenwerts kann das Verhältnis zwischen False Positives und False Negatives verändern und macht die Schwellenwertwahl zu einer wichtigen Governance- und Leistungsentscheidung.
Validierungsdaten sind Daten, die während der Modellentwicklung verwendet werden, um ein Modell zu bewerten und Entscheidungen wie Hyperparameter, Schwellenwerte oder Lernprozesse abzustimmen. Sie sollten von Trainings- und Testdaten getrennt sein, um Underfitting, Overfitting und Generalisierungsprobleme besser zu erkennen.
Ein Testdatensatz ist ein zurückgehaltener Datensatz, der eine unabhängige Bewertung eines trainierten Modells oder KI-Systems ermöglichen soll. Er sollte von Trainings- und Validierungsdaten getrennt sein, damit Leistungsschätzungen das Verhalten auf unbekannten Daten vor Einsatz oder Veröffentlichung besser widerspiegeln.
Modellmonitoring ist die kontinuierliche Beobachtung der Leistung, Eingaben, Ausgaben, Drift, Fehler, Latenz und operativen Gesundheit eines eingesetzten Modells. Es hilft, Leistungsabfall, Fehlanwendung, Bias, Sicherheitsprobleme und Bedingungen zu erkennen, die Retraining oder Intervention erfordern.
Groundedness ist die Eigenschaft einer Modellausgabe, durch konkretes Quellenmaterial oder bereitgestellten Kontext gestützt zu sein. In generativer KI hilft Groundedness zu bewerten, ob eine Antwort auf Nachweise zurückführbar ist statt auf unbelegte Modellgenerierung.
UCR (Unsupported-Claim-Rate) ist der Prozentsatz der Behauptungen in einer Modellantwort, die nicht durch unterstützende Nachweise gedeckt sind. Eine hohe UCR zeigt an, dass das System möglicherweise zu viele unbelegte oder halluzinierte Aussagen erzeugt.