Anfänger
Was ist Modellevaluation?
Evaluation ist der Prozess, die Qualität, das Verhalten oder die Leistung eines Modells, Systems oder einer Änderung anhand definierter Kriterien zu messen. Im Machine Learning kann sie Validierungs- und Testdaten verwenden, während LLM-Evaluation auch Sicherheit, Faktentreue, Robustheit und Auswirkungen auf Nutzer einbeziehen kann.
Was ist ein Benchmark in der KI-Evaluation?
Ein Benchmark ist ein standardisierter Test, Datensatz, eine Aufgabe oder ein Evaluationsverfahren, mit dem die Leistung von KI-Systemen gemessen und verglichen wird.
Wie unterscheiden sich Precision und Recall?
Verwenden Sie Precision, wenn False Positives teuer sind; verwenden Sie Recall, wenn verpasste Positives teuer sind.
Warum kann Accuracy irreführend sein?
Accuracy ist eine Klassifikationsmetrik, die dem Anteil korrekter Vorhersagen an allen getroffenen Vorhersagen entspricht. Sie ist in manchen Evaluationssituationen nützlich, kann aber bei unausgewogenen Klassen irreführend sein, wenn Precision, Recall oder andere Metriken die Modellleistung besser abbilden.
Fortgeschritten
Was ist ein F1-Score?
Der F1-Score ist das harmonische Mittel aus Precision und Recall und wird verwendet, um die Leistung bei Klassifikation und Informationsextraktion zu bewerten. Er reicht von 0 bis 1; höhere Werte zeigen ein besseres Gleichgewicht zwischen korrekt erkannten positiven Fällen und übersehenen positiven Fällen an.
Wie unterscheiden sich False Positives und False Negatives?
Verwende False Positive für eine falsche positive Markierung; verwende False Negative für das falsche Nicht-Erkennen eines tatsächlich positiven Zustands.
Was ist ein Klassifikationsschwellenwert?
Ein Klassifikationsschwellenwert ist ein gewählter Grenzwert, mit dem ein Modellscore oder eine Wahrscheinlichkeit in eine Klassenvorhersage umgewandelt wird. Eine Änderung des Schwellenwerts kann das Verhältnis zwischen False Positives und False Negatives verändern und macht die Schwellenwertwahl zu einer wichtigen Governance- und Leistungsentscheidung.
Was sind Validierungsdaten?
Validierungsdaten sind Daten, die während der Modellentwicklung verwendet werden, um ein Modell zu bewerten und Entscheidungen wie Hyperparameter, Schwellenwerte oder Lernprozesse abzustimmen. Sie sollten von Trainings- und Testdaten getrennt sein, um Underfitting, Overfitting und Generalisierungsprobleme besser zu erkennen.
Was ist ein Testdatensatz?
Ein Testdatensatz ist ein zurückgehaltener Datensatz, der eine unabhängige Bewertung eines trainierten Modells oder KI-Systems ermöglichen soll. Er sollte von Trainings- und Validierungsdaten getrennt sein, damit Leistungsschätzungen das Verhalten auf unbekannten Daten vor Einsatz oder Veröffentlichung besser widerspiegeln.
Was ist Modellmonitoring?
Modellmonitoring ist die kontinuierliche Beobachtung der Leistung, Eingaben, Ausgaben, Drift, Fehler, Latenz und operativen Gesundheit eines eingesetzten Modells. Es hilft, Leistungsabfall, Fehlanwendung, Bias, Sicherheitsprobleme und Bedingungen zu erkennen, die Retraining oder Intervention erfordern.
Experte
Was ist Groundedness in der LLM-Bewertung?
Groundedness ist die Eigenschaft einer Modellausgabe, durch konkretes Quellenmaterial oder bereitgestellten Kontext gestützt zu sein. In generativer KI hilft Groundedness zu bewerten, ob eine Antwort auf Nachweise zurückführbar ist statt auf unbelegte Modellgenerierung.
Was ist die Unsupported-Claim-Rate?
UCR (Unsupported-Claim-Rate) ist der Prozentsatz der Behauptungen in einer Modellantwort, die nicht durch unterstützende Nachweise gedeckt sind. Eine hohe UCR zeigt an, dass das System möglicherweise zu viele unbelegte oder halluzinierte Aussagen erzeugt.