Anfänger
Was ist Modellevaluation?
Evaluation ist der Prozess, die Qualität, das Verhalten oder die Leistung eines Modells, Systems oder einer Änderung anhand definierter Kriterien zu messen. Im Machine Learning kann sie Validierungs- und Testdaten verwenden, während LLM-Evaluation auch Sicherheit, Faktentreue, Robustheit und Auswirkungen auf Nutzer einbeziehen kann.
Was ist ein Benchmark in der KI-Evaluation?
Ein Benchmark ist ein standardisierter Test, Datensatz, eine Aufgabe oder ein Evaluationsverfahren, mit dem die Leistung von KI-Systemen gemessen und verglichen wird.
Wie unterscheiden sich Precision und Recall?
Verwenden Sie Precision, wenn False Positives teuer sind; verwenden Sie Recall, wenn verpasste Positives teuer sind.
Warum kann Accuracy irreführend sein?
Accuracy ist eine Klassifikationsmetrik, die dem Anteil korrekter Vorhersagen an allen getroffenen Vorhersagen entspricht. Sie ist in manchen Evaluationssituationen nützlich, kann aber bei unausgewogenen Klassen irreführend sein, wenn Precision, Recall oder andere Metriken die Modellleistung besser abbilden.