Klassifizierung und Extraktion: die Aufgaben mit dem höchsten Ertrag
Warum gerade diese
Klassifizierung und Extraktion haben eine prüfbare richtige Antwort, eine kurze günstige Ausgabe und eine einfache Anbindung an bestehende Systeme. Es sind auch die Fälle, in denen ein Modell wiederkehrende Handarbeit ersetzt — Anfragen leiten, Rechnungen lesen, Leads etikettieren.
Dagegen ist eine offene Chat-Oberfläche schwer zu messen, teuer und lädt zu Erwartungen ein, die das System nicht immer erfüllt.
Wie man richtig baut
Definieren Sie geschlossene Kategorien mit einer geschriebenen Definition je Kategorie, inklusive einer „unklar“-Kategorie. Ohne sie wird das Modell jeden Fall in die nächste Kategorie drücken und Ihnen in den Zahlen lügen.
Bei der Extraktion: definieren Sie ein strenges Schema, validieren im Code und geben einen leeren Wert statt einer Vermutung zurück. Ein halluziniertes Feld ist gefährlicher als ein fehlendes.
Mensch in der Schleife
Leiten Sie Fälle geringer Sicherheit an einen Menschen und nutzen Sie dessen Entscheidungen, um den Evaluationssatz zu vergrößern. So verbessert sich das System durch Nutzung, ohne ein Trainingsprojekt.
Im Detail
Messen Sie jede Kategorie getrennt — eine Gesamtgenauigkeit von 92 Prozent kann eine kritische Kategorie bei 60 verbergen. Und bauen Sie eine Verwechslungsmatrix: Sie zeigt nicht nur, wie viele Fehler es gibt, sondern welche Kategorien sich vertauschen, was meist ein Definitions- und kein Modellfehler ist.