Ausgaben bewahren, bevor Sie sie zusammenfassen
Eine Analyse beginnt mit der Verknüpfung von Eingaben, Referenzen und Vorhersagen. Prüfen Sie, dass jeder erwartete Identifikator genau einmal vorkommt. Unterscheiden Sie eine falsche Antwort von einer nicht abgeschlossenen Anfrage, einem Duplikat oder einer unlesbaren Ausgabe. Diese Probleme haben nicht dieselbe Lösung und dürfen bei der Mittelwertbildung nicht verschwinden.
Bewahren Sie die Rohausgabe neben ihrer normalisierten Version auf, dazu die Modellrevision, den Prompt, die Einstellungen und den Grund für das Urteil. Eine Konvertierung, die stillschweigend ein mehrdeutiges Datum umwandelt, kann einen künstlichen Erfolg erzeugen. Beginnen Sie die Erkundung an der Validierung. Wenn der finale Test dazu dient, die nächste Korrektur zu erfinden, ist eine getrennt gehaltene neue Bestätigung erforderlich.
Technische Quellen: scikit-learn 1.9 — den Test von den Modellentscheidungen fernhalten
Eine Konfusionsmatrix mit ihren Häufigkeiten lesen
Bei einer Klassifikation mit einer Kategorie pro Eingabe kreuzt die Matrix die Referenzklasse und die vorhergesagte Klasse. In der hier und in scikit-learn verwendeten Konvention tragen die Zeilen die Referenz und die Spalten die Vorhersage. Bewahren Sie die Rohhäufigkeiten vor der Normalisierung auf: Ein Prozentsatz ohne die Anzahl der Beispiele kann die Belastbarkeit einer Schlussfolgerung übertreiben.
Das folgende Beispiel ist fiktiv und rein arithmetisch. Hundert Tickets verteilen sich auf Rechnung, Zugang und Löschung. Die Diagonale enthält 54 + 24 + 5 = 83 richtige Antworten, also 83 %. Diese Summe verdeckt die Klasse Löschung: Nur 5 der 10 erwarteten Tickets werden erkannt. Kein Modell und keine GPU haben diese Zahlen erzeugt.
| Referenz | Vorhergesagt Rechnung | Vorhergesagt Zugang | Vorhergesagt Löschung | Tatsächliche Summe |
|---|---|---|---|---|
| Rechnung | 54 | 5 | 1 | 60 |
| Zugang | 4 | 24 | 2 | 30 |
| Löschung | 4 | 1 | 5 | 10 |
| Vorhergesagte Summe | 62 | 30 | 8 | 100 |
Technische Quellen: scikit-learn 1.9 — Definition der Konfusionsmatrix
Präzision, Recall und praktische Konsequenz verknüpfen
Für Löschung beträgt die Präzision 5/8 = 62,5 %: Von den in diese Kategorie gesendeten Tickets sind fünf korrekt. Der Recall beträgt 5/10 = 50 %: Die Hälfte der Tickets dieser Kategorie wird gefunden. Der F1-Wert beträgt 2 × 5 / (2 × 5 + 3 + 5), also etwa 55,56 %. Die drei falsch positiven und die fünf falsch negativen Fälle beschreiben unterschiedliche Probleme.
Die F1-Werte der Klassen Rechnung, Zugang und Löschung betragen jeweils 88,52 %, 80 % und 55,56 %. Ihr ungewichteter Mittelwert, der Macro-F1, beträgt etwa 74,69 %. Er ergänzt die 83 % richtigen Antworten, ohne die Häufigkeiten zu ersetzen. Wenn eine Klasse in den Referenzen oder den Vorhersagen fehlt, können manche Metriken undefiniert sein: Nennen Sie die verwendete Konvention, statt den Fall in einem Mittelwert zu verbergen.
Technische Quellen: scikit-learn 1.9 — Präzision, Recall, F1, Mittelwerte und Division durch null
Eine kurze, mit Aktionen verknüpfte Taxonomie aufbauen
Eine Fehlerkategorie soll bei der Entscheidung helfen, was untersucht werden muss. Beginnen Sie mit wenigen Kategorien, einer Definition und einem repräsentativen Beispiel. Fügen Sie ein Hauptlabel hinzu, um die Fälle ohne Doppelzählung zu zählen, und dann sekundäre Labels, wenn mehrere Phänomene gleichzeitig auftreten. Behalten Sie eine Kategorie „zu prüfen" bei, statt eine Erklärung zu erzwingen.
Diese Taxonomie ist ein Arbeitsvorschlag, keine automatische Diagnose. Ein abgeschnittener Text kann auch eine Referenzmehrdeutigkeit enthalten. Die Häufigkeit eines Labels beschreibt die erneut geprüften Fälle; sie belegt noch keine Ursache. Bewahren Sie die Eingabepassage auf, die Ihre Interpretation stützt, und unterscheiden Sie beobachtete Ursache, Hypothese und fehlende Information.
| Hauptfehler | Was zu prüfen ist | Mögliches nächstes Experiment |
|---|---|---|
| Unvollständige Eingabe | Kürzung, fehlendes Teil, falsche Zusammenstellung | Aufbereitung korrigieren und dieselben Fälle erneut durchspielen |
| Ungültiges Format | Verbotenes Feld oder verbotene Kategorie, Parsing unmöglich | Ausgabekontrakt ändern und auch den Inhalt prüfen |
| Falscher Inhalt | Falsches Feld, Verwechslung zwischen Kategorien | Eine gezielte Anweisung oder ein gezieltes Beispiel testen |
| Anfechtbare Referenz | Mehrdeutige Annotation, widersprüchliche Anweisung | Entscheiden und dann die Referenz für alle Varianten versionieren |
| Unvollständige Ausführung | Abbruch, Timeout, fehlendes Ergebnis | Pipeline behandeln; den Fehlschlag in der Bilanz behalten |
Bei der Extraktion Felder und Dokumente zählen
Ein gültiges JSON-Format garantiert nicht, dass die Werte korrekt sind. Legen Sie die zulässigen Normalisierungen fest: kanonisches Datum, Dezimaltrennzeichen, Leerzeichen oder Kategoriecodes. Unterscheiden Sie fehlendes Feld, erfundenen Wert und erlaubte Enthaltung. Ein im Dokument fehlender Wert darf nicht durch eine Vermutung ersetzt werden, um die Ausfüllquote zu verbessern.
Hier ist eine zweite illustrative Berechnung, unabhängig von der Klassifikationstabelle. Fünfzig Dokumente enthalten jeweils drei erwartete Felder, also 150 Werte. Angenommen, 38 Dokumente sind vollständig korrekt, sechs mit zwei korrekten Feldern und sechs mit einem einzigen. Das ergibt 38 × 3 + 6 × 2 + 6 × 1 = 132 korrekte Werte, also 88 %. Dennoch sind nur 38/50 = 76 % der Dokumente vollständig akzeptabel, wenn alle drei Felder erforderlich sind.
Die 18 falschen Werte betreffen zwölf Dokumente. Stellen Sie sie nicht als achtzehn fehlerhafte Dokumente dar. Je nach Verwendung ist die nutzbringende Einheit ein geprüftes Feld oder ein vollständig akzeptiertes Dokument; definieren Sie sie vor dem Vergleich. Behalten Sie die Ergebnisse pro Feld bei, um zu wissen, ob die Schwierigkeit von den Daten, den Beträgen oder den Kategorien herrührt.
| Dokumenttyp | Dokumente | Korrekte Felder pro Dokument | Korrekte Felder insgesamt |
|---|---|---|---|
| Vollständig korrekt | 38 | 3 | 114 |
| Ein Fehler | 6 | 2 | 12 |
| Zwei Fehler | 6 | 1 | 6 |
| Gesamt | 50 | — | 132 von 150 |
Die Korrektur wählen, bevor eine Kampagne neu gestartet wird
Priorisieren Sie nach der Konsequenz und dem betroffenen Umfang, nicht nur nach der Anzahl der Zeilen. In der fiktiven Matrix können die fünf Fehler bei Löschung eine Überprüfung vor den sechs Fehlern bei Rechnung verdienen, wenn das Projekt diese Kategorie als kritisch definiert hat. Diese Priorität gehört zum Projektvertrag; die Tabelle erlaubt es nicht, eine geschäftliche Schwere zu erfinden.
Formulieren Sie eine testbare Hypothese: „Lange Eingaben verlieren bei der Aufbereitung die entscheidende Passage". Wählen Sie eine Änderung, die deren Untersuchung ermöglicht, und halten Sie den Rest konstant. Gleichzeitig Beispiele hinzuzufügen, das Modell zu wechseln und den Kontext zu erhöhen kann den Score verbessern, erlaubt es aber nicht mehr, den Effekt einer einzigen Korrektur zuzuschreiben.
- Einige Erfolge zusätzlich zu den Fehlern erneut prüfen, um zu verifizieren, dass das Kriterium konsistent angewendet wird.
- Die Varianten anhand derselben Identifikatoren und Referenzen vergleichen; jede Änderung des Korpus separat melden.
- Korrigierte Fehler, fortbestehende Fehler, neue Fehler und unveränderte Fälle unterscheiden.
- Auch Beispiele außerhalb der anvisierten Kategorie erneut durchspielen, um Regressionen zu suchen.
Den Gewinn kontrollieren, ohne die Regressionen zu löschen
Eine gepaarte Berechnung zeigt, was ein Nettoscore verbirgt. Stellen Sie sich bei den einhundert fiktiven Tickets vor, neun Fehler wurden korrigiert, aber vier frühere Erfolge wurden falsch. Die Bilanz steigt von 83 auf 83 + 9 − 4 = 88 korrekte Antworten. Der Gewinn beträgt fünf Punkte, mit vier zu prüfenden Regressionen. Er bedeutet nicht, dass neun Korrekturen ohne Gegenleistung erzielt wurden.
Die Entscheidungsnotiz behält die Vorher-/Nachher-Tabellen, die korrigierten Fälle, die neuen Fehler, die Version des Korrekturmaßnahms und die erfüllten Kriterien. Wenn eine kritische Regel weiterhin verletzt wird, reicht ein höherer Durchschnitt nicht aus, um die Variante zu akzeptieren. Kosten und Dauer werden anschließend zwischen den zulässigen Optionen verglichen; ein abgelehntes Ergebnis zu beschleunigen löst das Qualitätsproblem nicht.
Die Schlussfolgerung auf das beschränken, was untersucht wurde
Ein spektakulärer Fehler ist nicht unbedingt repräsentativ. Wenn Sie vor allem lange Einträge oder Fehlschläge einer seltenen Kategorie erneut prüfen, geben Sie diese Auswahlmethode an und stellen Sie deren Häufigkeiten nicht als die des gesamten Korpus dar. Bewahren Sie außerdem die nicht entschiedenen Fälle auf: Sie definieren eine Unsicherheit Ihrer Bewertung.
Ihre Analyse ist nutzbar, wenn ein anderer Leser den Eintrag wiederfinden, das Urteil verstehen und die vorgeschlagene Korrektur überprüfen kann. Sie beweist weder die interne Ursache einer generierten Antwort noch eine garantierte zukünftige Qualität. Wechseln Sie nach der Wahl der Korrekturmaßnahme zum zurückgehaltenen finalen Satz über und archivieren Sie die Grenzen zusammen mit der Schlussfolgerung.
Praktische Fragen
Reicht ein Anstieg des Gesamtscores aus, um eine Variante zu übernehmen?
Nein. Prüfen Sie die kritischen Kategorien, die neuen Fehler und die vollständig akzeptierten Ausgaben. Ein durchschnittlicher Anstieg kann mit einer Regression einhergehen, die das Kriterium des Projekts verletzt.
Soll ich eine Referenz korrigieren, wenn das Modell ihr widerspricht?
Prüfen Sie zuerst den Eintrag und die Annotationsanweisung. Wenn die Referenz fehlerhaft ist, entscheiden Sie und versionieren Sie die Korrektur, und wenden Sie sie dann auf alle Varianten an. Die bloße Uneinigkeit des Modells rechtfertigt es nicht, die erwartete Antwort zu ändern.
Kann ich die Kategorien meiner Taxonomie addieren?
Nur wenn jeder Fall für diese Zählung eine exklusive Hauptkategorie besitzt. Sekundäre Labels können sich überschneiden; ihre Summe zählt dann Label-Vorkommen, nicht verschiedene Fehler.