Bewaar de output voordat je die samenvat
Een analyse begint bij de samenvoeging van invoer, referenties en voorspellingen. Controleer dat elke verwachte identificatie precies één keer voorkomt. Onderscheid een incorrect antwoord van een niet-voltooide aanvraag, een duplicaat of een onleesbare output. Deze problemen hebben niet hetzelfde remedie en mogen niet verdwijnen bij het berekenen van een gemiddelde.
Bewaar de ruwe output naast de genormaliseerde versie, de modelrevisie, de prompt, de instellingen en de reden van het oordeel. Een conversie die stilletjes een ambigue datum omzet, kan een kunstmatig succes creëren. Begin de verkenning op de validatie. Als de eindexamen dient om de volgende correctie te bedenken, is een nieuwe, apart gehouden bevestiging nodig.
Technische bronnen: scikit-learn 1.9 — houd de test gescheiden van de modelkeuzes
Een verwarringsmatrix lezen met de aantallen erbij
Voor een classificatie met één categorie per invoer kruist de matrix de referentieklasse en de voorspelde klasse. In de conventie die hier en in scikit-learn wordt gebruikt, bevatten de rijen de referentie en de kolommen de voorspelling. Bewaar de ruwe aantallen voordat je normaliseert: een percentage zonder het aantal voorbeelden kan de stevigheid van een conclusie overdrijven.
Het volgende voorbeeld is fictief en louter rekenkundig. Honderd tickets zijn verdeeld over Factuur, Toegang en Verwijdering. De diagonaal bevat 54 + 24 + 5 = 83 correcte antwoorden, dus 83 %. Dat totaal verbergt de klasse Verwijdering: slechts 5 van de 10 verwachte tickets worden herkend. Geen enkel model of GPU heeft deze cijfers geproduceerd.
| Referentie | Voorspeld Factuur | Voorspeld Toegang | Voorspeld Verwijdering | Werkelijk totaal |
|---|---|---|---|---|
| Factuur | 54 | 5 | 1 | 60 |
| Toegang | 4 | 24 | 2 | 30 |
| Verwijdering | 4 | 1 | 5 | 10 |
| Voorspeld totaal | 62 | 30 | 8 | 100 |
Technische bronnen: scikit-learn 1.9 — definitie van de verwarringsmatrix
Precisie, recall en praktische consequentie met elkaar verbinden
Voor Verwijdering is de precisie 5/8 = 62,5 %: van de tickets die in deze categorie worden ingedeeld, zijn er vijf correct. De recall is 5/10 = 50 %: de helft van de tickets in deze categorie wordt teruggevonden. De F1 is 2 × 5 / (2 × 5 + 3 + 5), dus ongeveer 55,56 %. De drie fout-positieven en de vijf fout-negatieven beschrijven verschillende problemen.
De F1 van de klassen Factuur, Toegang en Verwijdering zijn respectievelijk 88,52 %, 80 % en 55,56 %. Hun ongewogen gemiddelde, de macro-F1, is ongeveer 74,69 %. Dat vult de 83 % correcte antwoorden aan, zonder de aantallen te vervangen. Als een klasse afwezig is in de referenties of de voorspellingen, kunnen sommige metrieken ongedefinieerd zijn: vermeld de gebruikte conventie in plaats van het geval in een gemiddelde te verbergen.
Technische bronnen: scikit-learn 1.9 — precisie, recall, F1, gemiddelden en delingen door nul
Een korte taxonomie opbouwen, gekoppeld aan acties
Een foutcategorie moet helpen beslissen wat je onder de loep neemt. Begin met een paar categorieën, een definitie en een representatief voorbeeld. Voeg een hoofdlabe toe om gevallen te tellen zonder dubbel te tellen, en daarna secundaire labels als meerdere fenomenen samen voorkomen. Houd een categorie 'te onderzoeken' aan in plaats van een verklaring te forceren.
Deze taxonomie is een werkvoorstel, geen automatische diagnose. Een afgekapt document kan ook een referentie-ambiguïteit bevatten. De frequentie van een label beschrijft de herlezen gevallen; ze bewijst nog geen oorzaak. Bewaar het invoerfragment dat je interpretatie ondersteunt en onderscheid waargenomen oorzaak, hypothese en ontbrekende informatie.
| Belangrijkste fout | Wat je moet onderzoeken | Mogelijk volgend experiment |
|---|---|---|
| Onvolledige invoer | Afkapping, ontbrekend stuk, verkeerde assemblage | Voorbereiding corrigeren en dezelfde gevallen opnieuw spelen |
| Ongeldig formaat | Verboden veld of categorie, parsing onmogelijk | Het uitvoercontract wijzigen en ook de inhoud controleren |
| Onjuiste inhoud | Fout veld, verwarring tussen categorieën | Een gerichte instructie of voorbeeld testen |
| Betwistbare referentie | Ambiguïteit bij annotatie, tegenstrijdige instructie | Beslechten en de referentie versioneren voor alle varianten |
| Onvolledige uitvoering | Stop, timeout, ontbrekend resultaat | De pipeline aanpakken; het falen in de balans bewaren |
Voor extractie velden en documenten tellen
Een geldig JSON-formaat garandeert niet dat de waarden correct zijn. Leg de toegestane normalisaties vast: canonieke datum, decimaalteken, spaties of categoriecodes. Onderscheid een ontbrekend veld, een verzonnen waarde en een toegestane abstentie. Een waarde die in het document ontbreekt, mag niet door een gok worden vervangen om het vulpercentage te verbeteren.
Hier is een tweede illustratieve berekening, onafhankelijk van de classificatietabel. Vijftig documenten hebben elk drie verwachte velden, dus 150 waarden. Stel dat 38 documenten volledig correct zijn, zes met twee correcte velden en zes met één. Dat geeft 38 × 3 + 6 × 2 + 6 × 1 = 132 correcte waarden, dus 88%. Toch is slechts 38/50 = 76% van de documenten volledig acceptabel als de drie velden vereist zijn.
De 18 onjuiste waarden raken twaalf documenten. Presenteer ze niet als achttien gebrekkige documenten. Afhankelijk van het gebruik is de nuttige eenheid een gecontroleerd veld of een volledig geaccepteerd document; definieer die vóór de vergelijking. Bewaar de resultaten per veld om te weten of de moeilijkheid van datums, bedragen of categorieën komt.
| Type document | Documenten | Correcte velden per document | Correcte velden in totaal |
|---|---|---|---|
| Volledig correct | 38 | 3 | 114 |
| Eén fout | 6 | 2 | 12 |
| Twee fouten | 6 | 1 | 6 |
| Totaal | 50 | — | 132 van 150 |
Kies de correctie voordat je een campagne opnieuw start
Geef prioriteit op basis van het gevolg en het getroffen bereik, niet alleen op basis van het aantal regels. In de fictieve matrix kunnen de vijf fouten van Verwijdering een review verdienen vóór de zes fouten van Factuur als het project die categorie als kritiek heeft gedefinieerd. Die prioriteit hoort bij het projectcontract; de tabel laat niet toe een zakelijke ernst te verzinnen.
Formuleer een testbare hypothese: 'Lange invoer verliest het beslissende fragment tijdens de voorbereiding'. Kies een wijziging waarmee je dat kunt onderzoeken en houd de rest constant. Gelijktijdig voorbeelden toevoegen, van model wisselen en de context vergroten kan de score verbeteren, maar maakt het niet meer mogelijk het effect aan één correctie toe te schrijven.
- Herlees enkele successen naast de fouten, om te controleren of het criterium consistent wordt toegepast.
- Vergelijk de varianten op dezelfde identifiers en referenties; meld elke wijziging van het corpus afzonderlijk.
- Onderscheid gecorrigeerde fouten, blijvende fouten, nieuwe fouten en ongewijzigde gevallen.
- Speel ook voorbeelden buiten de beoogde categorie opnieuw om regressies op te sporen.
Controleer de winst zonder regressies uit te wissen
Een gepaarde berekening toont wat een netscore verbergt. Stel dat van de honderd fictieve tickets negen fouten zijn gecorrigeerd, maar vier oude successen onjuist zijn geworden. De balans gaat van 83 naar 83 + 9 − 4 = 88 correcte antwoorden. De winst is vijf punten, met vier regressies om te onderzoeken. Dat betekent niet dat negen correcties zonder tegenprestatie zijn behaald.
Het beslisdocument bewaart de voor/na-tabellen, de gecorrigeerde gevallen, de nieuwe fouten, de versie van de correctie en de gehaalde criteria. Als een kritieke regel nog steeds wordt overtreden, volstaat een hoger gemiddelde niet om de variant te accepteren. Kosten en duur worden daarna vergeleken tussen de toelaatbare opties; een afgewezen resultaat versnellen lost het kwaliteitsprobleem niet op.
Beperk de conclusie tot wat is onderzocht
Een spectaculaire fout is niet noodzakelijk representatief. Als je vooral lange invoeren of mislukkingen van een zeldzame categorie herleest, vermeld dan die selectiemethode en presenteer hun frequenties niet als die van het hele corpus. Bewaar ook de niet-beslechte gevallen: die definiëren een onzekerheid in je evaluatie.
Je analyse is bruikbaar wanneer een andere lezer de invoer kan terugvinden, het oordeel kan begrijpen en de voorgestelde correctie kan verifiëren. Ze bewijst noch de interne oorzaak van een gegenereerd antwoord, noch een gegarandeerde toekomstige kwaliteit. Ga over naar de apart gehouden eindsets nadat de correctie is gekozen, en archiveer daarna de beperkingen samen met de conclusie.
Praktische vragen
Volstaat een stijging van de globale score om een variant te weerhouden?
Nee. Controleer de kritieke categorieën, de nieuwe fouten en de volledig geaccepteerde uitvoeren. Een gemiddelde stijging kan samengaan met een regressie die het criterium van het project overtreedt.
Moet ik een referentie corrigeren wanneer het model die tegenspreekt?
Controleer eerst de invoer en de annotatie-instructie. Als de referentie fout is, beslis en versionneer de correctie, en pas die toe op alle varianten. Enkel de onenigheid van het model rechtvaardigt niet om het verwachte antwoord te wijzigen.
Mag ik de categorieën van mijn taxonomie optellen?
Alleen als elk geval één exclusieve hoofdcategorie heeft voor die telling. Secundaire labels kunnen overlappen; hun som telt dan voorkomens van labels, niet afzonderlijke fouten.