GPU voor ML-onderzoek · Crypto-betaling zonder KYC
IteraGPU
Methode / Kwaliteit en diagnose

Een score omzetten in verifieerbare beslissingen.

Fouten analyseren betekent de gevallen terugvinden die een resultaat verklaren, en vervolgens een correctie kiezen waarvan het effect gecontroleerd kan worden. Bewaar de voorspellingen met hun identificatiegegevens en hun referentie, scheid fouten in formaat en inhoud, en onderzoek de belangrijke categorieën. Een globale score zegt niet welke gevallen falen of waarom. Het juiste volgende experiment corrigeert een precies mechanisme zonder nieuwe regressies te verbergen.

01 /

Bewaar de output voordat je die samenvat

Een analyse begint bij de samenvoeging van invoer, referenties en voorspellingen. Controleer dat elke verwachte identificatie precies één keer voorkomt. Onderscheid een incorrect antwoord van een niet-voltooide aanvraag, een duplicaat of een onleesbare output. Deze problemen hebben niet hetzelfde remedie en mogen niet verdwijnen bij het berekenen van een gemiddelde.

Bewaar de ruwe output naast de genormaliseerde versie, de modelrevisie, de prompt, de instellingen en de reden van het oordeel. Een conversie die stilletjes een ambigue datum omzet, kan een kunstmatig succes creëren. Begin de verkenning op de validatie. Als de eindexamen dient om de volgende correctie te bedenken, is een nieuwe, apart gehouden bevestiging nodig.

Technische bronnen: scikit-learn 1.9 — houd de test gescheiden van de modelkeuzes

02 /

Een verwarringsmatrix lezen met de aantallen erbij

Voor een classificatie met één categorie per invoer kruist de matrix de referentieklasse en de voorspelde klasse. In de conventie die hier en in scikit-learn wordt gebruikt, bevatten de rijen de referentie en de kolommen de voorspelling. Bewaar de ruwe aantallen voordat je normaliseert: een percentage zonder het aantal voorbeelden kan de stevigheid van een conclusie overdrijven.

Het volgende voorbeeld is fictief en louter rekenkundig. Honderd tickets zijn verdeeld over Factuur, Toegang en Verwijdering. De diagonaal bevat 54 + 24 + 5 = 83 correcte antwoorden, dus 83 %. Dat totaal verbergt de klasse Verwijdering: slechts 5 van de 10 verwachte tickets worden herkend. Geen enkel model of GPU heeft deze cijfers geproduceerd.

Illustratief voorbeeld — rijen: referentie; kolommen: voorspelling; eenheid: tickets
ReferentieVoorspeld FactuurVoorspeld ToegangVoorspeld VerwijderingWerkelijk totaal
Factuur545160
Toegang424230
Verwijdering41510
Voorspeld totaal62308100

Technische bronnen: scikit-learn 1.9 — definitie van de verwarringsmatrix

03 /

Precisie, recall en praktische consequentie met elkaar verbinden

Voor Verwijdering is de precisie 5/8 = 62,5 %: van de tickets die in deze categorie worden ingedeeld, zijn er vijf correct. De recall is 5/10 = 50 %: de helft van de tickets in deze categorie wordt teruggevonden. De F1 is 2 × 5 / (2 × 5 + 3 + 5), dus ongeveer 55,56 %. De drie fout-positieven en de vijf fout-negatieven beschrijven verschillende problemen.

De F1 van de klassen Factuur, Toegang en Verwijdering zijn respectievelijk 88,52 %, 80 % en 55,56 %. Hun ongewogen gemiddelde, de macro-F1, is ongeveer 74,69 %. Dat vult de 83 % correcte antwoorden aan, zonder de aantallen te vervangen. Als een klasse afwezig is in de referenties of de voorspellingen, kunnen sommige metrieken ongedefinieerd zijn: vermeld de gebruikte conventie in plaats van het geval in een gemiddelde te verbergen.

Precisie = waar-positieven / positieve voorspellingen; recall = waar-positieven / positieve referenties. Macro-F1 = gemiddelde van de F1 per klasse afzonderlijk berekend.

Technische bronnen: scikit-learn 1.9 — precisie, recall, F1, gemiddelden en delingen door nul

04 /

Een korte taxonomie opbouwen, gekoppeld aan acties

Een foutcategorie moet helpen beslissen wat je onder de loep neemt. Begin met een paar categorieën, een definitie en een representatief voorbeeld. Voeg een hoofdlabe toe om gevallen te tellen zonder dubbel te tellen, en daarna secundaire labels als meerdere fenomenen samen voorkomen. Houd een categorie 'te onderzoeken' aan in plaats van een verklaring te forceren.

Deze taxonomie is een werkvoorstel, geen automatische diagnose. Een afgekapt document kan ook een referentie-ambiguïteit bevatten. De frequentie van een label beschrijft de herlezen gevallen; ze bewijst nog geen oorzaak. Bewaar het invoerfragment dat je interpretatie ondersteunt en onderscheid waargenomen oorzaak, hypothese en ontbrekende informatie.

Starttaxonomie om aan te passen aan de taak
Belangrijkste foutWat je moet onderzoekenMogelijk volgend experiment
Onvolledige invoerAfkapping, ontbrekend stuk, verkeerde assemblageVoorbereiding corrigeren en dezelfde gevallen opnieuw spelen
Ongeldig formaatVerboden veld of categorie, parsing onmogelijkHet uitvoercontract wijzigen en ook de inhoud controleren
Onjuiste inhoudFout veld, verwarring tussen categorieënEen gerichte instructie of voorbeeld testen
Betwistbare referentieAmbiguïteit bij annotatie, tegenstrijdige instructieBeslechten en de referentie versioneren voor alle varianten
Onvolledige uitvoeringStop, timeout, ontbrekend resultaatDe pipeline aanpakken; het falen in de balans bewaren
05 /

Voor extractie velden en documenten tellen

Een geldig JSON-formaat garandeert niet dat de waarden correct zijn. Leg de toegestane normalisaties vast: canonieke datum, decimaalteken, spaties of categoriecodes. Onderscheid een ontbrekend veld, een verzonnen waarde en een toegestane abstentie. Een waarde die in het document ontbreekt, mag niet door een gok worden vervangen om het vulpercentage te verbeteren.

Hier is een tweede illustratieve berekening, onafhankelijk van de classificatietabel. Vijftig documenten hebben elk drie verwachte velden, dus 150 waarden. Stel dat 38 documenten volledig correct zijn, zes met twee correcte velden en zes met één. Dat geeft 38 × 3 + 6 × 2 + 6 × 1 = 132 correcte waarden, dus 88%. Toch is slechts 38/50 = 76% van de documenten volledig acceptabel als de drie velden vereist zijn.

De 18 onjuiste waarden raken twaalf documenten. Presenteer ze niet als achttien gebrekkige documenten. Afhankelijk van het gebruik is de nuttige eenheid een gecontroleerd veld of een volledig geaccepteerd document; definieer die vóór de vergelijking. Bewaar de resultaten per veld om te weten of de moeilijkheid van datums, bedragen of categorieën komt.

Fictieve extractie — drie vereiste velden in elk van de 50 documenten
Type documentDocumentenCorrecte velden per documentCorrecte velden in totaal
Volledig correct383114
Eén fout6212
Twee fouten616
Totaal50—132 van 150
06 /

Kies de correctie voordat je een campagne opnieuw start

Geef prioriteit op basis van het gevolg en het getroffen bereik, niet alleen op basis van het aantal regels. In de fictieve matrix kunnen de vijf fouten van Verwijdering een review verdienen vóór de zes fouten van Factuur als het project die categorie als kritiek heeft gedefinieerd. Die prioriteit hoort bij het projectcontract; de tabel laat niet toe een zakelijke ernst te verzinnen.

Formuleer een testbare hypothese: 'Lange invoer verliest het beslissende fragment tijdens de voorbereiding'. Kies een wijziging waarmee je dat kunt onderzoeken en houd de rest constant. Gelijktijdig voorbeelden toevoegen, van model wisselen en de context vergroten kan de score verbeteren, maar maakt het niet meer mogelijk het effect aan één correctie toe te schrijven.

  • Herlees enkele successen naast de fouten, om te controleren of het criterium consistent wordt toegepast.
  • Vergelijk de varianten op dezelfde identifiers en referenties; meld elke wijziging van het corpus afzonderlijk.
  • Onderscheid gecorrigeerde fouten, blijvende fouten, nieuwe fouten en ongewijzigde gevallen.
  • Speel ook voorbeelden buiten de beoogde categorie opnieuw om regressies op te sporen.
07 /

Controleer de winst zonder regressies uit te wissen

Een gepaarde berekening toont wat een netscore verbergt. Stel dat van de honderd fictieve tickets negen fouten zijn gecorrigeerd, maar vier oude successen onjuist zijn geworden. De balans gaat van 83 naar 83 + 9 − 4 = 88 correcte antwoorden. De winst is vijf punten, met vier regressies om te onderzoeken. Dat betekent niet dat negen correcties zonder tegenprestatie zijn behaald.

Het beslisdocument bewaart de voor/na-tabellen, de gecorrigeerde gevallen, de nieuwe fouten, de versie van de correctie en de gehaalde criteria. Als een kritieke regel nog steeds wordt overtreden, volstaat een hoger gemiddelde niet om de variant te accepteren. Kosten en duur worden daarna vergeleken tussen de toelaatbare opties; een afgewezen resultaat versnellen lost het kwaliteitsprobleem niet op.

08 /

Beperk de conclusie tot wat is onderzocht

Een spectaculaire fout is niet noodzakelijk representatief. Als je vooral lange invoeren of mislukkingen van een zeldzame categorie herleest, vermeld dan die selectiemethode en presenteer hun frequenties niet als die van het hele corpus. Bewaar ook de niet-beslechte gevallen: die definiëren een onzekerheid in je evaluatie.

Je analyse is bruikbaar wanneer een andere lezer de invoer kan terugvinden, het oordeel kan begrijpen en de voorgestelde correctie kan verifiëren. Ze bewijst noch de interne oorzaak van een gegenereerd antwoord, noch een gegarandeerde toekomstige kwaliteit. Ga over naar de apart gehouden eindsets nadat de correctie is gekozen, en archiveer daarna de beperkingen samen met de conclusie.

Praktische vragen

Volstaat een stijging van de globale score om een variant te weerhouden?

Nee. Controleer de kritieke categorieën, de nieuwe fouten en de volledig geaccepteerde uitvoeren. Een gemiddelde stijging kan samengaan met een regressie die het criterium van het project overtreedt.

Moet ik een referentie corrigeren wanneer het model die tegenspreekt?

Controleer eerst de invoer en de annotatie-instructie. Als de referentie fout is, beslis en versionneer de correctie, en pas die toe op alle varianten. Enkel de onenigheid van het model rechtvaardigt niet om het verwachte antwoord te wijzigen.

Mag ik de categorieën van mijn taxonomie optellen?

Alleen als elk geval één exclusieve hoofdcategorie heeft voor die telling. Secundaire labels kunnen overlappen; hun som telt dan voorkomens van labels, niet afzonderlijke fouten.