Conservare gli output prima di riassumerli
Un'analisi inizia dalla giunzione tra input, riferimenti e predizioni. Verifica che ogni identificatore atteso compaia esattamente una volta. Distingui una risposta errata da una richiesta non completata, da un duplicato o da un output illeggibile. Questi problemi non hanno lo stesso rimedio e non devono sparire durante il calcolo di una media.
Conserva l'output grezzo accanto alla sua versione normalizzata, la revisione del modello, il prompt, le impostazioni e il motivo del verdetto. Una conversione che trasforma silenziosamente una data ambigua può creare un successo artificiale. Inizia l'esplorazione sulla validazione. Se il test finale serve a inventare la correzione successiva, sarà necessaria una nuova conferma tenuta a parte.
Fonti tecniche: scikit-learn 1.9 — tenere il test lontano dalle scelte del modello
Leggere una matrice di confusione con le sue numerosità
Per una classificazione a una categoria per input, la matrice incrocia la classe di riferimento e la classe predetta. Nella convenzione usata qui e in scikit-learn, le righe portano il riferimento e le colonne la predizione. Conserva le numerosità grezze prima di normalizzare: una percentuale senza il numero di esempi può esagerare la solidità di una conclusione.
L'esempio seguente è fittizio e puramente aritmetico. Cento ticket sono ripartiti tra Fattura, Accesso ed Eliminazione. La diagonale contiene 54 + 24 + 5 = 83 risposte corrette, cioè l'83 %. Questo totale maschera la classe Eliminazione: solo 5 dei 10 ticket attesi sono riconosciuti. Nessun modello o GPU ha prodotto questi numeri.
| Riferimento | Predetto Fattura | Predetto Accesso | Predetto Eliminazione | Totale reale |
|---|---|---|---|---|
| Fattura | 54 | 5 | 1 | 60 |
| Accesso | 4 | 24 | 2 | 30 |
| Eliminazione | 4 | 1 | 5 | 10 |
| Totale predetto | 62 | 30 | 8 | 100 |
Fonti tecniche: scikit-learn 1.9 — definizione della matrice di confusione
Collegare precisione, richiamo e conseguenza pratica
Per Eliminazione, la precisione vale 5/8 = 62,5 %: tra i ticket inviati in questa categoria, cinque sono corretti. Il richiamo vale 5/10 = 50 %: la metà dei ticket di questa categoria viene ritrovata. L'F1 vale 2 × 5 / (2 × 5 + 3 + 5), cioè circa 55,56 %. I tre falsi positivi e i cinque falsi negativi descrivono problemi diversi.
Gli F1 delle classi Fattura, Accesso ed Eliminazione sono rispettivamente 88,52 %, 80 % e 55,56 %. La loro media non ponderata, il macro-F1, vale circa 74,69 %. Completa l'83 % di risposte corrette, senza sostituire le numerosità. Se una classe è assente dai riferimenti o dalle predizioni, alcune metriche possono essere non definite: dichiara la convenzione usata invece di nascondere il caso in una media.
Fonti tecniche: scikit-learn 1.9 — precisione, richiamo, F1, medie e divisioni per zero
Costruire una tassonomia breve, collegata ad azioni
Una categoria di errore deve aiutare a decidere cosa esaminare. Inizia con poche categorie, una definizione e un esempio rappresentativo. Aggiungi un'etichetta principale per contare i casi senza doppio conteggio, poi etichette secondarie se più fenomeni coesistono. Mantieni una categoria «da esaminare» invece di forzare una spiegazione.
Questa tassonomia è una proposta di lavoro, non una diagnosi automatica. Un documento troncato può anche contenere un'ambiguità di riferimento. La frequenza di un'etichetta descrive i casi riesaminati; non dimostra ancora una causa. Conserva il passaggio di input che sostiene la tua interpretazione e distingui causa osservata, ipotesi e informazione mancante.
| Errore principale | Cosa bisogna esaminare | Prossimo esperimento possibile |
|---|---|---|
| Input incompleto | Troncamento, parte mancante, assemblaggio errato | Correggere la preparazione poi rieseguire gli stessi casi |
| Formato non valido | Campo o categoria non ammessi, parsing impossibile | Modificare il contratto di output e verificare anche il contenuto |
| Contenuto errato | Campo sbagliato, confusione tra categorie | Testare un'istruzione o un esempio mirato |
| Riferimento discutibile | Annotazione ambigua, istruzione contraddittoria | Arbitrare poi versionare il riferimento per tutte le varianti |
| Esecuzione incompleta | Arresto, timeout, risultato mancante | Gestire la pipeline; conservare il fallimento nel bilancio |
Per l'estrazione, contare i campi e i documenti
Un formato JSON valido non garantisce che i valori siano corretti. Fissa le normalizzazioni ammesse: data canonica, separatore decimale, spazi o codici di categorie. Distingui campo mancante, valore inventato e astensione consentita. Un valore assente nel documento non deve essere sostituito da una supposizione per migliorare il tasso di riempimento.
Ecco un secondo calcolo illustrativo, indipendente dalla tabella di classificazione. Cinquanta documenti possiedono ciascuno tre campi attesi, cioè 150 valori. Supponiamo 38 documenti interamente corretti, sei con due campi corretti e sei con uno solo. Questo dà 38 × 3 + 6 × 2 + 6 × 1 = 132 valori corretti, cioè l'88%. Tuttavia, solo 38/50 = 76% dei documenti è interamente accettabile se i tre campi sono richiesti.
I 18 valori errati riguardano dodici documenti. Non presentarli come diciotto documenti difettosi. A seconda dell'uso, l'unità utile sarà un campo verificato o un documento completo accettato; definiscila prima del confronto. Conserva i risultati per campo per sapere se la difficoltà deriva dalle date, dagli importi o dalle categorie.
| Tipo di documento | Documenti | Campi corretti per documento | Campi corretti in totale |
|---|---|---|---|
| Interamente corretto | 38 | 3 | 114 |
| Un errore | 6 | 2 | 12 |
| Due errori | 6 | 1 | 6 |
| Totale | 50 | — | 132 su 150 |
Scegliere la correzione prima di rilanciare una campagna
Dai priorità in base alla conseguenza e all'ambito interessato, non solo al numero di righe. Nella matrice fittizia, i cinque errori di Cancellazione possono meritare una revisione prima dei sei errori di Fattura se il progetto ha definito quella categoria come critica. Questa priorità appartiene al contratto del progetto; la tabella non permette di inventare una gravità di business.
Formula un'ipotesi testabile: «Gli input lunghi perdono il passaggio decisivo durante la preparazione». Scegli una modifica che permetta di esaminarla, poi mantieni il resto costante. Aggiungere contemporaneamente esempi, cambiare modello e aumentare il contesto può migliorare il punteggio, ma non permette più di attribuire l'effetto a una sola correzione.
- Rileggere qualche successo oltre agli errori, per verificare che il criterio sia applicato in modo coerente.
- Confrontare le varianti sugli stessi identificatori e riferimenti; segnalare separatamente qualsiasi cambiamento del corpus.
- Distinguere errori corretti, errori persistenti, nuovi errori e casi invariati.
- Rieseguire anche esempi fuori dalla categoria mirata per cercare le regressioni.
Controllare il guadagno senza cancellare le regressioni
Un calcolo appaiato mostra ciò che un punteggio netto nasconde. Sui cento ticket fittizi, immaginiamo nove errori corretti ma quattro vecchi successi diventati errati. Il bilancio passa da 83 a 83 + 9 − 4 = 88 risposte corrette. Il guadagno è di cinque punti, con quattro regressioni da esaminare. Non significa che nove correzioni siano state ottenute senza contropartita.
La nota decisionale conserva le tabelle prima/dopo, i casi corretti, i nuovi errori, la versione della correzione e i criteri superati. Se una regola critica resta violata, una media superiore non basta ad accettare la variante. Il costo e la durata si confrontano poi tra le opzioni ammissibili; accelerare un risultato respinto non risolve il problema di qualità.
Limitare la conclusione a ciò che è stato esaminato
Un errore spettacolare non è necessariamente rappresentativo. Se rileggi soprattutto le voci lunghe o i fallimenti di una categoria rara, indica questo criterio di selezione e non presentare le loro frequenze come quelle dell'intero corpus. Conserva anche i casi non arbitrati: definiscono un'incertezza della tua valutazione.
La tua analisi è utilizzabile quando un altro lettore può ritrovare la voce, capire il verdetto e verificare la correzione proposta. Non prova né la causa interna di una risposta generata né una qualità futura garantita. Passa al set finale tenuto a parte dopo la scelta della correzione, poi archivia i limiti insieme alla conclusione.
Domande pratiche
Un aumento del punteggio globale basta a ritenere una variante?
No. Verifica le categorie critiche, i nuovi errori e gli output completi accettati. Un aumento medio può coesistere con una regressione che viola il criterio del progetto.
Devo correggere un riferimento quando il modello lo contraddice?
Verifica prima la voce e la consegna di annotazione. Se il riferimento è errato, arbitra e versiona la correzione, poi applicala a tutte le varianti. Il solo disaccordo del modello non giustifica cambiare la risposta attesa.
Posso sommare le categorie della mia tassonomia?
Solo se ogni caso possiede una categoria principale esclusiva per questo conteggio. Le etichette secondarie possono sovrapporsi; la loro somma conta allora occorrenze di etichette, non errori distinti.