Conserver les sorties avant de les résumer
Une analyse commence par la jointure entre entrées, références et prédictions. Vérifiez que chaque identifiant attendu apparaît exactement une fois. Distinguez une réponse incorrecte d’une requête non terminée, d’un doublon ou d’une sortie illisible. Ces problèmes n’ont pas le même remède et ne doivent pas disparaître lors du calcul d’une moyenne.
Conservez la sortie brute à côté de sa version normalisée, la révision du modèle, le prompt, les réglages et le motif de verdict. Une conversion qui transforme silencieusement une date ambiguë peut créer une réussite artificielle. Commencez l’exploration sur la validation. Si le test final sert à inventer la correction suivante, une nouvelle confirmation tenue à part sera nécessaire.
Sources techniques : scikit-learn 1.9 — tenir le test à l’écart des choix du modèle
Lire une matrice de confusion avec ses effectifs
Pour une classification à une catégorie par entrée, la matrice croise la classe de référence et la classe prédite. Dans la convention utilisée ici et dans scikit-learn, les lignes portent la référence et les colonnes la prédiction. Conservez les effectifs bruts avant de normaliser : un pourcentage sans le nombre d’exemples peut exagérer la solidité d’une conclusion.
L’exemple suivant est fictif et uniquement arithmétique. Cent tickets sont répartis entre Facture, Accès et Suppression. La diagonale contient 54 + 24 + 5 = 83 réponses correctes, soit 83 %. Ce total masque la classe Suppression : seuls 5 des 10 tickets attendus sont reconnus. Aucun modèle ou GPU n’a produit ces chiffres.
| Référence | Prédit Facture | Prédit Accès | Prédit Suppression | Total réel |
|---|---|---|---|---|
| Facture | 54 | 5 | 1 | 60 |
| Accès | 4 | 24 | 2 | 30 |
| Suppression | 4 | 1 | 5 | 10 |
| Total prédit | 62 | 30 | 8 | 100 |
Sources techniques : scikit-learn 1.9 — définition de la matrice de confusion
Relier précision, rappel et conséquence pratique
Pour Suppression, la précision vaut 5/8 = 62,5 % : parmi les tickets envoyés dans cette catégorie, cinq sont corrects. Le rappel vaut 5/10 = 50 % : la moitié des tickets de cette catégorie est retrouvée. Le F1 vaut 2 × 5 / (2 × 5 + 3 + 5), soit environ 55,56 %. Les trois faux positifs et les cinq faux négatifs décrivent des problèmes différents.
Les F1 des classes Facture, Accès et Suppression sont respectivement 88,52 %, 80 % et 55,56 %. Leur moyenne non pondérée, le macro-F1, vaut environ 74,69 %. Elle complète les 83 % de bonnes réponses, sans remplacer les effectifs. Si une classe est absente des références ou des prédictions, certaines métriques peuvent être non définies : annoncez la convention utilisée au lieu de cacher le cas dans une moyenne.
Sources techniques : scikit-learn 1.9 — précision, rappel, F1, moyennes et divisions nulles
Construire une taxonomie courte, reliée à des actions
Une catégorie d’erreur doit aider à décider quoi examiner. Commencez avec quelques catégories, une définition et un exemple représentatif. Ajoutez une étiquette principale pour compter les cas sans double comptage, puis des étiquettes secondaires si plusieurs phénomènes coexistent. Gardez une catégorie « à examiner » plutôt que de forcer une explication.
Cette taxonomie est une proposition de travail, pas un diagnostic automatique. Un document tronqué peut aussi contenir une ambiguïté de référence. La fréquence d’une étiquette décrit les cas relus ; elle ne démontre pas encore une cause. Conservez le passage d’entrée qui soutient votre interprétation et distinguez cause observée, hypothèse et information manquante.
| Erreur principale | Ce qu’il faut examiner | Expérience suivante possible |
|---|---|---|
| Entrée incomplète | Troncature, pièce absente, mauvais assemblage | Corriger la préparation puis rejouer les mêmes cas |
| Format invalide | Champ ou catégorie interdite, parsing impossible | Modifier le contrat de sortie et vérifier aussi le contenu |
| Contenu incorrect | Champ faux, confusion entre catégories | Tester une consigne ou un exemple ciblé |
| Référence contestable | Annotation ambiguë, consigne contradictoire | Arbitrer puis versionner la référence pour toutes les variantes |
| Exécution incomplète | Arrêt, timeout, résultat manquant | Traiter le pipeline ; conserver l’échec dans le bilan |
Pour l’extraction, compter les champs et les documents
Un format JSON valide ne garantit pas que les valeurs sont correctes. Fixez les normalisations autorisées : date canonique, séparateur décimal, espaces ou codes de catégories. Distinguez champ manquant, valeur inventée et abstention autorisée. Une valeur absente dans le document ne doit pas être remplacée par une supposition pour améliorer le taux de remplissage.
Voici un second calcul illustratif, indépendant du tableau de classification. Cinquante documents possèdent chacun trois champs attendus, soit 150 valeurs. Supposons 38 documents entièrement corrects, six avec deux champs corrects et six avec un seul. Cela donne 38 × 3 + 6 × 2 + 6 × 1 = 132 valeurs correctes, soit 88 %. Pourtant, seulement 38/50 = 76 % des documents sont entièrement acceptables si les trois champs sont requis.
Les 18 valeurs incorrectes touchent douze documents. Ne les présentez pas comme dix-huit documents défaillants. Selon l’usage, l’unité utile sera un champ vérifié ou un document complet accepté ; définissez-la avant la comparaison. Gardez les résultats par champ pour savoir si la difficulté vient des dates, des montants ou des catégories.
| Type de document | Documents | Champs corrects par document | Champs corrects au total |
|---|---|---|---|
| Entièrement correct | 38 | 3 | 114 |
| Une erreur | 6 | 2 | 12 |
| Deux erreurs | 6 | 1 | 6 |
| Total | 50 | — | 132 sur 150 |
Choisir la correction avant de relancer une campagne
Priorisez selon la conséquence et le périmètre touché, pas uniquement selon le nombre de lignes. Dans la matrice fictive, les cinq erreurs de Suppression peuvent mériter une revue avant les six erreurs de Facture si le projet a défini cette catégorie comme critique. Cette priorité appartient au contrat du projet ; le tableau ne permet pas d’inventer une gravité métier.
Formulez une hypothèse testable : « Les longues entrées perdent le passage décisif lors de la préparation ». Choisissez une modification qui permet de l’examiner, puis gardez le reste constant. Ajouter simultanément des exemples, changer de modèle et augmenter le contexte peut améliorer le score, mais ne permet plus d’attribuer l’effet à une seule correction.
- Relire quelques réussites en plus des erreurs, pour vérifier que le critère est appliqué de façon cohérente.
- Comparer les variantes sur les mêmes identifiants et références ; signaler séparément tout changement du corpus.
- Distinguer erreurs corrigées, erreurs persistantes, nouvelles erreurs et cas inchangés.
- Rejouer aussi des exemples hors de la catégorie ciblée pour chercher les régressions.
Contrôler le gain sans effacer les régressions
Un calcul apparié montre ce qu’un score net cache. Sur les cent tickets fictifs, imaginons neuf erreurs corrigées mais quatre anciennes réussites devenues fausses. Le bilan passe de 83 à 83 + 9 − 4 = 88 réponses correctes. Le gain est de cinq points, avec quatre régressions à examiner. Il ne signifie pas que neuf corrections ont été obtenues sans contrepartie.
La note de décision conserve les tableaux avant/après, les cas corrigés, les nouvelles erreurs, la version du correctif et les critères franchis. Si une règle critique reste violée, une moyenne supérieure ne suffit pas à accepter la variante. Le coût et la durée se comparent ensuite entre les options admissibles ; accélérer un résultat rejeté ne résout pas le problème de qualité.
Limiter la conclusion à ce qui a été examiné
Une erreur spectaculaire n’est pas forcément représentative. Si vous relisez surtout les longues entrées ou les échecs d’une catégorie rare, indiquez ce mode de sélection et ne présentez pas leurs fréquences comme celles de tout le corpus. Conservez également les cas non arbitrés : ils définissent une incertitude de votre évaluation.
Votre analyse est exploitable quand un autre lecteur peut retrouver l’entrée, comprendre le verdict et vérifier la correction proposée. Elle ne prouve ni la cause interne d’une réponse générée ni une qualité future garantie. Passez au jeu final tenu à part après le choix du correctif, puis archivez les limites avec la conclusion.
Questions pratiques
Une hausse du score global suffit-elle à retenir une variante ?
Non. Vérifiez les catégories critiques, les nouvelles erreurs et les sorties complètes acceptées. Une hausse moyenne peut coexister avec une régression qui viole le critère du projet.
Dois-je corriger une référence lorsque le modèle la contredit ?
Vérifiez d’abord l’entrée et la consigne d’annotation. Si la référence est fautive, arbitrez et versionnez la correction, puis appliquez-la à toutes les variantes. Le désaccord du modèle seul ne justifie pas de changer la réponse attendue.
Puis-je additionner les catégories de ma taxonomie ?
Seulement si chaque cas possède une catégorie principale exclusive pour ce décompte. Des étiquettes secondaires peuvent se chevaucher ; leur somme compte alors des occurrences d’étiquettes, pas des erreurs distinctes.