GPU pour la recherche ML · Paiement crypto sans KYC
IteraGPU
Méthode / Qualité et diagnostic

Transformer un score en décisions vérifiables.

Analyser les erreurs consiste à retrouver les cas qui expliquent un résultat, puis à choisir une correction dont l’effet pourra être contrôlé. Gardez les prédictions avec leurs identifiants et leur référence, séparez erreurs de format et de contenu, puis examinez les catégories importantes. Un score global ne dit ni quels cas échouent ni pourquoi. La bonne prochaine expérience corrige un mécanisme précis sans masquer les nouvelles régressions.

01 /

Conserver les sorties avant de les résumer

Une analyse commence par la jointure entre entrées, références et prédictions. Vérifiez que chaque identifiant attendu apparaît exactement une fois. Distinguez une réponse incorrecte d’une requête non terminée, d’un doublon ou d’une sortie illisible. Ces problèmes n’ont pas le même remède et ne doivent pas disparaître lors du calcul d’une moyenne.

Conservez la sortie brute à côté de sa version normalisée, la révision du modèle, le prompt, les réglages et le motif de verdict. Une conversion qui transforme silencieusement une date ambiguë peut créer une réussite artificielle. Commencez l’exploration sur la validation. Si le test final sert à inventer la correction suivante, une nouvelle confirmation tenue à part sera nécessaire.

Sources techniques : scikit-learn 1.9 — tenir le test à l’écart des choix du modèle

02 /

Lire une matrice de confusion avec ses effectifs

Pour une classification à une catégorie par entrée, la matrice croise la classe de référence et la classe prédite. Dans la convention utilisée ici et dans scikit-learn, les lignes portent la référence et les colonnes la prédiction. Conservez les effectifs bruts avant de normaliser : un pourcentage sans le nombre d’exemples peut exagérer la solidité d’une conclusion.

L’exemple suivant est fictif et uniquement arithmétique. Cent tickets sont répartis entre Facture, Accès et Suppression. La diagonale contient 54 + 24 + 5 = 83 réponses correctes, soit 83 %. Ce total masque la classe Suppression : seuls 5 des 10 tickets attendus sont reconnus. Aucun modèle ou GPU n’a produit ces chiffres.

Exemple illustratif — lignes : référence ; colonnes : prédiction ; unité : tickets
RéférencePrédit FacturePrédit AccèsPrédit SuppressionTotal réel
Facture545160
Accès424230
Suppression41510
Total prédit62308100

Sources techniques : scikit-learn 1.9 — définition de la matrice de confusion

03 /

Relier précision, rappel et conséquence pratique

Pour Suppression, la précision vaut 5/8 = 62,5 % : parmi les tickets envoyés dans cette catégorie, cinq sont corrects. Le rappel vaut 5/10 = 50 % : la moitié des tickets de cette catégorie est retrouvée. Le F1 vaut 2 × 5 / (2 × 5 + 3 + 5), soit environ 55,56 %. Les trois faux positifs et les cinq faux négatifs décrivent des problèmes différents.

Les F1 des classes Facture, Accès et Suppression sont respectivement 88,52 %, 80 % et 55,56 %. Leur moyenne non pondérée, le macro-F1, vaut environ 74,69 %. Elle complète les 83 % de bonnes réponses, sans remplacer les effectifs. Si une classe est absente des références ou des prédictions, certaines métriques peuvent être non définies : annoncez la convention utilisée au lieu de cacher le cas dans une moyenne.

Précision = vrais positifs / prédictions positives ; rappel = vrais positifs / références positives. Macro-F1 = moyenne des F1 calculés séparément par classe.

Sources techniques : scikit-learn 1.9 — précision, rappel, F1, moyennes et divisions nulles

04 /

Construire une taxonomie courte, reliée à des actions

Une catégorie d’erreur doit aider à décider quoi examiner. Commencez avec quelques catégories, une définition et un exemple représentatif. Ajoutez une étiquette principale pour compter les cas sans double comptage, puis des étiquettes secondaires si plusieurs phénomènes coexistent. Gardez une catégorie « à examiner » plutôt que de forcer une explication.

Cette taxonomie est une proposition de travail, pas un diagnostic automatique. Un document tronqué peut aussi contenir une ambiguïté de référence. La fréquence d’une étiquette décrit les cas relus ; elle ne démontre pas encore une cause. Conservez le passage d’entrée qui soutient votre interprétation et distinguez cause observée, hypothèse et information manquante.

Taxonomie de départ à adapter à la tâche
Erreur principaleCe qu’il faut examinerExpérience suivante possible
Entrée incomplèteTroncature, pièce absente, mauvais assemblageCorriger la préparation puis rejouer les mêmes cas
Format invalideChamp ou catégorie interdite, parsing impossibleModifier le contrat de sortie et vérifier aussi le contenu
Contenu incorrectChamp faux, confusion entre catégoriesTester une consigne ou un exemple ciblé
Référence contestableAnnotation ambiguë, consigne contradictoireArbitrer puis versionner la référence pour toutes les variantes
Exécution incomplèteArrêt, timeout, résultat manquantTraiter le pipeline ; conserver l’échec dans le bilan
05 /

Pour l’extraction, compter les champs et les documents

Un format JSON valide ne garantit pas que les valeurs sont correctes. Fixez les normalisations autorisées : date canonique, séparateur décimal, espaces ou codes de catégories. Distinguez champ manquant, valeur inventée et abstention autorisée. Une valeur absente dans le document ne doit pas être remplacée par une supposition pour améliorer le taux de remplissage.

Voici un second calcul illustratif, indépendant du tableau de classification. Cinquante documents possèdent chacun trois champs attendus, soit 150 valeurs. Supposons 38 documents entièrement corrects, six avec deux champs corrects et six avec un seul. Cela donne 38 × 3 + 6 × 2 + 6 × 1 = 132 valeurs correctes, soit 88 %. Pourtant, seulement 38/50 = 76 % des documents sont entièrement acceptables si les trois champs sont requis.

Les 18 valeurs incorrectes touchent douze documents. Ne les présentez pas comme dix-huit documents défaillants. Selon l’usage, l’unité utile sera un champ vérifié ou un document complet accepté ; définissez-la avant la comparaison. Gardez les résultats par champ pour savoir si la difficulté vient des dates, des montants ou des catégories.

Extraction fictive — trois champs requis dans chacun des 50 documents
Type de documentDocumentsChamps corrects par documentChamps corrects au total
Entièrement correct383114
Une erreur6212
Deux erreurs616
Total50—132 sur 150
06 /

Choisir la correction avant de relancer une campagne

Priorisez selon la conséquence et le périmètre touché, pas uniquement selon le nombre de lignes. Dans la matrice fictive, les cinq erreurs de Suppression peuvent mériter une revue avant les six erreurs de Facture si le projet a défini cette catégorie comme critique. Cette priorité appartient au contrat du projet ; le tableau ne permet pas d’inventer une gravité métier.

Formulez une hypothèse testable : « Les longues entrées perdent le passage décisif lors de la préparation ». Choisissez une modification qui permet de l’examiner, puis gardez le reste constant. Ajouter simultanément des exemples, changer de modèle et augmenter le contexte peut améliorer le score, mais ne permet plus d’attribuer l’effet à une seule correction.

  • Relire quelques réussites en plus des erreurs, pour vérifier que le critère est appliqué de façon cohérente.
  • Comparer les variantes sur les mêmes identifiants et références ; signaler séparément tout changement du corpus.
  • Distinguer erreurs corrigées, erreurs persistantes, nouvelles erreurs et cas inchangés.
  • Rejouer aussi des exemples hors de la catégorie ciblée pour chercher les régressions.
07 /

Contrôler le gain sans effacer les régressions

Un calcul apparié montre ce qu’un score net cache. Sur les cent tickets fictifs, imaginons neuf erreurs corrigées mais quatre anciennes réussites devenues fausses. Le bilan passe de 83 à 83 + 9 − 4 = 88 réponses correctes. Le gain est de cinq points, avec quatre régressions à examiner. Il ne signifie pas que neuf corrections ont été obtenues sans contrepartie.

La note de décision conserve les tableaux avant/après, les cas corrigés, les nouvelles erreurs, la version du correctif et les critères franchis. Si une règle critique reste violée, une moyenne supérieure ne suffit pas à accepter la variante. Le coût et la durée se comparent ensuite entre les options admissibles ; accélérer un résultat rejeté ne résout pas le problème de qualité.

08 /

Limiter la conclusion à ce qui a été examiné

Une erreur spectaculaire n’est pas forcément représentative. Si vous relisez surtout les longues entrées ou les échecs d’une catégorie rare, indiquez ce mode de sélection et ne présentez pas leurs fréquences comme celles de tout le corpus. Conservez également les cas non arbitrés : ils définissent une incertitude de votre évaluation.

Votre analyse est exploitable quand un autre lecteur peut retrouver l’entrée, comprendre le verdict et vérifier la correction proposée. Elle ne prouve ni la cause interne d’une réponse générée ni une qualité future garantie. Passez au jeu final tenu à part après le choix du correctif, puis archivez les limites avec la conclusion.

Questions pratiques

Une hausse du score global suffit-elle à retenir une variante ?

Non. Vérifiez les catégories critiques, les nouvelles erreurs et les sorties complètes acceptées. Une hausse moyenne peut coexister avec une régression qui viole le critère du projet.

Dois-je corriger une référence lorsque le modèle la contredit ?

Vérifiez d’abord l’entrée et la consigne d’annotation. Si la référence est fautive, arbitrez et versionnez la correction, puis appliquez-la à toutes les variantes. Le désaccord du modèle seul ne justifie pas de changer la réponse attendue.

Puis-je additionner les catégories de ma taxonomie ?

Seulement si chaque cas possède une catégorie principale exclusive pour ce décompte. Des étiquettes secondaires peuvent se chevaucher ; leur somme compte alors des occurrences d’étiquettes, pas des erreurs distinctes.