GPU pour la recherche ML · Paiement crypto sans KYC
IteraGPU
Méthode · Concevoir l’expérience

Une ablation doit isoler une décision.

Pour planifier une ablation, définissez la modification étudiée, une référence qui fonctionne et le résultat qui changerait votre décision. Comparez les variantes sur les mêmes données d’évaluation, puis examinez leurs interactions avant de cumuler les gains. Le bon plan réserve aussi des répétitions et une confirmation : tester beaucoup de réglages une seule fois peut laisser moins de certitude qu’une question étroite correctement examinée.

01 /

Écrire une hypothèse qui peut être contredite

« Améliorer le modèle » ne précise pas l’expérience. Écrivez plutôt : « La pondération des classes améliore la qualité sur les classes rares, sans dépasser la régression admise sur les classes fréquentes. » Nommez une métrique principale, les sous-groupes importants et le seuil d’effet utile. Fixez aussi la contrainte qui reste prioritaire : mémoire, délai, couverture des entrées ou simplicité du modèle.

Distinguez ajout et retrait. Ajouter un composant à une référence simple mesure son apport dans ce contexte. Le retirer d’un système complet mesure ce que perd ce système. Les deux questions peuvent produire des réponses différentes lorsque des composants interagissent. Votre conclusion doit donc préciser la référence et l’état des autres facteurs.

Le livrable attendu est une décision accompagnée d’un tableau des variantes, pas seulement un meilleur score. Avant de réserver les essais, écrivez ce qui vous ferait conserver, abandonner ou approfondir chaque piste.

Sources techniques : NIST — définir l’objectif du plan d’expérience

02 /

Construire un témoin et des variantes interprétables

Le témoin reprend la procédure de référence, avec ses versions, ses données et sa règle de sélection du checkpoint. Il doit être exécutable dans la campagne actuelle. Une métrique ancienne sans prédictions ni protocole complet peut servir de repère, mais elle ne remplace pas automatiquement ce témoin.

Pour chaque facteur, déclarez exactement les deux états comparés. « Augmentation activée » est trop vague : conservez transformation, probabilité et données concernées. Décrivez les paramètres qui restent communs : prétraitement hors facteur étudié, splits, optimiseur, budget d’apprentissage et méthode d’évaluation. Si les étapes d’apprentissage restent fixes mais que les tokens traités changent, notez cette conséquence.

Gardez le jeu de test final hors des choix de variantes. Les transformations apprises et les décisions de réglage doivent utiliser les données prévues à cet effet. Une amélioration obtenue après avoir ajusté le modèle sur les erreurs du test ne constitue plus une évaluation indépendante.

Sources techniques : scikit-learn — éviter les fuites de données

03 /

Deux facteurs demandent quatre situations

Supposons que vous étudiiez A, une pondération des classes, et B, une règle d’augmentation à l’entraînement. Pour voir leur interaction, examinez le témoin, A seul, B seul et A avec B. Ce plan à deux facteurs et deux niveaux contient quatre configurations. Avec k facteurs binaires, le plan complet contient 2ᵏ configurations avant les répétitions : le nombre d’essais croît vite.

Le tableau suivant est un exemple numérique inventé pour expliquer le raisonnement. Ses scores ne viennent d’aucun entraînement. Ils représentent des moyennes fictives de macro-F1 sur une échelle de 0 à 100 ; dans un travail réel, les valeurs individuelles et leur variabilité restent indispensables.

Exemple illustratif de quatre configurations — valeurs fictives, non mesurées
ConfigurationA : pondérationB : augmentationMacro-F1 fictive, sur 100
TémoinNonNon70,0
A seulOuiNon71,2
B seulNonOui70,8
A + BOuiOui71,5

Sources techniques : NIST — plans factoriels complets à deux niveaux

04 /

Lire les effets et leur interaction

Dans cet exemple, A apporte 1,2 point sans B, mais seulement 0,7 point lorsque B est déjà actif. B apporte 0,8 point sans A et 0,3 point avec A. Le gain combiné est de 1,5 point, alors que la somme des deux gains isolés vaut 2,0 points. L’écart de −0,5 point décrit ici une interaction non additive.

Ce calcul n’établit ni sa robustesse ni une explication du mécanisme. Il vous apprend quelle question confirmer : l’ajout de B au système contenant A justifie-t-il sa complexité pour seulement 0,3 point dans cet exemple ? Examinez aussi les sous-groupes prévus. Une même moyenne peut masquer des gains et pertes différents.

Comparez ces différences sur des répétitions appariées lorsque votre protocole le permet. Ne choisissez pas la meilleure graine de chaque variante. Si le signe ou l’amplitude change fortement selon les essais, la décision reste incertaine.

Écart illustratif à l’additivité = score(A+B) − score(A) − score(B) + score(témoin) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 point.

Sources techniques : NIST — combinaisons et interactions dans un plan factoriel

05 /

Allouer le budget aux décisions importantes

Une enveloppe d’essais est un outil de planification, pas une prévision de vitesse GPU. Exemple : vous disposez d’un budget organisationnel de 24 exécutions complètes. Vous affectez 12 exécutions aux quatre configurations avec trois graines chacune, 10 à une confirmation du témoin et d’un candidat avec cinq nouvelles graines, et 2 à des reprises justifiées. Le total vaut 24 ; rien ne dit encore combien d’heures elles demanderont.

Les trois premières graines servent ici à explorer, pas à certifier un gagnant. Fixez la règle de choix du candidat avant d’observer cette série. La confirmation utilise le protocole arrêté ; les nouvelles graines réduisent la dépendance à la sélection initiale mais ne corrigent pas un jeu de test déjà utilisé pour régler le modèle.

Si l’enveloppe ne permet pas les répétitions nécessaires, réduisez les facteurs ou reportez une question. Priorisez les changements qui affectent une décision réelle : supprimer un composant coûteux, résoudre un échec ou départager deux options proches. Gardez du temps pour l’évaluation et les artefacts avant de comparer les forfaits.

Exemple de répartition d’une enveloppe de 24 exécutions, sans durée supposée
ÉtapeCalculExécutions
Exploration4 configurations × 3 graines12
Confirmation2 configurations × 5 nouvelles graines10
Reprises documentéesRéserve2
Enveloppe totale12 + 10 + 224
06 /

Préparer l’ordre et les règles d’arrêt

Écrivez la liste des essais avant leur lancement, avec identifiant, configuration, graine et priorité. Répartissez les variantes dans l’ordre de passage au lieu de terminer tous les témoins puis tous les candidats. Si une période, un jeu de données ou une machine constitue un bloc de comparaison, documentez ce bloc. Un changement d’environnement au milieu de la série doit rester visible.

Préparez les motifs d’arrêt techniques, comme des erreurs répétées ou un dépassement mémoire. Conservez chaque tentative et son statut. Ne remplacez pas silencieusement un échec par une exécution plus courte, ni un essai décevant par une nouvelle graine jusqu’à obtenir le score attendu.

Un arrêt anticipé décidé sur les scores change le protocole d’analyse. Si vous prévoyez des décisions intermédiaires, annoncez leurs règles et leur portée exploratoire. Pour une conclusion confirmatoire, gardez un plan d’analyse adapté à ces décisions.

07 /

Clore l’ablation avec une conclusion vérifiable

La fiche finale indique l’hypothèse, le témoin, les facteurs, les répétitions, les écarts et les cas d’échec. Reliez chaque valeur aux prédictions et au run qui l’a produite. Terminez par une décision explicite : composant conservé, composant retiré, ou données insuffisantes pour choisir.

Évitez trois raccourcis : attribuer un changement à A alors que le prétraitement a aussi changé ; additionner des gains isolés sans tester leur combinaison ; annoncer une règle générale à partir d’un seul corpus. Une ablation établit une observation dans un protocole défini. Sa portée dépend des données, du modèle et des variations effectivement étudiées.

Questions pratiques

Faut-il toujours tester toutes les combinaisons ?

Un plan complet est utile pour les interactions, mais son coût augmente avec le nombre de facteurs. Délimitez d’abord les facteurs qui peuvent changer votre décision. Un plan réduit reste possible si vous explicitez les effets qu’il ne permet pas de séparer ; ne présentez pas les combinaisons absentes comme testées.

Puis-je réutiliser le témoin d’une campagne précédente ?

Vous pouvez le réutiliser si données, code, budget, sélection du modèle et évaluation sont réellement comparables et documentés. Sinon, relancez un témoin dans le protocole courant. Une différence de version ou de split peut expliquer l’écart que vous cherchiez à attribuer au composant.

Un résultat négatif signifie-t-il que le composant est inutile ?

Un résultat négatif indique qu’il n’apporte pas l’effet recherché dans les conditions étudiées, ou que la preuve manque. Vérifiez l’incertitude et les interactions avant de généraliser. Documenter ce résultat évite de dépenser à nouveau le budget sur une piste déjà examinée.