GPU per la ricerca ML · Pagamento crypto senza KYC
IteraGPU
Metodo · Progettare l'esperimento

Un'ablazione deve isolare una decisione.

Per pianificare un'ablazione, definisci la modifica studiata, un riferimento che funziona e il risultato che cambierebbe la tua decisione. Confronta le varianti sugli stessi dati di valutazione, poi esamina le loro interazioni prima di cumulare i guadagni. Il buon piano riserva anche delle ripetizioni e una conferma: testare molte impostazioni una sola volta può lasciare meno certezza di una domanda ristretta esaminata correttamente.

01 /

Scrivere un'ipotesi che possa essere contraddetta

«Migliorare il modello» non precisa l'esperimento. Scrivi invece: «La ponderazione delle classi migliora la qualità sulle classi rare, senza superare la regressione ammessa sulle classi frequenti.» Nomina una metrica principale, i sottogruppi importanti e la soglia di effetto utile. Fissa anche il vincolo che resta prioritario: memoria, tempo, copertura degli input o semplicità del modello.

Distingui aggiunta e rimozione. Aggiungere un componente a una baseline semplice misura il suo contributo in quel contesto. Rimuoverlo da un sistema completo misura ciò che quel sistema perde. Le due domande possono produrre risposte diverse quando i componenti interagiscono. La tua conclusione deve quindi precisare la baseline e lo stato degli altri fattori.

Il deliverable atteso è una decisione accompagnata da una tabella delle varianti, non solo un punteggio migliore. Prima di prenotare gli esperimenti, scrivi cosa ti farebbe mantenere, abbandonare o approfondire ciascuna pista.

Fonti tecniche: NIST — definire l'obiettivo del piano sperimentale

02 /

Costruire un controllo e varianti interpretabili

Il controllo riprende la procedura di riferimento, con le sue versioni, i suoi dati e la sua regola di selezione del checkpoint. Deve essere eseguibile nella campagna attuale. Una metrica vecchia senza predizioni né protocollo completo può servire da riferimento, ma non sostituisce automaticamente questo controllo.

Per ogni fattore, dichiara esattamente i due stati confrontati. «Augmentation attivata» è troppo vago: conserva trasformazione, probabilità e dati coinvolti. Descrivi i parametri che restano comuni: preprocessing al di fuori del fattore studiato, split, ottimizzatore, budget di addestramento e metodo di valutazione. Se i passi di addestramento restano fissi ma i token processati cambiano, annota questa conseguenza.

Tieni il set di test finale fuori dalle scelte delle varianti. Le trasformazioni apprese e le decisioni di tuning devono usare i dati previsti a questo scopo. Un miglioramento ottenuto dopo aver regolato il modello sugli errori del test non costituisce più una valutazione indipendente.

Fonti tecniche: scikit-learn — evitare le fughe di dati

03 /

Due fattori richiedono quattro situazioni

Supponiamo che tu studi A, una ponderazione delle classi, e B, una regola di augmentation in addestramento. Per vedere la loro interazione, esamina il controllo, A da solo, B da solo e A con B. Questo piano a due fattori e due livelli contiene quattro configurazioni. Con k fattori binari, il piano completo contiene 2ᵏ configurazioni prima delle ripetizioni: il numero di esperimenti cresce in fretta.

La tabella seguente è un esempio numerico inventato per spiegare il ragionamento. I suoi punteggi non provengono da alcun addestramento. Rappresentano medie fittizie di macro-F1 su una scala da 0 a 100; in un lavoro reale, i valori individuali e la loro variabilità restano indispensabili.

Esempio illustrativo di quattro configurazioni — valori fittizi, non misurati
ConfigurazioneA: ponderazioneB : augmentationMacro-F1 fittizia, su 100
ControlloNoNo70,0
A da soloSìNo71,2
B da soloNoSì70,8
A + BSìSì71,5

Fonti tecniche: NIST — piani fattoriali completi a due livelli

04 /

Leggere gli effetti e la loro interazione

In questo esempio, A apporta 1,2 punti senza B, ma solo 0,7 punti quando B è già attivo. B apporta 0,8 punti senza A e 0,3 punti con A. Il guadagno combinato è di 1,5 punti, mentre la somma dei due guadagni isolati vale 2,0 punti. Lo scarto di −0,5 punti descrive qui un'interazione non additiva.

Questo calcolo non stabilisce né la sua robustezza né una spiegazione del meccanismo. Ti insegna quale domanda confermare: l'aggiunta di B al sistema che contiene A giustifica la sua complessità per soli 0,3 punti in questo esempio? Esamina anche i sottogruppi previsti. Una stessa media può mascherare guadagni e perdite diversi.

Confronta queste differenze su ripetizioni appaiate quando il tuo protocollo lo permette. Non scegliere il miglior seed di ogni variante. Se il segno o l'ampiezza cambiano molto da un esperimento all'altro, la decisione resta incerta.

Scarto illustrativo dall'additività = punteggio(A+B) − punteggio(A) − punteggio(B) + punteggio(controllo) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 punti.

Fonti tecniche: NIST — combinazioni e interazioni in un piano fattoriale

05 /

Assegnare il budget alle decisioni importanti

Un monte di esperimenti è uno strumento di pianificazione, non una previsione di velocità GPU. Esempio: disponi di un budget organizzativo di 24 esecuzioni complete. Assegni 12 esecuzioni alle quattro configurazioni con tre seed ciascuna, 10 a una conferma del controllo e di un candidato con cinque nuovi seed, e 2 a riprese giustificate. Il totale è 24; nulla dice ancora quante ore richiederanno.

I primi tre seed servono qui per esplorare, non per certificare un vincitore. Fissa la regola di scelta del candidato prima di osservare questa serie. La conferma utilizza il protocollo stabilito; i nuovi seed riducono la dipendenza dalla selezione iniziale ma non correggono un test set già usato per regolare il modello.

Se il budget non permette le ripetizioni necessarie, riduci i fattori o rimanda una domanda. Dai priorità ai cambiamenti che influenzano una decisione reale: eliminare un componente costoso, risolvere un fallimento o dirimere tra due opzioni vicine. Conserva del tempo per la valutazione e gli artefatti prima di confrontare i piani.

Esempio di ripartizione di un budget di 24 esecuzioni, senza durata presunta
FaseCalcoloEsecuzioni
Esplorazione4 configurazioni × 3 seed12
Conferma2 configurazioni × 5 nuovi seed10
Riprese documentateRiserva2
Budget totale12 + 10 + 224
06 /

Preparare l'ordine e le regole di arresto

Scrivi la lista delle prove prima del loro lancio, con identificatore, configurazione, seed e priorità. Distribuisci le varianti nell'ordine di esecuzione invece di completare prima tutti i controlli e poi tutti i candidati. Se un periodo, un dataset o una macchina costituisce un blocco di confronto, documenta quel blocco. Un cambiamento di ambiente a metà serie deve restare visibile.

Prepara i motivi di arresto tecnici, come errori ripetuti o un superamento di memoria. Conserva ogni tentativo e il suo stato. Non sostituire silenziosamente un fallimento con un'esecuzione più breve, né una prova deludente con un nuovo seed fino a ottenere il punteggio atteso.

Un arresto anticipato deciso sui punteggi cambia il protocollo di analisi. Se prevedi decisioni intermedie, annuncia le loro regole e la loro portata esplorativa. Per una conclusione confermativa, mantieni un piano di analisi adatto a queste decisioni.

07 /

Chiudere l'ablation con una conclusione verificabile

La scheda finale indica l'ipotesi, il controllo, i fattori, le ripetizioni, gli scarti e i casi di fallimento. Collega ogni valore alle previsioni e al run che l'ha prodotto. Concludi con una decisione esplicita: componente conservato, componente rimosso, o dati insufficienti per scegliere.

Evita tre scorciatoie: attribuire un cambiamento ad A quando anche il preprocessing è cambiato; sommare guadagni isolati senza testare la loro combinazione; annunciare una regola generale a partire da un solo corpus. Un'ablation stabilisce un'osservazione in un protocollo definito. La sua portata dipende dai dati, dal modello e dalle variazioni effettivamente studiate.

Domande pratiche

Bisogna sempre testare tutte le combinazioni?

Un piano completo è utile per le interazioni, ma il suo costo aumenta con il numero di fattori. Delimita prima i fattori che possono cambiare la tua decisione. Un piano ridotto resta possibile se espliciti gli effetti che non permette di separare; non presentare le combinazioni assenti come testate.

Posso riutilizzare il controllo di una campagna precedente?

Puoi riutilizzarlo se dati, codice, budget, selezione del modello e valutazione sono realmente comparabili e documentati. Altrimenti, rilancia un controllo nel protocollo corrente. Una differenza di versione o di split può spiegare lo scarto che cercavi di attribuire al componente.

Un risultato negativo significa che il componente è inutile?

Un risultato negativo indica che non apporta l'effetto ricercato nelle condizioni studiate, o che manca la prova. Verifica l'incertezza e le interazioni prima di generalizzare. Documentare questo risultato evita di spendere di nuovo il budget su una pista già esaminata.