GPU voor ML-onderzoek · Crypto-betaling zonder KYC
IteraGPU
Methode · Het experiment ontwerpen

Een ablatie moet één beslissing isoleren.

Om een ablatie te plannen definieer je de onderzochte wijziging, een werkende referentie en het resultaat dat je beslissing zou veranderen. Vergelijk de varianten op dezelfde evaluatiedata en onderzoek hun interacties voordat je winsten optelt. Een goed plan reserveert ook herhalingen en een bevestiging: veel instellingen één keer testen kan minder zekerheid opleveren dan één nauwkeurig onderzochte, afgebakende vraag.

01 /

Een hypothese schrijven die weerlegd kan worden

'Het model verbeteren' specificeert het experiment niet. Schrijf eerder: 'De klasseweging verbetert de kwaliteit op de zeldzame klassen, zonder de toegestane regressie op de frequente klassen te overschrijden.' Benoem een primaire metriek, de belangrijke subgroepen en de drempel voor nuttig effect. Leg ook de beperking vast die prioriteit houdt: geheugen, tijd, dekking van de invoer of eenvoud van het model.

Onderscheid toevoegen en weglaten. Een component toevoegen aan een eenvoudige referentie meet zijn bijdrage in die context. Hem weghalen uit een volledig systeem meet wat dat systeem verliest. Beide vragen kunnen verschillende antwoorden opleveren wanneer componenten op elkaar inwerken. Je conclusie moet dus de referentie en de toestand van de overige factoren vermelden.

Het verwachte deliverable is een beslissing met een tabel van de varianten, niet alleen een betere score. Voordat je de runs boekt, schrijf je op wat je ertoe zou brengen elke piste te behouden, te laten vallen of verder uit te diepen.

Technische bronnen: NIST — het doel van het experimentplan bepalen

02 /

Een controlegroep en interpreteerbare varianten opzetten

De controlegroep neemt de referentieprocedure over, met zijn versies, zijn data en zijn regel voor het selecteren van het checkpoint. Hij moet uitvoerbaar zijn in de huidige campagne. Een oude metriek zonder voorspellingen of volledig protocol kan als ijkpunt dienen, maar vervangt deze controlegroep niet automatisch.

Verklaar voor elke factor precies de twee vergeleken toestanden. ‘Augmentatie ingeschakeld’ is te vaag: behoud de transformatie, de waarschijnlijkheid en de betrokken data. Beschrijf de parameters die gemeenschappelijk blijven: voorverwerking buiten de bestudeerde factor, splits, optimizer, leertijdbudget en evaluatiemethode. Als de leerstappen vast blijven maar de verwerkte tokens veranderen, noteer dan dat gevolg.

Houd de uiteindelijke testset buiten de keuzes van varianten. De geleerde transformaties en de afstemmingsbeslissingen moeten de daarvoor bestemde data gebruiken. Een verbetering die is behaald nadat het model op de fouten van de test is afgesteld, vormt niet langer een onafhankelijke evaluatie.

Technische bronnen: scikit-learn — datalekken vermijden

03 /

Twee factoren vragen om vier situaties

Stel dat je A onderzoekt, een weging van de klassen, en B, een augmentatieregel tijdens de training. Om hun interactie te zien, bekijk je de controlegroep, A alleen, B alleen en A met B. Dit plan met twee factoren en twee niveaus bevat vier configuraties. Met k binaire factoren bevat het volledige plan 2ᵏ configuraties vóór de herhalingen: het aantal runs groeit snel.

De volgende tabel is een verzonnen numeriek voorbeeld om de redenering uit te leggen. De scores komen uit geen enkele training. Ze stellen fictieve gemiddelden van macro-F1 voor op een schaal van 0 tot 100; in echt werk blijven de individuele waarden en hun variabiliteit onmisbaar.

Illustratief voorbeeld van vier configuraties — fictieve waarden, niet gemeten
ConfiguratieA: wegingB : augmentationFictieve macro-F1, op 100
ControlegroepNeeNee70,0
A alleenJaNee71,2
B alleenNeeJa70,8
A + BJaJa71,5

Technische bronnen: NIST — volledige factoriële plannen met twee niveaus

04 /

Effecten en hun interactie lezen

In dit voorbeeld levert A 1,2 punt op zonder B, maar slechts 0,7 punt wanneer B al actief is. B levert 0,8 punt op zonder A en 0,3 punt met A. De gecombineerde winst is 1,5 punt, terwijl de som van de twee afzonderlijke winsten 2,0 punten bedraagt. Het verschil van −0,5 punt beschrijft hier een niet-additieve interactie.

Deze berekening stelt noch zijn robuustheid noch een verklaring van het mechanisme vast. Ze leert je welke vraag je moet bevestigen: rechtvaardigt het toevoegen van B aan het systeem met A zijn complexiteit voor slechts 0,3 punt in dit voorbeeld? Bekijk ook de voorziene subgroepen. Eenzelfde gemiddelde kan verschillende winsten en verliezen verbergen.

Vergelijk deze verschillen op gepaarde herhalingen wanneer je protocol dat toelaat. Kies niet de beste seed van elke variant. Als het teken of de grootte sterk verandert per run, blijft de beslissing onzeker.

Illustratief verschil met de additiviteit = score(A+B) − score(A) − score(B) + score(controlegroep) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 punt.

Technische bronnen: NIST — combinaties en interacties in een factorieel plan

05 /

Het budget toewijzen aan belangrijke beslissingen

Een enveloppe van runs is een planningsinstrument, geen voorspelling van de GPU-snelheid. Voorbeeld: je hebt een organisatorisch budget van 24 volledige uitvoeringen. Je besteedt 12 uitvoeringen aan de vier configuraties met elk drie seeds, 10 aan een bevestiging van de controlegroep en een kandidaat met vijf nieuwe seeds, en 2 aan gerechtvaardigde herhalingen. Het totaal is 24; niets zegt nog hoeveel uur ze zullen vragen.

De eerste drie seeds dienen hier om te verkennen, niet om een winnaar te certificeren. Leg de regel voor de kandidaatkeuze vast voordat je deze reeks observeert. De confirmatie gebruikt het vastgestelde protocol; nieuwe seeds verminderen de afhankelijkheid van de initiële selectie, maar corrigeren geen testset die al is gebruikt om het model af te stellen.

Als het budget de nodige herhalingen niet toelaat, reduceer dan de factoren of stel een vraag uit. Geef prioriteit aan wijzigingen die een echte beslissing beïnvloeden: een kostbare component verwijderen, een fout oplossen of twee dicht bij elkaar liggende opties onderscheiden. Houd tijd over voor de evaluatie en de artefacten voordat je de abonnementen vergelijkt.

Voorbeeld van de verdeling van een budget van 24 uitvoeringen, zonder veronderstelde duur
StapBerekeningUitvoeringen
Verkenning4 configuraties × 3 seeds12
Confirmatie2 configuraties × 5 nieuwe seeds10
Gedocumenteerde hervattingenReserve2
Totaal budget12 + 10 + 224
06 /

De volgorde en stopregels voorbereiden

Schrijf de lijst van proeven op voordat ze worden gestart, met identificatie, configuratie, seed en prioriteit. Verdeel de varianten over de volgorde van uitvoering in plaats van eerst alle controles en dan alle kandidaten af te ronden. Als een periode, een dataset of een machine een vergelijkingsblok vormt, documenteer dat blok. Een verandering van omgeving midden in de reeks moet zichtbaar blijven.

Bereid de technische stopredenen voor, zoals herhaalde fouten of een geheugenoverschrijding. Bewaar elke poging en de bijbehorende status. Vervang een mislukking niet stilzwijgend door een kortere uitvoering, en een teleurstellende proef niet door een nieuwe seed tot de verwachte score wordt behaald.

Een vroegtijdige stop op basis van de scores verandert het analyseprotocol. Als je tussentijdse beslissingen plant, kondig dan de regels en hun verkennende reikwijdte aan. Voor een confirmatieve conclusie houd je een analyseplan aan dat op die beslissingen is afgestemd.

07 /

De ablatie afsluiten met een verifieerbare conclusie

De eindfiche vermeldt de hypothese, de controle, de factoren, de herhalingen, de afwijkingen en de mislukkingsgevallen. Koppel elke waarde aan de voorspellingen en aan de run die haar heeft geproduceerd. Sluit af met een expliciete beslissing: component behouden, component verwijderd, of onvoldoende gegevens om te kiezen.

Vermijd drie shortcuts: een verandering aan A toeschrijven terwijl ook de voorbewerking is veranderd; losse winsten bij elkaar optellen zonder hun combinatie te testen; een algemene regel aankondigen op basis van één corpus. Een ablatie stelt een observatie vast binnen een gedefinieerd protocol. De reikwijdte ervan hangt af van de gegevens, het model en de daadwerkelijk onderzochte variaties.

Praktische vragen

Moet je altijd alle combinaties testen?

Een volledig plan is nuttig voor de interacties, maar de kosten ervan stijgen met het aantal factoren. Baken eerst de factoren af die je beslissing kunnen veranderen. Een beperkt plan blijft mogelijk als je expliciet maakt welke effecten het niet kan scheiden; presenteer de ontbrekende combinaties niet als getest.

Kan ik de controle van een eerdere campagne hergebruiken?

Je kunt die hergebruiken als gegevens, code, budget, modelselectie en evaluatie daadwerkelijk vergelijkbaar en gedocumenteerd zijn. Zo niet, start dan een controle opnieuw in het huidige protocol. Een verschil in versie of split kan het verschil verklaren dat je aan de component wilde toeschrijven.

Betekent een negatief resultaat dat de component nutteloos is?

Een negatief resultaat geeft aan dat de component niet het gezochte effect oplevert onder de bestudeerde omstandigheden, of dat het bewijs ontbreekt. Controleer de onzekerheid en de interacties voordat je generaliseert. Het documenteren van dit resultaat voorkomt dat je opnieuw budget uitgeeft aan een al onderzocht spoor.