GPU für die ML-Forschung · Krypto-Zahlung ohne KYC
IteraGPU
Methode · Das Experiment entwerfen

Eine Ablation muss eine Entscheidung isolieren.

Um eine Ablation zu planen, definieren Sie die untersuchte Änderung, eine funktionierende Referenz und das Ergebnis, das Ihre Entscheidung ändern würde. Vergleichen Sie die Varianten an denselben Evaluationsdaten und untersuchen Sie ihre Interaktionen, bevor Sie die Gewinne addieren. Ein guter Plan sieht auch Wiederholungen und eine Bestätigung vor: viele Einstellungen nur einmal zu testen, kann weniger Gewissheit lassen als eine eng gefasste Frage, die korrekt untersucht wird.

01 /

Eine Hypothese formulieren, die widerlegt werden kann

„Das Modell verbessern" präzisiert das Experiment nicht. Schreiben Sie stattdessen: „Die Klassengewichtung verbessert die Qualität bei seltenen Klassen, ohne die zulässige Regression bei häufigen Klassen zu überschreiten." Benennen Sie eine Hauptmetrik, die wichtigen Untergruppen und die Schwelle für den nutzbaren Effekt. Legen Sie auch die Einschränkung fest, die vorrangig bleibt: Speicher, Zeit, Abdeckung der Eingaben oder Einfachheit des Modells.

Unterscheiden Sie Hinzufügen und Entfernen. Wird eine Komponente zu einer einfachen Referenz hinzugefügt, misst das ihren Beitrag in diesem Kontext. Wird sie aus einem vollständigen System entfernt, misst das, was dieses System verliert. Beide Fragen können unterschiedliche Antworten liefern, wenn Komponenten interagieren. Ihre Schlussfolgerung muss daher die Referenz und den Zustand der übrigen Faktoren angeben.

Das erwartete Ergebnis ist eine Entscheidung mit einer Tabelle der Varianten, nicht nur ein besserer Score. Bevor Sie die Versuche reservieren, schreiben Sie auf, was Sie dazu bringen würde, jeden Ansatz beizubehalten, zu verwerfen oder zu vertiefen.

Technische Quellen: NIST — das Ziel des Versuchsplans definieren

02 /

Eine Kontrolle und interpretierbare Varianten aufbauen

Die Kontrolle übernimmt die Referenzprozedur mit ihren Versionen, ihren Daten und ihrer Regel zur Checkpoint-Auswahl. Sie muss in der aktuellen Kampagne ausführbar sein. Eine ältere Metrik ohne Vorhersagen und ohne vollständiges Protokoll kann als Anhaltspunkt dienen, ersetzt aber nicht automatisch diese Kontrolle.

Geben Sie für jeden Faktor genau die beiden verglichenen Zustände an. „Augmentierung aktiviert“ ist zu vage: Behalten Sie Transformation, Wahrscheinlichkeit und betroffene Daten bei. Beschreiben Sie die Parameter, die gemeinsam bleiben: Vorverarbeitung außerhalb des untersuchten Faktors, Splits, Optimierer, Lernbudget und Evaluierungsmethode. Wenn die Lernschritte fest bleiben, aber die verarbeiteten Tokens sich ändern, notieren Sie diese Konsequenz.

Halten Sie das finale Testset aus den Entscheidungen zu den Varianten heraus. Gelernte Transformationen und Tuning-Entscheidungen müssen die dafür vorgesehenen Daten verwenden. Eine Verbesserung, die erzielt wird, nachdem das Modell auf die Fehler des Tests abgestimmt wurde, stellt keine unabhängige Evaluierung mehr dar.

Technische Quellen: scikit-learn — Datenlecks vermeiden

03 /

Zwei Faktoren erfordern vier Situationen

Angenommen, Sie untersuchen A, eine Klassengewichtung, und B, eine Augmentierungsregel beim Training. Um ihre Interaktion zu sehen, betrachten Sie die Kontrolle, A allein, B allein und A mit B. Dieser Plan mit zwei Faktoren und zwei Stufen enthält vier Konfigurationen. Bei k binären Faktoren enthält der vollständige Plan 2ᵏ Konfigurationen vor den Wiederholungen: Die Anzahl der Versuche wächst schnell.

Die folgende Tabelle ist ein erfundenes Zahlenbeispiel, um die Argumentation zu erklären. Ihre Werte stammen aus keinem Training. Sie stellen fiktive Mittelwerte von Macro-F1 auf einer Skala von 0 bis 100 dar; in einer realen Arbeit bleiben die einzelnen Werte und ihre Streuung unverzichtbar.

Veranschaulichendes Beispiel mit vier Konfigurationen — fiktive, nicht gemessene Werte
KonfigurationA: GewichtungB : augmentationFiktive Macro-F1, von 100
KontrolleNeinNein70,0
A alleinJaNein71,2
B alleinNeinJa70,8
A + BJaJa71,5

Technische Quellen: NIST — vollständige faktorielle Pläne mit zwei Stufen

04 /

Effekte und ihre Interaktion lesen

In diesem Beispiel bringt A 1,2 Punkte ohne B, aber nur 0,7 Punkte, wenn B bereits aktiv ist. B bringt 0,8 Punkte ohne A und 0,3 Punkte mit A. Der kombinierte Gewinn beträgt 1,5 Punkte, während die Summe der beiden Einzelgewinne 2,0 Punkte ergibt. Die Abweichung von −0,5 Punkten beschreibt hier eine nicht additive Interaktion.

Diese Berechnung belegt weder ihre Robustheit noch eine Erklärung des Mechanismus. Sie zeigt Ihnen, welche Frage zu bestätigen ist: Rechtfertigt das Hinzufügen von B zum System mit A seine Komplexität für nur 0,3 Punkte in diesem Beispiel? Betrachten Sie auch die vorgesehenen Untergruppen. Ein und derselbe Mittelwert kann unterschiedliche Gewinne und Verluste verdecken.

Vergleichen Sie diese Unterschiede an gepaarten Wiederholungen, wenn Ihr Protokoll dies erlaubt. Wählen Sie nicht den besten Seed jeder Variante. Wenn Vorzeichen oder Ausmaß je nach Versuch stark schwanken, bleibt die Entscheidung unsicher.

Veranschaulichende Abweichung von der Additivität = score(A+B) − score(A) − score(B) + score(Kontrolle) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 Punkte.

Technische Quellen: NIST — Kombinationen und Interaktionen in einem faktoriellen Plan

05 /

Das Budget den wichtigen Entscheidungen zuweisen

Ein Versuchskontingent ist ein Planungswerkzeug, keine Vorhersage der GPU-Geschwindigkeit. Beispiel: Sie verfügen über ein organisatorisches Budget von 24 vollständigen Durchläufen. Sie weisen 12 Durchläufe den vier Konfigurationen mit je drei Seeds zu, 10 einer Bestätigung der Kontrolle und eines Kandidaten mit fünf neuen Seeds und 2 begründeten Wiederholungen. Die Summe beträgt 24; nichts besagt bislang, wie viele Stunden sie erfordern werden.

Die ersten drei Seeds dienen hier der Exploration, nicht der Bestätigung eines Siegers. Legen Sie die Regel zur Auswahl des Kandidaten fest, bevor Sie diese Reihe beobachten. Die Bestätigung verwendet das festgelegte Protokoll; neue Seeds verringern die Abhängigkeit von der ursprünglichen Auswahl, korrigieren aber kein Testset, das bereits zum Einstellen des Modells verwendet wurde.

Wenn das Budget die erforderlichen Wiederholungen nicht erlaubt, reduzieren Sie die Faktoren oder verschieben Sie eine Frage. Priorisieren Sie Änderungen, die eine echte Entscheidung beeinflussen: eine teure Komponente entfernen, einen Fehler beheben oder zwei nahe beieinanderliegende Optionen trennen. Reservieren Sie Zeit für die Auswertung und die Artefakte, bevor Sie die Tarife vergleichen.

Beispiel für die Aufteilung eines Budgets von 24 Ausführungen, ohne angenommene Dauer
SchrittBerechnungAusführungen
Exploration4 Konfigurationen × 3 Seeds12
Bestätigung2 Konfigurationen × 5 neue Seeds10
Dokumentierte WiederholungenReserve2
Gesamtbudget12 + 10 + 224
06 /

Reihenfolge und Abbruchregeln vorbereiten

Schreiben Sie die Liste der Versuche vor deren Start auf, mit Identifikator, Konfiguration, Seed und Priorität. Verteilen Sie die Varianten über die Reihenfolge der Durchführung, statt erst alle Kontrollen und dann alle Kandidaten abzuschließen. Wenn ein Zeitraum, ein Datensatz oder eine Maschine einen Vergleichsblock bildet, dokumentieren Sie diesen Block. Ein Wechsel der Umgebung mitten in der Reihe muss sichtbar bleiben.

Bereiten Sie die technischen Abbruchgründe vor, etwa wiederholte Fehler oder eine Speicherüberschreitung. Behalten Sie jeden Versuch und seinen Status bei. Ersetzen Sie nicht stillschweigend einen Fehlschlag durch eine kürzere Ausführung, noch einen enttäuschenden Versuch durch einen neuen Seed, bis das erwartete Ergebnis erreicht ist.

Ein auf Basis der Ergebnisse beschlossener vorzeitiger Abbruch verändert das Analyseprotokoll. Wenn Sie Zwischenentscheidungen planen, kündigen Sie deren Regeln und ihren explorativen Umfang an. Für eine bestätigende Schlussfolgerung behalten Sie einen Analyseplan bei, der zu diesen Entscheidungen passt.

07 /

Die Ablation mit einer überprüfbaren Schlussfolgerung abschließen

Das abschließende Dokument gibt die Hypothese, die Kontrolle, die Faktoren, die Wiederholungen, die Abweichungen und die Fehlerfälle an. Verknüpfen Sie jeden Wert mit den Vorhersagen und dem Lauf, der ihn erzeugt hat. Schließen Sie mit einer ausdrücklichen Entscheidung ab: Komponente beibehalten, Komponente entfernt oder unzureichende Daten für eine Wahl.

Vermeiden Sie drei Abkürzungen: eine Änderung A zuschreiben, obwohl sich auch die Vorverarbeitung geändert hat; einzelne Gewinne addieren, ohne ihre Kombination zu testen; eine allgemeine Regel aus einem einzigen Korpus ableiten. Eine Ablation stellt eine Beobachtung in einem definierten Protokoll fest. Ihre Reichweite hängt von den Daten, dem Modell und den tatsächlich untersuchten Variationen ab.

Praktische Fragen

Muss man immer alle Kombinationen testen?

Ein vollständiger Plan ist für Interaktionen nützlich, aber seine Kosten steigen mit der Anzahl der Faktoren. Grenzen Sie zunächst die Faktoren ein, die Ihre Entscheidung ändern können. Ein reduzierter Plan bleibt möglich, wenn Sie die Effekte benennen, die er nicht trennen kann; stellen Sie die fehlenden Kombinationen nicht als getestet dar.

Kann ich die Kontrolle einer früheren Kampagne wiederverwenden?

Sie können sie wiederverwenden, wenn Daten, Code, Budget, Modellauswahl und Auswertung tatsächlich vergleichbar und dokumentiert sind. Andernfalls führen Sie eine Kontrolle im aktuellen Protokoll erneut durch. Ein Unterschied bei der Version oder beim Split kann die Abweichung erklären, die Sie der Komponente zuschreiben wollten.

Bedeutet ein negatives Ergebnis, dass die Komponente nutzlos ist?

Ein negatives Ergebnis zeigt, dass sie unter den untersuchten Bedingungen nicht den gesuchten Effekt bringt oder dass der Nachweis fehlt. Prüfen Sie die Unsicherheit und die Interaktionen, bevor Sie verallgemeinern. Dieses Ergebnis zu dokumentieren erspart es, das Budget erneut für eine bereits untersuchte Spur auszugeben.