GPU für die ML-Forschung · Krypto-Zahlung ohne KYC
IteraGPU
Methode · Wiederholungen und Unsicherheit

Vergleichen Sie Unterschiede, nicht zwei Bestwerte.

Eine Abweichung zwischen zwei Ergebnissen wird überzeugender, wenn sie sich in einem vergleichbaren Protokoll wiederholt, eine nutzbare Schwelle überschreitet und mit ihrer Unsicherheit nachvollziehbar bleibt. Bereiten Sie die Seeds vor, paaren Sie die Versuche, wo es sinnvoll ist, und analysieren Sie die erhaltenen Unterschiede. Ein höherer Mittelwert, ein günstiger Seed oder ein enges Intervall bei einer einzigen Variationsquelle reichen nicht aus, um eine allgemeine Verbesserung zu belegen.

01 /

Festlegen, was variiert und was eine Wiederholung darstellt

Beginnen Sie mit der Frage: Bewerten Sie den Effekt der Initialisierung eines Trainings, der Datenreihenfolge, eines Train/Test-Splits oder einer stochastischen Generierung? Ein Seed steuert einen Zufallsgenerator; er allein identifiziert nicht alle diese Dimensionen. Behalten Sie eine Zeile pro Ausführung und die tatsächlich geänderten Faktoren bei.

Die zehnmalige Wiederholung der deterministischen Evaluierung desselben Checkpoints auf demselben Korpus ergibt nicht zehn unabhängige Trainings. Ebenso ersetzen tausend Vorhersagen aus einem einzigen Modell nicht mehrere Trainings, um deren Variabilität zu schätzen. Wählen Sie die Wiederholungseinheit, die zur Entscheidung passt.

Legen Sie vor der Serie die Hauptmetrik, ihre Richtung und den minimalen Effekt fest, der die Änderung rechtfertigen würde. In den folgenden Beispielen ist ein höherer Wert besser und der illustrative nützliche Schwellenwert beträgt 0,30 Punkte auf einer angezeigten Metrik von 0 bis 100. Dieser Schwellenwert stammt aus der Projektentscheidung, nicht aus einer universellen statistischen Regel.

02 /

Die Konfigurationen auf gemeinsamen Bedingungen paaren

Führen Sie für ein Paar i die Referenz A und den Kandidaten B auf demselben Datensplit und mit den vorgesehenen gemeinsamen Bedingungen aus. Berechnen Sie dann dᵢ = score(Bᵢ) − score(Aᵢ). Die Paarung beruht auf einer vor den Ergebnissen definierten Entsprechung; sie besteht nicht darin, im Nachhinein die Scores einander zuzuordnen, die sich ähneln.

Die Verwendung derselben Seed-Liste kann helfen, die Paare zu organisieren, aber zwei Architekturen können die Zufallszahlen unterschiedlich verbrauchen. Deklarieren Sie die Initialisierungs-, Daten- und Generierungs-Seeds getrennt, wenn Ihr Code sie unterscheidet. Erfassen Sie außerdem die Partitionen oder deren Identifikatoren: eine gemeinsame Ganzzahl beweist nicht, dass die Daten auf dieselbe Weise durchlaufen wurden.

Wenn ein Paar einen Fehlschlag enthält, behalten Sie beide Status bei und erläutern Sie, wie damit umgegangen wird. Vergleichen Sie nicht den Mittelwert von fünf erfolgreichen Kandidaten mit dem von sechs Referenzen, ohne die Änderung der Grundgesamtheit anzugeben.

Technische Quellen: NIST — Entsprechung zwischen gepaarten Beobachtungen

03 /

Die Grenzen von Seed und Determinismus beachten

PyTorch weist darauf hin, dass vollständig reproduzierbare Ergebnisse zwischen Versionen, Plattformen oder CPU- und GPU-Ausführungen nicht garantiert sind, selbst bei identischem Seed. Sein Leitfaden unterscheidet die Steuerung der Generatoren von der der nicht deterministischen Operationen. Halten Sie die Versionen und die angewandten Optionen fest, statt die Umgebung mit „Seed fixiert“ zusammenzufassen.

Eine deterministische Ausführung dient unter anderem dazu, ein Verhalten unter gegebenen Bedingungen wiederzufinden. Sie belegt nicht, dass das Modell anderen Initialisierungen oder Daten standhält. Umgekehrt verdient ein Unterschied zwischen zwei identischen Wiederholungen eine Diagnose, bevor er als Effekt des Kandidaten interpretiert wird.

Behalten Sie dieselbe Determinismus-Strategie für beide Varianten bei. Wenn Sie sie ändern, um einen Fehler zu diagnostizieren, kennzeichnen Sie diese Serie separat. Das Versuchsergebnis muss an die Bedingungen gebunden bleiben, unter denen es erzielt wurde.

Technische Quellen: PyTorch 2.14 — Reproduzierbarkeit und Steuerung des Zufalls

04 /

Berechnetes Beispiel: fünf gepaarte Differenzen

Hier sind fünf fiktive Paare für die Berechnung, ohne dass ein Training ausgeführt wurde. Die Seeds sind Beispiel-Identifikatoren. Die Referenz und der Kandidat verwenden hier dasselbe Vergleichsprotokoll. Die Scores sind auf 100 angegeben; die Differenzen sind Punkte und keine relativen Prozentsätze.

Der Mittelwert der Differenzen beträgt (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 Punkte. Ihr Median beträgt 0,30 Punkte und ihre Spannweite reicht von 0,10 bis 0,50. Die Stichproben-Standardabweichung der Differenzen beträgt etwa 0,179 Punkte, mit einem Nenner von n − 1. Alle fünf Vorzeichen sind positiv, aber die Amplitude bleibt im Verhältnis zum mittleren Gewinn groß.

Mittlere Differenz = 0,28 Punkte; Standardabweichung der Differenzen ≈ 0,179 Punkte; Standardfehler ≈ 0,179 / √5 = 0,080 Punkte.
Fiktives Zahlenbeispiel — Scores auf 100, Differenzen in Punkten
Illustrativer SeedReferenz AKandidat BB − A
1771,071,4+0,4
2971,671,9+0,3
4371,371,4+0,1
7170,871,3+0,5
10171,871,9+0,1
05 /

Ein Intervall lesen, ohne ihm eine übermäßige Tragweite zu geben

Um eine übliche Berechnung zu veranschaulichen, nehmen wir an, dass die Differenzen zwischen den Paaren unabhängig und aus einer annähernd normalen Verteilung stammen. Das Student-Intervall zu 95 % für ihren Mittelwert verwendet hier vier Freiheitsgrade: 0,28 ± 2,776 × 0,080, also etwa [0,058; 0,502] Punkte. Mit nur fünf Paaren ist die Form der Verteilung schwer einzuschätzen; die Berechnung macht diese Annahmen nicht wahr.

Dieses Intervall liegt im Beispiel über null, überschreitet aber die festgelegte Nutzschwelle von 0,30 Punkten nicht. Es stützt somit nicht die strenge Regel „der mittlere Gewinn übersteigt 0,30 Punkte“. Ein positiver Unterschied kann zu klein oder zu unsicher bleiben, um die Änderung zu rechtfertigen.

Ein 95-%-Intervall beschreibt ein Überdeckungsverfahren unter seinen Annahmen, nicht eine 95-%-Wahrscheinlichkeit für den Parameter nach der Berechnung. Es deckt hier nur die durch die Paare repräsentierte Variation ab, nicht automatisch einen anderen Bereich, ein anderes Korpus oder zukünftige Hardware.

Wenn Sie SciPy verwenden, vergleicht ttest_rel verbundene Stichproben und liefert ein Konfidenzintervall. Die Reihenfolge der Arrays bestimmt das Vorzeichen: Für B − A setzen Sie B an die erste Stelle. Bewahren Sie die Werte und die verwendete Methode auf, nicht nur einen p-Wert.

Technische Quellen: NIST — Konfidenzintervall für einen Mittelwert · SciPy 1.18 — ttest_rel und Intervall der Differenzen

06 /

Die Entscheidung und die nächsten Wiederholungen vorbereiten

Das Ergebnis des Beispiels lautet „Nutzgewinn nicht belegt“, nicht „nutzloser Kandidat“. Je nach Kosten der Änderung können Sie die Referenz beibehalten, die Datenerhebung fortsetzen oder eine substanziellere Änderung testen. Legen Sie diese Regel fest, bevor Sie die Reihe vor sich haben. Eine untere Grenze über Ihrer Nutzschwelle würde die Übernahme stärker stützen, sofern der Rest des Protokolls gültig ist.

Planen Sie die Wiederholungen anhand der erforderlichen Präzision und der erwarteten Streuung, mit einem Puffer für Fehlschläge. Es gibt keine Anzahl von Seeds, die universell eine Schlussfolgerung garantiert. Ein Pilotversuch kann helfen, die Streuung zu schätzen; behalten Sie seinen explorativen Status bei und legen Sie anschließend das Bestätigungsverfahren fest.

Vermeiden Sie es, nach jedem Paar zu schauen und dann abzubrechen, sobald das Ergebnis günstig wird, indem Sie ein für einen festen Stichprobenumfang vorgesehenes Intervall verwenden. Wählen Sie einen Stichprobenumfang und eine Analyse im Voraus oder eine geeignete sequenzielle Methode. Nur beim enttäuschenden Kandidaten weitere Versuche hinzuzufügen, verändert ebenfalls das Gleichgewicht des Vergleichs.

07 /

Trainingsvariabilität und Korpusbewertung nicht verwechseln

Eine Reihe von Seeds auf einem festen Testsatz gibt Auskunft über die Variation der Trainings auf diesem Satz. Sie misst für sich genommen nicht die Unsicherheit, die mit der Wahl der Testbeispiele verbunden ist. Wenn Ihre Frage auch Partitionen oder Domänen betrifft, planen Sie ein Design, das diese Dimensionen variiert, ohne sie in einem einzigen Wiederholungszähler zu vermischen.

Halten Sie eine abschließende Bewertung von den Modellentscheidungen fern. Die Auswahl unter vielen Varianten mit demselben Test begünstigt Optionen, die dort zufällig gut abschneiden. Untergruppen und ergänzende Metriken sollten die Entscheidung erhellen, mit sichtbarer Anzahl und ihrem explorativen Status.

Die abschließende Ausgabe vereint die Rohwerte, die Paare, die Differenzen, die Streuung, die Intervallmethode und die Entscheidung gegenüber der Nutzschwelle. Fügen Sie die Fehlschläge und die Grenzen der Generalisierung bei. Sie können dann erklären, warum Ihnen der Unterschied ausreichend, unzureichend oder noch unentscheidbar erscheint.

Technische Quellen: scikit-learn — den Test aus den Modellentscheidungen heraushalten

Praktische Fragen

Reichen fünf Seeds für die Auswahl?

Fünf Seeds können für eine erste Beobachtung dienen, garantieren aber keine ausreichende Präzision. Die erforderliche Anzahl hängt von der Streuung und dem kleinsten Nutzeffekt ab. Untersuchen Sie die Rohdifferenzen und die Unsicherheit; ein noch unentscheidbares Ergebnis verlangt ein besser dimensioniertes Protokoll, keine magische Zahl.

Beweist ein Intervall, das null enthält, die Äquivalenz?

Ein Intervall, das null enthält, beweist keine Äquivalenz. Es kann auch mit erheblichen Gewinnen oder Verlusten vereinbar sein. Um eine praktische Äquivalenz zu stützen, legen Sie im Voraus eine akzeptable Marge fest und verwenden Sie eine für diese Frage geeignete Analyse mit genügend Präzision, um sie zu prüfen.

Kann ich nur den besten Seed veröffentlichen?

Der beste Seed beschreibt eine günstige Auswahl, nicht die typische Leistung des Verfahrens. Veröffentlichen Sie alle geplanten Wiederholungen und die Regel zur Auswahl des ausgelieferten Modells. Wenn dieses beste Modell bewertet werden soll, verwenden Sie eine abschließende Bewertung, die nicht zu seiner Auswahl gedient hat.