GPU do badań ML · Płatność crypto bez KYC
IteraGPU
Metoda · Powtórzenia i niepewność

Porównuj różnice, a nie dwa najlepsze wyniki.

Różnica między dwoma wynikami staje się bardziej przekonująca, gdy powtarza się w porównywalnym protokole, przekracza użyteczny próg i pozostaje czytelna wraz ze swoją niepewnością. Przygotuj ziarna, sparuj próby, gdy ma to sens, i analizuj uzyskane różnice. Wyższa średnia, korzystne ziarno czy wąski przedział na jednym źródle zmienności nie wystarczą, by potwierdzić ogólną poprawę.

01 /

Określ, co się zmienia, a co stanowi powtórzenie

Zacznij od pytania: oceniasz efekt inicjalizacji treningu, kolejności danych, podziału train/test czy generowania stochastycznego? Ziarno kontroluje generator liczb losowych; samo w sobie nie identyfikuje wszystkich tych wymiarów. Zachowaj jeden wiersz na uruchomienie i czynniki, które rzeczywiście zostały zmienione.

Dziesięciokrotne powtórzenie deterministycznej ewaluacji tego samego checkpointu na tym samym korpusie nie daje dziesięciu niezależnych treningów. Podobnie tysiąc predykcji pochodzących z jednego modelu nie zastąpi kilku treningów przy szacowaniu ich zmienności. Wybierz jednostkę powtórzenia odpowiadającą podejmowanej decyzji.

Przed rozpoczęciem serii ustal metrykę główną, jej kierunek i minimalny efekt, który uzasadniałby zmianę. W kolejnych przykładach wyższa wartość jest lepsza, a ilustracyjny próg użyteczności wynosi 0,30 punktu na metryce prezentowanej w skali od 0 do 100. Próg ten wynika z decyzji projektowej, a nie z uniwersalnej reguły statystycznej.

02 /

Dopasuj konfiguracje do wspólnych warunków

Dla pary i uruchom referencję A i kandydata B na tym samym podziale danych i z przewidzianymi wspólnymi warunkami. Następnie oblicz dᵢ = score(Bᵢ) − score(Aᵢ). Dopasowanie opiera się na powiązaniu zdefiniowanym przed uzyskaniem wyników; nie polega na kojarzeniu później wyników, które są do siebie podobne.

Użycie tej samej listy ziaren może pomóc w organizacji par, ale dwie architektury mogą zużywać liczby losowe w różny sposób. Deklaruj oddzielnie ziarna inicjalizacji, danych i generowania, gdy Twój kod je rozróżnia. Zapisuj także partycje lub ich identyfikatory: wspólna liczba całkowita nie dowodzi, że dane zostały przetworzone w ten sam sposób.

Jeśli para zawiera niepowodzenie, zachowaj oba statusy i wyjaśnij, jak zostanie ona potraktowana. Nie porównuj średniej pięciu udanych kandydatów ze średnią sześciu referencji bez zasygnalizowania zmiany populacji.

Źródła techniczne: NIST — dopasowanie obserwacji sparowanych

03 /

Uwzględnij ograniczenia ziarna i determinizmu

PyTorch wskazuje, że w pełni odtwarzalne wyniki nie są gwarantowane między wersjami, platformami ani uruchomieniami na CPU i GPU, nawet przy identycznym ziarnie. Jego przewodnik rozróżnia kontrolę generatorów od kontroli operacji niedeterministycznych. Odnotuj wersje i zastosowane opcje, zamiast podsumowywać środowisko jako „ustawione ziarno”.

Uruchomienie deterministyczne służy między innymi do odtworzenia zachowania w danych warunkach. Nie dowodzi, że model jest odporny na inne inicjalizacje lub dane. Odwrotnie, różnica między dwoma identycznymi powtórzeniami zasługuje na diagnozę, zanim zostanie zinterpretowana jako efekt kandydata.

Zachowaj tę samą politykę determinizmu dla obu wariantów. Jeśli zmienisz ją w celu zdiagnozowania błędu, oznacz tę serię osobno. Wynik eksperymentu powinien pozostać powiązany z warunkami, w których został uzyskany.

Źródła techniczne: PyTorch 2.14 — odtwarzalność i kontrola losowości

04 /

Przykład obliczeniowy: pięć różnic sparowanych

Oto pięć fikcyjnych par przeznaczonych do obliczeń, bez przeprowadzonego treningu. Ziarna są przykładowymi identyfikatorami. Referencja i kandydat stosują tu ten sam protokół porównania. Wyniki są wyrażone w skali do 100; różnice to punkty, a nie wartości procentowe względne.

Średnia różnic wynosi (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 punktu. Ich mediana wynosi 0,30 punktu, a rozstęp od 0,10 do 0,50. Odchylenie standardowe z próby dla różnic wynosi około 0,179 punktu, z mianownikiem n − 1. Wszystkie pięć znaków jest dodatnich, ale amplituda pozostaje duża w stosunku do średniego zysku.

Średnia różnica = 0,28 punktu; odchylenie standardowe różnic ≈ 0,179 punktu; błąd standardowy ≈ 0,179 / √5 = 0,080 punktu.
Fikcyjny przykład liczbowy — wyniki w skali do 100, różnice w punktach
Ziarno ilustracyjneReferencja AKandydat BB − A
1771,071,4+0,4
2971,671,9+0,3
4371,371,4+0,1
7170,871,3+0,5
10171,871,9+0,1
05 /

Odczytuj przedział bez nadawania mu nadmiernego zasięgu

Aby zilustrować typowe obliczenie, załóżmy, że różnice są niezależne między parami i pochodzą z rozkładu w przybliżeniu normalnego. Przedział Studenta na poziomie 95% dla ich średniej wykorzystuje tu cztery stopnie swobody: 0,28 ± 2,776 × 0,080, czyli około [0,058; 0,502] punktu. Przy zaledwie pięciu parach kształt rozkładu jest trudny do oceny; obliczenie nie czyni tych założeń prawdziwymi.

Ten przedział jest w przykładzie powyżej zera, ale obejmuje ustalony próg użyteczności wynoszący 0,30 punktu. Nie wspiera zatem rygorystycznej reguły „średni zysk przekracza 0,30 punktu”. Dodatnia różnica może pozostać zbyt mała lub zbyt niepewna, by uzasadnić zmianę.

Przedział 95 % opisuje procedurę pokrycia przy swoich założeniach, a nie 95 % prawdopodobieństwo przypisane parametrowi po obliczeniach. Obejmuje tu wyłącznie zmienność reprezentowaną przez pary, a nie automatycznie inny obszar, inny korpus czy przyszły sprzęt.

Jeśli używasz SciPy, ttest_rel porównuje próby zależne i oferuje przedział ufności. Kolejność tablic ustala znak: dla B − A umieść B na pierwszym miejscu. Zachowaj wartości i zastosowaną metodę, nie tylko p-wartość.

Źródła techniczne: NIST — przedział ufności dla średniej · SciPy 1.18 — ttest_rel i przedział różnic

06 /

Przygotowanie decyzji i kolejnych powtórzeń

Wynik przykładu to „zysk użyteczny nieudowodniony”, a nie „bezużyteczny kandydat”. W zależności od kosztu zmiany możesz zachować punkt odniesienia, kontynuować zbieranie danych lub przetestować bardziej zasadniczą modyfikację. Ogłoś tę regułę, zanim zobaczysz serię wyników. Dolna granica powyżej twojego progu użyteczności silniej wspierałaby wdrożenie, pod warunkiem że reszta protokołu jest poprawna.

Zaplanuj powtórzenia na podstawie wymaganej precyzji i oczekiwanej zmienności, z rezerwą na niepowodzenia. Nie istnieje liczba ziaren, która uniwersalnie gwarantuje rozstrzygnięcie. Pilotaż może pomóc oszacować rozrzut; zachowaj jego status eksploracyjny, a następnie ustal procedurę potwierdzającą.

Unikaj zaglądania po każdej parze i zatrzymywania się, gdy tylko wynik stanie się korzystny, używając przedziału przewidzianego dla stałej liczebności. Wybierz liczebność i analizę z góry albo dostosowaną metodę sekwencyjną. Dodawanie prób wyłącznie do rozczarowującego kandydata również zmienia równowagę porównania.

07 /

Nie myl zmienności treningu z oceną korpusu

Seria ziaren na ustalonym zbiorze testowym dostarcza informacji o zmienności treningów na tym zbiorze. Sama w sobie nie mierzy niepewności związanej z wyborem przykładów testowych. Jeśli twoje pytanie dotyczy także podziałów lub domen, zaplanuj schemat, który zmienia te wymiary bez mieszania ich w jednym liczniku powtórzeń.

Zachowaj końcową ocenę z dala od wyborów modeli. Wybieranie spośród wielu wariantów za pomocą tego samego testu sprzyja opcjom, które wypadają w nim dobrze przez przypadek. Podgrupy i uzupełniające metryki powinny naświetlać decyzję, z widoczną ich liczbą i statusem eksploracyjnym.

Wynik końcowy łączy surowe wyniki, pary, różnice, rozrzut, metodę przedziału i decyzję wobec progu użyteczności. Dołącz niepowodzenia i ograniczenia generalizacji. Możesz wtedy wyjaśnić, dlaczego różnica wydaje ci się wystarczająca, niewystarczająca lub wciąż nierozstrzygalna.

Źródła techniczne: scikit-learn — trzymanie testu poza wyborami modelu

Praktyczne pytania

Czy pięć ziaren wystarczy do wyboru?

Pięć ziaren może posłużyć do pierwszej obserwacji, ale nie gwarantuje wystarczającej precyzji. Potrzebna liczba zależy od zmienności i najmniejszego użytecznego efektu. Przeanalizuj surowe różnice i niepewność; wynik wciąż nierozstrzygalny wymaga lepiej zaprojektowanego protokołu, a nie magicznej liczby.

Czy przedział zawierający zero dowodzi równoważności?

Przedział zawierający zero nie dowodzi równoważności. Może być też zgodny z istotnymi zyskami lub stratami. Aby potwierdzić równoważność praktyczną, ustal z góry akceptowalny margines i zastosuj analizę dostosowaną do tego pytania, z wystarczającą precyzją, by go zbadać.

Czy mogę opublikować tylko najlepsze ziarno?

Najlepsze ziarno opisuje korzystny wybór, a nie typową wydajność procedury. Opublikuj cały zestaw zaplanowanych powtórzeń i regułę wyboru dostarczonego modelu. Jeśli ten najlepszy model ma zostać oceniony, użyj końcowej oceny, która nie posłużyła do jego wyboru.