GPU do badań ML · Płatność crypto bez KYC
IteraGPU
Metoda · Projektowanie eksperymentu

Ablacja powinna izolować jedną decyzję.

Aby zaplanować ablację, zdefiniuj badaną modyfikację, działającą referencję i wynik, który zmieniłby twoją decyzję. Porównaj warianty na tych samych danych ewaluacyjnych, a następnie zbadaj ich interakcje, zanim zsumujesz zyski. Dobry plan rezerwuje też powtórzenia i potwierdzenie: testowanie wielu ustawień jednorazowo może dać mniejszą pewność niż wąskie pytanie należycie zbadane.

01 /

Zapisanie hipotezy, którą można obalić

„Poprawić model” nie precyzuje eksperymentu. Napisz raczej: „Ważenie klas poprawia jakość na rzadkich klasach, nie przekraczając dopuszczalnej regresji na częstych klasach”. Wskaż jedną metrykę główną, ważne podgrupy i próg użytecznego efektu. Ustal też ograniczenie pozostające priorytetem: pamięć, czas, pokrycie danych wejściowych lub prostotę modelu.

Rozróżniaj dodawanie i usuwanie. Dodanie komponentu do prostego odniesienia mierzy jego wkład w tym kontekście. Usunięcie go z kompletnego systemu mierzy to, co traci ten system. Oba pytania mogą dawać różne odpowiedzi, gdy komponenty oddziałują na siebie. Twoja konkluzja musi więc precyzować odniesienie i stan pozostałych czynników.

Oczekiwanym rezultatem jest decyzja wraz z tabelą wariantów, a nie tylko lepszy wynik. Zanim zarezerwujesz próby, zapisz, co skłoniłoby Cię do zachowania, porzucenia lub pogłębienia każdego tropu.

Źródła techniczne: NIST — zdefiniuj cel planu eksperymentu

02 /

Zbuduj próbę kontrolną i interpretowalne warianty

Próba kontrolna przejmuje procedurę odniesienia wraz z jej wersjami, danymi i regułą wyboru checkpointu. Musi być wykonalna w bieżącej kampanii. Dawna metryka bez predykcji i pełnego protokołu może służyć jako punkt odniesienia, ale nie zastępuje automatycznie tej próby kontrolnej.

Dla każdego czynnika zadeklaruj dokładnie dwa porównywane stany. „Augmentacja włączona” jest zbyt ogólne: zachowaj transformację, prawdopodobieństwo i dotyczące dane. Opisz parametry, które pozostają wspólne: przetwarzanie wstępne poza badanym czynnikiem, podziały, optymalizator, budżet uczenia i metodę oceny. Jeśli kroki uczenia pozostają stałe, ale przetwarzane tokeny się zmieniają, odnotuj tę konsekwencję.

Trzymaj końcowy zbiór testowy poza wyborami wariantów. Uczone transformacje i decyzje o strojeniu powinny wykorzystywać dane przeznaczone do tego celu. Poprawa uzyskana po dostrojeniu modelu na błędach testu nie stanowi już niezależnej oceny.

Źródła techniczne: scikit-learn — unikaj wycieków danych

03 /

Dwa czynniki wymagają czterech sytuacji

Załóżmy, że badasz A, ważenie klas, oraz B, regułę augmentacji przy uczeniu. Aby zobaczyć ich interakcję, zbadaj próbę kontrolną, samo A, samo B oraz A z B. Ten plan z dwoma czynnikami i dwoma poziomami zawiera cztery konfiguracje. Przy k czynnikach binarnych pełny plan zawiera 2ᵏ konfiguracji przed powtórzeniami: liczba prób rośnie szybko.

Poniższa tabela to wymyślony przykład liczbowy służący wyjaśnieniu rozumowania. Jej wyniki nie pochodzą z żadnego uczenia. Przedstawiają fikcyjne średnie macro-F1 w skali od 0 do 100; w rzeczywistej pracy poszczególne wartości i ich zmienność pozostają niezbędne.

Przykład ilustracyjny czterech konfiguracji — wartości fikcyjne, niemierzone
KonfiguracjaA: ważenieB : augmentationFikcyjna macro-F1, na 100
Próba kontrolnaNieNie70,0
Samo ATakNie71,2
Samo BNieTak70,8
A + BTakTak71,5

Źródła techniczne: NIST — pełne plany czynnikowe na dwóch poziomach

04 /

Odczytaj efekty i ich interakcję

W tym przykładzie A daje 1,2 punktu bez B, ale tylko 0,7 punktu, gdy B jest już aktywny. B daje 0,8 punktu bez A i 0,3 punktu z A. Łączny zysk wynosi 1,5 punktu, podczas gdy suma obu izolowanych zysków to 2,0 punktu. Różnica −0,5 punktu opisuje tu interakcję nieaddytywną.

To obliczenie nie ustala ani jego odporności, ani wyjaśnienia mechanizmu. Uczy Cię, które pytanie potwierdzić: czy dodanie B do systemu zawierającego A uzasadnia jego złożoność za jedyne 0,3 punktu w tym przykładzie? Przeanalizuj też zaplanowane podgrupy. Ta sama średnia może ukrywać różne zyski i straty.

Porównuj te różnice na sparowanych powtórzeniach, gdy Twój protokół na to pozwala. Nie wybieraj najlepszego ziarna z każdego wariantu. Jeśli znak lub amplituda mocno zmieniają się między próbami, decyzja pozostaje niepewna.

Ilustracyjne odchylenie od addytywności = wynik(A+B) − wynik(A) − wynik(B) + wynik(próby kontrolnej) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 punktu.

Źródła techniczne: NIST — kombinacje i interakcje w planie czynnikowym

05 /

Przydziel budżet do ważnych decyzji

Pula prób to narzędzie planowania, a nie prognoza szybkości GPU. Przykład: masz organizacyjny budżet 24 pełnych uruchomień. Przydzielasz 12 uruchomień na cztery konfiguracje z trzema ziarnami każda, 10 na potwierdzenie próby kontrolnej i kandydata z pięcioma nowymi ziarnami, a 2 na uzasadnione powtórzenia. Suma wynosi 24; nic jeszcze nie mówi, ile godzin będą wymagać.

Pierwsze trzy ziarna służą tu do eksploracji, a nie do wyłonienia zwycięzcy. Ustal regułę wyboru kandydata, zanim zaczniesz obserwować tę serię. Potwierdzenie wykorzystuje uzgodniony protokół; nowe ziarna zmniejszają zależność od wstępnej selekcji, ale nie naprawiają zbioru testowego, który posłużył już do dostrojenia modelu.

Jeśli budżet nie pozwala na niezbędne powtórzenia, ogranicz czynniki lub odłóż jedno pytanie na później. Nadaj priorytet zmianom, które wpływają na realną decyzję: usunięciu kosztownego komponentu, rozwiązaniu awarii lub rozstrzygnięciu między dwiema zbliżonymi opcjami. Zarezerwuj czas na ewaluację i artefakty, zanim porównasz pakiety.

Przykład podziału budżetu 24 uruchomień, bez zakładanego czasu trwania
EtapObliczeniaUruchomienia
Eksploracja4 konfiguracje × 3 ziarna12
Potwierdzenie2 konfiguracje × 5 nowych ziaren10
Udokumentowane wznowieniaRezerwa2
Całkowity budżet12 + 10 + 224
06 /

Przygotuj kolejność i reguły zatrzymania

Zapisz listę prób przed ich uruchomieniem, z identyfikatorem, konfiguracją, ziarnem i priorytetem. Rozłóż warianty w kolejności przebiegu, zamiast kończyć najpierw wszystkie próby kontrolne, a potem wszystkie kandydatów. Jeśli okres, zbiór danych lub maszyna stanowi blok porównawczy, udokumentuj ten blok. Zmiana środowiska w połowie serii musi pozostać widoczna.

Przygotuj techniczne powody zatrzymania, takie jak powtarzające się błędy lub przekroczenie pamięci. Zachowaj każdą próbę i jej status. Nie zastępuj po cichu niepowodzenia krótszym uruchomieniem ani rozczarowującej próby nowym ziarnem, aż uzyskasz oczekiwany wynik.

Przedwczesne zatrzymanie na podstawie wyników zmienia protokół analizy. Jeśli planujesz decyzje pośrednie, ogłoś ich reguły i charakter eksploracyjny. Aby wyciągnąć wnioski potwierdzające, zachowaj plan analizy dostosowany do tych decyzji.

07 /

Zamknij ablację wnioskiem, który można zweryfikować

Końcowa karta podaje hipotezę, próbę kontrolną, czynniki, powtórzenia, odchylenia i przypadki niepowodzeń. Powiąż każdą wartość z przewidywaniami i uruchomieniem, które ją wygenerowało. Zakończ wyraźną decyzją: komponent zachowany, komponent usunięty lub dane niewystarczające do wyboru.

Unikaj trzech skrótów: przypisywania zmiany czynnikowi A, gdy zmieniło się także przetwarzanie wstępne; sumowania izolowanych zysków bez testowania ich kombinacji; ogłaszania ogólnej reguły na podstawie jednego korpusu. Ablacja ustala obserwację w zdefiniowanym protokole. Jej zasięg zależy od danych, modelu i faktycznie badanych wariantów.

Praktyczne pytania

Czy zawsze trzeba testować wszystkie kombinacje?

Pełny plan jest przydatny przy interakcjach, ale jego koszt rośnie wraz z liczbą czynników. Najpierw wyodrębnij czynniki, które mogą zmienić twoją decyzję. Uproszczony plan jest nadal możliwy, jeśli jasno określisz efekty, których nie pozwala rozdzielić; nie przedstawiaj nieobecnych kombinacji jako przetestowanych.

Czy mogę ponownie użyć próby kontrolnej z poprzedniej kampanii?

Możesz ją ponownie użyć, jeśli dane, kod, budżet, wybór modelu i ewaluacja są rzeczywiście porównywalne i udokumentowane. W przeciwnym razie uruchom próbę kontrolną w bieżącym protokole. Różnica wersji lub podziału może wyjaśniać rozbieżność, którą chciałeś przypisać komponentowi.

Czy wynik negatywny oznacza, że komponent jest bezużyteczny?

Wynik negatywny wskazuje, że nie daje oczekiwanego efektu w badanych warunkach albo że brakuje dowodów. Sprawdź niepewność i interakcje, zanim uogólnisz. Udokumentowanie tego wyniku pozwala uniknąć ponownego wydawania budżetu na już zbadany trop.