GPU do badań ML · Płatność crypto bez KYC
IteraGPU
Laboratorium / Ścieżka ML: pięć pytań, pięć punktów wyjścia
IteraGPU / Badania ML

Które pytanie blokuje Cię dzisiaj?

Od pierwszego wczytania po checkpointy — uporządkuj punkty do sprawdzenia przed kampanią obliczeniową. Znajdź przewodniki, jak szacować rozmiary, mierzyć i zachowywać użyteczne wyniki.

Wybierz pytanie, które Cię blokuje. Każda ścieżka prowadzi do konkretnej decyzji, a biblioteka zbiera wszystkie materiały.

Mój model jeszcze nie działał. Od czego zacząć?

Budżet pamięci i dane wejściowe pierwszego testu.

  1. Wymiarowanie pamięci GPU: obliczenia, rezerwy i walidacja

    Oblicz wagi w GiB, zbuduj jawną rezerwę i zatwierdź pik według fazy. Przykłady liczbowe, pułapki kwantyzacji i wybór według karty.

  2. Pamięć GPU: wyjaśnić rozbieżność między szacowaniem a szczytem

    Rozróżnij wagi, cache i aktywacje, zmierz allocated i reserved na każdym etapie, a następnie wybierz margines za pomocą notebooka i protokołu PyTorch.

  3. Cache KV: oblicz pamięć według kontekstu, GQA i batcha

    Oblicz cache KV na podstawie głów KV, kontekstu i równoczesnych sekwencji. Rozróżnij GQA, precyzję i cache statyczny przed rzeczywistą próbą.

Wynik rośnie, ale czy mogę mu zaufać?

Wydzielony zbiór ewaluacyjny, przejrzane błędy i opisana różnica.

  1. Zbuduj zbiór ewaluacyjny ML bez wycieku danych

    Oddziel grupy, duplikaty i sposoby użycia danych, aby zbudować odłożony na bok zbiór ewaluacyjny ML: kontrolowalny i dopasowany do twojej decyzji.

  2. Analiza błędów ML w celu wyboru następnego eksperymentu

    Analizuj błędy klasyfikacji i ekstrakcji: macierz pomyłek, odniesienia, taksonomia, regresje i kontrola następnej poprawki.

  3. Zmienność między ziarnami: czy różnica w ML jest przekonująca?

    Interpretuj powtórzenia w ML za pomocą sparowanych ziaren, rozproszenia i progu użytecznego efektu. Obliczony przykład i ograniczenia małej próby.

Przygotowuję trening. Co sprawdzić przed serią?

Pełna aktualizacja, jawny batch i użyteczne ślady.

  1. Trening GPU: zweryfikuj pętlę przed kampanią

    Przygotuj dane, batch i wznowienie treningu. Protokół według faz do kontroli pamięci, gradientów, walidacji i plików wyjściowych.

  2. Microbatch i akumulacja: obliczyć efektywny batch

    Oblicz efektywny batch, znormalizuj stratę i zweryfikuj akumulację gradientów na jednej lub wielu kartach, wraz z jej ograniczeniami równoważności.

  3. Śledzenie eksperymentów ML: od uruchomienia do decyzji

    Połącz dane, kod, parametry, predykcje i decyzję za pomocą manifestu eksperymentu ML. Przykład kontroli runów i artefaktów bez narzucania narzędzia.

Dostrojenie czy kompresja modelu: jak wybrać wariant?

Punkt odniesienia, kontrolowana zmiana i porównywalna jakość.

  1. Fine-tuning: wybrać adaptację i zweryfikować jej wkład

    Przygotuj fine-tuning z odniesieniem, rozdzielonymi danymi i kontrolą ponownego wczytania. LoRA, skwantyzowana baza, budżet i analiza regresji.

  2. Porównywanie kwantyzacji: pamięć, jakość i użyteczny koszt

    Porównaj referencję, kalibrację, format wag i cache KV na tych samych danych. Zmierz pamięć i jakość, zanim zdecydujesz o budżecie GPU.

  3. Planowanie ablacji ML: próba kontrolna, efekty i budżet

    Zbuduj plan ablacji ML z próbą kontrolną, czynnikami, interakcjami i budżetem prób. Obliczony przykład priorytetyzacji wariantów i wyciągania wniosków.

Budżet jest ograniczony. Które testy przeprowadzić najpierw?

Kolejność eksperymentów i koszt pakietu zestawiony z użytecznymi wynikami.

  1. Budżetowanie kampanii ML: próby, decyzje i cały forfait

    Rozłóż kampanię ML na części, ustal priorytety wariantów i powiąż forfait GPU z użytecznymi wynikami, z przykładem harmonogramu i budżetu w USD.

  2. Planowanie ablacji ML: próba kontrolna, efekty i budżet

    Zbuduj plan ablacji ML z próbą kontrolną, czynnikami, interakcjami i budżetem prób. Obliczony przykład priorytetyzacji wariantów i wyciągania wniosków.

  3. Benchmark ML: porównaj koszt przy równoważnej jakości

    Ustal jakość, zmierz ten sam korpus i porównaj pełny koszt forfaitów GPU na 3, 7 lub 30 dni. Protokół i surowa tabela do pobrania.