Które pytanie blokuje Cię dzisiaj?
Od pierwszego wczytania po checkpointy — uporządkuj punkty do sprawdzenia przed kampanią obliczeniową. Znajdź przewodniki, jak szacować rozmiary, mierzyć i zachowywać użyteczne wyniki.
Mój model jeszcze nie działał. Od czego zacząć?
Budżet pamięci i dane wejściowe pierwszego testu.
Wymiarowanie pamięci GPU: obliczenia, rezerwy i walidacja
Oblicz wagi w GiB, zbuduj jawną rezerwę i zatwierdź pik według fazy. Przykłady liczbowe, pułapki kwantyzacji i wybór według karty.
Pamięć GPU: wyjaśnić rozbieżność między szacowaniem a szczytem
Rozróżnij wagi, cache i aktywacje, zmierz allocated i reserved na każdym etapie, a następnie wybierz margines za pomocą notebooka i protokołu PyTorch.
Cache KV: oblicz pamięć według kontekstu, GQA i batcha
Oblicz cache KV na podstawie głów KV, kontekstu i równoczesnych sekwencji. Rozróżnij GQA, precyzję i cache statyczny przed rzeczywistą próbą.
Wynik rośnie, ale czy mogę mu zaufać?
Wydzielony zbiór ewaluacyjny, przejrzane błędy i opisana różnica.
Zbuduj zbiór ewaluacyjny ML bez wycieku danych
Oddziel grupy, duplikaty i sposoby użycia danych, aby zbudować odłożony na bok zbiór ewaluacyjny ML: kontrolowalny i dopasowany do twojej decyzji.
Analiza błędów ML w celu wyboru następnego eksperymentu
Analizuj błędy klasyfikacji i ekstrakcji: macierz pomyłek, odniesienia, taksonomia, regresje i kontrola następnej poprawki.
Zmienność między ziarnami: czy różnica w ML jest przekonująca?
Interpretuj powtórzenia w ML za pomocą sparowanych ziaren, rozproszenia i progu użytecznego efektu. Obliczony przykład i ograniczenia małej próby.
Przygotowuję trening. Co sprawdzić przed serią?
Pełna aktualizacja, jawny batch i użyteczne ślady.
Trening GPU: zweryfikuj pętlę przed kampanią
Przygotuj dane, batch i wznowienie treningu. Protokół według faz do kontroli pamięci, gradientów, walidacji i plików wyjściowych.
Microbatch i akumulacja: obliczyć efektywny batch
Oblicz efektywny batch, znormalizuj stratę i zweryfikuj akumulację gradientów na jednej lub wielu kartach, wraz z jej ograniczeniami równoważności.
Śledzenie eksperymentów ML: od uruchomienia do decyzji
Połącz dane, kod, parametry, predykcje i decyzję za pomocą manifestu eksperymentu ML. Przykład kontroli runów i artefaktów bez narzucania narzędzia.
Dostrojenie czy kompresja modelu: jak wybrać wariant?
Punkt odniesienia, kontrolowana zmiana i porównywalna jakość.
Fine-tuning: wybrać adaptację i zweryfikować jej wkład
Przygotuj fine-tuning z odniesieniem, rozdzielonymi danymi i kontrolą ponownego wczytania. LoRA, skwantyzowana baza, budżet i analiza regresji.
Porównywanie kwantyzacji: pamięć, jakość i użyteczny koszt
Porównaj referencję, kalibrację, format wag i cache KV na tych samych danych. Zmierz pamięć i jakość, zanim zdecydujesz o budżecie GPU.
Planowanie ablacji ML: próba kontrolna, efekty i budżet
Zbuduj plan ablacji ML z próbą kontrolną, czynnikami, interakcjami i budżetem prób. Obliczony przykład priorytetyzacji wariantów i wyciągania wniosków.
Budżet jest ograniczony. Które testy przeprowadzić najpierw?
Kolejność eksperymentów i koszt pakietu zestawiony z użytecznymi wynikami.
Budżetowanie kampanii ML: próby, decyzje i cały forfait
Rozłóż kampanię ML na części, ustal priorytety wariantów i powiąż forfait GPU z użytecznymi wynikami, z przykładem harmonogramu i budżetu w USD.
Planowanie ablacji ML: próba kontrolna, efekty i budżet
Zbuduj plan ablacji ML z próbą kontrolną, czynnikami, interakcjami i budżetem prób. Obliczony przykład priorytetyzacji wariantów i wyciągania wniosków.
Benchmark ML: porównaj koszt przy równoważnej jakości
Ustal jakość, zmierz ten sam korpus i porównaj pełny koszt forfaitów GPU na 3, 7 lub 30 dni. Protokół i surowa tabela do pobrania.