GPU do badań ML · Płatność crypto bez KYC
IteraGPU
Narzędzie / Wymiarowanie

Ile pamięci potrzebuje Twoja hipoteza?

Aby wybrać GPU, zacznij od modelu i obciążenia do przetworzenia, a następnie sprawdź razem zgodność, pełną pamięć i oczekiwaną jakość. Kreator wymiarowania sumuje teoretyczne wagi i wybraną rezerwę; dostarcza kandydatów do rozważenia. Nie oblicza automatycznie cache'u, aktywacji ani stanów optymalizatora. Nieznane obowiązkowe kryterium pozostaje do potwierdzenia przed wybraniem konfiguracji.

01 / KalkulatorSzacunek

Podaj swoje założenia.

Pamięć podręczna, aktywacje, bufory: założenie do zmierzenia.

Wartość orientacyjna

19 GiB

Same wagi

13 GiB
Examiner NVIDIA RTX A5000 24GB

Wagi = parametry × bity ÷ 8 ÷ 2³⁰. Metadane kwantyzacji nie są uwzględnione. Przepustowość nie jest przewidywana.

Wybrany zapas, a potem zweryfikowany.

Wynik sumuje teoretyczne wagi i Twój zapas. Batch, cache, aktywacje i optymalizator nie są odejmowane automatycznie.

Zacznij od jawnego założenia, a następnie użyj poniższych scenariuszy, aby przygotować pomiar na własnym obciążeniu.

Od szacowania do pomiaru
01 /

Wybierz konfigurację dla zdefiniowanego obciążenia

Lista GPU, porada dla Twojego modelu i alternatywa dla Twojej obecnej konfiguracji wymagają tej samej karty startowej: model i wersja, inferencja lub dostrajanie, format wag, wymagana długość, współbieżność lub mikrobatch oraz kryterium jakości. Zachowaj te wymagania, gdy porównujesz oferty. Konfiguracja, która obsługuje mniej kontekstu, lub uproszczone zadanie nie odpowiada automatycznie temu samemu zapotrzebowaniu.

Każde wymaganie obowiązkowe zaklasyfikuj: dopuszczalne, jeśli dostępny dokument potwierdza je w Twoim zakresie; do potwierdzenia, jeśli go brakuje; wykluczyć, jeśli ustalona wada uniemożliwia spełnienie obciążenia. Kandydat zostaje wybrany tylko wtedy, gdy wszystkie te wymagania są spełnione. Następnie rozstrzygnij między dopuszczalnymi kandydatami na podstawie całkowitego kosztu pakietu, użytecznej marży i udokumentowanego harmonogramu. Preferencja nie równoważy kryterium eliminującego.

02 /

Powiąż każde kryterium z dokumentem i decyzją

Karta handlowa poświadcza to, co jest oferowane; Twój protokół ustala, co działa na danym obciążeniu. Środowisko wymagane przy zamówieniu pozostaje preferencją przygotowania. Nominalna pojemność pamięci lub deklarowany stan magazynowy nie dowodzą ani instalacji oprogramowania, ani czasu udostępnienia.

Zachowaj dokument wraz z jego wersją i zakresem. Jeśli informacja obowiązkowa nie jest udokumentowana, zapisz dokładnie warunek do potwierdzenia. Tabela pozwala utworzyć wstępną selekcję bez zamieniania tych niewiadomych w gwarancje.

Siatka selekcji — decyzja właściwa dla Twojego obciążenia, do wypełnienia Twoimi dokumentami
Kryterium obowiązkoweWeryfikowalny dokumentDopuszczalneDo potwierdzeniaWykluczyć
Pokryte obciążenieModel, wersja, tokeny, batch/współbieżność i wykonane dane wejścioweCałe niezbędne obciążenie jest pokryteRzeczywiste wymiary nieznaneNiezbędna część jest wycofana
ZgodnośćOficjalna dokumentacja oprogramowania i kontrola docelowego środowiskaZweryfikowana wymagana kombinacjaŚrodowisko tylko pożądaneNiezbędna zależność niekompatybilna
Pamięć na GPURozłożony obliczeń, dostępna pojemność i szczyty faz użytecznychPełny cykl pokryty z uzasadnionym zapasemZnane tylko wagi lub mały testNasycenie na wymaganym obciążeniu
JakośćZamrożony korpus, zidentyfikowane wyniki i progi zdefiniowane przed porównaniemProgi i tolerancje dotrzymaneNowy format nieocenionyRegresja przekraczająca tolerancję
Rozmieszczenie i serwerRozmieszczenie komponentów; wymagane RAM, pamięć masowa lub połączeniaZweryfikowane potrzebyNieudokumentowane wymagane charakterystykiNiezbędne rozmieszczenie niemożliwe
Budżet i harmonogramPakiet, partie, karty, dni, suma USD i pełny planLimit i okno dotrzymaneCzasy wciąż hipotetyczneBudżet lub termin przekroczone

Źródła techniczne: Karta obciążenia dla wnioskowania · Zmierz fazy i liczniki · Ustal kryteria jakości · Zaplanuj koszt eksperymentu

03 /

Wiedz, co oblicza wynik

Liczba parametrów odpowiada wartościom, które reprezentujesz w obliczeniu gęstym. Format wskazuje ich liczbę bitów na wartość. Wynik „Tylko wagi” przelicza tę objętość na GiB, a następnie „Orientacyjna otoczka” dodaje Twój zapas. Wybór trening lub adaptacja w narzędziu nie stosuje ukrytego uniwersalnego mnożnika; zachęca Cię do udokumentowania brakujących pozycji.

Ta prostota pozwala ponownie odczytać założenie. Wymaga też wiedzy, co pozostaje poza obliczeniem: metadane kwantyzacji, moduły innego formatu, pamięć robocza, ładowanie przejściowe i użycia poza procesem. Proponowana karta GPU to kandydat do zbadania, a nie gwarancja, że Twój model na niej zadziała. Nazwa i nominalna pamięć karty nie opisują reszty jej serwera.

Wagi w GiB = parametry × bity na wartość ÷ 8 ÷ 1 073 741 824
04 /

Czytaj jednostki przed porównaniem karty

Jeden dziesiętny GB odpowiada miliardowi bajtów; jeden GiB odpowiada 2³⁰ bajtów. Katalog wyświetla nominalną pojemność w GB. Narzędzie stosuje konwencję dziesiętną; aby zweryfikować konfigurację, odczytaj także pojemność w bajtach deklarowaną przez urządzenie. Liczniki Twojego programu mogą być wyświetlane w bajtach lub GiB. Przeliczaj wielkości o tej samej definicji przed porównaniem ich rozmiaru; nie mieszaj pamięci nominalnej, pamięci wolnej i szczytu zarezerwowanego.

Przykład obliczenia: 24 miliardy bajtów to około 22,35 GiB. Ten wynik nie zapowiada wolnej ilości na karcie 24 GB. System, kontekst wykonania i inne alokacje mogą się liczyć. Zachowaj jednostkę i zakres w nazwie każdej kolumny Twojego arkusza testowego.

Źródła techniczne: NIST — przedrostki binarne i dziesiętne

05 /

Przykład prześledzony krok po kroku: siedem miliardów parametrów

Dla 7 miliardów parametrów w 16 bitach gęsty wolumen wynosi 14 miliardów bajtów, czyli około 13,04 GiB. Przy wybranej rezerwie 6 GiB koperta wynosi 19,04 GiB. Obliczenie nie dowodzi, że rezerwa 6 GiB jest odpowiednia dla Twojego modelu: to właśnie założenie, które należy zweryfikować na podstawie przyjętych danych wejściowych i operacji.

Tabela zachowuje tę samą rezerwę, aby pokazać wyłącznie arytmetyczny efekt formatu wag. W rzeczywistym uruchomieniu pozostałe alokacje mogą zmieniać się inaczej. Reprezentacja czterobitowa często obejmuje dodatkowe informacje i może pozostawić niektóre warstwy w innym formacie. Nie czytaj więc ostatniego wiersza jako gwarantowanego szczytowego zużycia całkowitego.

Przykład teoretyczny — 7 miliardów gęstych parametrów, arbitralna rezerwa 6 GiB
Format wagGęsty wolumen w bajtachWagi w GiB, zaokrągloneWagi + rezerwa w GiB
32 bity28 000 000 00026,0832,08
16 bitów14 000 000 00013,0419,04
8 bitów7 000 000 0006,5212,52
4 bity teoretyczne3 500 000 0003,269,26

Źródła techniczne: Transformers 5.17 — formaty i ograniczenia bitsandbytes

06 /

Zbuduj rezerwę, którą potrafisz uzasadnić

Rozłóż rezerwę na części, zamiast wybierać procent z przyzwyczajenia. W autoregresyjnej inferencji odnotuj architekturę, cache, przechowywane tokeny i równoczesne sekwencje. W treningu zapisz uczone parametry, gradienty, optymalizator, aktywacje i bufory. Długość danych wejściowych i mikrobatch są częścią karty, nawet gdy liczba parametrów się nie zmienia.

Niektóre pozycje nie osiągają maksimum w tym samym momencie. Suma niezależnych maksymalnych marginesów może służyć jako konserwatywna koperta, jeśli zostanie tak zadeklarowana, ale nie jest zaobserwowanym szczytem. Zapisz pozycje oszacowane, zmierzone i te wciąż nieznane. Przewodnik po cache KV szczegółowo omawia jedno z takich obliczeń; dossier pamięci umieszcza liczniki w fazach programu.

Karta rezerwy do wypełnienia dla Twojego obciążenia
Pozycja do udokumentowaniaWymagane dane wejścioweOczekiwany dowód
Cache generacjiGłowy KV, warstwy, tokeny, sekwencje, formatObliczenie dopasowane do architektury, a następnie pomiar
AktywacjeMikrobatch, długość, architektura, checkpointingSzczyt na przyjętych danych wejściowych
Gradienty i optymalizatorTrenowane parametry, formaty, metodaPierwsza pełna aktualizacja
Wczytywanie, walidacja i eksportProcedura i rozmiary wyjścioweKontrola każdej niezbędnej fazy
07 /

Waliduj etapami, nie zmieniając po cichu zadania

Zacznij od krótkiego wejścia i małego batcha, aby wykryć błędy przygotowania. Przejdź następnie do typowego wejścia, a potem do swojego rzeczywiście niezbędnego limitu. Jeśli program obcina dane, zachowuje mniej tokenów lub pomija część korpusu, przypadek, który się mieści, nie potwierdza zadeklarowanego obciążenia. Zapisz wymiary faktycznie wykonane.

Odnotuj szczyt według fazy i według GPU wraz z jego licznikiem. Pamięć przydzielona tensorom i pamięć zarezerwowana przez alokator PyTorch nie sumują się. Odczyt systemowy może obejmować więcej niż instrumentowany proces. Jeśli rozważasz wiele kart, udokumentuj ich podział programowy; dwie karty nie tworzą automatycznie jednej wspólnej przestrzeni pamięci.

Źródła techniczne: PyTorch — zarządzanie pamięcią CUDA

08 /

Decyduj po pierwszym przekroczeniu

Niepowodzenie przy wczytywaniu kieruje ku wagom, formatowi lub alokacji przejściowej. Niepowodzenie przy generacji wymaga zbadania kontekstu i współbieżności. Niepowodzenie przy przejściu wstecz może kierować ku mikrobatchowi, aktywacjom lub strategii obliczeń. Ta lokalizacja pozwala uniknąć zmieniania na oślep precyzji, modelu i danych jednocześnie.

Po każdej poprawce sprawdź jakość i objęty zakres. Skrócenie niezbędnej długości może być nie do przyjęcia; zmiana kwantyzacji może zmienić wyniki. Jeśli potrzebna jest inna pojemność, wróć do katalogu z kartą, która podaje zaobserwowany szczyt, uzasadniony margines, wersje i graniczne dane wejściowe. Margines bez powodu nie jest bardziej wiarygodny niż wynik zaokrąglony do najbliższego GB.

09 /

Krótki wybór, przy tych samych wymaganiach

Dla ilustracyjnej inferencji z 7 miliardami parametrów w 16 bitach i rezerwą 6 GiB przykład prześledzony krok po kroku daje 19,04 GiB. Możesz rozważyć RTX 4090 z 24 GB lub RTX 6000 Ada z 48 GB. Ich zadeklarowane oferty dla partii jednej karty na 3 dni wynoszą odpowiednio 47,14 USD i 55,71 USD. To dwaj kandydaci o różnych pojemnościach: kontekst, współbieżność, rzeczywiście dostępna pamięć, zgodność i jakość wciąż wymagają weryfikacji. Te ceny nie ustalają żadnego rankingu szybkości.

W przypadku adaptacji użyj tej samej siatki z wyuczonymi parametrami i dodatkowymi fazami: przejście wstecz, pierwsza aktualizacja, walidacja i eksport. Liczba parametrów LoRA nie wystarcza do zatwierdzenia całkowitej pamięci. Ścieżka fine-tuningu pomaga zakwalifikować wynik; batch i akumulacja służą do udokumentowania porównywalnej aktualizacji.

Jeśli szukasz alternatywy po przekroczeniu limitu, zlokalizuj wadliwą fazę i zachowaj swoje wymagania dotyczące wyniku. Porównuj tylko jedną zmianę naraz: pojemność, cache, mikrobatch lub precyzję. Inny format musi odzyskać ustaloną minimalną jakość. Jeśli twoja potrzeba wymaga zarządzanej aplikacji, określonej pamięci RAM lub poświadczonej interkonekcji, sama karta GPU pozostawia decyzję do potwierdzenia. Dwie karty wymagają zweryfikowanego rozmieszczenia oprogramowania; ich pamięci nie tworzą automatycznie jednej wspólnej przestrzeni.

Źródła techniczne: RTX 4090 — partia, pojemność i plany · RTX 6000 Ada — partia, pojemność i plany · Jakość po kwantyzacji · Przygotowanie adaptacji · Określenie batcha i akumulacji

10 /

Zachowaj obliczenia wraz z tym, co je potwierdza

Zapisz wstępną hipotezę, tabelę pozycji, procedurę i surowe odczyty. Rozróżniaj szacowanie, zmierzony licznik i decyzję handlową. Notebook IteraGPU Lab pomaga zrozumieć tę instrumentację na małej sieci; nie zastępuje testu twojego modelu. Przykłady liczbowe na tej stronie to obliczenia, bez rzekomo zaobserwowanej przepustowości czy zużycia GPU.

Dobry wynik wymiarowania mieści się w jednej karcie: model i wersja, zadanie, precyzja, długość, mikrobatch lub współbieżność, pamięć na GPU i warunki pomiaru. Dodaj to, co unieważniłoby wniosek, na przykład dłuższe okno lub inną ocenę. Będziesz wtedy mógł wybrać plan odpowiadający kampanii, zamiast powtarzać całe szacowanie przy każdym wariancie.

Praktyczne pytania

Czy rezerwa proponowana przez narzędzie jest obliczana na podstawie mojego modelu?

Nie. Rezerwa to wartość wybrana przez ciebie. Narzędzie nie zna ani architektury, ani danych wejściowych twojego uruchomienia; użyj jej, aby ujawnić swoją hipotezę, a następnie skonfrontuj ją ze zmierzonymi fazami.

Dlaczego koperta mniejsza niż 24 GB może nadal zawieść?

Szacowanie może pominąć niektóre pozycje i używać GiB, podczas gdy pojemność nominalna jest wyrażona w GB. Liczyć się może także przejściowy szczyt, inny proces lub inne dane wejściowe. Porównaj jednostki i zakresy, a następnie zlokalizuj fazę, która zawodzi.

Czy mogę zsumować rezerwy i dwa szczyty PyTorch?

Nie. Szczyt przydzielonych tensorów i szczyt zarezerwowanej pamięci to nie dwie niezależne pozycje do zsumowania. Oddzielne szczyty mogą wystąpić w różnych momentach. Zachowaj ich nazwy i użyj metody pamięciowej do ich interpretacji.

Czy mogę poprosić o listę lub alternatywę, nie zmierzywszy wcześniej swojego modelu?

Tak, aby ustalić warunkowych kandydatów. Opisz obciążenie i ograniczenia, które muszą pozostać identyczne. Obliczenie pamięci i karty handlowe pozwalają na wstępny wybór; niezweryfikowane obowiązkowe kryteria pozostają do potwierdzenia przed wyborem oferty.