Wybierz konfigurację dla zdefiniowanego obciążenia
Lista GPU, porada dla Twojego modelu i alternatywa dla Twojej obecnej konfiguracji wymagają tej samej karty startowej: model i wersja, inferencja lub dostrajanie, format wag, wymagana długość, współbieżność lub mikrobatch oraz kryterium jakości. Zachowaj te wymagania, gdy porównujesz oferty. Konfiguracja, która obsługuje mniej kontekstu, lub uproszczone zadanie nie odpowiada automatycznie temu samemu zapotrzebowaniu.
Każde wymaganie obowiązkowe zaklasyfikuj: dopuszczalne, jeśli dostępny dokument potwierdza je w Twoim zakresie; do potwierdzenia, jeśli go brakuje; wykluczyć, jeśli ustalona wada uniemożliwia spełnienie obciążenia. Kandydat zostaje wybrany tylko wtedy, gdy wszystkie te wymagania są spełnione. Następnie rozstrzygnij między dopuszczalnymi kandydatami na podstawie całkowitego kosztu pakietu, użytecznej marży i udokumentowanego harmonogramu. Preferencja nie równoważy kryterium eliminującego.
Powiąż każde kryterium z dokumentem i decyzją
Karta handlowa poświadcza to, co jest oferowane; Twój protokół ustala, co działa na danym obciążeniu. Środowisko wymagane przy zamówieniu pozostaje preferencją przygotowania. Nominalna pojemność pamięci lub deklarowany stan magazynowy nie dowodzą ani instalacji oprogramowania, ani czasu udostępnienia.
Zachowaj dokument wraz z jego wersją i zakresem. Jeśli informacja obowiązkowa nie jest udokumentowana, zapisz dokładnie warunek do potwierdzenia. Tabela pozwala utworzyć wstępną selekcję bez zamieniania tych niewiadomych w gwarancje.
| Kryterium obowiązkowe | Weryfikowalny dokument | Dopuszczalne | Do potwierdzenia | Wykluczyć |
|---|---|---|---|---|
| Pokryte obciążenie | Model, wersja, tokeny, batch/współbieżność i wykonane dane wejściowe | Całe niezbędne obciążenie jest pokryte | Rzeczywiste wymiary nieznane | Niezbędna część jest wycofana |
| Zgodność | Oficjalna dokumentacja oprogramowania i kontrola docelowego środowiska | Zweryfikowana wymagana kombinacja | Środowisko tylko pożądane | Niezbędna zależność niekompatybilna |
| Pamięć na GPU | Rozłożony obliczeń, dostępna pojemność i szczyty faz użytecznych | Pełny cykl pokryty z uzasadnionym zapasem | Znane tylko wagi lub mały test | Nasycenie na wymaganym obciążeniu |
| Jakość | Zamrożony korpus, zidentyfikowane wyniki i progi zdefiniowane przed porównaniem | Progi i tolerancje dotrzymane | Nowy format nieoceniony | Regresja przekraczająca tolerancję |
| Rozmieszczenie i serwer | Rozmieszczenie komponentów; wymagane RAM, pamięć masowa lub połączenia | Zweryfikowane potrzeby | Nieudokumentowane wymagane charakterystyki | Niezbędne rozmieszczenie niemożliwe |
| Budżet i harmonogram | Pakiet, partie, karty, dni, suma USD i pełny plan | Limit i okno dotrzymane | Czasy wciąż hipotetyczne | Budżet lub termin przekroczone |
Źródła techniczne: Karta obciążenia dla wnioskowania · Zmierz fazy i liczniki · Ustal kryteria jakości · Zaplanuj koszt eksperymentu
Wiedz, co oblicza wynik
Liczba parametrów odpowiada wartościom, które reprezentujesz w obliczeniu gęstym. Format wskazuje ich liczbę bitów na wartość. Wynik „Tylko wagi” przelicza tę objętość na GiB, a następnie „Orientacyjna otoczka” dodaje Twój zapas. Wybór trening lub adaptacja w narzędziu nie stosuje ukrytego uniwersalnego mnożnika; zachęca Cię do udokumentowania brakujących pozycji.
Ta prostota pozwala ponownie odczytać założenie. Wymaga też wiedzy, co pozostaje poza obliczeniem: metadane kwantyzacji, moduły innego formatu, pamięć robocza, ładowanie przejściowe i użycia poza procesem. Proponowana karta GPU to kandydat do zbadania, a nie gwarancja, że Twój model na niej zadziała. Nazwa i nominalna pamięć karty nie opisują reszty jej serwera.
Czytaj jednostki przed porównaniem karty
Jeden dziesiętny GB odpowiada miliardowi bajtów; jeden GiB odpowiada 2³⁰ bajtów. Katalog wyświetla nominalną pojemność w GB. Narzędzie stosuje konwencję dziesiętną; aby zweryfikować konfigurację, odczytaj także pojemność w bajtach deklarowaną przez urządzenie. Liczniki Twojego programu mogą być wyświetlane w bajtach lub GiB. Przeliczaj wielkości o tej samej definicji przed porównaniem ich rozmiaru; nie mieszaj pamięci nominalnej, pamięci wolnej i szczytu zarezerwowanego.
Przykład obliczenia: 24 miliardy bajtów to około 22,35 GiB. Ten wynik nie zapowiada wolnej ilości na karcie 24 GB. System, kontekst wykonania i inne alokacje mogą się liczyć. Zachowaj jednostkę i zakres w nazwie każdej kolumny Twojego arkusza testowego.
Źródła techniczne: NIST — przedrostki binarne i dziesiętne
Przykład prześledzony krok po kroku: siedem miliardów parametrów
Dla 7 miliardów parametrów w 16 bitach gęsty wolumen wynosi 14 miliardów bajtów, czyli około 13,04 GiB. Przy wybranej rezerwie 6 GiB koperta wynosi 19,04 GiB. Obliczenie nie dowodzi, że rezerwa 6 GiB jest odpowiednia dla Twojego modelu: to właśnie założenie, które należy zweryfikować na podstawie przyjętych danych wejściowych i operacji.
Tabela zachowuje tę samą rezerwę, aby pokazać wyłącznie arytmetyczny efekt formatu wag. W rzeczywistym uruchomieniu pozostałe alokacje mogą zmieniać się inaczej. Reprezentacja czterobitowa często obejmuje dodatkowe informacje i może pozostawić niektóre warstwy w innym formacie. Nie czytaj więc ostatniego wiersza jako gwarantowanego szczytowego zużycia całkowitego.
| Format wag | Gęsty wolumen w bajtach | Wagi w GiB, zaokrąglone | Wagi + rezerwa w GiB |
|---|---|---|---|
| 32 bity | 28 000 000 000 | 26,08 | 32,08 |
| 16 bitów | 14 000 000 000 | 13,04 | 19,04 |
| 8 bitów | 7 000 000 000 | 6,52 | 12,52 |
| 4 bity teoretyczne | 3 500 000 000 | 3,26 | 9,26 |
Źródła techniczne: Transformers 5.17 — formaty i ograniczenia bitsandbytes
Zbuduj rezerwę, którą potrafisz uzasadnić
Rozłóż rezerwę na części, zamiast wybierać procent z przyzwyczajenia. W autoregresyjnej inferencji odnotuj architekturę, cache, przechowywane tokeny i równoczesne sekwencje. W treningu zapisz uczone parametry, gradienty, optymalizator, aktywacje i bufory. Długość danych wejściowych i mikrobatch są częścią karty, nawet gdy liczba parametrów się nie zmienia.
Niektóre pozycje nie osiągają maksimum w tym samym momencie. Suma niezależnych maksymalnych marginesów może służyć jako konserwatywna koperta, jeśli zostanie tak zadeklarowana, ale nie jest zaobserwowanym szczytem. Zapisz pozycje oszacowane, zmierzone i te wciąż nieznane. Przewodnik po cache KV szczegółowo omawia jedno z takich obliczeń; dossier pamięci umieszcza liczniki w fazach programu.
| Pozycja do udokumentowania | Wymagane dane wejściowe | Oczekiwany dowód |
|---|---|---|
| Cache generacji | Głowy KV, warstwy, tokeny, sekwencje, format | Obliczenie dopasowane do architektury, a następnie pomiar |
| Aktywacje | Mikrobatch, długość, architektura, checkpointing | Szczyt na przyjętych danych wejściowych |
| Gradienty i optymalizator | Trenowane parametry, formaty, metoda | Pierwsza pełna aktualizacja |
| Wczytywanie, walidacja i eksport | Procedura i rozmiary wyjściowe | Kontrola każdej niezbędnej fazy |
Waliduj etapami, nie zmieniając po cichu zadania
Zacznij od krótkiego wejścia i małego batcha, aby wykryć błędy przygotowania. Przejdź następnie do typowego wejścia, a potem do swojego rzeczywiście niezbędnego limitu. Jeśli program obcina dane, zachowuje mniej tokenów lub pomija część korpusu, przypadek, który się mieści, nie potwierdza zadeklarowanego obciążenia. Zapisz wymiary faktycznie wykonane.
Odnotuj szczyt według fazy i według GPU wraz z jego licznikiem. Pamięć przydzielona tensorom i pamięć zarezerwowana przez alokator PyTorch nie sumują się. Odczyt systemowy może obejmować więcej niż instrumentowany proces. Jeśli rozważasz wiele kart, udokumentuj ich podział programowy; dwie karty nie tworzą automatycznie jednej wspólnej przestrzeni pamięci.
Źródła techniczne: PyTorch — zarządzanie pamięcią CUDA
Decyduj po pierwszym przekroczeniu
Niepowodzenie przy wczytywaniu kieruje ku wagom, formatowi lub alokacji przejściowej. Niepowodzenie przy generacji wymaga zbadania kontekstu i współbieżności. Niepowodzenie przy przejściu wstecz może kierować ku mikrobatchowi, aktywacjom lub strategii obliczeń. Ta lokalizacja pozwala uniknąć zmieniania na oślep precyzji, modelu i danych jednocześnie.
Po każdej poprawce sprawdź jakość i objęty zakres. Skrócenie niezbędnej długości może być nie do przyjęcia; zmiana kwantyzacji może zmienić wyniki. Jeśli potrzebna jest inna pojemność, wróć do katalogu z kartą, która podaje zaobserwowany szczyt, uzasadniony margines, wersje i graniczne dane wejściowe. Margines bez powodu nie jest bardziej wiarygodny niż wynik zaokrąglony do najbliższego GB.
Krótki wybór, przy tych samych wymaganiach
Dla ilustracyjnej inferencji z 7 miliardami parametrów w 16 bitach i rezerwą 6 GiB przykład prześledzony krok po kroku daje 19,04 GiB. Możesz rozważyć RTX 4090 z 24 GB lub RTX 6000 Ada z 48 GB. Ich zadeklarowane oferty dla partii jednej karty na 3 dni wynoszą odpowiednio 47,14 USD i 55,71 USD. To dwaj kandydaci o różnych pojemnościach: kontekst, współbieżność, rzeczywiście dostępna pamięć, zgodność i jakość wciąż wymagają weryfikacji. Te ceny nie ustalają żadnego rankingu szybkości.
W przypadku adaptacji użyj tej samej siatki z wyuczonymi parametrami i dodatkowymi fazami: przejście wstecz, pierwsza aktualizacja, walidacja i eksport. Liczba parametrów LoRA nie wystarcza do zatwierdzenia całkowitej pamięci. Ścieżka fine-tuningu pomaga zakwalifikować wynik; batch i akumulacja służą do udokumentowania porównywalnej aktualizacji.
Jeśli szukasz alternatywy po przekroczeniu limitu, zlokalizuj wadliwą fazę i zachowaj swoje wymagania dotyczące wyniku. Porównuj tylko jedną zmianę naraz: pojemność, cache, mikrobatch lub precyzję. Inny format musi odzyskać ustaloną minimalną jakość. Jeśli twoja potrzeba wymaga zarządzanej aplikacji, określonej pamięci RAM lub poświadczonej interkonekcji, sama karta GPU pozostawia decyzję do potwierdzenia. Dwie karty wymagają zweryfikowanego rozmieszczenia oprogramowania; ich pamięci nie tworzą automatycznie jednej wspólnej przestrzeni.
Źródła techniczne: RTX 4090 — partia, pojemność i plany · RTX 6000 Ada — partia, pojemność i plany · Jakość po kwantyzacji · Przygotowanie adaptacji · Określenie batcha i akumulacji
Zachowaj obliczenia wraz z tym, co je potwierdza
Zapisz wstępną hipotezę, tabelę pozycji, procedurę i surowe odczyty. Rozróżniaj szacowanie, zmierzony licznik i decyzję handlową. Notebook IteraGPU Lab pomaga zrozumieć tę instrumentację na małej sieci; nie zastępuje testu twojego modelu. Przykłady liczbowe na tej stronie to obliczenia, bez rzekomo zaobserwowanej przepustowości czy zużycia GPU.
Dobry wynik wymiarowania mieści się w jednej karcie: model i wersja, zadanie, precyzja, długość, mikrobatch lub współbieżność, pamięć na GPU i warunki pomiaru. Dodaj to, co unieważniłoby wniosek, na przykład dłuższe okno lub inną ocenę. Będziesz wtedy mógł wybrać plan odpowiadający kampanii, zamiast powtarzać całe szacowanie przy każdym wariancie.
Praktyczne pytania
Czy rezerwa proponowana przez narzędzie jest obliczana na podstawie mojego modelu?
Nie. Rezerwa to wartość wybrana przez ciebie. Narzędzie nie zna ani architektury, ani danych wejściowych twojego uruchomienia; użyj jej, aby ujawnić swoją hipotezę, a następnie skonfrontuj ją ze zmierzonymi fazami.
Dlaczego koperta mniejsza niż 24 GB może nadal zawieść?
Szacowanie może pominąć niektóre pozycje i używać GiB, podczas gdy pojemność nominalna jest wyrażona w GB. Liczyć się może także przejściowy szczyt, inny proces lub inne dane wejściowe. Porównaj jednostki i zakresy, a następnie zlokalizuj fazę, która zawodzi.
Czy mogę zsumować rezerwy i dwa szczyty PyTorch?
Nie. Szczyt przydzielonych tensorów i szczyt zarezerwowanej pamięci to nie dwie niezależne pozycje do zsumowania. Oddzielne szczyty mogą wystąpić w różnych momentach. Zachowaj ich nazwy i użyj metody pamięciowej do ich interpretacji.
Czy mogę poprosić o listę lub alternatywę, nie zmierzywszy wcześniej swojego modelu?
Tak, aby ustalić warunkowych kandydatów. Opisz obciążenie i ograniczenia, które muszą pozostać identyczne. Obliczenie pamięci i karty handlowe pozwalają na wstępny wybór; niezweryfikowane obowiązkowe kryteria pozostają do potwierdzenia przed wyborem oferty.