Najpierw wybierz, co współdzielą obie karty
W klasycznym paralelizmie danych każdy GPU przechowuje kopię modelu i otrzymuje część batcha. Dla modelu zbyt dużego na jedną kartę potrzebny jest podział parametrów lub warstw. Zsumowane 360 GB nie stanowi więc automatycznie jednej alokacji. Zapisuj swoją hipotezę przed wynajmem: zwiększenie globalnego batcha, skrócenie czasu kroku lub umożliwienie wykonania.
Test podziału, który daje wniosek
Zacznij od tego samego zredukowanego zbioru danych na jednej karcie, jeśli model się mieści, a następnie na dwóch. Zanotuj szczyt pamięci każdego GPU, czas na krok po rozgrzewce i koszt wymiany. Karta prawie pusta i druga przeciążona sugerują niezrównoważony podział. Dwa niezależne eksperymenty mogą być bardziej użyteczne niż rozproszony trening, gdy Twoje pytanie dotyczy kilku hiperparametrów.
Podczas tego porównania utrzymuj stałą precyzję i liczbę przetworzonych przykładów. Poprawa uzyskana przez jednoczesną zmianę formatu liczbowego i rozmiaru batcha byłaby trudna do przypisania sprzętowi.
Przygotuj stos Blackwell i wybierz alternatywę
Sprawdź, czy Twoja wersja PyTorch, dystrybucja CUDA i skompilowane rozszerzenia są prawidłowo ukierunkowane na Blackwell. Własny kernel zgodny z inną generacją nie wystarczy, by ustalić tę zgodność. Przetestuj podstawowe operacje przed pełną kampanią. Jeśli Twój model i jego rezerwa wykonawcza mieszczą się w 141 GB, H200 pozwala zbadać uruchomienie na jednym GPU; MI300X otwiera inną drogę dla projektu przygotowanego pod ROCm.
Zarezerwuj użyteczne okno badawcze
Trzy dni wystarczą na przygotowaną wcześniej walidację podziału. Siedem dni pozwala zorganizować kilka wariantów i ich ocenę. Trzydzieści dni odpowiada kampanii z monitorowaniem, ze zdefiniowanymi checkpointami i kryteriami zatrzymania. Wybierz liczbę partii po dwie karty, czas trwania i żądane środowisko, a następnie podaj swoje dane kontaktowe. Po przelewie krypto użyj „Zapłaciłem” w zamówieniu; dalej postępuj zgodnie z krokami płatności i przygotowania dostępu.