Rozdzielić rozdzielczość i rozmiar batcha
Model wizyjny, który działa na małych obrazach, nie pozwala bezpośrednio przewidzieć zapotrzebowania pamięci dla Twoich roboczych obrazów. Najpierw zbuduj serię ze stałym batchem i rosnącymi rozdzielczościami, a następnie serię ze stałą rozdzielczością i rosnącymi batchami. Pozwala to przypisać różnice do konkretnych czynników. Zachowaj te same zasady skalowania i kadrowania: zmiana przetwarzania wstępnego może wpłynąć na wynik tak samo jak wybór modelu.
Zmierzyć pełny trening lub adaptację
48 GB daje więcej miejsca niż karta 24 GB na aktywacje i komponenty pomocnicze. Nie definiuje jednak uniwersalnego rozmiaru modelu, który się zmieści. Zmierz propagację wsteczną, jeśli trenujesz, cały pipeline, jeśli generujesz embeddingi, oraz największe próbki, jeśli kształty są zmienne. Zapisz szczyt i parametry, które go wywołały.
W przypadku adaptacji porównaj jakość na zbiorze odseparowanym od konfiguracji. Zwiększenie batcha, aby zająć całą pamięć, samo w sobie nie stanowi postępu naukowego.
Ada i Ampere: porównanie przy stałych receptach
RTX 6000 Ada i RTX A6000 mają w tym katalogu po 48 GB, ale należą do różnych architektur. Utrzymuj więc swoje wersje CUDA, PyTorch i bibliotek w miarę możliwości porównywalne. Sprawdź skompilowane rozszerzenia dla Ada i przetestuj najbardziej wyspecjalizowaną operację swojego modelu. L40S to kolejne porównanie z 48 GB; RTX 4090 może wystarczyć, jeśli Twoje szczyty mieszczą się w jej budżecie 24 GB.
Przygotować dane przed wyborem pakietu
Trzy dni wystarczą na mapowanie rozdzielczość/batch. Siedem dni pozwala zaadaptować i ocenić kilka wariantów. Trzydzieści dni towarzyszy kampanii wizyjnej z powtórzeniami i uporządkowanymi eksportami. Przygotuj manifest obrazów, ich podziały i skrypt ewaluacji, zanim wybierzesz czas trwania. Zamówienie łączy konfigurację, żądane środowisko i Twoje dane kontaktowe; płatność krypto śledzisz następnie w tym samym zgłoszeniu.