Od pojedynczego zapytania do realistycznego obciążenia
Zacznij od jednego zapytania, a następnie stopniowo zwiększaj liczbę równoczesnych żądań. Odtwarzaj stały zestaw danych wejściowych o różnych długościach i typach treści. Zapisuj medianę oraz miarę wolnych żądań, nie tylko średnią. W przypadku generacji rozróżniaj czas do pierwszego tokena od całkowitego czasu trwania. Te obserwacje odpowiadają różnym zastosowaniom, takim jak interfejs interaktywny czy przetwarzanie dokumentów offline.
Ochrona marginesu w 24 GB
Model załadowany bez błędu może wciąż zostać przeciążony przy wielu żądaniach. Zmierz cache, bufory i zachowanie na długich danych wejściowych. Przetestuj limit współbieżności, który zachowuje margines, i zapisz ten limit wraz z modelem. Jeśli kwantyzujesz wagi, zweryfikuj odpowiedzi na swoim zbiorze ewaluacyjnym, zanim uznasz wariant za równoważny.
W przypadku przetwarzania offline większy batch może być akceptowalny, nawet jeśli zwiększa opóźnienie indywidualne. Przedstaw te dwa cele osobno w swoim notatniku, aby wybrać konfigurację w zależności od rzeczywistej potrzeby.
Wybór silnika zgodnego z Ada
L4 wykorzystuje architekturę Ada. Sprawdź wersje CUDA, PyTorch lub silnika inferencji, a także formaty kwantyzacji i wymagane operatory. Wstępne ładowanie nie waliduje wszystkich form danych wejściowych: uwzględnij w teście najbardziej wymagający przykład. Porównaj RTX 4090 dla innej konfiguracji 24 GB lub L40S, gdy większy kontekst lub współbieżność wymaga 48 GB.
Wynajmij, aby określić zmierzoną pojemność
Trzy dni pozwalają nakreślić pierwszą zależność między współbieżnością a opóźnieniem. Siedem dni daje czas na ocenę kilku ustawień i powtórzenie testu. Trzydzieści dni towarzyszy regularnej kampanii inferencji lub walidacji. Przygotuj żądania, model i kryteria jakości przed zamówieniem. Wybierz swój pakiet, podaj dane kontaktowe i postępuj zgodnie z instrukcjami krypto; „Zapłaciłem” sygnalizuje wykonany przelew.