Von der einzelnen Anfrage zu einer realistischen Last
Beginnen Sie mit einer Anfrage und erhöhen Sie dann schrittweise die Anzahl gleichzeitiger Anfragen. Spielen Sie einen festen Satz von Eingaben mit mehreren Längen und Inhaltstypen durch. Erfassen Sie den Median und ein Maß für langsame Anfragen, nicht nur einen Mittelwert. Unterscheiden Sie bei der Generierung die Zeit bis zum ersten Token von der Gesamtdauer. Diese Beobachtungen entsprechen unterschiedlichen Anwendungsfällen, etwa einer interaktiven Oberfläche oder einer Offline-Dokumentenverarbeitung.
Die Marge in den 24 GB schützen
Ein fehlerfrei geladenes Modell kann unter mehreren Anfragen dennoch an seine Grenzen stoßen. Messen Sie den Cache, die Puffer und das Verhalten bei Ihren langen Eingaben. Testen Sie ein Nebenläufigkeitslimit, das eine Marge behält, und notieren Sie dieses Limit zusammen mit dem Modell. Wenn Sie die Gewichte quantisieren, überprüfen Sie die Antworten anhand Ihres Evaluierungssatzes, bevor Sie die Variante als gleichwertig betrachten.
Für eine Offline-Verarbeitung kann ein größerer Batch akzeptabel sein, auch wenn er die individuelle Latenz erhöht. Führen Sie diese beiden Ziele getrennt in Ihrem Notizbuch auf, um eine Konfiguration nach dem tatsächlichen Bedarf zu wählen.
Eine mit Ada kompatible Engine wählen
Die L4 nutzt die Ada-Architektur. Prüfen Sie die Versionen von CUDA, PyTorch oder der Inferenz-Engine sowie die Quantisierungsformate und die erforderlichen Operatoren. Das anfängliche Laden validiert nicht alle Eingabeformen: Nehmen Sie das anspruchsvollste Beispiel in den Test auf. Vergleichen Sie eine RTX 4090 für eine andere 24-GB-Konfiguration oder die L40S, wenn mehr Kontext oder Nebenläufigkeit 48 GB erfordert.
Mieten, um eine gemessene Kapazität zu definieren
Drei Tage ermöglichen es, eine erste Beziehung zwischen Nebenläufigkeit und Latenz aufzuzeichnen. Sieben Tage geben Zeit, mehrere Einstellungen zu bewerten und den Test zu wiederholen. Dreißig Tage begleiten eine regelmäßige Inferenz- oder Validierungskampagne. Bereiten Sie die Anfragen, das Modell und die Qualitätskriterien vor der Bestellung vor. Wählen Sie Ihr Paket, geben Sie Ihre Kontaktdaten an und folgen Sie den Krypto-Anweisungen; „Ich habe bezahlt“ meldet die ausgeführte Überweisung.