Passer de la requête isolée à une charge réaliste
Commencez par une requête, puis augmentez progressivement le nombre de demandes simultanées. Rejouez un jeu d’entrées fixe, avec plusieurs longueurs et types de contenu. Enregistrez la médiane et une mesure des requêtes lentes, pas seulement une moyenne. Pour la génération, distinguez le temps avant le premier token de la durée complète. Ces observations répondent à des usages différents, comme une interface interactive ou un traitement de documents hors ligne.
Protéger la marge dans les 24 Go
Un modèle chargé sans erreur peut encore saturer sous plusieurs requêtes. Mesurez le cache, les buffers et le comportement sur vos entrées longues. Testez une limite de concurrence qui conserve une marge et notez cette limite avec le modèle. Si vous quantifiez les poids, vérifiez les réponses sur votre ensemble d’évaluation avant de considérer la variante comme équivalente.
Pour un traitement hors ligne, un batch plus grand peut être acceptable même s’il augmente la latence individuelle. Présentez ces deux objectifs séparément dans votre carnet afin de choisir une configuration en fonction du besoin réel.
Choisir un moteur compatible avec Ada
La L4 utilise l’architecture Ada. Vérifiez les versions CUDA, PyTorch ou du moteur d’inférence, ainsi que les formats de quantification et les opérateurs requis. Le chargement initial ne valide pas toutes les formes d’entrée : incluez l’exemple le plus exigeant dans le test. Comparez une RTX 4090 pour une autre configuration de 24 Go, ou le L40S lorsque davantage de contexte ou de concurrence demande 48 Go.
Louer pour définir une capacité mesurée
Trois jours permettent de tracer une première relation entre concurrence et latence. Sept jours donnent le temps d’évaluer plusieurs réglages et de répéter le test. Trente jours accompagnent une campagne régulière d’inférence ou de validation. Préparez les requêtes, le modèle et les critères de qualité avant la commande. Choisissez votre forfait, renseignez vos coordonnées et suivez les instructions crypto ; « J’ai payé » signale le transfert effectué.