Chronométrer ce que votre application fait vraiment
Un test sur des tenseurs déjà présents sur le GPU décrit le calcul seul. Un service ou un entraînement doit aussi décoder, préparer et transférer ses entrées. Construisez donc deux mesures : la boucle de calcul isolée et une boucle qui part de vos données habituelles. L’écart indique où chercher une amélioration. Attendez la fin effective du travail GPU avant de relever un temps ; les lancements CUDA sont souvent asynchrones.
Utiliser le batch comme variable contrôlée
Pour une inférence hors ligne, comparez plusieurs tailles de lot en conservant la longueur et le type des entrées. Pour une application interactive, mesurez aussi la latence d’une requête et celle des requêtes les plus lentes. Le batch qui maximise le volume traité peut rendre l’attente moins acceptable. Sur 80 Go, réservez de la place pour le cache ou les activations plutôt que d’arrêter le dimensionnement au chargement du modèle.
Consignez la précision des poids et du calcul séparément. Un modèle stocké dans un format réduit peut encore utiliser des buffers ou des opérations de plus haute précision pendant son exécution.
Comparer sans assimiler les variantes H100
La fiche concerne le H100 PCIe 80 Go. Les résultats d’un H100 SXM ou d’un ensemble de plusieurs cartes ne décrivent pas automatiquement cette configuration. Vérifiez CUDA, PyTorch et les bibliothèques spécialisées pour votre architecture, puis choisissez une recette commune aux GPU comparés. Si 80 Go ne suffisent pas, étudiez le H200 ; si le besoin tient dans 48 Go, ajoutez le L40S à votre comparaison économique.
Préparer une commande orientée pipeline
Trois jours peuvent servir à identifier la part du calcul et des transferts. Sept jours permettent de tester les corrections et de répéter les mesures. Trente jours accompagnent une campagne d’inférence ou un entraînement planifié. Sélectionnez durée et quantité, indiquez votre environnement, puis vos coordonnées de suivi. Les instructions crypto de la commande précisent le réseau et le montant ; le bouton « J’ai payé » signale votre transfert.