Retenir une configuration pour une charge définie
Une liste de GPU, un conseil pour votre modèle et une alternative à votre configuration actuelle demandent la même fiche de départ : modèle et révision, inférence ou adaptation, format des poids, longueur nécessaire, concurrence ou microbatch, et critère de qualité. Conservez ces exigences quand vous comparez les offres. Une configuration qui traite moins de contexte ou une tâche simplifiée ne répond pas automatiquement au même besoin.
Classez chaque exigence obligatoire : admissible si la pièce disponible la confirme dans votre périmètre ; à confirmer si elle manque ; exclure si un échec établi empêche de respecter la charge. Un candidat n’est retenu que lorsque toutes ces exigences sont satisfaites. Départagez ensuite les candidats admissibles par le coût total du forfait, la marge utile et le calendrier documenté. Une préférence ne compense pas un critère éliminatoire.
Relier chaque critère à une pièce et une décision
La fiche commerciale atteste ce qui est proposé ; votre protocole établit ce qui fonctionne sur la charge. L’environnement demandé lors de la commande reste une préférence de préparation. Une capacité mémoire nominale ou un stock déclaré ne prouve ni une installation logicielle ni une durée de mise à disposition.
Gardez la pièce avec sa version et son périmètre. Si une information obligatoire n’est pas documentée, inscrivez précisément la condition à confirmer. Le tableau permet de constituer une présélection sans transformer ces inconnues en garanties.
| Critère obligatoire | Pièce vérifiable | Admissible | À confirmer | Exclure |
|---|---|---|---|---|
| Charge couverte | Modèle, révision, tokens, batch/concurrence et entrées exécutées | Toute la charge nécessaire est couverte | Dimensions réelles inconnues | Une partie indispensable est supprimée |
| Compatibilité | Documentation officielle du logiciel et contrôle de l’environnement visé | Combinaison requise vérifiée | Environnement seulement souhaité | Dépendance indispensable incompatible |
| Mémoire par GPU | Calcul décomposé, capacité disponible et pics des phases utiles | Cycle complet couvert avec marge justifiée | Poids seuls ou petit essai connus | Saturation sur la charge requise |
| Qualité | Corpus figé, sorties identifiées et seuils définis avant comparaison | Seuils et tolérances respectés | Nouveau format non évalué | Régression au-delà de la tolérance |
| Répartition et serveur | Placement des composants ; RAM, stockage ou interconnexion nécessaires | Besoins vérifiés | Caractéristiques requises non documentées | Répartition indispensable impossible |
| Budget et calendrier | Forfait, lots, cartes, jours, total USD et planning complet | Plafond et fenêtre respectés | Durées encore hypothétiques | Budget ou échéance dépassés |
Sources techniques : Fiche de charge pour l’inférence · Mesurer les phases et les compteurs · Fixer les critères de qualité · Planifier le coût de l’expérience
Savoir ce que le résultat calcule
Le nombre de paramètres correspond aux valeurs que vous représentez dans le calcul dense. Le format indique leur nombre de bits par valeur. Le résultat « Poids seuls » convertit ce volume en Gio, puis « Enveloppe indicative » ajoute votre réserve. Le choix entraînement ou adaptation dans l’outil n’applique pas un multiplicateur universel caché ; il vous invite à documenter les postes qui manquent.
Cette simplicité permet de relire l’hypothèse. Elle exige aussi de savoir ce qui reste hors du calcul : métadonnées de quantification, modules d’un autre format, mémoire de travail, chargement transitoire et usages extérieurs au processus. La fiche GPU proposée est un candidat à examiner, pas une garantie que votre modèle y fonctionnera. Le nom et la mémoire nominale d’une carte ne décrivent pas le reste de son serveur.
Lire les unités avant de comparer une carte
Un Go décimal correspond à un milliard d’octets ; un Gio correspond à 2³⁰ octets. Le catalogue affiche une capacité nominale en Go. L’outil applique la convention décimale ; pour valider une configuration, relevez aussi la capacité en octets déclarée par l’appareil. Les compteurs de votre programme peuvent être affichés en octets ou Gio. Convertissez des quantités qui ont la même définition avant de comparer leur taille ; ne mélangez pas mémoire nominale, mémoire libre et pic réservé.
Exemple de calcul : 24 milliards d’octets représentent environ 22,35 Gio. Ce résultat n’annonce pas la quantité libre d’une carte de 24 Go. Le système, le contexte d’exécution et d’autres allocations peuvent compter. Gardez l’unité et le périmètre dans le nom de chaque colonne de votre feuille d’essai.
Sources techniques : NIST — préfixes binaires et décimaux
Exemple travaillé : sept milliards de paramètres
Pour 7 milliards de paramètres à 16 bits, le volume dense est 14 milliards d’octets, soit environ 13,04 Gio. Avec une réserve choisie de 6 Gio, l’enveloppe devient 19,04 Gio. Le calcul ne démontre pas qu’une réserve de 6 Gio convient à votre modèle : c’est précisément l’hypothèse à contrôler avec les entrées et les opérations retenues.
Le tableau conserve la même réserve pour montrer uniquement l’effet arithmétique du format des poids. Dans une exécution réelle, les autres allocations peuvent évoluer différemment. Une représentation quatre bits inclut souvent des informations supplémentaires et peut laisser certaines couches dans un autre format. Ne lisez donc pas la dernière ligne comme un pic total garanti.
| Format des poids | Volume dense en octets | Poids en Gio, arrondis | Poids + réserve en Gio |
|---|---|---|---|
| 32 bits | 28 000 000 000 | 26,08 | 32,08 |
| 16 bits | 14 000 000 000 | 13,04 | 19,04 |
| 8 bits | 7 000 000 000 | 6,52 | 12,52 |
| 4 bits théoriques | 3 500 000 000 | 3,26 | 9,26 |
Sources techniques : Transformers 5.17 — formats et limites de bitsandbytes
Construire une réserve explicable
Décomposez la réserve au lieu de choisir un pourcentage par habitude. En inférence autorégressive, relevez architecture, cache, tokens conservés et séquences simultanées. En entraînement, notez paramètres appris, gradients, optimiseur, activations et buffers. La longueur d’entrée et le microbatch font partie de la fiche, même lorsque le nombre de paramètres ne change pas.
Certains postes n’atteignent pas leur maximum au même moment. Une addition de marges maximales indépendantes peut servir d’enveloppe conservatrice si elle est déclarée comme telle, mais elle n’est pas un pic observé. Inscrivez les postes estimés, ceux mesurés et ceux encore inconnus. Le guide cache KV détaille un de ces calculs ; le dossier mémoire replace les compteurs dans les phases du programme.
| Poste à documenter | Entrées nécessaires | Preuve attendue |
|---|---|---|
| Cache de génération | Têtes KV, couches, tokens, séquences, format | Calcul adapté à l’architecture puis mesure |
| Activations | Microbatch, longueur, architecture, checkpointing | Pic sur les entrées retenues |
| Gradients et optimiseur | Paramètres entraînés, formats, méthode | Première mise à jour complète |
| Chargement, validation et export | Procédure et tailles de sortie | Contrôle de chaque phase nécessaire |
Valider par paliers sans changer silencieusement la tâche
Commencez avec une entrée courte et un petit batch pour repérer les erreurs de préparation. Passez ensuite à une entrée habituelle puis à votre limite réellement nécessaire. Si le programme tronque les données, conserve moins de tokens ou saute une partie du corpus, le cas qui tient ne valide pas la charge annoncée. Notez les dimensions effectivement exécutées.
Relevez le pic par phase et par GPU avec son compteur. La mémoire allouée aux tenseurs et la mémoire réservée par l’allocateur PyTorch ne s’additionnent pas. Une lecture système peut couvrir plus que le processus instrumenté. Si plusieurs lots sont envisagés, documentez leur répartition logicielle ; deux cartes ne forment pas automatiquement un espace mémoire unique.
Sources techniques : PyTorch — gestion mémoire CUDA
Décider après le premier dépassement
Un échec au chargement oriente vers les poids, le format ou une allocation transitoire. Un échec à la génération demande d’examiner contexte et concurrence. Un échec au passage arrière peut orienter vers microbatch, activations ou stratégie de calcul. Cette localisation évite de changer au hasard précision, modèle et données en même temps.
Après chaque correction, vérifiez la qualité et le périmètre couvert. Réduire la longueur nécessaire peut être inacceptable ; changer la quantification peut modifier des sorties. Si une autre capacité est requise, revenez au catalogue avec une fiche qui précise le pic observé, la marge justifiée, les versions et les entrées limites. Une marge sans motif n’est pas plus fiable qu’un résultat arrondi au Go près.
Une courte sélection, sous les mêmes exigences
Pour l’inférence illustrative à 7 milliards de paramètres en 16 bits et 6 Gio de réserve, l’exemple travaillé donne 19,04 Gio. Vous pouvez examiner la RTX 4090 de 24 Go ou la RTX 6000 Ada de 48 Go. Leurs offres déclarées pour un lot d’une carte sur 3 jours sont respectivement de 47,14 USD et 55,71 USD. Ce sont deux candidats de capacités différentes : contexte, concurrence, mémoire réellement disponible, compatibilité et qualité restent à vérifier. Ces prix n’établissent aucun classement de vitesse.
Pour une adaptation, reprenez la même grille avec les paramètres appris et les phases supplémentaires : passage arrière, première mise à jour, validation et export. Le nombre de paramètres LoRA ne suffit pas à valider la mémoire totale. Le parcours fine-tuning aide à qualifier le résultat ; batch et accumulation servent à documenter une mise à jour comparable.
Si vous cherchez une alternative après un dépassement, localisez la phase fautive et gardez vos exigences de sortie. Comparez une seule modification à la fois : capacité, cache, microbatch ou précision. Un format différent doit retrouver la qualité minimale fixée. Si votre besoin exige une application gérée, une RAM précise ou une interconnexion attestée, une fiche GPU seule laisse la décision à confirmer. Deux cartes exigent un placement logiciel vérifié ; leurs mémoires ne constituent pas automatiquement un espace unique.
Sources techniques : RTX 4090 — lot, capacité et forfaits · RTX 6000 Ada — lot, capacité et forfaits · Qualité après quantification · Préparer une adaptation · Définir batch et accumulation
Conserver le calcul avec ce qui le confirme
Enregistrez l’hypothèse initiale, le tableau des postes, la procédure et les relevés bruts. Distinguez estimation, compteur mesuré et décision commerciale. Le notebook IteraGPU Lab aide à comprendre cette instrumentation sur un petit réseau ; il ne remplace pas un essai de votre modèle. Les exemples numériques de cette page sont des calculs, sans débit ni consommation GPU prétendument observés.
Une bonne sortie de dimensionnement tient dans une fiche : modèle et révision, tâche, précision, longueur, microbatch ou concurrence, mémoire par GPU et conditions de mesure. Ajoutez ce qui invaliderait la conclusion, par exemple une fenêtre plus longue ou une évaluation différente. Vous pourrez alors choisir un forfait correspondant à la campagne, au lieu de relancer toute l’estimation à chaque variante.
Questions pratiques
La réserve proposée par l’outil est-elle calculée à partir de mon modèle ?
Non. La réserve est une valeur choisie par vous. L’outil ne connaît ni l’architecture ni les entrées de votre exécution ; utilisez-la pour rendre votre hypothèse explicite, puis confrontez-la aux phases mesurées.
Pourquoi une enveloppe inférieure à 24 Go peut-elle encore échouer ?
L’estimation peut omettre des postes et utiliser des Gio alors que la capacité nominale est exprimée en Go. Un pic transitoire, un autre processus ou une entrée différente peut aussi compter. Comparez unités et périmètres, puis localisez la phase qui échoue.
Puis-je additionner les réserves et les deux pics PyTorch ?
Non. Le pic des tenseurs alloués et celui de mémoire réservée ne sont pas deux postes indépendants à additionner. Des pics séparés peuvent survenir à des instants différents. Conservez leurs noms et utilisez la méthode mémoire pour les interpréter.
Puis-je demander une liste ou une alternative sans avoir déjà mesuré mon modèle ?
Oui, pour établir des candidats conditionnels. Décrivez la charge et les contraintes qui doivent rester identiques. Le calcul mémoire et les fiches commerciales permettent une première sélection ; les critères obligatoires non vérifiés restent à confirmer avant de retenir une offre.