Adottare una configurazione per un carico definito
Un elenco di GPU, un consiglio per il tuo modello e un'alternativa alla tua configurazione attuale richiedono la stessa scheda di partenza: modello e revisione, inferenza o adattamento, formato dei pesi, lunghezza necessaria, concorrenza o microbatch, e criterio di qualità. Conserva questi requisiti quando confronti le offerte. Una configurazione che gestisce meno contesto o un compito semplificato non risponde automaticamente allo stesso bisogno.
Classifica ogni requisito obbligatorio: ammissibile se il documento disponibile lo conferma nel tuo perimetro; da confermare se manca; escludere se un fallimento accertato impedisce di rispettare il carico. Un candidato è selezionato solo quando tutti questi requisiti sono soddisfatti. Poi distingui i candidati ammissibili in base al costo totale del pacchetto, al margine utile e al calendario documentato. Una preferenza non compensa un criterio eliminante.
Collegare ogni criterio a un documento e a una decisione
La scheda commerciale attesta ciò che viene proposto; il tuo protocollo stabilisce ciò che funziona sul carico. L'ambiente richiesto al momento dell'ordine resta una preferenza di preparazione. Una capacità di memoria nominale o una disponibilità dichiarata non prova né un'installazione software né una durata di messa a disposizione.
Conserva il documento con la sua versione e il suo perimetro. Se un'informazione obbligatoria non è documentata, annota con precisione la condizione da confermare. La tabella permette di costituire una preselezione senza trasformare queste incognite in garanzie.
| Criterio obbligatorio | Documento verificabile | Ammissibile | Da confermare | Escludere |
|---|---|---|---|---|
| Carico coperto | Modello, revisione, token, batch/concorrenza e input eseguiti | Tutto il carico necessario è coperto | Dimensioni reali sconosciute | Una parte indispensabile è eliminata |
| Compatibilità | Documentazione ufficiale del software e controllo dell'ambiente previsto | Combinazione richiesta verificata | Ambiente solo desiderato | Dipendenza indispensabile incompatibile |
| Memoria per GPU | Calcolo scomposto, capacità disponibile e picchi delle fasi utili | Ciclo completo coperto con margine giustificato | Soli pesi o piccolo test noti | Saturazione sul carico richiesto |
| Qualità | Corpus congelato, output identificati e soglie definite prima del confronto | Soglie e tolleranze rispettate | Nuovo formato non valutato | Regressione oltre la tolleranza |
| Ripartizione e server | Collocazione dei componenti; RAM, storage o interconnessione necessari | Esigenze verificate | Caratteristiche richieste non documentate | Ripartizione indispensabile impossibile |
| Budget e calendario | Pacchetto, lotti, schede, giorni, totale USD e pianificazione completa | Tetto e finestra rispettati | Durate ancora ipotetiche | Budget o scadenza superati |
Fonti tecniche: Scheda di carico per l'inferenza · Misurare le fasi e i contatori · Fissare i criteri di qualità · Pianificare il costo dell'esperimento
Sapere cosa calcola il risultato
Il numero di parametri corrisponde ai valori che rappresenti nel calcolo denso. Il formato indica il loro numero di bit per valore. Il risultato «Soli pesi» converte questo volume in GiB, poi «Inviluppo indicativo» aggiunge la tua riserva. La scelta addestramento o adattamento nello strumento non applica un moltiplicatore universale nascosto; ti invita a documentare le voci che mancano.
Questa semplicità permette di rileggere l'ipotesi. Richiede anche di sapere cosa resta fuori dal calcolo: metadati di quantizzazione, moduli di un altro formato, memoria di lavoro, caricamento transitorio e usi esterni al processo. La scheda GPU proposta è un candidato da esaminare, non una garanzia che il tuo modello vi funzionerà. Il nome e la memoria nominale di una scheda non descrivono il resto del suo server.
Leggere le unità prima di confrontare una scheda
Un GB decimale corrisponde a un miliardo di byte; un GiB corrisponde a 2³⁰ byte. Il catalogo mostra una capacità nominale in GB. Lo strumento applica la convenzione decimale; per convalidare una configurazione, rileva anche la capacità in byte dichiarata dal dispositivo. I contatori del tuo programma possono essere visualizzati in byte o GiB. Converti quantità che hanno la stessa definizione prima di confrontarne la dimensione; non mescolare memoria nominale, memoria libera e picco riservato.
Esempio di calcolo: 24 miliardi di byte rappresentano circa 22,35 GiB. Questo risultato non annuncia la quantità libera di una scheda da 24 GB. Il sistema, il contesto di esecuzione e altre allocazioni possono contare. Mantieni l'unità e il perimetro nel nome di ogni colonna del tuo foglio di test.
Fonti tecniche: NIST — prefissi binari e decimali
Esempio pratico: sette miliardi di parametri
Per 7 miliardi di parametri a 16 bit, il volume denso è di 14 miliardi di byte, ossia circa 13,04 GiB. Con una riserva scelta di 6 GiB, l'inviluppo diventa 19,04 GiB. Il calcolo non dimostra che una riserva di 6 GiB sia adatta al tuo modello: è proprio l'ipotesi da verificare con gli input e le operazioni considerate.
La tabella mantiene la stessa riserva per mostrare unicamente l'effetto aritmetico del formato dei pesi. In un'esecuzione reale, le altre allocazioni possono evolvere diversamente. Una rappresentazione a quattro bit include spesso informazioni aggiuntive e può lasciare alcuni layer in un altro formato. Non leggere quindi l'ultima riga come un picco totale garantito.
| Formato dei pesi | Volume denso in byte | Pesi in GiB, arrotondati | Pesi + riserva in GiB |
|---|---|---|---|
| 32 bit | 28 000 000 000 | 26,08 | 32,08 |
| 16 bit | 14 000 000 000 | 13,04 | 19,04 |
| 8 bit | 7 000 000 000 | 6,52 | 12,52 |
| 4 bit teorici | 3 500 000 000 | 3,26 | 9,26 |
Fonti tecniche: Transformers 5.17 — formati e limiti di bitsandbytes
Costruire una riserva spiegabile
Scomponi la riserva invece di scegliere una percentuale per abitudine. In inferenza autoregressiva, rileva architettura, cache, token conservati e sequenze simultanee. In addestramento, annota parametri appresi, gradienti, ottimizzatore, attivazioni e buffer. La lunghezza dell'input e il microbatch fanno parte della scheda, anche quando il numero di parametri non cambia.
Alcune voci non raggiungono il loro massimo nello stesso momento. Una somma di margini massimi indipendenti può servire da inviluppo conservativo se dichiarata come tale, ma non è un picco osservato. Annota le voci stimate, quelle misurate e quelle ancora sconosciute. La guida cache KV dettaglia uno di questi calcoli; il dossier memoria ricolloca i contatori nelle fasi del programma.
| Voce da documentare | Input necessari | Prova attesa |
|---|---|---|
| Cache di generazione | Teste KV, layer, token, sequenze, formato | Calcolo adattato all'architettura poi misura |
| Attivazioni | Microbatch, lunghezza, architettura, checkpointing | Picco sugli input considerati |
| Gradienti e ottimizzatore | Parametri addestrati, formati, metodo | Primo aggiornamento completo |
| Caricamento, validazione ed export | Procedura e dimensioni di output | Controllo di ogni fase necessaria |
Validare per gradi senza cambiare silenziosamente il compito
Inizia con un input breve e un piccolo batch per individuare gli errori di preparazione. Passa poi a un input abituale e quindi al tuo limite realmente necessario. Se il programma tronca i dati, conserva meno token o salta una parte del corpus, il caso che regge non valida il carico dichiarato. Annota le dimensioni effettivamente eseguite.
Rileva il picco per fase e per GPU con il suo contatore. La memoria allocata ai tensori e la memoria riservata dall'allocatore PyTorch non si sommano. Una lettura di sistema può coprire più del processo strumentato. Se sono previsti più lotti, documenta la loro ripartizione software; due schede non formano automaticamente uno spazio di memoria unico.
Fonti tecniche: PyTorch — gestione memoria CUDA
Decidere dopo il primo superamento
Un errore al caricamento orienta verso i pesi, il formato o un'allocazione transitoria. Un errore alla generazione richiede di esaminare contesto e concorrenza. Un errore al passaggio all'indietro può orientare verso microbatch, attivazioni o strategia di calcolo. Questa localizzazione evita di cambiare a caso precisione, modello e dati nello stesso momento.
Dopo ogni correzione, verifica la qualità e il perimetro coperto. Ridurre la lunghezza necessaria può essere inaccettabile; cambiare la quantizzazione può modificare gli output. Se è richiesta un'altra capacità, torna al catalogo con una scheda che precisi il picco osservato, il margine giustificato, le versioni e gli input limite. Un margine senza motivo non è più affidabile di un risultato arrotondato al GB.
Una breve selezione, con gli stessi requisiti
Per l'inferenza illustrativa a 7 miliardi di parametri a 16 bit e 6 GiB di riserva, l'esempio pratico dà 19,04 GiB. Puoi esaminare la RTX 4090 da 24 GB o la RTX 6000 Ada da 48 GB. Le loro offerte dichiarate per un lotto di una scheda su 3 giorni sono rispettivamente di 47,14 USD e 55,71 USD. Sono due candidati di capacità diverse: contesto, concorrenza, memoria realmente disponibile, compatibilità e qualità restano da verificare. Questi prezzi non stabiliscono alcuna classifica di velocità.
Per un adattamento, riprendi la stessa griglia con i parametri appresi e le fasi aggiuntive: passaggio all'indietro, primo aggiornamento, validazione ed esportazione. Il numero di parametri LoRA non basta a convalidare la memoria totale. Il percorso di fine-tuning aiuta a qualificare il risultato; batch e accumulo servono a documentare un aggiornamento confrontabile.
Se cerchi un'alternativa dopo un superamento, individua la fase incriminata e mantieni i tuoi requisiti di output. Confronta una sola modifica alla volta: capacità, cache, microbatch o precisione. Un formato diverso deve ritrovare la qualità minima fissata. Se la tua esigenza richiede un'applicazione gestita, una RAM precisa o un'interconnessione attestata, una scheda GPU da sola lascia la decisione da confermare. Due schede richiedono un posizionamento software verificato; le loro memorie non costituiscono automaticamente uno spazio unico.
Fonti tecniche: RTX 4090 — lotto, capacità e forfait · RTX 6000 Ada — lotto, capacità e forfait · Qualità dopo la quantizzazione · Preparare un adattamento · Definire batch e accumulo
Conservare il calcolo con ciò che lo conferma
Registra l'ipotesi iniziale, la tabella delle voci, la procedura e i rilevamenti grezzi. Distingui stima, contatore misurato e decisione commerciale. Il notebook IteraGPU Lab aiuta a comprendere questa strumentazione su una piccola rete; non sostituisce una prova del tuo modello. Gli esempi numerici di questa pagina sono calcoli, senza velocità di trasferimento né consumo GPU presunti come osservati.
Un buon output di dimensionamento sta in una scheda: modello e revisione, attività, precisione, lunghezza, microbatch o concorrenza, memoria per GPU e condizioni di misura. Aggiungi ciò che invaliderebbe la conclusione, per esempio una finestra più lunga o una valutazione diversa. Potrai così scegliere un forfait corrispondente alla campagna, invece di rifare tutta la stima a ogni variante.
Domande pratiche
La riserva proposta dallo strumento è calcolata a partire dal mio modello?
No. La riserva è un valore scelto da te. Lo strumento non conosce né l'architettura né gli input della tua esecuzione; usala per rendere esplicita la tua ipotesi, poi confrontala con le fasi misurate.
Perché un'involucro inferiore a 24 GB può ancora fallire?
La stima può omettere delle voci e usare i GiB mentre la capacità nominale è espressa in GB. Un picco transitorio, un altro processo o un input diverso possono anch'essi contare. Confronta unità e perimetri, poi individua la fase che fallisce.
Posso sommare le riserve e i due picchi PyTorch?
No. Il picco dei tensori allocati e quello della memoria riservata non sono due voci indipendenti da sommare. Picchi separati possono verificarsi in istanti diversi. Conserva i loro nomi e usa il metodo memoria per interpretarli.
Posso chiedere una lista o un'alternativa senza aver già misurato il mio modello?
Sì, per stabilire candidati condizionali. Descrivi il carico e i vincoli che devono restare identici. Il calcolo memoria e le schede commerciali consentono una prima selezione; i criteri obbligatori non verificati restano da confermare prima di scegliere un'offerta.