Escolher uma configuração para uma carga definida
Uma lista de GPU, uma recomendação para o seu modelo e uma alternativa à sua configuração atual exigem a mesma ficha inicial: modelo e revisão, inferência ou adaptação, formato dos pesos, comprimento necessário, concorrência ou microbatch, e critério de qualidade. Mantenha essas exigências quando comparar as ofertas. Uma configuração que processa menos contexto ou uma tarefa simplificada não atende automaticamente à mesma necessidade.
Classifique cada exigência obrigatória: admissível se a peça disponível a confirma no seu escopo; a confirmar se estiver faltando; excluir se uma falha comprovada impedir de atender à carga. Um candidato só é retido quando todas essas exigências são satisfeitas. Em seguida, desempate os candidatos admissíveis pelo custo total do pacote, a margem útil e o cronograma documentado. Uma preferência não compensa um critério eliminatório.
Ligar cada critério a uma peça e a uma decisão
A ficha comercial atesta o que é oferecido; seu protocolo estabelece o que funciona na carga. O ambiente solicitado no momento do pedido continua sendo uma preferência de preparação. Uma capacidade de memória nominal ou um estoque declarado não provam nem uma instalação de software nem um prazo de disponibilização.
Guarde a peça com sua versão e seu escopo. Se uma informação obrigatória não estiver documentada, escreva com precisão a condição a confirmar. A tabela permite montar uma pré-seleção sem transformar essas incógnitas em garantias.
| Critério obrigatório | Peça verificável | Admissível | A confirmar | Excluir |
|---|---|---|---|---|
| Carga coberta | Modelo, revisão, tokens, batch/concorrência e entradas executadas | Toda a carga necessária está coberta | Dimensões reais desconhecidas | Uma parte indispensável foi removida |
| Compatibilidade | Documentação oficial do software e verificação do ambiente visado | Combinação exigida verificada | Ambiente apenas desejado | Dependência indispensável incompatível |
| Memória por GPU | Cálculo decomposto, capacidade disponível e picos das fases úteis | Ciclo completo coberto com margem justificada | Pesos isolados ou pequeno teste conhecidos | Saturação na carga exigida |
| Qualidade | Corpus fixado, saídas identificadas e limiares definidos antes da comparação | Limiares e tolerâncias respeitados | Novo formato não avaliado | Regressão além da tolerância |
| Distribuição e servidor | Posicionamento dos componentes; RAM, armazenamento ou interconexão necessários | Necessidades verificadas | Características exigidas não documentadas | Distribuição indispensável impossível |
| Orçamento e cronograma | Pacote, lotes, placas, dias, total em USD e planejamento completo | Teto e janela respeitados | Durações ainda hipotéticas | Orçamento ou prazo ultrapassados |
Fontes técnicas: Ficha de carga para a inferência · Medir as fases e os contadores · Definir os critérios de qualidade · Planejar o custo do experimento
Saber o que o resultado calcula
O número de parâmetros corresponde aos valores que você representa no cálculo denso. O formato indica o número de bits por valor. O resultado “Pesos isolados” converte esse volume em GiB, e depois “Envelope indicativo” adiciona sua reserva. A escolha entre treinamento ou adaptação na ferramenta não aplica um multiplicador universal oculto; ela convida você a documentar os itens que faltam.
Essa simplicidade permite reler a hipótese. Ela também exige saber o que fica fora do cálculo: metadados de quantização, módulos de outro formato, memória de trabalho, carregamento transitório e usos externos ao processo. A ficha de GPU proposta é um candidato a examinar, não uma garantia de que seu modelo funcionará nela. O nome e a memória nominal de uma placa não descrevem o restante do servidor.
Ler as unidades antes de comparar uma placa
Um GB decimal corresponde a um bilhão de bytes; um GiB corresponde a 2³⁰ bytes. O catálogo exibe uma capacidade nominal em GB. A ferramenta aplica a convenção decimal; para validar uma configuração, verifique também a capacidade em bytes declarada pelo dispositivo. Os contadores do seu programa podem ser exibidos em bytes ou GiB. Converta quantidades que têm a mesma definição antes de comparar seu tamanho; não misture memória nominal, memória livre e pico reservado.
Exemplo de cálculo: 24 bilhões de bytes representam aproximadamente 22,35 GiB. Esse resultado não anuncia a quantidade livre de uma placa de 24 GB. O sistema, o contexto de execução e outras alocações podem contar. Mantenha a unidade e o escopo no nome de cada coluna da sua planilha de teste.
Fontes técnicas: NIST — prefixos binários e decimais
Exemplo prático: sete bilhões de parâmetros
Para 7 bilhões de parâmetros em 16 bits, o volume denso é 14 bilhões de bytes, ou seja, cerca de 13,04 GiB. Com uma reserva escolhida de 6 GiB, o envelope passa a ser 19,04 GiB. O cálculo não demonstra que uma reserva de 6 GiB é adequada ao seu modelo: é justamente a hipótese a controlar com as entradas e as operações adotadas.
A tabela mantém a mesma reserva para mostrar apenas o efeito aritmético do formato dos pesos. Em uma execução real, as outras alocações podem variar de forma diferente. Uma representação de quatro bits costuma incluir informações adicionais e pode deixar algumas camadas em outro formato. Portanto, não leia a última linha como um pico total garantido.
| Formato dos pesos | Volume denso em bytes | Pesos em GiB, arredondados | Pesos + reserva em GiB |
|---|---|---|---|
| 32 bits | 28 000 000 000 | 26,08 | 32,08 |
| 16 bits | 14 000 000 000 | 13,04 | 19,04 |
| 8 bits | 7 000 000 000 | 6,52 | 12,52 |
| 4 bits teóricos | 3 500 000 000 | 3,26 | 9,26 |
Fontes técnicas: Transformers 5.17 — formatos e limites do bitsandbytes
Construir uma reserva explicável
Decomponha a reserva em vez de escolher uma porcentagem por hábito. Na inferência autorregressiva, registre arquitetura, cache, tokens mantidos e sequências simultâneas. No treinamento, anote parâmetros aprendidos, gradientes, otimizador, ativações e buffers. O comprimento de entrada e o microbatch fazem parte da ficha, mesmo quando o número de parâmetros não muda.
Alguns itens não atingem o máximo no mesmo momento. Uma soma de margens máximas independentes pode servir como envelope conservador se for declarada como tal, mas não é um pico observado. Registre os itens estimados, os medidos e os ainda desconhecidos. O guia de cache KV detalha um desses cálculos; o dossiê de memória recoloca os contadores nas fases do programa.
| Item a documentar | Entradas necessárias | Evidência esperada |
|---|---|---|
| Cache de geração | Cabeças KV, camadas, tokens, sequências, formato | Cálculo adaptado à arquitetura e depois medição |
| Ativações | Microbatch, comprimento, arquitetura, checkpointing | Pico nas entradas adotadas |
| Gradientes e otimizador | Parâmetros treinados, formatos, método | Primeira atualização completa |
| Carregamento, validação e exportação | Procedimento e tamanhos de saída | Controle de cada fase necessária |
Validar por etapas sem alterar silenciosamente a tarefa
Comece com uma entrada curta e um batch pequeno para detectar erros de preparação. Passe em seguida a uma entrada habitual e depois ao seu limite realmente necessário. Se o programa trunca os dados, mantém menos tokens ou pula parte do corpus, o caso que cabe não valida a carga anunciada. Anote as dimensões efetivamente executadas.
Registre o pico por fase e por GPU com seu contador. A memória alocada aos tensores e a memória reservada pelo alocador PyTorch não se somam. Uma leitura de sistema pode abranger mais do que o processo instrumentado. Se vários lotes estiverem previstos, documente sua distribuição por software; duas placas não formam automaticamente um espaço de memória único.
Fontes técnicas: PyTorch — gerenciamento de memória CUDA
Decidir após o primeiro estouro
Uma falha no carregamento aponta para os pesos, o formato ou uma alocação transitória. Uma falha na geração exige examinar contexto e concorrência. Uma falha na passagem reversa pode apontar para microbatch, ativações ou estratégia de cálculo. Essa localização evita mudar ao acaso precisão, modelo e dados ao mesmo tempo.
Após cada correção, verifique a qualidade e o escopo coberto. Reduzir o comprimento necessário pode ser inaceitável; mudar a quantização pode alterar saídas. Se outra capacidade for necessária, volte ao catálogo com uma ficha que especifique o pico observado, a margem justificada, as versões e as entradas limite. Uma margem sem motivo não é mais confiável do que um resultado arredondado ao GB mais próximo.
Uma pequena seleção, sob as mesmas exigências
Para a inferência ilustrativa de 7 bilhões de parâmetros em 16 bits e 6 GiB de reserva, o exemplo prático dá 19,04 GiB. Você pode considerar a RTX 4090 de 24 GB ou a RTX 6000 Ada de 48 GB. Suas ofertas declaradas para um lote de uma placa por 3 dias são, respectivamente, de 47,14 USD e 55,71 USD. São dois candidatos de capacidades diferentes: contexto, concorrência, memória realmente disponível, compatibilidade e qualidade ainda precisam ser verificados. Esses preços não estabelecem nenhum ranking de velocidade.
Para uma adaptação, retome a mesma grade com os parâmetros aprendidos e as fases adicionais: passagem reversa, primeira atualização, validação e exportação. O número de parâmetros LoRA não é suficiente para validar a memória total. O percurso de fine-tuning ajuda a qualificar o resultado; batch e acumulação servem para documentar uma atualização comparável.
Se você busca uma alternativa após um estouro, localize a fase com falha e mantenha seus requisitos de saída. Compare uma única modificação por vez: capacidade, cache, microbatch ou precisão. Um formato diferente deve recuperar a qualidade mínima definida. Se sua necessidade exige uma aplicação gerenciada, uma RAM precisa ou uma interconexão atestada, uma ficha de GPU sozinha deixa a decisão a confirmar. Duas placas exigem um posicionamento de software verificado; suas memórias não constituem automaticamente um espaço único.
Fontes técnicas: RTX 4090 — lote, capacidade e planos · RTX 6000 Ada — lote, capacidade e planos · Qualidade após quantificação · Preparar uma adaptação · Definir batch e acumulação
Manter o cálculo com o que o confirma
Registre a hipótese inicial, a tabela de postos, o procedimento e as medições brutas. Distinga estimativa, contador medido e decisão comercial. O notebook IteraGPU Lab ajuda a compreender essa instrumentação em uma pequena rede; ele não substitui um teste do seu modelo. Os exemplos numéricos desta página são cálculos, sem taxa de transferência nem consumo de GPU supostamente observados.
Uma boa saída de dimensionamento cabe em uma ficha: modelo e revisão, tarefa, precisão, comprimento, microbatch ou concorrência, memória por GPU e condições de medição. Acrescente o que invalidaria a conclusão, por exemplo uma janela mais longa ou uma avaliação diferente. Assim você poderá escolher um plano correspondente à campanha, em vez de refazer toda a estimativa a cada variante.
Perguntas práticas
A reserva proposta pela ferramenta é calculada a partir do meu modelo?
Não. A reserva é um valor escolhido por você. A ferramenta não conhece nem a arquitetura nem as entradas da sua execução; use-a para tornar sua hipótese explícita e depois confronte-a com as fases medidas.
Por que um envelope inferior a 24 GB ainda pode falhar?
A estimativa pode omitir itens e usar GiB enquanto a capacidade nominal é expressa em GB. Um pico transitório, outro processo ou uma entrada diferente também podem contar. Compare unidades e escopos, depois localize a fase que falha.
Posso somar as reservas e os dois picos do PyTorch?
Não. O pico dos tensores alocados e o de memória reservada não são dois itens independentes a somar. Picos separados podem ocorrer em instantes diferentes. Mantenha seus nomes e use o método de memória para interpretá-los.
Posso pedir uma lista ou uma alternativa sem já ter medido meu modelo?
Sim, para estabelecer candidatos condicionais. Descreva a carga e as restrições que devem permanecer idênticas. O cálculo de memória e as fichas comerciais permitem uma primeira seleção; os critérios obrigatórios não verificados permanecem a confirmar antes de escolher uma oferta.