Separar resolução e tamanho de batch
Um modelo de visão que funciona em imagens pequenas não prevê diretamente o consumo das suas imagens de trabalho. Construa primeiro uma série com batch constante e resoluções crescentes, depois uma série com resolução fixa e batches crescentes. Isso permite atribuir as diferenças. Mantenha as mesmas regras de redimensionamento e recorte: alterar o pré-processamento pode mudar a pontuação tanto quanto a escolha do modelo.
Medir um treinamento ou uma adaptação completa
Os 48 GB oferecem mais espaço do que uma placa de 24 GB para as ativações e os componentes auxiliares. No entanto, eles não definem um tamanho de modelo universalmente aceitável. Meça a retropropagação se você treinar, o pipeline inteiro se você produzir embeddings, e as amostras mais volumosas se as formas variarem. Anote o pico e os parâmetros que o provocaram.
Para uma adaptação, compare a qualidade em um conjunto mantido fora dos ajustes. Aumentar o batch para ocupar toda a memória não constitui, por si só, uma melhoria científica.
Ada e Ampere: uma comparação com receitas constantes
A RTX 6000 Ada e a RTX A6000 têm ambas 48 GB neste catálogo, mas pertencem a arquiteturas diferentes. Portanto, mantenha suas versões de CUDA, PyTorch e bibliotecas o mais comparáveis possível. Verifique as extensões compiladas para Ada e teste a operação mais especializada do seu modelo. A L40S constitui outra comparação de 48 GB; uma RTX 4090 pode bastar se os seus picos permanecerem dentro do limite de 24 GB dela.
Preparar os dados antes do plano
Três dias bastam para um mapeamento resolução/batch. Sete dias permitem adaptar e avaliar algumas variantes. Trinta dias acompanham uma campanha de visão com repetições e exportações organizadas. Prepare o manifesto das imagens, suas divisões e o script de avaliação antes de escolher a duração. O pedido reúne a configuração, o ambiente desejado e seus dados de contato; o seu pagamento em cripto é acompanhado em seguida no mesmo registro.