Passar da requisição isolada para uma carga realista
Comece com uma requisição, depois aumente gradualmente o número de solicitações simultâneas. Reexecute um conjunto de entradas fixo, com vários comprimentos e tipos de conteúdo. Registre a mediana e uma medida das requisições lentas, não apenas uma média. Para a geração, diferencie o tempo até o primeiro token da duração completa. Essas observações respondem a usos diferentes, como uma interface interativa ou um processamento de documentos offline.
Proteger a margem nos 24 GB
Um modelo carregado sem erro ainda pode saturar sob várias requisições. Meça o cache, os buffers e o comportamento nas suas entradas longas. Teste um limite de concorrência que conserve uma margem e anote esse limite junto com o modelo. Se você quantificar os pesos, verifique as respostas no seu conjunto de avaliação antes de considerar a variante como equivalente.
Para um processamento offline, um batch maior pode ser aceitável mesmo que aumente a latência individual. Apresente esses dois objetivos separadamente no seu caderno para escolher uma configuração em função da necessidade real.
Escolher um motor compatível com Ada
A L4 usa a arquitetura Ada. Verifique as versões do CUDA, do PyTorch ou do motor de inferência, assim como os formatos de quantização e os operadores necessários. O carregamento inicial não valida todas as formas de entrada: inclua o exemplo mais exigente no teste. Compare uma RTX 4090 para outra configuração de 24 GB, ou a L40S quando mais contexto ou concorrência exigir 48 GB.
Alugar para definir uma capacidade medida
Três dias permitem traçar uma primeira relação entre concorrência e latência. Sete dias dão tempo para avaliar vários ajustes e repetir o teste. Trinta dias acompanham uma campanha regular de inferência ou de validação. Prepare as requisições, o modelo e os critérios de qualidade antes do pedido. Escolha o seu plano, informe os seus dados de contato e siga as instruções de cripto; «Já paguei» sinaliza a transferência realizada.