Pasar de la petición aislada a una carga realista
Empieza con una petición y luego aumenta progresivamente el número de solicitudes simultáneas. Repite un conjunto de entradas fijo, con varias longitudes y tipos de contenido. Registra la mediana y una medida de las peticiones lentas, no solo una media. Para la generación, distingue el tiempo hasta el primer token de la duración completa. Estas observaciones responden a usos distintos, como una interfaz interactiva o un procesamiento de documentos en lote.
Proteger el margen en los 24 GB
Un modelo cargado sin errores puede saturarse igualmente bajo varias peticiones. Mide la caché, los buffers y el comportamiento con tus entradas largas. Prueba un límite de concurrencia que conserve un margen y anota ese límite junto con el modelo. Si cuantizas los pesos, verifica las respuestas en tu conjunto de evaluación antes de considerar la variante como equivalente.
Para un procesamiento en lote, un batch más grande puede ser aceptable aunque aumente la latencia individual. Presenta estos dos objetivos por separado en tu cuaderno para elegir una configuración en función de la necesidad real.
Elegir un motor compatible con Ada
La L4 utiliza la arquitectura Ada. Verifica las versiones de CUDA, PyTorch o del motor de inferencia, así como los formatos de cuantización y los operadores requeridos. La carga inicial no valida todas las formas de entrada: incluye el ejemplo más exigente en el test. Compara una RTX 4090 para otra configuración de 24 GB, o la L40S cuando más contexto o concurrencia exija 48 GB.
Alquilar para definir una capacidad medida
Tres días permiten trazar una primera relación entre concurrencia y latencia. Siete días dan tiempo para evaluar varios ajustes y repetir el test. Treinta días acompañan una campaña regular de inferencia o de validación. Prepara las peticiones, el modelo y los criterios de calidad antes del pedido. Elige tu plan, introduce tus datos de contacto y sigue las instrucciones cripto; «He pagado» señala la transferencia realizada.