Distinguir el modelo cargado de la solicitud ejecutada
Un modelo que se carga correctamente todavía no valida tu caso de uso. La caché KV utilizada durante la generación puede crecer con las secuencias conservadas; las solicitudes simultáneas también aumentan la huella que hay que observar. Prepara tres grupos de textos: cortos, intermedios y cercanos a tu longitud máxima. Para cada uno, fija el número de tokens de salida a fin de comparar tareas equivalentes.
Medir la memoria en el punto difícil
Registra por separado la carga, el procesamiento del prompt y la generación. Una muestra de conversaciones medias puede ocultar el caso que satura la tarjeta. Busca el pico en las entradas largas con la concurrencia realmente prevista y luego conserva un margen para los búferes de tu motor de inferencia. Si pruebas una caché cuantizada o desplazada, anota también su efecto sobre el tiempo de respuesta y sobre tu métrica de calidad.
Los 141 GB también sirven para examinar un batch más grande en entrenamiento. En ese caso, gradientes, activaciones y estados del optimizador deben figurar en el presupuesto, y no solo los pesos.
Mantener una comparación legible con el H100
El H200 pertenece a la familia Hopper. Verifica las versiones CUDA y los kernels de atención admitidos por tu entorno, y luego bloquea esas versiones durante la prueba. Si todas tus cargas representativas ya caben en 80 GB, confronta el H200 con el H100 SXM con el mismo modelo y la misma precisión. Una memoria adicional es útil cuando permite un objetivo identificado, como más contexto o menos fragmentación del trabajo.
Del test de capacidad a la campaña completa
Reserva tres días para mapear memoria, contexto y concurrencia; siete días para comparar varias estrategias de caché; treinta días para evaluaciones repetidas sobre un corpus en evolución. Prepara los datos, los parámetros de generación y las exportaciones antes de hacer el pedido. El formulario te deja elegir la duración y el número de tarjetas, y luego el pago cripto sin KYC. Nombre, apellido y correo electrónico aseguran el seguimiento; no se solicita ningún documento de identidad.