Cronometrar lo que tu aplicación hace realmente
Una prueba sobre tensores que ya están en la GPU describe solo el cálculo. Un servicio o un entrenamiento también debe decodificar, preparar y transferir sus entradas. Construye, por tanto, dos medidas: el bucle de cálculo aislado y un bucle que parta de tus datos habituales. La diferencia indica dónde buscar una mejora. Espera al fin efectivo del trabajo de la GPU antes de registrar un tiempo; los lanzamientos de CUDA suelen ser asíncronos.
Usar el batch como variable controlada
Para una inferencia sin conexión, compara varios tamaños de lote conservando la longitud y el tipo de las entradas. Para una aplicación interactiva, mide también la latencia de una petición y la de las peticiones más lentas. El batch que maximiza el volumen procesado puede hacer que la espera sea menos aceptable. Con 80 GB, reserva espacio para la caché o las activaciones en lugar de detener el dimensionamiento al cargar el modelo.
Registra la precisión de los pesos y la del cálculo por separado. Un modelo almacenado en un formato reducido puede seguir usando buffers u operaciones de mayor precisión durante su ejecución.
Comparar sin asimilar las variantes de H100
La ficha se refiere a la H100 PCIe 80 GB. Los resultados de una H100 SXM o de un conjunto de varias tarjetas no describen automáticamente esta configuración. Verifica CUDA, PyTorch y las bibliotecas especializadas para tu arquitectura y luego elige una receta común a las GPU comparadas. Si 80 GB no bastan, estudia la H200; si la necesidad cabe en 48 GB, añade la L40S a tu comparación económica.
Preparar un pedido orientado al pipeline
Tres días pueden servir para identificar la parte de cómputo y de transferencias. Siete días permiten probar las correcciones y repetir las mediciones. Treinta días acompañan una campaña de inferencia o un entrenamiento planificado. Selecciona duración y cantidad, indica tu entorno y luego tus datos de seguimiento. Las instrucciones cripto del pedido precisan la red y el importe; el botón «He pagado» señala tu transferencia.