Retener una configuración para una carga definida
Una lista de GPU, un consejo para tu modelo y una alternativa a tu configuración actual piden la misma ficha de partida: modelo y revisión, inferencia o ajuste, formato de los pesos, longitud necesaria, concurrencia o microbatch, y criterio de calidad. Conserva estos requisitos cuando compares las ofertas. Una configuración que procesa menos contexto o una tarea simplificada no responde automáticamente a la misma necesidad.
Clasifica cada requisito obligatorio: admisible si la pieza disponible lo confirma dentro de tu alcance; por confirmar si falta; excluir si un fallo constatado impide cumplir la carga. Un candidato solo se retiene cuando se satisfacen todos estos requisitos. Desempata después los candidatos admisibles por el coste total del paquete, el margen útil y el calendario documentado. Una preferencia no compensa un criterio eliminatorio.
Vincular cada criterio con una pieza y una decisión
La ficha comercial acredita lo que se propone; tu protocolo establece lo que funciona sobre la carga. El entorno solicitado al hacer el pedido sigue siendo una preferencia de preparación. Una capacidad de memoria nominal o un stock declarado no prueban ni una instalación de software ni una duración de puesta a disposición.
Guarda la pieza con su versión y su alcance. Si una información obligatoria no está documentada, anota con precisión la condición por confirmar. La tabla permite constituir una preselección sin convertir esas incógnitas en garantías.
| Criterio obligatorio | Pieza verificable | Admisible | Por confirmar | Excluir |
|---|---|---|---|---|
| Carga cubierta | Modelo, revisión, tokens, batch/concurrencia y entradas ejecutadas | Toda la carga necesaria está cubierta | Dimensiones reales desconocidas | Se suprime una parte indispensable |
| Compatibilidad | Documentación oficial del software y control del entorno objetivo | Combinación requerida verificada | Entorno solo deseado | Dependencia indispensable incompatible |
| Memoria por GPU | Cálculo desglosado, capacidad disponible y picos de las fases útiles | Ciclo completo cubierto con margen justificado | Pesos solos o pequeña prueba conocidos | Saturación sobre la carga requerida |
| Calidad | Corpus fijado, salidas identificadas y umbrales definidos antes de la comparación | Umbrales y tolerancias respetados | Nuevo formato no evaluado | Regresión por encima de la tolerancia |
| Distribución y servidor | Ubicación de los componentes; RAM, almacenamiento o interconexión necesarios | Necesidades verificadas | Características requeridas no documentadas | Distribución indispensable imposible |
| Presupuesto y calendario | Paquete, lotes, tarjetas, días, total USD y planificación completa | Techo y ventana respetados | Duraciones aún hipotéticas | Presupuesto o plazo superados |
Fuentes técnicas: Ficha de carga para la inferencia · Medir las fases y los contadores · Fijar los criterios de calidad · Planificar el coste del experimento
Saber qué calcula el resultado
El número de parámetros corresponde a los valores que representas en el cálculo denso. El formato indica su número de bits por valor. El resultado «Pesos solos» convierte ese volumen en GiB, y después «Envolvente indicativa» añade tu reserva. La elección de entrenamiento o adaptación en la herramienta no aplica un multiplicador universal oculto; te invita a documentar las partidas que faltan.
Esta sencillez permite releer la hipótesis. También exige saber qué queda fuera del cálculo: metadatos de cuantización, módulos de otro formato, memoria de trabajo, carga transitoria y usos ajenos al proceso. La ficha GPU propuesta es un candidato que examinar, no una garantía de que tu modelo funcione en ella. El nombre y la memoria nominal de una tarjeta no describen el resto de su servidor.
Leer las unidades antes de comparar una tarjeta
Un GB decimal corresponde a mil millones de bytes; un GiB corresponde a 2³⁰ bytes. El catálogo muestra una capacidad nominal en GB. La herramienta aplica la convención decimal; para validar una configuración, anota también la capacidad en bytes declarada por el dispositivo. Los contadores de tu programa pueden mostrarse en bytes o en GiB. Convierte cantidades que tengan la misma definición antes de comparar su tamaño; no mezcles memoria nominal, memoria libre y pico reservado.
Ejemplo de cálculo: 24 mil millones de bytes representan aproximadamente 22,35 GiB. Este resultado no anuncia la cantidad libre de una tarjeta de 24 GB. El sistema, el contexto de ejecución y otras asignaciones pueden contar. Conserva la unidad y el alcance en el nombre de cada columna de tu hoja de prueba.
Fuentes técnicas: NIST — prefijos binarios y decimales
Ejemplo práctico: siete mil millones de parámetros
Para 7 mil millones de parámetros a 16 bits, el volumen denso es de 14 mil millones de bytes, es decir, unos 13,04 GiB. Con una reserva elegida de 6 GiB, la envolvente pasa a ser 19,04 GiB. El cálculo no demuestra que una reserva de 6 GiB sea adecuada para tu modelo: es precisamente la hipótesis que hay que verificar con las entradas y las operaciones elegidas.
La tabla mantiene la misma reserva para mostrar únicamente el efecto aritmético del formato de los pesos. En una ejecución real, las demás asignaciones pueden evolucionar de forma distinta. Una representación de cuatro bits suele incluir información adicional y puede dejar algunas capas en otro formato. Por lo tanto, no leas la última fila como un pico total garantizado.
| Formato de los pesos | Volumen denso en bytes | Pesos en GiB, redondeados | Pesos + reserva en GiB |
|---|---|---|---|
| 32 bits | 28 000 000 000 | 26,08 | 32,08 |
| 16 bits | 14 000 000 000 | 13,04 | 19,04 |
| 8 bits | 7 000 000 000 | 6,52 | 12,52 |
| 4 bits teóricos | 3 500 000 000 | 3,26 | 9,26 |
Fuentes técnicas: Transformers 5.17 — formatos y límites de bitsandbytes
Construir una reserva explicable
Desglosa la reserva en lugar de elegir un porcentaje por costumbre. En inferencia autorregresiva, anota arquitectura, caché, tokens conservados y secuencias simultáneas. En entrenamiento, anota parámetros aprendidos, gradientes, optimizador, activaciones y búferes. La longitud de entrada y el microbatch forman parte de la ficha, incluso cuando el número de parámetros no cambia.
Algunos componentes no alcanzan su máximo al mismo tiempo. Una suma de márgenes máximos independientes puede servir como envolvente conservadora si se declara como tal, pero no es un pico observado. Registra los componentes estimados, los medidos y los que aún se desconocen. La guía de caché KV detalla uno de estos cálculos; el dossier de memoria sitúa los contadores en las fases del programa.
| Componente que hay que documentar | Entradas necesarias | Prueba esperada |
|---|---|---|
| Caché de generación | Cabeceras KV, capas, tokens, secuencias, formato | Cálculo adaptado a la arquitectura y después medición |
| Activaciones | Microbatch, longitud, arquitectura, checkpointing | Pico con las entradas elegidas |
| Gradientes y optimizador | Parámetros entrenados, formatos, método | Primera actualización completa |
| Carga, validación y exportación | Procedimiento y tamaños de salida | Control de cada fase necesaria |
Validar por etapas sin cambiar la tarea en silencio
Empieza con una entrada corta y un batch pequeño para detectar errores de preparación. Pasa después a una entrada habitual y luego a tu límite realmente necesario. Si el programa trunca los datos, conserva menos tokens o se salta una parte del corpus, el caso que se sostiene no valida la carga anunciada. Anota las dimensiones que se ejecutan realmente.
Registra el pico por fase y por GPU con su contador. La memoria asignada a los tensores y la memoria reservada por el asignador de PyTorch no se suman. Una lectura del sistema puede abarcar más que el proceso instrumentado. Si se contemplan varios lotes, documenta su reparto por software; dos tarjetas no forman automáticamente un único espacio de memoria.
Fuentes técnicas: PyTorch — gestión de memoria CUDA
Decidir tras el primer desbordamiento
Un fallo en la carga orienta hacia los pesos, el formato o una asignación transitoria. Un fallo en la generación exige examinar contexto y concurrencia. Un fallo en el paso hacia atrás puede orientar hacia microbatch, activaciones o estrategia de cálculo. Esta localización evita cambiar al azar precisión, modelo y datos a la vez.
Después de cada corrección, verifica la calidad y el alcance cubierto. Reducir la longitud necesaria puede ser inaceptable; cambiar la cuantización puede modificar salidas. Si se requiere otra capacidad, vuelve al catálogo con una ficha que precise el pico observado, el margen justificado, las versiones y las entradas límite. Un margen sin motivo no es más fiable que un resultado redondeado al GB.
Una breve selección, bajo los mismos requisitos
Para la inferencia ilustrativa de 7 mil millones de parámetros a 16 bits y 6 GiB de reserva, el ejemplo práctico da 19,04 GiB. Puedes examinar la RTX 4090 de 24 GB o la RTX 6000 Ada de 48 GB. Sus ofertas declaradas para un lote de una tarjeta durante 3 días son respectivamente de 47,14 USD y 55,71 USD. Son dos candidatos de capacidades diferentes: contexto, concurrencia, memoria realmente disponible, compatibilidad y calidad quedan por verificar. Estos precios no establecen ninguna clasificación de velocidad.
Para una adaptación, retoma la misma cuadrícula con los parámetros aprendidos y las fases adicionales: pasada hacia atrás, primera actualización, validación y exportación. El número de parámetros LoRA no basta para validar la memoria total. El recorrido de fine-tuning ayuda a cualificar el resultado; batch y acumulación sirven para documentar una actualización comparable.
Si buscas una alternativa tras un desbordamiento, localiza la fase culpable y mantén tus requisitos de salida. Compara un solo cambio a la vez: capacidad, caché, microbatch o precisión. Un formato diferente debe recuperar la calidad mínima fijada. Si tu necesidad exige una aplicación gestionada, una RAM concreta o una interconexión certificada, una ficha de GPU por sí sola deja la decisión por confirmar. Dos tarjetas exigen una colocación de software verificada; sus memorias no constituyen automáticamente un espacio único.
Fuentes técnicas: RTX 4090 — lote, capacidad y planes · RTX 6000 Ada — lote, capacidad y planes · Calidad tras la cuantización · Preparar una adaptación · Definir batch y acumulación
Conservar el cálculo con lo que lo confirma
Registra la hipótesis inicial, la tabla de partidas, el procedimiento y las mediciones brutas. Distingue estimación, contador medido y decisión comercial. El notebook IteraGPU Lab ayuda a comprender esta instrumentación en una red pequeña; no sustituye a una prueba de tu modelo. Los ejemplos numéricos de esta página son cálculos, sin caudal ni consumo de GPU supuestamente observados.
Una buena salida de dimensionamiento cabe en una ficha: modelo y revisión, tarea, precisión, longitud, microbatch o concurrencia, memoria por GPU y condiciones de medición. Añade lo que invalidaría la conclusión, por ejemplo una ventana más larga o una evaluación diferente. Así podrás elegir un plan correspondiente a la campaña, en lugar de rehacer toda la estimación con cada variante.
Preguntas prácticas
¿La reserva propuesta por la herramienta se calcula a partir de mi modelo?
No. La reserva es un valor elegido por ti. La herramienta no conoce ni la arquitectura ni las entradas de tu ejecución; úsala para hacer explícita tu hipótesis y luego contrástala con las fases medidas.
¿Por qué una envolvente inferior a 24 GB puede seguir fallando?
La estimación puede omitir partidas y usar GiB cuando la capacidad nominal se expresa en GB. También puede contar un pico transitorio, otro proceso o una entrada diferente. Compara unidades y perímetros, y luego localiza la fase que falla.
¿Puedo sumar las reservas y los dos picos de PyTorch?
No. El pico de los tensores asignados y el de memoria reservada no son dos partidas independientes que sumar. Pueden producirse picos separados en instantes distintos. Conserva sus nombres y usa el método de memoria para interpretarlos.
¿Puedo pedir una lista o una alternativa sin haber medido ya mi modelo?
Sí, para establecer candidatos condicionales. Describe la carga y las restricciones que deben permanecer idénticas. El cálculo de memoria y las fichas comerciales permiten una primera selección; los criterios obligatorios no verificados quedan por confirmar antes de quedarse con una oferta.