Definir qué permitirá cerrar la campaña
«Entrenar un modelo» no define ni el trabajo que hay que comprar ni el momento en que está terminado. Prefiere un objetivo como comparar un testigo y dos variantes sobre un corpus fijado, y luego entregar sus predicciones, un análisis de los errores y un artefacto recargable. El resultado negativo puede bastar: mostrar que ninguna variante respeta el umbral evita una campaña más larga y mal orientada.
Separa tres categorías antes del pedido: indispensable para concluir, útil si el tiempo lo permite, exploratorio. El testigo, el control de los datos y una verificación de reanudación pertenecen generalmente a la primera. Fija un punto de decisión tras el piloto: continuar, reducir una variante facultativa o revisar la pregunta. El forfait disponible no debe convertirse en la obligación de llenar cada hora.
Construir un calendario de principio a fin
Una extrapolación a partir de un paso de entrenamiento ya en marcha a veces olvida la carga, las entradas largas, la validación y los archivos de salida. Distingue los intervalos en los que la máquina está movilizada y el tiempo humano de preparación. Intervalos independientes pueden solaparse; dos etapas que utilizan la misma GPU no se vuelven paralelas porque tengan dos líneas en una tabla.
Este es un calendario ilustrativo, sin velocidad de GPU medida. Reserva 48 horas secuenciales desde el inicio de la preparación hasta la recuperación de los resultados. Dentro de una ventana de 72 horas, deja 24 horas sin comprometer. Esta resta solo verifica el calendario: ni la instalación ni una variante de diez horas son plazos prometidos por IteraGPU.
| Etapa | Horas previstas | Resultado esperado |
|---|---|---|
| Preparación de las entradas y del entorno | 4 | Versiones, archivos y rutas verificados |
| Piloto completo | 2 | Carga, actualización, validación y copia de seguridad |
| Referencia | 8 | Salidas y métricas del testigo |
| Dos variantes prioritarias | 20 | Dos pasadas completas, 10 h reservadas para cada una |
| Evaluación y lectura de los errores | 6 | Criterio de aceptación aplicado |
| Exportación y control de relectura | 2 | Carpeta recuperable |
| Reanudación prevista | 6 | Margen asignado a un incidente |
| Total | 48 | 24 h restantes en una ventana de 3 días |
Comparar los planes sin inventar una facturación por hora
El precio de un lote cubre la duración seleccionada. Una RTX 4090 del catálogo cuesta 47,14 USD por tres días, 110 USD por siete días y 390 USD por treinta días. Estos montos son las tarifas de IteraGPU; no miden el número de modelos entrenados. Dos lotes de tres días representan 94,28 USD. El lote B200 ya incluye dos GPU: su composición no multiplica una segunda vez su precio.
Si el calendario ilustrativo se alarga 30 horas, alcanza las 78 horas y supera los tres días en seis horas. Examina entonces el plan de siete días, o un protocolo reducido que aún responda a la pregunta. Comprar dos lotes puede ayudar a variantes independientes si tu entorno lo permite; eso no acorta automáticamente una ejecución ni fusiona las memorias.
Fuentes técnicas: Tarifas de IteraGPU y unidades de alquiler · Calcular los planes y verificar la ventana
Priorizar las variantes por su utilidad para la decisión
Después del piloto, actualiza tus hipótesis de duración y pregúntate qué resultado cambiaría la elección. Una variante casi idéntica al testigo puede ser menos informativa que un control que aísla una causa. Evita lanzar de golpe todas las combinaciones de rango, precisión, tasa de aprendizaje y longitud. La guía de ablaciones muestra cómo plantear un pequeño plan interpretable.
Inscribe la regla de parada antes de las pruebas: pérdida no finita, calidad por debajo de un umbral, entrada indispensable truncada o ausencia de reanudación utilizable. Si la parada ocurre, conserva su identificador y su motivo. Una ejecución interrumpida no se convierte en un entregable aceptado, pero sigue siendo un gasto y a veces una información decisiva. Una nueva configuración tras la corrección merece un nuevo identificador.
Prever el costo de una interrupción
Reanudar un entrenamiento requiere más que los pesos solos. La documentación de PyTorch distingue los parámetros del modelo y el estado del optimizador; también debe conservarse el progreso. Según el bucle, añade los estados necesarios del planificador, del scaler, de los aleatorios y del recorrido de los datos. Decide si quieres reanudar el aprendizaje o simplemente relanzar una inferencia.
Prueba una copia de seguridad temprana y luego su recarga en un nuevo proceso. Cuenta el tiempo de escritura, de transferencia y de restauración en el calendario. Un intervalo de copia de seguridad no se elige únicamente para producir muchos archivos: acerca la pérdida de trabajo tolerable y el costo observado de la operación. Verifica también dónde viven esos archivos y cómo los recuperarás antes del fin del periodo.
Fuentes técnicas: PyTorch — copia de seguridad y reanudación
Reportar el presupuesto al resultado útil
Al cierre, indica el plan comprometido, los demás gastos realmente incluidos y el número de entregables que pasaron los controles anunciados. Los posibles gastos externos quedan separados del precio del alquiler; no inventes ni tasa de impuesto ni costo de transferencia no proporcionado. El costo de una campaña no se borra cuando su resultado es negativo.
Ejemplo aritmético condicional: si un plan de 47,14 USD permite entregar dos corpus distintos completos y aceptados, su parte de alquiler es de 23,57 USD por corpus. Repetir cinco veces el mismo corpus para cronometrar no da cinco corpus útiles. Con cero corpus aceptados, el ratio es indefinido; muestra el coste incurrido y la causa del rechazo, nunca un coste nulo. Para una decisión de investigación, describe mejor la conclusión obtenida en lugar de crear una unidad artificial.
Cerrar con archivos que puedas releer
Prepara el directorio de salida durante la campaña: manifiesto, parámetros, medidas brutas, predicciones, motivos de parada e instrucciones de recarga. Verifica los identificadores esperados, los archivos vacíos y las rutas que dependen de un directorio temporal. Para un adaptador, conserva la revisión exacta de la base. Un archivo presente pero imposible de recargar no es una salida verificada.
Compara lo previsto y lo realizado sin reescribir el plan inicial: tiempo reservado, tiempo constatado, desviaciones explicadas, decisiones tomadas. El cuaderno de IteraGPU puede conservar la síntesis y la referencia del pedido; tus archivos brutos y copias de seguridad quedan por organizar. La siguiente campaña arranca entonces con una mejor estimación y una lista más corta de incertidumbres.
Preguntas prácticas
¿Bastan tres días para mi campaña?
Tres días dan una ventana de 72 horas, no una promesa de rendimiento. Suma preparación, pruebas, evaluación, reanudaciones y recuperación; confirma las duraciones en un piloto representativo. Si el plan supera la ventana, reduce un trabajo opcional o plantéate una duración más larga.
¿Puedo repartir el precio entre mis experimentos?
Puedes definir un reparto analítico interno, por objetivo o tiempo movilizado. No cambia el plan del pedido. Documenta la regla e incluye los ensayos fallidos para evitar infravalorar el coste del resultado elegido.
¿Es siempre la mejor opción el más barato a tres días?
El precio solo decide entre configuraciones que ya cumplen la compatibilidad, la memoria y la calidad requeridas. Una oferta más barata que no termina la carga útil no responde a la misma decisión.