Separar resolución y tamaño de batch
Un modelo de visión que funciona con imágenes pequeñas no predice directamente la huella de tus imágenes de trabajo. Construye primero una serie con batch constante y resoluciones crecientes, y después una serie con resolución fija y batches crecientes. Así podrás atribuir las diferencias. Mantén las mismas reglas de redimensionamiento y recorte: modificar el preprocesamiento puede cambiar la puntuación tanto como la elección del modelo.
Medir un entrenamiento o una adaptación completa
Los 48 GB dan más espacio que una tarjeta de 24 GB para las activaciones y los componentes auxiliares. Sin embargo, no definen un tamaño de modelo universalmente admisible. Mide la retropropagación si entrenas, todo el pipeline si produces embeddings, y las muestras más voluminosas si las formas varían. Anota el pico y los parámetros que lo provocaron.
Para una adaptación, compara la calidad en un conjunto reservado aparte de los ajustes. Aumentar el batch para ocupar toda la memoria no constituye, por sí solo, una mejora científica.
Ada y Ampere: una comparación con recetas constantes
La RTX 6000 Ada y la RTX A6000 tienen ambas 48 GB en este catálogo, pero pertenecen a arquitecturas diferentes. Mantén, por tanto, tus versiones de CUDA, PyTorch y bibliotecas lo más comparables posible. Verifica las extensiones compiladas para Ada y prueba la operación más especializada de tu modelo. La L40S constituye otra comparación de 48 GB; una RTX 4090 puede bastar si tus picos se mantienen dentro de su presupuesto de 24 GB.
Preparar los datos antes del plan
Tres días bastan para un mapeo resolución/batch. Siete días permiten adaptar y evaluar algunas variantes. Treinta días acompañan una campaña de visión con repeticiones y exportaciones organizadas. Prepara el manifiesto de las imágenes, sus divisiones y el script de evaluación antes de elegir la duración. El pedido reúne la configuración, el entorno deseado y tus datos de contacto; tu pago en cripto se sigue luego en el mismo expediente.