GPU para la investigación ML · Pago cripto sin KYC
IteraGPU
Laboratorio / Ruta ML: cinco preguntas, cinco puntos de partida
IteraGPU / Investigación ML

¿Qué pregunta te bloquea hoy?

Desde la primera carga hasta los checkpoints, organiza los puntos que debes verificar antes de una campaña de cómputo. Encuentra guías para dimensionar, medir y conservar resultados aprovechables.

Elige la pregunta que te bloquea. Cada recorrido lleva a una decisión precisa; la biblioteca reúne el conjunto de las referencias.

Mi modelo aún no ha corrido. ¿Por dónde empezar?

Un presupuesto de memoria y las entradas de la primera prueba.

  1. Dimensionar la memoria GPU: cálculo, reservas y validación

    Calcula los pesos en GiB, construye una reserva explícita y valida el pico por fase. Ejemplos con cifras, trampas de cuantización y elección por tarjeta.

  2. Memoria GPU: explicar la diferencia entre la estimación y el pico

    Distingue pesos, caché y activaciones, mide allocated y reserved por fase y luego elige un margen con un notebook y un protocolo de PyTorch.

  3. Caché KV: calcular la memoria según contexto, GQA y batch

    Calcula la caché KV con las cabezas KV, el contexto y las secuencias simultáneas. Distingue GQA, precisión y caché estática antes de una prueba real.

El score mejora, pero ¿puedo confiar en él?

Un conjunto de evaluación aislado, errores revisados y una diferencia cualificada.

  1. Construir un conjunto de evaluación ML sin fuga de datos

    Separa grupos, duplicados y usos de los datos para construir un conjunto de evaluación ML reservado, controlable y adaptado a tu decisión.

  2. Analizar los errores de ML para elegir el próximo experimento

    Analiza los errores de clasificación y extracción: matriz de confusión, referencias, taxonomía, regresiones y control de la siguiente corrección.

  3. Variabilidad entre seeds: ¿es convincente una diferencia en ML?

    Interpreta las repeticiones en ML con semillas emparejadas, la dispersión y un umbral de efecto útil. Ejemplo calculado y límites de una muestra pequeña.

Estoy preparando un entrenamiento. ¿Qué hay que verificar antes de la serie?

Una actualización completa, un batch explícito y trazas aprovechables.

  1. Entrenamiento con GPU: validar el bucle antes de la campaña

    Prepara los datos, el batch y la reanudación de un entrenamiento. Un protocolo por fase para controlar memoria, gradientes, validación y archivos de salida.

  2. Microbatch y acumulación: calcular el batch efectivo

    Calcula el batch efectivo, normaliza la pérdida y verifica una acumulación de gradientes en una o varias tarjetas, con sus límites de equivalencia.

  3. Trazar tus experimentos ML: del run a la decisión

    Conecta datos, código, parámetros, predicciones y decisión con un manifiesto de experimento de ML. Ejemplo de control de runs y artefactos sin imponer ninguna herramienta.

Adaptar o comprimir el modelo: ¿cómo elegir una variante?

Una referencia, un cambio controlado y una calidad comparable.

  1. Fine-tuning: elegir una adaptación y verificar su aporte

    Prepara un fine-tuning con una referencia, datos separados y un control de recarga. LoRA, base cuantizada, presupuesto y análisis de las regresiones.

  2. Comparar cuantizaciones: memoria, calidad y costo útil

    Compara referencia, calibración, formato de los pesos y caché KV con los mismos datos. Mide memoria y calidad antes de decidir el presupuesto de GPU.

  3. Planificar ablaciones ML: control, efectos y presupuesto

    Construye un plan de ablación ML con control, factores, interacciones y presupuesto de ensayos. Un ejemplo calculado para priorizar las variantes y concluir.

El presupuesto es limitado. ¿Qué pruebas realizar primero?

Un orden de experimentos y el coste del forfait acercado a los resultados útiles.

  1. Presupuestar una campaña ML: ensayos, decisiones y forfait completo

    Descompón una campaña ML, prioriza las variantes y vincula el forfait de GPU a los resultados útiles, con un ejemplo de calendario y de presupuesto en USD.

  2. Planificar ablaciones ML: control, efectos y presupuesto

    Construye un plan de ablación ML con control, factores, interacciones y presupuesto de ensayos. Un ejemplo calculado para priorizar las variantes y concluir.

  3. Benchmark ML: comparar el coste con calidad equivalente

    Fija la calidad, mide el mismo corpus y compara el coste completo de los precios de GPU de 3, 7 o 30 días. Protocolo y tabla en bruto para descargar.