GPU para la investigación ML · Pago cripto sin KYC
IteraGPU
Método · Diseñar el experimento

Una ablación debe aislar una decisión.

Para planificar una ablación, define la modificación estudiada, una referencia que funcione y el resultado que cambiaría tu decisión. Compara las variantes sobre los mismos datos de evaluación y luego examina sus interacciones antes de acumular ganancias. El buen plan también reserva repeticiones y una confirmación: probar muchos ajustes una sola vez puede dejar menos certeza que una pregunta estrecha examinada correctamente.

01 /

Escribir una hipótesis que pueda ser refutada

«Mejorar el modelo» no precisa el experimento. Escribe más bien: «La ponderación de las clases mejora la calidad en las clases raras, sin superar la regresión admitida en las clases frecuentes». Nombra una métrica principal, los subgrupos importantes y el umbral de efecto útil. Fija también la restricción que sigue siendo prioritaria: memoria, plazo, cobertura de las entradas o simplicidad del modelo.

Distingue añadir y quitar. Añadir un componente a una referencia simple mide su aporte en ese contexto. Quitarlo de un sistema completo mide lo que pierde ese sistema. Ambas preguntas pueden producir respuestas diferentes cuando los componentes interactúan. Por lo tanto, tu conclusión debe precisar la referencia y el estado de los demás factores.

El entregable esperado es una decisión acompañada de una tabla de variantes, no solo una mejor puntuación. Antes de reservar los ensayos, escribe qué te haría conservar, descartar o profundizar en cada pista.

Fuentes técnicas: NIST — definir el objetivo del plan de experimentos

02 /

Construir un control y variantes interpretables

El control retoma el procedimiento de referencia, con sus versiones, sus datos y su regla de selección del checkpoint. Debe ser ejecutable en la campaña actual. Una métrica antigua sin predicciones ni protocolo completo puede servir de referencia, pero no sustituye automáticamente a ese control.

Para cada factor, declara exactamente los dos estados comparados. «Aumento activado» es demasiado vago: conserva la transformación, la probabilidad y los datos afectados. Describe los parámetros que permanecen comunes: preprocesamiento fuera del factor estudiado, splits, optimizador, presupuesto de entrenamiento y método de evaluación. Si los pasos de entrenamiento permanecen fijos pero los tokens procesados cambian, anota esa consecuencia.

Mantén el conjunto de test final fuera de las decisiones sobre variantes. Las transformaciones aprendidas y las decisiones de ajuste deben usar los datos previstos para ello. Una mejora obtenida tras ajustar el modelo con los errores del test ya no constituye una evaluación independiente.

Fuentes técnicas: scikit-learn — evitar fugas de datos

03 /

Dos factores exigen cuatro situaciones

Supongamos que estudias A, una ponderación de las clases, y B, una regla de aumento en el entrenamiento. Para ver su interacción, examina el control, A solo, B solo y A con B. Este plan de dos factores y dos niveles contiene cuatro configuraciones. Con k factores binarios, el plan completo contiene 2ᵏ configuraciones antes de las repeticiones: el número de ensayos crece rápido.

La siguiente tabla es un ejemplo numérico inventado para explicar el razonamiento. Sus puntuaciones no provienen de ningún entrenamiento. Representan medias ficticias de macro-F1 en una escala de 0 a 100; en un trabajo real, los valores individuales y su variabilidad siguen siendo indispensables.

Ejemplo ilustrativo de cuatro configuraciones — valores ficticios, no medidos
ConfiguraciónA: ponderaciónB : augmentationMacro-F1 ficticia, sobre 100
ControlNoNo70,0
A soloSíNo71,2
B soloNoSí70,8
A + BSíSí71,5

Fuentes técnicas: NIST — planes factoriales completos de dos niveles

04 /

Leer los efectos y su interacción

En este ejemplo, A aporta 1,2 puntos sin B, pero solo 0,7 puntos cuando B ya está activo. B aporta 0,8 puntos sin A y 0,3 puntos con A. La ganancia combinada es de 1,5 puntos, mientras que la suma de las dos ganancias aisladas vale 2,0 puntos. La diferencia de −0,5 puntos describe aquí una interacción no aditiva.

Este cálculo no establece ni su robustez ni una explicación del mecanismo. Te indica qué pregunta confirmar: ¿la adición de B al sistema que contiene A justifica su complejidad por solo 0,3 puntos en este ejemplo? Examina también los subgrupos previstos. Una misma media puede ocultar ganancias y pérdidas diferentes.

Compara estas diferencias en repeticiones emparejadas cuando tu protocolo lo permita. No elijas la mejor semilla de cada variante. Si el signo o la amplitud cambia mucho según los ensayos, la decisión sigue siendo incierta.

Diferencia ilustrativa respecto a la aditividad = puntuación(A+B) − puntuación(A) − puntuación(B) + puntuación(control) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 puntos.

Fuentes técnicas: NIST — combinaciones e interacciones en un plan factorial

05 /

Asignar el presupuesto a las decisiones importantes

Un cupo de ensayos es una herramienta de planificación, no una previsión de velocidad de GPU. Ejemplo: dispones de un presupuesto organizativo de 24 ejecuciones completas. Asignas 12 ejecuciones a las cuatro configuraciones con tres semillas cada una, 10 a una confirmación del control y de un candidato con cinco semillas nuevas, y 2 a repeticiones justificadas. El total es 24; nada dice todavía cuántas horas requerirán.

Las tres primeras semillas sirven aquí para explorar, no para certificar un ganador. Fija la regla de elección del candidato antes de observar esta serie. La confirmación utiliza el protocolo acordado; las nuevas semillas reducen la dependencia de la selección inicial, pero no corrigen un conjunto de test ya utilizado para ajustar el modelo.

Si el presupuesto no permite las repeticiones necesarias, reduce los factores o pospón una pregunta. Prioriza los cambios que afectan a una decisión real: eliminar un componente costoso, resolver un fallo o dirimir entre dos opciones cercanas. Reserva tiempo para la evaluación y los artefactos antes de comparar los planes.

Ejemplo de reparto de un presupuesto de 24 ejecuciones, sin duración supuesta
EtapaCálculoEjecuciones
Exploración4 configuraciones × 3 semillas12
Confirmación2 configuraciones × 5 semillas nuevas10
Repeticiones documentadasReserva2
Presupuesto total12 + 10 + 224
06 /

Preparar el orden y las reglas de parada

Escribe la lista de ensayos antes de lanzarlos, con identificador, configuración, semilla y prioridad. Distribuye las variantes en el orden de paso en lugar de terminar todos los controles y luego todos los candidatos. Si un periodo, un conjunto de datos o una máquina constituye un bloque de comparación, documenta ese bloque. Un cambio de entorno en mitad de la serie debe permanecer visible.

Prepara los motivos de parada técnicos, como errores repetidos o un desbordamiento de memoria. Conserva cada intento y su estado. No sustituyas en silencio un fallo por una ejecución más corta, ni un ensayo decepcionante por una nueva semilla hasta obtener la puntuación esperada.

Una parada anticipada decidida sobre las puntuaciones cambia el protocolo de análisis. Si prevés decisiones intermedias, anuncia sus reglas y su alcance exploratorio. Para una conclusión confirmatoria, mantén un plan de análisis adaptado a esas decisiones.

07 /

Cerrar la ablación con una conclusión verificable

La ficha final indica la hipótesis, el control, los factores, las repeticiones, las desviaciones y los casos de fallo. Relaciona cada valor con las predicciones y con el run que lo produjo. Termina con una decisión explícita: componente conservado, componente retirado, o datos insuficientes para elegir.

Evita tres atajos: atribuir un cambio a A cuando el preprocesamiento también cambió; sumar ganancias aisladas sin probar su combinación; anunciar una regla general a partir de un solo corpus. Una ablación establece una observación dentro de un protocolo definido. Su alcance depende de los datos, del modelo y de las variaciones realmente estudiadas.

Preguntas prácticas

¿Hay que probar siempre todas las combinaciones?

Un plan completo es útil para las interacciones, pero su coste aumenta con el número de factores. Delimita primero los factores que pueden cambiar tu decisión. Un plan reducido sigue siendo posible si explicitas los efectos que no permite separar; no presentes las combinaciones ausentes como probadas.

¿Puedo reutilizar el control de una campaña anterior?

Puedes reutilizarlo si los datos, el código, el presupuesto, la selección del modelo y la evaluación son realmente comparables y están documentados. Si no, vuelve a lanzar un control en el protocolo actual. Una diferencia de versión o de split puede explicar la desviación que intentabas atribuir al componente.

¿Un resultado negativo significa que el componente es inútil?

Un resultado negativo indica que no aporta el efecto buscado en las condiciones estudiadas, o que falta prueba. Verifica la incertidumbre y las interacciones antes de generalizar. Documentar este resultado evita volver a gastar presupuesto en una pista ya examinada.