Definir qué varía y qué constituye una repetición
Empieza por la pregunta: ¿evalúas el efecto de la inicialización de un entrenamiento, del orden de los datos, de una división train/test o de una generación estocástica? Una semilla controla un generador aleatorio; por sí sola no identifica todas esas dimensiones. Conserva una línea por ejecución y los factores realmente modificados.
Repetir diez veces la evaluación determinista del mismo checkpoint sobre el mismo corpus no produce diez entrenamientos independientes. Del mismo modo, mil predicciones procedentes de un solo modelo no sustituyen a varios entrenamientos para estimar su variabilidad. Elige la unidad de repetición que corresponda a la decisión.
Fija antes de la serie la métrica principal, su sentido y el efecto mínimo que justificaría el cambio. En los ejemplos siguientes, un valor más alto es preferible y el umbral útil ilustrativo es de 0,30 puntos en una métrica mostrada de 0 a 100. Este umbral proviene de la decisión del proyecto, no de una regla estadística universal.
Emparejar las configuraciones sobre condiciones comunes
Para un par i, ejecuta la referencia A y el candidato B sobre la misma división de datos y con las condiciones comunes previstas. Calcula después dᵢ = score(Bᵢ) − score(Aᵢ). El emparejamiento se basa en una correspondencia definida antes de los resultados; no consiste en asociar después las puntuaciones que se parecen.
Usar la misma lista de semillas puede ayudar a organizar los pares, pero dos arquitecturas pueden consumir los números aleatorios de forma distinta. Declara por separado las semillas de inicialización, de datos y de generación cuando tu código las distinga. Registra también las particiones o sus identificadores: un entero común no demuestra que los datos se hayan recorrido de la misma manera.
Si un par contiene un fallo, conserva ambos estados y explica cómo se tratará. No compares la media de cinco candidatos exitosos con la de seis referencias sin señalar el cambio de población.
Fuentes técnicas: NIST — correspondencia entre observaciones emparejadas
Conservar los límites de la semilla y del determinismo
PyTorch indica que no se garantizan resultados totalmente reproducibles entre versiones, plataformas o ejecuciones de CPU y GPU, incluso con una semilla idéntica. Su guía distingue el control de los generadores y el de las operaciones no deterministas. Anota las versiones y las opciones aplicadas en lugar de resumir el entorno con «seed fijada».
Una ejecución determinista sirve, entre otras cosas, para reproducir un comportamiento en unas condiciones dadas. No demuestra que el modelo resista a otras inicializaciones o datos. A la inversa, una diferencia entre dos relanzamientos idénticos merece un diagnóstico antes de interpretarse como el efecto del candidato.
Mantén la misma política de determinismo para las dos variantes. Si la cambias para diagnosticar un error, identifica esa serie por separado. El resultado experimental debe permanecer ligado a las condiciones en las que se obtuvo.
Fuentes técnicas: PyTorch 2.14 — reproducibilidad y control de lo aleatorio
Ejemplo calculado: cinco diferencias emparejadas
Aquí tienes cinco pares ficticios destinados al cálculo, sin entrenamiento ejecutado. Las semillas son identificadores de ejemplo. La referencia y el candidato usan aquí el mismo protocolo de comparación. Las puntuaciones se expresan sobre 100; las diferencias son puntos, y no porcentajes relativos.
La media de las diferencias es (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 puntos. Su mediana es 0,30 puntos y su rango va de 0,10 a 0,50. La desviación típica muestral de las diferencias es de aproximadamente 0,179 puntos, con un denominador n − 1. Los cinco signos son positivos, pero la amplitud sigue siendo importante en relación con la ganancia media.
| Semilla ilustrativa | Referencia A | Candidato B | B − A |
|---|---|---|---|
| 17 | 71,0 | 71,4 | +0,4 |
| 29 | 71,6 | 71,9 | +0,3 |
| 43 | 71,3 | 71,4 | +0,1 |
| 71 | 70,8 | 71,3 | +0,5 |
| 101 | 71,8 | 71,9 | +0,1 |
Leer un intervalo sin darle un alcance excesivo
Para ilustrar un cálculo habitual, supongamos que las diferencias son independientes entre pares y proceden de una distribución aproximadamente normal. El intervalo de Student al 95 % para su media usa aquí cuatro grados de libertad: 0,28 ± 2,776 × 0,080, es decir, aproximadamente [0,058 ; 0,502] puntos. Con solo cinco pares, la forma de la distribución es difícil de apreciar; el cálculo no convierte esas suposiciones en verdaderas.
Ese intervalo está por encima de cero en el ejemplo, pero roza el umbral útil fijado en 0,30 puntos. Por lo tanto, no respalda la regla exigente «la ganancia media supera 0,30 puntos». Una diferencia positiva puede seguir siendo demasiado pequeña o demasiado incierta para justificar el cambio.
Un intervalo al 95 % describe un procedimiento de cobertura bajo sus supuestos, no una probabilidad del 95 % asociada al parámetro después del cálculo. Aquí solo cubre la variación representada por los pares, no automáticamente otro dominio, otro corpus o hardware futuro.
Si usas SciPy, ttest_rel compara muestras relacionadas y ofrece un intervalo de confianza. El orden de los arreglos fija el signo: para B − A, coloca B primero. Conserva los valores y el método utilizado, no solo un p-valor.
Fuentes técnicas: NIST — intervalo de confianza para una media · SciPy 1.18 — ttest_rel e intervalo de las diferencias
Preparar la decisión y las siguientes repeticiones
El resultado del ejemplo es «ganancia útil no establecida», no «candidato inútil». Según el costo del cambio, puedes conservar la referencia, seguir recopilando o probar una modificación más sustancial. Anuncia esta regla antes de tener la serie a la vista. Un límite inferior por encima de tu umbral útil respaldaría más la adopción, siempre que el resto del protocolo sea válido.
Planifica las repeticiones a partir de la precisión necesaria y la variabilidad esperada, con una reserva para los fallos. No existe un número de semillas que garantice universalmente una conclusión. Un piloto puede ayudar a estimar la dispersión; mantén su carácter exploratorio y luego fija el procedimiento de confirmación.
Evita mirar después de cada par y detenerte en cuanto el resultado se vuelva favorable usando un intervalo previsto para un tamaño fijo. Elige un tamaño y un análisis de antemano, o un método secuencial adecuado. Añadir ensayos solo al candidato decepcionante también altera el equilibrio de la comparación.
No confundir variabilidad de entrenamiento y evaluación del corpus
Una serie de semillas sobre un conjunto de test fijo informa sobre la variación de los entrenamientos en ese conjunto. Por sí sola no mide la incertidumbre ligada a la elección de los ejemplos de test. Si tu pregunta también abarca las particiones o los dominios, prevé un plan que varíe esas dimensiones sin mezclarlas en un solo contador de repeticiones.
Mantén una evaluación final al margen de las decisiones de modelo. Seleccionar entre muchas variantes con el mismo test favorece las opciones que parecen buenas por azar. Los subgrupos y métricas complementarias deben iluminar la decisión, con su número y su carácter exploratorio visibles.
La salida final reúne las puntuaciones brutas, los pares, las diferencias, la dispersión, el método de intervalo y la decisión frente al umbral útil. Adjunta los fallos y los límites de generalización. Entonces podrás explicar por qué la diferencia te parece suficiente, insuficiente o aún indecidible.
Fuentes técnicas: scikit-learn — mantener el test fuera de las decisiones de modelo
Preguntas prácticas
¿Bastan cinco semillas para elegir?
Cinco semillas pueden servir para una primera observación, pero no garantizan una precisión suficiente. El número necesario depende de la variabilidad y del menor efecto útil. Examina las diferencias brutas y la incertidumbre; un resultado aún indecidible exige un protocolo mejor dimensionado, no un número mágico.
¿Un intervalo que contiene cero prueba la equivalencia?
Un intervalo que contiene cero no prueba la equivalencia. También puede ser compatible con ganancias o pérdidas importantes. Para respaldar una equivalencia práctica, fija de antemano un margen aceptable y usa un análisis adecuado a esa pregunta, con suficiente precisión para examinarlo.
¿Puedo publicar solo la mejor semilla?
La mejor semilla describe una selección favorable, no el rendimiento típico del procedimiento. Publica el conjunto de las repeticiones previstas y la regla de selección del modelo entregado. Si ese mejor modelo debe evaluarse, usa una evaluación final que no haya servido para elegirlo.