Definir o que varia e o que constitui uma repetição
Comece pela pergunta: você está avaliando o efeito da inicialização de um treinamento, da ordem dos dados, de uma divisão treino/teste ou de uma geração estocástica? Uma seed controla um gerador aleatório; ela não identifica por si só todas essas dimensões. Mantenha uma linha por execução e os fatores realmente modificados.
Reexecutar dez vezes a avaliação determinística do mesmo checkpoint no mesmo corpus não produz dez treinamentos independentes. Do mesmo modo, mil predições provenientes de um único modelo não substituem vários treinamentos para estimar sua variabilidade. Escolha a unidade de repetição correspondente à decisão.
Defina antes da série a métrica principal, seu sentido e o efeito mínimo que justificaria a mudança. Nos exemplos a seguir, um valor mais alto é preferível e o limiar útil ilustrativo é de 0,30 ponto em uma métrica exibida de 0 a 100. Esse limiar vem da decisão do projeto, não de uma regra estatística universal.
Emparelhar as configurações em condições comuns
Para um par i, execute a referência A e o candidato B na mesma divisão de dados e com as condições comuns previstas. Calcule então dᵢ = score(Bᵢ) − score(Aᵢ). O emparelhamento baseia-se em uma correspondência definida antes dos resultados; não consiste em associar depois os scores que se parecem.
Usar a mesma lista de seeds pode ajudar a organizar os pares, mas duas arquiteturas podem consumir os números aleatórios de forma diferente. Declare separadamente as seeds de inicialização, de dados e de geração quando seu código as distingue. Registre também as partições ou seus identificadores: um inteiro comum não prova que os dados foram percorridos da mesma maneira.
Se um par contém uma falha, mantenha os dois status e explique como ela será tratada. Não compare a média de cinco candidatos bem-sucedidos com a de seis referências sem sinalizar a mudança de população.
Fontes técnicas: NIST — correspondência entre observações emparelhadas
Manter os limites da seed e do determinismo
O PyTorch indica que resultados totalmente reprodutíveis não são garantidos entre versões, plataformas ou execuções de CPU e GPU, mesmo com uma seed idêntica. Seu guia distingue o controle dos geradores do controle das operações não determinísticas. Registre as versões e as opções aplicadas em vez de resumir o ambiente como "seed fixada".
Uma execução determinística serve, entre outras coisas, para reproduzir um comportamento sob determinadas condições. Ela não demonstra que o modelo resiste a outras inicializações ou dados. Inversamente, uma diferença entre duas reexecuções idênticas merece um diagnóstico antes de ser interpretada como o efeito do candidato.
Mantenha a mesma política de determinismo para as duas variantes. Se você a alterar para diagnosticar um erro, identifique essa série separadamente. O resultado experimental deve permanecer atrelado às condições em que foi obtido.
Fontes técnicas: PyTorch 2.14 — reprodutibilidade e controle do aleatório
Exemplo calculado: cinco diferenças emparelhadas
Aqui estão cinco pares fictícios destinados ao cálculo, sem treinamento executado. As seeds são identificadores de exemplo. A referência e o candidato usam aqui o mesmo protocolo de comparação. Os scores são expressos em 100; as diferenças são pontos, e não porcentagens relativas.
A média das diferenças vale (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 ponto. Sua mediana vale 0,30 ponto e sua amplitude vai de 0,10 a 0,50. O desvio-padrão amostral das diferenças vale aproximadamente 0,179 ponto, com denominador n − 1. Os cinco sinais são positivos, mas a amplitude permanece grande em relação ao ganho médio.
| Seed ilustrativa | Referência A | Candidato B | B − A |
|---|---|---|---|
| 17 | 71,0 | 71,4 | +0,4 |
| 29 | 71,6 | 71,9 | +0,3 |
| 43 | 71,3 | 71,4 | +0,1 |
| 71 | 70,8 | 71,3 | +0,5 |
| 101 | 71,8 | 71,9 | +0,1 |
Ler um intervalo sem lhe dar um alcance excessivo
Para ilustrar um cálculo usual, suponhamos que as diferenças sejam independentes entre os pares e provenham de uma distribuição aproximadamente normal. O intervalo de Student a 95% para sua média usa aqui quatro graus de liberdade: 0,28 ± 2,776 × 0,080, ou seja, aproximadamente [0,058; 0,502] ponto. Com apenas cinco pares, a forma da distribuição é difícil de avaliar; o cálculo não torna essas hipóteses verdadeiras.
Esse intervalo está acima de zero no exemplo, mas abrange o limiar útil fixado em 0,30 ponto. Portanto, ele não sustenta a regra exigente "o ganho médio supera 0,30 ponto". Uma diferença positiva pode continuar pequena ou incerta demais para justificar a mudança.
Um intervalo de 95% descreve um procedimento de cobertura sob suas premissas, não uma probabilidade de 95% ligada ao parâmetro após o cálculo. Aqui ele cobre apenas a variação representada pelos pares, não automaticamente outro domínio, outro corpus ou hardware futuro.
Se você usa SciPy, ttest_rel compara amostras pareadas e oferece um intervalo de confiança. A ordem dos arrays define o sinal: para B − A, coloque B primeiro. Guarde os valores e o método utilizado, não apenas um p-value.
Fontes técnicas: NIST — intervalo de confiança para uma média · SciPy 1.18 — ttest_rel e intervalo das diferenças
Preparar a decisão e as próximas repetições
O resultado do exemplo é "ganho útil não estabelecido", não "candidato inútil". Dependendo do custo da mudança, você pode manter a referência, continuar a coleta ou testar uma modificação mais substancial. Anuncie essa regra antes de ter a série diante dos olhos. Um limite inferior acima do seu limiar útil sustentaria mais a adoção, desde que o restante do protocolo seja válido.
Planeje as repetições a partir da precisão necessária e da variabilidade esperada, com uma reserva para falhas. Não existe um número de sementes que garanta universalmente uma conclusão. Um piloto pode ajudar a estimar a dispersão; mantenha seu status exploratório e depois fixe o procedimento de confirmação.
Evite olhar após cada par e parar assim que o resultado ficar favorável usando um intervalo previsto para um tamanho de amostra fixo. Escolha um tamanho de amostra e uma análise com antecedência, ou um método sequencial adequado. Adicionar ensaios apenas ao candidato decepcionante também altera o equilíbrio da comparação.
Não confundir variabilidade de treinamento e avaliação do corpus
Uma série de sementes em um conjunto de teste fixo informa a variação dos treinamentos nesse conjunto. Ela não mede por si só a incerteza ligada à escolha dos exemplos de teste. Se sua pergunta também envolve as partições ou os domínios, preveja um plano que varie essas dimensões sem misturá-las em um único contador de repetições.
Mantenha uma avaliação final à parte das escolhas de modelos. Selecionar entre muitas variantes com o mesmo teste favorece as opções que parecem boas ali por acaso. Os subgrupos e métricas complementares devem esclarecer a decisão, com seu número e status exploratório visíveis.
A saída final reúne os scores brutos, os pares, as diferenças, a dispersão, o método de intervalo e a decisão diante do limiar útil. Anexe as falhas e os limites de generalização. Você pode então explicar por que a diferença lhe parece suficiente, insuficiente ou ainda indecidível.
Fontes técnicas: scikit-learn — manter o teste fora das escolhas de modelo
Perguntas práticas
Cinco sementes bastam para escolher?
Cinco sementes podem servir para uma primeira observação, mas não garantem precisão suficiente. O número necessário depende da variabilidade e do menor efeito útil. Examine as diferenças brutas e a incerteza; um resultado ainda indecidível pede um protocolo melhor dimensionado, não um número mágico.
Um intervalo que contém zero prova equivalência?
Um intervalo que contém zero não prova equivalência. Ele também pode ser compatível com ganhos ou perdas importantes. Para sustentar uma equivalência prática, fixe com antecedência uma margem aceitável e use uma análise adequada a essa questão, com precisão suficiente para examiná-la.
Posso publicar apenas a melhor semente?
A melhor semente descreve uma seleção favorável, não o desempenho típico do procedimento. Publique o conjunto das repetições previstas e a regra de seleção do modelo entregue. Se esse melhor modelo precisar ser avaliado, use uma avaliação final que não tenha servido para escolhê-lo.