Escrever uma hipótese que possa ser contraditada
«Melhorar o modelo» não especifica o experimento. Escreva antes: «A ponderação das classes melhora a qualidade nas classes raras, sem ultrapassar a regressão admitida nas classes frequentes.» Nomeie uma métrica principal, os subgrupos importantes e o limiar de efeito útil. Defina também a restrição que permanece prioritária: memória, prazo, cobertura das entradas ou simplicidade do modelo.
Distinga adição e remoção. Adicionar um componente a uma referência simples mede sua contribuição nesse contexto. Removê-lo de um sistema completo mede o que esse sistema perde. As duas perguntas podem produzir respostas diferentes quando os componentes interagem. Sua conclusão deve, portanto, precisar a referência e o estado dos outros fatores.
O entregável esperado é uma decisão acompanhada de uma tabela das variantes, não apenas uma pontuação melhor. Antes de reservar os testes, escreva o que faria você manter, abandonar ou aprofundar cada pista.
Fontes técnicas: NIST — definir o objetivo do plano de experimento
Construir um controle e variantes interpretáveis
O controle retoma o procedimento de referência, com suas versões, seus dados e sua regra de seleção do checkpoint. Ele deve ser executável na campanha atual. Uma métrica antiga sem predições nem protocolo completo pode servir de referência, mas não substitui automaticamente esse controle.
Para cada fator, declare exatamente os dois estados comparados. «Aumento ativado» é vago demais: mantenha transformação, probabilidade e dados envolvidos. Descreva os parâmetros que permanecem comuns: pré-processamento fora do fator estudado, splits, otimizador, orçamento de treinamento e método de avaliação. Se as etapas de treinamento permanecem fixas mas os tokens processados mudam, anote essa consequência.
Mantenha o conjunto de teste final fora das escolhas de variantes. As transformações aprendidas e as decisões de ajuste devem usar os dados previstos para esse fim. Uma melhoria obtida após ajustar o modelo sobre os erros do teste deixa de constituir uma avaliação independente.
Fontes técnicas: scikit-learn — evitar vazamentos de dados
Dois fatores pedem quatro situações
Suponhamos que você estude A, uma ponderação das classes, e B, uma regra de aumento no treinamento. Para ver sua interação, examine o controle, A sozinho, B sozinho e A com B. Esse plano com dois fatores e dois níveis contém quatro configurações. Com k fatores binários, o plano completo contém 2ᵏ configurações antes das repetições: o número de testes cresce rápido.
A tabela a seguir é um exemplo numérico inventado para explicar o raciocínio. Suas pontuações não vêm de nenhum treinamento. Elas representam médias fictícias de macro-F1 em uma escala de 0 a 100; em um trabalho real, os valores individuais e sua variabilidade continuam indispensáveis.
| Configuração | A: ponderação | B : augmentation | Macro-F1 fictícia, sobre 100 |
|---|---|---|---|
| Controle | Não | Não | 70,0 |
| A sozinho | Sim | Não | 71,2 |
| B sozinho | Não | Sim | 70,8 |
| A + B | Sim | Sim | 71,5 |
Fontes técnicas: NIST — planos fatoriais completos com dois níveis
Ler os efeitos e sua interação
Neste exemplo, A contribui com 1,2 ponto sem B, mas apenas 0,7 ponto quando B já está ativo. B contribui com 0,8 ponto sem A e 0,3 ponto com A. O ganho combinado é de 1,5 ponto, enquanto a soma dos dois ganhos isolados vale 2,0 pontos. A diferença de −0,5 ponto descreve aqui uma interação não aditiva.
Esse cálculo não estabelece nem sua robustez nem uma explicação do mecanismo. Ele ensina qual pergunta confirmar: a adição de B ao sistema que contém A justifica sua complexidade por apenas 0,3 ponto neste exemplo? Examine também os subgrupos previstos. Uma mesma média pode mascarar ganhos e perdas diferentes.
Compare essas diferenças em repetições pareadas quando seu protocolo permitir. Não escolha a melhor seed de cada variante. Se o sinal ou a amplitude mudar fortemente entre os testes, a decisão permanece incerta.
Fontes técnicas: NIST — combinações e interações em um plano fatorial
Alocar o orçamento às decisões importantes
Um envelope de testes é uma ferramenta de planejamento, não uma previsão de velocidade da GPU. Exemplo: você dispõe de um orçamento organizacional de 24 execuções completas. Você destina 12 execuções às quatro configurações com três seeds cada, 10 a uma confirmação do controle e de um candidato com cinco novas seeds, e 2 a retomadas justificadas. O total dá 24; nada ainda diz quantas horas elas exigirão.
As três primeiras sementes servem aqui para explorar, não para certificar um vencedor. Defina a regra de escolha do candidato antes de observar essa série. A confirmação usa o protocolo estabelecido; as novas sementes reduzem a dependência da seleção inicial, mas não corrigem um conjunto de teste já usado para ajustar o modelo.
Se o envelope não permitir as repetições necessárias, reduza os fatores ou adie uma questão. Priorize as mudanças que afetam uma decisão real: remover um componente caro, resolver uma falha ou desempatar duas opções próximas. Reserve tempo para a avaliação e os artefatos antes de comparar os planos.
| Etapa | Cálculo | Execuções |
|---|---|---|
| Exploração | 4 configurações × 3 sementes | 12 |
| Confirmação | 2 configurações × 5 novas sementes | 10 |
| Repetições documentadas | Reserva | 2 |
| Envelope total | 12 + 10 + 2 | 24 |
Preparar a ordem e as regras de parada
Escreva a lista de ensaios antes de iniciá-los, com identificador, configuração, semente e prioridade. Distribua as variantes na ordem de passagem em vez de terminar todos os controles e depois todos os candidatos. Se um período, um conjunto de dados ou uma máquina constitui um bloco de comparação, documente esse bloco. Uma mudança de ambiente no meio da série deve permanecer visível.
Prepare os motivos de parada técnicos, como erros repetidos ou estouro de memória. Guarde cada tentativa e seu status. Não substitua silenciosamente uma falha por uma execução mais curta, nem um ensaio decepcionante por uma nova semente até obter a pontuação esperada.
Uma parada antecipada decidida com base nas pontuações altera o protocolo de análise. Se você prevê decisões intermediárias, anuncie suas regras e seu alcance exploratório. Para uma conclusão confirmatória, mantenha um plano de análise adaptado a essas decisões.
Encerrar a ablação com uma conclusão verificável
A ficha final indica a hipótese, o controle, os fatores, as repetições, os desvios e os casos de falha. Relacione cada valor às previsões e à execução que o produziu. Termine com uma decisão explícita: componente mantido, componente removido, ou dados insuficientes para escolher.
Evite três atalhos: atribuir uma mudança a A quando o pré-processamento também mudou; somar ganhos isolados sem testar sua combinação; anunciar uma regra geral a partir de um único corpus. Uma ablação estabelece uma observação em um protocolo definido. Seu alcance depende dos dados, do modelo e das variações efetivamente estudadas.
Perguntas práticas
É sempre necessário testar todas as combinações?
Um plano completo é útil para as interações, mas seu custo aumenta com o número de fatores. Delimite primeiro os fatores que podem mudar sua decisão. Um plano reduzido continua possível se você explicitar os efeitos que ele não permite separar; não apresente as combinações ausentes como testadas.
Posso reutilizar o controle de uma campanha anterior?
Você pode reutilizá-lo se dados, código, orçamento, seleção do modelo e avaliação forem realmente comparáveis e documentados. Caso contrário, refaça um controle no protocolo atual. Uma diferença de versão ou de split pode explicar o desvio que você buscava atribuir ao componente.
Um resultado negativo significa que o componente é inútil?
Um resultado negativo indica que ele não traz o efeito buscado nas condições estudadas, ou que falta evidência. Verifique a incerteza e as interações antes de generalizar. Documentar esse resultado evita gastar novamente o orçamento em uma pista já examinada.