GPU para pesquisa ML · Pagamento crypto sem KYC
IteraGPU
Método / Qualidade e diagnóstico

Transformar uma pontuação em decisões verificáveis.

Analisar os erros consiste em recuperar os casos que explicam um resultado e, em seguida, escolher uma correção cujo efeito possa ser controlado. Mantenha as previsões com seus identificadores e sua referência, separe erros de formato e de conteúdo e examine as categorias importantes. Uma pontuação global não diz quais casos falham nem por quê. A próxima experiência correta corrige um mecanismo preciso sem mascarar novas regressões.

01 /

Conservar as saídas antes de resumi-las

Uma análise começa pela junção entre entradas, referências e previsões. Verifique se cada identificador esperado aparece exatamente uma vez. Distinga uma resposta incorreta de uma requisição não concluída, de uma duplicata ou de uma saída ilegível. Esses problemas não têm o mesmo remédio e não devem desaparecer no cálculo de uma média.

Mantenha a saída bruta junto de sua versão normalizada, a revisão do modelo, o prompt, os ajustes e o motivo do veredito. Uma conversão que transforma silenciosamente uma data ambígua pode criar um acerto artificial. Comece a exploração pela validação. Se o teste final servir para inventar a próxima correção, será necessária uma nova confirmação mantida à parte.

Fontes técnicas: scikit-learn 1.9 — manter o teste à parte das escolhas do modelo

02 /

Ler uma matriz de confusão com seus efetivos

Para uma classificação com uma categoria por entrada, a matriz cruza a classe de referência e a classe prevista. Na convenção usada aqui e no scikit-learn, as linhas trazem a referência e as colunas a previsão. Mantenha os efetivos brutos antes de normalizar: uma porcentagem sem o número de exemplos pode exagerar a solidez de uma conclusão.

O exemplo a seguir é fictício e apenas aritmético. Cem tickets são distribuídos entre Fatura, Acesso e Exclusão. A diagonal contém 54 + 24 + 5 = 83 respostas corretas, ou seja, 83 %. Esse total mascara a classe Exclusão: apenas 5 dos 10 tickets esperados são reconhecidos. Nenhum modelo ou GPU produziu esses números.

Exemplo ilustrativo — linhas: referência; colunas: previsão; unidade: tickets
ReferênciaPrevisto FaturaPrevisto AcessoPrevisto ExclusãoTotal real
Fatura545160
Acesso424230
Exclusão41510
Total previsto62308100

Fontes técnicas: scikit-learn 1.9 — definição da matriz de confusão

03 /

Relacionar precisão, recall e consequência prática

Para Exclusão, a precisão vale 5/8 = 62,5 %: entre os tickets enviados para essa categoria, cinco estão corretos. O recall vale 5/10 = 50 %: metade dos tickets dessa categoria é recuperada. O F1 vale 2 × 5 / (2 × 5 + 3 + 5), ou seja, aproximadamente 55,56 %. Os três falsos positivos e os cinco falsos negativos descrevem problemas diferentes.

Os F1 das classes Fatura, Acesso e Exclusão são respectivamente 88,52 %, 80 % e 55,56 %. Sua média não ponderada, o macro-F1, vale aproximadamente 74,69 %. Ela complementa os 83 % de respostas corretas, sem substituir os efetivos. Se uma classe estiver ausente das referências ou das previsões, algumas métricas podem ser indefinidas: anuncie a convenção utilizada em vez de esconder o caso em uma média.

Precisão = verdadeiros positivos / previsões positivas; recall = verdadeiros positivos / referências positivas. Macro-F1 = média dos F1 calculados separadamente por classe.

Fontes técnicas: scikit-learn 1.9 — precisão, recall, F1, médias e divisões por zero

04 /

Construir uma taxonomia curta, ligada a ações

Uma categoria de erro deve ajudar a decidir o que examinar. Comece com algumas categorias, uma definição e um exemplo representativo. Adicione uma etiqueta principal para contar os casos sem dupla contagem, depois etiquetas secundárias se vários fenômenos coexistirem. Mantenha uma categoria "a examinar" em vez de forçar uma explicação.

Esta taxonomia é uma proposta de trabalho, não um diagnóstico automático. Um documento truncado também pode conter uma ambiguidade de referência. A frequência de uma etiqueta descreve os casos relidos; ela ainda não demonstra uma causa. Conserve o trecho de entrada que sustenta sua interpretação e distinga causa observada, hipótese e informação ausente.

Taxonomia inicial a adaptar à tarefa
Erro principalO que examinarPróximo experimento possível
Entrada incompletaTruncamento, peça ausente, montagem incorretaCorrigir a preparação e reexecutar os mesmos casos
Formato inválidoCampo ou categoria proibida, parsing impossívelModificar o contrato de saída e verificar também o conteúdo
Conteúdo incorretoCampo errado, confusão entre categoriasTestar uma instrução ou um exemplo direcionado
Referência contestávelAnotação ambígua, instrução contraditóriaArbitrar e depois versionar a referência para todas as variantes
Execução incompletaParada, timeout, resultado ausenteTratar o pipeline; manter a falha no balanço
05 /

Para extração, contar os campos e os documentos

Um formato JSON válido não garante que os valores estão corretos. Fixe as normalizações permitidas: data canônica, separador decimal, espaços ou códigos de categorias. Distinga campo ausente, valor inventado e abstenção autorizada. Um valor ausente no documento não deve ser substituído por um palpite para melhorar a taxa de preenchimento.

Eis um segundo cálculo ilustrativo, independente da tabela de classificação. Cinquenta documentos possuem cada um três campos esperados, ou seja, 150 valores. Suponhamos 38 documentos totalmente corretos, seis com dois campos corretos e seis com apenas um. Isso dá 38 × 3 + 6 × 2 + 6 × 1 = 132 valores corretos, ou seja, 88%. No entanto, apenas 38/50 = 76% dos documentos são totalmente aceitáveis se os três campos forem obrigatórios.

Os 18 valores incorretos afetam doze documentos. Não os apresente como dezoito documentos falhos. Conforme o uso, a unidade útil será um campo verificado ou um documento completo aceito; defina-a antes da comparação. Mantenha os resultados por campo para saber se a dificuldade vem das datas, dos valores ou das categorias.

Extração fictícia — três campos obrigatórios em cada um dos 50 documentos
Tipo de documentoDocumentosCampos corretos por documentoCampos corretos no total
Totalmente correto383114
Um erro6212
Dois erros616
Total50—132 de 150
06 /

Escolher a correção antes de relançar uma campanha

Priorize conforme a consequência e o escopo afetado, não apenas conforme o número de linhas. Na matriz fictícia, os cinco erros de Exclusão podem merecer uma revisão antes dos seis erros de Fatura se o projeto tiver definido essa categoria como crítica. Essa prioridade pertence ao contrato do projeto; a tabela não permite inventar uma gravidade de negócio.

Formule uma hipótese testável: "Entradas longas perdem o trecho decisivo durante a preparação". Escolha uma modificação que permita examiná-la e depois mantenha o restante constante. Adicionar exemplos, trocar de modelo e aumentar o contexto ao mesmo tempo pode melhorar o score, mas não permite mais atribuir o efeito a uma única correção.

  • Reler alguns acertos além dos erros, para verificar se o critério é aplicado de forma coerente.
  • Comparar as variantes nos mesmos identificadores e referências; sinalizar separadamente qualquer alteração do corpus.
  • Distinguir erros corrigidos, erros persistentes, novos erros e casos inalterados.
  • Reexecutar também exemplos fora da categoria alvo para procurar regressões.
07 /

Controlar o ganho sem apagar as regressões

Um cálculo pareado mostra o que um score líquido esconde. Nos cem tickets fictícios, imaginemos nove erros corrigidos, mas quatro acertos antigos que se tornaram falsos. O balanço passa de 83 para 83 + 9 − 4 = 88 respostas corretas. O ganho é de cinco pontos, com quatro regressões a examinar. Ele não significa que nove correções foram obtidas sem contrapartida.

O registro de decisão conserva as tabelas antes/depois, os casos corrigidos, os novos erros, a versão da correção e os critérios atingidos. Se uma regra crítica continuar sendo violada, uma média superior não basta para aceitar a variante. O custo e a duração são então comparados entre as opções admissíveis; acelerar um resultado rejeitado não resolve o problema de qualidade.

08 /

Limitar a conclusão ao que foi examinado

Um erro espetacular não é necessariamente representativo. Se você relê sobretudo as entradas longas ou as falhas de uma categoria rara, indique esse modo de seleção e não apresente suas frequências como as de todo o corpus. Conserve também os casos não arbitrados: eles definem uma incerteza da sua avaliação.

Sua análise é aproveitável quando outro leitor consegue reencontrar a entrada, entender o veredito e verificar a correção proposta. Ela não prova nem a causa interna de uma resposta gerada nem uma qualidade futura garantida. Passe para o conjunto final mantido à parte após a escolha da correção, e depois arquive os limites junto com a conclusão.

Perguntas práticas

Uma alta da pontuação global basta para reter uma variante?

Não. Verifique as categorias críticas, os novos erros e as saídas completas aceitas. Uma alta média pode coexistir com uma regressão que viola o critério do projeto.

Devo corrigir uma referência quando o modelo a contradiz?

Verifique primeiro a entrada e a instrução de anotação. Se a referência estiver errada, arbitre e versione a correção, e depois aplique-a a todas as variantes. A discordância do modelo sozinha não justifica mudar a resposta esperada.

Posso somar as categorias da minha taxonomia?

Somente se cada caso tiver uma categoria principal exclusiva para essa contagem. Rótulos secundários podem se sobrepor; sua soma conta então ocorrências de rótulos, não erros distintos.