Conservar as saídas antes de resumi-las
Uma análise começa pela junção entre entradas, referências e previsões. Verifique se cada identificador esperado aparece exatamente uma vez. Distinga uma resposta incorreta de uma requisição não concluída, de uma duplicata ou de uma saída ilegível. Esses problemas não têm o mesmo remédio e não devem desaparecer no cálculo de uma média.
Mantenha a saída bruta junto de sua versão normalizada, a revisão do modelo, o prompt, os ajustes e o motivo do veredito. Uma conversão que transforma silenciosamente uma data ambígua pode criar um acerto artificial. Comece a exploração pela validação. Se o teste final servir para inventar a próxima correção, será necessária uma nova confirmação mantida à parte.
Fontes técnicas: scikit-learn 1.9 — manter o teste à parte das escolhas do modelo
Ler uma matriz de confusão com seus efetivos
Para uma classificação com uma categoria por entrada, a matriz cruza a classe de referência e a classe prevista. Na convenção usada aqui e no scikit-learn, as linhas trazem a referência e as colunas a previsão. Mantenha os efetivos brutos antes de normalizar: uma porcentagem sem o número de exemplos pode exagerar a solidez de uma conclusão.
O exemplo a seguir é fictício e apenas aritmético. Cem tickets são distribuídos entre Fatura, Acesso e Exclusão. A diagonal contém 54 + 24 + 5 = 83 respostas corretas, ou seja, 83 %. Esse total mascara a classe Exclusão: apenas 5 dos 10 tickets esperados são reconhecidos. Nenhum modelo ou GPU produziu esses números.
| Referência | Previsto Fatura | Previsto Acesso | Previsto Exclusão | Total real |
|---|---|---|---|---|
| Fatura | 54 | 5 | 1 | 60 |
| Acesso | 4 | 24 | 2 | 30 |
| Exclusão | 4 | 1 | 5 | 10 |
| Total previsto | 62 | 30 | 8 | 100 |
Fontes técnicas: scikit-learn 1.9 — definição da matriz de confusão
Relacionar precisão, recall e consequência prática
Para Exclusão, a precisão vale 5/8 = 62,5 %: entre os tickets enviados para essa categoria, cinco estão corretos. O recall vale 5/10 = 50 %: metade dos tickets dessa categoria é recuperada. O F1 vale 2 × 5 / (2 × 5 + 3 + 5), ou seja, aproximadamente 55,56 %. Os três falsos positivos e os cinco falsos negativos descrevem problemas diferentes.
Os F1 das classes Fatura, Acesso e Exclusão são respectivamente 88,52 %, 80 % e 55,56 %. Sua média não ponderada, o macro-F1, vale aproximadamente 74,69 %. Ela complementa os 83 % de respostas corretas, sem substituir os efetivos. Se uma classe estiver ausente das referências ou das previsões, algumas métricas podem ser indefinidas: anuncie a convenção utilizada em vez de esconder o caso em uma média.
Fontes técnicas: scikit-learn 1.9 — precisão, recall, F1, médias e divisões por zero
Construir uma taxonomia curta, ligada a ações
Uma categoria de erro deve ajudar a decidir o que examinar. Comece com algumas categorias, uma definição e um exemplo representativo. Adicione uma etiqueta principal para contar os casos sem dupla contagem, depois etiquetas secundárias se vários fenômenos coexistirem. Mantenha uma categoria "a examinar" em vez de forçar uma explicação.
Esta taxonomia é uma proposta de trabalho, não um diagnóstico automático. Um documento truncado também pode conter uma ambiguidade de referência. A frequência de uma etiqueta descreve os casos relidos; ela ainda não demonstra uma causa. Conserve o trecho de entrada que sustenta sua interpretação e distinga causa observada, hipótese e informação ausente.
| Erro principal | O que examinar | Próximo experimento possível |
|---|---|---|
| Entrada incompleta | Truncamento, peça ausente, montagem incorreta | Corrigir a preparação e reexecutar os mesmos casos |
| Formato inválido | Campo ou categoria proibida, parsing impossível | Modificar o contrato de saída e verificar também o conteúdo |
| Conteúdo incorreto | Campo errado, confusão entre categorias | Testar uma instrução ou um exemplo direcionado |
| Referência contestável | Anotação ambígua, instrução contraditória | Arbitrar e depois versionar a referência para todas as variantes |
| Execução incompleta | Parada, timeout, resultado ausente | Tratar o pipeline; manter a falha no balanço |
Para extração, contar os campos e os documentos
Um formato JSON válido não garante que os valores estão corretos. Fixe as normalizações permitidas: data canônica, separador decimal, espaços ou códigos de categorias. Distinga campo ausente, valor inventado e abstenção autorizada. Um valor ausente no documento não deve ser substituído por um palpite para melhorar a taxa de preenchimento.
Eis um segundo cálculo ilustrativo, independente da tabela de classificação. Cinquenta documentos possuem cada um três campos esperados, ou seja, 150 valores. Suponhamos 38 documentos totalmente corretos, seis com dois campos corretos e seis com apenas um. Isso dá 38 × 3 + 6 × 2 + 6 × 1 = 132 valores corretos, ou seja, 88%. No entanto, apenas 38/50 = 76% dos documentos são totalmente aceitáveis se os três campos forem obrigatórios.
Os 18 valores incorretos afetam doze documentos. Não os apresente como dezoito documentos falhos. Conforme o uso, a unidade útil será um campo verificado ou um documento completo aceito; defina-a antes da comparação. Mantenha os resultados por campo para saber se a dificuldade vem das datas, dos valores ou das categorias.
| Tipo de documento | Documentos | Campos corretos por documento | Campos corretos no total |
|---|---|---|---|
| Totalmente correto | 38 | 3 | 114 |
| Um erro | 6 | 2 | 12 |
| Dois erros | 6 | 1 | 6 |
| Total | 50 | — | 132 de 150 |
Escolher a correção antes de relançar uma campanha
Priorize conforme a consequência e o escopo afetado, não apenas conforme o número de linhas. Na matriz fictícia, os cinco erros de Exclusão podem merecer uma revisão antes dos seis erros de Fatura se o projeto tiver definido essa categoria como crítica. Essa prioridade pertence ao contrato do projeto; a tabela não permite inventar uma gravidade de negócio.
Formule uma hipótese testável: "Entradas longas perdem o trecho decisivo durante a preparação". Escolha uma modificação que permita examiná-la e depois mantenha o restante constante. Adicionar exemplos, trocar de modelo e aumentar o contexto ao mesmo tempo pode melhorar o score, mas não permite mais atribuir o efeito a uma única correção.
- Reler alguns acertos além dos erros, para verificar se o critério é aplicado de forma coerente.
- Comparar as variantes nos mesmos identificadores e referências; sinalizar separadamente qualquer alteração do corpus.
- Distinguir erros corrigidos, erros persistentes, novos erros e casos inalterados.
- Reexecutar também exemplos fora da categoria alvo para procurar regressões.
Controlar o ganho sem apagar as regressões
Um cálculo pareado mostra o que um score líquido esconde. Nos cem tickets fictícios, imaginemos nove erros corrigidos, mas quatro acertos antigos que se tornaram falsos. O balanço passa de 83 para 83 + 9 − 4 = 88 respostas corretas. O ganho é de cinco pontos, com quatro regressões a examinar. Ele não significa que nove correções foram obtidas sem contrapartida.
O registro de decisão conserva as tabelas antes/depois, os casos corrigidos, os novos erros, a versão da correção e os critérios atingidos. Se uma regra crítica continuar sendo violada, uma média superior não basta para aceitar a variante. O custo e a duração são então comparados entre as opções admissíveis; acelerar um resultado rejeitado não resolve o problema de qualidade.
Limitar a conclusão ao que foi examinado
Um erro espetacular não é necessariamente representativo. Se você relê sobretudo as entradas longas ou as falhas de uma categoria rara, indique esse modo de seleção e não apresente suas frequências como as de todo o corpus. Conserve também os casos não arbitrados: eles definem uma incerteza da sua avaliação.
Sua análise é aproveitável quando outro leitor consegue reencontrar a entrada, entender o veredito e verificar a correção proposta. Ela não prova nem a causa interna de uma resposta gerada nem uma qualidade futura garantida. Passe para o conjunto final mantido à parte após a escolha da correção, e depois arquive os limites junto com a conclusão.
Perguntas práticas
Uma alta da pontuação global basta para reter uma variante?
Não. Verifique as categorias críticas, os novos erros e as saídas completas aceitas. Uma alta média pode coexistir com uma regressão que viola o critério do projeto.
Devo corrigir uma referência quando o modelo a contradiz?
Verifique primeiro a entrada e a instrução de anotação. Se a referência estiver errada, arbitre e versione a correção, e depois aplique-a a todas as variantes. A discordância do modelo sozinha não justifica mudar a resposta esperada.
Posso somar as categorias da minha taxonomia?
Somente se cada caso tiver uma categoria principal exclusiva para essa contagem. Rótulos secundários podem se sobrepor; sua soma conta então ocorrências de rótulos, não erros distintos.