Conservar las salidas antes de resumirlas
Un análisis comienza por la unión entre entradas, referencias y predicciones. Verifica que cada identificador esperado aparezca exactamente una vez. Distingue una respuesta incorrecta de una solicitud no terminada, de un duplicado o de una salida ilegible. Estos problemas no tienen el mismo remedio y no deben desaparecer al calcular una media.
Conserva la salida bruta junto a su versión normalizada, la revisión del modelo, el prompt, los ajustes y el motivo del veredicto. Una conversión que transforma silenciosamente una fecha ambigua puede crear un acierto artificial. Empieza la exploración en la validación. Si el test final sirve para inventar la siguiente corrección, será necesaria una nueva confirmación aparte.
Fuentes técnicas: scikit-learn 1.9 — mantener el test al margen de las decisiones del modelo
Leer una matriz de confusión con sus recuentos
Para una clasificación con una categoría por entrada, la matriz cruza la clase de referencia y la clase predicha. En la convención usada aquí y en scikit-learn, las filas llevan la referencia y las columnas la predicción. Conserva los recuentos brutos antes de normalizar: un porcentaje sin el número de ejemplos puede exagerar la solidez de una conclusión.
El siguiente ejemplo es ficticio y puramente aritmético. Cien tickets se reparten entre Factura, Acceso y Eliminación. La diagonal contiene 54 + 24 + 5 = 83 respuestas correctas, es decir, el 83 %. Este total oculta la clase Eliminación: solo se reconocen 5 de los 10 tickets esperados. Ningún modelo ni GPU ha producido estas cifras.
| Referencia | Predice Factura | Predice Acceso | Predice Eliminación | Total real |
|---|---|---|---|---|
| Factura | 54 | 5 | 1 | 60 |
| Acceso | 4 | 24 | 2 | 30 |
| Eliminación | 4 | 1 | 5 | 10 |
| Total predicho | 62 | 30 | 8 | 100 |
Fuentes técnicas: scikit-learn 1.9 — definición de la matriz de confusión
Relacionar precisión, exhaustividad y consecuencia práctica
Para Eliminación, la precisión vale 5/8 = 62,5 %: entre los tickets enviados a esta categoría, cinco son correctos. La exhaustividad vale 5/10 = 50 %: se recupera la mitad de los tickets de esta categoría. El F1 vale 2 × 5 / (2 × 5 + 3 + 5), es decir, aproximadamente el 55,56 %. Los tres falsos positivos y los cinco falsos negativos describen problemas distintos.
Los F1 de las clases Factura, Acceso y Eliminación son respectivamente 88,52 %, 80 % y 55,56 %. Su media no ponderada, el macro-F1, vale aproximadamente 74,69 %. Completa el 83 % de respuestas correctas, sin sustituir los recuentos. Si una clase está ausente de las referencias o de las predicciones, algunas métricas pueden quedar indefinidas: anuncia la convención utilizada en lugar de esconder el caso en una media.
Fuentes técnicas: scikit-learn 1.9 — precisión, exhaustividad, F1, medias y divisiones por cero
Construir una taxonomía breve, vinculada a acciones
Una categoría de error debe ayudar a decidir qué examinar. Empieza con unas pocas categorías, una definición y un ejemplo representativo. Añade una etiqueta principal para contar los casos sin doble conteo, y luego etiquetas secundarias si coexisten varios fenómenos. Mantén una categoría «a examinar» en lugar de forzar una explicación.
Esta taxonomía es una propuesta de trabajo, no un diagnóstico automático. Un documento truncado también puede contener una ambigüedad de referencia. La frecuencia de una etiqueta describe los casos releídos; todavía no demuestra una causa. Conserva el pasaje de entrada que respalda tu interpretación y distingue causa observada, hipótesis e información faltante.
| Error principal | Qué hay que examinar | Siguiente experimento posible |
|---|---|---|
| Entrada incompleta | Truncamiento, pieza ausente, ensamblaje incorrecto | Corregir la preparación y volver a ejecutar los mismos casos |
| Formato no válido | Campo o categoría prohibida, parsing imposible | Modificar el contrato de salida y verificar también el contenido |
| Contenido incorrecto | Campo erróneo, confusión entre categorías | Probar una consigna o un ejemplo específico |
| Referencia discutible | Anotación ambigua, consigna contradictoria | Arbitrar y luego versionar la referencia para todas las variantes |
| Ejecución incompleta | Detención, timeout, resultado faltante | Tratar el pipeline; conservar el fallo en el balance |
Para la extracción, contar los campos y los documentos
Un formato JSON válido no garantiza que los valores sean correctos. Fija las normalizaciones autorizadas: fecha canónica, separador decimal, espacios o códigos de categorías. Distingue campo faltante, valor inventado y abstención autorizada. Un valor ausente en el documento no debe sustituirse por una suposición para mejorar la tasa de llenado.
Aquí tienes un segundo cálculo ilustrativo, independiente de la tabla de clasificación. Cincuenta documentos tienen cada uno tres campos esperados, es decir, 150 valores. Supongamos 38 documentos completamente correctos, seis con dos campos correctos y seis con solo uno. Esto da 38 × 3 + 6 × 2 + 6 × 1 = 132 valores correctos, es decir, el 88 %. Sin embargo, solo 38/50 = 76 % de los documentos son completamente aceptables si se requieren los tres campos.
Los 18 valores incorrectos afectan a doce documentos. No los presentes como dieciocho documentos defectuosos. Según el uso, la unidad útil será un campo verificado o un documento completo aceptado; defínela antes de la comparación. Conserva los resultados por campo para saber si la dificultad viene de las fechas, los importes o las categorías.
| Tipo de documento | Documentos | Campos correctos por documento | Campos correctos en total |
|---|---|---|---|
| Completamente correcto | 38 | 3 | 114 |
| Un error | 6 | 2 | 12 |
| Dos errores | 6 | 1 | 6 |
| Total | 50 | — | 132 de 150 |
Elegir la corrección antes de relanzar una campaña
Prioriza según la consecuencia y el alcance afectado, no solo según el número de líneas. En la matriz ficticia, los cinco errores de Eliminación pueden merecer una revisión antes que los seis errores de Factura si el proyecto ha definido esa categoría como crítica. Esta prioridad pertenece al contrato del proyecto; la tabla no permite inventar una gravedad de negocio.
Formula una hipótesis comprobable: «Las entradas largas pierden el pasaje decisivo durante la preparación». Elige una modificación que permita examinarla, y luego mantén el resto constante. Añadir ejemplos al mismo tiempo, cambiar de modelo y aumentar el contexto puede mejorar la puntuación, pero ya no permite atribuir el efecto a una sola corrección.
- Releer algunos aciertos además de los errores, para verificar que el criterio se aplica de forma coherente.
- Comparar las variantes sobre los mismos identificadores y referencias; señalar por separado cualquier cambio del corpus.
- Distinguir errores corregidos, errores persistentes, nuevos errores y casos sin cambios.
- Volver a ejecutar también ejemplos fuera de la categoría objetivo para buscar regresiones.
Controlar la ganancia sin borrar las regresiones
Un cálculo emparejado muestra lo que oculta una puntuación neta. Sobre los cien tickets ficticios, imaginemos nueve errores corregidos pero cuatro aciertos antiguos que se volvieron incorrectos. El balance pasa de 83 a 83 + 9 − 4 = 88 respuestas correctas. La ganancia es de cinco puntos, con cuatro regresiones por examinar. No significa que se hayan obtenido nueve correcciones sin contrapartida.
La nota de decisión conserva las tablas antes/después, los casos corregidos, los nuevos errores, la versión del parche y los criterios superados. Si una regla crítica sigue infringiéndose, una media superior no basta para aceptar la variante. El coste y la duración se comparan después entre las opciones admisibles; acelerar un resultado rechazado no resuelve el problema de calidad.
Limitar la conclusión a lo que se ha examinado
Un error espectacular no es necesariamente representativo. Si revisas sobre todo las entradas largas o los fallos de una categoría poco frecuente, indica ese modo de selección y no presentes sus frecuencias como las de todo el corpus. Conserva también los casos no arbitrados: definen una incertidumbre de tu evaluación.
Tu análisis es aprovechable cuando otro lector puede recuperar la entrada, entender el veredicto y verificar la corrección propuesta. No demuestra ni la causa interna de una respuesta generada ni una calidad futura garantizada. Pasa al conjunto final apartado tras elegir el parche y, después, archiva los límites junto con la conclusión.
Preguntas prácticas
¿Basta una subida del score global para retener una variante?
No. Verifica las categorías críticas, los nuevos errores y las salidas completas aceptadas. Una subida media puede coexistir con una regresión que infringe el criterio del proyecto.
¿Debo corregir una referencia cuando el modelo la contradice?
Verifica primero la entrada y la consigna de anotación. Si la referencia es errónea, arbitra y versiona la corrección, y luego aplícala a todas las variantes. El desacuerdo del modelo por sí solo no justifica cambiar la respuesta esperada.
¿Puedo sumar las categorías de mi taxonomía?
Solo si cada caso tiene una categoría principal exclusiva para ese recuento. Las etiquetas secundarias pueden solaparse; su suma cuenta entonces ocurrencias de etiquetas, no errores distintos.