GPU para la investigación ML · Pago cripto sin KYC
IteraGPU
Método / Calidad y diagnóstico

Convertir una puntuación en decisiones verificables.

Analizar los errores consiste en recuperar los casos que explican un resultado y, después, elegir una corrección cuyo efecto pueda controlarse. Conserva las predicciones con sus identificadores y su referencia, separa los errores de formato y de contenido, y examina las categorías importantes. Una puntuación global no dice qué casos fallan ni por qué. El buen próximo experimento corrige un mecanismo concreto sin ocultar las nuevas regresiones.

01 /

Conservar las salidas antes de resumirlas

Un análisis comienza por la unión entre entradas, referencias y predicciones. Verifica que cada identificador esperado aparezca exactamente una vez. Distingue una respuesta incorrecta de una solicitud no terminada, de un duplicado o de una salida ilegible. Estos problemas no tienen el mismo remedio y no deben desaparecer al calcular una media.

Conserva la salida bruta junto a su versión normalizada, la revisión del modelo, el prompt, los ajustes y el motivo del veredicto. Una conversión que transforma silenciosamente una fecha ambigua puede crear un acierto artificial. Empieza la exploración en la validación. Si el test final sirve para inventar la siguiente corrección, será necesaria una nueva confirmación aparte.

Fuentes técnicas: scikit-learn 1.9 — mantener el test al margen de las decisiones del modelo

02 /

Leer una matriz de confusión con sus recuentos

Para una clasificación con una categoría por entrada, la matriz cruza la clase de referencia y la clase predicha. En la convención usada aquí y en scikit-learn, las filas llevan la referencia y las columnas la predicción. Conserva los recuentos brutos antes de normalizar: un porcentaje sin el número de ejemplos puede exagerar la solidez de una conclusión.

El siguiente ejemplo es ficticio y puramente aritmético. Cien tickets se reparten entre Factura, Acceso y Eliminación. La diagonal contiene 54 + 24 + 5 = 83 respuestas correctas, es decir, el 83 %. Este total oculta la clase Eliminación: solo se reconocen 5 de los 10 tickets esperados. Ningún modelo ni GPU ha producido estas cifras.

Ejemplo ilustrativo — filas: referencia; columnas: predicción; unidad: tickets
ReferenciaPredice FacturaPredice AccesoPredice EliminaciónTotal real
Factura545160
Acceso424230
Eliminación41510
Total predicho62308100

Fuentes técnicas: scikit-learn 1.9 — definición de la matriz de confusión

03 /

Relacionar precisión, exhaustividad y consecuencia práctica

Para Eliminación, la precisión vale 5/8 = 62,5 %: entre los tickets enviados a esta categoría, cinco son correctos. La exhaustividad vale 5/10 = 50 %: se recupera la mitad de los tickets de esta categoría. El F1 vale 2 × 5 / (2 × 5 + 3 + 5), es decir, aproximadamente el 55,56 %. Los tres falsos positivos y los cinco falsos negativos describen problemas distintos.

Los F1 de las clases Factura, Acceso y Eliminación son respectivamente 88,52 %, 80 % y 55,56 %. Su media no ponderada, el macro-F1, vale aproximadamente 74,69 %. Completa el 83 % de respuestas correctas, sin sustituir los recuentos. Si una clase está ausente de las referencias o de las predicciones, algunas métricas pueden quedar indefinidas: anuncia la convención utilizada en lugar de esconder el caso en una media.

Precisión = verdaderos positivos / predicciones positivas; exhaustividad = verdaderos positivos / referencias positivas. Macro-F1 = media de los F1 calculados por separado para cada clase.

Fuentes técnicas: scikit-learn 1.9 — precisión, exhaustividad, F1, medias y divisiones por cero

04 /

Construir una taxonomía breve, vinculada a acciones

Una categoría de error debe ayudar a decidir qué examinar. Empieza con unas pocas categorías, una definición y un ejemplo representativo. Añade una etiqueta principal para contar los casos sin doble conteo, y luego etiquetas secundarias si coexisten varios fenómenos. Mantén una categoría «a examinar» en lugar de forzar una explicación.

Esta taxonomía es una propuesta de trabajo, no un diagnóstico automático. Un documento truncado también puede contener una ambigüedad de referencia. La frecuencia de una etiqueta describe los casos releídos; todavía no demuestra una causa. Conserva el pasaje de entrada que respalda tu interpretación y distingue causa observada, hipótesis e información faltante.

Taxonomía de partida que hay que adaptar a la tarea
Error principalQué hay que examinarSiguiente experimento posible
Entrada incompletaTruncamiento, pieza ausente, ensamblaje incorrectoCorregir la preparación y volver a ejecutar los mismos casos
Formato no válidoCampo o categoría prohibida, parsing imposibleModificar el contrato de salida y verificar también el contenido
Contenido incorrectoCampo erróneo, confusión entre categoríasProbar una consigna o un ejemplo específico
Referencia discutibleAnotación ambigua, consigna contradictoriaArbitrar y luego versionar la referencia para todas las variantes
Ejecución incompletaDetención, timeout, resultado faltanteTratar el pipeline; conservar el fallo en el balance
05 /

Para la extracción, contar los campos y los documentos

Un formato JSON válido no garantiza que los valores sean correctos. Fija las normalizaciones autorizadas: fecha canónica, separador decimal, espacios o códigos de categorías. Distingue campo faltante, valor inventado y abstención autorizada. Un valor ausente en el documento no debe sustituirse por una suposición para mejorar la tasa de llenado.

Aquí tienes un segundo cálculo ilustrativo, independiente de la tabla de clasificación. Cincuenta documentos tienen cada uno tres campos esperados, es decir, 150 valores. Supongamos 38 documentos completamente correctos, seis con dos campos correctos y seis con solo uno. Esto da 38 × 3 + 6 × 2 + 6 × 1 = 132 valores correctos, es decir, el 88 %. Sin embargo, solo 38/50 = 76 % de los documentos son completamente aceptables si se requieren los tres campos.

Los 18 valores incorrectos afectan a doce documentos. No los presentes como dieciocho documentos defectuosos. Según el uso, la unidad útil será un campo verificado o un documento completo aceptado; defínela antes de la comparación. Conserva los resultados por campo para saber si la dificultad viene de las fechas, los importes o las categorías.

Extracción ficticia — tres campos requeridos en cada uno de los 50 documentos
Tipo de documentoDocumentosCampos correctos por documentoCampos correctos en total
Completamente correcto383114
Un error6212
Dos errores616
Total50—132 de 150
06 /

Elegir la corrección antes de relanzar una campaña

Prioriza según la consecuencia y el alcance afectado, no solo según el número de líneas. En la matriz ficticia, los cinco errores de Eliminación pueden merecer una revisión antes que los seis errores de Factura si el proyecto ha definido esa categoría como crítica. Esta prioridad pertenece al contrato del proyecto; la tabla no permite inventar una gravedad de negocio.

Formula una hipótesis comprobable: «Las entradas largas pierden el pasaje decisivo durante la preparación». Elige una modificación que permita examinarla, y luego mantén el resto constante. Añadir ejemplos al mismo tiempo, cambiar de modelo y aumentar el contexto puede mejorar la puntuación, pero ya no permite atribuir el efecto a una sola corrección.

  • Releer algunos aciertos además de los errores, para verificar que el criterio se aplica de forma coherente.
  • Comparar las variantes sobre los mismos identificadores y referencias; señalar por separado cualquier cambio del corpus.
  • Distinguir errores corregidos, errores persistentes, nuevos errores y casos sin cambios.
  • Volver a ejecutar también ejemplos fuera de la categoría objetivo para buscar regresiones.
07 /

Controlar la ganancia sin borrar las regresiones

Un cálculo emparejado muestra lo que oculta una puntuación neta. Sobre los cien tickets ficticios, imaginemos nueve errores corregidos pero cuatro aciertos antiguos que se volvieron incorrectos. El balance pasa de 83 a 83 + 9 − 4 = 88 respuestas correctas. La ganancia es de cinco puntos, con cuatro regresiones por examinar. No significa que se hayan obtenido nueve correcciones sin contrapartida.

La nota de decisión conserva las tablas antes/después, los casos corregidos, los nuevos errores, la versión del parche y los criterios superados. Si una regla crítica sigue infringiéndose, una media superior no basta para aceptar la variante. El coste y la duración se comparan después entre las opciones admisibles; acelerar un resultado rechazado no resuelve el problema de calidad.

08 /

Limitar la conclusión a lo que se ha examinado

Un error espectacular no es necesariamente representativo. Si revisas sobre todo las entradas largas o los fallos de una categoría poco frecuente, indica ese modo de selección y no presentes sus frecuencias como las de todo el corpus. Conserva también los casos no arbitrados: definen una incertidumbre de tu evaluación.

Tu análisis es aprovechable cuando otro lector puede recuperar la entrada, entender el veredicto y verificar la corrección propuesta. No demuestra ni la causa interna de una respuesta generada ni una calidad futura garantizada. Pasa al conjunto final apartado tras elegir el parche y, después, archiva los límites junto con la conclusión.

Preguntas prácticas

¿Basta una subida del score global para retener una variante?

No. Verifica las categorías críticas, los nuevos errores y las salidas completas aceptadas. Una subida media puede coexistir con una regresión que infringe el criterio del proyecto.

¿Debo corregir una referencia cuando el modelo la contradice?

Verifica primero la entrada y la consigna de anotación. Si la referencia es errónea, arbitra y versiona la corrección, y luego aplícala a todas las variantes. El desacuerdo del modelo por sí solo no justifica cambiar la respuesta esperada.

¿Puedo sumar las categorías de mi taxonomía?

Solo si cada caso tiene una categoría principal exclusiva para ese recuento. Las etiquetas secundarias pueden solaparse; su suma cuenta entonces ocurrencias de etiquetas, no errores distintos.