Zachowaj wyniki, zanim je podsumujesz
Analiza zaczyna się od połączenia wejść, odniesień i predykcji. Sprawdź, czy każdy oczekiwany identyfikator występuje dokładnie raz. Odróżnij niepoprawną odpowiedź od niedokończonego zapytania, duplikatu lub nieczytelnego wyniku. Te problemy mają różne rozwiązania i nie powinny znikać przy obliczaniu średniej.
Zachowaj surowy wynik obok jego znormalizowanej wersji, rewizję modelu, prompt, ustawienia i powód werdyktu. Konwersja, która po cichu przekształca niejednoznaczną datę, może stworzyć sztuczny sukces. Rozpocznij eksplorację od zbioru walidacyjnego. Jeśli ostateczny zbiór testowy posłuży do wymyślenia kolejnej poprawki, konieczne będzie nowe, odrębne potwierdzenie.
Źródła techniczne: scikit-learn 1.9 — trzymaj zbiór testowy z dala od wyborów modelu
Odczytaj macierz pomyłek wraz z jej liczebnościami
Dla klasyfikacji z jedną kategorią na wejście macierz zestawia klasę odniesienia z klasą przewidywaną. W stosowanej tu konwencji oraz w scikit-learn wiersze zawierają odniesienie, a kolumny predykcję. Zachowaj surowe liczebności przed normalizacją: procent bez liczby przykładów może wyolbrzymić solidność wniosku.
Poniższy przykład jest fikcyjny i wyłącznie arytmetyczny. Sto zgłoszeń rozdzielono między Faktura, Dostęp i Usunięcie. Przekątna zawiera 54 + 24 + 5 = 83 poprawne odpowiedzi, czyli 83%. Ten wynik ukrywa klasę Usunięcie: rozpoznano tylko 5 z 10 oczekiwanych zgłoszeń. Żaden model ani GPU nie wygenerowały tych liczb.
| Odniesienie | Przewidziano Faktura | Przewidziano Dostęp | Przewidziano Usunięcie | Razem rzeczywiste |
|---|---|---|---|---|
| Faktura | 54 | 5 | 1 | 60 |
| Dostęp | 4 | 24 | 2 | 30 |
| Usunięcie | 4 | 1 | 5 | 10 |
| Razem przewidziane | 62 | 30 | 8 | 100 |
Źródła techniczne: scikit-learn 1.9 — definicja macierzy pomyłek
Powiąż precyzję, czułość i praktyczne konsekwencje
Dla Usunięcia precyzja wynosi 5/8 = 62,5%: spośród zgłoszeń przypisanych do tej kategorii pięć jest poprawne. Czułość wynosi 5/10 = 50%: połowa zgłoszeń tej kategorii została odnaleziona. F1 wynosi 2 × 5 / (2 × 5 + 3 + 5), czyli około 55,56%. Trzy fałszywe trafienia i pięć fałszywych pominięć opisują różne problemy.
F1 klas Faktura, Dostęp i Usunięcie wynoszą odpowiednio 88,52%, 80% i 55,56%. Ich nieważona średnia, macro-F1, wynosi około 74,69%. Uzupełnia ona 83% poprawnych odpowiedzi, nie zastępując liczebności. Jeśli danej klasy brakuje w odniesieniach lub predykcjach, niektóre metryki mogą być niezdefiniowane: ogłoś stosowaną konwencję, zamiast ukrywać ten przypadek w średniej.
Źródła techniczne: scikit-learn 1.9 — precyzja, czułość, F1, średnie i dzielenie przez zero
Zbuduj krótką taksonomię powiązaną z działaniami
Kategoria błędów powinna pomagać zdecydować, co sprawdzić. Zacznij od kilku kategorii, definicji i reprezentatywnego przykładu. Dodaj główną etykietę, aby zliczać przypadki bez podwójnego liczenia, a następnie etykiety drugorzędne, jeśli współwystępuje kilka zjawisk. Zachowaj kategorię „do sprawdzenia” zamiast wymuszać wyjaśnienie.
Ta taksonomia to propozycja robocza, nie automatyczna diagnoza. Obcięty dokument może również zawierać niejednoznaczność odniesienia. Częstość etykiety opisuje przypadki ponownie przejrzane; nie dowodzi jeszcze przyczyny. Zachowaj fragment wejściowy, który wspiera twoją interpretację, i rozróżnij zaobserwowaną przyczynę, hipotezę oraz brakującą informację.
| Główny błąd | Co należy sprawdzić | Możliwy następny eksperyment |
|---|---|---|
| Niekompletne wejście | Obcięcie, brakujący element, błędne złożenie | Popraw przygotowanie, a następnie powtórz te same przypadki |
| Nieprawidłowy format | Zabronione pole lub kategoria, parsowanie niemożliwe | Zmień kontrakt wyjściowy i sprawdź także zawartość |
| Niepoprawna treść | Błędne pole, pomylenie kategorii | Przetestuj ukierunkowaną instrukcję lub przykład |
| Dyskusyjne odniesienie | Niejednoznaczna adnotacja, sprzeczna instrukcja | Rozstrzygnij, a następnie wersjonuj odniesienie dla wszystkich wariantów |
| Niekompletne wykonanie | Zatrzymanie, timeout, brakujący wynik | Zajmij się pipeline'em; zachowaj porażkę w podsumowaniu |
Przy ekstrakcji licz pola i dokumenty
Poprawny format JSON nie gwarantuje, że wartości są prawidłowe. Ustal dozwolone normalizacje: data kanoniczna, separator dziesiętny, spacje lub kody kategorii. Rozróżnij brakujące pole, wymyśloną wartość i dozwoloną abstynencję. Brakującej wartości w dokumencie nie wolno zastępować domysłem, aby poprawić współczynnik wypełnienia.
Oto drugie obliczenie ilustracyjne, niezależne od tabeli klasyfikacji. Pięćdziesiąt dokumentów ma każde po trzy oczekiwane pola, czyli 150 wartości. Załóżmy, że 38 dokumentów jest w pełni poprawnych, sześć ma dwa poprawne pola, a sześć jedno. Daje to 38 × 3 + 6 × 2 + 6 × 1 = 132 poprawne wartości, czyli 88%. Jednak tylko 38/50 = 76% dokumentów jest w pełni akceptowalnych, jeśli wymagane są wszystkie trzy pola.
18 niepoprawnych wartości dotyczy dwunastu dokumentów. Nie przedstawiaj ich jako osiemnastu wadliwych dokumentów. W zależności od zastosowania użyteczną jednostką będzie sprawdzone pole lub zaakceptowany kompletny dokument; zdefiniuj ją przed porównaniem. Zachowaj wyniki według pól, aby wiedzieć, czy trudność wynika z dat, kwot czy kategorii.
| Typ dokumentu | Dokumenty | Poprawne pola na dokument | Poprawne pola łącznie |
|---|---|---|---|
| W pełni poprawny | 38 | 3 | 114 |
| Jeden błąd | 6 | 2 | 12 |
| Dwa błędy | 6 | 1 | 6 |
| Razem | 50 | — | 132 ze 150 |
Wybierz poprawkę, zanim ponownie uruchomisz kampanię
Ustal priorytety według konsekwencji i objętego zakresu, nie tylko według liczby wierszy. W fikcyjnej macierzy pięć błędów kategorii Usunięcie może wymagać przeglądu przed sześcioma błędami kategorii Faktura, jeśli projekt zdefiniował tę kategorię jako krytyczną. Ten priorytet należy do kontraktu projektu; tabela nie pozwala wymyślić istotności biznesowej.
Sformułuj testowalną hipotezę: „Długie wejścia tracą decydujący fragment podczas przygotowania”. Wybierz modyfikację, która pozwala ją sprawdzić, a resztę pozostaw bez zmian. Jednoczesne dodanie przykładów, zmiana modelu i zwiększenie kontekstu może poprawić wynik, ale nie pozwala już przypisać efektu jednej poprawce.
- Przejrzyj kilka udanych przypadków oprócz błędów, aby sprawdzić, czy kryterium jest stosowane spójnie.
- Porównuj warianty na tych samych identyfikatorach i odniesieniach; osobno zgłaszaj każdą zmianę korpusu.
- Rozróżnij błędy poprawione, błędy trwałe, nowe błędy i przypadki niezmienione.
- Powtórz także przykłady spoza docelowej kategorii, aby szukać regresji.
Kontroluj zysk bez wymazywania regresji
Obliczenie parami pokazuje to, co ukrywa wynik netto. Na stu fikcyjnych zgłoszeniach wyobraź sobie dziewięć poprawionych błędów, ale cztery dawne sukcesy, które stały się błędne. Bilans zmienia się z 83 na 83 + 9 − 4 = 88 poprawnych odpowiedzi. Zysk wynosi pięć punktów, z czterema regresjami do sprawdzenia. Nie oznacza to, że dziewięć poprawek uzyskano bez przeciwwagi.
Notatka decyzyjna zachowuje tabele przed/po, poprawione przypadki, nowe błędy, wersję poprawki i spełnione kryteria. Jeśli krytyczna reguła pozostaje naruszona, wyższa średnia nie wystarcza, by zaakceptować wariant. Koszt i czas porównuje się następnie między dopuszczalnymi opcjami; przyspieszenie odrzuconego wyniku nie rozwiązuje problemu jakości.
Ogranicz wniosek do tego, co zostało zbadane
Spektakularny błąd nie musi być reprezentatywny. Jeśli przeglądasz głównie długie wpisy lub niepowodzenia rzadkiej kategorii, wskaż ten sposób selekcji i nie przedstawiaj ich częstości jako częstości całego korpusu. Zachowaj również przypadki nierozstrzygnięte: definiują one niepewność Twojej oceny.
Twoja analiza jest użyteczna, gdy inny czytelnik może odnaleźć wpis, zrozumieć werdykt i zweryfikować proponowaną poprawkę. Nie dowodzi ani wewnętrznej przyczyny wygenerowanej odpowiedzi, ani gwarantowanej przyszłej jakości. Przejdź do odłożonego zbioru finalnego po wyborze poprawki, a następnie zarchiwizuj ograniczenia wraz z wnioskiem.
Praktyczne pytania
Czy wzrost wyniku ogólnego wystarcza, by zatrzymać wariant?
Nie. Sprawdź kategorie krytyczne, nowe błędy i zaakceptowane pełne wyjścia. Wzrost średniej może współistnieć z regresją, która narusza kryterium projektu.
Czy mam poprawić referencję, gdy model jej przeczy?
Sprawdź najpierw wpis i instrukcję adnotacji. Jeśli referencja jest błędna, rozstrzygnij i wersjonuj poprawkę, a następnie zastosuj ją do wszystkich wariantów. Sama niezgodność modelu nie uzasadnia zmiany oczekiwanej odpowiedzi.
Czy mogę sumować kategorie mojej taksonomii?
Tylko jeśli każdy przypadek ma jedną wyłączną kategorię główną na potrzeby tego zliczenia. Etykiety drugorzędne mogą się nakładać; ich suma liczy wtedy wystąpienia etykiet, a nie odrębne błędy.