Özetlemeden önce çıktıları saklayın
Bir analiz, girdiler, referanslar ve tahminler arasındaki birleştirmeyle başlar. Beklenen her kimliğin tam olarak bir kez göründüğünü doğrulayın. Yanlış bir yanıtı tamamlanmamış bir istekten, bir kopyadan veya okunamayan bir çıktıdan ayırın. Bu sorunların çözümü aynı değildir ve bir ortalama hesaplanırken kaybolmamalıdır.
Ham çıktıyı normalleştirilmiş sürümünün, model revizyonunun, promptun, ayarların ve karar gerekçesinin yanında saklayın. Belirsiz bir tarihi sessizce dönüştüren bir dönüşüm yapay bir başarı yaratabilir. Keşfe doğrulama üzerinde başlayın. Son test bir sonraki düzeltmeyi icat etmeye hizmet ederse, ayrı tutulan yeni bir onay gerekli olacaktır.
Teknik kaynaklar: scikit-learn 1.9 — testi model seçimlerinden uzak tutun
Bir karışıklık matrisini sayılarıyla birlikte okuyun
Girdi başına tek kategori içeren bir sınıflandırma için matris, referans sınıfı ile tahmin edilen sınıfı çaprazlar. Burada ve scikit-learn'de kullanılan konvansiyonda satırlar referansı, sütunlar tahmini taşır. Normalleştirmeden önce ham sayıları saklayın: örnek sayısı olmadan bir yüzde, bir sonucun sağlamlığını abartabilir.
Aşağıdaki örnek kurgusaldır ve yalnızca aritmetiktir. Yüz talep Fatura, Erişim ve Silme arasında dağıtılmıştır. Köşegen 54 + 24 + 5 = 83 doğru yanıt içerir, yani %83. Bu toplam Silme sınıfını gizler: beklenen 10 talepten yalnızca 5'i tanınır. Bu sayıları hiçbir model veya GPU üretmemiştir.
| Referans | Tahmin: Fatura | Tahmin: Erişim | Tahmin: Silme | Gerçek toplam |
|---|---|---|---|---|
| Fatura | 54 | 5 | 1 | 60 |
| Erişim | 4 | 24 | 2 | 30 |
| Silme | 4 | 1 | 5 | 10 |
| Tahmin toplamı | 62 | 30 | 8 | 100 |
Teknik kaynaklar: scikit-learn 1.9 — karışıklık matrisinin tanımı
Kesinlik, duyarlılık ve pratik sonucu ilişkilendirin
Silme için kesinlik 5/8 = %62,5'tir: bu kategoriye gönderilen talepler arasında beşi doğrudur. Duyarlılık 5/10 = %50'dir: bu kategorideki taleplerin yarısı bulunur. F1 ise 2 × 5 / (2 × 5 + 3 + 5), yani yaklaşık %55,56'dır. Üç yanlış pozitif ve beş yanlış negatif farklı sorunları tanımlar.
Fatura, Erişim ve Silme sınıflarının F1 değerleri sırasıyla %88,52, %80 ve %55,56'dır. Bunların ağırlıksız ortalaması, yani makro-F1, yaklaşık %74,69'dur. Bu, %83 doğru yanıtı tamamlar ancak sayıların yerini almaz. Bir sınıf referanslarda veya tahminlerde yoksa bazı metrikler tanımsız olabilir: durumu bir ortalamanın içinde gizlemek yerine kullanılan konvansiyonu belirtin.
Teknik kaynaklar: scikit-learn 1.9 — kesinlik, duyarlılık, F1, ortalamalar ve sıfıra bölme
Eylemlere bağlı kısa bir taksonomi oluşturun
Bir hata kategorisi, neyin inceleneceğine karar vermeye yardımcı olmalıdır. Birkaç kategori, bir tanım ve temsili bir örnekle başlayın. Çift sayım yapmadan vakaları saymak için bir ana etiket, ardından birden fazla olgu bir arada bulunuyorsa ikincil etiketler ekleyin. Bir açıklamayı zorlamak yerine bir « incelenecek » kategorisi tutun.
Bu taksonomi otomatik bir teşhis değil, bir çalışma önerisidir. Kısaltılmış bir belge aynı zamanda bir referans belirsizliği de içerebilir. Bir etiketin sıklığı yeniden okunan vakaları tanımlar; henüz bir nedeni kanıtlamaz. Yorumunuzu destekleyen giriş pasajını koruyun ve gözlemlenen nedeni, hipotezi ve eksik bilgiyi birbirinden ayırın.
| Ana hata | İncelenmesi gerekenler | Olası sonraki deney |
|---|---|---|
| Eksik giriş | Kısaltma, eksik parça, hatalı birleştirme | Hazırlığı düzeltip aynı vakaları yeniden oynatın |
| Geçersiz biçim | Yasak alan veya kategori, ayrıştırma imkânsız | Çıktı sözleşmesini değiştirin ve içeriği de doğrulayın |
| Hatalı içerik | Yanlış alan, kategoriler arası karışıklık | Hedefli bir talimat veya örnek test edin |
| Tartışmalı referans | Belirsiz anotasyon, çelişkili talimat | Karar verin, ardından referansı tüm varyantlar için sürümleyin |
| Eksik yürütme | Durdurma, zaman aşımı, eksik sonuç | İşlem hattını ele alın; başarısızlığı bilançoda koruyun |
Çıkarım için alanları ve belgeleri sayın
Geçerli bir JSON biçimi, değerlerin doğru olduğunu garanti etmez. İzin verilen normalizasyonları belirleyin: kurallı tarih, ondalık ayırıcı, boşluklar veya kategori kodları. Eksik alanı, uydurulmuş değeri ve izin verilen çekimserliği birbirinden ayırın. Belgede bulunmayan bir değer, doldurma oranını artırmak için bir tahminle değiştirilmemelidir.
İşte sınıflandırma tablosundan bağımsız, açıklayıcı ikinci bir hesaplama. Elli belgenin her birinde üç beklenen alan vardır, yani 150 değer. 38 belgenin tamamen doğru, altısının iki alanı doğru ve altısının tek alanı doğru olduğunu varsayalım. Bu 38 × 3 + 6 × 2 + 6 × 1 = 132 doğru değer verir, yani %88. Ancak üç alan da zorunluysa belgelerin yalnızca 38/50 = %76'sı tamamen kabul edilebilirdir.
Yanlış 18 değer on iki belgeyi etkiliyor. Bunları on sekiz başarısız belge olarak sunmayın. Kullanıma bağlı olarak yararlı birim, doğrulanmış bir alan veya kabul edilmiş tam bir belge olacaktır; karşılaştırmadan önce bunu tanımlayın. Güçlüğün tarihlerden, tutarlardan veya kategorilerden kaynaklanıp kaynaklanmadığını bilmek için alan bazında sonuçları koruyun.
| Belge türü | Belgeler | Belge başına doğru alanlar | Toplam doğru alanlar |
|---|---|---|---|
| Tamamen doğru | 38 | 3 | 114 |
| Bir hata | 6 | 2 | 12 |
| İki hata | 6 | 1 | 6 |
| Toplam | 50 | — | 150 üzerinden 132 |
Bir kampanyayı yeniden başlatmadan önce düzeltmeyi seçin
Yalnızca satır sayısına göre değil, sonuca ve etkilenen kapsama göre önceliklendirin. Kurgusal matriste, proje bu kategoriyi kritik olarak tanımladıysa beş Silme hatası, altı Fatura hatasından önce bir incelemeyi hak edebilir. Bu öncelik projenin sözleşmesine aittir; tablo bir işletme ciddiyeti uydurmaya izin vermez.
Test edilebilir bir hipotez kurun: « Uzun girişler hazırlık sırasında belirleyici pasajı kaybediyor ». Bunu incelemeyi sağlayan bir değişiklik seçin, ardından geri kalanı sabit tutun. Aynı anda örnek eklemek, modeli değiştirmek ve bağlamı artırmak puanı iyileştirebilir, ancak artık etkiyi tek bir düzeltmeye atfetmeye izin vermez.
- Kriterin tutarlı biçimde uygulandığını doğrulamak için hataların yanı sıra birkaç başarıyı da yeniden okuyun.
- Varyantları aynı tanımlayıcılar ve referanslar üzerinde karşılaştırın; derlemdeki herhangi bir değişikliği ayrıca bildirin.
- Düzeltilmiş hataları, süregelen hataları, yeni hataları ve değişmeyen vakaları birbirinden ayırın.
- Gerilemeleri aramak için hedeflenen kategori dışındaki örnekleri de yeniden oynatın.
Gerilemeleri silmeden kazancı kontrol edin
Eşleştirilmiş bir hesaplama, net bir puanın neyi gizlediğini gösterir. Yüz kurgusal bilette, dokuz hatanın düzeltildiğini ancak dört eski başarının yanlışa dönüştüğünü varsayalım. Bilanço 83'ten 83 + 9 − 4 = 88 doğru yanıta geçer. Kazanç beş puandır ve incelenecek dört gerileme vardır. Bu, dokuz düzeltmenin karşılıksız elde edildiği anlamına gelmez.
Karar notu, önce/sonra tablolarını, düzeltilen vakaları, yeni hataları, düzeltme sürümünü ve geçilen kriterleri saklar. Kritik bir kural hâlâ ihlal ediliyorsa, daha yüksek bir ortalama varyantı kabul etmek için yeterli değildir. Maliyet ve süre daha sonra kabul edilebilir seçenekler arasında karşılaştırılır; reddedilen bir sonucu hızlandırmak kalite sorununu çözmez.
Sonucu yalnızca incelenenlerle sınırlayın
Göze çarpan bir hata her zaman temsil edici değildir. Özellikle uzun girdileri veya nadir bir kategorinin başarısızlıklarını yeniden inceliyorsanız, bu seçim biçimini belirtin ve bunların sıklıklarını tüm derlemin sıklıkları gibi sunmayın. Karara bağlanmamış vakaları da saklayın: bunlar değerlendirmenizdeki bir belirsizliği tanımlar.
Analiziniz, başka bir okuyucunun girdiyi bulabildiği, kararı anlayabildiği ve önerilen düzeltmeyi doğrulayabildiği zaman kullanılabilir. Bu, üretilen bir yanıtın iç nedenini ne de gelecekte garanti edilen bir kaliteyi kanıtlar. Düzeltme seçiminden sonra ayrı tutulan final setine geçin, ardından sınırlamaları sonuçla birlikte arşivleyin.
Pratik sorular
Genel skordaki bir artış bir varyantı seçmek için yeterli mi?
Hayır. Kritik kategorileri, yeni hataları ve kabul edilen tam çıktıları kontrol edin. Ortalama bir artış, projenin kriterini ihlal eden bir gerilemeyle birlikte var olabilir.
Model referansla çeliştiğinde referansı düzeltmeli miyim?
Önce girdiyi ve anotasyon talimatını kontrol edin. Referans hatalıysa, karara bağlayın ve düzeltmeyi sürümleyin, ardından tüm varyantlara uygulayın. Yalnızca modelin anlaşmazlığı beklenen yanıtı değiştirmeyi haklı çıkarmaz.
Taksonomimin kategorilerini toplayabilir miyim?
Yalnızca her vaka bu sayım için dışlayıcı bir ana kategoriye sahipse. İkincil etiketler çakışabilir; bunların toplamı o zaman farklı hataları değil, etiket oluşumlarını sayar.