Simpan keluaran sebelum merangkumnya
Sebuah analisis dimulai dari penggabungan antara masukan, referensi, dan prediksi. Pastikan setiap pengidentifikasi yang diharapkan muncul tepat satu kali. Bedakan jawaban yang salah dari permintaan yang tidak selesai, duplikat, atau keluaran yang tidak terbaca. Masalah-masalah ini tidak memiliki penawar yang sama dan tidak boleh hilang saat menghitung rata-rata.
Simpan keluaran mentah di samping versi normalisasinya, revisi model, prompt, pengaturan, dan alasan putusan. Konversi yang diam-diam mengubah tanggal ambigu dapat menciptakan keberhasilan artifisial. Mulailah eksplorasi pada validasi. Jika uji akhir digunakan untuk menemukan koreksi berikutnya, diperlukan konfirmasi baru yang disimpan terpisah.
Sumber teknis: scikit-learn 1.9 — menjaga uji tetap terpisah dari pilihan model
Membaca matriks konfusi beserta jumlahnya
Untuk klasifikasi satu kategori per masukan, matriks ini menyilangkan kelas referensi dan kelas prediksi. Dalam konvensi yang digunakan di sini dan di scikit-learn, baris memuat referensi dan kolom memuat prediksi. Simpan jumlah mentah sebelum menormalisasi: persentase tanpa jumlah contoh dapat melebih-lebihkan kekuatan suatu kesimpulan.
Contoh berikut bersifat fiktif dan semata-mata aritmetis. Seratus tiket terbagi antara Faktur, Akses, dan Penghapusan. Diagonal berisi 54 + 24 + 5 = 83 jawaban benar, yaitu 83 %. Total ini menyembunyikan kelas Penghapusan: hanya 5 dari 10 tiket yang diharapkan yang dikenali. Tidak ada model atau GPU yang menghasilkan angka-angka ini.
| Referensi | Prediksi Faktur | Prediksi Akses | Prediksi Penghapusan | Total aktual |
|---|---|---|---|---|
| Faktur | 54 | 5 | 1 | 60 |
| Akses | 4 | 24 | 2 | 30 |
| Penghapusan | 4 | 1 | 5 | 10 |
| Total prediksi | 62 | 30 | 8 | 100 |
Sumber teknis: scikit-learn 1.9 — definisi matriks konfusi
Menghubungkan presisi, recall, dan konsekuensi praktis
Untuk Penghapusan, presisi bernilai 5/8 = 62,5 %: di antara tiket yang dikirim ke kategori ini, lima di antaranya benar. Recall bernilai 5/10 = 50 %: separuh tiket dalam kategori ini berhasil ditemukan. F1 bernilai 2 × 5 / (2 × 5 + 3 + 5), yaitu sekitar 55,56 %. Tiga positif palsu dan lima negatif palsu menggambarkan masalah yang berbeda.
F1 untuk kelas Faktur, Akses, dan Penghapusan masing-masing adalah 88,52 %, 80 %, dan 55,56 %. Rata-rata tanpa pembobotannya, yakni macro-F1, bernilai sekitar 74,69 %. Angka ini melengkapi 83 % jawaban benar, tanpa menggantikan jumlahnya. Jika suatu kelas tidak ada dalam referensi atau prediksi, sebagian metrik dapat tidak terdefinisi: nyatakan konvensi yang digunakan alih-alih menyembunyikan kasus tersebut dalam sebuah rata-rata.
Sumber teknis: scikit-learn 1.9 — presisi, recall, F1, rata-rata, dan pembagian dengan nol
Membangun taksonomi singkat yang terkait dengan tindakan
Sebuah kategori kesalahan harus membantu memutuskan apa yang perlu diperiksa. Mulailah dengan beberapa kategori, satu definisi, dan satu contoh yang representatif. Tambahkan satu label utama untuk menghitung kasus tanpa penghitungan ganda, lalu label sekunder jika beberapa fenomena muncul bersamaan. Pertahankan kategori "perlu diperiksa" daripada memaksakan suatu penjelasan.
Taksonomi ini adalah proposal kerja, bukan diagnosis otomatis. Dokumen yang terpotong juga bisa mengandung ambiguitas referensi. Frekuensi suatu label menggambarkan kasus yang ditinjau ulang; hal itu belum membuktikan suatu penyebab. Simpan bagian masukan yang mendukung interpretasi Anda dan bedakan antara penyebab yang diamati, hipotesis, dan informasi yang hilang.
| Kesalahan utama | Yang perlu diperiksa | Eksperimen berikutnya yang mungkin |
|---|---|---|
| Masukan tidak lengkap | Pemotongan, bagian yang hilang, penggabungan yang salah | Perbaiki persiapan lalu jalankan ulang kasus yang sama |
| Format tidak valid | Bidang atau kategori yang dilarang, parsing tidak mungkin dilakukan | Ubah kontrak keluaran dan periksa juga isinya |
| Konten salah | Bidang yang salah, kebingungan antar kategori | Uji satu instruksi atau contoh yang tertarget |
| Referensi yang diperdebatkan | Anotasi ambigu, instruksi yang bertentangan | Putuskan lalu versikan referensi untuk semua varian |
| Eksekusi tidak lengkap | Berhenti, timeout, hasil yang hilang | Tangani pipeline-nya; pertahankan kegagalan dalam rekapitulasi |
Untuk ekstraksi, hitung bidang dan dokumen
Format JSON yang valid tidak menjamin bahwa nilainya benar. Tetapkan normalisasi yang diizinkan: tanggal kanonis, pemisah desimal, spasi, atau kode kategori. Bedakan antara bidang yang hilang, nilai yang dikarang, dan abstensi yang diizinkan. Nilai yang tidak ada dalam dokumen tidak boleh digantikan dengan dugaan untuk meningkatkan tingkat pengisian.
Berikut perhitungan ilustratif kedua, yang independen dari tabel klasifikasi. Lima puluh dokumen masing-masing memiliki tiga bidang yang diharapkan, sehingga totalnya 150 nilai. Misalkan 38 dokumen sepenuhnya benar, enam dengan dua bidang benar, dan enam dengan satu bidang benar. Ini menghasilkan 38 × 3 + 6 × 2 + 6 × 1 = 132 nilai benar, yaitu 88%. Namun, hanya 38/50 = 76% dokumen yang sepenuhnya dapat diterima jika ketiga bidang diwajibkan.
Ke-18 nilai yang salah tersebut menyentuh dua belas dokumen. Jangan menyajikannya sebagai delapan belas dokumen yang bermasalah. Bergantung pada penggunaannya, unit yang berguna adalah bidang yang diverifikasi atau dokumen lengkap yang diterima; tentukan itu sebelum perbandingan. Simpan hasil per bidang untuk mengetahui apakah kesulitannya berasal dari tanggal, jumlah, atau kategori.
| Jenis dokumen | Dokumen | Bidang benar per dokumen | Bidang benar secara total |
|---|---|---|---|
| Sepenuhnya benar | 38 | 3 | 114 |
| Satu kesalahan | 6 | 2 | 12 |
| Dua kesalahan | 6 | 1 | 6 |
| Total | 50 | — | 132 dari 150 |
Pilih perbaikan sebelum menjalankan ulang kampanye
Prioritaskan berdasarkan konsekuensi dan cakupan yang terdampak, bukan hanya berdasarkan jumlah baris. Dalam matriks fiktif, lima kesalahan Penghapusan mungkin perlu ditinjau sebelum enam kesalahan Faktur jika proyek telah menetapkan kategori tersebut sebagai kritis. Prioritas ini adalah bagian dari kontrak proyek; tabel tersebut tidak memungkinkan untuk mengarang tingkat keparahan bisnis.
Rumuskan hipotesis yang dapat diuji: "Masukan yang panjang kehilangan bagian yang menentukan saat persiapan". Pilih satu perubahan yang memungkinkan untuk memeriksanya, lalu jaga sisanya tetap konstan. Menambahkan contoh, mengganti model, dan memperbesar konteks secara bersamaan dapat meningkatkan skor, tetapi tidak lagi memungkinkan untuk mengaitkan efeknya dengan satu perbaikan saja.
- Tinjau ulang beberapa keberhasilan selain kesalahan, untuk memastikan bahwa kriteria diterapkan secara konsisten.
- Bandingkan varian pada identitas dan referensi yang sama; tandai secara terpisah setiap perubahan pada korpus.
- Bedakan antara kesalahan yang diperbaiki, kesalahan yang masih ada, kesalahan baru, dan kasus yang tidak berubah.
- Jalankan ulang juga contoh di luar kategori yang ditargetkan untuk mencari regresi.
Kendalikan keuntungan tanpa menghapus regresi
Perhitungan berpasangan menunjukkan apa yang disembunyikan oleh skor bersih. Dari seratus tiket fiktif, bayangkan sembilan kesalahan diperbaiki tetapi empat keberhasilan lama menjadi salah. Rekapitulasinya berubah dari 83 menjadi 83 + 9 − 4 = 88 jawaban benar. Keuntungannya lima poin, dengan empat regresi untuk diperiksa. Ini tidak berarti bahwa sembilan perbaikan diperoleh tanpa konsekuensi.
Catatan keputusan menyimpan tabel sebelum/sesudah, kasus yang diperbaiki, kesalahan baru, versi perbaikan, dan kriteria yang terpenuhi. Jika aturan kritis masih dilanggar, rata-rata yang lebih tinggi tidak cukup untuk menerima varian. Biaya dan durasi kemudian dibandingkan antar opsi yang dapat diterima; mempercepat hasil yang ditolak tidak menyelesaikan masalah kualitas.
Batasi kesimpulan pada apa yang telah diperiksa
Kesalahan yang mencolok belum tentu representatif. Jika Anda terutama meninjau ulang entri panjang atau kegagalan dari kategori yang jarang, tunjukkan mode pemilihan tersebut dan jangan sajikan frekuensinya sebagai frekuensi seluruh korpus. Pertahankan juga kasus yang belum diarbitrase: kasus-kasus itu mendefinisikan ketidakpastian evaluasi Anda.
Analisis Anda dapat digunakan ketika pembaca lain dapat menemukan kembali entri, memahami putusannya, dan memverifikasi perbaikan yang diusulkan. Analisis itu tidak membuktikan penyebab internal suatu respons yang dihasilkan maupun kualitas masa depan yang terjamin. Beralihlah ke set final yang disisihkan setelah pemilihan perbaikan, lalu arsipkan batasan bersama kesimpulan.
Pertanyaan praktis
Apakah kenaikan skor keseluruhan cukup untuk mempertahankan suatu varian?
Tidak. Periksa kategori kritis, kesalahan baru, dan keluaran lengkap yang diterima. Kenaikan rata-rata dapat beriringan dengan regresi yang melanggar kriteria proyek.
Haruskah saya memperbaiki referensi ketika model membantahnya?
Periksa dulu entri dan instruksi anotasi. Jika referensi keliru, arbitrase dan versikan perbaikannya, lalu terapkan ke semua varian. Ketidaksepakatan model saja tidak membenarkan perubahan jawaban yang diharapkan.
Bisakah saya menjumlahkan kategori dalam taksonomi saya?
Hanya jika setiap kasus memiliki satu kategori utama yang eksklusif untuk penghitungan tersebut. Label sekunder dapat tumpang tindih; jumlahnya kemudian menghitung kemunculan label, bukan kesalahan yang berbeda.