GPU untuk riset ML · Pembayaran kripto tanpa KYC
IteraGPU
Metode / Data dan evaluasi

Pertahankan evaluasi yang masih bisa mengejutkan Anda.

Himpunan evaluasi yang berguna merepresentasikan pekerjaan yang harus dilakukan model tanpa pernah dipakai untuk memilih pengaturannya. Tentukan unit yang dievaluasi, kelompokkan contoh-contoh yang terkait, cari duplikat, dan sisihkan himpunan akhir. Anda kemudian dapat menafsirkan perbedaan kualitas. Pembagian baris secara acak tidak menjamin independensi ini, terutama ketika beberapa baris berasal dari dokumen atau percakapan yang sama.

01 /

Tentukan apa yang direpresentasikan setiap contoh

Mulailah dengan satu kalimat keputusan: mengenali kategori tiket baru, mengekstrak tiga bidang dari sebuah dokumen, atau menjawab pertanyaan beserta lampirannya. Jelaskan input yang tersedia pada saat prediksi, output yang diharapkan, dan kasus di luar cakupan. Informasi yang ditambahkan setelah tiket diselesaikan tidak boleh muncul dalam input yang seharusnya merepresentasikan saat tiket masuk.

Bedakan kemudian antara baris dan unit independen. Lima pesan dalam satu percakapan berbagi konteks; sepuluh halaman dalam satu berkas berbagi asalnya. Jika tujuan Anda menyangkut berkas baru, simpan setiap berkas dalam satu partisi saja. Pemisahan berdasarkan pengguna, dokumen, peralatan, atau periode menjawab pertanyaan yang berbeda: pilih yang paling mirip dengan penggunaan di masa depan, lalu cantumkan alasannya dalam manifes.

Sumber teknis: scikit-learn 1.9 — validasi dengan grup dan dependensi temporal

02 /

Tetapkan peran untuk setiap himpunan

Himpunan pembelajaran digunakan untuk penyesuaian model. Himpunan validasi memandu keputusan pengembangan: prompt, ambang batas, hyperparameter, atau pilihan varian. Test akhir menjawab pertanyaan yang sudah ditetapkan. Melihatnya untuk memilih pengaturan terbaik secara bertahap mengubah test ini menjadi alat pengembangan, meskipun tidak ada gradien yang dihitung padanya.

Pisahkan juga data yang digunakan untuk mempelajari suatu transformasi. Normalisasi, pemilihan variabel, atau imputasi yang disesuaikan pada seluruh korpus dapat meneruskan informasi ke model. Pelajari transformasi ini pada partisi yang diizinkan, lalu terapkan transformasi yang disimpan ke himpunan lainnya. Sebuah pipeline mempermudah kontrol ini; ia tidak dengan sendirinya memperbaiki grup yang salah dipisahkan.

Peran yang harus dinamai sebelum menghasilkan skor pertama
HimpunanPenggunaan yang diizinkanKeputusan yang harus dihindari
PembelajaranMenyesuaikan parameter dan transformasi yang dipelajariMengimpor jawaban test akhir ke dalamnya
ValidasiMemilih pengaturan, prompt, dan ambang batasMenyajikan skor eksploratif terbaik sebagai hasil akhir yang independen
Test akhirMengevaluasi konfigurasi yang dipilih menurut aturan yang telah ditetapkanMengubah pengaturan setelah membaca lalu menggunakan kembali skor yang sama sebagai konfirmasi
Kalibrasi opsionalMenyiapkan metode kuantisasi yang membutuhkannyaGunakan uji akhir untuk membuat varian yang dievaluasi

Sumber teknis: scikit-learn 1.9 — kebocoran data dan transformasi

03 /

Menangani duplikat tanpa menghapus kasus sulit

Simpan korpus mentah, lalu bangun inventaris kerja dengan pengenal, asal, dan grup. Sidik jari konten mendeteksi salinan persis sesuai representasi yang dipilih. Dokumentasikan representasi ini: menghapus semua tanda baca atau mengubah teks menjadi huruf kecil dapat menggabungkan entri yang perbedaannya penting bagi tugas. Pertahankan pemetaan antara salinan yang dibuang dan contoh yang disimpan.

Hampir-duplikat memerlukan tinjauan tambahan: ekspor yang dimodifikasi, jawaban yang dirumuskan ulang, bagian yang sama, atau dokumen yang diterbitkan ulang. Kemiripan yang tinggi adalah sinyal untuk diperiksa, bukan bukti bahwa dua anotasi dapat dipertukarkan. Kelompokkan varian yang terkait sebelum membagi data. Jika dua salinan memuat rujukan yang bertentangan, buka pertanyaan anotasi; jangan memilih secara otomatis salinan yang paling baik diprediksi oleh model.

04 /

Contoh yang dikerjakan: 1.200 baris bukan 1.200 observasi independen

Contoh ini sepenuhnya ilustratif: tidak ada korpus atau model yang diukur. Misalkan 240 percakapan, masing-masing diekspor menjadi lima baris. Satu baris adalah salinan persis di setiap percakapan; empat lainnya berbeda. Menghapus 240 salinan ini menyisakan 960 contoh, yang tetap tersusun dalam 240 grup. Pilihan pedagogis berikut menyisihkan 70% grup untuk pelatihan, 15% untuk validasi, dan 15% untuk pengujian.

Diperoleh 168, 36, dan 36 percakapan, yaitu 672, 144, dan 144 contoh. Kesamaan proporsi dalam baris dan grup di sini berasal dari empat contoh per percakapan. Dalam korpus nyata dengan ukuran yang bervariasi, hal itu tidak akan terjadi secara otomatis. Proporsi ini bukan aturan universal: proporsi tersebut harus menyisakan cukup banyak grup dan kasus penting di setiap himpunan.

1.200 − 240 = 960 contoh; 168 + 36 + 36 = 240 grup; 672 + 144 + 144 = 960 contoh.
Partisi aritmetika ilustratif, setelah penanganan salinan
PartisiPercakapan utuhContohPeran
Pembelajaran168672Sesuaikan
Validasi36144Pilih
Test akhir36144Konfirmasi pada himpunan yang disisihkan

Sumber teknis: scikit-learn 1.9 — GroupShuffleSplit menghitung grup

05 /

Periksa kelas, panjang, dan kronologi

Setelah partisi, hitung kelas dan grup yang memuatnya. Kelas yang muncul pada banyak baris tetapi hanya dalam satu percakapan tidak menawarkan banyak kasus independen. Periksa juga panjang, bahasa yang benar-benar tercakup, dokumen yang tidak lengkap, dan kategori yang penting bagi keputusan. Rata-rata yang melegakan dapat menyembunyikan partisi tanpa satu pun contoh dari kasus kritis.

Stratifikasi dengan grup berupaya mempertahankan proporsi kelas tanpa menyebarkan grup. Stratifikasi ini tidak menjamin keseimbangan sempurna ketika grup sedikit atau sangat tidak seimbang. Jika tugasnya adalah memprediksi observasi di masa depan, pemisahan kronologis bisa lebih relevan daripada pengacakan. Periksa juga bahwa variabel-variabel tersedia pada tanggal prediksi.

Sumber teknis: scikit-learn 1.9 — StratifiedGroupKFold dan keterbatasannya · scikit-learn 1.9 — validasi data temporal

06 /

Buat rujukan cukup presisi untuk menilai keluaran

Tulis instruksi anotasi dengan contoh dan kasus batas. Untuk ekstraksi, jelaskan arti bidang yang tidak ada, format tanggal, mata uang, dan padanan yang diterima. Untuk klasifikasi, jelaskan batas antar kategori. Jawaban yang berbeda dari rujukan tidak selalu merupakan kesalahan model: rujukan bisa ambigu atau keliru.

Mintalah peninjauan ulang atas pilihan yang beragam, khususnya ketidaksepakatan dan kasus penting, lalu catat arbitrasenya. Simpan koreksi dalam versi baru kumpulan data. Jika suatu koreksi mengubah hasil perbandingan, hitung ulang semua varian terkait pada rujukan yang sama; jangan hanya mengoreksi baris yang merugikan model favorit Anda.

07 /

Hasilkan paket evaluasi sebelum kampanye GPU

Luaran dari persiapan ini adalah himpunan yang dapat diidentifikasi, disertai aturannya. Ini memungkinkan reproduksi pemilihan data tanpa bergantung pada ingatan dari notebook. Menyiapkan paket ini sebelum penyewaan menghindari habisnya periode komputasi untuk menyelesaikan perbedaan berkas atau kriteria.

  • Tetapkan pengenal, grup, partisi, dan justifikasinya; simpan skrip atau daftar yang menghasilkannya.
  • Periksa irisan antara pengenal, grup, dan sidik jari antarpartisi. Setiap irisan yang tidak terduga harus dijelaskan atau diperbaiki.
  • Ekspor jumlah unit per partisi, kelas, dan subgrup yang relevan, serta daftar pengecualian dan alasannya.
  • Kunci referensi, aturan normalisasi, metrik utama, dan ambang batas sebelum perbandingan.
  • Simpan revisi, sidik jari, hak penggunaan, dan lokasi data. Sidik jari menjamin identifikasi, bukan anonimitas.
  • Batasi akses ke uji akhir hingga keputusan yang direncanakan; simpan catatan akses dan perubahan protokol.
08 /

Memahami apa yang dibuktikan oleh pengujian

Persiapan dapat diterima ketika jumlah unit selaras dengan inventaris, tumpang tindih terkendali, dan setiap keluaran dapat dinilai berdasarkan aturan yang jelas. Hal ini tidak membuktikan bahwa model akan berhasil, maupun bahwa semua penggunaan di masa depan terwakili. Kumpulan data kecil dapat mendeskripsikan masalah tertentu namun tetap tidak memadai untuk menarik kesimpulan tentang kelas yang jarang.

Jika Anda menggunakan kesalahan dari uji akhir untuk meningkatkan sistem, simpan uji tersebut sebagai riwayat dan siapkan konfirmasi independen yang baru. Untuk model yang telah dilatih sebelumnya yang data aslinya tidak diketahui, partisi Anda tidak dapat menjamin tidak adanya paparan sebelumnya. Dokumentasikan keterbatasan ini daripada menyebut kumpulan data tersebut sepenuhnya murni.

Pertanyaan praktis

Apakah selalu harus menyisihkan 20% data untuk pengujian?

Tidak. Porsi yang berguna bergantung pada jumlah unit independen dan kasus yang harus dicakup. Periksa grup, kategori penting, dan ketepatan kesimpulan yang diharapkan; persentase saja tidak menjamin pengujian yang informatif.

Apakah pengenal yang berbeda sudah cukup untuk mengecualikan duplikat?

Tidak. Dua ekspor dapat memiliki pengenal berbeda namun berisi teks yang sama atau varian dari berkas yang sama. Periksa konten dan asal-usulnya, lalu simpan contoh-contoh terkait dalam partisi yang sesuai dengan aturan pengelompokan Anda.

Bisakah saya menggunakan kembali uji saya setelah memperbaiki model berdasarkan kesalahannya?

Anda dapat menyimpannya untuk melacak riwayat, tetapi uji tersebut telah ikut serta dalam pengembangan. Untuk mengonfirmasi peningkatan pada data yang disisihkan, gunakan kumpulan data baru yang independen dan nyatakan dengan jelas peran masing-masing.