GPU untuk riset ML · Pembayaran kripto tanpa KYC
IteraGPU
Metode · Merancang eksperimen

Sebuah ablasi harus mengisolasi satu keputusan.

Untuk merencanakan ablasi, tentukan perubahan yang diteliti, referensi yang berfungsi, dan hasil yang akan mengubah keputusan Anda. Bandingkan varian pada data evaluasi yang sama, lalu periksa interaksinya sebelum menjumlahkan perolehannya. Rencana yang baik juga menyediakan pengulangan dan konfirmasi: menguji banyak pengaturan sekali saja bisa memberi kepastian lebih sedikit daripada satu pertanyaan sempit yang diperiksa dengan benar.

01 /

Menulis hipotesis yang dapat dibantah

"Meningkatkan model" tidak memperjelas eksperimennya. Tulislah misalnya: "Pembobotan kelas meningkatkan kualitas pada kelas langka, tanpa melampaui regresi yang diizinkan pada kelas umum." Sebutkan satu metrik utama, subkelompok penting, dan ambang efek yang berguna. Tetapkan juga kendala yang tetap prioritas: memori, waktu, cakupan entri, atau kesederhanaan model.

Bedakan antara penambahan dan penghapusan. Menambahkan komponen ke referensi sederhana mengukur kontribusinya dalam konteks tersebut. Menghapusnya dari sistem yang lengkap mengukur apa yang hilang dari sistem tersebut. Kedua pertanyaan dapat menghasilkan jawaban berbeda ketika komponen saling berinteraksi. Karena itu, kesimpulan Anda harus mencantumkan referensi dan kondisi faktor-faktor lainnya.

Luaran yang diharapkan adalah keputusan disertai tabel varian, bukan sekadar skor yang lebih baik. Sebelum memesan uji coba, tuliskan apa yang membuat Anda mempertahankan, menghentikan, atau memperdalam setiap opsi.

Sumber teknis: NIST — menetapkan tujuan rencana percobaan

02 /

Membangun kontrol dan varian yang dapat ditafsirkan

Kontrol mengikuti prosedur referensi, dengan versinya, datanya, dan aturan pemilihan checkpoint-nya. Kontrol harus dapat dijalankan dalam kampanye saat ini. Metrik lama tanpa prediksi dan protokol lengkap dapat menjadi patokan, tetapi tidak secara otomatis menggantikan kontrol tersebut.

Untuk setiap faktor, nyatakan secara tepat dua kondisi yang dibandingkan. "Augmentasi aktif" terlalu kabur: simpan transformasi, probabilitas, dan data yang terpengaruh. Jelaskan parameter yang tetap sama: prapemrosesan di luar faktor yang diteliti, split, optimizer, anggaran pelatihan, dan metode evaluasi. Jika langkah pelatihan tetap tetapi token yang diproses berubah, catat konsekuensinya.

Jauhkan test set final dari pilihan varian. Transformasi yang dipelajari dan keputusan penyetelan harus menggunakan data yang disiapkan untuk itu. Peningkatan yang diperoleh setelah menyesuaikan model pada kesalahan test bukan lagi evaluasi independen.

Sumber teknis: scikit-learn — menghindari kebocoran data

03 /

Dua faktor memerlukan empat situasi

Misalkan Anda meneliti A, sebuah pembobotan kelas, dan B, sebuah aturan augmentasi saat pelatihan. Untuk melihat interaksinya, periksa kontrol, A saja, B saja, dan A dengan B. Rancangan dua faktor dan dua level ini berisi empat konfigurasi. Dengan k faktor biner, rancangan penuh berisi 2ᵏ konfigurasi sebelum pengulangan: jumlah uji coba tumbuh dengan cepat.

Tabel berikut adalah contoh numerik rekaan untuk menjelaskan penalaran. Skornya tidak berasal dari pelatihan mana pun. Nilai tersebut mewakili rata-rata fiktif macro-F1 pada skala 0 hingga 100; dalam pekerjaan nyata, nilai individual dan variabilitasnya tetap sangat diperlukan.

Contoh ilustratif empat konfigurasi — nilai fiktif, tidak diukur
KonfigurasiA: pembobotanB : augmentationMacro-F1 fiktif, dari 100
KontrolTidakTidak70,0
A sajaYaTidak71,2
B sajaTidakYa70,8
A + BYaYa71,5

Sumber teknis: NIST — rancangan faktorial penuh dua level

04 /

Membaca efek dan interaksinya

Dalam contoh ini, A memberikan 1,2 poin tanpa B, tetapi hanya 0,7 poin ketika B sudah aktif. B memberikan 0,8 poin tanpa A dan 0,3 poin dengan A. Keuntungan gabungannya adalah 1,5 poin, sedangkan jumlah kedua keuntungan terpisah bernilai 2,0 poin. Selisih −0,5 poin di sini menggambarkan interaksi yang tidak aditif.

Perhitungan ini tidak menetapkan kekokohannya maupun menjelaskan mekanismenya. Perhitungan ini memberi tahu Anda pertanyaan mana yang perlu dikonfirmasi: apakah penambahan B ke sistem yang berisi A membenarkan kompleksitasnya hanya untuk 0,3 poin dalam contoh ini? Periksa juga subkelompok yang direncanakan. Rata-rata yang sama dapat menyembunyikan keuntungan dan kerugian yang berbeda.

Bandingkan perbedaan ini pada pengulangan berpasangan bila protokol Anda memungkinkan. Jangan pilih seed terbaik dari setiap varian. Jika tanda atau amplitudonya berubah drastis antar uji coba, keputusannya tetap tidak pasti.

Selisih ilustratif terhadap aditivitas = skor(A+B) − skor(A) − skor(B) + skor(kontrol) = 71,5 − 71,2 − 70,8 + 70,0 = −0,5 poin.

Sumber teknis: NIST — kombinasi dan interaksi dalam rancangan faktorial

05 /

Mengalokasikan anggaran untuk keputusan penting

Pagu uji coba adalah alat perencanaan, bukan prediksi kecepatan GPU. Contoh: Anda memiliki anggaran organisasi sebesar 24 eksekusi lengkap. Anda mengalokasikan 12 eksekusi untuk empat konfigurasi dengan masing-masing tiga seed, 10 untuk konfirmasi kontrol dan satu kandidat dengan lima seed baru, dan 2 untuk pengulangan yang beralasan. Totalnya 24; belum ada yang menyatakan berapa jam yang dibutuhkannya.

Tiga seed pertama di sini berfungsi untuk eksplorasi, bukan untuk memastikan pemenang. Tetapkan aturan pemilihan kandidat sebelum mengamati rangkaian ini. Konfirmasi menggunakan protokol yang telah ditetapkan; seed baru mengurangi ketergantungan pada seleksi awal tetapi tidak memperbaiki test set yang sudah dipakai untuk menyetel model.

Jika anggaran tidak memungkinkan pengulangan yang diperlukan, kurangi faktor atau tunda satu pertanyaan. Prioritaskan perubahan yang memengaruhi keputusan nyata: menghapus komponen mahal, mengatasi kegagalan, atau memisahkan dua opsi yang berdekatan. Sisakan waktu untuk evaluasi dan artefak sebelum membandingkan paket.

Contoh pembagian anggaran 24 eksekusi, tanpa durasi yang diasumsikan
LangkahKomputasiEksekusi
Eksplorasi4 konfigurasi × 3 seed12
Konfirmasi2 konfigurasi × 5 seed baru10
Pengulangan terdokumentasiCadangan2
Total anggaran12 + 10 + 224
06 /

Siapkan urutan dan aturan penghentian

Tuliskan daftar uji coba sebelum diluncurkan, dengan identitas, konfigurasi, seed, dan prioritas. Sebarkan varian dalam urutan pelaksanaan alih-alih menyelesaikan semua kontrol lalu semua kandidat. Jika suatu periode, dataset, atau mesin merupakan blok perbandingan, dokumentasikan blok tersebut. Perubahan lingkungan di tengah rangkaian harus tetap terlihat.

Siapkan alasan penghentian teknis, seperti kesalahan berulang atau kelebihan memori. Simpan setiap percobaan dan statusnya. Jangan diam-diam mengganti kegagalan dengan eksekusi yang lebih pendek, atau uji coba yang mengecewakan dengan seed baru sampai memperoleh skor yang diharapkan.

Penghentian dini yang ditentukan berdasarkan skor mengubah protokol analisis. Jika Anda merencanakan keputusan antara, umumkan aturannya dan sifat eksploratifnya. Untuk kesimpulan konfirmatori, pertahankan rencana analisis yang sesuai dengan keputusan tersebut.

07 /

Tutup ablasi dengan kesimpulan yang dapat diverifikasi

Lembar akhir mencantumkan hipotesis, kontrol, faktor, pengulangan, selisih, dan kasus kegagalan. Kaitkan setiap nilai dengan prediksi dan run yang menghasilkannya. Akhiri dengan keputusan eksplisit: komponen dipertahankan, komponen dihapus, atau data tidak cukup untuk memilih.

Hindari tiga jalan pintas: mengaitkan perubahan pada A padahal prapemrosesan juga berubah; menjumlahkan keuntungan terpisah tanpa menguji kombinasinya; mengumumkan aturan umum dari satu korpus saja. Ablasi menetapkan suatu observasi dalam protokol yang terdefinisi. Cakupannya bergantung pada data, model, dan variasi yang benar-benar diteliti.

Pertanyaan praktis

Apakah semua kombinasi harus selalu diuji?

Rencana lengkap berguna untuk interaksi, tetapi biayanya meningkat seiring jumlah faktor. Batasi dulu faktor yang dapat mengubah keputusan Anda. Rencana yang dikurangi tetap mungkin dilakukan jika Anda menjelaskan efek yang tidak dapat dipisahkannya; jangan menyajikan kombinasi yang tidak ada sebagai sudah diuji.

Bisakah saya menggunakan kembali kontrol dari kampanye sebelumnya?

Anda dapat menggunakannya kembali jika data, kode, anggaran, pemilihan model, dan evaluasi benar-benar sebanding dan terdokumentasi. Jika tidak, jalankan ulang kontrol dalam protokol saat ini. Perbedaan versi atau split dapat menjelaskan selisih yang ingin Anda kaitkan pada komponen tersebut.

Apakah hasil negatif berarti komponen tersebut tidak berguna?

Hasil negatif menunjukkan bahwa komponen tersebut tidak memberikan efek yang dicari dalam kondisi yang diteliti, atau buktinya kurang. Periksa ketidakpastian dan interaksi sebelum menggeneralisasi. Mendokumentasikan hasil ini mencegah pemborosan anggaran lagi pada jalur yang sudah diperiksa.