Pertanyaan mana yang menghambat Anda hari ini?
Dari pemuatan pertama hingga checkpoint, atur poin-poin yang perlu diverifikasi sebelum kampanye komputasi. Temukan panduan untuk menghitung ukuran, mengukur, dan menyimpan hasil yang dapat ditindaklanjuti.
Model saya belum pernah dijalankan. Mulai dari mana?
Sebuah amplop memori dan input untuk uji coba pertama.
Mengukur memori GPU: perhitungan, cadangan, dan validasi
Hitung bobot dalam Gio, bangun cadangan eksplisit, dan validasi puncak per fase. Contoh numerik, jebakan kuantisasi, dan pilihan per kartu.
Memori GPU: menjelaskan selisih antara estimasi dan puncak
Bedakan bobot, cache, dan aktivasi, ukur allocated dan reserved per fase, lalu pilih margin dengan notebook dan protokol PyTorch.
Cache KV: menghitung memori berdasarkan konteks, GQA, dan batch
Hitung cache KV dengan kepala KV, konteks, dan sekuens bersamaan. Bedakan GQA, presisi, dan cache statis sebelum uji coba nyata.
Skornya meningkat, tetapi bisakah saya mempercayainya?
Satu set evaluasi terpisah, kesalahan yang ditinjau ulang, dan selisih yang terukur.
Membangun himpunan evaluasi ML tanpa kebocoran data
Pisahkan grup, duplikat, dan penggunaan data untuk membangun himpunan evaluasi ML yang disisihkan, terkendali, dan sesuai dengan keputusan Anda.
Menganalisis kesalahan ML untuk memilih eksperimen berikutnya
Analisis kesalahan klasifikasi dan ekstraksi: matriks konfusi, referensi, taksonomi, regresi, dan kontrol atas koreksi berikutnya.
Variabilitas antar seed: apakah selisih ML meyakinkan?
Tafsirkan pengulangan ML dengan seed berpasangan, dispersi, dan ambang efek yang berguna. Contoh perhitungan dan keterbatasan sampel kecil.
Saya menyiapkan pelatihan. Apa yang perlu diverifikasi sebelum menjalankan rangkaian?
Pembaruan lengkap, batch yang eksplisit, dan jejak yang dapat dianalisis.
Pelatihan GPU: validasi loop sebelum kampanye
Siapkan data, batch, dan pemulihan pelatihan. Satu protokol per fase untuk mengontrol memori, gradien, validasi, dan berkas keluaran.
Microbatch dan akumulasi: menghitung batch efektif
Hitung batch efektif, normalkan loss, dan verifikasi akumulasi gradien pada satu atau beberapa kartu, beserta batas kesetaraannya.
Melacak eksperimen ML Anda: dari run hingga keputusan
Hubungkan data, kode, parameter, prediksi, dan keputusan dengan manifes eksperimen ML. Contoh kontrol run dan artefak tanpa alat yang diwajibkan.
Menyesuaikan atau mengompresi model: bagaimana memilih varian?
Sebuah baseline, perubahan terkendali, dan kualitas yang sebanding.
Fine-tuning: memilih adaptasi dan memverifikasi kontribusinya
Siapkan fine-tuning dengan referensi, data terpisah, dan kontrol pemuatan ulang. LoRA, basis terkuantisasi, anggaran, dan analisis regresi.
Membandingkan kuantisasi: memori, kualitas, dan biaya yang berguna
Bandingkan referensi, kalibrasi, format bobot, dan cache KV dengan data yang sama. Ukur memori dan kualitas sebelum memutuskan anggaran GPU.
Merencanakan ablasi ML: kontrol, efek, dan anggaran
Susun rencana ablasi ML dengan kontrol, faktor, interaksi, dan anggaran uji coba. Contoh perhitungan untuk memprioritaskan varian dan menyimpulkan.
Anggarannya terbatas. Uji coba mana yang harus dijalankan lebih dulu?
Urutan eksperimen dan biaya paket yang dibandingkan dengan hasil yang berguna.
Menganggarkan kampanye ML: percobaan, keputusan, dan paket penuh
Uraikan kampanye ML, prioritaskan varian, dan hubungkan paket GPU dengan hasil yang berguna, lengkap dengan contoh jadwal dan anggaran dalam USD.
Merencanakan ablasi ML: kontrol, efek, dan anggaran
Susun rencana ablasi ML dengan kontrol, faktor, interaksi, dan anggaran uji coba. Contoh perhitungan untuk memprioritaskan varian dan menyimpulkan.
Benchmark ML: membandingkan biaya pada kualitas setara
Tetapkan kualitas, ukur korpus yang sama, dan bandingkan biaya penuh paket GPU 3, 7, atau 30 hari. Protokol dan tabel mentah untuk diunduh.