Pilih konfigurasi untuk beban yang ditentukan
Daftar GPU, saran untuk model Anda, dan alternatif untuk konfigurasi Anda saat ini memerlukan lembar awal yang sama: model dan revisi, inferensi atau adaptasi, format bobot, panjang yang dibutuhkan, konkurensi atau microbatch, dan kriteria kualitas. Pertahankan persyaratan ini saat membandingkan penawaran. Konfigurasi yang memproses lebih sedikit konteks atau tugas yang disederhanakan tidak otomatis memenuhi kebutuhan yang sama.
Klasifikasikan setiap persyaratan wajib: dapat diterima jika dokumen yang tersedia mengonfirmasinya dalam lingkup Anda; perlu dikonfirmasi jika tidak ada; keluarkan jika kegagalan yang terbukti menghalangi pemenuhan beban kerja. Kandidat hanya dipilih ketika semua persyaratan ini terpenuhi. Selanjutnya, pisahkan kandidat yang dapat diterima berdasarkan total biaya paket, margin yang berguna, dan jadwal yang terdokumentasi. Preferensi tidak menggantikan kriteria yang bersifat mengeliminasi.
Hubungkan setiap kriteria dengan dokumen dan keputusan
Lembar komersial membuktikan apa yang ditawarkan; protokol Anda menetapkan apa yang berfungsi pada beban kerja. Lingkungan yang diminta saat pemesanan tetap menjadi preferensi persiapan. Kapasitas memori nominal atau stok yang dinyatakan tidak membuktikan pemasangan perangkat lunak maupun durasi ketersediaan.
Simpan dokumen beserta versi dan lingkupnya. Jika informasi wajib tidak terdokumentasi, tuliskan secara tepat kondisi yang perlu dikonfirmasi. Tabel ini memungkinkan penyusunan pra-seleksi tanpa mengubah hal-hal yang belum diketahui menjadi jaminan.
| Kriteria wajib | Dokumen yang dapat diverifikasi | Dapat diterima | Perlu dikonfirmasi | Keluarkan |
|---|---|---|---|---|
| Beban kerja tercakup | Model, revisi, token, batch/konkurensi, dan input yang dijalankan | Seluruh beban kerja yang diperlukan tercakup | Dimensi sebenarnya belum diketahui | Sebagian yang penting dihilangkan |
| Kompatibilitas | Dokumentasi resmi perangkat lunak dan pemeriksaan lingkungan yang dituju | Kombinasi yang diperlukan terverifikasi | Lingkungan hanya diinginkan | Dependensi penting tidak kompatibel |
| Memori per GPU | Perhitungan yang diuraikan, kapasitas tersedia, dan puncak fase yang berguna | Siklus penuh tercakup dengan margin yang wajar | Hanya bobot atau uji kecil yang diketahui | Saturasi pada beban kerja yang diminta |
| Kualitas | Korpus dibekukan, output diidentifikasi, dan ambang batas ditetapkan sebelum perbandingan | Ambang batas dan toleransi terpenuhi | Format baru belum dievaluasi | Regresi melebihi toleransi |
| Distribusi dan server | Penempatan komponen; RAM, penyimpanan, atau interkoneksi yang diperlukan | Kebutuhan terverifikasi | Karakteristik yang diperlukan tidak terdokumentasi | Distribusi penting tidak mungkin dilakukan |
| Anggaran dan jadwal | Paket, lot, kartu, hari, total USD, dan jadwal lengkap | Batas dan jendela terpenuhi | Durasi masih bersifat hipotetis | Anggaran atau tenggat terlampaui |
Sumber teknis: Lembar beban kerja untuk inferensi · Ukur fase dan penghitung · Tetapkan kriteria kualitas · Rencanakan biaya eksperimen
Ketahui apa yang dihitung oleh hasil
Jumlah parameter sesuai dengan nilai yang Anda representasikan dalam perhitungan dense. Format menunjukkan jumlah bit per nilai. Hasil “Bobot saja” mengonversi volume ini menjadi Gio, lalu “Envelope indikatif” menambahkan cadangan Anda. Pilihan pelatihan atau adaptasi dalam alat ini tidak menerapkan pengali universal yang tersembunyi; ini mengajak Anda untuk mendokumentasikan pos-pos yang kurang.
Kesederhanaan ini memungkinkan peninjauan ulang asumsi. Ini juga menuntut Anda mengetahui apa yang berada di luar perhitungan: metadata kuantisasi, modul dari format lain, memori kerja, pemuatan sementara, dan penggunaan di luar proses. Kartu GPU yang diusulkan adalah kandidat untuk diperiksa, bukan jaminan bahwa model Anda akan berjalan di sana. Nama dan memori nominal sebuah kartu tidak menggambarkan bagian lain dari servernya.
Baca satuan sebelum membandingkan kartu
Satu GB desimal sama dengan satu miliar byte; satu Gio sama dengan 2³⁰ byte. Katalog menampilkan kapasitas nominal dalam GB. Alat ini menerapkan konvensi desimal; untuk memvalidasi konfigurasi, catat juga kapasitas dalam byte yang dinyatakan oleh perangkat. Penghitung program Anda dapat ditampilkan dalam byte atau Gio. Konversikan besaran yang memiliki definisi sama sebelum membandingkan ukurannya; jangan mencampur memori nominal, memori bebas, dan puncak yang dicadangkan.
Contoh perhitungan: 24 miliar byte setara dengan sekitar 22,35 Gio. Hasil ini tidak menunjukkan jumlah memori bebas pada kartu 24 GB. Sistem, konteks eksekusi, dan alokasi lain dapat ikut terhitung. Pertahankan satuan dan lingkup dalam nama setiap kolom lembar uji Anda.
Sumber teknis: NIST — awalan biner dan desimal
Contoh Terperinci: Tujuh Miliar Parameter
Untuk 7 miliar parameter pada 16 bit, volume padat adalah 14 miliar byte, yaitu sekitar 13,04 GiB. Dengan cadangan yang dipilih sebesar 6 GiB, selubungnya menjadi 19,04 GiB. Perhitungan ini tidak membuktikan bahwa cadangan 6 GiB cocok untuk model Anda: justru itulah asumsi yang harus dikendalikan dengan input dan operasi yang dipilih.
Tabel ini mempertahankan cadangan yang sama untuk menunjukkan semata-mata efek aritmetika dari format bobot. Dalam eksekusi nyata, alokasi lain dapat berubah secara berbeda. Representasi empat bit sering kali mencakup informasi tambahan dan dapat membiarkan sebagian lapisan dalam format lain. Karena itu, jangan membaca baris terakhir sebagai puncak total yang dijamin.
| Format bobot | Volume padat dalam byte | Bobot dalam GiB, dibulatkan | Bobot + cadangan dalam GiB |
|---|---|---|---|
| 32 bit | 28 000 000 000 | 26,08 | 32,08 |
| 16 bit | 14 000 000 000 | 13,04 | 19,04 |
| 8 bit | 7 000 000 000 | 6,52 | 12,52 |
| 4 bit teoretis | 3 500 000 000 | 3,26 | 9,26 |
Sumber teknis: Transformers 5.17 — format dan batasan bitsandbytes
Membangun cadangan yang dapat dijelaskan
Uraikan cadangan alih-alih memilih persentase berdasarkan kebiasaan. Dalam inferensi autoregresif, catat arsitektur, cache, token yang dipertahankan, dan sekuens simultan. Dalam pelatihan, catat parameter yang dipelajari, gradien, optimizer, aktivasi, dan buffer. Panjang input dan microbatch adalah bagian dari lembar catatan, bahkan ketika jumlah parameter tidak berubah.
Sebagian pos tidak mencapai maksimumnya pada waktu yang sama. Penjumlahan margin maksimum yang independen dapat berfungsi sebagai selubung konservatif jika dinyatakan demikian, tetapi itu bukan puncak yang teramati. Catat pos yang diestimasikan, yang diukur, dan yang masih belum diketahui. Panduan cache KV merinci salah satu perhitungan ini; berkas memori menempatkan kembali penghitung dalam fase-fase program.
| Pos yang harus didokumentasikan | Input yang diperlukan | Bukti yang diharapkan |
|---|---|---|
| Cache generasi | Kepala KV, lapisan, token, sekuens, format | Perhitungan yang disesuaikan dengan arsitektur lalu pengukuran |
| Aktivasi | Microbatch, panjang, arsitektur, checkpointing | Puncak pada input yang dipilih |
| Gradien dan optimizer | Parameter yang dilatih, format, metode | Pembaruan penuh pertama |
| Pemuatan, validasi, dan ekspor | Prosedur dan ukuran keluaran | Pemeriksaan setiap fase yang diperlukan |
Validasi secara bertahap tanpa diam-diam mengubah tugas
Mulailah dengan input pendek dan batch kecil untuk menemukan kesalahan persiapan. Lanjutkan kemudian ke input yang biasa lalu ke batas yang benar-benar Anda perlukan. Jika program memotong data, mempertahankan lebih sedikit token, atau melewati sebagian korpus, kasus yang berhasil tidak memvalidasi beban kerja yang dinyatakan. Catat dimensi yang benar-benar dieksekusi.
Catat puncak per fase dan per GPU dengan penghitungnya. Memori yang dialokasikan untuk tensor dan memori yang dicadangkan oleh allocator PyTorch tidak dijumlahkan. Pembacaan sistem dapat mencakup lebih dari proses yang diinstrumentasikan. Jika beberapa lot dipertimbangkan, dokumentasikan distribusi perangkat lunaknya; dua kartu tidak otomatis membentuk satu ruang memori tunggal.
Sumber teknis: PyTorch — manajemen memori CUDA
Memutuskan setelah pelanggaran pertama
Kegagalan saat pemuatan mengarah ke bobot, format, atau alokasi sementara. Kegagalan saat generasi menuntut pemeriksaan konteks dan konkurensi. Kegagalan saat backward pass dapat mengarah ke microbatch, aktivasi, atau strategi komputasi. Pelokalan ini menghindari mengubah presisi, model, dan data secara acak pada saat yang sama.
Setelah setiap koreksi, verifikasi kualitas dan cakupan yang tercakup. Mengurangi panjang yang diperlukan bisa jadi tidak dapat diterima; mengubah kuantisasi dapat mengubah keluaran. Jika kapasitas lain diperlukan, kembalilah ke katalog dengan lembar catatan yang merinci puncak yang teramati, margin yang beralasan, versi, dan input batas. Margin tanpa alasan tidak lebih andal daripada hasil yang dibulatkan hingga satuan GB terdekat.
Pilihan singkat, dengan persyaratan yang sama
Untuk inferensi ilustratif 7 miliar parameter pada 16 bit dan cadangan 6 GiB, contoh terperinci menghasilkan 19,04 GiB. Anda dapat mempertimbangkan RTX 4090 24 GB atau RTX 6000 Ada 48 GB. Penawaran yang dinyatakan untuk satu lot satu kartu selama 3 hari masing-masing adalah 47,14 USD dan 55,71 USD. Ini adalah dua kandidat dengan kapasitas berbeda: konteks, konkurensi, memori yang benar-benar tersedia, kompatibilitas, dan kualitas masih perlu diverifikasi. Harga-harga ini tidak menetapkan peringkat kecepatan apa pun.
Untuk adaptasi, gunakan kembali kisi yang sama dengan parameter yang telah dipelajari dan fase tambahan: lintasan mundur, pembaruan pertama, validasi, dan ekspor. Jumlah parameter LoRA tidak cukup untuk memvalidasi memori total. Alur fine-tuning membantu mengualifikasi hasil; batch dan akumulasi berfungsi mendokumentasikan pembaruan yang sebanding.
Jika Anda mencari alternatif setelah kelebihan beban, lokalisasi fase yang bermasalah dan pertahankan persyaratan keluaran Anda. Bandingkan satu perubahan saja pada satu waktu: kapasitas, cache, microbatch, atau presisi. Format yang berbeda harus mengembalikan kualitas minimum yang telah ditetapkan. Jika kebutuhan Anda menuntut aplikasi terkelola, RAM yang presisi, atau interkoneksi yang tersertifikasi, lembar GPU saja membuat keputusan masih perlu dikonfirmasi. Dua kartu memerlukan penempatan perangkat lunak yang terverifikasi; memorinya tidak otomatis menjadi satu ruang tunggal.
Sumber teknis: RTX 4090 — batch, kapasitas, dan paket · RTX 6000 Ada — batch, kapasitas, dan paket · Kualitas setelah kuantisasi · Mempersiapkan adaptasi · Menentukan batch dan akumulasi
Mempertahankan perhitungan dengan yang mengonfirmasinya
Simpan hipotesis awal, tabel pos, prosedur, dan catatan mentah. Bedakan antara estimasi, penghitung terukur, dan keputusan komersial. Notebook IteraGPU Lab membantu memahami instrumentasi ini pada jaringan kecil; ini tidak menggantikan uji coba model Anda. Contoh numerik di halaman ini adalah perhitungan, tanpa throughput atau konsumsi GPU yang diklaim teramati.
Keluaran penentuan ukuran yang baik cukup dalam satu lembar: model dan revisi, tugas, presisi, panjang, microbatch atau konkurensi, memori per GPU, dan kondisi pengukuran. Tambahkan apa yang dapat membatalkan kesimpulan, misalnya jendela yang lebih panjang atau evaluasi yang berbeda. Anda kemudian dapat memilih paket yang sesuai dengan kampanye, alih-alih mengulang seluruh estimasi untuk setiap varian.
Pertanyaan praktis
Apakah cadangan yang disarankan alat dihitung dari model saya?
Tidak. Cadangan adalah nilai yang Anda pilih sendiri. Alat ini tidak mengetahui arsitektur maupun masukan eksekusi Anda; gunakan untuk membuat hipotesis Anda eksplisit, lalu bandingkan dengan fase yang terukur.
Mengapa amplop di bawah 24 GB masih bisa gagal?
Estimasi dapat melewatkan beberapa pos dan menggunakan GiB sementara kapasitas nominal dinyatakan dalam GB. Puncak transien, proses lain, atau masukan berbeda juga dapat berpengaruh. Bandingkan satuan dan cakupan, lalu lokalisasi fase yang gagal.
Bisakah saya menjumlahkan cadangan dan dua puncak PyTorch?
Tidak. Puncak tensor yang dialokasikan dan puncak memori cadangan bukan dua pos independen yang dapat dijumlahkan. Puncak yang terpisah dapat terjadi pada waktu yang berbeda. Pertahankan namanya dan gunakan metode memori untuk menafsirkannya.
Bisakah saya meminta daftar atau alternatif tanpa sudah mengukur model saya?
Ya, untuk menetapkan kandidat bersyarat. Jelaskan beban dan kendala yang harus tetap sama. Perhitungan memori dan lembar komersial memungkinkan seleksi awal; kriteria wajib yang belum terverifikasi masih perlu dikonfirmasi sebelum memilih penawaran.