GPU untuk riset ML · Pembayaran kripto tanpa KYC
IteraGPU
Alat / Pengukuran

Berapa banyak memori untuk hipotesis Anda?

Untuk memilih GPU, mulailah dari model dan beban yang akan diproses, lalu verifikasi bersama-sama kompatibilitas, memori lengkap, dan kualitas yang diharapkan. Pengukur ini menjumlahkan bobot teoretis dan cadangan yang dipilih; ia memberikan kandidat untuk ditinjau. Ia tidak menghitung cache, aktivasi, atau status optimizer secara otomatis. Kriteria wajib yang belum diketahui tetap harus dikonfirmasi sebelum memilih konfigurasi.

01 / Penentu UkuranEstimasi

Tetapkan asumsi Anda.

Cache, aktivasi, buffer: asumsi yang perlu diukur.

Amplop indikatif

19 GiB

Bobot saja

13 GiB
Examiner NVIDIA RTX A5000 24GB

Bobot = parameter × bit ÷ 8 ÷ 2³⁰. Metadata kuantisasi tidak disertakan. Tidak ada throughput yang diprediksi.

Cadangan yang dipilih, lalu diverifikasi.

Hasilnya menjumlahkan bobot teoretis dan cadangan Anda. Batch, cache, aktivasi, dan optimizer tidak dihitung secara otomatis.

Mulailah dengan hipotesis yang eksplisit, lalu gunakan skenario di bawah ini untuk menyiapkan pengukuran pada beban kerja Anda.

Beralih dari estimasi ke pengukuran
01 /

Pilih konfigurasi untuk beban yang ditentukan

Daftar GPU, saran untuk model Anda, dan alternatif untuk konfigurasi Anda saat ini memerlukan lembar awal yang sama: model dan revisi, inferensi atau adaptasi, format bobot, panjang yang dibutuhkan, konkurensi atau microbatch, dan kriteria kualitas. Pertahankan persyaratan ini saat membandingkan penawaran. Konfigurasi yang memproses lebih sedikit konteks atau tugas yang disederhanakan tidak otomatis memenuhi kebutuhan yang sama.

Klasifikasikan setiap persyaratan wajib: dapat diterima jika dokumen yang tersedia mengonfirmasinya dalam lingkup Anda; perlu dikonfirmasi jika tidak ada; keluarkan jika kegagalan yang terbukti menghalangi pemenuhan beban kerja. Kandidat hanya dipilih ketika semua persyaratan ini terpenuhi. Selanjutnya, pisahkan kandidat yang dapat diterima berdasarkan total biaya paket, margin yang berguna, dan jadwal yang terdokumentasi. Preferensi tidak menggantikan kriteria yang bersifat mengeliminasi.

02 /

Hubungkan setiap kriteria dengan dokumen dan keputusan

Lembar komersial membuktikan apa yang ditawarkan; protokol Anda menetapkan apa yang berfungsi pada beban kerja. Lingkungan yang diminta saat pemesanan tetap menjadi preferensi persiapan. Kapasitas memori nominal atau stok yang dinyatakan tidak membuktikan pemasangan perangkat lunak maupun durasi ketersediaan.

Simpan dokumen beserta versi dan lingkupnya. Jika informasi wajib tidak terdokumentasi, tuliskan secara tepat kondisi yang perlu dikonfirmasi. Tabel ini memungkinkan penyusunan pra-seleksi tanpa mengubah hal-hal yang belum diketahui menjadi jaminan.

Kisi seleksi — keputusan khusus untuk beban kerja Anda, diisi dengan dokumen Anda
Kriteria wajibDokumen yang dapat diverifikasiDapat diterimaPerlu dikonfirmasiKeluarkan
Beban kerja tercakupModel, revisi, token, batch/konkurensi, dan input yang dijalankanSeluruh beban kerja yang diperlukan tercakupDimensi sebenarnya belum diketahuiSebagian yang penting dihilangkan
KompatibilitasDokumentasi resmi perangkat lunak dan pemeriksaan lingkungan yang ditujuKombinasi yang diperlukan terverifikasiLingkungan hanya diinginkanDependensi penting tidak kompatibel
Memori per GPUPerhitungan yang diuraikan, kapasitas tersedia, dan puncak fase yang bergunaSiklus penuh tercakup dengan margin yang wajarHanya bobot atau uji kecil yang diketahuiSaturasi pada beban kerja yang diminta
KualitasKorpus dibekukan, output diidentifikasi, dan ambang batas ditetapkan sebelum perbandinganAmbang batas dan toleransi terpenuhiFormat baru belum dievaluasiRegresi melebihi toleransi
Distribusi dan serverPenempatan komponen; RAM, penyimpanan, atau interkoneksi yang diperlukanKebutuhan terverifikasiKarakteristik yang diperlukan tidak terdokumentasiDistribusi penting tidak mungkin dilakukan
Anggaran dan jadwalPaket, lot, kartu, hari, total USD, dan jadwal lengkapBatas dan jendela terpenuhiDurasi masih bersifat hipotetisAnggaran atau tenggat terlampaui

Sumber teknis: Lembar beban kerja untuk inferensi · Ukur fase dan penghitung · Tetapkan kriteria kualitas · Rencanakan biaya eksperimen

03 /

Ketahui apa yang dihitung oleh hasil

Jumlah parameter sesuai dengan nilai yang Anda representasikan dalam perhitungan dense. Format menunjukkan jumlah bit per nilai. Hasil “Bobot saja” mengonversi volume ini menjadi Gio, lalu “Envelope indikatif” menambahkan cadangan Anda. Pilihan pelatihan atau adaptasi dalam alat ini tidak menerapkan pengali universal yang tersembunyi; ini mengajak Anda untuk mendokumentasikan pos-pos yang kurang.

Kesederhanaan ini memungkinkan peninjauan ulang asumsi. Ini juga menuntut Anda mengetahui apa yang berada di luar perhitungan: metadata kuantisasi, modul dari format lain, memori kerja, pemuatan sementara, dan penggunaan di luar proses. Kartu GPU yang diusulkan adalah kandidat untuk diperiksa, bukan jaminan bahwa model Anda akan berjalan di sana. Nama dan memori nominal sebuah kartu tidak menggambarkan bagian lain dari servernya.

Bobot dalam Gio = parameter × bit per nilai ÷ 8 ÷ 1.073.741.824
04 /

Baca satuan sebelum membandingkan kartu

Satu GB desimal sama dengan satu miliar byte; satu Gio sama dengan 2³⁰ byte. Katalog menampilkan kapasitas nominal dalam GB. Alat ini menerapkan konvensi desimal; untuk memvalidasi konfigurasi, catat juga kapasitas dalam byte yang dinyatakan oleh perangkat. Penghitung program Anda dapat ditampilkan dalam byte atau Gio. Konversikan besaran yang memiliki definisi sama sebelum membandingkan ukurannya; jangan mencampur memori nominal, memori bebas, dan puncak yang dicadangkan.

Contoh perhitungan: 24 miliar byte setara dengan sekitar 22,35 Gio. Hasil ini tidak menunjukkan jumlah memori bebas pada kartu 24 GB. Sistem, konteks eksekusi, dan alokasi lain dapat ikut terhitung. Pertahankan satuan dan lingkup dalam nama setiap kolom lembar uji Anda.

Sumber teknis: NIST — awalan biner dan desimal

05 /

Contoh Terperinci: Tujuh Miliar Parameter

Untuk 7 miliar parameter pada 16 bit, volume padat adalah 14 miliar byte, yaitu sekitar 13,04 GiB. Dengan cadangan yang dipilih sebesar 6 GiB, selubungnya menjadi 19,04 GiB. Perhitungan ini tidak membuktikan bahwa cadangan 6 GiB cocok untuk model Anda: justru itulah asumsi yang harus dikendalikan dengan input dan operasi yang dipilih.

Tabel ini mempertahankan cadangan yang sama untuk menunjukkan semata-mata efek aritmetika dari format bobot. Dalam eksekusi nyata, alokasi lain dapat berubah secara berbeda. Representasi empat bit sering kali mencakup informasi tambahan dan dapat membiarkan sebagian lapisan dalam format lain. Karena itu, jangan membaca baris terakhir sebagai puncak total yang dijamin.

Contoh teoretis — 7 miliar parameter padat, cadangan arbitrer 6 GiB
Format bobotVolume padat dalam byteBobot dalam GiB, dibulatkanBobot + cadangan dalam GiB
32 bit28 000 000 00026,0832,08
16 bit14 000 000 00013,0419,04
8 bit7 000 000 0006,5212,52
4 bit teoretis3 500 000 0003,269,26

Sumber teknis: Transformers 5.17 — format dan batasan bitsandbytes

06 /

Membangun cadangan yang dapat dijelaskan

Uraikan cadangan alih-alih memilih persentase berdasarkan kebiasaan. Dalam inferensi autoregresif, catat arsitektur, cache, token yang dipertahankan, dan sekuens simultan. Dalam pelatihan, catat parameter yang dipelajari, gradien, optimizer, aktivasi, dan buffer. Panjang input dan microbatch adalah bagian dari lembar catatan, bahkan ketika jumlah parameter tidak berubah.

Sebagian pos tidak mencapai maksimumnya pada waktu yang sama. Penjumlahan margin maksimum yang independen dapat berfungsi sebagai selubung konservatif jika dinyatakan demikian, tetapi itu bukan puncak yang teramati. Catat pos yang diestimasikan, yang diukur, dan yang masih belum diketahui. Panduan cache KV merinci salah satu perhitungan ini; berkas memori menempatkan kembali penghitung dalam fase-fase program.

Lembar cadangan yang harus diisi untuk beban kerja Anda
Pos yang harus didokumentasikanInput yang diperlukanBukti yang diharapkan
Cache generasiKepala KV, lapisan, token, sekuens, formatPerhitungan yang disesuaikan dengan arsitektur lalu pengukuran
AktivasiMicrobatch, panjang, arsitektur, checkpointingPuncak pada input yang dipilih
Gradien dan optimizerParameter yang dilatih, format, metodePembaruan penuh pertama
Pemuatan, validasi, dan eksporProsedur dan ukuran keluaranPemeriksaan setiap fase yang diperlukan
07 /

Validasi secara bertahap tanpa diam-diam mengubah tugas

Mulailah dengan input pendek dan batch kecil untuk menemukan kesalahan persiapan. Lanjutkan kemudian ke input yang biasa lalu ke batas yang benar-benar Anda perlukan. Jika program memotong data, mempertahankan lebih sedikit token, atau melewati sebagian korpus, kasus yang berhasil tidak memvalidasi beban kerja yang dinyatakan. Catat dimensi yang benar-benar dieksekusi.

Catat puncak per fase dan per GPU dengan penghitungnya. Memori yang dialokasikan untuk tensor dan memori yang dicadangkan oleh allocator PyTorch tidak dijumlahkan. Pembacaan sistem dapat mencakup lebih dari proses yang diinstrumentasikan. Jika beberapa lot dipertimbangkan, dokumentasikan distribusi perangkat lunaknya; dua kartu tidak otomatis membentuk satu ruang memori tunggal.

Sumber teknis: PyTorch — manajemen memori CUDA

08 /

Memutuskan setelah pelanggaran pertama

Kegagalan saat pemuatan mengarah ke bobot, format, atau alokasi sementara. Kegagalan saat generasi menuntut pemeriksaan konteks dan konkurensi. Kegagalan saat backward pass dapat mengarah ke microbatch, aktivasi, atau strategi komputasi. Pelokalan ini menghindari mengubah presisi, model, dan data secara acak pada saat yang sama.

Setelah setiap koreksi, verifikasi kualitas dan cakupan yang tercakup. Mengurangi panjang yang diperlukan bisa jadi tidak dapat diterima; mengubah kuantisasi dapat mengubah keluaran. Jika kapasitas lain diperlukan, kembalilah ke katalog dengan lembar catatan yang merinci puncak yang teramati, margin yang beralasan, versi, dan input batas. Margin tanpa alasan tidak lebih andal daripada hasil yang dibulatkan hingga satuan GB terdekat.

09 /

Pilihan singkat, dengan persyaratan yang sama

Untuk inferensi ilustratif 7 miliar parameter pada 16 bit dan cadangan 6 GiB, contoh terperinci menghasilkan 19,04 GiB. Anda dapat mempertimbangkan RTX 4090 24 GB atau RTX 6000 Ada 48 GB. Penawaran yang dinyatakan untuk satu lot satu kartu selama 3 hari masing-masing adalah 47,14 USD dan 55,71 USD. Ini adalah dua kandidat dengan kapasitas berbeda: konteks, konkurensi, memori yang benar-benar tersedia, kompatibilitas, dan kualitas masih perlu diverifikasi. Harga-harga ini tidak menetapkan peringkat kecepatan apa pun.

Untuk adaptasi, gunakan kembali kisi yang sama dengan parameter yang telah dipelajari dan fase tambahan: lintasan mundur, pembaruan pertama, validasi, dan ekspor. Jumlah parameter LoRA tidak cukup untuk memvalidasi memori total. Alur fine-tuning membantu mengualifikasi hasil; batch dan akumulasi berfungsi mendokumentasikan pembaruan yang sebanding.

Jika Anda mencari alternatif setelah kelebihan beban, lokalisasi fase yang bermasalah dan pertahankan persyaratan keluaran Anda. Bandingkan satu perubahan saja pada satu waktu: kapasitas, cache, microbatch, atau presisi. Format yang berbeda harus mengembalikan kualitas minimum yang telah ditetapkan. Jika kebutuhan Anda menuntut aplikasi terkelola, RAM yang presisi, atau interkoneksi yang tersertifikasi, lembar GPU saja membuat keputusan masih perlu dikonfirmasi. Dua kartu memerlukan penempatan perangkat lunak yang terverifikasi; memorinya tidak otomatis menjadi satu ruang tunggal.

Sumber teknis: RTX 4090 — batch, kapasitas, dan paket · RTX 6000 Ada — batch, kapasitas, dan paket · Kualitas setelah kuantisasi · Mempersiapkan adaptasi · Menentukan batch dan akumulasi

10 /

Mempertahankan perhitungan dengan yang mengonfirmasinya

Simpan hipotesis awal, tabel pos, prosedur, dan catatan mentah. Bedakan antara estimasi, penghitung terukur, dan keputusan komersial. Notebook IteraGPU Lab membantu memahami instrumentasi ini pada jaringan kecil; ini tidak menggantikan uji coba model Anda. Contoh numerik di halaman ini adalah perhitungan, tanpa throughput atau konsumsi GPU yang diklaim teramati.

Keluaran penentuan ukuran yang baik cukup dalam satu lembar: model dan revisi, tugas, presisi, panjang, microbatch atau konkurensi, memori per GPU, dan kondisi pengukuran. Tambahkan apa yang dapat membatalkan kesimpulan, misalnya jendela yang lebih panjang atau evaluasi yang berbeda. Anda kemudian dapat memilih paket yang sesuai dengan kampanye, alih-alih mengulang seluruh estimasi untuk setiap varian.

Pertanyaan praktis

Apakah cadangan yang disarankan alat dihitung dari model saya?

Tidak. Cadangan adalah nilai yang Anda pilih sendiri. Alat ini tidak mengetahui arsitektur maupun masukan eksekusi Anda; gunakan untuk membuat hipotesis Anda eksplisit, lalu bandingkan dengan fase yang terukur.

Mengapa amplop di bawah 24 GB masih bisa gagal?

Estimasi dapat melewatkan beberapa pos dan menggunakan GiB sementara kapasitas nominal dinyatakan dalam GB. Puncak transien, proses lain, atau masukan berbeda juga dapat berpengaruh. Bandingkan satuan dan cakupan, lalu lokalisasi fase yang gagal.

Bisakah saya menjumlahkan cadangan dan dua puncak PyTorch?

Tidak. Puncak tensor yang dialokasikan dan puncak memori cadangan bukan dua pos independen yang dapat dijumlahkan. Puncak yang terpisah dapat terjadi pada waktu yang berbeda. Pertahankan namanya dan gunakan metode memori untuk menafsirkannya.

Bisakah saya meminta daftar atau alternatif tanpa sudah mengukur model saya?

Ya, untuk menetapkan kandidat bersyarat. Jelaskan beban dan kendala yang harus tetap sama. Perhitungan memori dan lembar komersial memungkinkan seleksi awal; kriteria wajib yang belum terverifikasi masih perlu dikonfirmasi sebelum memilih penawaran.