GPU untuk riset ML · Pembayaran kripto tanpa KYC
IteraGPU
Metode / Presisi dan kompromi

Pilih kuantisasi berdasarkan hasilnya, bukan berdasarkan bitnya.

Kuantisasi bermanfaat jika ia menjaga kualitas Anda sekaligus memperbaiki kendala nyata: memori, latensi, atau anggaran yang dikomitmenkan. Bandingkanlah dengan acuan menggunakan masukan yang sama, lalu catat secara terpisah format bobot, presisi komputasi, dan cache. Berkas yang diiklankan sebagai empat bit tidak berarti seluruh eksekusi menggunakan empat bit, maupun bahwa eksekusi tersebut akan lebih cepat. Keputusan harus tetap terkait dengan beban yang terukur.

01 /

Menjelaskan varian di luar jumlah bit-nya

Sebutkan metode, implementasinya, versinya, dan revisi artefak yang tepat. Dua varian empat bit dapat menggunakan representasi, grup, metadata, dan kernel yang berbeda. Pisahkan format penyimpanan bobot dari format operasi komputasi. Catat pula modul yang dipertahankan pada presisi lain dan setiap pengalihan ke CPU.

Dalam bitsandbytes, lapisan linear terkuantisasi menggantikan sebagian lapisan biasa; modul lainnya mengikuti dtype yang dikonfigurasi. Perilaku ini dengan sendirinya tidak menggambarkan puncak proses. Bacalah konfigurasi efektif setelah pemuatan, lalu pastikan varian tersebut benar-benar menjalankan pemrosesan yang diharapkan alih-alih fallback perangkat lunak yang berbeda.

Manifes minimal untuk membandingkan dua artefak terkuantisasi
BidangYang perlu dicatatKekeliruan yang dihindari
AsalModel, revisi, tokenizer, metode, dan versiMembandingkan dua model berbeda dengan nama yang sama
BobotFormat, bit, grup, dan modul yang dikecualikanMenganggap empat bit sebagai resep tunggal
KomputasiDtype, kernel, dan perangkat yang benar-benar digunakanMengacaukan penyimpanan dan eksekusi
GenerasiCache, konteks, batas keluaran, dan konkurensiMengaitkan efek yang berasal dari cache dengan bobot
PembuatanKalibrasi yang mungkin dilakukan dan revisi dataMelupakan bagaimana artefak tersebut dihasilkan

Sumber teknis: Hugging Face Transformers 5.17 — lapisan terkuantisasi dan dtype lainnya

02 /

Memisahkan kalibrasi dan evaluasi

Sebagian metode menggunakan contoh untuk mempersiapkan kuantisasi. Prosedur GPTQ yang didokumentasikan dalam Transformers antara lain memerlukan set kalibrasi dan tokenizer. Set ini ikut serta dalam pembuatan artefak: ia bukan bukti kualitas yang independen. Metode lain mengikuti jalur berbeda; jangan berasumsi bahwa protokol kalibrasi yang sama berlaku untuk semua format.

Sisihkan contoh kalibrasi dalam data yang diizinkan untuk mempersiapkan model, lalu catat identitas, asalnya, panjangnya, dan transformasi yang diterapkan. Simpan validasi untuk memilih pengaturan, dan uji akhir untuk konfirmasi. Jika Anda memilih beberapa set kalibrasi setelah membandingkan skornya, pencarian ini merupakan bagian dari pengembangan dan harus dicatat dalam laporan.

Sumber teknis: Hugging Face Transformers 5.17 — kalibrasi kuantisasi GPTQ · Membangun partisi sesuai perannya

03 /

Menghitung batas bobot tanpa menjualnya sebagai puncak

Ambil contoh model fiktif dengan tiga miliar parameter, semuanya disimpan pada jumlah bit yang sama. Volume kasarnya dihitung dengan parameter × bit / 8. Pada 16 bit, diperoleh 6 miliar byte; pada 8 bit, 3 miliar; pada 4 bit, 1,5 miliar. Angka-angka ini adalah aritmetika ilustratif, bukan ukuran artefak yang teramati maupun kebutuhan model yang dijalankan.

Selisih kasar antara 16 dan 4 bit adalah 4,5 GB, yaitu sekitar 4,191 GiB. Ini mengecualikan skala, metadata, modul yang tidak terkuantisasi, cache, dan berkas sementara. Ini memungkinkan perumusan hipotesis memori yang perlu diperiksa, tanpa memprediksi pembagian puncak dengan empat. Dossier memori menjelaskan cara memisahkan fase dan menafsirkan penghitung.

Volume kasar dalam byte = parameter × bit / 8. Volume dalam GiB = byte / 2³⁰.
Perhitungan ilustratif untuk 3 miliar parameter yang disimpan secara seragam — di luar biaya tambahan
Format yang diasumsikanByte kasarGB desimalPerkiraan GiB
16 bit6 000 000 00065,588
8 bit3 000 000 00032,794
4 bit1 500 000 0001,51,397

Sumber teknis: NIST — awalan biner dan desimal · IteraGPU — estimasi dan puncak memori

04 /

Mengubah bobot sebelum mengubah cache

Mulailah dengan acuan yang perilakunya Anda ketahui. Bandingkan kemudian varian bobot dengan cache yang sama, panjang yang sama, batch yang sama, atau konkurensi yang sama. Jika Anda juga mengubah parameter tersebut, Anda membandingkan konfigurasi lengkap: nyatakanlah hal itu dan jangan mengaitkan seluruh selisih pada kuantisasi bobot.

Cache KV itu sendiri dapat dikuantisasi jika model dan mesin memungkinkan. Ini adalah pilihan yang terpisah. Dokumentasi Transformers khususnya menunjukkan bahwa cache terkuantisasi dapat merugikan latensi untuk konteks pendek ketika masih tersedia cukup memori. Uji perubahan kedua ini dalam rangkaian terpisah; memori yang lebih hemat tidak menjamin waktu tunda yang lebih baik.

Sumber teknis: Hugging Face Transformers 5.17 — cache KV terkuantisasi dan kompromi latensi

05 /

Contoh aturan kualitas: penurunan kecil pun bisa tetap tidak dapat diterima

Berikut ilustrasi keputusan, tanpa eksekusi model. Sebuah proyek mengevaluasi 200 dokumen dan menetapkan sebelum pengujian kerugian maksimal satu poin persentase terhadap referensi. Proyek itu juga menuntut setidaknya 90% keberhasilan pada 20 dokumen kritis yang termasuk dalam 200 dokumen tersebut. Sebuah dokumen diterima hanya jika semua kolom wajibnya benar.

Nilai fiktif di bawah ini membuat A dapat diterima berdasarkan kedua aturan tersebut: 94% alih-alih 95%, dan 18/20 pada kelompok kritis. B gagal pada keduanya. Kita belum bisa menyatakan A menang: baik puncak memori maupun durasi tidak diberikan. Selain itu, total tidak menunjukkan dokumen mana yang berubah; periksa kesalahan yang berpasangan untuk mendeteksi regresi penting yang baru.

Kerugian A = 95 − 94 = 1 poin; kerugian B = 95 − 92 = 3 poin. Satu poin persentase bukanlah penurunan relatif sebesar 1%.
Kualitas fiktif untuk menjelaskan ambang batas; tidak ada performa GPU yang diukur
VarianDokumen diterimaTingkat keseluruhanKasus kritis yang diterimaPutusan menurut aturan ini
Referensi190 / 20095 %19 / 20 = 95 %Titik perbandingan
A188 / 20094 %18 / 20 = 90 %Dapat diterima pada kualitas
B184 / 20092 %16 / 20 = 80 %Ditolak

Sumber teknis: Periksa kesalahan alih-alih hanya total

06 /

Jalankan perbandingan yang selisihnya dapat dijelaskan

Siapkan dulu kontrak perbandingan, lalu berkas hasil. Protokol berikut harus dijalankan pada beban kerja Anda; angka-angka sebelumnya tidak menggantikannya. Jika suatu varian tidak dapat dimuat atau tidak memiliki operator yang diperlukan, simpan kegagalan itu sebagai informasi kompatibilitas.

  • Tetapkan korpus, referensi, model, tokenizer, prompt, dan aturan keluaran; pastikan kasus panjang dan sulit tetap teridentifikasi.
  • Catat kalibrasi, artefak yang diekspor, dan konfigurasi efektif. Periksa perangkat yang digunakan dan kemungkinan transfer CPU/GPU.
  • Pisahkan pembuatan, pemuatan, pemanasan, dan pemrosesan yang telah stabil. Gunakan batas pengukuran yang sama dan simpan pengulangan mentah.
  • Catat puncak per perangkat dan per fase; pisahkan allocated dan reserved. Jangan menjumlahkan penghitung ini dan jangan mengurangkan nilai maksimumnya yang independen.
  • Evaluasi format, konten, dan subkelompok yang disepakati, lalu cocokkan kesalahan berdasarkan pengenal.
  • Muat ulang artefak yang dipilih dalam proses baru dan jalankan kembali kontrol yang telah ditetapkan. Hasil yang diperoleh sebelum ekspor tidak otomatis memvalidasi pemuatan ulang.

Sumber teknis: Mengukur memori dengan benar · Menetapkan pengulangan dan pengukuran waktu

07 /

Menghubungkan kompromi dengan biaya yang dikeluarkan

Penghematan memori dapat memperluas konfigurasi yang mungkin dipertimbangkan, memungkinkan lebih banyak konkurensi, atau sekadar menyisakan margin. Hal itu tidak otomatis mengurangi pengeluaran. Jika periode, paket yang dipesan, dan hasil yang diterima tetap sama, biaya paket tetap sama, meskipun satu proses lebih cepat.

Sertakan dalam jadwal kemungkinan kalibrasi, kuantisasi, evaluasi, percobaan yang ditolak, dan pemuatan ulang. Lalu bandingkan paket lengkap 3, 7, atau 30 hari di antara opsi yang memenuhi kriteria Anda. Rasio per korpus yang berguna hanya dapat dihitung dengan korpus yang benar-benar selesai dan diterima; pengulangan pengukuran waktu tidak menghasilkan hasil baru.

Jika satu penyewaan digunakan untuk membandingkan beberapa varian, jumlahnya adalah pengeluaran bersama kampanye. Jangan secara mental membebankan seluruh paket ke setiap varian lalu menjumlahkan jumlah tersebut sebagai pengeluaran nyata yang terpisah. Untuk mengalokasikan porsi analitis, nyatakan konvensinya; hal itu tidak mengubah total yang dikeluarkan.

Sumber teknis: IteraGPU — paket penuh dan biaya satu eksperimen

08 /

Menyimpulkan dengan satu konfigurasi dan batasannya

Keputusan akhir menyebutkan artefak, lingkungan, beban kerja yang dicakup, kriteria kualitas yang terpenuhi, dan kendala yang diperbaiki. Jika varian-variannya berdekatan, pertahankan ketidakpastian itu dan utamakan pilihan yang Anda tahu dapat dimuat ulang dan dijelaskan. Jumlah bit saja bukanlah urutan preferensi.

Kesimpulan pada korpus pendek tidak otomatis berlaku untuk konteks panjang, bahasa lain, atau lebih banyak permintaan simultan. Kuantisasi yang dipilih untuk inferensi juga tidak menentukan parameter yang dapat dilatih dalam sebuah fine-tuning. Pisahkan pertanyaan-pertanyaan ini dan konfirmasikan varian yang dipilih pada test yang disisihkan.

Pertanyaan praktis

Apakah empat bit selalu mengonsumsi empat kali lebih sedikit memori daripada enam belas bit?

Volume mentah bobot yang disimpan secara seragam mengikuti rasio tersebut. Puncak total juga mencakup metadata, modul dengan format lain, cache, dan berkas sementara. Ukur eksekusi sebenarnya sebelum mengumumkan penghematan secara keseluruhan.

Bisakah saya mengkalibrasi kuantisasi dengan test akhir saya?

Test tersebut kemudian akan ikut serta dalam pembuatan artefak dan tidak lagi menjadi evaluasi independen. Siapkan kalibrasi dengan himpunan yang diizinkan untuk pengembangan, lalu simpan konfirmasi yang disisihkan.

Apakah varian yang lebih kecil pasti lebih murah untuk dijalankan?

Tidak. Anggaran bergantung pada periode dan batch yang dipesan, pada persiapan, dan pada hasil berguna yang diterima. Pengurangan memori tanpa perubahan elemen-elemen ini dapat meningkatkan margin tanpa mengurangi jumlah sewa.