Mengukur waktu yang benar-benar dilakukan aplikasi Anda
Uji pada tensor yang sudah ada di GPU hanya menggambarkan komputasi semata. Layanan atau pelatihan juga harus mendekode, menyiapkan, dan mentransfer inputnya. Karena itu, buatlah dua pengukuran: loop komputasi yang terisolasi dan loop yang dimulai dari data biasa Anda. Selisihnya menunjukkan di mana harus mencari peningkatan. Tunggu hingga pekerjaan GPU benar-benar selesai sebelum mencatat waktu; peluncuran CUDA sering kali asinkron.
Menggunakan batch sebagai variabel terkontrol
Untuk inferensi offline, bandingkan beberapa ukuran batch dengan mempertahankan panjang dan jenis input. Untuk aplikasi interaktif, ukur juga latensi satu permintaan dan latensi permintaan paling lambat. Batch yang memaksimalkan volume yang diproses dapat membuat waktu tunggu kurang dapat diterima. Pada 80 GB, sisihkan ruang untuk cache atau aktivasi daripada menghentikan penskalaan pada pemuatan model.
Catat presisi bobot dan komputasi secara terpisah. Model yang disimpan dalam format tereduksi masih dapat menggunakan buffer atau operasi berpresisi lebih tinggi selama eksekusinya.
Membandingkan tanpa menyamakan varian H100
Lembar ini membahas H100 PCIe 80 GB. Hasil dari H100 SXM atau kumpulan beberapa kartu tidak secara otomatis menggambarkan konfigurasi ini. Periksa CUDA, PyTorch, dan pustaka khusus untuk arsitektur Anda, lalu pilih resep yang sama untuk GPU yang dibandingkan. Jika 80 GB tidak cukup, pertimbangkan H200; jika kebutuhan tercukupi dalam 48 GB, tambahkan L40S ke perbandingan ekonomi Anda.
Menyiapkan pesanan yang berorientasi pipeline
Tiga hari dapat digunakan untuk mengidentifikasi porsi komputasi dan transfer. Tujuh hari memungkinkan pengujian koreksi dan pengulangan pengukuran. Tiga puluh hari mendampingi kampanye inferensi atau pelatihan yang terencana. Pilih durasi dan jumlah, isi lingkungan Anda, lalu koordinat pelacakan Anda. Instruksi kripto pesanan mencantumkan jaringan dan jumlah; tombol « Saya sudah bayar » menandai transfer Anda.