Uygulamanızın gerçekte ne yaptığını ölçmek
Halihazırda GPU'da bulunan tensörler üzerinde yapılan bir test yalnızca hesaplamayı tanımlar. Bir servis veya bir eğitim ayrıca girdilerini çözmeli, hazırlamalı ve transfer etmelidir. Bu nedenle iki ölçüm oluşturun: yalıtılmış hesaplama döngüsü ve olağan verilerinizden başlayan bir döngü. Aradaki fark, iyileştirmenin nerede aranacağını gösterir. Bir süreyi kaydetmeden önce GPU işinin gerçekten bitmesini bekleyin; CUDA başlatmaları genellikle asenkron çalışır.
Batch'i kontrol değişkeni olarak kullanmak
Çevrimdışı çıkarım için girdilerin uzunluğunu ve türünü koruyarak birkaç batch boyutunu karşılaştırın. Etkileşimli bir uygulama için tek bir isteğin gecikmesini ve en yavaş isteklerin gecikmesini de ölçün. İşlenen hacmi en üst düzeye çıkaran batch, beklemeyi daha az kabul edilebilir hale getirebilir. 80 GB'da, boyutlandırmayı model yüklemesinde durdurmak yerine önbellek veya aktivasyonlar için yer ayırın.
Ağırlıkların ve hesaplamanın hassasiyetini ayrı ayrı kaydedin. Düşük bir formatta saklanan bir model, çalışma sırasında hâlâ daha yüksek hassasiyetli buffer'lar veya işlemler kullanabilir.
H100 varyantlarını birbirine karıştırmadan karşılaştırmak
Bu sayfa H100 PCIe 80 GB ile ilgilidir. Bir H100 SXM'in veya birden çok karttan oluşan bir kümenin sonuçları bu konfigürasyonu otomatik olarak tanımlamaz. Mimariniz için CUDA, PyTorch ve özel kütüphaneleri doğrulayın, ardından karşılaştırılan GPU'lar için ortak bir tarif seçin. 80 GB yeterli değilse H200'ü inceleyin; ihtiyaç 48 GB'a sığıyorsa L40S'i ekonomik karşılaştırmanıza ekleyin.
Pipeline odaklı bir sipariş hazırlamak
Üç gün, hesaplama ve aktarım payını belirlemeye yardımcı olabilir. Yedi gün, düzeltmeleri test etmeye ve ölçümleri yinelemeye olanak tanır. Otuz gün, planlanmış bir çıkarım kampanyasına veya eğitime eşlik eder. Süre ve miktarı seçin, ortamınızı, ardından takip bilgilerinizi girin. Siparişin kripto talimatları ağı ve tutarı belirtir; «Ödedim» düğmesi transferinizi bildirir.