Çok modlu bir iş yükünü adımlara bölmek
Görsel-metin zincirinde görselin ön işlemesini, kodlanmasını, bağlam hazırlığını ve son üretimi birbirinden ayırın. Her adımın farklı bir zirvesi olabilir. Faydalı bir test seti, birden çok çözünürlüğü ve istek başına görsel sayısını, uzunluğu sabitlenmiş çıktılarla birlikte içerir. Uygulamanız için gerçekten önemli olan kazancı belirlemek üzere yanıt kalitesini ve her adımın süresini kaydedin.
48 GB'a kesin bir rol vermek
Bu kapasite, birden çok bileşeni GPU'da tutmayı veya 24 GB'lık bir kartı doyuran bir batch'i büyütmeyi mümkün kılabilir. Bu faydayı doğrulayın, belleği hedefsiz doldurmayın. Bileşenler ardışık olarak kullanılıyorsa, bunların eş zamanlı bulunmasını adım adım yükleme ile karşılaştırın. Aktarım ve yeniden yükleme, yürütme sonunda sığsa bile gecikmeyi değiştirebilir.
Bir LoRA uyarlaması için rank, hedeflenen modüller, temel modelin hassasiyeti ve örnek uzunluğunu not edin. Eğitilen parametre sayısının az olması, aktivasyonlar için gereken belleği ortadan kaldırmaz.
CUDA'yı ve gerçekten kullanılan formatları hazırlayın
PyTorch derlemenizin ve dikkat veya niceleme eklentilerinizin Ada uyumluluğunu doğrulayın. Donanımın duyurduğu bir formatın seçtiğiniz motor tarafından etkinleştirildiğini varsaymayın. Hedef 24 GB içinde kalıyorsa, aynı çıkarım hizmetinde bir L4 ile karşılaştırın. 48 GB bağlamı veya eğitimi sınırlıyorsa, A100 SXM aynı tarifle değerlendirilecek 80 GB'lık bir kapasite sunar.
Kiralama için beklenen sonucu tanımlayın
Üç günde adımların bellek profilini çıkarın. Yedi günde seçilen batch'leri veya uyarlamaları karşılaştırın. Otuz günde sonuçların üretimini ve düzenli değerlendirmelerini planlayın. L40S'i, süreyi ve miktarı seçin, ardından istediğiniz ortamı belirtin. Yazılımlar ve işlemler üzerindeki kontrol sizde kalır; IteraGPU dosyalarınızın, prompt'larınızın veya hesaplamalarınızın içeriğini incelemez.