ML araştırması için GPU · KYC'siz kripto ödeme
IteraGPU
Kullanım · Çıkarım

Gerçek istekleriniz için bir GPU seçin.

Bir çıkarım GPU'su seçmek için, modelinizin öngörülen istekleri kabul edilebilir kalitede tamamladığını doğrulayın, ardından beklenen eşzamanlılık altında belleği ve gecikmeleri ölçün. Yalnızca ağırlıklar yeterli değildir: giriş uzunluğu, üretim ve eşzamanlı istekler yükü değiştirir. IteraGPU, bu ihtiyaca göre karşılaştırılacak yapılandırmalar sunar; modelinizin kapasitesi veya hızı tek başına kartın adından çıkarılamaz.

01 /

İşlem hızı aramadan önce faydalı sonucu tanımlamak

Etkileşimde, ilk token beklemesini ve tam yanıt beklemesini ölçün. Çevrimdışı bir derlem için, beklenen tüm çıktıları elde etmek için gereken süreyi ölçün. Her iki durumda da kabul kuralını belirleyin: bilinen yanıtlarda doğruluk, bir sıralamanın kalitesi veya doğrulanmış alan çıkarımı. Sözdizimsel olarak geçerli bir JSON yine de yanlış bir yanıt içerebilir.

Araçlarınız izin verdiğinde, kuyruktaki bekleme, işleme ve istemcinizin gözlemlediği uçtan uca yolu ayırın. Motora içkin bir ölçüm, uygulamanınkiyle aynı sınırlara sahip değildir. vLLM metrik belgeleri özellikle bekleme, ilk token ve toplam süreyi ayırt eder: hangi motoru seçerseniz seçin, kayıtlarınızda bu ayrımı koruyun.

Teknik kaynaklar: vLLM — istek ve gecikme metrikleri

02 /

İsteklerinizi seçim kriterlerine dönüştürmek

Sabit tanımlayıcılarla kısa, olağan ve uzun girdiler hazırlayın. Modeli, tokenizer'ı, sohbet şablonunu ve üretim parametrelerini koruyun. Uygulama tarafından eklenen geçmiş ve belgeler dahil, gerçekten iletilen token'ları sayın. İstenen batch'i, gönderilen eşzamanlılığı ve gerçekten eşzamanlı işlenen istekleri ayrı ayrı kaydedin: bunlar mutlaka aynı sayılar değildir.

Aynı model ve aynı girdiler: belgelenecek parametreler, ölçümler ve kararlar
Belirlenecek girdiÖlçüm ve birimSeçim için sonuç
Tam prompt ve çıkış sınırıİstek başına giriş ve çıkış token'larıUzun durumları ve sınırda kesilen yanıtları doğrulayın
Eşzamanlı istekler ve varış hızıEtkin, bekleyen ve tamamlanan isteklerGereken gecikmeyle sürdürülebilir yükü belirleyin
Hassasiyet, nicemleme ve önbellekGPU başına bellek zirvesi, bayt veya Gio cinsindenÖngörülen yükte belleği aşan ayarları eleyin
Kalite kuralı ve referanslarKabul edilen çıktılar / beklenen çıktılar; iş metriğiYalnızca aynı ölçütü karşılayan varyantları karşılaştırın
Kronometre kapsamıİlk token, tam yanıt veya korpus: saniyeAynı sınırlara sahip süreleri karşılaştırın
Dosyalar alınana kadarki takvimSaat veya gün cinsinden toplam pencereArdından 3, 7 veya 30 günlük bir paket seçin
03 /

Belleği bağlam ve eşzamanlılıkla ölçün

Token token üreten otoregresif bir modelde KV önbelleği dikkat durumlarını saklar. Boyutu modele ve saklanan tokenlara bağlıdır. Dinamik bir önbellek üretim sırasında büyüyebilir; statik bir önbellek azami bir boyut ayırır. Bazı kayan pencere katmanları bu büyümeyi sınırlar. Bu nedenle öngörülen uzunlukları ve eşzamanlılığı gerçekten kullanılan stratejiyle test edin.

Ağırlık nicelemesi ile önbellek nicelemesi iki ayrı seçimdir. Örneğin bitsandbytes bazı doğrusal katmanları nicelenmiş sürümlerle değiştirir; bu, çalıştırmanızdaki tüm ayırmaları tanımlamaz. Hassasiyet değişikliğinden sonra tüm tepe noktasının aynı oranda azaldığını varsaymak yerine belleği ve kaliteyi yeniden doğrulayın.

PyTorch ile ayrılan tensörlerin tepe noktasını ve ayırıcının ayırdığı belleğin tepe noktasını ayrı ayrı kaydedin. Bunları toplamayın. Ölçülen GPU'yu ve birimi belirtin: 1 GiB, 2³⁰ bayta karşılık gelir. Bu sayaçlar cihazın tüm doluluğunu mutlaka temsil etmez. Bellek klasörü sınırlarını ayrıntılı olarak açıklar.

Teknik kaynaklar: Hugging Face Transformers 5.17 — KV önbellek stratejileri · Hugging Face Transformers 5.17 — bitsandbytes nicelemesi · PyTorch 2.14 — CUDA bellek yönetimi ve sayaçları

04 /

300 belge üzerinde ölçülebilir bir deneme

Yetkili korpunuzla gerçekleştirilecek örnek: 300 belgeden tarih, tutar ve kategori çıkarın. Beklenen değerleri gözden geçirin, eksik alanların işlenişini belirtin ve kabul eşiğini denemeden önce sabitleyin. Belge sayısı protokolü tanımlar; hiçbir süre, puan veya hız varsayılmaz.

  • 300 tanımlayıcıyı, model revizyonunu, promptları, token sınırlarını ve ayrıştırma kuralını sabitleyin. Uzun belgeleri bilançoda tanımlanabilir tutun.
  • Bir referansı tek seferde bir istekle çalıştırın. Yükleme, ısınma ve ölçümü ayırın; belge başına tahminleri ve hataları saklayın.
  • Ardından tek bir parametreyi artırın: toplu işleme için batch veya istek motoru için eşzamanlılık. Aynı girdileri ve kalite ölçütlerini koruyun.
  • Her geçiş için süreyi, bellek tepe noktasını, yinelenmeden bulunan tanımlayıcı sayısını ve kabul edilen çıktıları kaydedin. Ölçümleri tekrarlayın ve ham değerleri dağılımlarıyla birlikte saklayın.
  • Bir varyant başarısız olursa nedeni kaydedin: bellek, kesme, biçim veya kalite. Azaltılmış bir batch veya bir yeniden başlatma, belgelenmesi gereken bir karar yaratır; silinecek bir başarısızlık değil.
Beklenen sonuç, çıktıları, hataları ve her ölçümün kapsamıyla birlikte eksiksiz değerlendirilmiş bir korpustur.

Teknik kaynaklar: IteraGPU — eşdeğer kalitede karşılaştırma için ayrıntılı protokol

05 /

IteraGPU Lab v1 kaynaklarını doğru kapsamda kullanın

Notebook ve beraberindeki betik, bir ağırlık hesabı ve küçük bir sentetik ağ üzerinde ölçüm sunar. Ölçüm kodları, yerel bir RTX 5070 üzerinde PyTorch 2.11.0 ile küçük bir float32 yapılandırmasında çalıştırılmıştır. Bu deneme söz konusu çalıştırma durumunu doğrular; ne bir LLM'i, ne bir KV önbelleğini, ne de katalogdaki GPU'ları istekleriniz üzerinde ölçer.

Notebook'u sayaçları anlamak için kullanın, ardından gerçek yükünüzü kendi ortamınızla ölçün. Kalite protokolü ve ham tablo, karşılaştırmayı hazırlamaya yarar. Dağıtılan notebook'un çıktıları ve CSV'nin sonuç satırları boş kalır; prosedür hiçbir model veya sürücü kurmaz. Çalıştırmadan önce README'deki ön koşulları okuyun.

06 /

Ölçümlerden bir teklife geçin

Seçim belgeniz uyumlu ortamı, kart başına belleği, bağlamı, eşzamanlılığı, elde edilen kaliteyi ve ölçülen süreleri bir araya getirmelidir. Bu ölçütleri karşılayan yapılandırmaları, ardından tam takvime göre 3, 7 ve 30 günlük paketleri karşılaştırın: hazırlık, işleme, değerlendirme, yeniden başlatmalar ve dışa aktarma. Benchmark dosyasının hesaplayıcısı tam paketi ve gerçekten doğrulanmış faydalı derlemleri kullanır.

Bu belgeyi ve kod sürümlerini defterinizde saklayın. Yazılımlarınızı ve işlemlerinizi siz seçersiniz; IteraGPU dosyalarınızın, promptlarınızın veya hesaplamalarınızın içeriğini incelemez. Sipariş sırasında bir ortam seçimi, hazırlık ihtiyacınızı ifade eder: modelinizin zaten kurulduğunun veya test edildiğinin kanıtı değildir.

Pratik sorular

24 GB çıkarım modelim için yeterli mi?

24 GB kapasite, model ve yük bilinmeden bu soruya yanıt vermek için yeterli değildir. Ağırlıkları, çalıştırma tahsislerini, bağlamı ve eşzamanlı istekleri birlikte kontrol edin. Yapılandırma, uzun durumları istenen kalitede tamamlamalıdır; yalnızca dosya boyutu veya ağırlık tahmini bunu kanıtlamaz.

Çevrimdışı bir derlem için hangi hız karşılaştırılmalı?

Önce aynı derlemi tamamlamak ve değerlendirmek için gereken süreyi karşılaştırın. Bir hız yayımlarsanız, kabul edilen faydalı çıktı sayısını, esas alınan süreyi ve hataları belirtin. Yanıt uzunluğu ve kalite kontrolü olmadan saniye başına token cinsinden bir hız, iki yapılandırmayı ayırt etmeye yetmez.

Bellek aşımı GPU değiştirmeyi gerektirir mi?

Bellek aşımı öncelikle ona neden olan ayarın ve girdinin belirlenmesini gerektirir. Batch, eşzamanlılık, uzunluk veya hassasiyeti projenin amacını koruyarak inceleyebilirsiniz. İşlenen belgeleri veya beklenen yanıtları değiştiren her azaltma yeni bir kalite doğrulaması gerektirir; bu kısıtların korunması gerekiyorsa daha fazla bellek gerekebilir.

Sağlanan notebook çıkarım uygulamamı doğrular mı?

Sağlanan notebook uygulamanızı doğrulamaz: küçük bir sentetik ağı ölçer ve bellek sayaçlarını açıklar. Belgelenen yerel test yalnızca bu durumu kapsar. Uygulamanız, herhangi bir kapasite veya performans sonucundan önce kendi modeli, girdileri, ortamı ve kabul ölçütleriyle değerlendirilmelidir.