İşlem hızı aramadan önce faydalı sonucu tanımlamak
Etkileşimde, ilk token beklemesini ve tam yanıt beklemesini ölçün. Çevrimdışı bir derlem için, beklenen tüm çıktıları elde etmek için gereken süreyi ölçün. Her iki durumda da kabul kuralını belirleyin: bilinen yanıtlarda doğruluk, bir sıralamanın kalitesi veya doğrulanmış alan çıkarımı. Sözdizimsel olarak geçerli bir JSON yine de yanlış bir yanıt içerebilir.
Araçlarınız izin verdiğinde, kuyruktaki bekleme, işleme ve istemcinizin gözlemlediği uçtan uca yolu ayırın. Motora içkin bir ölçüm, uygulamanınkiyle aynı sınırlara sahip değildir. vLLM metrik belgeleri özellikle bekleme, ilk token ve toplam süreyi ayırt eder: hangi motoru seçerseniz seçin, kayıtlarınızda bu ayrımı koruyun.
Teknik kaynaklar: vLLM — istek ve gecikme metrikleri
İsteklerinizi seçim kriterlerine dönüştürmek
Sabit tanımlayıcılarla kısa, olağan ve uzun girdiler hazırlayın. Modeli, tokenizer'ı, sohbet şablonunu ve üretim parametrelerini koruyun. Uygulama tarafından eklenen geçmiş ve belgeler dahil, gerçekten iletilen token'ları sayın. İstenen batch'i, gönderilen eşzamanlılığı ve gerçekten eşzamanlı işlenen istekleri ayrı ayrı kaydedin: bunlar mutlaka aynı sayılar değildir.
| Belirlenecek girdi | Ölçüm ve birim | Seçim için sonuç |
|---|---|---|
| Tam prompt ve çıkış sınırı | İstek başına giriş ve çıkış token'ları | Uzun durumları ve sınırda kesilen yanıtları doğrulayın |
| Eşzamanlı istekler ve varış hızı | Etkin, bekleyen ve tamamlanan istekler | Gereken gecikmeyle sürdürülebilir yükü belirleyin |
| Hassasiyet, nicemleme ve önbellek | GPU başına bellek zirvesi, bayt veya Gio cinsinden | Öngörülen yükte belleği aşan ayarları eleyin |
| Kalite kuralı ve referanslar | Kabul edilen çıktılar / beklenen çıktılar; iş metriği | Yalnızca aynı ölçütü karşılayan varyantları karşılaştırın |
| Kronometre kapsamı | İlk token, tam yanıt veya korpus: saniye | Aynı sınırlara sahip süreleri karşılaştırın |
| Dosyalar alınana kadarki takvim | Saat veya gün cinsinden toplam pencere | Ardından 3, 7 veya 30 günlük bir paket seçin |
Belleği bağlam ve eşzamanlılıkla ölçün
Token token üreten otoregresif bir modelde KV önbelleği dikkat durumlarını saklar. Boyutu modele ve saklanan tokenlara bağlıdır. Dinamik bir önbellek üretim sırasında büyüyebilir; statik bir önbellek azami bir boyut ayırır. Bazı kayan pencere katmanları bu büyümeyi sınırlar. Bu nedenle öngörülen uzunlukları ve eşzamanlılığı gerçekten kullanılan stratejiyle test edin.
Ağırlık nicelemesi ile önbellek nicelemesi iki ayrı seçimdir. Örneğin bitsandbytes bazı doğrusal katmanları nicelenmiş sürümlerle değiştirir; bu, çalıştırmanızdaki tüm ayırmaları tanımlamaz. Hassasiyet değişikliğinden sonra tüm tepe noktasının aynı oranda azaldığını varsaymak yerine belleği ve kaliteyi yeniden doğrulayın.
PyTorch ile ayrılan tensörlerin tepe noktasını ve ayırıcının ayırdığı belleğin tepe noktasını ayrı ayrı kaydedin. Bunları toplamayın. Ölçülen GPU'yu ve birimi belirtin: 1 GiB, 2³⁰ bayta karşılık gelir. Bu sayaçlar cihazın tüm doluluğunu mutlaka temsil etmez. Bellek klasörü sınırlarını ayrıntılı olarak açıklar.
Teknik kaynaklar: Hugging Face Transformers 5.17 — KV önbellek stratejileri · Hugging Face Transformers 5.17 — bitsandbytes nicelemesi · PyTorch 2.14 — CUDA bellek yönetimi ve sayaçları
300 belge üzerinde ölçülebilir bir deneme
Yetkili korpunuzla gerçekleştirilecek örnek: 300 belgeden tarih, tutar ve kategori çıkarın. Beklenen değerleri gözden geçirin, eksik alanların işlenişini belirtin ve kabul eşiğini denemeden önce sabitleyin. Belge sayısı protokolü tanımlar; hiçbir süre, puan veya hız varsayılmaz.
- 300 tanımlayıcıyı, model revizyonunu, promptları, token sınırlarını ve ayrıştırma kuralını sabitleyin. Uzun belgeleri bilançoda tanımlanabilir tutun.
- Bir referansı tek seferde bir istekle çalıştırın. Yükleme, ısınma ve ölçümü ayırın; belge başına tahminleri ve hataları saklayın.
- Ardından tek bir parametreyi artırın: toplu işleme için batch veya istek motoru için eşzamanlılık. Aynı girdileri ve kalite ölçütlerini koruyun.
- Her geçiş için süreyi, bellek tepe noktasını, yinelenmeden bulunan tanımlayıcı sayısını ve kabul edilen çıktıları kaydedin. Ölçümleri tekrarlayın ve ham değerleri dağılımlarıyla birlikte saklayın.
- Bir varyant başarısız olursa nedeni kaydedin: bellek, kesme, biçim veya kalite. Azaltılmış bir batch veya bir yeniden başlatma, belgelenmesi gereken bir karar yaratır; silinecek bir başarısızlık değil.
Teknik kaynaklar: IteraGPU — eşdeğer kalitede karşılaştırma için ayrıntılı protokol
IteraGPU Lab v1 kaynaklarını doğru kapsamda kullanın
Notebook ve beraberindeki betik, bir ağırlık hesabı ve küçük bir sentetik ağ üzerinde ölçüm sunar. Ölçüm kodları, yerel bir RTX 5070 üzerinde PyTorch 2.11.0 ile küçük bir float32 yapılandırmasında çalıştırılmıştır. Bu deneme söz konusu çalıştırma durumunu doğrular; ne bir LLM'i, ne bir KV önbelleğini, ne de katalogdaki GPU'ları istekleriniz üzerinde ölçer.
Notebook'u sayaçları anlamak için kullanın, ardından gerçek yükünüzü kendi ortamınızla ölçün. Kalite protokolü ve ham tablo, karşılaştırmayı hazırlamaya yarar. Dağıtılan notebook'un çıktıları ve CSV'nin sonuç satırları boş kalır; prosedür hiçbir model veya sürücü kurmaz. Çalıştırmadan önce README'deki ön koşulları okuyun.
- IteraGPU Lab v1 bellek notebook'u
Bellek ölçümünü anlamak için hesaplamalar ve küçük sentetik ağ.
- Tamamlanacak kalite protokolü
Sabit girdiler, çıktı kabulü ve denemelerin karşılaştırılması.
- Boş ham tablo
Her gerçek geçiş için bir satır; parametreler, ölçümler ve karar.
- IteraGPU Lab v1 ön koşulları ve sınırları
Zaten gerçekleştirilmiş yerel denemenin talimatları ve kesin kapsamı.
Ölçümlerden bir teklife geçin
Seçim belgeniz uyumlu ortamı, kart başına belleği, bağlamı, eşzamanlılığı, elde edilen kaliteyi ve ölçülen süreleri bir araya getirmelidir. Bu ölçütleri karşılayan yapılandırmaları, ardından tam takvime göre 3, 7 ve 30 günlük paketleri karşılaştırın: hazırlık, işleme, değerlendirme, yeniden başlatmalar ve dışa aktarma. Benchmark dosyasının hesaplayıcısı tam paketi ve gerçekten doğrulanmış faydalı derlemleri kullanır.
Bu belgeyi ve kod sürümlerini defterinizde saklayın. Yazılımlarınızı ve işlemlerinizi siz seçersiniz; IteraGPU dosyalarınızın, promptlarınızın veya hesaplamalarınızın içeriğini incelemez. Sipariş sırasında bir ortam seçimi, hazırlık ihtiyacınızı ifade eder: modelinizin zaten kurulduğunun veya test edildiğinin kanıtı değildir.
Pratik sorular
24 GB çıkarım modelim için yeterli mi?
24 GB kapasite, model ve yük bilinmeden bu soruya yanıt vermek için yeterli değildir. Ağırlıkları, çalıştırma tahsislerini, bağlamı ve eşzamanlı istekleri birlikte kontrol edin. Yapılandırma, uzun durumları istenen kalitede tamamlamalıdır; yalnızca dosya boyutu veya ağırlık tahmini bunu kanıtlamaz.
Çevrimdışı bir derlem için hangi hız karşılaştırılmalı?
Önce aynı derlemi tamamlamak ve değerlendirmek için gereken süreyi karşılaştırın. Bir hız yayımlarsanız, kabul edilen faydalı çıktı sayısını, esas alınan süreyi ve hataları belirtin. Yanıt uzunluğu ve kalite kontrolü olmadan saniye başına token cinsinden bir hız, iki yapılandırmayı ayırt etmeye yetmez.
Bellek aşımı GPU değiştirmeyi gerektirir mi?
Bellek aşımı öncelikle ona neden olan ayarın ve girdinin belirlenmesini gerektirir. Batch, eşzamanlılık, uzunluk veya hassasiyeti projenin amacını koruyarak inceleyebilirsiniz. İşlenen belgeleri veya beklenen yanıtları değiştiren her azaltma yeni bir kalite doğrulaması gerektirir; bu kısıtların korunması gerekiyorsa daha fazla bellek gerekebilir.
Sağlanan notebook çıkarım uygulamamı doğrular mı?
Sağlanan notebook uygulamanızı doğrulamaz: küçük bir sentetik ağı ölçer ve bellek sayaçlarını açıklar. Belgelenen yerel test yalnızca bu durumu kapsar. Uygulamanız, herhangi bir kapasite veya performans sonucundan önce kendi modeli, girdileri, ortamı ve kabul ölçütleriyle değerlendirilmelidir.