Neyin değiştiğini ve neyin tekrar oluşturduğunu tanımlayın
Şu soruyla başlayın: Bir eğitimin başlatılmasının, veri sırasının, train/test bölünmesinin veya stokastik bir üretimin etkisini mi değerlendiriyorsunuz? Bir tohum rastgele bir üreteci kontrol eder; tek başına tüm bu boyutları tanımlamaz. Her çalıştırma için bir satır ve gerçekten değiştirilen faktörleri saklayın.
Aynı checkpoint'in aynı derlem üzerindeki deterministik değerlendirmesini on kez yeniden çalıştırmak on bağımsız eğitim üretmez. Aynı şekilde, tek bir modelden gelen bin tahmin, değişkenliklerini tahmin etmek için birden fazla eğitimin yerini tutmaz. Karara karşılık gelen tekrar birimini seçin.
Diziden önce ana metriği, yönünü ve değişikliği haklı çıkaracak asgari etkiyi belirleyin. Aşağıdaki örneklerde daha yüksek bir değer tercih edilir ve faydalı eşik örnek olarak 0 ile 100 arasında gösterilen bir metrikte 0,30 puandır. Bu eşik projenin kararından gelir, evrensel bir istatistik kuralından değil.
Yapılandırmaları ortak koşullarda eşleştirin
Bir i çifti için, referans A'yı ve aday B'yi aynı veri bölünmesinde ve öngörülen ortak koşullarla çalıştırın. Ardından dᵢ = score(Bᵢ) − score(Aᵢ) hesaplayın. Eşleştirme, sonuçlardan önce tanımlanmış bir karşılığa dayanır; sonradan birbirine benzeyen skorları ilişkilendirmekten ibaret değildir.
Aynı tohum listesini kullanmak çiftleri düzenlemeye yardımcı olabilir, ancak iki mimari rastgele sayıları farklı şekilde tüketebilir. Kodunuz bunları ayırt ediyorsa başlatma, veri ve üretim tohumlarını ayrı ayrı belirtin. Bölümleri veya kimliklerini de kaydedin: ortak bir tam sayı, verilerin aynı şekilde işlendiğini kanıtlamaz.
Bir çift bir başarısızlık içeriyorsa, her iki durumu da koruyun ve nasıl ele alınacağını açıklayın. Popülasyon değişimini belirtmeden başarılı beş adayın ortalamasını altı referansınkiyle karşılaştırmayın.
Teknik kaynaklar: NIST — eşleştirilmiş gözlemler arasındaki karşılık
Tohum ve determinizmin sınırlarını koruyun
PyTorch, aynı tohumla bile sürümler, platformlar veya CPU ile GPU çalıştırmaları arasında tamamen yeniden üretilebilir sonuçların garanti edilmediğini belirtir. Kılavuzu, üreteçlerin kontrolünü deterministik olmayan işlemlerin kontrolünden ayırır. Ortamı "sabit tohum" ile özetlemek yerine uygulanan sürümleri ve seçenekleri kaydedin.
Deterministik bir çalıştırma özellikle belirli koşullarda bir davranışı yeniden bulmaya yarar. Modelin diğer başlatmalara veya verilere dayandığını kanıtlamaz. Tersine, iki özdeş yeniden çalıştırma arasındaki bir fark, adayın etkisi olarak yorumlanmadan önce bir teşhis gerektirir.
Her iki varyant için aynı determinizm politikasını koruyun. Bir hatayı teşhis etmek için bunu değiştirirseniz, bu diziyi ayrı olarak tanımlayın. Deneysel sonuç, elde edildiği koşullara bağlı kalmalıdır.
Teknik kaynaklar: PyTorch 2.14 — yeniden üretilebilirlik ve rastgelelik kontrolü
Hesaplanmış örnek: beş eşleştirilmiş fark
İşte hesaplama için beş kurgusal çift; hiçbir eğitim çalıştırılmamıştır. Tohumlar örnek kimliklerdir. Referans ve aday burada aynı karşılaştırma protokolünü kullanır. Skorlar 100 üzerinden ifade edilir; farklar puandır, göreli yüzde değil.
Farkların ortalaması (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 puandır. Medyanı 0,30 puandır ve aralığı 0,10 ile 0,50 arasındadır. Farkların örneklem standart sapması, n − 1 paydasıyla yaklaşık 0,179 puandır. Beş işaret de pozitiftir, ancak genlik ortalama kazanca göre hâlâ büyüktür.
| Örnek tohum | Referans A | Aday B | B − A |
|---|---|---|---|
| 17 | 71,0 | 71,4 | +0,4 |
| 29 | 71,6 | 71,9 | +0,3 |
| 43 | 71,3 | 71,4 | +0,1 |
| 71 | 70,8 | 71,3 | +0,5 |
| 101 | 71,8 | 71,9 | +0,1 |
Bir aralığı aşırı bir kapsam yüklemeden okuyun
Yaygın bir hesaplamayı göstermek için, farkların çiftler arasında bağımsız ve yaklaşık normal bir dağılımdan geldiğini varsayalım. Ortalamaları için %95'lik Student aralığı burada dört serbestlik derecesi kullanır: 0,28 ± 2,776 × 0,080, yani yaklaşık [0,058 ; 0,502] puan. Yalnızca beş çiftle dağılımın biçimini değerlendirmek zordur; hesaplama bu varsayımları doğru kılmaz.
Bu aralık örnekte sıfırın üzerindedir, ancak 0,30 puan olarak belirlenen fayda eşiğini kapsamaktadır. Dolayısıyla katı « ortalama kazanç 0,30 puanı aşıyor » kuralını desteklemez. Pozitif bir fark, değişikliği gerekçelendirmek için çok küçük veya çok belirsiz kalabilir.
%95'lik bir aralık, varsayımları altında bir kapsama prosedürünü tanımlar, hesaplamadan sonra parametreye bağlı %95'lik bir olasılığı değil. Burada yalnızca çiftlerin temsil ettiği varyasyonu kapsar; otomatik olarak başka bir alanı, başka bir külliyatı veya gelecekteki bir donanımı değil.
SciPy kullanıyorsanız, ttest_rel bağlı örnekleri karşılaştırır ve bir güven aralığı sunar. Dizilerin sırası işareti belirler: B − A için B'yi ilk sıraya koyun. Yalnızca bir p-değerini değil, değerleri ve kullanılan yöntemi saklayın.
Teknik kaynaklar: NIST — bir ortalama için güven aralığı · SciPy 1.18 — ttest_rel ve farkların aralığı
Kararı ve sonraki tekrarları hazırlamak
Örneğin sonucu « fayda sağlanamadı » değil, « yararlı kazanç kanıtlanmadı »dır. Değişikliğin maliyetine bağlı olarak referansı koruyabilir, veri toplamaya devam edebilir veya daha esaslı bir değişikliği test edebilirsiniz. Bu kuralı, seriyi gözünüzün önüne almadan önce duyurun. Fayda eşiğinizin üzerinde bir alt sınır, protokolün geri kalanı geçerli olmak kaydıyla benimsemeyi daha çok desteklerdi.
Tekrarları, gereken hassasiyet ve beklenen değişkenlikten yola çıkarak, başarısızlıklar için bir pay bırakarak planlayın. Evrensel olarak bir sonucu garanti eden bir tohum sayısı yoktur. Bir pilot, dağılımı tahmin etmeye yardımcı olabilir; onun keşifsel statüsünü koruyun ve ardından doğrulama prosedürünü sabitleyin.
Her çiftten sonra bakıp sonuç lehinize döner dönmez, sabit bir örneklem büyüklüğü için öngörülmüş bir aralık kullanarak durmaktan kaçının. Örneklem büyüklüğünü ve analizi önceden seçin ya da uygun bir sıralı yöntem kullanın. Yalnızca hayal kırıklığı yaratan adaya denemeler eklemek de karşılaştırmanın dengesini değiştirir.
Eğitim değişkenliği ile külliyat değerlendirmesini karıştırmamak
Sabit bir test kümesi üzerinde bir dizi tohum, bu küme üzerindeki eğitimlerin varyasyonu hakkında bilgi verir. Tek başına test örneklerinin seçimine bağlı belirsizliği ölçmez. Sorunuz bölümlemeleri veya alanları da kapsıyorsa, bu boyutları tek bir tekrar sayacında karıştırmadan değiştiren bir plan öngörün.
Nihai bir değerlendirmeyi model seçimlerinden uzak tutun. Aynı testle birçok varyant arasından seçim yapmak, orada tesadüfen iyi görünen seçenekleri kayırır. Alt gruplar ve tamamlayıcı metrikler kararı aydınlatmalı; sayıları ve keşifsel statüleri görünür olmalıdır.
Nihai çıktı, ham skorları, çiftleri, farkları, dağılımı, aralık yöntemini ve fayda eşiğine karşı kararı bir araya getirir. Başarısızlıkları ve genelleme sınırlarını da ekleyin. Böylece farkın size neden yeterli, yetersiz veya hâlâ karar verilemez göründüğünü açıklayabilirsiniz.
Teknik kaynaklar: scikit-learn — testi model seçimlerinden uzak tutmak
Pratik sorular
Seçim yapmak için beş tohum yeterli mi?
Beş tohum ilk bir gözlem için kullanılabilir, ancak yeterli hassasiyeti garanti etmez. Gereken sayı, değişkenliğe ve en küçük yararlı etkiye bağlıdır. Ham farkları ve belirsizliği inceleyin; hâlâ karar verilemez bir sonuç, sihirli bir sayı değil, daha iyi boyutlandırılmış bir protokol gerektirir.
Sıfırı içeren bir aralık denkliği kanıtlar mı?
Sıfırı içeren bir aralık denkliği kanıtlamaz. Önemli kazançlar veya kayıplarla da uyumlu olabilir. Pratik bir denkliği desteklemek için önceden kabul edilebilir bir marj belirleyin ve bu soruya uygun bir analiz kullanın; bunu incelemeye yetecek hassasiyetle.
Yalnızca en iyi tohumu yayımlayabilir miyim?
En iyi tohum, prosedürün tipik performansını değil, lehinize bir seçimi tanımlar. Öngörülen tüm tekrarları ve teslim edilen modelin seçim kuralını yayımlayın. Bu en iyi model değerlendirilecekse, onu seçmek için kullanılmamış nihai bir değerlendirme kullanın.