Çürütülebilecek bir hipotez yazma
«Modeli iyileştirmek» deneyi belirtmez. Bunun yerine şöyle yazın: «Sınıf ağırlıklandırma, nadir sınıflarda kaliteyi artırır ve sık sınıflarda kabul edilen regresyonu aşmaz.» Bir ana metriği, önemli alt grupları ve faydalı etki eşiğini belirtin. Öncelikli kalan kısıtı da sabitleyin: bellek, gecikme, girdi kapsamı veya model basitliği.
Ekleme ile çıkarmayı birbirinden ayırın. Basit bir referansa bir bileşen eklemek, o bileşenin bu bağlamdaki katkısını ölçer. Onu eksiksiz bir sistemden çıkarmak ise bu sistemin ne kaybettiğini ölçer. Bileşenler etkileşime girdiğinde bu iki soru farklı yanıtlar üretebilir. Bu nedenle vardığınız sonuç, referansı ve diğer faktörlerin durumunu açıkça belirtmelidir.
Beklenen çıktı, yalnızca en iyi skor değil, bir karar ve buna eşlik eden bir varyant tablosudur. Denemeleri rezerve etmeden önce, her bir yolu neden koruyacağınızı, bırakacağınızı veya derinleştireceğinizi yazın.
Teknik kaynaklar: NIST — deney planının hedefini belirleyin
Yorumlanabilir bir referans ve varyantlar oluşturma
Referans tanığı, sürümleri, verileri ve kontrol noktası seçim kuralıyla birlikte temel prosedürü yeniden ele alır. Mevcut kampanyada çalıştırılabilir olmalıdır. Tahminler ve eksiksiz bir protokol içermeyen eski bir metrik bir kıyas noktası olarak hizmet edebilir, ancak bu tanığın yerini otomatik olarak almaz.
Her faktör için, karşılaştırılan tam olarak iki durumu belirtin. "Artırma etkin" fazla belirsizdir: dönüşümü, olasılığı ve ilgili verileri koruyun. Ortak kalan parametreleri tanımlayın: incelenen faktör dışındaki ön işleme, split'ler, optimizer, eğitim bütçesi ve değerlendirme yöntemi. Eğitim adımları sabit kalırken işlenen token'lar değişiyorsa, bu sonucu not edin.
Nihai test setini varyant seçimlerinin dışında tutun. Öğrenilen dönüşümler ve ayar kararları bu amaç için ayrılmış verileri kullanmalıdır. Modeli testin hatalarına göre ayarladıktan sonra elde edilen bir iyileşme artık bağımsız bir değerlendirme oluşturmaz.
Teknik kaynaklar: scikit-learn — veri sızıntısını önleme
İki faktör dört durum gerektirir
A'yı, yani bir sınıf ağırlıklandırmayı ve B'yi, yani eğitimde bir artırma kuralını incelediğinizi varsayalım. Etkileşimlerini görmek için kontrol grubunu, yalnız A'yı, yalnız B'yi ve A ile B'yi birlikte inceleyin. İki faktörlü ve iki düzeyli bu tasarım dört yapılandırma içerir. k adet ikili faktörle, tam tasarım tekrarlardan önce 2ᵏ yapılandırma içerir: deneme sayısı hızla artar.
Aşağıdaki tablo, mantığı açıklamak için uydurulmuş sayısal bir örnektir. Puanları hiçbir eğitimden gelmez. 0 ile 100 arasında değişen ölçekte hayali makro-F1 ortalamalarını temsil eder; gerçek bir çalışmada, tek tek değerler ve bunların değişkenliği vazgeçilmezdir.
| Yapılandırma | A: ağırlıklandırma | B : augmentation | Hayali makro-F1, 100 üzerinden |
|---|---|---|---|
| Kontrol grubu | Hayır | Hayır | 70,0 |
| Yalnızca A | Evet | Hayır | 71,2 |
| Yalnızca B | Hayır | Evet | 70,8 |
| A + B | Evet | Evet | 71,5 |
Teknik kaynaklar: NIST — tam faktöriyel iki seviyeli planlar
Etkileri ve etkileşimlerini okuma
Bu örnekte A, B olmadan 1,2 puan, ancak B zaten etkinken yalnızca 0,7 puan katkı sağlıyor. B ise A olmadan 0,8 puan, A ile birlikte 0,3 puan katkı sağlıyor. Birleşik kazanç 1,5 puan iken, iki ayrı kazancın toplamı 2,0 puan ediyor. Buradaki −0,5 puanlık fark, toplamsal olmayan bir etkileşimi tanımlar.
Bu hesaplama ne sağlamlığını ne de mekanizmaya dair bir açıklamayı ortaya koyar. Size yalnızca hangi soruyu doğrulamanız gerektiğini öğretir: A içeren sisteme B eklemek, bu örnekte yalnızca 0,3 puan için karmaşıklığını haklı çıkarıyor mu? Öngörülen alt grupları da inceleyin. Aynı ortalama, farklı kazanç ve kayıpları gizleyebilir.
Protokolünüz izin verdiğinde bu farkları eşleştirilmiş tekrarlar üzerinde karşılaştırın. Her varyantın en iyi tohumunu seçmeyin. Denemeler arasında işaret veya büyüklük belirgin biçimde değişiyorsa, karar belirsiz kalır.
Teknik kaynaklar: NIST — faktöriyel tasarımda kombinasyonlar ve etkileşimler
Bütçeyi önemli kararlara ayırın
Bir deneme bütçesi bir planlama aracıdır, GPU hızı tahmini değildir. Örnek: kurumsal olarak 24 tam çalıştırmalık bir bütçeniz var. 12 çalıştırmayı her biri üç tohumlu dört yapılandırmaya, 10'unu kontrolün ve bir adayın beş yeni tohumla doğrulanmasına, 2'sini de gerekçeli tekrarlara ayırırsınız. Toplam 24 eder; bunların kaç saat süreceğini ise henüz hiçbir şey söylemez.
İlk üç tohum burada bir kazananı onaylamak için değil, keşif yapmak için kullanılır. Aday seçim kuralını bu seriyi gözlemlemeden önce belirleyin. Doğrulama, kararlaştırılan protokolü kullanır; yeni tohumlar başlangıçtaki seçime bağımlılığı azaltır ancak modeli ayarlamak için zaten kullanılmış bir test setini düzeltmez.
Eğer bütçe gerekli tekrarlara izin vermiyorsa, faktörleri azaltın veya bir soruyu erteleyin. Gerçek bir kararı etkileyen değişikliklere öncelik verin: pahalı bir bileşeni kaldırmak, bir başarısızlığı çözmek veya birbirine yakın iki seçeneği ayırt etmek. Paketleri karşılaştırmadan önce değerlendirme ve artefaktlar için zaman ayırın.
| Adım | Hesaplama | Çalıştırmalar |
|---|---|---|
| Keşif | 4 konfigürasyon × 3 tohum | 12 |
| Doğrulama | 2 konfigürasyon × 5 yeni tohum | 10 |
| Belgelenmiş yeniden çalıştırmalar | Yedek | 2 |
| Toplam bütçe | 12 + 10 + 2 | 24 |
Sıralamayı ve durdurma kurallarını hazırlayın
Denemelerin listesini başlatmadan önce kimlik, konfigürasyon, tohum ve öncelikle birlikte yazın. Önce tüm kontrolleri sonra tüm adayları bitirmek yerine, varyantları geçiş sırasına göre dağıtın. Bir dönem, bir veri seti veya bir makine bir karşılaştırma bloğu oluşturuyorsa, bu bloğu belgeleyin. Serinin ortasında bir ortam değişikliği görünür kalmalıdır.
Tekrarlanan hatalar veya bellek aşımı gibi teknik durdurma nedenlerini hazırlayın. Her denemeyi ve durumunu saklayın. Bir başarısızlığı sessizce daha kısa bir çalıştırmayla değiştirmeyin, ne de hayal kırıklığı yaratan bir denemeyi beklenen puanı elde edene kadar yeni bir tohumla değiştirmeyin.
Puanlara göre kararlaştırılan erken durdurma, analiz protokolünü değiştirir. Ara kararlar öngörüyorsanız, bunların kurallarını ve keşifsel kapsamını önceden bildirin. Doğrulayıcı bir sonuç için, bu kararlara uygun bir analiz planı tutun.
Ablasyonu doğrulanabilir bir sonuçla kapatın
Nihai fiche hipotezi, kontrolü, faktörleri, tekrarları, farkları ve başarısızlık durumlarını belirtir. Her değeri, onu üreten tahminlere ve run'a bağlayın. Açık bir kararla bitirin: bileşen korundu, bileşen kaldırıldı veya seçim yapmak için yetersiz veri.
Üç kısa yoldan kaçının: ön işleme de değişmişken bir değişikliği A'ya atfetmek; birleşimlerini test etmeden izole kazançları toplamak; tek bir korpustan genel bir kural ilan etmek. Bir ablasyon, tanımlanmış bir protokolde bir gözlem ortaya koyar. Kapsamı verilere, modele ve gerçekte incelenen varyasyonlara bağlıdır.
Pratik sorular
Tüm kombinasyonlar her zaman test edilmeli mi?
Tam bir plan etkileşimler için faydalıdır, ancak maliyeti faktör sayısıyla artar. Önce kararınızı değiştirebilecek faktörleri sınırlayın. Ayırt etmenize izin vermediği etkileri açıkça belirtirseniz, azaltılmış bir plan mümkün kalır; eksik kombinasyonları test edilmiş gibi sunmayın.
Önceki bir kampanyanın kontrolünü yeniden kullanabilir miyim?
Veriler, kod, bütçe, model seçimi ve değerlendirme gerçekten karşılaştırılabilir ve belgelenmişse yeniden kullanabilirsiniz. Aksi takdirde, güncel protokolde bir kontrolü yeniden çalıştırın. Bir sürüm veya split farkı, bileşene atfetmeye çalıştığınız farkı açıklayabilir.
Olumsuz bir sonuç, bileşenin işe yaramaz olduğu anlamına mı gelir?
Olumsuz bir sonuç, incelenen koşullarda aranan etkiyi sağlamadığını veya kanıtın eksik olduğunu gösterir. Genelleme yapmadan önce belirsizliği ve etkileşimleri kontrol edin. Bu sonucu belgelemek, zaten incelenmiş bir yol için bütçeyi yeniden harcamaktan kaçınmanızı sağlar.