GPU cho nghiên cứu ML · Thanh toán crypto không KYC
IteraGPU
Phương pháp · Số lần lặp và độ bất định

Hãy so sánh các chênh lệch, không phải hai điểm số tốt nhất.

Một chênh lệch giữa hai điểm số trở nên thuyết phục hơn khi nó lặp lại trong một giao thức có thể so sánh, vượt qua một ngưỡng hữu ích và vẫn dễ hiểu cùng với độ bất định của nó. Hãy chuẩn bị các hạt giống, ghép cặp các lần thử khi điều đó hợp lý và phân tích các chênh lệch thu được. Một giá trị trung bình cao hơn, một hạt giống thuận lợi hoặc một khoảng tin cậy hẹp trên một nguồn biến thiên duy nhất không đủ để xác nhận một cải thiện tổng quát.

01 /

Xác định điều gì thay đổi và điều gì tạo thành một lần lặp lại

Hãy bắt đầu bằng câu hỏi: bạn đang đánh giá hiệu ứng của việc khởi tạo một lần huấn luyện, của thứ tự dữ liệu, của một cách chia train/test hay của một lần sinh ngẫu nhiên? Một hạt giống chỉ điều khiển một bộ sinh số ngẫu nhiên; nó không tự nó xác định tất cả các khía cạnh đó. Hãy giữ một dòng cho mỗi lần chạy và các yếu tố thực sự được thay đổi.

Chạy lại mười lần phép đánh giá tất định của cùng một checkpoint trên cùng một tập dữ liệu không tạo ra mười lần huấn luyện độc lập. Tương tự, một nghìn dự đoán từ một mô hình duy nhất không thay thế được nhiều lần huấn luyện để ước lượng mức biến thiên của chúng. Hãy chọn đơn vị lặp lại tương ứng với quyết định.

Trước khi chạy chuỗi, hãy cố định chỉ số chính, ý nghĩa của nó và hiệu ứng tối thiểu đủ để biện minh cho sự thay đổi. Trong các ví dụ sau, giá trị cao hơn là tốt hơn và ngưỡng hữu ích minh họa là 0,30 điểm trên một chỉ số hiển thị từ 0 đến 100. Ngưỡng này xuất phát từ quyết định của dự án, không phải từ một quy tắc thống kê phổ quát.

02 /

Ghép cặp các cấu hình trên những điều kiện chung

Với một cặp i, hãy chạy tham chiếu A và ứng viên B trên cùng một cách chia dữ liệu và với các điều kiện chung đã định trước. Sau đó tính dᵢ = score(Bᵢ) − score(Aᵢ). Việc ghép cặp dựa trên một sự tương ứng được xác định trước kết quả; nó không phải là việc ghép nối sau đó những điểm số giống nhau.

Dùng cùng một danh sách hạt giống có thể giúp tổ chức các cặp, nhưng hai kiến trúc có thể tiêu thụ các số ngẫu nhiên theo cách khác nhau. Hãy khai báo riêng các hạt giống khởi tạo, dữ liệu và sinh ngẫu nhiên khi mã của bạn phân biệt chúng. Cũng hãy lưu lại các phân vùng hoặc mã định danh của chúng: một số nguyên chung không chứng minh rằng dữ liệu đã được duyệt theo cùng một cách.

Nếu một cặp chứa một lần thất bại, hãy giữ cả hai trạng thái và giải thích cách xử lý nó. Đừng so sánh trung bình của năm ứng viên thành công với trung bình của sáu tham chiếu mà không nêu rõ sự thay đổi về tập hợp.

Nguồn kỹ thuật: NIST — sự tương ứng giữa các quan sát ghép cặp

03 /

Giữ đúng giới hạn của hạt giống và tính tất định

PyTorch cho biết rằng kết quả tái lập hoàn toàn không được đảm bảo giữa các phiên bản, nền tảng hoặc lần chạy CPU và GPU, ngay cả với cùng một hạt giống. Hướng dẫn của nó phân biệt việc kiểm soát các bộ sinh số với việc kiểm soát các phép toán không tất định. Hãy ghi lại các phiên bản và tùy chọn đã áp dụng thay vì tóm tắt môi trường bằng cụm “seed cố định”.

Một lần chạy tất định chủ yếu dùng để tái tạo một hành vi trong những điều kiện nhất định. Nó không chứng minh rằng mô hình chống chịu được với các cách khởi tạo hoặc dữ liệu khác. Ngược lại, một khác biệt giữa hai lần chạy lại giống hệt nhau đáng được chẩn đoán trước khi được diễn giải là hiệu ứng của ứng viên.

Hãy giữ cùng một chính sách tất định cho cả hai biến thể. Nếu bạn thay đổi nó để chẩn đoán một lỗi, hãy xác định riêng chuỗi đó. Kết quả thực nghiệm phải luôn gắn với những điều kiện mà nó đã được thu được.

Nguồn kỹ thuật: PyTorch 2.14 — khả năng tái lập và kiểm soát tính ngẫu nhiên

04 /

Ví dụ tính toán: năm khác biệt ghép cặp

Dưới đây là năm cặp giả định dành cho việc tính toán, không có lần huấn luyện nào được chạy. Các hạt giống là những mã định danh ví dụ. Tham chiếu và ứng viên ở đây dùng cùng một giao thức so sánh. Các điểm số được biểu diễn trên thang 100; các khác biệt là điểm, không phải phần trăm tương đối.

Trung bình của các khác biệt bằng (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 điểm. Trung vị của chúng bằng 0,30 điểm và khoảng biến thiên từ 0,10 đến 0,50. Độ lệch chuẩn mẫu của các khác biệt xấp xỉ 0,179 điểm, với mẫu số là n − 1. Cả năm dấu đều dương, nhưng biên độ vẫn lớn so với mức tăng trung bình.

Khác biệt trung bình = 0,28 điểm; độ lệch chuẩn của các khác biệt ≈ 0,179 điểm; sai số chuẩn ≈ 0,179 / √5 = 0,080 điểm.
Ví dụ số giả định — điểm trên thang 100, khác biệt tính bằng điểm
Hạt giống minh họaTham chiếu AỨng viên BB − A
1771,071,4+0,4
2971,671,9+0,3
4371,371,4+0,1
7170,871,3+0,5
10171,871,9+0,1
05 /

Đọc một khoảng tin cậy mà không gán cho nó phạm vi quá lớn

Để minh họa một phép tính thường dùng, giả sử các khác biệt độc lập giữa các cặp và tuân theo một phân phối xấp xỉ chuẩn. Khoảng tin cậy Student 95 % cho trung bình của chúng ở đây dùng bốn bậc tự do: 0,28 ± 2,776 × 0,080, tức khoảng [0,058 ; 0,502] điểm. Với chỉ năm cặp, hình dạng của phân phối rất khó đánh giá; phép tính không làm cho những giả định đó trở thành đúng.

Khoảng này nằm trên 0 trong ví dụ, nhưng nó bao trùm ngưỡng hữu ích được đặt ở 0,30 điểm. Do đó nó không ủng hộ quy tắc nghiêm ngặt « mức tăng trung bình vượt 0,30 điểm ». Một khác biệt dương có thể vẫn quá nhỏ hoặc quá không chắc chắn để biện minh cho sự thay đổi.

Khoảng tin cậy 95 % mô tả một quy trình bao phủ dưới các giả định của nó, chứ không phải xác suất 95 % gắn với tham số sau khi tính toán. Ở đây nó chỉ bao phủ biến thiên được đại diện bởi các cặp, chứ không tự động bao phủ một miền khác, một ngữ liệu khác hay phần cứng trong tương lai.

Nếu bạn dùng SciPy, ttest_rel so sánh các mẫu ghép cặp và cung cấp khoảng tin cậy. Thứ tự của các mảng quyết định dấu: với B − A, hãy đặt B trước. Hãy lưu giữ các giá trị và phương pháp đã dùng, không chỉ một p-value.

Nguồn kỹ thuật: NIST — khoảng tin cậy cho một trung bình · SciPy 1.18 — ttest_rel và khoảng tin cậy của các khác biệt

06 /

Chuẩn bị cho quyết định và các lần lặp tiếp theo

Kết quả của ví dụ là « mức tăng hữu ích chưa được chứng minh », chứ không phải « ứng viên vô ích ». Tùy theo chi phí thay đổi, bạn có thể giữ nguyên mốc tham chiếu, tiếp tục thu thập hoặc thử một thay đổi lớn hơn. Hãy công bố quy tắc này trước khi nhìn thấy chuỗi kết quả. Một cận dưới nằm trên ngưỡng hữu ích của bạn sẽ ủng hộ việc áp dụng nhiều hơn, với điều kiện phần còn lại của giao thức là hợp lệ.

Hãy lên kế hoạch cho các lần lặp dựa trên độ chính xác cần thiết và độ biến thiên dự kiến, với một khoản dự phòng cho các thất bại. Không có con số seed nào đảm bảo kết luận một cách phổ quát. Một thử nghiệm thí điểm có thể giúp ước lượng độ phân tán; hãy giữ tính chất thăm dò của nó và sau đó cố định quy trình xác nhận.

Tránh việc xem xét sau mỗi cặp rồi dừng lại ngay khi kết quả trở nên thuận lợi bằng cách dùng một khoảng tin cậy được thiết kế cho một cỡ mẫu cố định. Hãy chọn cỡ mẫu và phân tích trước, hoặc một phương pháp tuần tự phù hợp. Việc chỉ thêm thử nghiệm cho ứng viên gây thất vọng cũng làm thay đổi sự cân bằng của so sánh.

07 /

Đừng nhầm lẫn giữa biến thiên huấn luyện và đánh giá ngữ liệu

Một chuỗi seed trên một tập kiểm tra cố định cho biết biến thiên của các lần huấn luyện trên tập đó. Bản thân nó không đo lường được sự bất định liên quan đến việc chọn các mẫu kiểm tra. Nếu câu hỏi của bạn cũng liên quan đến các phân chia hay các miền, hãy lập kế hoạch biến đổi các chiều đó mà không trộn lẫn chúng vào một bộ đếm số lần lặp duy nhất.

Hãy giữ một đánh giá cuối cùng tách biệt khỏi các lựa chọn mô hình. Việc chọn lựa giữa nhiều biến thể với cùng một tập kiểm tra sẽ thiên vị những phương án trông có vẻ tốt ở đó một cách ngẫu nhiên. Các phân nhóm và chỉ số bổ sung cần làm sáng tỏ quyết định, với số lượng và trạng thái thăm dò của chúng được hiển thị rõ.

Kết quả cuối cùng tập hợp các điểm số thô, các cặp, các khác biệt, độ phân tán, phương pháp khoảng tin cậy và quyết định so với ngưỡng hữu ích. Hãy kèm theo các thất bại và giới hạn khái quát hóa. Khi đó bạn có thể giải thích vì sao chênh lệch được cho là đủ, không đủ, hay vẫn chưa thể quyết định.

Nguồn kỹ thuật: scikit-learn — giữ tập kiểm tra tách biệt khỏi các lựa chọn mô hình

Câu hỏi thực tế

Năm seed có đủ để lựa chọn không?

Năm seed có thể dùng cho một quan sát ban đầu, nhưng chúng không đảm bảo độ chính xác đủ. Số lượng cần thiết phụ thuộc vào độ biến thiên và hiệu ứng hữu ích nhỏ nhất. Hãy xem xét các khác biệt thô và độ bất định; một kết quả vẫn chưa thể quyết định đòi hỏi một giao thức được thiết kế kích thước tốt hơn, chứ không phải một con số kỳ diệu.

Một khoảng chứa 0 có chứng minh sự tương đương không ?

Một khoảng chứa số không không chứng minh được sự tương đương. Nó cũng có thể tương thích với những mức tăng hoặc giảm đáng kể. Để ủng hộ tính tương đương thực tiễn, hãy đặt trước một biên độ chấp nhận được và sử dụng một phân tích phù hợp với câu hỏi này, với đủ độ chính xác để xem xét nó.

Tôi có thể chỉ công bố seed tốt nhất không?

Seed tốt nhất mô tả một sự lựa chọn thuận lợi, chứ không phải hiệu năng điển hình của quy trình. Hãy công bố toàn bộ các lần lặp dự kiến và quy tắc chọn mô hình được bàn giao. Nếu mô hình tốt nhất đó cần được đánh giá, hãy dùng một đánh giá cuối cùng chưa từng dùng để chọn nó.