GPU cho nghiên cứu ML · Thanh toán crypto không KYC
IteraGPU
Phòng thí nghiệm / Lộ trình ML: năm câu hỏi, năm điểm khởi đầu
IteraGPU / Nghiên cứu ML

Câu hỏi nào đang cản bạn hôm nay?

Từ lần tải đầu tiên đến các checkpoint, hãy sắp xếp những điểm cần kiểm tra trước một chiến dịch tính toán. Tìm các hướng dẫn để ước tính, đo lường và lưu lại kết quả có thể sử dụng được.

Chọn câu hỏi đang cản trở bạn. Mỗi lộ trình dẫn đến một quyết định cụ thể; thư viện tập hợp toàn bộ các tài liệu tham chiếu.

Mô hình của tôi chưa từng chạy. Bắt đầu từ đâu?

Một mức bao bộ nhớ và đầu vào cho lần chạy thử đầu tiên.

  1. Định cỡ bộ nhớ GPU: tính toán, dự trữ và xác nhận

    Tính weights theo Gio, xây dựng một khoản dự trữ rõ ràng và xác nhận đỉnh theo từng pha. Ví dụ bằng số, các cạm bẫy lượng tử hóa và lựa chọn theo card.

  2. Bộ nhớ GPU: giải thích chênh lệch giữa ước tính và mức đỉnh

    Phân biệt trọng số, cache và activation, đo allocated và reserved theo từng pha, rồi chọn một biên an toàn bằng notebook và giao thức PyTorch.

  3. Cache KV: tính bộ nhớ theo ngữ cảnh, GQA và batch

    Tính cache KV với các đầu KV, ngữ cảnh và các chuỗi đồng thời. Phân biệt GQA, độ chính xác và cache tĩnh trước một thử nghiệm thực tế.

Điểm số đang tăng, nhưng tôi có thể tin được không?

Một tập đánh giá tách biệt, các lỗi được rà soát lại và một khác biệt được định lượng.

  1. Xây dựng một tập đánh giá ML không rò rỉ dữ liệu

    Tách biệt các nhóm, bản sao và cách sử dụng dữ liệu để xây dựng một tập đánh giá ML giữ riêng, có thể kiểm soát và phù hợp với quyết định của bạn.

  2. Phân tích lỗi ML để chọn thử nghiệm tiếp theo

    Phân tích lỗi phân loại và trích xuất: ma trận nhầm lẫn, tham chiếu, phân loại học, hồi quy và kiểm soát bản sửa lỗi tiếp theo.

  3. Biến thiên giữa các seed: một chênh lệch ML có thuyết phục không?

    Diễn giải các lần lặp ML bằng hạt giống ghép cặp, độ phân tán và một ngưỡng hiệu ứng hữu ích. Ví dụ được tính toán và các giới hạn của một mẫu nhỏ.

Tôi đang chuẩn bị huấn luyện. Cần kiểm tra gì trước chuỗi chạy?

Một bản cập nhật đầy đủ, một batch rõ ràng và những dấu vết có thể khai thác.

  1. Huấn luyện GPU: xác nhận vòng lặp trước đợt chạy

    Chuẩn bị dữ liệu, batch và khả năng khôi phục một lần huấn luyện. Một giao thức từng pha để kiểm soát bộ nhớ, gradient, đánh giá và các tệp đầu ra.

  2. Microbatch và tích lũy: tính batch hiệu dụng

    Tính batch hiệu dụng, chuẩn hóa mất mát và kiểm tra tích lũy gradient trên một hoặc nhiều card, cùng các giới hạn tương đương của nó.

  3. Theo dõi các thí nghiệm ML: từ run đến quyết định

    Kết nối dữ liệu, mã, tham số, dự đoán và quyết định bằng một manifest thí nghiệm ML. Ví dụ về kiểm soát các run và artifact mà không bị ép buộc dùng công cụ nào.

Tinh chỉnh hay nén mô hình: chọn biến thể thế nào?

Một mốc tham chiếu, một thay đổi có kiểm soát và chất lượng tương đương.

  1. Fine-tuning: chọn một cách thích ứng và kiểm tra đóng góp của nó

    Chuẩn bị một fine-tuning với một tham chiếu, dữ liệu tách riêng và kiểm tra nạp lại. LoRA, nền tảng lượng tử hóa, ngân sách và phân tích các hồi quy.

  2. So sánh các phép lượng tử hóa: bộ nhớ, chất lượng và chi phí hữu ích

    So sánh tham chiếu, hiệu chuẩn, định dạng trọng số và cache KV với cùng dữ liệu. Đo bộ nhớ và chất lượng trước khi quyết định ngân sách GPU.

  3. Lập kế hoạch ablation ML: đối chứng, hiệu ứng và ngân sách

    Xây dựng kế hoạch ablation ML với đối chứng, nhân tố, tương tác và ngân sách thử nghiệm. Một ví dụ được tính toán để ưu tiên các biến thể và kết luận.

Ngân sách có hạn. Nên chạy thử những gì trước?

Một thứ tự thí nghiệm và chi phí gói được đối chiếu với các kết quả hữu ích.

  1. Lập ngân sách cho một chiến dịch ML: thử nghiệm, quyết định và gói trọn vẹn

    Phân rã một chiến dịch ML, ưu tiên các biến thể và gắn gói GPU với các kết quả hữu ích, kèm ví dụ về lịch trình và ngân sách bằng USD.

  2. Lập kế hoạch ablation ML: đối chứng, hiệu ứng và ngân sách

    Xây dựng kế hoạch ablation ML với đối chứng, nhân tố, tương tác và ngân sách thử nghiệm. Một ví dụ được tính toán để ưu tiên các biến thể và kết luận.

  3. Benchmark ML: so sánh chi phí ở chất lượng tương đương

    Cố định chất lượng, đo trên cùng một tập dữ liệu và so sánh toàn bộ chi phí của các gói GPU 3, 7 hoặc 30 ngày. Có giao thức và bảng dữ liệu thô để tải về.