Trước tiên chọn điều mà hai card chia sẻ
Trong song song dữ liệu cổ điển, mỗi GPU giữ một bản sao của mô hình và nhận một phần batch. Với mô hình quá lớn so với một card, cần phân bổ tham số hoặc các lớp. Vậy nên 360 GB cộng lại không tự động tạo thành một phân bổ duy nhất. Hãy viết giả thuyết của bạn trước khi thuê: tăng batch toàn cục, giảm thời gian một bước hoặc làm cho một lần chạy trở nên khả thi.
Một thử nghiệm phân bổ đưa ra kết luận
Hãy bắt đầu với cùng một tập dữ liệu thu nhỏ trên một card, nếu mô hình vừa, rồi trên hai card. Ghi lại đỉnh bộ nhớ của từng GPU, thời gian mỗi bước sau khi khởi động và chi phí trao đổi. Một card gần như trống và card kia quá tải gợi ý phân bổ mất cân bằng. Hai thí nghiệm độc lập có thể hữu ích hơn một huấn luyện phân tán khi câu hỏi của bạn xoay quanh nhiều siêu tham số.
Giữ độ chính xác và số ví dụ được xử lý không đổi trong suốt so sánh này. Một cải thiện đạt được khi đồng thời thay đổi định dạng số và kích thước batch sẽ khó quy cho phần cứng.
Chuẩn bị ngăn xếp Blackwell và chọn một phương án thay thế
Hãy kiểm tra xem phiên bản PyTorch, bản phân phối CUDA và các extension đã biên dịch của bạn có nhắm đúng vào Blackwell hay không. Một kernel tùy chỉnh tương thích với một thế hệ khác không đủ để thiết lập khả năng tương thích này. Hãy kiểm thử các phép toán thiết yếu trước chiến dịch đầy đủ. Nếu mô hình và phần dự trữ khi chạy của bạn vừa với 141 GB, H200 cho phép nghiên cứu chạy trên một GPU duy nhất; MI300X mở ra một hướng khác cho dự án đã chuẩn bị cho ROCm.
Đặt một khung nghiên cứu khả thi
Ba ngày phù hợp cho một kiểm chứng phân bổ đã chuẩn bị trước. Bảy ngày cho phép tổ chức nhiều biến thể và đánh giá chúng. Ba mươi ngày tương ứng với một chiến dịch theo dõi, với các checkpoint và tiêu chí dừng đã xác định. Chọn số lô hai card, thời lượng và môi trường mong muốn, rồi điền thông tin liên hệ. Sau khi chuyển crypto, dùng “Tôi đã trả tiền” trong đơn hàng; sau đó làm theo các bước thanh toán và chuẩn bị quyền truy cập.