Tách riêng độ phân giải và kích thước batch
Một mô hình thị giác chạy tốt trên ảnh nhỏ không dự đoán trực tiếp mức tiêu thụ bộ nhớ cho ảnh làm việc của bạn. Trước tiên, hãy xây dựng một loạt thử nghiệm với batch cố định và độ phân giải tăng dần, rồi một loạt với độ phân giải cố định và batch tăng dần. Cách này giúp quy kết các khác biệt. Giữ nguyên các quy tắc thay đổi kích thước và cắt ảnh: thay đổi bước tiền xử lý có thể làm điểm số thay đổi ngang với việc chọn mô hình.
Đo lường một lần huấn luyện hoặc tinh chỉnh hoàn chỉnh
48 GB cho nhiều chỗ hơn so với card 24 GB để chứa activation và các thành phần phụ trợ. Tuy nhiên, chúng không định nghĩa một kích thước mô hình dùng chung cho mọi trường hợp. Hãy đo lan truyền ngược nếu bạn huấn luyện, đo toàn bộ pipeline nếu bạn tạo embedding, và đo các mẫu lớn nhất nếu kích thước thay đổi. Ghi lại mức đỉnh và các tham số đã gây ra nó.
Với tinh chỉnh, hãy so sánh chất lượng trên một tập tách riêng khỏi các cấu hình. Tăng batch để lấp đầy bộ nhớ không tự nó tạo thành một cải thiện khoa học.
Ada và Ampere: so sánh với cùng công thức
RTX 6000 Ada và RTX A6000 đều có 48 GB trong danh mục này, nhưng thuộc các kiến trúc khác nhau. Vì vậy, hãy giữ phiên bản CUDA, PyTorch và thư viện của bạn càng giống nhau càng tốt. Kiểm tra các tiện ích mở rộng đã biên dịch cho Ada và thử phép toán chuyên biệt nhất của mô hình bạn. L40S là một lựa chọn so sánh 48 GB khác; RTX 4090 có thể đủ nếu mức đỉnh của bạn vẫn nằm trong giới hạn 24 GB của nó.
Chuẩn bị dữ liệu trước khi chọn gói
Ba ngày phù hợp để lập bản đồ độ phân giải/batch. Bảy ngày cho phép tinh chỉnh và đánh giá một vài biến thể. Ba mươi ngày đồng hành cùng một chiến dịch thị giác với các lần lặp lại và xuất dữ liệu có tổ chức. Hãy chuẩn bị manifest ảnh, phân chia tập và script đánh giá trước khi chọn thời hạn. Đơn hàng bao gồm cấu hình, môi trường mong muốn và thông tin liên hệ của bạn; thanh toán crypto của bạn sau đó được theo dõi trong cùng hồ sơ.