Chuyển từ một truy vấn đơn lẻ sang một tải thực tế
Hãy bắt đầu với một truy vấn, rồi tăng dần số lượng yêu cầu đồng thời. Chạy lại một tập đầu vào cố định, với nhiều độ dài và loại nội dung khác nhau. Ghi lại trung vị và một thước đo cho các truy vấn chậm, không chỉ giá trị trung bình. Với tác vụ sinh văn bản, hãy phân biệt thời gian trước token đầu tiên và tổng thời lượng. Những quan sát này đáp ứng các mục đích sử dụng khác nhau, chẳng hạn một giao diện tương tác hay xử lý tài liệu ngoại tuyến.
Bảo vệ biên dư trong 24 GB
Một mô hình nạp không lỗi vẫn có thể bị quá tải khi có nhiều truy vấn. Hãy đo cache, các buffer và hành vi với đầu vào dài của bạn. Thử một giới hạn đồng thời vẫn giữ được biên dư và ghi lại giới hạn đó cùng với mô hình. Nếu bạn lượng tử hóa trọng số, hãy kiểm tra câu trả lời trên tập đánh giá của bạn trước khi coi biến thể đó là tương đương.
Với xử lý ngoại tuyến, một batch lớn hơn có thể chấp nhận được ngay cả khi nó làm tăng độ trễ của từng yêu cầu. Hãy trình bày riêng hai mục tiêu này trong sổ tay của bạn để chọn một cấu hình dựa trên nhu cầu thực tế.
Chọn một engine tương thích với Ada
L4 dùng kiến trúc Ada. Hãy kiểm tra các phiên bản CUDA, PyTorch hoặc engine suy luận, cùng các định dạng lượng tử hóa và toán tử cần thiết. Việc nạp ban đầu không xác nhận mọi dạng đầu vào: hãy đưa ví dụ khắt khe nhất vào bài kiểm tra. So sánh một RTX 4090 cho một cấu hình 24 GB khác, hoặc L40S khi cần nhiều ngữ cảnh hay mức đồng thời hơn đòi hỏi 48 GB.
Thuê để xác định một năng lực đã đo lường
Ba ngày cho phép phác họa mối quan hệ đầu tiên giữa tính đồng thời và độ trễ. Bảy ngày cho thời gian đánh giá nhiều cấu hình và lặp lại bài kiểm tra. Ba mươi ngày đồng hành cùng một chiến dịch suy luận hoặc xác thực định kỳ. Hãy chuẩn bị các truy vấn, mô hình và tiêu chí chất lượng trước khi đặt hàng. Chọn gói của bạn, điền thông tin liên hệ và làm theo hướng dẫn crypto; « Tôi đã thanh toán » báo hiệu giao dịch đã thực hiện.