GPU cho nghiên cứu ML · Thanh toán crypto không KYC
IteraGPU
Ứng dụng · Suy luận

Chọn một GPU cho các truy vấn thực tế của bạn.

Để chọn một GPU suy luận, hãy kiểm tra rằng mô hình của bạn hoàn thành các truy vấn dự kiến với chất lượng chấp nhận được, rồi đo bộ nhớ và độ trễ dưới mức đồng thời mong đợi. Chỉ riêng trọng số là không đủ: độ dài đầu vào, việc sinh và các truy vấn đồng thời làm thay đổi tải. IteraGPU cung cấp các cấu hình để so sánh theo nhu cầu này; không thể suy ra năng lực hay tốc độ mô hình của bạn chỉ từ tên card.

01 /

Xác định kết quả hữu ích trước khi tìm thông lượng

Trong tương tác, hãy đo thời gian chờ token đầu tiên và thời gian chờ câu trả lời hoàn chỉnh. Với một kho dữ liệu ngoại tuyến, hãy đo thời gian cần để có tất cả đầu ra mong đợi. Trong cả hai trường hợp, hãy cố định quy tắc chấp nhận: độ chính xác trên các câu trả lời đã biết, chất lượng của một xếp hạng hoặc trích xuất trường được kiểm chứng. Một JSON hợp lệ về cú pháp vẫn có thể chứa câu trả lời sai.

Hãy tách thời gian chờ trong hàng đợi, thời gian xử lý và toàn bộ hành trình mà client của bạn quan sát được khi công cụ cho phép. Một phép đo nội bộ của engine không có cùng giới hạn như phép đo của ứng dụng. Tài liệu về các chỉ số vLLM phân biệt cụ thể thời gian chờ, token đầu tiên và tổng thời gian: hãy giữ sự phân biệt này trong các ghi nhận của bạn, bất kể engine được chọn.

Nguồn kỹ thuật: vLLM — chỉ số về truy vấn và độ trễ

02 /

Chuyển các truy vấn của bạn thành tiêu chí lựa chọn

Hãy chuẩn bị các đầu vào ngắn, thông thường và dài với các mã định danh ổn định. Giữ nguyên mô hình, tokenizer, mẫu hội thoại và các tham số sinh. Đếm số token thực sự được truyền, kể cả lịch sử và các tài liệu do ứng dụng thêm vào. Ghi riêng batch yêu cầu, mức đồng thời gửi đi và các truy vấn thực sự được xử lý đồng thời: đây không nhất thiết là cùng những con số.

Cùng mô hình và cùng đầu vào: các tham số, phép đo và quyết định cần ghi lại
Đầu vào cần cố địnhPhép đo và đơn vịHệ quả cho lựa chọn
Prompt đầy đủ và giới hạn đầu raToken đầu vào và đầu ra mỗi truy vấnKiểm tra các trường hợp dài và các câu trả lời bị cắt ở giới hạn
Truy vấn đồng thời và nhịp đếnTruy vấn đang hoạt động, đang chờ và đã hoàn tấtXác định tải có thể duy trì với độ trễ yêu cầu
Độ chính xác, lượng tử hóa và bộ nhớ đệmĐỉnh bộ nhớ mỗi GPU, tính bằng byte hoặc GioLoại bỏ các thiết lập vượt quá bộ nhớ trên tải dự kiến
Quy tắc chất lượng và tham chiếuĐầu ra được chấp nhận / đầu ra mong đợi; chỉ số nghiệp vụChỉ so sánh các biến thể đáp ứng cùng một tiêu chí
Phạm vi đo thời gianToken đầu tiên, phản hồi đầy đủ hoặc toàn bộ dữ liệu: giâySo sánh các khoảng thời gian có cùng mốc giới hạn
Lịch trình cho đến khi nhận được tệpKhoảng thời gian tổng, tính bằng giờ hoặc ngàySau đó chọn gói 3, 7 hoặc 30 ngày
03 /

Đo bộ nhớ với ngữ cảnh và mức đồng thời

Với một mô hình tự hồi quy sinh từng token, bộ nhớ đệm KV lưu giữ các trạng thái chú ý. Kích thước của nó phụ thuộc vào mô hình và số token được lưu giữ. Bộ nhớ đệm động có thể tăng trong quá trình sinh; bộ nhớ đệm tĩnh dự trữ một kích thước tối đa. Một số lớp cửa sổ trượt giới hạn sự tăng trưởng này. Vì vậy, hãy kiểm tra độ dài và mức đồng thời dự kiến với chiến lược thực sự được sử dụng.

Lượng hóa trọng số và lượng hóa bộ nhớ đệm là hai lựa chọn riêng biệt. Ví dụ, bitsandbytes thay thế một số lớp tuyến tính bằng các phiên bản được lượng hóa; điều đó không mô tả hết mọi phân bổ trong quá trình chạy của bạn. Sau khi thay đổi độ chính xác, hãy kiểm tra lại bộ nhớ và chất lượng thay vì giả định rằng toàn bộ mức đỉnh giảm theo cùng một tỷ lệ.

Với PyTorch, hãy ghi nhận riêng mức đỉnh của các tensor được cấp phát và mức đỉnh của bộ nhớ được bộ cấp phát dự trữ. Đừng cộng chúng lại. Ghi rõ GPU được đo và đơn vị: 1 GiB tương ứng với 2³⁰ byte. Các bộ đếm này không nhất thiết đại diện cho toàn bộ mức sử dụng của thiết bị. Hồ sơ bộ nhớ trình bày chi tiết các giới hạn của chúng.

Nguồn kỹ thuật: Hugging Face Transformers 5.17 — chiến lược bộ nhớ đệm KV · Hugging Face Transformers 5.17 — lượng hóa bitsandbytes · PyTorch 2.14 — quản lý và bộ đếm bộ nhớ CUDA

04 /

Một thử nghiệm có thể đo lường trên 300 tài liệu

Ví dụ cần thực hiện với bộ dữ liệu được cấp phép của bạn: trích xuất ngày, số tiền và danh mục từ 300 tài liệu. Hãy đọc lại các giá trị mong đợi, nêu rõ cách xử lý các trường vắng mặt và đặt ngưỡng chấp nhận trước khi thử nghiệm. Số lượng tài liệu mô tả quy trình; không có thời gian, điểm số hay thông lượng nào được giả định.

  • Cố định 300 mã định danh, bản sửa đổi của mô hình, các prompt, giới hạn token và quy tắc phân tích cú pháp. Giữ các tài liệu dài có thể nhận diện được trong báo cáo tổng kết.
  • Chạy một tham chiếu với từng truy vấn một. Tách biệt tải, khởi động nóng và đo lường; giữ lại các dự đoán và lỗi theo từng tài liệu.
  • Sau đó tăng một tham số duy nhất: batch cho xử lý theo lô, hoặc mức đồng thời cho một engine truy vấn. Giữ nguyên đầu vào và tiêu chí chất lượng.
  • Với mỗi lần chạy, ghi nhận thời gian, mức đỉnh bộ nhớ, số mã định danh tìm thấy không trùng lặp và số đầu ra được chấp nhận. Lặp lại các phép đo và giữ lại giá trị thô cùng độ phân tán của chúng.
  • Nếu một biến thể thất bại, hãy ghi lại lý do: bộ nhớ, cắt ngắn, định dạng hay chất lượng. Việc giảm batch hoặc chạy lại tạo ra một quyết định cần ghi chép, không phải một thất bại cần xóa bỏ.
Kết quả mong đợi là một bộ dữ liệu hoàn chỉnh đã được đánh giá, cùng với đầu ra, lỗi và phạm vi của từng phép đo.

Nguồn kỹ thuật: IteraGPU — quy trình chi tiết so sánh ở chất lượng tương đương

05 /

Sử dụng tài nguyên IteraGPU Lab v1 đúng phạm vi

Notebook và script đi kèm của nó đề xuất một phép tính trọng số và một phép đo trên một mạng tổng hợp nhỏ. Mã đo lường của chúng đã được chạy trên một RTX 5070 cục bộ với PyTorch 2.11.0, trên một cấu hình nhỏ ở float32. Thử nghiệm này kiểm tra trường hợp chạy đó; nó không đo một LLM, cũng không đo bộ nhớ đệm KV, cũng không đo các GPU trong danh mục trên truy vấn của bạn.

Hãy dùng notebook để hiểu các bộ đếm, sau đó đo tải thực tế của bạn với môi trường của nó. Quy trình chất lượng và bảng thô dùng để chuẩn bị so sánh. Các đầu ra của notebook được phân phối và các dòng kết quả trong CSV vẫn để trống; quy trình không cài đặt mô hình hay trình điều khiển nào. Hãy đọc các yêu cầu tiên quyết trong README trước khi chạy.

06 /

Chuyển từ các phép đo sang một gói dịch vụ

Bản ghi lựa chọn của bạn cần tập hợp môi trường tương thích, bộ nhớ mỗi card, ngữ cảnh, mức đồng thời, chất lượng đạt được và thời gian đo được. Hãy so sánh các cấu hình đáp ứng những tiêu chí này, rồi so sánh các gói 3, 7 và 30 ngày theo toàn bộ lịch trình: chuẩn bị, xử lý, đánh giá, chạy lại và xuất. Công cụ tính của hồ sơ benchmarks dùng toàn bộ gói và các corpus hữu ích đã thực sự được kiểm chứng.

Hãy lưu bản ghi này và các phiên bản mã trong sổ tay của bạn. Bạn tự chọn phần mềm và cách xử lý; IteraGPU không kiểm tra nội dung tệp, prompt hay phép tính của bạn. Việc chọn môi trường khi đặt hàng thể hiện nhu cầu chuẩn bị của bạn: điều đó không chứng minh rằng mô hình của bạn đã được cài đặt hay kiểm thử.

Câu hỏi thực tế

24 GB có đủ cho mô hình suy luận của tôi không?

Dung lượng 24 GB không đủ để trả lời nếu chưa biết mô hình và tải. Hãy kiểm tra đồng thời trọng số, phân bổ khi chạy, ngữ cảnh và các truy vấn đồng thời. Cấu hình phải hoàn thành các trường hợp dài với chất lượng yêu cầu; chỉ kích thước tệp hay ước lượng trọng số thì không chứng minh được điều đó.

Nên so sánh thông lượng nào cho một corpus ngoại tuyến?

Trước tiên hãy so sánh thời gian cần thiết để hoàn thành và đánh giá cùng một corpus. Nếu bạn công bố thông lượng, hãy nêu số đầu ra hữu ích được chấp nhận, thời gian tính và các lỗi. Thông lượng token mỗi giây mà không có độ dài phản hồi hay kiểm soát chất lượng thì không đủ để phân định hai cấu hình.

Vượt bộ nhớ có buộc phải đổi GPU không?

Vượt bộ nhớ trước tiên đòi hỏi xác định cài đặt và đầu vào đã gây ra nó. Bạn có thể xem xét batch, mức đồng thời, độ dài hoặc độ chính xác, trong khi giữ mục tiêu của dự án. Mọi giảm bớt làm thay đổi tài liệu được xử lý hoặc phản hồi mong đợi đều buộc phải kiểm chứng lại chất lượng; có thể cần thêm bộ nhớ nếu phải giữ nguyên những ràng buộc này.

Notebook được cung cấp có kiểm chứng ứng dụng suy luận của tôi không?

Notebook được cung cấp không kiểm chứng ứng dụng của bạn: nó đo một mạng tổng hợp nhỏ và giải thích các bộ đếm bộ nhớ. Bài thử cục bộ có tài liệu chỉ áp dụng cho trường hợp đó. Ứng dụng của bạn phải được đánh giá với mô hình, đầu vào, môi trường và tiêu chí chấp nhận riêng trước mọi kết luận về dung lượng hay hiệu năng.