从单次请求转向真实负载
先从单次请求开始,然后逐步增加同时请求数。用固定的输入集反复重放,覆盖多种长度和内容类型。记录中位数以及慢请求的度量,而不仅仅是平均值。对于生成任务,要区分首个 token 之前的时间和完整时长。这些观察对应不同的使用场景,例如交互式界面或离线文档处理。
守住 24 GB 内的余量
一个能成功加载的模型在多请求下仍可能耗尽资源。要测量缓存、缓冲区以及在您长输入下的表现。测试一个仍保留余量的并发上限,并将该上限与模型一起记录。如果您量化了权重,请先在您的评估集上核对回答,再将这一变体视为等价。
对于离线处理,即使单次延迟会升高,较大的批大小也可能是可以接受的。请在您的笔记本中分别列出这两个目标,以便根据实际需求选择配置。
选择与 Ada 兼容的引擎
L4 采用 Ada 架构。请核对 CUDA、PyTorch 或推理引擎的版本,以及所需的量化格式和算子。初次加载并不能验证所有输入形态:请把最苛刻的示例也纳入测试。可将 RTX 4090 作为另一套 24 GB 配置进行对比,或在需要更多上下文或并发而要求 48 GB 时对比 L40S。
租用来确定可测量的容量
三天可以初步描绘出并发与延迟之间的关系。七天足够评估多种设置并重复测试。三十天可以支撑一轮规律的推理或验证活动。下单前请准备好请求、模型和质量标准。选择您的套餐,填写联系方式并按照加密支付说明操作;点击「J’ai payé」即表示转账已完成。