为你的应用真正执行的操作计时
对已驻留 GPU 的张量进行测试,只能描述纯计算部分。而一个服务或一次训练还需要解码、准备和传输输入。因此请构建两种测量:孤立的计算循环,以及从你日常数据出发的循环。两者之差指明了该去哪里寻找优化空间。记录时间前请等待 GPU 工作真正结束;CUDA 启动通常是异步的。
将 batch 用作受控变量
对于离线推理,在保持输入长度和类型不变的前提下比较多种批大小。对于交互式应用,还要测量单个请求的延迟以及最慢请求的延迟。使处理量最大化的 batch 可能让等待变得难以接受。在 80 GB 上,请为缓存或激活值留出空间,而不是在模型加载时就停止尺寸规划。
请分别记录权重精度与计算精度。以缩减格式存储的模型在运行时仍可能使用更高精度的缓冲区或运算。
比较 H100 各变体,但不要混为一谈
本页面针对 H100 PCIe 80 GB。H100 SXM 或多卡组合的结果并不能自动代表该配置。请针对你的架构检查 CUDA、PyTorch 和专用库,然后选择一套适用于所比较 GPU 的共同方案。如果 80 GB 不够用,请研究 H200;如果需求在 48 GB 以内,请把 L40S 加入你的经济性比较。
准备一份面向流水线的订单
三天可用于确定计算与传输所占的比例。七天可以测试修正并重复测量。三十天则能支撑一轮推理活动或计划好的训练。选择时长和数量,填写您的环境信息,然后是您的跟踪联系方式。订单中的加密货币说明会指明网络和金额;“我已付款”按钮用于告知您的转账。