将分辨率与 batch 大小分开考察
一个在小图上运行良好的视觉模型,并不能直接预测您工作图像的显存占用。请先构建一组 batch 恒定、分辨率递增的实验,再构建一组分辨率固定、batch 递增的实验。这样才能把差异归因到具体因素。请保持相同的缩放和裁剪规则:改动预处理对分数的影响,可能和更换模型一样大。
测量一次完整训练或适配
相比 24 GB 的显卡,48 GB 为激活值和辅助组件提供了更大的空间。但它们并不能定义一个普遍适用的模型大小。如果您要训练,请测量反向传播;如果您要生成 embeddings,请测量整个流水线;如果形状会变化,请测量最大的样本。记录峰值以及引发峰值的参数。
对于适配,请在独立于调参的留出集上比较质量。仅仅为了占满内存而增大 batch,本身并不构成科学上的改进。
Ada 与 Ampere:在相同配方下比较
RTX 6000 Ada 和 RTX A6000 在本目录中都是 48 GB,但属于不同架构。因此请尽量让您的 CUDA、PyTorch 和库版本保持可比。检查针对 Ada 编译的扩展,并测试您模型中最专用的操作。L40S 是另一个 48 GB 的对比对象;如果您的峰值仍在 24 GB 额度之内,一块 RTX 4090 可能就足够了。
在选套餐前准备好数据
三天适合做分辨率/batch 的映射。七天可以适配并评估若干变体。三十天可以支撑一轮带有重复实验和有序导出的视觉研究。在选择时长之前,先准备好图像清单、其划分方式以及评估脚本。下单时会汇总配置、所需环境和您的联系方式;您的加密货币付款随后可在同一工单中追踪。