让预算服务于消融实验
有用的消融每次只移除或修改一个要素:一类数据、一种增强、损失函数的一个组成部分或一个可训练模块。在首次运行前就写好各变体,并保留一个基线试验。可用时间也应投入到它们的评估上。一张由大量不可比配置组成的大表,还不如一小组能清晰归因结果差异的配置更有价值。
利用显存保持配方稳定
48 GB 可以提供余量,让各变体之间保持相同的分辨率或长度。如果换成较小的显卡会迫使你每次试验都修改实验协议,那么这就是一项方法学上的优势。不过,仍要测量每个变体的峰值:改变模型的一个组成部分可能会改变激活显存。请保持统一的等效批大小规则,并记录对微批的任何缩减。
请规划可识别的检查点和导出文件名,其中应包含实验标识符。在长时间运行之前,确认重新启动的执行会沿用正确的参数,而不是悄无声息地从头开始。
保持可验证的 Ampere 技术栈
请检查 CUDA、PyTorch 以及模型专用算子与 Ampere 的兼容性。为复现论文而保留的旧版本,值得在正式实验前完整测试一次。RTX A6000 可用于与另一款 48 GB 的 Ampere 显卡进行对比。如果某个阶段的耗时成为主要障碍,也可以同时测一下 Ada 配置,比如 L40S,但不要同时改动数据或精度。
为实验矩阵留出三个时间窗口
三天用于验证基础配置和首次消融实验。七天可以完成一个简短矩阵及其复核。三十天适合多种子重复实验与稳健性检验。选择您需要的时长、显卡数量和环境,然后填写联系方式。您自行准备软件和计算任务;加密支付的状态跟踪始终可以在您的订单空间中查看。