在不丢失问题的前提下缩小项目
若要复现实验,请先从一个能保留重要类别或难点的数据子集开始。让数据加载、训练、验证和保存在这个范围内跑通。这个中间结果不能替代完整实验,但可以在投入全部时长之前验证计算路径。请提前确定以什么信号作为依据,来切换到完整语料库或更大的配置。
让测试装进 24 GB
将各个变量分开:权重格式、计算精度、样本长度和微批次。两次内存测量之间只改动一个变量。根据模型和激活值,调整几个参数可能就能适配这个内存范围,但同一模型的完整训练可能占用截然不同的内存。请记录使用精确参数(包括验证时所用参数)观察到的峰值。
测试从检查点恢复,并在重新加载后检查一些输出。第一个套餐的有用结果往往是一个可以重新启动、而无需重新构建内存和数据选择的实验。
在已完成的成果上比较各代显卡
确保你的 CUDA/PyTorch 环境和已编译的扩展支持 Ampere。对于旧的研究仓库,锁定版本的依赖文件有助于诊断。RTX 4090 可以在同样的 24 GB 容量下比较更新的架构。RTX A6000 回答的是另一个问题:保留更多内存,尤其是在缩短样本长度会破坏你的实验方案时。
规划 3 天、7 天或 30 天的进度
三天适合一次可复现的端到端测试。七天可以在稳定后的语料上尝试几种变体。三十天可以在验证配方后进行更多次重复。整理好数据和导出内容,选择时长和数量,然后填写名字、姓氏和邮箱。租用使用加密货币支付,无需提供身份证件;你的订单会保留跟踪步骤。