用于 ML 研究的 GPU · 无需 KYC 的加密货币支付
IteraGPU
实验室 / ML 学习路径:五个疑问,五个起点
IteraGPU / 机器学习研究

今天是什么问题卡住了您?

从首次加载到 checkpoint,梳理计算任务前需要核查的要点。查阅指南,学习如何估算规模、测量并保存可用的结果。

选择卡住您的问题。每条路径都通向一个明确的决策;资料库汇集了全部参考。

我的模型还没跑起来。该从哪里开始?

一份显存预算和首次试用的输入。

  1. GPU 内存规划:计算、预留与验证

    以 Gio 计算权重,构建明确的预留,并按阶段验证峰值。附数值示例、量化陷阱和按显卡选择。

  2. GPU 显存:解释估算值与峰值之间的差距

    区分权重、缓存和激活值,按阶段测量 allocated 与 reserved,再用 notebook 和 PyTorch 协议选择合适的余量。

  3. KV 缓存:按上下文、GQA 和批次计算内存

    用 KV 头数、上下文和并发序列来计算 KV 缓存。在真实试验之前,先区分 GQA、精度和静态缓存。

分数在提升,但能信得过吗?

一个独立的评测集、复核过的错误,以及被定性的差异。

  1. 构建不泄露数据的机器学习评估集

    分离分组、重复项和数据用途,构建一个留出的、可控且契合你决策的机器学习评估集。

  2. 分析 ML 错误,以选择下一项实验

    分析分类和抽取的错误:混淆矩阵、参考标签、分类体系、回归以及下一次修正的检查。

  3. 种子间的变异性:一个 ML 差距是否令人信服?

    用配对种子、离散程度和实用效应阈值来解读 ML 重复实验。含一个计算示例以及小样本的局限性。

我在准备一次训练。正式开跑前该检查什么?

一次完整的更新、一个显式的 batch 和可用的追踪记录。

  1. GPU 训练:在正式开跑前验证训练循环

    准备好数据、批大小和训练恢复。按阶段制定流程,以控制内存、梯度、验证和输出文件。

  2. 微批量与累积:计算有效批量

    计算有效批量,归一化损失,并在单张或多张显卡上验证梯度累积,及其等价性边界。

  3. 追踪你的机器学习实验:从运行到决策

    用机器学习实验清单将数据、代码、参数、预测和决策串联起来。无需强制使用特定工具的运行与产物管控示例。

适配还是压缩模型:如何选择变体?

一个基线、一次受控的改动,以及相当的质量。

  1. 微调:选择一种适配方式并验证其贡献

    用参照、分离的数据和重载检查来准备一次微调。LoRA、量化基座、预算与回归分析。

  2. 比较量化方案:内存、质量与有效成本

    用相同的数据比较参考、校准、权重格式和 KV 缓存。在决定 GPU 预算之前,先测量内存和质量。

  3. 规划 ML 消融实验:对照组、效应与预算

    用对照组、因子、交互作用和试验预算来构建 ML 消融计划。一个计算示例,用于排定变体优先级并得出结论。

预算有限。该优先做哪些试验?

一个实验顺序,以及将套餐成本与有效结果对照。

  1. 为 ML 项目做预算:试验、决策与整包计费

    拆解一个 ML 项目,排列各种变体的优先级,把 GPU 整包与有用的结果对应起来,并附上以美元计的日程和预算示例。

  2. 规划 ML 消融实验:对照组、效应与预算

    用对照组、因子、交互作用和试验预算来构建 ML 消融计划。一个计算示例,用于排定变体优先级并得出结论。

  3. ML 基准测试:在同等的质量下比较成本

    固定质量标准,测量同一语料库,并比较 3 天、7 天或 30 天 GPU 套餐的整体成本。可下载协议和原始表格。