用于 ML 研究的 GPU · 无需 KYC 的加密货币支付
IteraGPU
GPU 租赁 / 微调活动

为您的适配提供所需的容量。

让您的模型适配特定任务,无需购买显卡。IteraGPU 提供三种配置供您对比,用于为期一周的训练活动:选择适合您协议的内存和后端,然后直接使用加密货币支付租用费用,无需预先充值。

加密货币支付,无需 KYC。直接支付,无需预先充值,例如使用 Bitcoin 上的 BTC 或 Tron 上的 USDT。 需要账户:名字、姓氏、邮箱和密码。无需 KYC 程序,也无需身份证件。

三种配置,为您的适配周做好准备。

7 天 · 1 个批次

NVIDIA GeForce RTX 4090 24GB

USD 110.00

7 天 · 1 批 · 1 GPU · 每块 GPU 24 GB

RTX 4090 · 24 GB 显存上的训练活动

适合首次适配的 NVIDIA 候选方案,完整周期可在单卡 24 GB 内完成。对比其套餐价格,以便准备您的基准、优先变体以及具有明确容量设定的评估。

配置 7 天查看完整详情
7 天 · 1 个批次

NVIDIA A100 SXM 80GB

USD 280.00

7 天 · 1 批 · 1 GPU · 每块 GPU 80 GB

A100 SXM · 升级至每卡 80 GB

如果您的协议需要超过 24 GB 的内存,可以选择这款 NVIDIA 配置。每批次每块 GPU 提供 80 GB 标称内存,便于组织训练活动;您还可以在相同时长下对比 H100 SXM 80 GB。

配置 7 天查看完整详情
7 天 · 1 个批次

AMD Instinct MI300X 192GB

USD 450.00

7 天 · 1 批 · 1 GPU · 每块 GPU 192 GB

MI300X · 搭配适配的 AMD 后端提供 192 GB

适合需要该容量的负载的单卡 192 GB 方案。当您的 AMD 后端、库和扩展支持计划的适配协议时,可以选择 MI300X。

配置 7 天查看完整详情

选择服务于您研究问题的套餐。

您的训练活动可能旨在更好地对工单分类、提取字段或遵循特定的回复格式。明确相对于初始模型的预期提升,然后将租用时间用于能够帮助您做出决策的对比。所展示的三款方案均覆盖 7 天,提供单块 GPU,并以 USD 显示总价。

根据整个工作流程来选择内存:加载数据集、适配、评估和导出。LoRA 或量化基础模型是根据您的架构需要考察的选项;仅凭其名称并不能确定所需容量。下文详述的方法可帮助您准备一次有效的对比。

下单前请汇总所有前置条件:后端和库版本、所需软件、RAM、存储以及交付条件。如果您的训练活动依赖 Jupyter 访问及其文件持久化,请务必确认。已公布的硬件并不意味着您的环境已预先安装;结果和运行时间仍取决于您的实际负载。

  • 对于已确认可在 24 GB 内运行的负载,请考察 RTX 4090 套餐。如果有效周期的峰值超过该容量,请对比提供更大内存的显卡。
  • 对于需要 80 GB 的 NVIDIA 协议,请在相同时长下对比 A100 SXM 和 H100 SXM。二者共享的标称内存使其可相互对比;模型的选择还取决于您的库以及套餐价格。
  • 若要考虑 MI300X,请先确认您的 AMD 后端是否支持。其每卡 192 GB 的内存并不能替代这一软件层面的验证。
  • 上述场景均基于 7 天。详情页还支持选择 3 天或 30 天,以调整您的训练活动窗口,并在下单前显示整个周期的价格。

直接用加密货币支付您的租用费用。

直接支付,无需预先充值,例如使用 Bitcoin 上的 BTC 或 Tron 上的 USDT。 需要账户:名字、姓氏、邮箱和密码。无需 KYC 程序,也无需身份证件。

查看资产、网络和支付条件

选择您的租赁方案:实用的解答。

本页展示的微调套餐包含哪些内容?

此处展示的每款 IteraGPU 方案均涵盖 7 天的单块 GPU:RTX 4090 24 GB、A100 SXM 80 GB 或 MI300X 192 GB。所显示的 USD 金额覆盖整个周期。您租用 GPU 算力来组织自己的适配工作;该套餐并非由我们代您完成的微调服务。详情页还提供 3 天和 30 天的时长选项。

为了获得更大内存,我是否应该选择 MI300X 而非 A100 或 H100?

在 IteraGPU,MI300X 每卡提供 192 GB,而 A100 SXM 和 H100 SXM 均为 80 GB。请将这些容量与您适配周期的峰值进行对比,但也要考虑后端:若选择 MI300X,您的协议必须在 AMD 上获得支持。如果您的环境是为 NVIDIA 准备的,A100 和 H100 是两款可对比套餐的 80 GB 候选方案。仅凭标称容量无法预测吞吐量或所获得的质量。

我可以用加密货币支付训练活动费用,无需充值或身份证明吗?

可以。IteraGPU 允许直接使用加密货币支付租用费用,无需预先充值,也无需 KYC 或身份证明。支持的支付方式包括 Bitcoin 网络上的 BTC 和 Tron 网络上的 USDT。下单和跟踪租用进度需要注册账户,填写名、姓、邮箱和密码。支付确认与 GPU 交付是两个独立的步骤。

LoRA 能让任何适配都在小显存显卡上完成吗?

不能。基础模型、激活值、输入以及所学习参数的状态仍然占用显存。在下结论之前,请用你的架构和精度测量实际的有效周期。

导出适配器后我可以更换基础模型吗?

适配器依赖于它生成时所针对的基础模型和模块。请保存它们的准确引用。任何更换都必须作为新的组合来处理,需要重新加载并重新评估。

损失更低就足以选定适配器吗?

不能。请以针对用途定义的质量标准为准,并检查回归情况。损失有助于诊断学习过程;它不能代替在预留样本上对输出进行评估。

从参考基准到可复用的适配器

构建将指导您购买的方案。

01 /

明确这次实验要证明的收益。

定义一个可观察的任务:对工单分类、抽取字段,或遵守某种回答格式。先打磨一条参照指令并保留其输出。如果仅靠修改提示词就足够,那它就成为一个可比较的候选。没有这个对照组,归功于微调的提升可能仅仅来自更好的表述方式或对回答的另一种处理。

将格式有效性与内容准确性分开。一个能通过解析器的 JSON 对象可能包含错误的类别。补充需要保留的行为,例如对缺失字段或罕见类别的处理。在选择秩、学习率或步数之前,先确定接受规则和拒绝原因。

02 /

选择能真正区分优劣的数据。

当同一段对话、同一份文档或同一来源的变体距离过近、威胁到评估独立性时,应把它们放在同一个集合中。要在学习到的变换或由结果驱动的调参之前完成划分。按行随机切分,可能在几乎已经见过的样本上造成进步的假象。

教学示例:1 200 张按对话分组的工单,在遵守分组后划分为 840 个学习示例、180 个验证示例和 180 个测试示例。这些数字描述的是一个示意性方案,而非提供的语料库。验证集用于选择变体;最终测试集则保持隔离。要检查每个集合中的类别和长度,而不是相信仅凭比例就能保证质量。

03 /

确定要与你基准对比的那个适配方案。

完全微调会修改基座中相关的权重。LoRA 向目标模块添加低秩矩阵,并学习它们的贡献。秩、目标模块、缩放系数和所选项共同定义了这次实验。更高的秩会增加适配器的参数量,但并不能证明它会改善你的任务。

对于一个 4 096 × 4 096 的示意矩阵,两个秩为 8 的 LoRA 矩阵包含 8 × (4 096 + 4 096) = 65 536 个值,而稠密矩阵中有 16 777 216 个值,这还不包括偏置和其他模块。这个数量比既不描述整个模型,也不描述内存峰值:基座、激活值和学习到的参数状态仍需考虑。

适配选择——测量前需记录的差异
选项变化之处必要的控制
参考指令提示词及可能的解析质量,而不修改权重
LoRA目标模块的附加参数模块、秩、学习和重新加载
量化基座与适配器部分权重和学习到的参数的存储确切格式、兼容性与质量
完全微调训练后的基座权重优化器状态、内存和训练成本

技术来源: PEFT — 配置与 LoRA 矩阵

04 /

为整个工作流程选择精度。

以四位加载的基座并不意味着所有运算、所有张量和缓存都使用四位。量化元数据以及以其他精度保留的模块会影响内存分配。在 bitsandbytes 中,对以四位或八位加载的模型进行训练,针对的是附加参数;这并不是对量化权重的全局更新。

记录基座格式、计算类型、可训练模块和版本。对比一个真实的训练步、评估以及你希望使用的导出操作。合并、反量化或生成另一种格式,所需空间可能不同于训练时所需的空间。一种在适配期间可行的方案,还不能证明整个流程都能在同一张卡上跑通。

技术来源: Transformers 5.17 — bitsandbytes 与附加参数

05 /

在既定的试验预算内对比各个变体。

在示意数据集上,保留一个无适配基线、一个秩为 8 的 LoRA 和一个秩为 16 的变体,使用相同的模块、数据、步数预算和评估规则。这样,秩就是所研究的因素。如果同时改变秩和学习率,你就制造了另一个问题;消融指南会说明如何让这种交互清晰可读。

在每次试验前,检查几个分词后的示例以及参与损失计算的部分。试验后,用同一个评估器对照已识别的预测。记录缺失的输出和回退,而不仅仅是平均值。根据你的质量约定,一个罕见类别若变得系统性错误,就可能使整体收益失效。

还要记录 alpha、dropout 和初始化。在经典的 LoRA 设置下,缩放为 alpha/r;当秩变化时,要说明你是保持 alpha 不变还是保持 alpha/r 不变。这些协议所回答的并不完全是同一个问题。其他缩放规则,例如 rsLoRA,必须单独标明。

技术来源: PEFT — LoRA 的秩、alpha 与缩放规则

06 /

在投入更多算力前,先决定要修正什么。

损失在下降而验证质量却停滞,这时需要分析,而不是自动增加步数。检查标签错误、表述重复、被截断的输入,以及训练格式与推理格式之间的不一致。按类别保留一份错误样本,用于选择修正方式。

如果你修正了分类体系或解析方式,请给评估器打版本,并重新计算必要的候选分数。不要直接比较用不同规则得到的两个数字。如果你为了选择修正方式而查看最终测试集,那么它从此就参与了开发:请为下一次结论准备一份新的独立评估。

07 /

确认你想复用的那个结果。

PEFT 格式保留适配器的参数及其配置;它通常不包含基础模型的权重。因此,请把该基础模型的准确标识符和版本与产物一起保存。仅一个指向会持续演进的版本的模型名称,不足以重建当时的条件。

在新的进程中重新加载真正用于实际使用的结果。重放若干控制输入,再重放评估协议。归档 tokenizer、模板、生成参数、依赖项、指标和数据来源。如果产物已合并,请记录这一转换并校验其输出;它是一道需要验证的步骤,而不是一个看不见的形式。

技术来源: PEFT — 检查点内容与基础模型

08 /

根据结果选择下一步。

依据完整步骤与评估的峰值、所需的最大输入,以及兼容的软件栈来比较 GPU。在套餐中为对照组、优先变体、错误排查和恢复预留时间。下单时选择某个环境表达的是你所期望的准备程度,并不会自动认定你的适配已经合格。

结论必须指明选定的候选方案,或说明没有获得足够的增益、覆盖了哪些分组、已知的回归,以及重新加载的条件。你的记录本保存参考信息和作出该选择的理由。显存测量包有助于理解插桩;它并不会替你提供一个经过测试的 LoRA 训练。

先选定算力容量,再选择您的套餐。

结合您的内存峰值和软件环境来比较候选方案。

选择我的配置