ML 研究向け GPU · KYC 不要の暗号通貨決済
IteraGPU
GPUカタログ / 2 × NVIDIA B200 SXM
Location GPU / NVIDIA

2 × NVIDIA B200 SXM

2基の B200 SXM のロットは、2基の GPU を使う明確な理由がある実験向けです。モデルを分散させる、学習を分散させる、あるいは独立した2つのバリアントを実行するといった用途です。各カードは 180 GB の HBM3e を搭載しており、これらの容量をどう活用するかはあなたのソフトウェア戦略次第です。

あなたの構成

ロットあたりのGPU
2
GPUあたりのメモリ
180 Go
メモリの種類
HBM3e
在庫あり
4 2台単位

3日、7日、30日のプラン。台数は次のステップで選択します。

KYCや身分証明書なしの暗号通貨決済。注文の追跡には名、姓、メールアドレスが必要です。

支払いの流れ
あなたのレンタル3 / 7 / 30 日

2 × NVIDIA B200 SXM

2 GPU込み · カードあたり180 GB · HBM3e

プラン合計 · 3日

USD 887.57

2枚のカードのロットが4件利用可能です。

この構成をレンタル

まず2枚のカードが何を共有するかを決める

古典的なデータ並列では、各GPUがモデルのコピーを保持し、バッチの一部を受け取ります。1枚のカードには大きすぎるモデルの場合は、パラメータや層の分割が必要です。したがって、合計360GBが自動的に単一の割り当てになるわけではありません。レンタル前に仮説を書き出してください。グローバルバッチを増やす、1ステップの時間を短縮する、あるいは実行を可能にする、といったことです。

結論を生み出す分割の試行

モデルが1枚に収まるなら、まず削減した同じデータセットを1枚で、その後2枚で始めましょう。各 GPU のメモリピーク、ウォームアップ後のステップあたりの時間、通信コストを記録します。片方がほぼ空で、もう片方が飽和している場合は、分散のバランスが悪いことを示唆します。複数のハイパーパラメータを検討する場合、2つの独立した実験のほうが分散学習より有用なことがあります。

この比較の間は、精度と処理する例の数を一定に保ってください。数値形式とバッチサイズを同時に変えて得られた改善は、ハードウェアの効果に帰属させるのが難しくなります。

Blackwellスタックを準備し、代替案を選ぶ

PyTorchのバージョン、CUDAディストリビューション、コンパイル済み拡張機能がBlackwellを正しくターゲットにしているか確認してください。別の世代に対応したカスタムカーネルだけでは、この互換性を確立するには不十分です。本格的なキャンペーンの前に、必須の演算をテストしてください。モデルとその実行時予備領域が141GBに収まるなら、H200は単一GPUでの実行を検討できます。MI300Xは、ROCm向けに準備されたプロジェクトにとって別の道筋を開きます。

実行可能な研究枠を予約する

3日間は、事前に準備した分散の検証に適しています。7日間あれば、複数のバリアントとその評価を整理できます。30日間は、チェックポイントと停止基準を定めた継続的なキャンペーンに対応します。2枚のカードのロット数、期間、希望する環境を選び、連絡先を入力してください。暗号資産の送金後、注文の「支払いました」を使用し、その後は支払いとアクセス準備の手順に従ってください。

この構成で最初のトライアルを準備する

GPUの仕様書はあくまで能力を示すものです。以下の方法は、ご自身のワークロードで検証すべき入力、設定、結果を定義するのに役立ちます。