まず2枚のカードが何を共有するかを決める
古典的なデータ並列では、各GPUがモデルのコピーを保持し、バッチの一部を受け取ります。1枚のカードには大きすぎるモデルの場合は、パラメータや層の分割が必要です。したがって、合計360GBが自動的に単一の割り当てになるわけではありません。レンタル前に仮説を書き出してください。グローバルバッチを増やす、1ステップの時間を短縮する、あるいは実行を可能にする、といったことです。
結論を生み出す分割の試行
モデルが1枚に収まるなら、まず削減した同じデータセットを1枚で、その後2枚で始めましょう。各 GPU のメモリピーク、ウォームアップ後のステップあたりの時間、通信コストを記録します。片方がほぼ空で、もう片方が飽和している場合は、分散のバランスが悪いことを示唆します。複数のハイパーパラメータを検討する場合、2つの独立した実験のほうが分散学習より有用なことがあります。
この比較の間は、精度と処理する例の数を一定に保ってください。数値形式とバッチサイズを同時に変えて得られた改善は、ハードウェアの効果に帰属させるのが難しくなります。
Blackwellスタックを準備し、代替案を選ぶ
PyTorchのバージョン、CUDAディストリビューション、コンパイル済み拡張機能がBlackwellを正しくターゲットにしているか確認してください。別の世代に対応したカスタムカーネルだけでは、この互換性を確立するには不十分です。本格的なキャンペーンの前に、必須の演算をテストしてください。モデルとその実行時予備領域が141GBに収まるなら、H200は単一GPUでの実行を検討できます。MI300Xは、ROCm向けに準備されたプロジェクトにとって別の道筋を開きます。
実行可能な研究枠を予約する
3日間は、事前に準備した分散の検証に適しています。7日間あれば、複数のバリアントとその評価を整理できます。30日間は、チェックポイントと停止基準を定めた継続的なキャンペーンに対応します。2枚のカードのロット数、期間、希望する環境を選び、連絡先を入力してください。暗号資産の送金後、注文の「支払いました」を使用し、その後は支払いとアクセス準備の手順に従ってください。