アプリケーションが実際に行っていることを計測する
すでにGPU上にあるテンソルを使ったテストは、計算そのものを表します。サービスや学習では、入力をデコードし、準備し、転送する必要もあります。そこで、計算ループ単体と、普段のデータから始まるループの2つの測定を構築します。その差は、どこに改善の余地があるかを示します。時間を記録する前に、GPU処理の実際の終了を待ちます。CUDAの起動は多くの場合非同期です。
バッチを制御変数として使う
オフライン推論では、入力の長さと種類を保ったまま複数のバッチサイズを比較します。対話型アプリケーションでは、1リクエストのレイテンシと最も遅いリクエストのレイテンシも測定します。処理量を最大化するバッチは、待ち時間を許容しにくくする可能性があります。80GBでは、モデルのロードでサイジングを止めるのではなく、キャッシュやアクティベーション用の余裕を確保します。
重みと計算の精度を別々に記録してください。縮小フォーマットで保存されたモデルでも、実行中はより高精度なバッファや演算を使用することがあります。
H100バリアントを同一視せずに比較する
このページはH100 PCIe 80GBに関するものです。H100 SXMや複数カード構成の結果が、自動的にこの構成を表すわけではありません。ご自身のアーキテクチャ向けにCUDA、PyTorch、専用ライブラリを確認し、比較するGPUに共通のレシピを選んでください。80GBで足りなければH200を検討し、48GBに収まるならL40Sを経済的な比較に加えてください。
パイプライン指向の注文を準備する
3日間は、計算と転送の割合を特定するのに使えます。7日間では、修正を試し、測定を繰り返せます。30日間は、推論キャンペーンや計画的な学習に伴走します。期間と数量を選択し、環境を指定してから、追跡用の連絡先を入力します。注文の暗号通貨の手順にはネットワークと金額が記載されており、「支払いました」ボタンで送金を通知します。