マルチモーダルワークロードをステップに分割する
画像-テキストのパイプラインでは、画像の前処理、そのエンコード、コンテキストの準備、最終的な生成を区別してください。各ステップでピークが異なる場合があります。有用なテストセットには、複数の解像度とリクエストあたりの画像枚数、および固定長の出力が含まれます。応答の品質と各ステップの時間を記録して、アプリケーションにとって本当に重要な利得を特定してください。
48GBに明確な役割を与える
この容量により、複数のコンポーネントをGPU上に保持したり、24GBのカードを飽和させるバッチを増やしたりできます。目的なくメモリを埋めるのではなく、この利点を検証してください。コンポーネントが順次使用される場合は、それらを同時に存在させる場合とステップごとのロードを比較してください。実行が最終的に収まっても、転送と再ロードがレイテンシを変えることがあります。
LoRA適応の場合、ランク、対象モジュール、ベースモデルの精度、サンプルの長さを記録してください。学習するパラメータが少なくても、アクティベーションに必要なメモリはなくなりません。
CUDAと実際に使用するフォーマットを準備する
お使いのPyTorchビルドおよびアテンションや量子化の拡張のAda互換性を確認してください。ハードウェアが謳うフォーマットが、選択したエンジンで有効になっていると仮定しないでください。目標が24GBに収まるなら、同じ推論サービスでL4を比較してください。48GBがコンテキストや学習を制限する場合は、A100 SXMが80GBの容量をもたらし、同じレシピで評価できます。
レンタルの期待される成果を定義する
3日間では、各ステップのメモリプロファイルを作成します。7日間では、採用したバッチや適応を比較します。30日間では、結果の生成と定期的な評価を計画します。L40S、期間、数量を選択し、希望する環境を指定します。ソフトウェアと処理の管理はあなたが保持します。IteraGPUは、あなたのファイル、プロンプト、計算の内容を検査しません。