解像度とバッチサイズを分けて検証する
小さな画像で動作するビジョンモデルが、実際の作業画像のメモリ使用量をそのまま予測するわけではありません。まずバッチを固定して解像度を段階的に上げる系列を構築し、次に解像度を固定してバッチを段階的に上げる系列を構築します。これにより差異を帰属させることができます。リサイズとクロップのルールは同じに保ちましょう。前処理を変えると、モデルの選択と同じくらいスコアが変わる可能性があります。
学習または完全な適応を測定する
48GBは24GBのカードよりも活性化と補助コンポーネントのための余地を多く与えます。しかし、それによって普遍的に許容されるモデルサイズが定義されるわけではありません。学習する場合は逆伝播を、埋め込みを生成する場合はパイプライン全体を、形状が変動する場合は最も大きなサンプルを測定しましょう。ピークと、それを引き起こしたパラメータを記録します。
適応の場合、設定とは別に保持したセットで品質を比較しましょう。メモリを埋めるためにバッチを増やすことは、それ自体では科学的な改善にはなりません。
AdaとAmpere:同じレシピでの比較
RTX 6000 AdaとRTX A6000は、このカタログではどちらも48GBですが、異なるアーキテクチャに属しています。そのため、CUDA、PyTorch、ライブラリのバージョンは可能な限り揃えましょう。Ada向けにコンパイルされた拡張機能を確認し、モデルで最も特殊な演算をテストします。L40Sはもう一つの48GBの比較対象です。ピークが24GBの枠内に収まるなら、RTX 4090で十分な場合もあります。
プランの前にデータを準備する
3日間は解像度/バッチのマッピングに適しています。7日間では、いくつかのバリエーションを適応させ評価できます。30日間は、反復と整理されたエクスポートを伴うビジョンキャンペーンに伴走します。期間を選ぶ前に、画像のマニフェスト、それらの分割、評価スクリプトを用意します。注文には構成、希望する環境、連絡先がまとめられ、暗号通貨での支払いはその後同じ案件で追跡されます。