問いを失わずにプロジェクトを縮小する
再現の場合、重要なクラスや難所を保つデータのサブセットから始めてください。その範囲で読み込み、学習、検証、保存を動作させます。この中間結果は完全な実験の代わりにはなりませんが、全期間を費やす前に計算経路を確認できます。どのシグナルが得られたら全体のコーパスやより大きな構成に移るかを、あらかじめ決めておいてください。
テストを24GBに収める
要素を分離します。重みの形式、計算精度、サンプル長、マイクロバッチです。2回のメモリ測定の間では、1つの要素だけを変更します。モデルとアクティベーションによっては、数個のパラメータの適応でこの範囲に収まる場合がありますが、同じモデルの完全なトレーニングではフットプリントが大きく異なることがあります。検証のパラメータも含め、正確なパラメータで観測されたピークを記録してください。
チェックポイントからの再開をテストし、再読み込み後にいくつかの出力を確認しましょう。最初のプランの有用な成果は、メモリとデータの選択を組み直さずに再実行できる実験であることが多いです。
完成した結果で世代を比較する
CUDA/PyTorch環境とコンパイル済み拡張がAmpereをサポートしていることを確認しましょう。古い研究リポジトリでは、依存関係を固定したファイルがあると診断が容易になります。RTX 4090は、同じ24 GBの容量でより新しいアーキテクチャを比較できます。RTX A6000は別の問いに答えます。つまり、例を短くするとプロトコルが変わってしまう場合などに、より多くのメモリを確保することです。
3日、7日、30日での進行を計画する
3日間は、再現可能なエンドツーエンドのテストに適しています。7日間では、安定したコーパス上でいくつかのバリエーションが可能です。30日間は、レシピの検証後に、より多くの反復をカバーできます。データとエクスポートを整理し、期間と数量を選択して、名、姓、メールアドレスを入力してください。レンタルは暗号通貨で決済され、身分証明書の提出は不要です。注文には追跡のステップが保存されます。