Спершу визначте, що саме дві карти розділять між собою
У класичному паралелізмі за даними кожен GPU зберігає копію моделі та отримує частину пакета. Для моделі, завеликої для однієї карти, потрібен розподіл параметрів або шарів. Отже, додані 360 ГБ не утворюють автоматично єдине виділення. Запишіть свою гіпотезу до оренди: збільшити глобальний пакет, скоротити час одного кроку чи уможливити запуск.
Експеримент із розподілу, що дає висновок
Почніть з того самого зменшеного набору даних на одній карті, якщо модель на неї вміщається, а потім на двох. Фіксуйте пік пам'яті кожного GPU, час на крок після прогріву та витрати на обмін. Майже порожня карта й перевантажена інша вказують на незбалансований розподіл. Два незалежні експерименти можуть бути кориснішими за розпаралелене навчання, коли ваше питання стосується кількох гіперпараметрів.
Під час цього порівняння тримайте точність і кількість оброблених прикладів сталими. Покращення, отримане одночасною зміною числового формату й розміру пакета, було б важко приписати апаратному забезпеченню.
Підготувати стек Blackwell і вибрати альтернативу
Переконайтеся, що ваша версія PyTorch, ваш дистрибутив CUDA та скомпільовані розширення правильно орієнтовані на Blackwell. Кастомне ядро, сумісне з іншим поколінням, не достатньо для встановлення такої сумісності. Протестуйте ключові операції перед повною кампанією. Якщо ваша модель і її робочий запас вміщуються на 141 ГБ, H200 дає змогу дослідити виконання на одному GPU; MI300X відкриває інший шлях для проєкту, підготовленого під ROCm.
Забронювати придатне для досліджень вікно
Три дні підходять для заздалегідь підготовленої валідації розподілу. Сім днів дають змогу організувати кілька варіантів та їх оцінювання. Тридцять днів відповідають тривалій кампанії з визначеними контрольними точками та критеріями зупинки. Оберіть кількість комплектів по дві карти, тривалість і бажане середовище, потім вкажіть свої контактні дані. Після вашого крипто-переказу скористайтеся кнопкою «Я оплатив» у замовленні; далі дотримуйтеся кроків оплати та підготовки доступу.