Перевірити конвеєр, перш ніж множити спроби
На невеликому наборі даних перевірте форми тензорів, мітки, розділення для валідації та узгодженість виходів. Спробуйте спершу навчитися на крихітному батчі, коли це доречно для вашого завдання: невдача може виявити проблему з даними, функцією втрат або градієнтами. Цей крок дає кориснішу основу, ніж тривалий запуск без проміжного контролю.
Створити просту карту пам’яті
Для цієї межі у 24 ГБ зафіксуйте обсяг після завантаження, пік одного кроку навчання та пік оцінювання. Додайте точність, мікробатч і довжину або роздільну здатність входів. Така коротка карта дає змогу відрізнити насичення, спричинене моделлю, від насичення, пов’язаного з даними. Вона також слугує для вибору наступного GPU, якщо ви розширюватимете експеримент.
Для інференсу квантованої моделі зберігайте приклади порівняння з еталонним виходом. Для адаптації збережіть навчені параметри та перезавантажте експорт у чистій сесії. Збережений файл і команда, що його відтворює, мають залишатися пов’язаними.
Залишатися узгодженим із поколінням Ampere
Переконайтеся, що ваш стек CUDA/PyTorch і спеціалізовані бібліотеки підтримують Ampere. Краще почати з комбінації, задокументованої вашим проєктом, а потім за потреби змінювати версії по одній. RTX 3090 — це ще одне порівняння на 24 ГБ. Якщо ваші входи неможливо зменшити без зміни самого завдання, розгляньте A40 на 48 ГБ, аніж накопичувати важко інтерпретовані адаптації.
Перетворити пакет на багаторазову відправну точку
Три дні можуть дати затверджений конвеєр і чекпоінт, який можна перезавантажити. Сім днів дають змогу розглянути кілька варіантів даних або гіперпараметрів. Тридцять днів підходять для скромної кампанії, уже готової до запуску та оцінювання. Перед замовленням підготуйте тестові дані та список результатів для експорту. Виберіть тривалість, кількість і бажане середовище, потім заповніть свої контактні дані. Оплата криптовалютою позначається в замовленні кнопкою «Я оплатив».