Розділити роздільну здатність і розмір batch
Модель комп'ютерного зору, яка працює на маленьких зображеннях, не передбачає безпосередньо обсяг пам'яті, потрібний для ваших робочих зображень. Спершу побудуйте серію зі сталим batch і зростаючими роздільними здатностями, а потім серію з фіксованою роздільною здатністю і зростаючими batch. Це дасть змогу віднести відмінності до конкретного чинника. Зберігайте ті самі правила масштабування та кадрування: зміна попередньої обробки може вплинути на оцінку так само, як і вибір моделі.
Виміряти повне навчання чи адаптацію
48 ГБ дають більше місця, ніж карта на 24 ГБ, для активацій та допоміжних компонентів. Однак вони не визначають універсально прийнятний розмір моделі. Вимірюйте зворотне поширення, якщо ви навчаєте, весь конвеєр, якщо ви створюєте embeddings, і найбільші зразки, якщо форми змінюються. Фіксуйте пік та параметри, які його спричинили.
Для адаптації порівнюйте якість на наборі, відокремленому від налаштувань. Збільшення batch, щоб заповнити всю пам'ять, саме по собі не є науковим поліпшенням.
Ada та Ampere: порівняння за сталих рецептів
RTX 6000 Ada і RTX A6000 мають обидві по 48 ГБ у цьому каталозі, але належать до різних архітектур. Тож тримайте ваші версії CUDA, PyTorch і бібліотек якомога порівнюванішими. Перевіряйте скомпільовані розширення для Ada і тестуйте найспеціалізованішу операцію вашої моделі. L40S — це ще одне порівняння на 48 ГБ; RTX 4090 може бути достатньо, якщо ваші піки залишаються в її обсязі 24 ГБ.
Підготувати дані до тарифу
Трьох днів достатньо для картографування роздільна здатність/batch. Сім днів дають змогу адаптувати й оцінити кілька варіантів. Тридцять днів супроводжують кампанію комп'ютерного зору з повтореннями та впорядкованими експортами. Підготуйте маніфест зображень, їхні розділення та скрипт оцінювання, перш ніж обирати тривалість. Замовлення об'єднує конфігурацію, бажане середовище та ваші контактні дані; вашу оплату криптовалютою далі відстежують у тій самій справі.