Заміряти, що насправді робить ваш застосунок
Тест на тензорах, уже наявних на GPU, описує лише обчислення. Сервіс чи навчання також має декодувати, готувати й передавати свої вхідні дані. Тож побудуйте два виміри: ізольований цикл обчислень і цикл, що виходить із ваших звичайних даних. Різниця вказує, де шукати покращення. Дочекайтеся фактичного завершення роботи GPU, перш ніж фіксувати час; запуски CUDA часто асинхронні.
Використовувати батч як контрольовану змінну
Для офлайн-висновування порівняйте кілька розмірів пакета, зберігаючи довжину та тип входів. Для інтерактивного застосунку також виміряйте затримку одного запиту та найповільніших запитів. Батч, що максимізує оброблений обсяг, може зробити очікування менш прийнятним. На 80 ГБ зарезервуйте місце для кешу чи активацій, замість зупиняти підбір розміру на завантаженні моделі.
Фіксуйте точність ваг і обчислень окремо. Модель, збережена у зниженому форматі, може все ще використовувати буфери або операції вищої точності під час виконання.
Порівнювати, не ототожнюючи варіанти H100
Ця сторінка стосується H100 PCIe 80 ГБ. Результати H100 SXM чи набору з кількох карт автоматично не описують цю конфігурацію. Перевірте CUDA, PyTorch і спеціалізовані бібліотеки для вашої архітектури, а потім виберіть спільний рецепт для порівнюваних GPU. Якщо 80 ГБ не вистачає, розгляньте H200; якщо потреба вкладається у 48 ГБ, додайте L40S до свого економічного порівняння.
Підготувати замовлення, орієнтоване на конвеєр
Три дні можуть допомогти визначити частку обчислень і передач. Сім днів дають змогу перевірити виправлення та повторити вимірювання. Тридцять днів супроводжують кампанію інференсу або заплановане навчання. Виберіть тривалість і кількість, укажіть ваше середовище, а потім ваші координати для відстеження. Криптографічні інструкції замовлення вказують мережу та суму; кнопка «Я оплатив» позначає ваш переказ.