Перейти від окремого запиту до реалістичного навантаження
Почніть з одного запиту, а потім поступово збільшуйте кількість одночасних запитів. Відтворюйте фіксований набір вхідних даних із різними довжинами та типами вмісту. Записуйте медіану та показник повільних запитів, а не лише середнє. Для генерації розрізняйте час до першого токена та повну тривалість. Ці спостереження відповідають різним сценаріям використання, як-от інтерактивний інтерфейс або офлайн-обробка документів.
Зберегти запас у 24 ГБ
Модель, завантажена без помилок, усе одно може насичуватися під кількома запитами. Виміряйте кеш, буфери та поведінку на ваших довгих вхідних даних. Перевірте ліміт конкурентності, який зберігає запас, і занотуйте цей ліміт разом із моделлю. Якщо ви квантуєте ваги, перевірте відповіді на вашому наборі оцінювання, перш ніж вважати варіант еквівалентним.
Для офлайн-обробки більший batch може бути прийнятним, навіть якщо він збільшує індивідуальну затримку. Подайте ці дві цілі окремо у своєму журналі, щоб обрати конфігурацію відповідно до реальної потреби.
Обрати рушій, сумісний з Ada
L4 використовує архітектуру Ada. Перевірте версії CUDA, PyTorch або рушія інференсу, а також формати квантування та потрібні оператори. Початкове завантаження не перевіряє всі форми вхідних даних: включіть найвимогливіший приклад у тест. Порівняйте з RTX 4090 для іншої конфігурації на 24 ГБ або з L40S, коли більший контекст чи конкурентність вимагають 48 ГБ.
Орендувати, щоб визначити виміряну потужність
Три дні дозволяють простежити перший зв’язок між конкурентністю та затримкою. Сім днів дають час оцінити кілька налаштувань і повторити тест. Тридцять днів супроводжують регулярну кампанію інференсу або валідації. Підготуйте запити, модель і критерії якості перед замовленням. Оберіть свій тариф, вкажіть контактні дані та дотримуйтесь інструкцій щодо криптооплати; «Я оплатив» сигналізує про виконаний переказ.