Перейти от одиночного запроса к реалистичной нагрузке
Начните с одного запроса, затем постепенно увеличивайте число одновременных обращений. Воспроизводите фиксированный набор входных данных с разными длинами и типами контента. Фиксируйте медиану и меру медленных запросов, а не только среднее. Для генерации различайте время до первого токена и полную длительность. Эти наблюдения отвечают разным сценариям, например интерактивному интерфейсу или офлайн-обработке документов.
Сохранить запас в пределах 24 ГБ
Модель, загрузившаяся без ошибок, всё ещё может насыщаться при нескольких запросах. Измерьте кэш, буферы и поведение на ваших длинных входах. Проверьте предел конкурентности, сохраняющий запас, и зафиксируйте этот предел вместе с моделью. Если вы квантуете веса, проверьте ответы на вашем наборе оценки, прежде чем считать вариант эквивалентным.
Для офлайн-обработки больший батч может быть приемлем даже при увеличении индивидуальной задержки. Изложите эти две цели отдельно в вашей тетради, чтобы выбрать конфигурацию исходя из реальной потребности.
Выбрать движок, совместимый с Ada
L4 использует архитектуру Ada. Проверьте версии CUDA, PyTorch или движка инференса, а также форматы квантования и требуемые операторы. Начальная загрузка не проверяет все формы входных данных: включите в тест самый требовательный пример. Сравните с RTX 4090 для другой конфигурации на 24 ГБ или с L40S, когда больший контекст или конкурентность требуют 48 ГБ.
Арендовать, чтобы определить измеренную ёмкость
Три дня позволяют проследить первую зависимость между конкурентностью и задержкой. Семь дней дают время оценить несколько настроек и повторить тест. Тридцать дней сопровождают регулярную кампанию инференса или валидации. Подготовьте запросы, модель и критерии качества до заказа. Выберите тариф, укажите свои контактные данные и следуйте инструкциям по криптовалюте; «Я оплатил» сигнализирует о выполненном переводе.