GPU для исследований в ML · Криптооплата без KYC
IteraGPU
Инструмент / Планирование

Сколько памяти нужно для вашей гипотезы?

Чтобы выбрать GPU, начните с модели и нагрузки, которую нужно обработать, затем совместно проверьте совместимость, полную память и ожидаемое качество. Планировщик складывает теоретические веса и выбранный резерв; он даёт кандидатов для рассмотрения. Он не вычисляет автоматически кэш, активации или состояния оптимизатора. Неизвестный обязательный критерий нужно подтвердить, прежде чем останавливаться на конфигурации.

01 / КалькуляторОценка

Задайте свои гипотезы.

Кэш, активации, буферы: гипотеза, требующая измерения.

Ориентировочный объём

19 GiB

Только веса

13 GiB
Examiner NVIDIA RTX A5000 24GB

Веса = параметры × биты ÷ 8 ÷ 2³⁰. Метаданные квантования не включены. Пропускная способность не прогнозируется.

Выбранный резерв, затем проверенный.

Результат складывает теоретические веса и ваш резерв. Батч, кэш, активации и оптимизатор не учитываются автоматически.

Начните с явной гипотезы, затем используйте приведённые ниже сценарии, чтобы подготовить измерение на вашей нагрузке.

От оценки к измерению
01 /

Выбрать конфигурацию для заданной нагрузки

Список GPU, рекомендация для вашей модели и альтернатива вашей текущей конфигурации требуют одной и той же стартовой карточки: модель и ревизия, инференс или адаптация, формат весов, необходимая длина, конкурентность или микробатч и критерий качества. Сохраняйте эти требования, когда сравниваете предложения. Конфигурация, которая обрабатывает меньше контекста, или упрощённая задача не отвечают автоматически той же потребности.

Классифицируйте каждое обязательное требование: допустимо, если имеющийся документ подтверждает его в вашем сценарии; требует подтверждения, если он отсутствует; исключить, если установленный сбой не позволяет выдержать нагрузку. Кандидат отбирается только тогда, когда все эти требования выполнены. Затем отберите допустимых кандидатов по полной стоимости пакета, полезной марже и документированному графику. Предпочтение не компенсирует отборочный критерий.

02 /

Связать каждый критерий с документом и решением

Коммерческая карточка подтверждает то, что предлагается; ваш протокол устанавливает то, что работает на нагрузке. Среда, запрошенная при заказе, остаётся предпочтением по подготовке. Номинальный объём памяти или заявленный запас не доказывают ни установку программного обеспечения, ни срок предоставления в распоряжение.

Сохраняйте документ вместе с его версией и рамками. Если обязательная информация не задокументирована, точно укажите условие, требующее подтверждения. Таблица позволяет сформировать предварительный отбор, не превращая эти неизвестные в гарантии.

Таблица отбора — решение, зависящее от вашей нагрузки, заполняется вашими документами
Обязательный критерийПроверяемый документДопустимоТребует подтвержденияИсключить
Нагрузка покрытаМодель, ревизия, токены, batch/параллелизм и выполненные входные данныеВся необходимая нагрузка покрытаРеальные размеры неизвестныЧасть необходимого удалена
СовместимостьОфициальная документация программного обеспечения и проверка целевой средыТребуемая комбинация проверенаСреда только желательнаНеобходимая зависимость несовместима
Память на GPUРасчёт по частям, доступная ёмкость и пики полезных фазПолный цикл покрыт с обоснованным запасомИзвестны только веса или небольшой тестНасыщение на требуемой нагрузке
КачествоЗафиксированный корпус, определённые выходные данные и пороги, заданные до сравненияПороги и допуски соблюденыНовый формат не оценёнРегрессия за пределами допуска
Распределение и серверРазмещение компонентов; необходимая RAM, хранилище или межсоединениеПотребности провереныТребуемые характеристики не задокументированыНеобходимое распределение невозможно
Бюджет и графикПакет, партии, карты, дни, итог в USD и полный планПотолок и окно соблюденыСроки пока гипотетическиеБюджет или срок превышены

Технические источники: Лист нагрузки для инференса · Измерить фазы и счётчики · Задать критерии качества · Спланировать стоимость эксперимента

03 /

Понимать, что рассчитывает результат

Число параметров соответствует значениям, которые вы представляете в плотном расчёте. Формат указывает их число бит на значение. Результат «Только веса» переводит этот объём в Gio, затем «Ориентировочная оболочка» добавляет ваш резерв. Выбор обучения или адаптации в инструменте не применяет скрытый универсальный множитель; он предлагает вам задокументировать недостающие статьи.

Эта простота позволяет перечитать гипотезу. Она также требует понимать, что остаётся за пределами расчёта: метаданные квантования, модули другого формата, рабочая память, переходная загрузка и использования вне процесса. Предложенная карточка GPU — кандидат для рассмотрения, а не гарантия, что ваша модель на ней заработает. Название и номинальная память карты не описывают остальную часть её сервера.

Вес в Gio = параметры × бит на значение ÷ 8 ÷ 1 073 741 824
04 /

Читайте единицы измерения, прежде чем сравнивать карту

Десятичный GB соответствует миллиарду байт; GiB соответствует 2³⁰ байт. Каталог отображает номинальный объём в GB. Инструмент применяет десятичную конвенцию; чтобы подтвердить конфигурацию, уточните также объём в байтах, заявленный устройством. Счётчики вашей программы могут отображаться в байтах или GiB. Преобразуйте величины с одинаковым определением, прежде чем сравнивать их размер; не смешивайте номинальную память, свободную память и зарезервированный пик.

Пример расчёта: 24 миллиарда байт составляют примерно 22,35 GiB. Этот результат не предсказывает объём, свободный на карте с 24 GB. Система, среда выполнения и другие аллокации могут учитываться. Сохраняйте единицу измерения и контекст в названии каждого столбца вашей таблицы тестов.

Технические источники: NIST — двоичные и десятичные приставки

05 /

Разобранный пример: семь миллиардов параметров

Для 7 миллиардов параметров в 16 битах плотный объём составляет 14 миллиардов байт, то есть примерно 13,04 ГиБ. При выбранном резерве 6 ГиБ общая оболочка становится 19,04 ГиБ. Расчёт не доказывает, что резерв 6 ГиБ подходит вашей модели: именно это и есть гипотеза, которую нужно проверить с учётом выбранных входных данных и операций.

В таблице сохраняется один и тот же резерв, чтобы показать только арифметический эффект формата весов. При реальном запуске другие выделения памяти могут меняться иначе. Четырёхбитное представление часто включает дополнительную информацию и может оставлять некоторые слои в другом формате. Поэтому не читайте последнюю строку как гарантированный общий пик.

Теоретический пример — 7 миллиардов плотных параметров, произвольный резерв 6 ГиБ
Формат весовПлотный объём в байтахВес в ГиБ, округлённоВес + резерв в ГиБ
32 бита28 000 000 00026,0832,08
16 бит14 000 000 00013,0419,04
8 бит7 000 000 0006,5212,52
4 бита теоретически3 500 000 0003,269,26

Технические источники: Transformers 5.17 — форматы и ограничения bitsandbytes

06 /

Как построить объяснимый резерв

Разложите резерв на составляющие вместо того, чтобы выбирать процент по привычке. При авторегрессивном инференсе фиксируйте архитектуру, кэш, сохраняемые токены и одновременные последовательности. При обучении отмечайте обучаемые параметры, градиенты, оптимизатор, активации и буферы. Длина входа и микробатч входят в карточку, даже если число параметров не меняется.

Некоторые статьи не достигают максимума в один и тот же момент. Сложение независимых максимальных запасов может служить консервативной оболочкой, если это заявлено как таковое, но это не наблюдаемый пик. Вписывайте оценённые статьи, измеренные и пока неизвестные. Руководство по KV-кэшу подробно разбирает один из таких расчётов; материал по памяти возвращает счётчики к фазам программы.

Карточка резерва для заполнения под вашу нагрузку
Статья для документированияНеобходимые входные данныеОжидаемое подтверждение
Кэш генерацииKV-головы, слои, токены, последовательности, форматРасчёт под архитектуру, затем измерение
АктивацииМикробатч, длина, архитектура, checkpointingПик на выбранных входных данных
Градиенты и оптимизаторОбучаемые параметры, форматы, методПервое полное обновление
Загрузка, валидация и экспортПроцедура и размеры выводаПроверка каждой необходимой фазы
07 /

Проверяйте по этапам, не подменяя задачу незаметно

Начните с короткого входа и маленького батча, чтобы выявить ошибки подготовки. Затем перейдите к обычному входу, а потом к действительно необходимому вам пределу. Если программа обрезает данные, сохраняет меньше токенов или пропускает часть корпуса, проходящий случай не подтверждает заявленную нагрузку. Записывайте фактически выполненные размерности.

Фиксируйте пик по фазам и по каждому GPU вместе с его счётчиком. Память, выделенная под тензоры, и память, зарезервированная аллокатором PyTorch, не складываются. Системное чтение может охватывать больше, чем инструментированный процесс. Если рассматривается несколько карт, документируйте их программное распределение; две карты не образуют автоматически единое адресное пространство памяти.

Технические источники: PyTorch — управление памятью CUDA

08 /

Как решать после первого превышения

Сбой при загрузке указывает на веса, формат или временное выделение. Сбой при генерации требует рассмотрения контекста и параллелизма. Сбой на обратном проходе может указывать на микробатч, активации или стратегию вычислений. Такая локализация избавляет от случайной одновременной смены точности, модели и данных.

После каждой правки проверяйте качество и охваченный периметр. Уменьшение необходимой длины может быть неприемлемым; смена квантизации может изменить выходные данные. Если требуется другая мощность, вернитесь в каталог с карточкой, в которой указаны наблюдаемый пик, обоснованный запас, версии и предельные входные данные. Запас без обоснования не надёжнее результата, округлённого до целого гигабайта.

09 /

Короткая подборка при тех же требованиях

Для иллюстративного инференса на 7 миллиардов параметров в 16 битах с резервом 6 ГиБ разобранный пример даёт 19,04 ГиБ. Вы можете рассмотреть RTX 4090 на 24 ГБ или RTX 6000 Ada на 48 ГБ. Их заявленные предложения для партии из одной карты на 3 дня составляют соответственно 47,14 USD и 55,71 USD. Это два кандидата разной мощности: контекст, параллелизм, реально доступную память, совместимость и качество ещё предстоит проверить. Эти цены не устанавливают никакого рейтинга скорости.

Для адаптации возьмите ту же сетку с изученными параметрами и дополнительные фазы: обратный проход, первое обновление, валидацию и экспорт. Количество параметров LoRA само по себе не подтверждает общую память. Прохождение fine-tuning помогает охарактеризовать результат; batch и накопление служат для документирования сопоставимого обновления.

Если вы ищете альтернативу после превышения лимита, определите сбойную фазу и сохраните требования к выходу. Сравнивайте по одному изменению за раз: ёмкость, кэш, микробатч или точность. Другой формат должен вернуть установленное минимальное качество. Если ваша задача требует управляемого приложения, конкретного объёма RAM или подтверждённого межсоединения, одна карта GPU оставляет решение неподтверждённым. Две карты требуют проверенного программного размещения; их память не образует автоматически единое пространство.

Технические источники: RTX 4090 — партия, ёмкость и тарифы · RTX 6000 Ada — партия, ёмкость и тарифы · Качество после квантизации · Подготовка адаптации · Определение batch и накопления

10 /

Сохранить расчёт вместе с тем, что его подтверждает

Запишите исходную гипотезу, таблицу статей, процедуру и необработанные показания. Различайте оценку, измеренный счётчик и коммерческое решение. Ноутбук IteraGPU Lab помогает разобраться в этой инструментовке на небольшой сети; он не заменяет испытание вашей модели. Числовые примеры на этой странице — это расчёты, без якобы наблюдаемых пропускной способности или потребления GPU.

Хороший результат по подбору размеров умещается в одну карточку: модель и ревизия, задача, точность, длина, микробатч или конкурентность, память на GPU и условия измерения. Добавьте то, что опровергло бы вывод, например более длинное окно или другую оценку. Тогда вы сможете выбрать тариф, соответствующий кампании, вместо того чтобы повторять всю оценку при каждом варианте.

Практические вопросы

Рассчитывается ли предлагаемый инструментом резерв исходя из моей модели?

Нет. Резерв — это значение, выбранное вами. Инструмент не знает ни архитектуры, ни входных данных вашего запуска; используйте его, чтобы сделать вашу гипотезу явной, а затем сопоставьте её с измеренными фазами.

Почему бюджет меньше 24 ГБ всё ещё может не уложиться?

Оценка может упускать отдельные статьи и использовать GiB, тогда как номинальная ёмкость выражена в ГБ. Пиковое переходное значение, другой процесс или другие входные данные тоже могут сказаться. Сравните единицы и охват, затем определите фазу, на которой происходит сбой.

Можно ли сложить резервы и два пика PyTorch?

Нет. Пик выделенных тензоров и пик зарезервированной памяти — это не две независимые статьи для сложения. Раздельные пики могут возникать в разные моменты. Сохраните их названия и используйте метод по памяти для их интерпретации.

Можно ли запросить список или альтернативу, ещё не измерив мою модель?

Да, чтобы обозначить условных кандидатов. Опишите нагрузку и ограничения, которые должны оставаться неизменными. Расчёт памяти и коммерческие карточки позволяют сделать первоначальный отбор; обязательные непроверенные критерии остаются неподтверждёнными до выбора предложения.