Какой вопрос вас сейчас останавливает?
От первой загрузки до чекпоинтов — упорядочьте то, что нужно проверить перед вычислительной кампанией. Здесь собраны руководства по расчёту, измерению и сохранению пригодных результатов.
Моя модель ещё не запускалась. С чего начать?
Оценка объёма памяти и входные данные для первого запуска.
Планирование памяти GPU: расчёт, резервы и валидация
Вычислите веса в ГиБ, постройте явный резерв и подтвердите пик по фазам. Числовые примеры, подводные камни квантизации и выбор по картам.
Память GPU: объяснить расхождение между оценкой и пиком
Различайте веса, кэш и активации, измеряйте allocated и reserved по фазам, затем выбирайте запас с помощью ноутбука и протокола PyTorch.
KV-кэш: расчёт памяти по контексту, GQA и батчу
Рассчитайте KV-кэш с учётом KV-голов, контекста и одновременных последовательностей. Разберитесь с GQA, точностью и статическим кэшем перед реальным запуском.
Показатель растёт, но можно ли ему доверять?
Изолированный набор для оценки, перепроверенные ошибки и охарактеризованная разница.
Как построить набор для оценки ML без утечки данных
Разделите группы, дубликаты и варианты использования данных, чтобы построить отложенный набор для оценки ML — контролируемый и подходящий для вашего решения.
Анализировать ошибки ML, чтобы выбрать следующий эксперимент
Анализируйте ошибки классификации и извлечения: матрица ошибок, эталоны, таксономия, регрессии и контроль следующей коррекции.
Изменчивость между сидами: убедительно ли расхождение в ML?
Интерпретируйте повторения в ML с помощью парных сидов, разброса и порога полезного эффекта. Пример расчёта и ограничения малой выборки.
Я готовлю обучение. Что проверить перед запуском серии?
Полное обновление, явный размер батча и пригодные для анализа трассировки.
Обучение на GPU: проверить цикл до кампании
Подготовьте данные, batch и возобновление обучения. Протокол по фазам для контроля памяти, градиентов, валидации и выходных файлов.
Микробатч и накопление: расчёт эффективного батча
Вычислите эффективный батч, нормализуйте потерю и проверьте накопление градиентов на одной или нескольких картах с его границами эквивалентности.
Отслеживание ML-экспериментов: от запуска к решению
Свяжите данные, код, параметры, предсказания и решение с помощью манифеста ML-эксперимента. Пример контроля запусков и артефактов без навязывания инструмента.
Адаптировать или сжать модель: как выбрать вариант?
Базовый ориентир, контролируемое изменение и сопоставимое качество.
Fine-tuning: выбрать адаптацию и проверить её вклад
Подготовьте fine-tuning с эталоном, разделёнными данными и контролем перезагрузки. LoRA, квантованная база, бюджет и анализ регрессий.
Сравнивать квантизации: память, качество и полезная стоимость
Сравнивайте эталон, калибровку, формат весов и кэш KV на одних и тех же данных. Измеряйте память и качество, прежде чем определять бюджет GPU.
Планирование ML-абляций: контроль, эффекты и бюджет
Постройте план ML-абляции с контролем, факторами, взаимодействиями и бюджетом испытаний. Расчётный пример для приоритизации вариантов и выводов.
Бюджет ограничен. Какие эксперименты провести в первую очередь?
Порядок экспериментов и стоимость тарифа в сопоставлении с полезными результатами.
Бюджетирование ML-кампании: испытания, решения и общий пакет
Разложите ML-кампанию на этапы, расставьте приоритеты вариантов и свяжите пакет GPU с полезными результатами — с примером календаря и бюджета в USD.
Планирование ML-абляций: контроль, эффекты и бюджет
Постройте план ML-абляции с контролем, факторами, взаимодействиями и бюджетом испытаний. Расчётный пример для приоритизации вариантов и выводов.
Бенчмарк ML: сравнить стоимость при одинаковом качестве
Зафиксируйте качество, измерьте на одном и том же корпусе и сравните полную стоимость тарифов GPU на 3, 7 или 30 дней. Протокол и исходная таблица для скачивания.