Определите, что варьируется, а что составляет повторение
Начните с вопроса: оцениваете ли вы эффект инициализации обучения, порядка данных, разбиения train/test или стохастической генерации? Семя управляет генератором случайных чисел; само по себе оно не идентифицирует все эти измерения. Сохраняйте по одной строке на запуск и только те факторы, которые действительно менялись.
Десятикратный повтор детерминированной оценки одного и того же checkpoint на одном и том же корпусе не даёт десяти независимых обучений. Точно так же тысяча предсказаний одной модели не заменяет несколько обучений для оценки их изменчивости. Выбирайте единицу повторения, соответствующую решению.
Зафиксируйте до начала серии основную метрику, её направление и минимальный эффект, который оправдал бы изменение. В следующих примерах большее значение предпочтительнее, а иллюстративный полезный порог составляет 0,30 пункта по метрике, отображаемой от 0 до 100. Этот порог исходит из решения проекта, а не из универсального статистического правила.
Сопоставляйте конфигурации по общим условиям
Для пары i запустите базовый вариант A и кандидата B на одном и том же разбиении данных и с предусмотренными общими условиями. Затем вычислите dᵢ = score(Bᵢ) − score(Aᵢ). Сопоставление опирается на соответствие, определённое до получения результатов; оно не состоит в том, чтобы задним числом объединять похожие оценки.
Использование одного и того же списка семян может помочь организовать пары, но две архитектуры могут потреблять случайные числа по-разному. Указывайте отдельно семена инициализации, данных и генерации, когда ваш код их различает. Также сохраняйте разбиения или их идентификаторы: общее целое число не доказывает, что данные обходились одинаково.
Если пара содержит сбой, сохраните оба статуса и объясните, как она будет обработана. Не сравнивайте среднее пяти успешных кандидатов со средним шести базовых вариантов, не отметив изменение совокупности.
Технические источники: NIST — соответствие между парными наблюдениями
Учитывайте ограничения семени и детерминизма
PyTorch указывает, что полностью воспроизводимые результаты не гарантируются между версиями, платформами или запусками на CPU и GPU даже при одинаковом семени. Его руководство различает управление генераторами и управление недетерминированными операциями. Фиксируйте версии и применённые опции, а не сводите окружение к «зафиксированному seed».
Детерминированный запуск служит, в частности, для воспроизведения поведения в заданных условиях. Он не доказывает, что модель устойчива к другим инициализациям или данным. И наоборот, различие между двумя идентичными перезапусками заслуживает диагностики, прежде чем интерпретировать его как эффект кандидата.
Сохраняйте одну и ту же политику детерминизма для обоих вариантов. Если вы меняете её для диагностики ошибки, выделите эту серию отдельно. Экспериментальный результат должен оставаться привязанным к условиям, в которых он был получен.
Технические источники: PyTorch 2.14 — воспроизводимость и контроль случайности
Рассчитанный пример: пять парных разностей
Вот пять вымышленных пар, предназначенных для вычислений, без выполняемого обучения. Зёрна — это примеры идентификаторов. Референс и кандидат здесь используют один и тот же протокол сравнения. Оценки выражаются по шкале из 100; различия — это баллы, а не относительные проценты.
Среднее разностей равно (0,4 + 0,3 + 0,1 + 0,5 + 0,1) / 5 = 0,28 пункта. Их медиана равна 0,30 пункта, а размах — от 0,10 до 0,50. Выборочное стандартное отклонение разностей составляет примерно 0,179 пункта при знаменателе n − 1. Все пять знаков положительны, но разброс остаётся значительным по отношению к среднему выигрышу.
| Иллюстративное семя | Базовый вариант A | Кандидат B | B − A |
|---|---|---|---|
| 17 | 71,0 | 71,4 | +0,4 |
| 29 | 71,6 | 71,9 | +0,3 |
| 43 | 71,3 | 71,4 | +0,1 |
| 71 | 70,8 | 71,3 | +0,5 |
| 101 | 71,8 | 71,9 | +0,1 |
Как читать интервал, не придавая ему чрезмерного значения
Чтобы проиллюстрировать обычный расчёт, предположим, что разности независимы между парами и происходят из приблизительно нормального распределения. 95%-й интервал Стьюдента для их среднего использует здесь четыре степени свободы: 0,28 ± 2,776 × 0,080, то есть примерно [0,058; 0,502] пункта. При наличии всего лишь пяти пар форму распределения трудно оценить; расчёт не делает эти допущения истинными.
Этот интервал находится выше нуля в примере, но он перекрывает полезный порог, установленный на уровне 0,30 пункта. Поэтому он не подтверждает строгое правило «средний выигрыш превышает 0,30 пункта». Положительная разница может оставаться слишком малой или слишком неопределённой, чтобы оправдать изменение.
Интервал с уровнем 95 % описывает процедуру покрытия при её допущениях, а не вероятность 95 %, приписываемую параметру после расчёта. Здесь он охватывает только вариацию, представленную парами, и не обязательно распространяется автоматически на другую область, другой корпус или будущее оборудование.
Если вы используете SciPy, ttest_rel сравнивает связанные выборки и предлагает доверительный интервал. Порядок массивов задаёт знак: для B − A поставьте B первым. Сохраняйте значения и использованный метод, а не только p-value.
Технические источники: NIST — доверительный интервал для среднего · SciPy 1.18 — ttest_rel и интервал разностей
Подготовить решение и следующие повторения
Результат примера — «полезный выигрыш не установлен», а не «кандидат бесполезен». В зависимости от стоимости изменения вы можете сохранить базовый вариант, продолжить сбор данных или протестировать более существенное изменение. Объявите это правило до того, как увидите серию. Нижняя граница выше вашего полезного порога больше поддерживала бы внедрение, при условии что остальная часть протокола корректна.
Планируйте повторения исходя из необходимой точности и ожидаемой вариабельности, с запасом на неудачи. Не существует числа seed, которое универсально гарантирует вывод. Пилотный запуск может помочь оценить разброс; сохраняйте за ним исследовательский статус, а затем зафиксируйте процедуру подтверждения.
Не смотрите после каждой пары и не останавливайтесь, как только результат станет благоприятным, используя интервал, рассчитанный на фиксированный размер выборки. Выберите размер выборки и анализ заранее или подходящий последовательный метод. Добавление испытаний только к разочаровывающему кандидату также меняет баланс сравнения.
Не путать вариабельность обучения и оценку корпуса
Серия seed на фиксированном тестовом наборе говорит о вариации обучений на этом наборе. Она сама по себе не измеряет неопределённость, связанную с выбором тестовых примеров. Если ваш вопрос касается также разбиений или областей, предусмотрите план, который варьирует эти измерения, не смешивая их в одном счётчике повторений.
Держите финальную оценку в стороне от выбора моделей. Отбор среди множества вариантов с помощью одного и того же теста благоприятствует опциям, которые кажутся на нём хорошими случайно. Подгруппы и дополнительные метрики должны прояснять решение, с видимым указанием их числа и исследовательского статуса.
Итоговый вывод объединяет исходные оценки, пары, разности, разброс, метод интервала и решение относительно полезного порога. Приложите неудачи и ограничения обобщения. Тогда вы сможете объяснить, почему разрыв кажется вам достаточным, недостаточным или пока неопределимым.
Технические источники: scikit-learn — держать тест вне выбора модели
Практические вопросы
Достаточно ли пяти seed для выбора?
Пять seed могут послужить для первого наблюдения, но они не гарантируют достаточной точности. Необходимое число зависит от вариабельности и наименьшего полезного эффекта. Изучите сырые разности и неопределённость; результат, остающийся неопределимым, требует лучше спланированного протокола, а не магического числа.
Доказывает ли эквивалентность интервал, содержащий ноль?
Интервал, содержащий ноль, не доказывает эквивалентность. Он также может быть совместим со значительными выигрышами или потерями. Чтобы поддержать практическую эквивалентность, заранее задайте приемлемый предел и используйте анализ, подходящий для этого вопроса, с достаточной точностью для его рассмотрения.
Можно ли опубликовать только лучший seed?
Лучший seed описывает благоприятный отбор, а не типичную производительность процедуры. Публикуйте весь набор запланированных повторений и правило отбора поставляемой модели. Если этот лучший модель нужно оценить, используйте финальную оценку, которая не участвовала в его выборе.