Команда останавливает A/B-тест сразу после первого статистически значимого результата. Какое искажение возникает при таком правиле остановки?
Регулярная остановка теста после первого значимого результата повышает вероятность ложноположительного вывода: случайное колебание может быть принято за эффект. Обычный уровень значимости, например 5%, корректен только при заранее определённом правиле анализа, включая момент или условия остановки.
Классические статистические критерии разрабатывались для ситуации, когда объём выборки и основная проверка задаются до анализа данных. Это позволяло контролировать вероятность ошибки первого рода — отклонения нулевой гипотезы при отсутствии реального эффекта.
В продуктовой аналитике данные поступают непрерывно, поэтому командам удобно ежедневно смотреть на эксперимент. Однако многократная проверка результата меняет статистическую задачу: появляется несколько возможностей случайно получить значимость.
Предположим, истинного различия между вариантами нет. Если проверять результат один раз на уровне значимости 5%, вероятность случайного значимого результата ограничена примерно этим уровнем. Если проверять его много раз и завершать тест при первой удаче, общая вероятность ложной тревоги становится выше 5%.
Это приводит к преждевременному запуску неэффективного изменения, неверной оценке влияния и накоплению ошибок в последующих решениях. Особенно опасен такой подход при большом числе метрик, сегментов и параллельных экспериментов.
Проблема возникает не из-за самого раннего завершения, а из-за несогласованности между правилом остановки и статистическим методом. При каждом новом просмотре есть шанс, что оценка эффекта случайно пересечёт порог значимости; остановка именно в этот момент отбирает наиболее удачное наблюдение.
Надёжные варианты следующие:
Последовательный анализ не запрещает смотреть на данные часто. Он задаёт специальное правило расходования статистического порога, поэтому частые промежуточные проверки учитываются в контроле ошибки.
Раннее завершение также может быть оправдано по причинам безопасности, технической неисправности или заранее заданному критерию бесполезности. Но такие правила должны быть определены до просмотра итогов либо применяться методом, который учитывает их в расчёте.
Важно различать статистическую значимость и достаточность результата для продукта. Даже корректно полученный значимый эффект может быть слишком малым для покрытия стоимости разработки, рисков миграции или ухудшения вторичных метрик.
В учебном сценарии команда тестирует новый экран оплаты и каждое утро проверяет конверсию. На десятый день результат становится значимым, поэтому тест останавливают. Позже при накоплении полного заранее запланированного объёма эффект исчезает; ранняя остановка была следствием случайного всплеска.
Рассматривались три варианта. Полностью запретить промежуточный просмотр было бы статистически просто, но ухудшило бы контроль аварий и задержало бы обнаружение явного вреда. Останавливать тест при любом значимом результате было бы оперативно удобно, но создавало бы неконтролируемый рост ложноположительных решений. Команда выбрала заранее описанный последовательный дизайн с контрольными точками, отдельным критерием вреда и финальным критерием успеха.
В результате данные можно было проверять по расписанию, а досрочное решение принималось только при выполнении соответствующего порога. Это сохранило оперативность без подмены статистического уровня значимости случайным моментом просмотра.
Нет. Недействительным становится использование обычного фиксированного критерия при правиле, которое допускает многократные остановки без поправки. Если заранее применён последовательный дизайн с подходящими границами, досрочная остановка может быть частью корректного анализа.
Нет, простое увеличение выборки не исправляет уже возникшее искажение от правила остановки. Нужно изменить статистическую процедуру: учесть число и моменты проверок, применить последовательный метод или провести независимое подтверждающее исследование с заранее заданным планом.
Если речь идёт о заранее установленном защитном пороге, например о недопустимом вреде для ключевой метрики, это может быть разумным продуктовым правилом. Но его статистические последствия всё равно следует включить в дизайн эксперимента; иначе частые проверки и выбор наиболее тревожного момента могут искажать оценку риска. Для экстренной остановки по безопасности допустим консервативный бизнес-процесс, но итоговый вывод о размере эффекта нужно подтверждать корректным анализом.