АналитикаАнализ данныхПродуктовый аналитик

Аналитик завершил A/B тест сразу после того, как p value стало ниже 0,05, хотя размер выборки заранее не фи...

Аналитик завершил A/B-тест сразу после того, как p-value стало ниже 0,05, хотя размер выборки заранее не фиксировался. Как это влияет на надёжность вывода?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Такое досрочное завершение после многократного просмотра результатов повышает вероятность ложноположительного вывода. Уровень значимости 5% больше нельзя интерпретировать как реальную вероятность ошибки первого рода для всей процедуры, потому что решение о завершении зависело от уже увиденных данных.

Исторический контекст

Классические статистические тесты обычно предполагают заранее заданный объём выборки или момент завершения эксперимента. Это ограничение нужно, чтобы частота ложных отклонений нулевой гипотезы соответствовала заявленному уровню значимости.

На практике результаты эксперимента часто хотят проверять по мере накопления данных. Для этого появились последовательные методы, которые явно учитывают промежуточные просмотры и позволяют контролировать ошибку первого рода без запрета на мониторинг.

Постановка проблемы

Если аналитик проверяет результат после каждого нового периода или набора пользователей и останавливается при первом p-value ниже 0,05, он фактически получает много возможностей обнаружить случайное отклонение. Даже если истинного эффекта нет, одна из проверок может случайно оказаться значимой.

Неверное решение приводит к запуску неэффективного варианта, ошибочному прогнозу выручки и переоценке эффекта. Кроме того, обычный доверительный интервал после такого отбора момента остановки может быть слишком узким и не иметь заявленного покрытия.

Подробное решение

При фиксированном плане теста вероятность получить p-value ниже 0,05 при верной нулевой гипотезе контролируется для одного заранее определённого анализа. При остановке по текущему результату рассматривается уже не одна проверка, а множество возможных правил остановки.

Корректные варианты:

  • заранее зафиксировать размер выборки и момент основного анализа;
  • использовать последовательный дизайн с заранее заданными границами остановки;
  • применять корректировку уровня значимости, например распределять общий допустимый риск ошибки между промежуточными анализами;
  • заранее определить критерии досрочного завершения по эффективности, вреду или бесполезности.

Простой перенос обычного порога 0,05 на каждую промежуточную проверку некорректен. При этом сам промежуточный просмотр не является проблемой: проблема возникает, когда статистический метод не учитывает количество просмотров и правило остановки.

После досрочной остановки нельзя безоговорочно сообщать обычные p-value и доверительные интервалы как результаты заранее фиксированного теста. Нужно использовать методы, соответствующие последовательному дизайну, либо честно описать исследование как исследовательское и подтвердить вывод в независимом тесте.

Ситуация из практики

Команда ежедневно отслеживает конверсию нового варианта и завершает эксперимент, как только видит значимость. Рассматривались три подхода: полностью запретить промежуточный мониторинг, продолжать проверки без корректировки или заранее спланировать несколько анализов с последовательными границами.

Запрет мониторинга снижает риск статистической ошибки, но может задержать остановку явно вредного варианта. Некорректный постоянный мониторинг удобен, однако завышает риск ложного решения. Выбранный последовательный дизайн сохраняет возможность остановить опасный или явно успешный вариант и одновременно контролирует общий риск ошибки.

В результате команда получает более быстрые решения при сильном эффекте, не подменяя статистическую гарантию случайным срабатыванием одного из многочисленных просмотров.

Что кандидаты часто упускают

1. Всегда ли промежуточный просмотр делает эксперимент недействительным?

Нет. Он нарушает предпосылки обычного фиксированного анализа, но не делает данные бесполезными. Если правило промежуточных проверок и границы остановки были заранее включены в последовательный дизайн, общий уровень ошибки можно контролировать корректно.

2. Можно ли просто снизить порог значимости при многократных проверках?

Иногда это возможно как часть корректировки, но универсального нового порога нет. Он зависит от числа анализов, их времени и выбранного последовательного метода; простое деление 0,05 на количество просмотров может быть слишком консервативным или не соответствовать фактическому дизайну.

3. Отличается ли проблема остановки по незначимости от остановки по значимости?

Да. Остановка после незначимого результата может приводить к недооценке мощности и преждевременному выводу об отсутствии эффекта, особенно при малой выборке. Остановка после значимости прежде всего повышает риск ложноположительного вывода и обычно завышает наблюдаемую величину эффекта.