Перед запуском A/B-теста аналитик увеличил планируемую выборку в четыре раза, сохранив ожидаемый эффект и разброс. Как изменится статистическая мощность и почему?
Статистическая мощность увеличится, но не обязательно в четыре раза. При увеличении выборки в четыре раза стандартная ошибка оценки примерно уменьшится вдвое, поэтому тот же истинный эффект станет заметнее относительно случайного шума. Точное новое значение мощности зависит от уровня значимости, размера эффекта, дисперсии, односторонней или двусторонней проверки и исходной мощности.
Понятие статистической мощности сформировалось в рамках планирования статистических проверок, чтобы оценивать не только риск ложной тревоги, но и способность обнаружить реальный эффект. Одного контроля вероятности ошибки первого рода недостаточно: тест может не отвергнуть нулевую гипотезу просто потому, что данных мало.
Такой подход решает практическую проблему выбора объёма выборки до эксперимента. Аналитик заранее оценивает, сколько наблюдений нужно, чтобы с заданной вероятностью обнаружить эффект определённого размера.
Если выборка слишком мала, тест часто получает высокий уровень ошибки второго рода: реальный эффект существует, но статистически значимым не становится. Это особенно опасно, когда по результату такого теста принимают решение не запускать полезное изменение.
Увеличение выборки снижает случайную неопределённость, однако не исправляет систематические ошибки. Репрезентативность, корректность рандомизации, качество метрики и независимость наблюдений остаются отдельными условиями валидности эксперимента.
Мощность — это вероятность отвергнуть нулевую гипотезу при условии, что рассматриваемый альтернативный эффект действительно существует. Она равна единице минус вероятность ошибки второго рода.
Для многих оценок стандартная ошибка пропорциональна обратной величине квадратного корня из объёма выборки. Поэтому при увеличении выборки в четыре раза она примерно уменьшается в два раза. Отношение эффекта к стандартной ошибке, то есть стандартизированный сигнал, при неизменных эффекте и разбросе примерно удваивается.
Из-за этого распределение статистики при альтернативной гипотезе сильнее смещается относительно критической границы, и вероятность попасть в область статистической значимости возрастает. Но мощность ограничена сверху единицей и зависит от формы распределения статистики, поэтому её нельзя вычислять простым умножением исходной мощности на четыре.
Например, рост мощности с 20% до 40% и рост с 80% до 95% требуют разной интерпретации: в первом случае данных может всё ещё быть недостаточно, а во втором дополнительная выборка даёт меньший практический выигрыш. При двустороннем тесте и фиксированном уровне значимости расчёт также отличается от одностороннего.
Расчёт мощности должен использовать эффект, который имеет практическое значение, а не только самый оптимистичный ожидаемый эффект. Для метрик с ограничениями, сезонностью, зависимыми наблюдениями или кластеризацией эффективный объём данных может быть меньше номинального, поэтому простая формула даёт завышенную мощность.
Команда проверяет изменение конверсии и ожидает рост на один процентный пункт. При исходном плане мощность равна 55%, поэтому вероятность не обнаружить действительно существующий эффект остаётся высокой.
Рассматривались три варианта: оставить выборку без изменений, снизив стоимость эксперимента, но принять высокий риск пропустить эффект; увеличить выборку в четыре раза, повысив мощность, но продлив набор данных; либо изменить метрику на более чувствительную, что может сократить длительность теста, но создаёт риск потери связи с бизнес-ценностью.
Выбрано увеличение выборки после проверки длительности эксперимента, сезонности и доступного бюджета. Решение обосновано тем, что один процентный пункт заранее признан практически важным, а высокая вероятность ложно отрицательного вывода была дороже дополнительных наблюдений. После расчёта мощности по исторической дисперсии план был скорректирован; при этом критерии остановки и основная метрика были зафиксированы до запуска.
Нет. Нестатистически значимый результат означает, что данных недостаточно для уверенного отклонения нулевой гипотезы при выбранном критерии, либо эффект действительно мал. Для различения этих объяснений смотрят на доверительный интервал, минимально значимый эффект и заранее рассчитанную мощность.
Большая выборка обычно уменьшает случайную ошибку, но не обязана уменьшать систематическое смещение. Например, нарушение рандомизации или постоянное неполное измерение целевой группы может сохраняться при любом объёме данных. В результате оценка станет точнее вокруг неверного значения, а статистическая значимость может лишь усилить уверенность в ошибочном выводе.
Мощность снизится, потому что стандартизированный сигнал станет меньше: эффект будет слабее относительно стандартной ошибки. Чтобы сохранить прежнюю мощность при сопоставимом разбросе, обычно требуется существенно больше наблюдений; для многих стандартных оценок объём выборки приблизительно растёт обратно пропорционально квадрату величины обнаруживаемого эффекта.