Команда планирует A/B тест новой кнопки. Как выбор минимально значимого эффекта определяет требуемый размер...

Команда планирует A/B-тест новой кнопки. Как выбор минимально значимого эффекта определяет требуемый размер выборки?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Чем меньше минимально значимый эффект — минимальное изменение метрики, ради которого бизнес готов принимать решение, — тем больше нужна выборка. При прочих равных уменьшение обнаруживаемого эффекта в два раза требует примерно в четыре раза больше наблюдений, потому что статистический сигнал уменьшается линейно, а его отношение к шуму — вместе с ним.

Исторический контекст

Статистическое планирование экспериментов появилось как способ заранее отделять потенциально полезный сигнал от случайных колебаний данных. Без такого планирования команда может получить незначимый результат просто из-за маленькой выборки или объявить несущественное изменение важным после многократных проверок.

Выбор размера выборки до запуска теста связывает статистическую строгость с бизнес-решением: какой эффект достаточно велик, чтобы оправдать стоимость разработки, риск для пользователей и длительность эксперимента.

Постановка проблемы

Если тест рассчитан только на крупный эффект, он может не заметить умеренное, но практически ценное улучшение. Такой результат называют недостаточной статистической мощностью: отсутствие значимости не доказывает отсутствие эффекта.

Если же команда задаёт слишком маленький минимально значимый эффект, требуемая выборка может стать настолько большой, что тест будет идти дольше жизненного цикла решения. Поэтому нельзя выбирать это значение только из желания получить статистически значимый результат.

Подробное решение

Размер выборки определяется прежде всего четырьмя параметрами: базовым уровнем метрики, минимально значимым эффектом, допустимой вероятностью ложноположительного вывода и требуемой мощностью теста. Для конверсии важен также разброс бинарной метрики: при базовой конверсии около 50% дисперсия выше, чем при конверсии, близкой к нулю или единице.

Минимально значимый эффект нужно задавать в абсолютных единицах, если это возможно. Например, рост конверсии с 5% до 5,5% — это увеличение на 0,5 процентного пункта и относительный рост на 10%. Для расчёта выборки принципиален именно абсолютный разрыв между вариантами.

Для двух групп и бинарной метрики приближённая зависимость имеет вид:

размер выборки на группу ∝ p(1 − p) × (критический порог + запас мощности)² / d²

Здесь p — базовая конверсия, а d — минимальный абсолютный эффект. Поэтому зависимость от d квадратичная: переход от эффекта 1 процентный пункт к эффекту 0,5 процентного пункта увеличивает требуемую выборку примерно в четыре раза при неизменных остальных условиях.

На размер выборки также влияют односторонняя или двусторонняя проверка, соотношение размеров групп, потери наблюдений, кластеризация пользователей и выбранная основная метрика. Если пользователи взаимодействуют внутри команд, компаний или других кластеров, независимых наблюдений фактически меньше, чем строк в отчёте, и выборку приходится увеличивать.

Практический порядок такой: определить бизнес-эффект, выбрать базовую метрику по историческим данным, задать допустимый уровень ошибки первого рода и мощность, затем оценить выборку и длительность теста. После запуска нельзя менять минимально значимый эффект только потому, что фактический результат оказался меньше первоначального ожидания.

Ситуация из практики

Команда тестирует изменение экрана оплаты. Историческая конверсия составляет 5%, а продукт готов внедрить изменение только при росте минимум на 0,5 процентного пункта. При таких условиях тест планируют на двусторонний уровень значимости 5% и мощность 80%.

Рассматривались два варианта. Первый — искать рост на 1 процентный пункт: он требует заметно меньшей выборки, но может пропустить улучшение на 0,5 процентного пункта. Второй — искать рост на 0,1 процентного пункта: он чувствительнее, но потребует примерно в 25 раз больше наблюдений, чем поиск эффекта в 0,5 процентного пункта, если остальные условия одинаковы.

Команда выбрала порог 0,5 процентного пункта, потому что меньший эффект не покрывал ожидаемые расходы и риск релиза. Затем она зафиксировала длительность теста с учётом полного недельного цикла и заранее определила основную метрику, чтобы не подбирать критерии после получения результата.

Что кандидаты часто упускают

1. Дополнительный вопрос: означает ли статистически незначимый результат, что эффект равен нулю?

Нет. Он означает, что при выбранной выборке и уровне шума данных недостаточно оснований отвергнуть нулевую гипотезу. Эффект может быть нулевым, слишком малым для обнаружения или скрытым высокой дисперсией.

Нужно смотреть на доверительный интервал и его границы. Если весь интервал лежит ниже бизнес-порога полезности, решение может быть отрицательным даже без формального доказательства эффекта, а если интервал широк, разумнее признать результат неопределённым и собрать больше данных.

2. Дополнительный вопрос: что произойдёт с требуемой выборкой, если базовая конверсия изменится?

Изменится дисперсия метрики и, следовательно, необходимый объём данных. Для бинарной метрики дисперсия пропорциональна p(1 − p) и максимальна около 50%; при конверсии, близкой к 0% или 100%, для обнаружения того же абсолютного эффекта может потребоваться другая выборка.

Поэтому расчёт обычно делают по надёжной исторической оценке базовой конверсии или используют консервативный сценарий. Если во время теста базовый уровень неожиданно изменился, заранее рассчитанная мощность может отличаться от фактической.

3. Дополнительный вопрос: можно ли уменьшить выборку, не увеличивая минимально значимый эффект?

Иногда да — за счёт снижения шума метрики или более эффективного дизайна. Например, можно использовать стратификацию, сбалансированное распределение по важным признакам или корректировку на предэкспериментальные значения, если метод был заранее выбран и корректно применён.

Однако нельзя просто остановить тест раньше при достижении нужного числа значимых пользователей или регулярно проверять результат без поправок: это меняет вероятность ложноположительного вывода. Снижение выборки допустимо только вместе с заранее определённым статистическим планом и проверкой того, что новый дизайн сохраняет требуемую ошибку и мощность.