Компания получила статистически значимый эффект в эксперименте. Как определить, имеет ли он практическую ценность?
Статистическая значимость показывает, насколько результат совместим с нулевой гипотезой при заданной модели и размере выборки. Практическая значимость показывает, достаточно ли велик эффект, чтобы оправдать затраты, риски и изменение процесса.
Чтобы оценить практическую ценность, нужно рассмотреть размер эффекта в абсолютных и относительных единицах, его доверительный интервал, заранее заданный минимально важный эффект, стоимость внедрения и влияние на ключевые бизнес-метрики. Малый эффект может быть статистически значимым на огромной выборке, но не иметь смысла для бизнеса.
Классическая проверка гипотез создавалась для решения задачи отделения наблюдаемого сигнала от случайных колебаний данных. p-значение и уровень значимости помогают формализовать риск ошибочно отвергнуть нулевую гипотезу, но сами по себе не отвечают на вопрос о полезности результата.
По мере роста объёмов данных стало очевидно, что статистический критерий может обнаружить очень малые отклонения от нуля. Поэтому в прикладном анализе к проверке гипотез добавили оценку размера эффекта, неопределённости и экономических последствий.
Предположим, эксперимент повысил конверсию с 10,00% до 10,08%. При миллионах наблюдений такой прирост может оказаться статистически значимым, хотя он даёт только 0,08 процентного пункта, или примерно 0,8% относительно исходного уровня.
Если принять решение только по p-значению, компания может потратить ресурсы на внедрение изменения, которое почти не влияет на результат. Обратная ошибка тоже возможна: эффект может быть практически важным, но исследование окажется слишком маленьким, чтобы получить статистически убедительное подтверждение.
Сначала оценивают размер эффекта в единицах, понятных бизнесу: процентные пункты конверсии, рубли выручки на пользователя, минуты задержки или количество ошибок. Относительный процентный рост полезен для сравнения, но без абсолютной базы может вводить в заблуждение.
Затем рассматривают доверительный интервал эффекта. Он показывает диапазон правдоподобных значений с учётом случайной неопределённости. Если весь интервал выше нуля, это может поддерживать вывод о наличии эффекта, но ещё не означает, что весь интервал выше порога, важного для бизнеса.
До эксперимента желательно определить минимально практически значимый эффект. Например, изменение имеет смысл внедрять только при приросте конверсии не менее 0,3 процентного пункта, потому что меньший прирост не покрывает стоимость разработки и поддержки.
Решение принимают с учётом нескольких факторов:
Полезно разделять три результата: эффект, вероятно, несущественен; эффект практически важен; данных недостаточно для решения. Последний случай нельзя автоматически трактовать как отсутствие эффекта: возможно, выборка не обеспечила нужную мощность теста.
Нельзя заменять p-значением размер эффекта. При фиксированном эффекте увеличение выборки обычно повышает способность обнаружить его, но не делает сам эффект больше и не доказывает его экономическую целесообразность.
В интернет-магазине новый экран оформления заказа увеличил конверсию на 0,08 процентного пункта. Благодаря большой выборке доверительный интервал эффекта полностью оказался выше нуля, поэтому результат статистически значим.
Рассматривались три варианта: сразу внедрить экран, отказаться от него или продолжить исследование. Немедленное внедрение использовало подтверждённый сигнал, но не учитывало стоимость переделки и небольшой абсолютный прирост. Отказ снижал риск затрат, но игнорировал возможную дополнительную прибыль. Продолжение теста могло уточнить эффект, но увеличивало время принятия решения.
Команда сравнила ожидаемую дополнительную маржу с затратами на разработку, поддержку и возможными потерями из-за ухудшения вспомогательных метрик. Поскольку верхняя граница экономического эффекта оставалась ниже порога окупаемости, изменение не внедрили, а направили ресурсы на вариант с более высоким ожидаемым эффектом. Результат был признан статистически убедительным, но практически недостаточным.
Да. Если оценённый эффект велик, но доверительный интервал широк и включает ноль, это означает не отсутствие ценности, а недостаток точности. В таком случае нужно проверить качество эксперимента, рассчитать требуемый объём выборки и оценить, оправданы ли дополнительные наблюдения с учётом стоимости и времени.
Данных недостаточно для уверенного решения: возможны и отсутствие эффекта, и практически важный положительный эффект. Следует не выбирать удобную границу интервала, а увеличить точность оценки, если потенциальная выгода оправдывает продолжение исследования; параллельно нужно проверить соблюдение дизайна эксперимента и стабильность метрик.
Потому что небольшой абсолютный сдвиг при низкой исходной базе выглядит большим в процентах. Рост конверсии с 0,10% до 0,12% — это увеличение на 20% относительно исходного уровня, но всего 0,02 процентного пункта. Для решения нужно показывать обе величины и переводить эффект в реальные дополнительные действия, выручку или издержки.