В A/B-тесте рост конверсии на 0,1 процентного пункта статистически значим. Достаточно ли этого для запуска изменения?
Нет. Статистическая значимость показывает, что наблюдаемый эффект маловероятно объясняется случайными колебаниями при заданной модели анализа, но не говорит, что эффект достаточно велик для бизнеса. Перед запуском нужно сопоставить оценку эффекта и её доверительный интервал с заранее заданным порогом практической значимости, а также учесть стоимость внедрения, риски и влияние на другие метрики.
Статистические тесты появились как способ отделить устойчивый сигнал от случайного шума в ограниченной выборке. В продуктовой аналитике этот подход применяют к контролируемым экспериментам, но итоговая задача шире: принять решение об изменении продукта при неопределённости и ограниченных ресурсах.
Поэтому одного ответа на вопрос «есть ли эффект» недостаточно. Бизнесу важно понять, настолько ли велик эффект, чтобы оправдать разработку, операционные расходы, возможные риски и отказ от других инициатив.
При большой выборке даже очень небольшой эффект может стать статистически значимым. Например, рост конверсии на 0,1 процентного пункта может означать существенное число дополнительных заказов в крупном продукте, но быть экономически бесполезным для небольшого продукта или не окупать стоимость реализации.
Обратная ошибка тоже возможна: практически важный эффект может не достичь статистической значимости из-за малого объёма данных или высокой дисперсии. Если запускать изменения только по факту значимого p-значения, команда рискует внедрять несущественные улучшения и отклонять перспективные решения.
Сначала задают минимально практически значимый эффект — величину улучшения, ради которой изменение имеет смысл внедрять. Этот порог определяют до эксперимента на основе экономики продукта, стоимости разработки, потенциального объёма результата и допустимого риска.
Затем оценивают не только точечный эффект, но и его доверительный интервал. Если весь интервал лежит выше практически значимого порога, решение о запуске обычно имеет сильное обоснование. Если интервал пересекает этот порог, данных недостаточно для уверенного вывода о бизнес-ценности: нужно продолжить сбор данных, изменить дизайн эксперимента или принять решение с явным учётом риска.
Также проверяют абсолютное и относительное изменение. Рост с 1% до 1,1% — это 0,1 процентного пункта, но относительный рост составляет 10%; эти представления отвечают на разные вопросы и не должны подменять друг друга.
Решение нельзя принимать по одной целевой метрике. Нужно проверить заранее выбранные защитные метрики: например, выручку на пользователя, возвраты, отмены, скорость работы или удержание. Небольшой рост конверсии не оправдывает запуск, если он сопровождается ухудшением качества заказов или долгосрочного удержания.
Ограничение подхода в том, что порог практической значимости не является чисто статистической величиной. Он зависит от стратегии и стоимости ошибки. Поэтому его следует фиксировать до просмотра результатов, чтобы не выбирать удобный порог постфактум.
Предположим, изменение экрана оплаты дало рост конверсии на 0,1 процентного пункта, p-значение оказалось меньше заранее выбранного уровня, а доверительный интервал эффекта составил от 0,04 до 0,16 процентного пункта. Команда оценила, что запуск окупается только при росте не менее 0,2 процентного пункта.
Рассматривались три варианта. Немедленный запуск был быстрым, но не подтверждал достижение окупаемого эффекта; продолжение эксперимента могло сузить интервал, но требовало времени; отказ снижал риск бесполезной разработки, однако мог привести к потере небольшого положительного эффекта.
Выбрали не запускать изменение в текущем виде и переработать гипотезу, поскольку верхняя граница интервала оставалась ниже экономического порога. Дополнительно проверили защитные метрики и сформировали новый вариант, который должен был влиять не только на конверсию, но и на ценность заказа. Такой результат не означает, что эксперимент «ничего не показал»: он показал наличие небольшого эффекта, недостаточного для принятого бизнес-решения.
Нет. Статистическая незначимость означает, что данных недостаточно для уверенного отделения эффекта от шума при выбранном методе и размере выборки. Нужно посмотреть доверительный интервал: если он включает и заметно отрицательные, и заметно положительные значения, эксперимент плохо различает возможные сценарии. Если же интервал узкий и целиком находится около нулевого или экономически несущественного диапазона, свидетельства в пользу практически важного эффекта сильнее отсутствия значимости само по себе.
Он задаёт критерий решения до того, как команда увидит результаты. Без такого порога можно объявить успехом любой положительный эффект, который оказался статистически значимым, даже если он не покрывает стоимость внедрения. Предварительная фиксация также помогает спланировать размер выборки и продолжительность эксперимента: чем меньше эффект, который нужно надёжно обнаружить, тем больше данных обычно требуется.
Да, если масштаб продукта делает его экономически значимым, стоимость внедрения мала, а риски ограничены. Например, небольшой относительный прирост на огромном объёме трафика может дать заметное число дополнительных целевых действий. Однако такой вывод должен опираться на расчёт ожидаемого результата и проверку защитных метрик, а не только на статистическую значимость.