Результат эксперимента статистически значим в одной подгруппе пользователей и незначим в другой. Можно ли заключить, что эффект между подгруппами различается?
Нет. Различие между «значимым» и «незначимым» результатом само по себе не доказывает, что эффекты в подгруппах различаются. Нужно напрямую проверить взаимодействие между вариантом эксперимента и принадлежностью к подгруппе.
Разбиение результатов на подгруппы используют, чтобы понять, одинаково ли воздействие для разных типов пользователей. Однако отдельная проверка гипотезы в каждой подгруппе создаёт риск ошибочно интерпретировать случайные различия как неодинаковый эффект.
Для этой проблемы применяют модели и тесты взаимодействия. Они проверяют не значимость эффекта внутри каждой группы по отдельности, а разность эффектов между группами.
Пусть в первой подгруппе оценка эффекта равна 10% с широким доверительным интервалом, а во второй — 6% с ещё более широким интервалом. В первой группе результат может оказаться значимым, а во второй — нет из-за меньшего объёма выборки или большей дисперсии, а не из-за реального различия эффектов.
Ошибка «значим в одной группе, незначим в другой» приводит к ложным выводам о персонализации продукта, неодинаковой эффективности кампании или необходимости отключать воздействие для отдельного сегмента. Дополнительно большое число подгрупп повышает вероятность случайных находок.
Сначала для каждой подгруппы оценивают эффект и его неопределённость. Затем проверяют нулевую гипотезу о том, что разность эффектов равна нулю: эффект в первой подгруппе не отличается от эффекта во второй.
В регрессионной постановке это соответствует члену взаимодействия между признаком варианта и признаком подгруппы. Если взаимодействие статистически убедительно и его доверительный интервал не поддерживает отсутствие различия, можно говорить о неодинаковых эффектах.
Важно оценивать не только p-value, но и размер разности эффектов, доверительный интервал и практическую значимость. Статистически значимое взаимодействие может быть слишком малым для бизнес-решения, а широкий интервал означает, что данных недостаточно для надёжного вывода.
Подгруппы желательно определить до анализа или заранее зарегистрировать план проверки. Если сегменты выбирали после просмотра данных, необходимо учитывать множественные проверки и рассматривать результат как исследовательский, пока он не подтверждён на новых данных.
При малых подгруппах полезны объединение заранее схожих сегментов, иерархические модели или увеличение выборки. Эти подходы уменьшают шум, но могут сгладить реальные различия, поэтому выбор метода зависит от цели анализа и допустимого компромисса между стабильностью и детализацией.
После запуска функции конверсия среди новых пользователей выросла значимо на 4 процентных пункта, а среди постоянных пользователей выросла на 1 пункт, но статистической значимости не достигла. Команда решила оставить функцию только для новых пользователей.
Рассматривались два варианта. Сравнить p-value в двух сегментах было бы быстро, но такой подход не проверяет различие эффектов. Отдельный тест взаимодействия требует более полного анализа и может не дать точного вывода при малом числе постоянных пользователей, зато непосредственно отвечает на нужный вопрос.
Команда построила модель с эффектом варианта, признаком сегмента и их взаимодействием, а также проверила доверительный интервал разности эффектов. Интервал включал как небольшое преимущество новых пользователей, так и отсутствие существенного различия, поэтому функцию не ограничили одним сегментом и запланировали дополнительный сбор данных.
Дополнительный вопрос: Если доверительные интервалы эффектов в двух подгруппах пересекаются, означает ли это отсутствие различий?
Ответ: Нет. Пересечение интервалов отдельных оценок не является универсальным тестом равенства эффектов. Интервалы могут пересекаться даже при статистически значимой разности, особенно если оценки коррелированы. Надёжнее анализировать доверительный интервал именно для разности эффектов или коэффициента взаимодействия.
Дополнительный вопрос: Нужно ли корректировать уровень значимости, если подгруппы были заранее определены в плане эксперимента?
Ответ: Не всегда в одинаковой степени. Если заранее была сформулирована одна конкретная гипотеза о взаимодействии, её можно тестировать как запланированный анализ. Если же проверяли множество сегментов или множество характеристик и выбрали интересный результат постфактум, контроль множественных сравнений становится необходимым для ограничения доли ложных находок.
Дополнительный вопрос: Что означает незначимое взаимодействие при заметной разнице оценок эффектов?
Ответ: Это означает, что имеющихся данных недостаточно, чтобы уверенно отличить наблюдаемую разницу от случайного шума. Нельзя автоматически заключать ни равенство эффектов, ни отсутствие практической неоднородности. Следует изучить ширину доверительного интервала, минимально важную для бизнеса разницу и статистическую мощность анализа взаимодействия.