АналитикаАнализ данныхПродуктовый аналитик

После запуска функции метрика выросла на 8%, но у пользователей, которым функция недоступна, она тоже вырос...

После запуска функции метрика выросла на 8%, но у пользователей, которым функция недоступна, она тоже выросла на 6%. Как оценить эффект функции?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Оценивать эффект следует через разницу изменений: прирост в группе с доступом к функции минус прирост в сопоставимой контрольной группе. В данном примере предварительная оценка дополнительного эффекта равна 2 процентным пунктам, но она достоверна только при сопоставимости групп и обоснованном предположении о параллельных трендах.

Исторический контекст

Сравнение показателя только до и после запуска не отделяет эффект функции от сезонности, рекламных кампаний, изменений рынка и других событий, произошедших одновременно. Поэтому в анализе экспериментов и квазиэкспериментов используют контрольную группу, которая отражает общий временной сдвиг без воздействия.

Такой подход лежит в основе метода разностей разностей. Он позволяет вычесть изменение, наблюдаемое у контрольной группы, и тем самым приблизиться к оценке именно добавочного эффекта вмешательства.

Постановка проблемы

Рост на 8% в группе воздействия сам по себе не доказывает, что функция принесла весь этот результат. Если контрольная группа выросла на 6%, значительная часть изменения, вероятно, связана с внешними факторами.

Неверно также автоматически считать разницу в 2 процентных пункта причинным эффектом. Группы могли отличаться по составу, пользователи могли самостоятельно выбирать доступ к функции, а внешнее событие могло влиять на них неодинаково. Нужно учитывать неопределённость оценки и проверить, не содержит ли доверительный интервал нулевой эффект.

Подробное решение

Пусть изменение метрики в группе воздействия равно (\Delta_T = 8%), а в контроле — (\Delta_C = 6%). Оценка добавочного эффекта по методу разностей разностей рассчитывается как:

Эффект = (\Delta_T - \Delta_C = 8 - 6 = 2) процентных пункта.

Это не означает автоматически относительный рост на 2%. Если конверсия изменилась с 10% до 18% в группе воздействия и с 10% до 16% в контроле, разность изменений составит 2 процентных пункта; относительная интерпретация будет другой.

Ключевое предположение метода — параллельные тренды: без запуска функции метрика в обеих группах изменилась бы примерно одинаково. Проверить его напрямую невозможно, поскольку контрфактический результат группы воздействия не наблюдается, но можно изучить динамику показателя в нескольких периодах до запуска. Сходные предтренды повышают доверие к оценке, однако не доказывают предположение окончательно.

Нужно заранее определить момент воздействия, единицу анализа и окно наблюдения. Следует использовать одинаковое определение метрики, исключить пользователей, появившихся только из-за самого запуска, и оценить доверительный интервал эффекта. Если группы сильно различаются, полезно применять стратификацию, регрессионную корректировку или взвешивание, но эти методы не устраняют неизвестные различия полностью.

Случайное распределение пользователей в группы обычно предпочтительнее наблюдательного сравнения: оно снижает риск систематического различия между группами. Если рандомизация невозможна, результат следует называть оценкой ассоциации или квазиэкспериментальной оценкой и явно описывать оставшиеся угрозы валидности.

Ситуация из практики

Сервис запустил новый экран оплаты для 40% пользователей. Конверсия в группе воздействия выросла с 12% до 20%, а в контрольной группе — с 12% до 18%. Простое сравнение после запуска даёт разницу 2 процентных пункта, а разности разностей — 6 процентных пунктов: прирост составил 8 пунктов против 6 пунктов.

Аналитик рассмотрел три варианта. Сравнение только периода после запуска было простым, но игнорировало исходные различия и общий рыночный рост. Сравнение «до–после» в группе воздействия учитывало исходный уровень, но приписывало функции все временные изменения. Рандомизированная контрольная группа давала наиболее сильную причинную оценку, но требовала удерживать часть пользователей без нового экрана.

Выбрали рандомизированный holdout и рассчитали разность разностей с доверительным интервалом. Если интервал не включал ноль, команда могла говорить о статистически подтверждённом добавочном эффекте; если включал ноль, корректный вывод ограничивался отсутствием убедительных доказательств эффекта, несмотря на наблюдаемый рост.

Что кандидаты часто упускают

  1. Нужно ли, чтобы уровни метрики в группах до запуска совпадали?

Нет, одинаковые исходные уровни не обязательны. Метод разностей разностей может корректно работать при постоянном различии уровней, если в отсутствие воздействия группы имели бы одинаковую динамику. Например, контрольная группа может стабильно иметь конверсию на 3 процентных пункта ниже, но её изменение во времени должно быть сопоставимо с изменением в группе воздействия.

Проблема возникает, когда различаются именно тренды: одна группа росла бы быстрее другой даже без функции. Тогда вычитаемое изменение контрольной группы не является корректным контрфактическим ориентиром, и оценка эффекта будет смещена.

  1. Как проверить предположение о параллельных трендах?

Нужно построить динамику метрики по группам за несколько периодов до запуска и сравнить направления и темпы изменений. Дополнительно используют формальные проверки взаимодействия группы с временем в предэкспериментальном периоде и placebo-анализы, где условную дату запуска помещают в прошлое.

Эти проверки не доказывают параллельные тренды: совпадение прошлой динамики не гарантирует совпадение будущей. Они лишь выявляют очевидные нарушения и помогают оценить правдоподобие предположения.

  1. Что меняется, если доступ к функции получили не случайно выбранные пользователи?

Возникает риск смешения эффекта функции с характеристиками пользователей, связанными с её доступом. Например, наиболее активным клиентам могли включить функцию раньше, и их рост метрики мог быть вызван высокой вовлечённостью, а не изменением интерфейса.

В таком случае полезны рандомизация доступа, анализ по первоначальному назначению, корректировка по известным предтестовым признакам и проверка устойчивости результата на разных сегментах. Сопоставление и регрессия уменьшают влияние наблюдаемых различий, но не устраняют смещение от неизвестных факторов.