После запуска функции метрика выросла на 8%, но у пользователей, которым функция недоступна, она тоже выросла на 6%. Как оценить эффект функции?
Оценивать эффект следует через разницу изменений: прирост в группе с доступом к функции минус прирост в сопоставимой контрольной группе. В данном примере предварительная оценка дополнительного эффекта равна 2 процентным пунктам, но она достоверна только при сопоставимости групп и обоснованном предположении о параллельных трендах.
Сравнение показателя только до и после запуска не отделяет эффект функции от сезонности, рекламных кампаний, изменений рынка и других событий, произошедших одновременно. Поэтому в анализе экспериментов и квазиэкспериментов используют контрольную группу, которая отражает общий временной сдвиг без воздействия.
Такой подход лежит в основе метода разностей разностей. Он позволяет вычесть изменение, наблюдаемое у контрольной группы, и тем самым приблизиться к оценке именно добавочного эффекта вмешательства.
Рост на 8% в группе воздействия сам по себе не доказывает, что функция принесла весь этот результат. Если контрольная группа выросла на 6%, значительная часть изменения, вероятно, связана с внешними факторами.
Неверно также автоматически считать разницу в 2 процентных пункта причинным эффектом. Группы могли отличаться по составу, пользователи могли самостоятельно выбирать доступ к функции, а внешнее событие могло влиять на них неодинаково. Нужно учитывать неопределённость оценки и проверить, не содержит ли доверительный интервал нулевой эффект.
Пусть изменение метрики в группе воздействия равно (\Delta_T = 8%), а в контроле — (\Delta_C = 6%). Оценка добавочного эффекта по методу разностей разностей рассчитывается как:
Эффект = (\Delta_T - \Delta_C = 8 - 6 = 2) процентных пункта.
Это не означает автоматически относительный рост на 2%. Если конверсия изменилась с 10% до 18% в группе воздействия и с 10% до 16% в контроле, разность изменений составит 2 процентных пункта; относительная интерпретация будет другой.
Ключевое предположение метода — параллельные тренды: без запуска функции метрика в обеих группах изменилась бы примерно одинаково. Проверить его напрямую невозможно, поскольку контрфактический результат группы воздействия не наблюдается, но можно изучить динамику показателя в нескольких периодах до запуска. Сходные предтренды повышают доверие к оценке, однако не доказывают предположение окончательно.
Нужно заранее определить момент воздействия, единицу анализа и окно наблюдения. Следует использовать одинаковое определение метрики, исключить пользователей, появившихся только из-за самого запуска, и оценить доверительный интервал эффекта. Если группы сильно различаются, полезно применять стратификацию, регрессионную корректировку или взвешивание, но эти методы не устраняют неизвестные различия полностью.
Случайное распределение пользователей в группы обычно предпочтительнее наблюдательного сравнения: оно снижает риск систематического различия между группами. Если рандомизация невозможна, результат следует называть оценкой ассоциации или квазиэкспериментальной оценкой и явно описывать оставшиеся угрозы валидности.
Сервис запустил новый экран оплаты для 40% пользователей. Конверсия в группе воздействия выросла с 12% до 20%, а в контрольной группе — с 12% до 18%. Простое сравнение после запуска даёт разницу 2 процентных пункта, а разности разностей — 6 процентных пунктов: прирост составил 8 пунктов против 6 пунктов.
Аналитик рассмотрел три варианта. Сравнение только периода после запуска было простым, но игнорировало исходные различия и общий рыночный рост. Сравнение «до–после» в группе воздействия учитывало исходный уровень, но приписывало функции все временные изменения. Рандомизированная контрольная группа давала наиболее сильную причинную оценку, но требовала удерживать часть пользователей без нового экрана.
Выбрали рандомизированный holdout и рассчитали разность разностей с доверительным интервалом. Если интервал не включал ноль, команда могла говорить о статистически подтверждённом добавочном эффекте; если включал ноль, корректный вывод ограничивался отсутствием убедительных доказательств эффекта, несмотря на наблюдаемый рост.
Нет, одинаковые исходные уровни не обязательны. Метод разностей разностей может корректно работать при постоянном различии уровней, если в отсутствие воздействия группы имели бы одинаковую динамику. Например, контрольная группа может стабильно иметь конверсию на 3 процентных пункта ниже, но её изменение во времени должно быть сопоставимо с изменением в группе воздействия.
Проблема возникает, когда различаются именно тренды: одна группа росла бы быстрее другой даже без функции. Тогда вычитаемое изменение контрольной группы не является корректным контрфактическим ориентиром, и оценка эффекта будет смещена.
Нужно построить динамику метрики по группам за несколько периодов до запуска и сравнить направления и темпы изменений. Дополнительно используют формальные проверки взаимодействия группы с временем в предэкспериментальном периоде и placebo-анализы, где условную дату запуска помещают в прошлое.
Эти проверки не доказывают параллельные тренды: совпадение прошлой динамики не гарантирует совпадение будущей. Они лишь выявляют очевидные нарушения и помогают оценить правдоподобие предположения.
Возникает риск смешения эффекта функции с характеристиками пользователей, связанными с её доступом. Например, наиболее активным клиентам могли включить функцию раньше, и их рост метрики мог быть вызван высокой вовлечённостью, а не изменением интерфейса.
В таком случае полезны рандомизация доступа, анализ по первоначальному назначению, корректировка по известным предтестовым признакам и проверка устойчивости результата на разных сегментах. Сопоставление и регрессия уменьшают влияние наблюдаемых различий, но не устраняют смещение от неизвестных факторов.