Компания выкатила функцию только в одном регионе. Какое ключевое допущение нужно проверить, чтобы разность ...

Компания выкатила функцию только в одном регионе. Какое ключевое допущение нужно проверить, чтобы разность изменений метрики между регионами интерпретировать как эффект функции?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Ключевое допущение — параллельность трендов: без функции метрика в регионе внедрения менялась бы во времени так же, как в контрольном регионе. Тогда разность изменений между регионами устраняет общий временной эффект и постоянное различие между регионами, оставляя оценку эффекта функции.

Проверка предтрендов повышает доверие к выводу, но не доказывает параллельность будущих трендов. Нужно также исключить различия в составе пользователей, одновременные локальные события и перетекание эффекта в контрольный регион.

Исторический контекст

Difference-in-differences, или метод разностей, применяют, когда случайная рандомизация невозможна, а вмешательство получают только отдельные группы. Обычное сравнение до и после смешивает эффект функции с сезонностью, общим ростом продукта и другими изменениями во времени.

Сравнение регионов после запуска тоже недостаточно: регионы могли различаться ещё до внедрения. Метод использует две разности — изменение во времени внутри каждой группы и разницу этих изменений между группами.

Постановка проблемы

Пусть в регионе внедрения метрика выросла с 20% до 26%, а в контрольном регионе — с 18% до 21%. Простое сравнение до и после даёт рост на 6 процентных пунктов, но 3 пункта могли быть вызваны общим рыночным или сезонным эффектом.

Оценка методом разностей равна 6 − 3 = 3 процентных пункта. Она осмысленна только при условии, что контрольный регион адекватно описывает сценарий, который произошёл бы в регионе внедрения без функции.

Неверный выбор контроля создаёт смещение. Например, если в контрольном регионе одновременно закрыли канал привлечения, его падение или замедление роста искусственно завысит оценку эффекта функции.

Подробное решение

Для двух групп и двух периодов оценка считается так:

Эффект = изменение метрики в тестовом регионе − изменение метрики в контрольном регионе.

Постоянные различия между регионами устраняются первой разностью во времени. Общие для регионов изменения устраняются второй разностью. Поэтому метод не требует одинаковых исходных уровней, но требует сходной динамики без вмешательства.

Параллельность обычно оценивают по нескольким периодам до запуска. На графике или в регрессионной модели проверяют, не было ли систематического расхождения трендов. Полезны плацебо-тесты: условно назначить дату запуска до фактического релиза и проверить, не появляется ли там мнимый эффект.

Предтренды — диагностический сигнал, а не формальное доказательство. Даже совпадавшая история не гарантирует одинаковую реакцию на будущий шок. Поэтому контрольный регион должен быть похож по рынку, каналам, зрелости продукта и составу пользователей.

Нужно проверить четыре основных риска:

  • Одновременные изменения: цены, маркетинг, доступность функции или регуляторные условия различались по регионам.
  • Изменение состава пользователей: после запуска в регионах могли прийти разные сегменты.
  • Перетекание эффекта: пользователи контрольного региона получили функцию через общий аккаунт, поездки или межрегиональные контакты.
  • Разная сезонность: регионы могли по-разному реагировать на праздники, погоду или локальные события.

Если вмешательство внедряется поэтапно, простая формула двух периодов может быть недостаточной. Используют данные по нескольким периодам, исследование динамики эффекта и методы, учитывающие неодновременное начало воздействия. Интервалы неопределённости обязательны: положительная оценка без оценки разброса не показывает, отличим ли эффект от случайных колебаний.

Ситуация из практики

Команда запустила новый сценарий оплаты в регионе A, но не могла провести индивидуальную рандомизацию из-за ограничений партнёра. Регион B выбрали как контрольный: у него были похожие каналы трафика, зрелость продукта и динамика конверсии за шесть предыдущих недель.

Рассматривались варианты. Сравнение только до и после было простым, но не отделяло эффект функции от сезонного роста. Сравнение регионов только после запуска учитывало разный исходный уровень. Сопоставление с несколькими регионами давало более устойчивый контроль, но требовало сложной проверки качества данных.

Выбрали метод разностей с несколькими контрольными регионами и проверкой предтрендов. В иллюстративном расчёте конверсия в регионе A выросла с 20% до 26%, а в сопоставленном контроле — с 18% до 21%; оценка эффекта составила 3 процентных пункта. Предтренды не расходились, плацебо-запуски не давали эффекта, а доверительный интервал не включал практически незначимое значение.

Решение о расширении запуска приняли не только по точечной оценке, но и с учётом интервала, стоимости внедрения и проверок на побочные метрики. Если бы предтренды расходились или в контрольном регионе проходила отдельная кампания, результат считали бы наблюдательной корреляцией, а не надёжной оценкой причинного эффекта.

Что кандидаты часто упускают

1. Достаточно ли того, что предтренды регионов визуально похожи?

Нет. Похожие предтренды поддерживают допущение, но не доказывают его. Небольшое число периодов, шумная метрика или низкая статистическая мощность могут скрыть реальное расхождение.

Нужно проверить несколько временных интервалов, доверительные интервалы для различий трендов и наличие содержательных причин, по которым регионы должны реагировать сходно. Также полезно провести плацебо-тесты и заранее определить критерии приемлемости контроля.

2. Что произойдёт, если часть пользователей контрольного региона всё же получит функцию?

Возникает загрязнение контрольной группы. Контроль начинает частично испытывать воздействие, поэтому его метрика приближается к метрике тестового региона, а оцененный эффект обычно смещается к нулю.

Нужно анализировать фактическое получение функции, ограничивать взаимное влияние регионов или выбирать географические единицы, между которыми меньше перетекания. Исключение загрязнённых пользователей может создать новый перекос, поэтому такой анализ следует заранее планировать и дополнять оценкой чувствительности результата.

3. Почему опасно применять одну и ту же регрессионную формулу при поэтапном запуске в разных регионах?

При неодновременном запуске группы получают воздействие в разные моменты, а эффект может меняться со временем. Простая модель с фиксированными эффектами иногда использует уже подвергшиеся воздействию группы как контроль для ещё не подвергшихся и смешивает эффекты разных периодов.

Следует анализировать динамику относительно даты запуска каждой группы, проверять предтренды отдельно и применять метод, корректный для неоднородных эффектов и разного времени воздействия. Иначе итоговый коэффициент может быть трудно интерпретировать как средний причинный эффект функции.