В A/B тесте после поэтапного расширения охвата метрика изменилась. Как проверить, что это не эффект календа...

В A/B-тесте после поэтапного расширения охвата метрика изменилась. Как проверить, что это не эффект календарного времени?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Нужно сохранить одновременно работающую контрольную группу и сравнить варианты внутри одинаковых календарных периодов. Если разница между группами меняется вместе с датой запуска, а аналогичное изменение наблюдается в контроле, результат нельзя приписывать только продуктовой модификации.

Исторический контекст

Рандомизированный контролируемый эксперимент появился как способ отделить влияние вмешательства от различий между группами и внешних изменений. При одновременном показе вариантов календарные факторы — сезонность, праздники, маркетинговые кампании и изменения инфраструктуры — в среднем воздействуют на обе группы.

При поэтапном rollout это свойство легко нарушается: ранняя часть тестовой группы наблюдается в один период, а поздняя — в другой. Поэтому дата получения варианта становится связана с самим вариантом.

Постановка проблемы

Если сравнить метрику тестовой группы до расширения и после него, рост может быть вызван не изменением продукта, а внешним фактором. Например, на позднем этапе могла начаться рекламная кампания, измениться платёжный провайдер или наступить сезонный пик спроса.

Главный риск — ошибочно масштабировать неэффективное изменение либо остановить полезное. Простое сравнение средних за весь период также может скрыть проблему, если доля пользователей в вариантах и внешние условия менялись со временем.

Подробное решение

На каждом календарном отрезке нужно считать эффект как разницу между тестом и контролем, а затем проверять, стабилен ли этот эффект во времени. Полезны следующие проверки:

  • сравнение теста и контроля по дням или неделям;
  • проверка, что в контроле нет такого же скачка в момент расширения охвата;
  • анализ взаимодействия вариант × период;
  • проверка предэкспериментальных метрик и равномерности распределения по времени;
  • фиксация внешних событий: рекламных активностей, релизов, сбоев и изменений правил атрибуции.

Базовый критерий — сохранять параллельный holdout, то есть часть пользователей, которая остаётся в контроле на всём периоде. Тогда общий эффект оценивается не как «после минус до», а как разница между вариантами при одинаковом календарном воздействии.

Если поэтапное расширение было неизбежным, периоды rollout можно анализировать отдельно, а вывод делать только по интервалам, где обе группы наблюдались одновременно. Модель с периодами и их взаимодействием помогает описать динамику, но не заменяет корректный дизайн: при сильном совпадении даты rollout с внешним событием статистика сама по себе не восстановит причинность.

У такого подхода есть компромиссы. Удержание контроля уменьшает потенциальный охват функции и может увеличить длительность эксперимента, зато снижает риск неверного решения. Разбиение по периодам повышает прозрачность, но уменьшает размер выборки в каждом срезе и может снизить статистическую мощность.

Ситуация из практики

Команда постепенно увеличила долю пользователей с новой оплатой с 10 до 50 процентов. После расширения охвата конверсия выросла на 0,8 процентного пункта. Одновременно в контрольной группе произошёл почти такой же рост, а начало изменения совпало с запуском промокампании.

Рассматривались три варианта. Сравнить ранний и поздний этапы было быстро, но такой анализ смешивал эффект функции с кампанией. Объединить все данные в один итоговый показатель было устойчивее к шуму, но скрывало временную неоднородность. Оставить постоянный holdout и сравнивать группы по одинаковым дням было менее выгодно с точки зрения охвата, однако лучше сохраняло причинную интерпретацию.

Выбрали третий вариант. После корректировки на календарные периоды дополнительный эффект функции оказался близок к нулю, поэтому масштабирование остановили и отдельно оценили влияние промокампании. Решение предотвратило запуск изменения, которое первоначально выглядело успешным только из-за внешнего фактора.

Что кандидаты часто упускают

  1. Достаточно ли проверить только среднюю метрику в контрольной группе?

Нет. Важно проверить не только среднее значение, но и временной профиль: дату начала скачка, длительность и наличие аналогичной динамики в тесте. Среднее может скрыть кратковременный внешний шок или компенсировать разнонаправленные изменения в разные дни.

  1. Можно ли решить проблему, добавив в модель календарную дату?

Добавление периода, дня недели или признака кампании может уменьшить смешение, но не гарантирует причинный вывод. Если внешний фактор точно совпал с расширением охвата и его влияние измерено неполно, модель не сможет надёжно разделить два эффекта. Надёжнее иметь одновременную контрольную группу и заранее фиксировать внешние воздействия.

  1. Что делать, если после расширения эффекты действительно различаются по периодам?

Нужно выяснить, связано ли это с календарным фактором, изменением состава аудитории или реальным изменением поведения. Следует проверить взаимодействие варианта с периодом, распределение сегментов и метрики в каждом интервале, не выбирая удобный период постфактум. Если неоднородность подтверждается, решение принимают по заранее важным сегментам и долгосрочным метрикам, а не по общей средней оценке.