В A/B-тесте после поэтапного расширения охвата метрика изменилась. Как проверить, что это не эффект календарного времени?
Нужно сохранить одновременно работающую контрольную группу и сравнить варианты внутри одинаковых календарных периодов. Если разница между группами меняется вместе с датой запуска, а аналогичное изменение наблюдается в контроле, результат нельзя приписывать только продуктовой модификации.
Рандомизированный контролируемый эксперимент появился как способ отделить влияние вмешательства от различий между группами и внешних изменений. При одновременном показе вариантов календарные факторы — сезонность, праздники, маркетинговые кампании и изменения инфраструктуры — в среднем воздействуют на обе группы.
При поэтапном rollout это свойство легко нарушается: ранняя часть тестовой группы наблюдается в один период, а поздняя — в другой. Поэтому дата получения варианта становится связана с самим вариантом.
Если сравнить метрику тестовой группы до расширения и после него, рост может быть вызван не изменением продукта, а внешним фактором. Например, на позднем этапе могла начаться рекламная кампания, измениться платёжный провайдер или наступить сезонный пик спроса.
Главный риск — ошибочно масштабировать неэффективное изменение либо остановить полезное. Простое сравнение средних за весь период также может скрыть проблему, если доля пользователей в вариантах и внешние условия менялись со временем.
На каждом календарном отрезке нужно считать эффект как разницу между тестом и контролем, а затем проверять, стабилен ли этот эффект во времени. Полезны следующие проверки:
Базовый критерий — сохранять параллельный holdout, то есть часть пользователей, которая остаётся в контроле на всём периоде. Тогда общий эффект оценивается не как «после минус до», а как разница между вариантами при одинаковом календарном воздействии.
Если поэтапное расширение было неизбежным, периоды rollout можно анализировать отдельно, а вывод делать только по интервалам, где обе группы наблюдались одновременно. Модель с периодами и их взаимодействием помогает описать динамику, но не заменяет корректный дизайн: при сильном совпадении даты rollout с внешним событием статистика сама по себе не восстановит причинность.
У такого подхода есть компромиссы. Удержание контроля уменьшает потенциальный охват функции и может увеличить длительность эксперимента, зато снижает риск неверного решения. Разбиение по периодам повышает прозрачность, но уменьшает размер выборки в каждом срезе и может снизить статистическую мощность.
Команда постепенно увеличила долю пользователей с новой оплатой с 10 до 50 процентов. После расширения охвата конверсия выросла на 0,8 процентного пункта. Одновременно в контрольной группе произошёл почти такой же рост, а начало изменения совпало с запуском промокампании.
Рассматривались три варианта. Сравнить ранний и поздний этапы было быстро, но такой анализ смешивал эффект функции с кампанией. Объединить все данные в один итоговый показатель было устойчивее к шуму, но скрывало временную неоднородность. Оставить постоянный holdout и сравнивать группы по одинаковым дням было менее выгодно с точки зрения охвата, однако лучше сохраняло причинную интерпретацию.
Выбрали третий вариант. После корректировки на календарные периоды дополнительный эффект функции оказался близок к нулю, поэтому масштабирование остановили и отдельно оценили влияние промокампании. Решение предотвратило запуск изменения, которое первоначально выглядело успешным только из-за внешнего фактора.
Нет. Важно проверить не только среднее значение, но и временной профиль: дату начала скачка, длительность и наличие аналогичной динамики в тесте. Среднее может скрыть кратковременный внешний шок или компенсировать разнонаправленные изменения в разные дни.
Добавление периода, дня недели или признака кампании может уменьшить смешение, но не гарантирует причинный вывод. Если внешний фактор точно совпал с расширением охвата и его влияние измерено неполно, модель не сможет надёжно разделить два эффекта. Надёжнее иметь одновременную контрольную группу и заранее фиксировать внешние воздействия.
Нужно выяснить, связано ли это с календарным фактором, изменением состава аудитории или реальным изменением поведения. Следует проверить взаимодействие варианта с периодом, распределение сегментов и метрики в каждом интервале, не выбирая удобный период постфактум. Если неоднородность подтверждается, решение принимают по заранее важным сегментам и долгосрочным метрикам, а не по общей средней оценке.