Распределение участников A/B-теста заметно отклонилось от запланированной пропорции. Какой вывод нужно сделать до анализа разницы метрик?
Сначала нужно проверить sample ratio mismatch (SRM) — несоответствие фактического распределения участников ожидаемой пропорции. Пока причина отклонения не объяснена, результаты эксперимента нельзя считать надёжными: нарушиться могли рандомизация, попадание пользователей в варианты или сбор данных.
Само по себе отклонение не доказывает эффект варианта и не означает автоматически ошибку продукта. Это диагностический сигнал, требующий проверки процесса эксперимента.
Рандомизированные эксперименты появились как способ отделить влияние изменения от различий между группами. Их интерпретация опирается на заранее заданную вероятность попадания пользователя в каждый вариант и сопоставимость групп.
В реальных цифровых системах проблема часто возникает не в статистической формуле, а в операционном контуре: неправильно работает распределитель трафика, часть пользователей отбрасывается фильтрами, события назначения теряются или аналитическая выборка формируется иначе, чем аудитория эксперимента. Поэтому проверка соотношения групп стала базовым контролем качества A/B-теста.
Предположим, эксперимент должен делить eligible-аудиторию поровну, но в данных оказалось существенно больше пользователей в варианте A. Это может быть связано с ошибкой таргетинга, неполной фиксацией назначения, повторным учётом пользователей, различиями платформ или досрочным включением только одного варианта.
Если причина связана с отбором пользователей, группы могут различаться не только тестируемым изменением. Тогда разница конверсии смешивает эффект продукта с эффектом механизма формирования выборки, а решение о запуске или откате может оказаться ошибочным.
Проверять нужно именно тех пользователей, которые должны были попасть в эксперимент, и различать три сущности: eligible-аудиторию, фактически назначенных пользователей и пользователей, реально увидевших вариант. Несоответствие между ними имеет разные причины и требует разного расследования.
Сначала фиксируют ожидаемую пропорцию распределения. Она не обязана быть 50/50: например, эксперимент мог быть запланирован как 90/10. Затем сравнивают наблюдаемое число назначенных пользователей с ожидаемым, обычно с помощью теста соответствия распределения, например критерия хи-квадрат.
Порог и момент проверки лучше определить заранее. При очень большом объёме данных статистически значимым может стать даже практически несущественное отклонение, поэтому оценивают не только p-value, но и размер расхождения, его стабильность по времени, платформам, странам и другим срезам.
Типовые причины SRM:
До выяснения причины не следует выбирать победителя по основной метрике. Корректный порядок действий: проверить распределение на уровне назначения, сопоставить его с логами доставки и экспозиции, локализовать проблему по сегментам и времени, затем повторить эксперимент или заранее обоснованно скорректировать план анализа.
Взвешивание или постфактум удаление части пользователей редко является полноценным исправлением. Такие методы могут помочь только при хорошо известном механизме отбора и дополнительных предпосылках; они не восстанавливают потерянную рандомизацию и обычно увеличивают неопределённость результата.
Команда тестировала новый экран оплаты с ожидаемым распределением 50/50. Через сутки в аналитическом отчёте оказалось 62% пользователей в A и 38% в B, причём конверсия B выглядела выше.
Рассматривались три варианта. Продолжить тест означало быстро получить больше данных, но сохранить риск смешения эффекта с ошибкой распределения. Удалить случайную часть пользователей из A позволяло приблизить размеры групп, но не устраняло возможную систематическую ошибку. Немедленно объявить B победителем было самым быстрым, но методологически необоснованным решением.
Команда сопоставила логи назначения с событиями экспозиции и обнаружила, что на одной версии мобильного приложения событие назначения иногда не отправлялось для B. Пользователи при этом присутствовали в реальном эксперименте, но отсутствовали в аналитической выборке B.
Тест остановили, исправили регистрацию назначения и повторили эксперимент. Это заняло больше времени, зато новая оценка сравнивала корректно сформированные группы; первоначальный «выигрыш» B при повторе не подтвердился.
1. Доказывает ли SRM, что тестовый вариант хуже?
Нет. SRM говорит о несоответствии формирования групп ожидаемому распределению, но не указывает направление продуктового эффекта. Причиной может быть техническая ошибка, различие в логировании, фильтрация или реальное изменение состава аудитории.
Например, если пользователи B чаще используют платформу, где событие экспозиции теряется, группа B будет искусственно уменьшена. Наблюдаемая конверсия также может измениться, но это будет следствием качества данных, а не свойства экрана.
2. Нужно ли останавливать любой тест при малом отклонении от пропорции?
Нет. Сначала оценивают величину отклонения, статистическую значимость, динамику и практическое влияние на анализ. Небольшая случайная разница ожидаема, особенно на раннем этапе, а при огромной выборке даже малая разница может получить низкое p-value.
Однако устойчивое отклонение, локализованное в конкретной платформе или возникшее сразу после изменения распределителя, является сильным сигналом для расследования. Решение о продолжении должно учитывать заранее установленное правило качества эксперимента.
3. Можно ли исправить SRM обычным постстратификационным взвешиванием?
Иногда взвешивание корректирует известное различие состава, но оно не является универсальным лечением. Если пользователи были неслучайно потеряны, неправильно назначены или по-разному увидели варианты, неизвестна сама вероятность включения в анализ и нарушаются предпосылки взвешивания.
Поэтому сначала восстанавливают причину и проверяют данные на уровне назначения и экспозиции. Взвешивание допустимо рассматривать только при документированном механизме отбора, стабильных признаках, объясняющих этот отбор, и заранее согласованном плане анализа.