Как использование предэкспериментального значения метрики влияет на точность оценки эффекта в A/B-тесте?
Использование значения метрики до воздействия как ковариаты обычно повышает точность оценки эффекта: оно объясняет часть индивидуальных различий и уменьшает остаточную дисперсию. При корректной рандомизации и использовании только предэкспериментальных данных это не должно систематически смещать оценку среднего эффекта.
В A/B-тестах эффект часто трудно обнаружить не из-за его отсутствия, а из-за высокой естественной вариативности метрики между пользователями. Методы ковариатной корректировки, включая подходы типа CUPED, появились как способ уменьшить эту вариативность без обязательного увеличения выборки или длительности эксперимента.
Исходная проблема — сравнение групп по зашумлённой постэкспериментальной метрике. Если заранее известная характеристика пользователя хорошо предсказывает будущий результат, её можно использовать для более точного сравнения групп.
Пусть у каждого пользователя есть значение метрики до эксперимента и значение после него. Даже при отсутствии воздействия пользователи могут сильно различаться по активности, расходам или частоте заказов. Это различие увеличивает разброс результатов внутри каждой группы и расширяет доверительный интервал эффекта.
Если аналитик использует признак, сформированный уже после воздействия, возникает риск смещения: сам эксперимент может повлиять на этот признак, а тот — на итоговую метрику. Тогда корректировка способна удалить часть реального эффекта или создать искусственную связь.
Предэкспериментальное значение метрики можно включить в модель сравнения как ковариату. Интуитивно метод сравнивает пользователей не только по их итоговым значениям, но и с учётом того, каким был их исходный уровень.
Если исходная метрика сильно коррелирует с итоговой, она объясняет значительную часть разброса. В упрощённом виде остаточная дисперсия уменьшается примерно пропорционально величине, обратной квадрату корреляции: чем выше корреляция, тем больше потенциальный выигрыш в точности.
При случайном распределении по группам ковариата в среднем сбалансирована между вариантами. Поэтому её использование обычно не меняет сам целевой эффект, а уменьшает шум вокруг его оценки. На практике это выражается в более узком доверительном интервале и большей статистической мощности при том же размере выборки.
Важные условия:
Ковариатная корректировка не заменяет рандомизацию и не исправляет нарушение эксперимента. Она также не превращает наблюдательные данные в рандомизированные: без корректного дизайна остаются риски смешения и отбора.
В сервисе измеряют влияние новой рекомендации на недельную выручку пользователя. Выручка сильно различается между пользователями, но недельная выручка до запуска эксперимента хорошо предсказывает недельную выручку после запуска.
Вариант без корректировки прост: сравнить среднюю постэкспериментальную выручку групп. Его плюс — прозрачность и минимальное число допущений; минус — широкий интервал из-за различий в исходной активности.
Второй вариант — скорректировать сравнение по предэкспериментальной выручке. Он сложнее для объяснения и требует контроля периода измерения и пропусков, зато уменьшает остаточный разброс. Этот вариант выбирают, если ковариата действительно предсказательна, не зависит от назначения в группу и была рассчитана до старта воздействия.
После корректировки оценка эффекта почти не изменилась, но доверительный интервал стал заметно уже. Это означает не усиление самого воздействия, а более точное измерение того же эффекта.
Да, численное значение оценки может измениться. В идеальном рандомизированном эксперименте корректировка не должна систематически смещать средний эффект, но конечная выборка случайна, а модель может быть задана неидеально. Поэтому оценивают не только точечный эффект, но и его доверительный интервал, устойчивость к разумным вариантам спецификации и баланс исходной ковариаты между группами.
Потому что она может быть следствием воздействия. Если новая функция изменила активность, а аналитик скорректировал итоговую метрику по этой активности, он частично контролирует путь, через который проявляется эффект. В результате оценка может недооценить реальное воздействие или стать трудной для причинной интерпретации.
Ожидаемый выигрыш в точности будет близок к нулю. Ковариата почти не объясняет остаточный разброс, поэтому доверительный интервал существенно не сужается. Само включение такого признака не обязательно создаёт сильное смещение при корректной рандомизации, но усложняет анализ и может повысить чувствительность к ошибкам обработки данных.