АналитикаАнализ данныхАналитик по экспериментам

Как использование предэкспериментального значения метрики влияет на точность оценки эффекта в A/B тесте?

Как использование предэкспериментального значения метрики влияет на точность оценки эффекта в A/B-тесте?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Использование значения метрики до воздействия как ковариаты обычно повышает точность оценки эффекта: оно объясняет часть индивидуальных различий и уменьшает остаточную дисперсию. При корректной рандомизации и использовании только предэкспериментальных данных это не должно систематически смещать оценку среднего эффекта.

Исторический контекст

В A/B-тестах эффект часто трудно обнаружить не из-за его отсутствия, а из-за высокой естественной вариативности метрики между пользователями. Методы ковариатной корректировки, включая подходы типа CUPED, появились как способ уменьшить эту вариативность без обязательного увеличения выборки или длительности эксперимента.

Исходная проблема — сравнение групп по зашумлённой постэкспериментальной метрике. Если заранее известная характеристика пользователя хорошо предсказывает будущий результат, её можно использовать для более точного сравнения групп.

Постановка проблемы

Пусть у каждого пользователя есть значение метрики до эксперимента и значение после него. Даже при отсутствии воздействия пользователи могут сильно различаться по активности, расходам или частоте заказов. Это различие увеличивает разброс результатов внутри каждой группы и расширяет доверительный интервал эффекта.

Если аналитик использует признак, сформированный уже после воздействия, возникает риск смещения: сам эксперимент может повлиять на этот признак, а тот — на итоговую метрику. Тогда корректировка способна удалить часть реального эффекта или создать искусственную связь.

Подробное решение

Предэкспериментальное значение метрики можно включить в модель сравнения как ковариату. Интуитивно метод сравнивает пользователей не только по их итоговым значениям, но и с учётом того, каким был их исходный уровень.

Если исходная метрика сильно коррелирует с итоговой, она объясняет значительную часть разброса. В упрощённом виде остаточная дисперсия уменьшается примерно пропорционально величине, обратной квадрату корреляции: чем выше корреляция, тем больше потенциальный выигрыш в точности.

При случайном распределении по группам ковариата в среднем сбалансирована между вариантами. Поэтому её использование обычно не меняет сам целевой эффект, а уменьшает шум вокруг его оценки. На практике это выражается в более узком доверительном интервале и большей статистической мощности при том же размере выборки.

Важные условия:

  • ковариата должна быть измерена до воздействия;
  • она должна быть связана с итоговой метрикой;
  • правило расчёта ковариаты должно быть задано заранее или применяться симметрично ко всем группам;
  • пропуски и выбросы нужно обрабатывать одинаково для вариантов;
  • улучшение точности не гарантируется, если исходный признак почти не связан с результатом.

Ковариатная корректировка не заменяет рандомизацию и не исправляет нарушение эксперимента. Она также не превращает наблюдательные данные в рандомизированные: без корректного дизайна остаются риски смешения и отбора.

Ситуация из практики

В сервисе измеряют влияние новой рекомендации на недельную выручку пользователя. Выручка сильно различается между пользователями, но недельная выручка до запуска эксперимента хорошо предсказывает недельную выручку после запуска.

Вариант без корректировки прост: сравнить среднюю постэкспериментальную выручку групп. Его плюс — прозрачность и минимальное число допущений; минус — широкий интервал из-за различий в исходной активности.

Второй вариант — скорректировать сравнение по предэкспериментальной выручке. Он сложнее для объяснения и требует контроля периода измерения и пропусков, зато уменьшает остаточный разброс. Этот вариант выбирают, если ковариата действительно предсказательна, не зависит от назначения в группу и была рассчитана до старта воздействия.

После корректировки оценка эффекта почти не изменилась, но доверительный интервал стал заметно уже. Это означает не усиление самого воздействия, а более точное измерение того же эффекта.

Что кандидаты часто упускают

  1. Дополнительный вопрос: может ли ковариатная корректировка изменить оценку эффекта, а не только её стандартную ошибку?

Да, численное значение оценки может измениться. В идеальном рандомизированном эксперименте корректировка не должна систематически смещать средний эффект, но конечная выборка случайна, а модель может быть задана неидеально. Поэтому оценивают не только точечный эффект, но и его доверительный интервал, устойчивость к разумным вариантам спецификации и баланс исходной ковариаты между группами.

  1. Дополнительный вопрос: почему нельзя использовать активность пользователя, измеренную после начала эксперимента?

Потому что она может быть следствием воздействия. Если новая функция изменила активность, а аналитик скорректировал итоговую метрику по этой активности, он частично контролирует путь, через который проявляется эффект. В результате оценка может недооценить реальное воздействие или стать трудной для причинной интерпретации.

  1. Дополнительный вопрос: что произойдёт, если исходная метрика почти не коррелирует с итоговой?

Ожидаемый выигрыш в точности будет близок к нулю. Ковариата почти не объясняет остаточный разброс, поэтому доверительный интервал существенно не сужается. Само включение такого признака не обязательно создаёт сильное смещение при корректной рандомизации, но усложняет анализ и может повысить чувствительность к ошибкам обработки данных.