АналитикаАнализ данныхАналитик по экспериментам

После рандомизации в A/B тесте аналитик оставил в расчёте только пользователей, посетивших сервис после воз...

После рандомизации в A/B-тесте аналитик оставил в расчёте только пользователей, посетивших сервис после воздействия. Какой риск возникает для оценки эффекта?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Фильтрация по посещению после воздействия может исказить оценку эффекта, потому что посещение является постлечебным признаком: на него может влиять само воздействие и факторы, связанные с исходом. Основной анализ следует проводить по всем пользователям, включённым в эксперимент, то есть по принципу intention-to-treat.

Исторический контекст

В экспериментальном анализе возникла практическая проблема: после рандомизации участники по-разному взаимодействуют с воздействием, не выполняют инструкции или прекращают наблюдение. Если анализировать только тех, кто дошёл до определённого этапа, группы могут перестать быть сопоставимыми.

Поэтому в рандомизированных экспериментах выделяют анализ по первоначальному назначению воздействия. Он сохраняет преимущества рандомизации и оценивает эффект предложения или назначения варианта для всей исходной популяции.

Постановка проблемы

Пусть воздействие влияет на вероятность посещения сервиса, а интересующий результат также связан с этой вероятностью. После исключения непосетивших в группах сравниваются уже не случайные выборки, а отобранные подгруппы.

Такой отбор может создать selection bias и даже изменить знак эффекта. Например, воздействие может привлечь в сервис пользователей с низкой склонностью к покупке; если анализировать только посетителей, средняя конверсия варианта окажется ниже не из-за вреда воздействия, а из-за изменившегося состава аудитории.

Подробное решение

В первичном анализе нужно сохранить всех пользователей, которые соответствовали критериям включения до начала воздействия, независимо от того, посещали ли они сервис после него. Разницу целевой метрики между рандомизированными группами тогда интерпретируют как средний эффект назначения варианта.

Посещение после воздействия является постлечебной переменной. Она может быть одновременно следствием воздействия и результатом скрытых характеристик пользователя, связанных с целевой метрикой. Условие на такую переменную может открыть искусственную зависимость между группой и этими характеристиками; в терминах причинного анализа это часто описывают как обусловливание на коллайдере.

Анализ только посетителей иногда нужен для отдельного вопроса, например для оценки эффекта среди реально вовлечённых пользователей. Но это уже другая оценочная величина, и простая фильтрация не даёт автоматически корректного причинного эффекта для этой группы.

Если интересует эффект фактического использования, а не назначения, применяют специальные подходы: анализ соблюдения протокола, инструментальные переменные или другие причинные методы. Они требуют явных предположений и не сводятся к удалению строк с нулевой вовлечённостью.

Ситуация из практики

В эксперименте тестировали напоминание о продлении подписки. Напоминание могло увеличить число визитов, но среди пришедших пользователей оказалось больше тех, кто изначально сомневался в продлении. Если сравнить только посетителей, эффект напоминания на продление может выглядеть слабым или отрицательным.

Рассматривались два варианта. Фильтрация по визиту была простой, но разрушала сопоставимость групп и меняла целевую совокупность. Анализ всех рандомизированных пользователей сохранял корректную оценку влияния назначения напоминания, хотя эффект мог быть меньше, чем среди активно вовлечённых пользователей.

Выбранным решением стал intention-to-treat как первичный анализ, а посещение и продление рассматривались как отдельные вторичные метрики. Это позволило не смешивать общий эффект кампании с эффектом среди уже вовлечённых пользователей.

Что кандидаты часто упускают

  1. Можно ли анализировать только пользователей из заранее определённого сегмента, например новых клиентов?

Да, если сегмент определён по признакам, известным до рандомизации, и рандомизация внутри него выполнена корректно. Такой анализ не создаёт постлечебного отбора, но уменьшает объём данных и может снизить статистическую мощность. Если сегмент выбран после просмотра результатов, возрастает риск случайного или предвзятого вывода.

  1. Равен ли анализ только использовавших функцию оценке эффекта фактического использования?

Нет. Пользователи, которые воспользовались функцией, могут систематически отличаться от тех, кто не воспользовался ею. Поэтому сравнение использовавших с остальными смешивает эффект функции с исходными различиями и самоотбором. Для эффекта фактического использования нужны дополнительные причинные предположения и методы, а не только фильтр.

  1. Устранит ли добавление посещения после воздействия как контрольного признака проблему в регрессионной модели?

Обычно нет. Контроль постлечебного признака может удалить часть реального эффекта, если посещение является промежуточным звеном, либо внести дополнительное смещение, если оно выступает коллайдером. Корректность такой корректировки зависит от заранее сформулированной причинной схемы и от того, какой именно эффект требуется оценить.