После рандомизации в A/B-тесте аналитик оставил в расчёте только пользователей, посетивших сервис после воздействия. Какой риск возникает для оценки эффекта?
Фильтрация по посещению после воздействия может исказить оценку эффекта, потому что посещение является постлечебным признаком: на него может влиять само воздействие и факторы, связанные с исходом. Основной анализ следует проводить по всем пользователям, включённым в эксперимент, то есть по принципу intention-to-treat.
В экспериментальном анализе возникла практическая проблема: после рандомизации участники по-разному взаимодействуют с воздействием, не выполняют инструкции или прекращают наблюдение. Если анализировать только тех, кто дошёл до определённого этапа, группы могут перестать быть сопоставимыми.
Поэтому в рандомизированных экспериментах выделяют анализ по первоначальному назначению воздействия. Он сохраняет преимущества рандомизации и оценивает эффект предложения или назначения варианта для всей исходной популяции.
Пусть воздействие влияет на вероятность посещения сервиса, а интересующий результат также связан с этой вероятностью. После исключения непосетивших в группах сравниваются уже не случайные выборки, а отобранные подгруппы.
Такой отбор может создать selection bias и даже изменить знак эффекта. Например, воздействие может привлечь в сервис пользователей с низкой склонностью к покупке; если анализировать только посетителей, средняя конверсия варианта окажется ниже не из-за вреда воздействия, а из-за изменившегося состава аудитории.
В первичном анализе нужно сохранить всех пользователей, которые соответствовали критериям включения до начала воздействия, независимо от того, посещали ли они сервис после него. Разницу целевой метрики между рандомизированными группами тогда интерпретируют как средний эффект назначения варианта.
Посещение после воздействия является постлечебной переменной. Она может быть одновременно следствием воздействия и результатом скрытых характеристик пользователя, связанных с целевой метрикой. Условие на такую переменную может открыть искусственную зависимость между группой и этими характеристиками; в терминах причинного анализа это часто описывают как обусловливание на коллайдере.
Анализ только посетителей иногда нужен для отдельного вопроса, например для оценки эффекта среди реально вовлечённых пользователей. Но это уже другая оценочная величина, и простая фильтрация не даёт автоматически корректного причинного эффекта для этой группы.
Если интересует эффект фактического использования, а не назначения, применяют специальные подходы: анализ соблюдения протокола, инструментальные переменные или другие причинные методы. Они требуют явных предположений и не сводятся к удалению строк с нулевой вовлечённостью.
В эксперименте тестировали напоминание о продлении подписки. Напоминание могло увеличить число визитов, но среди пришедших пользователей оказалось больше тех, кто изначально сомневался в продлении. Если сравнить только посетителей, эффект напоминания на продление может выглядеть слабым или отрицательным.
Рассматривались два варианта. Фильтрация по визиту была простой, но разрушала сопоставимость групп и меняла целевую совокупность. Анализ всех рандомизированных пользователей сохранял корректную оценку влияния назначения напоминания, хотя эффект мог быть меньше, чем среди активно вовлечённых пользователей.
Выбранным решением стал intention-to-treat как первичный анализ, а посещение и продление рассматривались как отдельные вторичные метрики. Это позволило не смешивать общий эффект кампании с эффектом среди уже вовлечённых пользователей.
Да, если сегмент определён по признакам, известным до рандомизации, и рандомизация внутри него выполнена корректно. Такой анализ не создаёт постлечебного отбора, но уменьшает объём данных и может снизить статистическую мощность. Если сегмент выбран после просмотра результатов, возрастает риск случайного или предвзятого вывода.
Нет. Пользователи, которые воспользовались функцией, могут систематически отличаться от тех, кто не воспользовался ею. Поэтому сравнение использовавших с остальными смешивает эффект функции с исходными различиями и самоотбором. Для эффекта фактического использования нужны дополнительные причинные предположения и методы, а не только фильтр.
Обычно нет. Контроль постлечебного признака может удалить часть реального эффекта, если посещение является промежуточным звеном, либо внести дополнительное смещение, если оно выступает коллайдером. Корректность такой корректировки зависит от заранее сформулированной причинной схемы и от того, какой именно эффект требуется оценить.