Пользователь попал в тестовую группу, но не воспользовался новой функцией. Как корректно оценить эффект экс...

Пользователь попал в тестовую группу, но не воспользовался новой функцией. Как корректно оценить эффект эксперимента?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Основной анализ нужно проводить по принципу intention-to-treat (ITT): сравнивать всех пользователей по первоначально назначенным группам, независимо от фактического использования функции. Это сохраняет преимущества случайного распределения и оценивает эффект предложения функции всей целевой аудитории.

Исключение неактивировавших пользователей из тестовой группы обычно искажает результат: группы начинают различаться не только наличием функции, но и готовностью ею пользоваться.

Исторический контекст

Подход ITT сформировался в рандомизированных исследованиях, где участники могли не следовать назначенному лечению или прекращать участие. Исходная проблема состояла в том, что анализ только фактически следовавших назначению смешивал эффект вмешательства с особенностями людей, которые согласились его применять.

В продуктовых экспериментах возникает та же ситуация: пользователь может увидеть новую функцию, но не открыть её, не дойти до нужного шага или отказаться от использования. Случайное назначение группы известно заранее, а фактическое воздействие на пользователя может быть неполным.

Постановка проблемы

Если сравнить тест только среди активировавших функцию, в анализ попадут пользователи с особым поведением: более высокой мотивацией, частотой использования продукта или готовностью пробовать новое. Поэтому измеренный эффект может отражать не только пользу функции, но и свойства таких пользователей.

Если же считать всех назначенных пользователей, оценка может выглядеть слабее: часть аудитории фактически не получила воздействия. Это не ошибка, а ответ на другой бизнес-вопрос — какой результат даст запуск функции для всей аудитории, которой её предложат.

Подробное решение

Сначала фиксируют единицу рандомизации и анализируют метрику у всех пользователей, назначенных в каждую группу. Пользователь, попавший в тест, остаётся в тестовой группе даже при нулевом числе взаимодействий с функцией.

Такой расчёт даёт эффект назначения: изменение метрики от предложения новой функции по сравнению с контролем. Он защищён случайным распределением, поскольку исходные различия между группами в среднем сбалансированы независимо от последующего поведения.

Отдельно можно изучать активацию, долю использовавших функцию и эффект среди активировавших. Но это уже не является автоматически причинным эффектом функции: факт активации произошёл после назначения и может зависеть от мотивации пользователя.

Анализ только активировавших, или per-protocol-анализ, полезен для диагностики механизма, но опасен как основной критерий запуска. При существенном несоблюдении назначения можно дополнительно применять методы оценки эффекта фактического воздействия, например инструментальный подход, однако он требует явных предположений и обычно сложнее для интерпретации.

При принятии решения ITT следует рассматривать вместе с метриками активации, удержания, выручки и защитными метриками. Низкий общий эффект может означать либо слабую ценность функции, либо недостаточную активацию; эти причины нужно разделять, не меняя основной принцип сравнения.

Ситуация из практики

Команда добавила новый способ оформления заказа. В тесте функцию предложили всем пользователям случайно выбранной группы, но активировали её только 30% участников. Вариант анализа только активировавших показал заметный рост завершённых заказов, однако такие пользователи чаще совершали покупки ещё до эксперимента.

Команда рассматривала два варианта. Исключить неактивировавших было проще и давало более высокий наблюдаемый эффект, но нарушало сопоставимость групп. Сравнить всех назначенных пользователей было менее впечатляюще по размеру эффекта, зато результат соответствовал реальному сценарию массового запуска.

Выбрали ITT как основной анализ, а активацию и эффект среди активировавших оставили диагностическими показателями. В условном результате общий рост оказался небольшим, но положительным, а низкая активация указала на необходимость улучшить обнаружение и объяснение функции до масштабирования.

Что кандидаты часто упускают

  1. Можно ли считать ITT бессмысленным, если функцией воспользовалась лишь малая доля тестовой группы?

Нет. ITT по-прежнему отвечает на вопрос о результате назначения функции всей аудитории. Однако малое проникновение снижает наблюдаемый эффект и может потребовать большего размера выборки; параллельно нужно исследовать, почему пользователи не активируют функцию.

  1. Чем отличается эффект назначения от эффекта фактического использования?

Эффект назначения показывает изменение метрики при попадании пользователя в тестовую группу. Эффект фактического использования пытается оценить, что произошло бы с пользователями, которые действительно применили функцию. Второй эффект не следует напрямую из простого сравнения активировавших, потому что активация неслучайна и связана с характеристиками пользователя.

  1. Когда анализ активировавших может привести к завышенной оценке?

Когда функцию чаще активируют наиболее мотивированные или уже лояльные пользователи. Их высокая конверсия могла бы сохраняться и без изменения, поэтому сравнение активировавших с контролем приписывает функции часть исходного различия. Такой анализ допустим как исследование механизма, но не как единственное доказательство причинного эффекта.