Команда сравнивает конверсию вариантов A и B по платформам. Какой механизм может сделать вариант B хуже в о...

Команда сравнивает конверсию вариантов A и B по платформам. Какой механизм может сделать вариант B хуже в общей таблице, хотя внутри каждой платформы он лучше?

WITH data(platform, variant, users, conversions) AS (
  VALUES
    ('mobile', 'A', 900, 90),
    ('mobile', 'B', 100, 11),
    ('web',    'A', 100, 1),
    ('web',    'B', 900, 18)
)
SELECT variant,
       SUM(conversions) * 1.0 / SUM(users) AS conversion_rate
FROM data
GROUP BY variant;
Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Это проявление парадокса Симпсона: агрегированная метрика является взвешенным средним сегментных конверсий, а веса сегментов у вариантов различаются. Поэтому B может иметь более высокую конверсию внутри каждой платформы, но более низкую общую конверсию из-за большей доли платформы с низкой базовой конверсией.

Для решения по эксперименту нужно сравнивать варианты при одинаковом составе платформ: анализировать страты отдельно или стандартизировать результаты по единому распределению платформ. Нельзя делать причинный вывод только по общей метрике, если состав групп отличается.

Исторический контекст

Агрегирование появилось как естественный способ получить одну понятную метрику для продукта: общую конверсию, выручку или удержание. Исходная проблема такого подхода — потеря информации о структуре пользователей и смешение эффекта варианта с различиями в составе аудиторий.

Парадокс Симпсона показывает, что направление связи на агрегированном уровне может отличаться от направления внутри однородных групп. Для продуктовой аналитики это особенно важно при экспериментах, когда распределение платформ, стран, каналов или типов пользователей между вариантами не совпадает.

Постановка проблемы

В данных из вопроса для mobile конверсия A равна 10%, а B — 11%. Для web конверсия A равна 1%, а B — 2%. Значит, внутри каждой платформы B лучше.

Однако общая конверсия A равна 91/1000 = 9,1%, а B — 29/1000 = 2,9%. У A 90% пользователей приходятся на mobile, у B — только 10%; B преимущественно показан на web, где базовая конверсия существенно ниже.

Если принять решение по агрегированной разнице, командa ошибочно решит, что B ухудшает продукт. Обратная ошибка также возможна: несбалансированный состав способен создать кажущийся положительный эффект.

Подробное решение

Конверсия варианта вычисляется так:

SELECT variant, platform, conversions * 1.0 / users AS platform_rate, SUM(conversions) OVER (PARTITION BY variant) * 1.0 / SUM(users) OVER (PARTITION BY variant) AS total_rate FROM data;

Сегментная конверсия — это отношение конверсий к пользователям внутри платформы. Общая конверсия — взвешенная сумма сегментных конверсий, где весом является доля платформы среди пользователей конкретного варианта. Веса A и B здесь различаются, поэтому сравнение включает одновременно эффект варианта и эффект состава аудитории.

Корректный анализ должен заранее определить оцен estimand, то есть для какой целевой популяции измеряется эффект. Практические варианты:

  • сравнить A и B отдельно внутри каждой платформы;
  • применить стратифицированную рандомизацию, чтобы состав платформ был сопоставимым;
  • стандартизировать обе конверсии по одному фиксированному распределению платформ;
  • использовать модель с платформой и взаимодействием варианта с платформой, если предполагается разный эффект на платформах.

При стандартизации веса платформ должны быть одинаковыми для обоих вариантов. Например, если взять распределение A — 90% mobile и 10% web, стандартизированная конверсия B составит 0,9 × 11% + 0,1 × 2% = 10,1%, а A — 0,9 × 10% + 0,1 × 1% = 9,1%. В этом целевом составе B лучше на 1 процентный пункт.

Одной разницы конверсий недостаточно: нужно учитывать доверительные интервалы, размер сегментов, множественные проверки и возможное взаимодействие эффекта с платформой. Если сегментный эффект неоднороден, одна итоговая цифра может скрывать важный продуктовый риск.

Ситуация из практики

После запуска нового экрана команда увидела падение общей регистрации с 9,1% до 2,9% и предложила немедленно откатить изменение. Проверка показала, что новый экран чаще направлялся на web-аудиторию: там регистрация была 2% против 1% в контроле, а на mobile — 11% против 10%.

Рассматривались три варианта. Откат был простым, но отвергал улучшение внутри обеих платформ. Сравнение только общей конверсии было быстрым, но смешивало эффект экрана с изменением состава трафика. Стандартизация по единому распределению платформ требовала дополнительного анализа, зато давала сопоставимый показатель для принятой целевой аудитории.

Команда выбрала стратифицированный анализ и закрепила одинаковое распределение платформ для сравнения. В стандартизированном расчёте B превысил A на 1 процентный пункт; решение об откате отменили, но отдельно проверили web на достаточность выборки и технические ошибки. Такой результат не доказывает одинаковую силу эффекта для всех платформ, поэтому платформу оставили постоянным срезом мониторинга.

Что кандидаты часто упускают

  1. Всегда ли различие агрегированного и сегментного вывода означает парадокс Симпсона?

Нет. Для этого достаточно различающихся весов сегментов и разных базовых конверсий; термин «парадокс» описывает особенно наглядное обращение направления вывода, но сам риск агрегирования шире. Кроме того, различие может быть вызвано случайным дисбалансом, ошибкой измерения или тем, что сегмент определён уже после воздействия варианта.

  1. Можно ли использовать общую конверсию, если распределение платформ действительно различается?

Да, если именно фактический состав пользователей каждой группы является целевой популяцией для решения. Тогда общая конверсия отвечает на другой вопрос: какой результат получен при текущем трафике варианта. Но для оценки причинного эффекта вариантов нужно заранее зафиксировать целевую популяцию и сравнивать результаты при одинаковых весах; иначе показатель меняется вместе с составом аудитории.

  1. Что делать, если B улучшает метрику на mobile, но ухудшает её на web?

Нельзя механически усреднять сегменты или выбирать удобный результат. Нужно оценить доверительные интервалы, проверить статистическое взаимодействие варианта с платформой, определить бизнес-веса платформ и отдельно учесть guardrail-метрики.

Если эффект действительно неоднороден, решение может быть адресным: включить B на mobile, оставить A на web и продолжить сбор данных. Общая метрика допустима только после явного выбора целевого распределения и понимания того, какую бизнес-сценарий она представляет.