Команда сравнивает конверсию вариантов A и B по платформам. Какой механизм может сделать вариант B хуже в общей таблице, хотя внутри каждой платформы он лучше?
WITH data(platform, variant, users, conversions) AS (
VALUES
('mobile', 'A', 900, 90),
('mobile', 'B', 100, 11),
('web', 'A', 100, 1),
('web', 'B', 900, 18)
)
SELECT variant,
SUM(conversions) * 1.0 / SUM(users) AS conversion_rate
FROM data
GROUP BY variant;
Это проявление парадокса Симпсона: агрегированная метрика является взвешенным средним сегментных конверсий, а веса сегментов у вариантов различаются. Поэтому B может иметь более высокую конверсию внутри каждой платформы, но более низкую общую конверсию из-за большей доли платформы с низкой базовой конверсией.
Для решения по эксперименту нужно сравнивать варианты при одинаковом составе платформ: анализировать страты отдельно или стандартизировать результаты по единому распределению платформ. Нельзя делать причинный вывод только по общей метрике, если состав групп отличается.
Агрегирование появилось как естественный способ получить одну понятную метрику для продукта: общую конверсию, выручку или удержание. Исходная проблема такого подхода — потеря информации о структуре пользователей и смешение эффекта варианта с различиями в составе аудиторий.
Парадокс Симпсона показывает, что направление связи на агрегированном уровне может отличаться от направления внутри однородных групп. Для продуктовой аналитики это особенно важно при экспериментах, когда распределение платформ, стран, каналов или типов пользователей между вариантами не совпадает.
В данных из вопроса для mobile конверсия A равна 10%, а B — 11%. Для web конверсия A равна 1%, а B — 2%. Значит, внутри каждой платформы B лучше.
Однако общая конверсия A равна 91/1000 = 9,1%, а B — 29/1000 = 2,9%. У A 90% пользователей приходятся на mobile, у B — только 10%; B преимущественно показан на web, где базовая конверсия существенно ниже.
Если принять решение по агрегированной разнице, командa ошибочно решит, что B ухудшает продукт. Обратная ошибка также возможна: несбалансированный состав способен создать кажущийся положительный эффект.
Конверсия варианта вычисляется так:
Сегментная конверсия — это отношение конверсий к пользователям внутри платформы. Общая конверсия — взвешенная сумма сегментных конверсий, где весом является доля платформы среди пользователей конкретного варианта. Веса A и B здесь различаются, поэтому сравнение включает одновременно эффект варианта и эффект состава аудитории.
Корректный анализ должен заранее определить оцен estimand, то есть для какой целевой популяции измеряется эффект. Практические варианты:
При стандартизации веса платформ должны быть одинаковыми для обоих вариантов. Например, если взять распределение A — 90% mobile и 10% web, стандартизированная конверсия B составит 0,9 × 11% + 0,1 × 2% = 10,1%, а A — 0,9 × 10% + 0,1 × 1% = 9,1%. В этом целевом составе B лучше на 1 процентный пункт.
Одной разницы конверсий недостаточно: нужно учитывать доверительные интервалы, размер сегментов, множественные проверки и возможное взаимодействие эффекта с платформой. Если сегментный эффект неоднороден, одна итоговая цифра может скрывать важный продуктовый риск.
После запуска нового экрана команда увидела падение общей регистрации с 9,1% до 2,9% и предложила немедленно откатить изменение. Проверка показала, что новый экран чаще направлялся на web-аудиторию: там регистрация была 2% против 1% в контроле, а на mobile — 11% против 10%.
Рассматривались три варианта. Откат был простым, но отвергал улучшение внутри обеих платформ. Сравнение только общей конверсии было быстрым, но смешивало эффект экрана с изменением состава трафика. Стандартизация по единому распределению платформ требовала дополнительного анализа, зато давала сопоставимый показатель для принятой целевой аудитории.
Команда выбрала стратифицированный анализ и закрепила одинаковое распределение платформ для сравнения. В стандартизированном расчёте B превысил A на 1 процентный пункт; решение об откате отменили, но отдельно проверили web на достаточность выборки и технические ошибки. Такой результат не доказывает одинаковую силу эффекта для всех платформ, поэтому платформу оставили постоянным срезом мониторинга.
Нет. Для этого достаточно различающихся весов сегментов и разных базовых конверсий; термин «парадокс» описывает особенно наглядное обращение направления вывода, но сам риск агрегирования шире. Кроме того, различие может быть вызвано случайным дисбалансом, ошибкой измерения или тем, что сегмент определён уже после воздействия варианта.
Да, если именно фактический состав пользователей каждой группы является целевой популяцией для решения. Тогда общая конверсия отвечает на другой вопрос: какой результат получен при текущем трафике варианта. Но для оценки причинного эффекта вариантов нужно заранее зафиксировать целевую популяцию и сравнивать результаты при одинаковых весах; иначе показатель меняется вместе с составом аудитории.
Нельзя механически усреднять сегменты или выбирать удобный результат. Нужно оценить доверительные интервалы, проверить статистическое взаимодействие варианта с платформой, определить бизнес-веса платформ и отдельно учесть guardrail-метрики.
Если эффект действительно неоднороден, решение может быть адресным: включить B на mobile, оставить A на web и продолжить сбор данных. Общая метрика допустима только после явного выбора целевого распределения и понимания того, какую бизнес-сценарий она представляет.