Из десятков метрик эксперимента команда выбирает ту, где получен самый высокий рост. Какой статистический р...

Из десятков метрик эксперимента команда выбирает ту, где получен самый высокий рост. Какой статистический риск возникает?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Возникает риск множественного тестирования: чем больше метрик проверяют, тем выше вероятность случайно найти статистически значимый рост хотя бы в одной из них. Поэтому выбранный результат нельзя интерпретировать с исходным уровнем значимости без заранее заданной основной метрики или корректировки процедуры проверки гипотез.

Исторический контекст

Классическая проверка статистической гипотезы обычно предполагает одну заранее сформулированную проверку: например, изменилось ли среднее значение одной основной метрики. Уровень значимости задаёт допустимую вероятность ложноположительного вывода именно для такой процедуры.

В продуктовых экспериментах часто одновременно смотрят конверсию, выручку на пользователя, удержание, частоту использования и десятки сегментов. Если выбрать лучший результат уже после просмотра данных, исходная гарантия ошибки перестаёт применяться к этому выбору.

Постановка проблемы

Предположим, каждая из 20 независимых метрик тестируется на уровне значимости 5%, а реального эффекта нет. Вероятность не получить ни одного случайного значимого результата примерно равна 0,95 в степени 20, то есть около 36%. Следовательно, вероятность найти хотя бы один ложноположительный результат составляет примерно 64%.

Проблема не в самом анализе нескольких метрик, а в том, что команда выдаёт отобранную после эксперимента метрику за заранее подтверждённый основной результат. Это приводит к ложным запускам, неверным выводам о причинности и переоценке эффекта.

Подробное решение

До запуска эксперимента нужно определить основную метрику, направление эффекта, окно измерения и правило принятия решения. Её результат можно проверять с заранее выбранным уровнем значимости. Остальные показатели следует разделить на вторичные подтверждающие метрики и исследовательские сигналы.

Если несколько гипотез действительно являются частью одного решения, применяют корректировку множественных сравнений. Поправки Бонферрони и Холма контролируют вероятность хотя бы одной ошибки первого рода, но могут снизить статистическую мощность. Для большого набора исследовательских метрик иногда контролируют долю ложных открытий с помощью процедур FDR, однако это не заменяет заранее определённый критерий запуска продукта.

Коррелированные метрики не делают проблему автоматически несущественной: степень инфляции ошибки меняется, но выбор максимального результата всё равно создаёт смещение. Простое правило «берём метрику с максимальным ростом» также переоценивает величину эффекта, потому что экстремальное наблюдение чаще оказывается случайным отклонением.

Корректировка не решает проблему слабой постановки эксперимента. Если метрики выбраны бессистемно, данные просмотрены многократно или решение принимается по удобному сегменту, одной статистической поправки недостаточно. Важно отделять подтверждающий анализ от генерации новых гипотез: исследовательский результат можно использовать для следующего эксперимента, но не выдавать за независимое подтверждение.

Ситуация из практики

Команда тестировала новый экран оплаты и заранее определила основной показатель — долю пользователей, завершивших покупку. После окончания теста основной показатель не изменился, но среди 18 дополнительных метрик одна показала значимый рост, а другая — значимое снижение.

Рассматривались два варианта. Запустить изменение по лучшей метрике было быстро, но это игнорировало риск случайного результата. Отказаться от анализа дополнительных показателей было безопаснее, но можно было потерять полезную гипотезу. Команда оставила запуск по основной метрике без изменений, проверила ухудшение защитной метрики с учётом плана анализа и использовала положительный сигнал как гипотезу для отдельного теста.

Такое решение сохраняет контроль ложных запусков и не выбрасывает исследовательскую информацию. В результате эксперимент не стал основанием для немедленного релиза, а следующий тест проверил наиболее правдоподобный механизм отдельно.

Что кандидаты часто упускают

  1. Всегда ли нужно корректировать p-value, если метрики заранее определены?

Нет, сам факт наличия нескольких метрик ещё не определяет единственную правильную процедуру. Если одна метрика заранее объявлена основной, а остальные используются для диагностики, основной вывод можно проверять отдельно, но вторичные выводы нельзя автоматически трактовать как подтверждённые на том же уровне гарантий. Если же запуск зависит от любой из нескольких метрик, их нужно рассматривать как совместное множество проверок и учитывать множественность.

  1. Почему увеличение размера выборки не устраняет проблему множественных сравнений?

Большая выборка уменьшает случайную погрешность и повышает вероятность обнаружить реальный небольшой эффект. Но при отсутствии эффекта вероятность ложного значимого результата для каждой отдельной проверки всё равно определяется выбранным уровнем значимости. При большом числе проверок совокупный риск ложного открытия сохраняется, если не изменить процедуру анализа.

  1. Можно ли использовать значимую вторичную метрику для принятия решения?

Можно, если это предусмотрено планом эксперимента: например, несколько метрик образуют заранее определённое правило успеха или одна является основной, а другая — обязательной защитной метрикой. Тогда нужно заранее описать, как они объединяются и как контролируется статистическая ошибка. Если метрика выбрана только после просмотра результатов, её следует считать исследовательским сигналом и подтвердить в новом эксперименте.