Объясните механизм: на каком условии основана перестановочная проверка гипотезы в рандомизированном эксперименте?
Перестановочная проверка гипотезы основана на обменности меток групп при верной нулевой гипотезе и корректной рандомизации. Если назначение в группы действительно случайно, то при отсутствии эффекта можно многократно перераспределять метки групп в соответствии с дизайном эксперимента и получать нулевое распределение статистики.
Наблюдаемое значение сравнивают с этим распределением. Доля перестановок со статистикой не менее экстремальной, чем наблюдаемая, служит перестановочным p-value.
Перестановочные методы появились как способ проверять гипотезы без жёсткого предположения о конкретном распределении данных, например о нормальности. Исходная проблема заключалась в том, что параметрические критерии могут быть чувствительны к неверно выбранной модели распределения.
В рандомизированных экспериментах такой подход особенно естественен: случайное назначение групп само задаёт механизм формирования нулевого распределения. Поэтому вывод опирается не только на свойства метрики, но и на дизайн эксперимента.
Предположим, пользователей случайно распределили в контрольную и тестовую группы, а затем сравнили средний доход. Распределение дохода может быть сильно асимметричным, содержать много нулей и редкие очень крупные значения.
Если применить критерий, требующий приблизительной нормальности, можно получить ненадёжный уровень ошибки первого рода или низкую устойчивость к выбросам. Перестановочный подход позволяет оценить, насколько необычна наблюдаемая разница при сохранении фактических значений метрики и случайном назначении групп.
Однако простое перемешивание строк допустимо не всегда. Нельзя независимо переставлять пользователей, если рандомизация выполнялась по кластерам, блокам или парам: схема перестановок должна повторять реальный механизм назначения.
При нулевой гипотезе отсутствия эффекта значения исхода не зависят от того, какая метка группы им присвоена. Это и есть условие обменности: при фиксированных наблюдениях допустимые назначения групп считаются равноправными согласно плану рандомизации.
Алгоритм состоит из следующих шагов:
Метод не требует нормальности исходной метрики, но это не означает полной независимости от предположений. Нужны корректная рандомизация, независимость единиц на уровне, где выполняется перестановка, и заранее выбранная статистика.
Точная интерпретация обычно относится к строгой нулевой гипотезе: эффект отсутствует у каждого объекта. Нулевая гипотеза о нулевом среднем эффекте является более слабой; наивное перемешивание групп может не давать точного уровня значимости для неё, особенно при разной дисперсии или неоднородных эффектах. В таких случаях применяют, например, устойчивые или студентизированные статистики и учитывают свойства конкретного дизайна.
Перестановочный p-value не показывает вероятность нулевой гипотезы и не измеряет размер эффекта. Он отвечает на более узкий вопрос: насколько часто при принятой нулевой модели и схеме рандомизации возникла бы статистика, не менее экстремальная наблюдаемой.
В эксперименте над подпиской доход на пользователя имел много нулевых значений и несколько крупных платежей. Команда рассматривала три варианта: обычный t-тест, сравнение медиан перестановочным тестом и перестановочный тест для заранее выбранной разницы средних.
t-тест был прост и давал удобную интерпретацию, но зависел от приближений, которые плохо соответствовали форме данных. Медиана была устойчивее к крупным платежам, однако могла не отражать бизнес-эффект, если редкие покупки существенны для выручки.
Выбрали перестановочную проверку разницы средних с перестановкой пользовательских меток, поскольку пользователи были рандомизированы независимо, а средний доход был основной метрикой. В отчёте отдельно указали размер эффекта и доверительный интервал, а p-value использовали только для оценки совместимости результата с нулевой гипотезой.
Если бы рандомизация проводилась по регионам, переставлять метки отдельных пользователей было бы ошибкой. В этом случае перестановки выполняли бы на уровне регионов либо применяли метод, учитывающий кластерную структуру.
1. Допустимо ли свободно перемешивать метки групп, если эксперимент проводился с блокировкой?
Нет. При блокированной рандомизации метки можно переставлять только внутри соответствующих блоков, если именно так формировались случайные назначения. Свободное перемешивание разрушает дизайн эксперимента и создаёт неправильное нулевое распределение, поэтому p-value может иметь неверный уровень ошибки первого рода.
2. Заменяет ли перестановочный тест оценку размера эффекта и доверительного интервала?
Нет. Перестановочный тест в первую очередь проверяет согласованность данных с нулевой гипотезой. Он не сообщает, насколько эффект велик или полезен для бизнеса, поэтому вместе с ним нужно показывать оценку эффекта, интервал неопределённости и заранее заданный критерий практической значимости.
3. Можно ли считать перестановочный тест универсальным решением для зависимых наблюдений?
Нет. Зависимые наблюдения требуют перестановок на уровне независимых единиц или специальной схемы, сохраняющей зависимость. Например, при нескольких сессиях одного пользователя перестановка каждой сессии отдельно искусственно увеличит число независимых наблюдений и может сделать результат чрезмерно значимым.