АналитикаАнализ данныхПродуктовый аналитик

Эксперимент не выявил статистически значимого различия между вариантами. Как проверить, что варианты практи...

Эксперимент не выявил статистически значимого различия между вариантами. Как проверить, что варианты практически эквивалентны?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Отсутствие статистически значимого различия не доказывает эквивалентность вариантов: данных может быть недостаточно. Для проверки эквивалентности заранее задают допустимую границу отличия и применяют тест эквивалентности, обычно процедуру TOST. Варианты считаются практически эквивалентными, если доверительный интервал для разницы целиком находится внутри заданного диапазона допустимых отклонений.

Исторический контекст

Классическая проверка гипотез отвечает на вопрос, достаточно ли свидетельств против точного равенства или другой нулевой гипотезы. Такой подход плохо подходит для ситуаций, где важно подтвердить, что новый вариант не хуже старого более чем на приемлемую величину.

Тесты эквивалентности появились как решение этой проблемы в задачах, где требуется показать сопоставимость методов, препаратов, измерений или вариантов продукта. Их ключевая идея состоит в том, что нулевая гипотеза описывает не равенство, а практически значимое различие.

Постановка проблемы

Пусть δ — разница метрик нового и базового варианта, а Δ — заранее заданная практически допустимая граница. Например, для конверсии бизнес может считать приемлемым отклонение не более одного процентного пункта: тогда Δ = 1 п.п.

Обычный результат с p-value выше уровня значимости означает только, что данных недостаточно для отклонения гипотезы о нулевой разнице. Он не исключает заметного эффекта, особенно при маленькой выборке или высокой вариативности.

При неверном выводе команда может принять вариант с потенциально существенным ухудшением или, наоборот, отказаться от безопасной замены из-за недостаточной мощности обычного теста.

Подробное решение

Для эквивалентности формулируют гипотезы:

  • нулевая гипотеза: δ ≤ −Δ или δ ≥ Δ, то есть варианты различаются не менее чем на практически значимую величину;
  • альтернативная гипотеза: −Δ < δ < Δ, то есть разница находится внутри допустимого диапазона.

Процедура TOST фактически выполняет две односторонние проверки: что новый вариант не хуже базового больше чем на Δ и что он не лучше базового больше чем на Δ. Эквивалентность подтверждается только при отклонении обеих частей нулевой гипотезы.

Эквивалентный практический критерий: заранее выбранный двусторонний доверительный интервал для δ должен полностью лежать внутри интервала [−Δ; Δ]. Если интервал пересекает границу, данных недостаточно для вывода об эквивалентности.

Границу Δ нельзя выбирать после просмотра результатов. Её обосновывают бизнес-последствиями, исторической вариативностью метрики, минимальным практически значимым эффектом и стоимостью ошибки. Слишком широкая граница позволит объявить эквивалентными действительно разные варианты, а слишком узкая потребует чрезмерной выборки.

Для долей важно заранее определить шкалу сравнения: абсолютная разница в процентных пунктах и относительная разница отвечают на разные вопросы. Для метрик с ограничениями или сильной асимметрией могут потребоваться преобразования, робастные методы или моделирование. Расчёт размера выборки также должен быть выполнен именно для теста эквивалентности, поскольку обычная мощность теста на обнаружение эффекта не гарантирует достаточную способность подтвердить эквивалентность.

Ситуация из практики

Команда заменяет старый экран приложения новым. Для конверсии в покупку заранее установлено, что снижение не более чем на 1 процентный пункт приемлемо, а улучшение более чем на 1 процентный пункт также считается уже не эквивалентностью, а значимым отличием.

Можно было бы применить обычный тест и получить p-value выше 0,05. Его преимущество — простота и привычность, но он не подтверждает безопасность замены. Можно было бы ориентироваться только на точечную оценку разницы, однако она игнорирует неопределённость.

Команда использует тест эквивалентности. Полученная разница составляет 0,1 п.п., а 90%-й доверительный интервал равен от −0,4 до 0,6 п.п. Интервал полностью находится между −1 и 1 п.п., поэтому варианты признаются практически эквивалентными, и новый экран можно раскатывать при условии отсутствия других рисков.

Если бы интервал составлял от −1,3 до 0,6 п.п., вывод об эквивалентности был бы недопустим: возможное ухудшение выходит за установленную границу. Это не означает, что новый экран обязательно хуже; означает лишь, что данных недостаточно для подтверждения требуемой эквивалентности.

Что кандидаты часто упускают

  1. Чем тест эквивалентности отличается от обычного теста с высоким p-value?

Высокое p-value в обычном тесте означает отсутствие достаточных оснований отвергнуть нулевую гипотезу о точном равенстве. Оно не доказывает, что реальная разница мала. В тесте эквивалентности нулевая гипотеза утверждает наличие различия не меньше заданной границы, поэтому её отклонение при достаточной мощности поддерживает вывод о практически малой разнице.

  1. Что произойдёт, если границу эквивалентности выбрать после эксперимента?

Вывод станет зависеть от наблюдённых данных: границу можно неявно подобрать так, чтобы интервал оказался внутри неё. Это повышает риск ложного подтверждения эквивалентности и нарушает заранее заданный статистический план. Границу следует определить до анализа и документировать её бизнес-обоснование.

  1. Можно ли использовать тест эквивалентности, если доверительный интервал широкий?

Обычно нет. Даже если точечная оценка близка к нулю, широкий интервал может включать практически значимое ухудшение или улучшение. В такой ситуации корректный вывод — недостаточно данных для подтверждения эквивалентности; нужно увеличить выборку, снизить вариативность измерения или пересмотреть дизайн эксперимента, но не объявлять варианты эквивалентными по одной точечной оценке.