Сравните стандартный t-тест Стьюдента и тест Уэлча при сравнении средних двух независимых групп с заметно разными дисперсиями: какой вариант предпочтительнее и почему?
При заметно различающихся дисперсиях предпочтителен тест Уэлча. Он не требует предположения о равенстве дисперсий и корректирует стандартную ошибку и число степеней свободы, поэтому обычно лучше контролирует ошибку первого рода при неодинаковой вариативности групп.
Классический двухвыборочный t-тест Стьюдента в своей исходной форме предполагает, что сравниваемые группы имеют одинаковые дисперсии. Это позволяет объединить оценки вариативности групп в одну общую оценку.
На практике дисперсии часто различаются: например, у опытных клиентов расходы могут быть значительно более неоднородными, чем у новых. Тест Уэлча был разработан как способ сравнивать средние без обязательного предположения о равенстве дисперсий.
Если применить стандартный t-тест при сильно разных дисперсиях, особенно при неодинаковых размерах групп, рассчитанная статистика и p-value могут быть некорректными. Риск зависит от того, какая группа больше и какая из них обладает большей дисперсией.
В результате можно получить слишком частые ложноположительные выводы или, наоборот, потерять чувствительность теста. Само по себе различие дисперсий не доказывает различие средних, поэтому сначала нужно разделять вопрос о среднем уровне и вопрос о вариативности.
Стандартный t-тест использует объединённую оценку дисперсии, фактически предполагая общую дисперсию в обеих группах. Тест Уэлча оценивает вклад каждой группы отдельно: большая дисперсия и меньший размер выборки увеличивают неопределённость оценки соответствующего среднего сильнее.
Кроме того, у теста Уэлча число степеней свободы рассчитывается с поправкой и обычно не является простым целым числом. Это делает критические значения более консервативными в ситуациях, где неравенство дисперсий действительно важно.
Перед выбором теста следует проверить условия анализа:
Тест Уэлча не решает проблему зависимых наблюдений, выбросов или неверного определения единицы анализа. Если один пользователь представлен множеством событий, нельзя считать эти события независимыми только потому, что тест Уэлча допускает разные дисперсии.
При больших выборках тест Уэлча часто является безопасным выбором по умолчанию для сравнения средних двух независимых групп. Однако статистическая значимость не показывает размер или практическую ценность различия: вместе с p-value нужно приводить оценку разницы и доверительный интервал.
Аналитик сравнивает средний чек в двух независимых группах клиентов. В контрольной группе много наблюдений с близкими значениями, а в тестовой есть небольшой, но существенно более неоднородный сегмент клиентов; размеры групп также различаются.
Рассматривались три варианта. Стандартный t-тест прост, но опирается на равенство дисперсий. Непараметрический тест может быть полезен при проблемах с распределением, но проверяет не то же самое, что разницу средних, поэтому его интерпретация для среднего чека менее прямая. Бутстрэп может дать доверительный интервал, но требует аккуратного выбора процедуры и проверки устойчивости при малом числе наблюдений или тяжёлых хвостах.
Был выбран тест Уэлча, потому что бизнес-вопрос касался именно разницы средних, группы были независимыми, а дисперсии заметно различались. В отчёте дополнительно указали разницу средних, доверительный интервал и анализ влияния экстремальных чеков. Это позволило не только принять или отвергнуть нулевую гипотезу, но и оценить диапазон практически возможного эффекта.
Да, для двух независимых групп это обычно допустимо. При равных дисперсиях тест Уэлча обычно даёт близкий результат к классическому t-тесту, но не требует предварительного решения о равенстве дисперсий. Поэтому его часто используют как устойчивый вариант по умолчанию.
Это не означает, что выбор теста становится неважным при любых данных. Независимость наблюдений, качество измерений, выбросы и форма распределения могут оказать большее влияние, чем различие между двумя вариантами t-теста.
Такой двухшаговый подход добавляет неопределённость и может ухудшить контроль ошибки: сначала данные используются для выбора модели, а затем результат проверяется так, будто выбор не зависел от данных. Кроме того, тесты дисперсий чувствительны к размеру выборки и отклонениям от предположений.
Практичнее заранее выбрать метод, устойчивый к неодинаковым дисперсиям, либо обосновать модель на основании предметной области и диагностик. Для сравнения двух независимых средних таким методом часто является тест Уэлча.
Сначала нужно определить, действительно ли среднее является нужной бизнес-метрикой. Если да, можно рассмотреть преобразование, например логарифмическое, устойчивые методы, бутстрэп доверительного интервала или модель, соответствующую природе данных.
Тест Уэлча учитывает неодинаковые дисперсии, но не делает любые данные нормальными и не устраняет влияние экстремальных наблюдений. Поэтому вывод следует проверить альтернативным анализом и явно описать, как выбросы и асимметрия влияют на оценку разницы.