В исследовании проверили 20 гипотез при уровне значимости 5%; одна дала p = 0,03. Можно ли объявить этот результат статистически значимым?
Нет, не автоматически. При множественной проверке гипотез значение p = 0,03 нужно оценивать с учётом числа проверок: иначе заметно возрастает вероятность получить хотя бы один ложноположительный результат. Следует заранее выбрать способ контроля множественных сравнений, например поправку Холма или контроль FDR.
Классический уровень значимости задаёт вероятность ложного отклонения одной истинной нулевой гипотезы. Когда один и тот же набор данных используют для множества проверок, эта гарантия уже не описывает вероятность ошибки во всей серии выводов.
Методы поправки появились для управления этим эффектом. Одни контролируют вероятность хотя бы одной ошибки первого рода во всём семействе проверок, другие ограничивают ожидаемую долю ложных открытий среди результатов, объявленных значимыми.
Если все 20 нулевых гипотез истинны, а проверки независимы, вероятность не получить ни одного случайного результата при уровне 5% равна 0,95 в каждой проверке. Вероятность хотя бы одного ложноположительного результата составляет примерно 1 − 0,95²⁰ = 64%.
Поэтому p = 0,03 может быть обычным случайным экстремальным результатом среди 20 попыток. Нельзя интерпретировать его как подтверждение эффекта без учёта того, сколько гипотез, подгрупп, метрик или вариантов анализа было просмотрено.
Сначала определяют семейство гипотез — набор проверок, по которым принимается общий вывод. Если важно не допустить хотя бы одного ложного открытия во всём семействе, применяют контроль FWER. Простая поправка Бонферрони делит исходный уровень значимости 0,05 на 20, поэтому порог становится 0,0025; результат с p = 0,03 его не проходит.
Поправка Холма также контролирует FWER, но обычно менее консервативна, чем простое деление всех p-значений на число проверок. Для большого исследовательского набора, где допускается ограниченная доля ложных открытий, может быть уместен контроль FDR, например процедура Бенджамини—Хохберга.
Выбор метода зависит от цели исследования. Для подтверждающего анализа с небольшим числом заранее определённых ключевых гипотез важен строгий контроль семейной ошибки; для разведочного анализа часто выбирают FDR, но результаты называют предварительными и проверяют на независимых данных.
Поправка не устраняет смещение, плохое качество данных или ошибочную постановку гипотезы. Также нельзя решать проблему постфактум, выбирая только удобное число проверок или меняя семейство гипотез после просмотра результатов; план анализа и правило коррекции желательно определить заранее.
Команда оценивает влияние продукта на 20 показателей поведения пользователей. Один показатель дал p = 0,03, а остальные — более высокие значения. Вариант без коррекции выглядит простым, но создаёт высокий риск представить случайную находку как эффект.
Применение Бонферрони хорошо защищает от хотя бы одного ложного открытия, однако может снизить мощность, особенно если показатели коррелированы. Поправка Холма сохраняет тот же строгий критерий ошибки, обычно теряя меньше мощности; FDR лучше подходит для поиска перспективных сигналов, но допускает некоторую долю ложных среди найденных эффектов.
Для продуктового решения команда применяет заранее выбранную процедуру Холма к 20 p-значениям. Результат с p = 0,03 не считается подтверждённым, поэтому его используют только как гипотезу для отдельного эксперимента. Это предотвращает дорогое масштабирование случайной закономерности и сохраняет найденный сигнал для последующей проверки.
Ответ: Нет. Сначала нужно определить, относятся ли проверки к одному семейству решений. Если исследователь заранее выделил одну первичную гипотезу, а остальные анализы объявил вторичными или разведочными, правила интерпретации могут различаться. Нельзя, однако, произвольно разделять проверки на семейства только для сохранения значимости; границы должны быть обоснованы предметной целью и планом анализа.
Ответ: FWER ограничивает вероятность хотя бы одного ложного открытия во всём семействе, поэтому он строгий и полезен в подтверждающих исследованиях. FDR ограничивает ожидаемую долю ложных открытий среди всех отклонённых нулевых гипотез; он обычно даёт больше обнаружений, но не гарантирует отсутствие даже одной ошибки. Выбор критерия — это компромисс между строгостью доказательства и количеством потенциально найденных эффектов.
Ответ: Нет. Скорректированное p-значение отвечает только на вопрос о совместимости данных с нулевой гипотезой после учёта множественных проверок. Для практического вывода нужны размер эффекта, доверительный интервал, исходная шкала измерения, стоимость ошибки, качество дизайна исследования и внешняя воспроизводимость результата. Большая выборка может сделать статистически значимым эффект, который практически неважен, а малая выборка — скрыть полезный эффект.