Что означает 95%-й доверительный интервал для оценки параметра?
95%-й доверительный интервал означает, что при многократном повторении выборки и построении интервалов одним и тем же корректным методом примерно 95% таких интервалов накрывали бы истинное значение параметра. Это не означает, что после получения конкретного интервала вероятность попадания параметра внутрь равна 95%.
Доверительные интервалы появились как способ показывать не только точечную оценку, но и неопределённость, вызванную случайностью выборки. Исходная проблема заключалась в том, что одно наблюдаемое значение оценки не показывает, насколько оно могло бы измениться при другой выборке.
Подход основан на частотной интерпретации вероятности: параметр считается фиксированным, а случайность относится к процедуре формирования выборки и самого интервала.
Допустим, по выборке оценили разницу конверсий между двумя вариантами и получили интервал от минус 0,5 до 4,5 процентного пункта. Неверно сразу говорить, что истинная разница с вероятностью 95% находится внутри этого конкретного интервала.
Корректность интервала зависит от дизайна исследования, независимости наблюдений, способа расчёта стандартной ошибки и других предположений. Если выборка смещена или наблюдения зависимы, заявленный уровень покрытия может не соответствовать реальному.
При многократном повторении эксперимента истинный параметр остаётся одним и тем же, а выборочные данные меняются. Поэтому каждый раз получается новый интервал. Метод называется 95%-м, если доля интервалов, содержащих истинный параметр, стремится к 95% при большом числе повторений.
Для уже построенного интервала в частотной статистике нельзя приписывать параметру случайную вероятность. Параметр рассматривается как фиксированное неизвестное значение, а интервал — как результат случайной процедуры. В прикладном языке допустимо сказать, что данные совместимы со значениями параметра внутри интервала при выбранном методе и его предположениях.
Ширина интервала отражает неопределённость оценки. Она обычно уменьшается при увеличении объёма независимой информации и увеличивается при большей вариативности данных или более высоком требуемом уровне покрытия.
Интервал не доказывает истинность всех значений внутри него и не делает одинаково правдоподобными его границы. Если нужен вероятностный вывод именно о параметре после получения данных, используют байесовский достоверный интервал, но его смысл основан на другой статистической модели и априорном распределении.
Команда сравнила удержание пользователей через 30 дней. Оценённая разница составила 2 процентных пункта, а 95%-й доверительный интервал — от минус 0,5 до 4,5 процентного пункта.
Первый вариант — объявить победу по точечной оценке. Его плюс — простота, но он игнорирует неопределённость и риск случайного результата. Второй вариант — объявить эксперимент безрезультатным только потому, что интервал пересекает ноль. Это тоже чрезмерно сильный вывод: данные не исключают полезный эффект, но и не подтверждают его с требуемой точностью.
Корректное решение — сообщить оценку и весь интервал, а затем сопоставить его с практически значимым порогом. Если запуск допустим только при эффекте не менее 3 процентных пунктов, текущих данных недостаточно для уверенного решения; можно продолжить сбор данных или выбрать действие с учётом стоимости ошибки. Такой вывод сохраняет информацию о размере эффекта и его неопределённости.
1. Чем отличается доверительный интервал от вероятностного утверждения о параметре?
В частотной интерпретации после расчёта интервала параметр не становится случайным. Утверждение о 95% относится к долгосрочной доле успешных интервалов при повторении процедуры, а не к вероятности для одного уже полученного интервала.
2. Что означает пересечение доверительного интервала с нулём?
Это означает, что нулевое значение совместимо с данными на выбранном уровне покрытия и при использованном методе. Такой результат не доказывает отсутствие эффекта: интервал может включать и ноль, и практически важные положительные или отрицательные значения из-за недостаточной точности оценки.
3. Можно ли сравнивать ширину интервалов, построенных разными методами?
Сравнивать их напрямую следует осторожно. Методы могут опираться на разные предположения, учитывать зависимость наблюдений по-разному и иметь различное фактическое покрытие. Узкий интервал не обязательно лучше: если модель неверна или стандартная ошибка занижена, высокая точность может быть лишь видимой.