Объясните механизм: почему увеличение объёма случайной выборки обычно сужает доверительный интервал оценки?
При прочих равных условиях увеличение объёма случайной выборки уменьшает стандартную ошибку оценки примерно пропорционально обратному квадратному корню из размера выборки. Поэтому доверительный интервал становится уже: оценка основана на большем количестве независимой информации. Это не устраняет систематическое смещение и не гарантирует рост точности при плохом дизайне исследования.
Доверительные интервалы появились как инструмент интервального оценивания, чтобы показывать не только точечную оценку параметра, но и неопределённость этой оценки. Такой подход решал проблему чрезмерно уверенной интерпретации одного числа, например среднего значения или доли.
В классической статистике ширина интервала связывает вариативность данных, объём выборки и выбранный уровень доверия. Это позволяет отделять естественный статистический шум от ограничений самой процедуры измерения.
Предположим, аналитик оценил средний чек по небольшой выборке и получил одно число. Если повторить отбор клиентов, результат будет меняться из-за случайного состава выборки. Интервал должен отражать масштаб таких колебаний.
Если интервал слишком широк, вывод недостаточно точен для принятия решения. Если его искусственно сузить без увеличения информации, можно создать ложное ощущение точности и принять решение на основе неустойчивой оценки.
Для среднего значения стандартная ошибка при независимых наблюдениях имеет вид:
Доверительный интервал обычно строится как точечная оценка плюс-минус критический коэффициент, умноженный на стандартную ошибку. Поэтому увеличение размера выборки с 100 до 400 наблюдений при неизменной вариативности уменьшает стандартную ошибку примерно в два раза, а не в четыре.
Механизм основан на усреднении независимого случайного шума: положительные и отрицательные отклонения частично компенсируют друг друга. Чем больше независимых наблюдений, тем стабильнее среднее или доля.
Это правило работает при важных предпосылках: выборка должна быть достаточно репрезентативной, наблюдения — корректно определёнными, а зависимость между ними — учтённой. Если данные кластеризованы, например несколько наблюдений принадлежат одному клиенту, эффективный объём выборки меньше фактического.
Увеличение выборки не исправляет систематическое смещение. Если в опрос попадают только добровольные респонденты, добавление новых добровольцев может сделать интервал уже, но не приблизить оценку к истинному параметру. Аналогично, дополнительная точность не компенсирует ошибки измерения или неверное определение целевой совокупности.
Ширина интервала также зависит от уровня доверия: переход к более высокому уровню доверия делает интервал шире. Для конечной совокупности, сравнимой по размеру с выборкой, может применяться поправка на конечную совокупность; при малой доле выборки её обычно можно не учитывать.
Команда оценивает долю успешных доставок. В первой выборке 400 заказов дают достаточно широкий интервал, поэтому нельзя уверенно определить, соответствует ли показатель целевому уровню.
Рассматривались два варианта. Можно было просто собрать ещё заказы: это уменьшает случайную неопределённость, но стоит времени и денег. Можно было сузить интервал, изменив метод расчёта или выбрав более высокий риск ошибки: это дешевле, но создаёт некорректную уверенность и не повышает качество данных.
Выбрали увеличение выборки по заранее определённому плану и одновременно проверили, что заказы равномерно покрывают регионы и периоды времени. В результате интервал сузился за счёт роста независимой информации, а проверка дизайна снизила риск того, что точная оценка будет систематически смещённой.
Нет. Оно обычно уменьшает случайную ошибку, но не устраняет смещение. Если выборка систематически отличается от целевой совокупности, можно получить очень узкий интервал вокруг неправильного значения.
Например, измерение удовлетворённости только среди пользователей, которые добровольно оставили отзыв, может быть смещённым. Больший объём таких отзывов повышает внутреннюю стабильность оценки, но не делает её автоматически репрезентативной.
Потому что стандартная ошибка уменьшается пропорционально квадратному корню из объёма выборки. При увеличении размера в четыре раза квадратный корень увеличивается в два раза, поэтому стандартная ошибка и примерно ширина интервала уменьшаются в два раза.
Это создаёт убывающую отдачу: для следующего заметного уменьшения ширины интервала требуется непропорционально больше наблюдений. Поэтому размер выборки выбирают с учётом требуемой точности и стоимости сбора данных.
Фактическая информация окажется меньше, чем предполагает простое использование числа строк. Например, тысяча заказов от небольшого числа клиентов может содержать меньше независимой информации, чем тысяча заказов от разных клиентов.
Если зависимость игнорировать, стандартная ошибка часто будет занижена, а доверительный интервал — неоправданно узок. Нужно учитывать структуру данных: применять кластеризацию, иерархическую модель или другой метод, соответствующий способу формирования наблюдений.