Для чего в бутстрэп-выборке пересэмплируют наблюдения с возвращением?
Пересэмплирование с возвращением нужно, чтобы имитировать множество новых выборок из исходной эмпирической выборки и оценить изменчивость статистики. В каждой бутстрэп-выборке сохраняют исходный размер данных, но одни наблюдения могут попасть несколько раз, а другие — не попасть вовсе. Так приближённо получают распределение выборочной статистики без явного вывода её формулы.
Бутстрэп появился как вычислительный способ оценивать стандартные ошибки, доверительные интервалы и устойчивость оценок, когда аналитическая формула распределения статистики сложна или неизвестна. Подход использует саму выборку как приближение генеральной совокупности и многократно моделирует возможные повторные выборки.
Он особенно полезен для медиан, квантилей, сложных метрик и других статистик, для которых простые нормальные приближения могут быть ненадёжны.
Пусть аналитик вычислил среднее, медиану или разницу метрик, но не знает, насколько эта оценка зависит от конкретного состава наблюдений. Одного значения статистики недостаточно: нужно оценить её выборочную изменчивость, чтобы построить интервал неопределённости или сравнить результаты.
Если просто переставлять имеющиеся значения без возвращения, состав каждой новой выборки не изменится. Это не создаёт реалистичной вариативности между повторными выборками и поэтому не позволяет корректно приблизить распределение оценки.
Сначала из исходных данных размера n случайно выбирают n наблюдений с возвращением. После каждого выбора наблюдение возвращается в исходный набор, поэтому оно может быть выбрано снова. В результате в одной бутстрэп-выборке появляются повторы, а часть исходных наблюдений отсутствует.
Для каждой такой выборки вычисляют интересующую статистику. Множество полученных значений образует приближённое бутстрэп-распределение статистики: по нему можно оценить стандартную ошибку, смещение или построить доверительный интервал.
Возвращение важно потому, что оно соответствует повторной выборке из эмпирического распределения. Без возвращения получались бы лишь перестановки исходных данных, а не новые выборки с возможным изменением их состава.
Бутстрэп не устраняет систематическое смещение исходных данных. Если выборка нерепрезентативна, содержит зависимые наблюдения или получена с сильным отбором, пересэмплирование обычно воспроизводит эту проблему, а не исправляет её.
Способ пересэмплирования должен соответствовать структуре данных. Для временных рядов могут требоваться блоки наблюдений, для данных с несколькими строками на клиента — выбор клиентов, а не отдельных строк. Интервалы также зависят от метода построения: процентильный, базовый и BCa-варианты имеют разные свойства и предпосылки.
Аналитик оценивает среднюю выручку на клиента после запуска нового тарифа. В данных есть несколько клиентов с очень крупными платежами, поэтому среднее заметно меняется при исключении отдельных наблюдений.
Рассматривались два варианта. Использовать нормальную аппроксимацию быстро и просто, но она может плохо описывать асимметричное распределение. Пересэмплировать отдельные транзакции технически легко, однако это искусственно нарушило бы независимость строк одного клиента и занизило бы неопределённость.
Выбрали кластерный бутстрэп: на каждой итерации с возвращением выбирали клиентов, а затем включали все их транзакции. Это сохранило зависимость операций внутри клиента и показало широкий, асимметричный интервал для среднего. В результате команда не ограничилась формальным сравнением точечных средних и учла риск того, что эффект определяется небольшим числом крупных клиентов.
Почему размер бутстрэп-выборки обычно равен размеру исходной?
Такой размер имитирует повторное получение выборки из той же генеральной совокупности. Если брать существенно меньше наблюдений, оценка вариативности будет относиться к выборкам меньшего объёма; если больше — к другой статистической задаче. Само равенство размеров не является абсолютным законом, но это стандартная схема для оценки свойств исходной оценки.
Почему примерно 63% уникальных наблюдений попадает в одну бутстрэп-выборку?
Для отдельного наблюдения вероятность не быть выбранным за n попыток равна ( (1 - 1/n)^n ), что при большом n приближается к (e^{-1}). Поэтому вероятность попасть хотя бы один раз приближается к (1 - e^{-1}), то есть примерно к 63%. Остальные наблюдения представлены повторами, и именно такая структура создаёт вариативность между бутстрэп-выборками.
Можно ли бутстрэпом доказать причинный эффект?
Нет. Бутстрэп оценивает неопределённость выбранной статистики при условии, что исходные данные и схема наблюдения корректны. Он не устраняет конфаундинг, смещение отбора, ошибки измерения или нарушение рандомизации. Поэтому бутстрэп может уточнить интервал оценки эффекта в эксперименте, но не превращает наблюдательную связь в причинный вывод.