Рассмотрите расчёт дисперсии после заполнения пропусков средним значением. Какой систематический эффект возникнет в результате такой замены?
WITH data(x) AS (
VALUES (10), (12), (14), (NULL), (NULL)
)
SELECT
VAR_SAMP(x) AS variance_before,
VAR_SAMP(COALESCE(x, (SELECT AVG(x) FROM data))) AS variance_after
FROM data;
Заполнение пропусков средним обычно занижает дисперсию и делает распределение искусственно сконцентрированным около среднего. В результате стандартные ошибки и доверительные интервалы могут оказаться слишком маленькими, а статистические тесты — чрезмерно оптимистичными.
В запросе AVG(x) игнорирует NULL, поэтому оба пропуска заменяются значением 12. Два дополнительных наблюдения в центре распределения уменьшают разброс по сравнению с анализом только исходных наблюдений.
Простая импутация средним появилась как удобный способ не терять строки при анализе неполных данных. Полный анализ только наблюдений без пропусков может резко уменьшить выборку и внести смещение, если пропуски распределены неслучайно.
Однако среднее значение заменяет неизвестное наблюдение не случайным возможным значением, а одной и той же точкой. Такой подход сохраняет приблизительный уровень среднего, но плохо передаёт неопределённость и структуру разброса данных.
После импутации средним размер набора данных формально увеличивается, но реальной информации не добавляется. Если пропусков много, искусственно созданные значения могут существенно изменить дисперсию, корреляции, квантили и результаты проверки гипотез.
Особенно опасно использовать такой набор для оценки доверительных интервалов или построения моделей, где недооценённая вариативность приводит к слишком уверенным выводам. Сохранение среднего после импутации не означает сохранения корректного распределения.
VAR_SAMP(x) в первой колонке рассчитывается только по пяти ненулевым значениям из исходной таблицы — фактически по трём наблюдениям. Во второй колонке пропуски заменяются средним 12, поэтому набор становится эквивалентен значениям 10, 12, 14, 12, 12.
Дисперсия уменьшается, потому что импутированные значения не добавляют нового разброса. Более того, в распределении возникает искусственная мода в точке среднего, которой могло не быть в реальных данных.
Средняя импутация допустима лишь как простой ориентир или при специальных условиях, когда пропуски не несут существенной информации и задача не требует корректной оценки дисперсии. Для аналитики обычно рассматривают следующие альтернативы:
Метод выбирают с учётом механизма пропусков: MCAR, MAR или MNAR. Если вероятность пропуска зависит от ненаблюдаемого самого значения, одной механической заменой проблему нельзя устранить; нужны анализ чувствительности и явные допущения.
В отчёте по времени доставки 35% значений отсутствовали преимущественно у заказов, оформленных через партнёрский канал. Аналитик заменил пропуски общим средним и получил небольшую дисперсию, после чего канал выглядел стабильнее остальных.
Рассматривались три варианта. Удаление строк было прозрачным, но исключало значительную часть партнёрских заказов. Заполнение медианой сохраняло объём данных и снижало влияние выбросов, но тоже искусственно сужало распределение. Множественная импутация с учётом канала, региона и типа доставки была сложнее, зато отражала неопределённость.
Выбрали множественную импутацию и отдельно показали долю пропусков по каналам. Итоговый отчёт содержал диапазон результатов по нескольким импутированным наборам, поэтому вывод о стабильности канала не зависел от единственного искусственного значения.
1. Сохраняет ли средняя импутация несмещённую оценку среднего?
Не всегда. Если пропуски возникают полностью случайно и среднее вычислено по репрезентативным наблюдаемым значениям, оценка среднего может выглядеть приемлемо. При зависимости пропусков от сегмента, времени или самого значения средняя импутация обычно создаёт смещение.
Даже при сохранении среднего она не сохраняет корректную дисперсию и взаимосвязи между признаками. Поэтому отсутствие явного смещения среднего не делает метод универсально корректным.
2. Можно ли после средней импутации использовать обычный t-тест?
Без дополнительных корректировок это рискованно. Тест будет воспринимать одинаковые импутированные значения как независимые реальные наблюдения и может недооценить стандартную ошибку.
Если импутация используется, неопределённость нужно учитывать в процедуре анализа. Один из подходов — множественная импутация с проведением теста в каждом наборе и последующим объединением оценок по правилам, учитывающим вариацию между импутациями.
3. Почему для прогнозной модели средняя импутация иногда всё же приемлема?
В прогнозировании целью может быть качество предсказаний, а не восстановление истинного распределения или причинный вывод. Простая импутация может дать приемлемый результат, если доля пропусков мала, механизм пропусков стабилен, а валидация выполняется корректно.
Но среднее для импутации нужно вычислять только по обучающей выборке. Использование всей выборки до разделения на обучение и тест раскрывает информацию о тесте и создаёт утечку данных. Даже в прогнозной задаче следует сравнить этот вариант с более подходящими методами на отложенной выборке.