В данных о доходах пропуски чаще встречаются у клиентов с низким доходом. Как это повлияет на оценку среднего дохода?
Оценка среднего дохода по наблюдаемым значениям, скорее всего, будет завышена: низкие доходы представлены в выборке реже, чем высокие. Это пример систематического пропуска данных, при котором простое исключение строк не является нейтральным и может исказить выводы.
Методы анализа пропусков появились из-за того, что удаление неполных наблюдений часто меняет состав выборки. Если вероятность пропуска не зависит от характеристик наблюдения, такой подход может быть приемлемым, но при зависимости от самого значения или связанных с ним факторов возникает смещение.
Для описания механизма используют категории MCAR, MAR и MNAR. При MCAR пропуск случаен, при MAR он объясняется наблюдаемыми признаками, а при MNAR вероятность пропуска зависит от ненаблюдаемого значения или от факторов, которые не полностью учтены в данных.
Если клиенты с низким доходом чаще не указывают его, то среди заполненных анкет доля обеспеченных клиентов становится выше реальной. Среднее по заполненным значениям будет отражать не всю целевую совокупность, а смещённую подвыборку.
Последствия зависят от задачи: можно завысить средний доход, неверно оценить сегменты, ошибиться в прогнозе спроса и принять неправильное решение о продукте или маркетинговом бюджете. Чем сильнее различается вероятность ответа между группами и чем выше доля пропусков, тем существеннее потенциальное смещение.
Сначала нужно сравнить долю пропусков по доступным признакам: возрасту, региону, каналу привлечения, типу клиента и другим характеристикам. Если пропуски связаны с наблюдаемыми факторами, можно использовать взвешивание по вероятности ответа, стратификацию или множественную импутацию, включив в модель причины пропуска и связанные с доходом переменные.
Простая замена пропусков общим средним обычно не решает проблему: она уменьшает разброс и может исказить взаимосвязи между доходом и другими признаками. Удаление строк допустимо только при обоснованном предположении о механизме пропусков и приемлемой доле таких строк.
Если пропуск зависит именно от неизвестного значения дохода, это случай, близкий к MNAR. По одним только наблюдаемым данным такой механизм обычно нельзя надёжно проверить, поэтому нужны анализ чувствительности, внешние источники, дополнительные вопросы в анкете или сценарные оценки при разных предположениях.
Важно разделять оценку среднего и причинные выводы. Даже корректное восстановление распределения доходов может не сделать анализ причинно-следственным, если данные получены неслучайно или есть другие источники смещения.
Компания оценивает доход клиентов для планирования премиального тарифа. В анкете доход не указали 35% клиентов, причём пропуски особенно часты у пользователей бесплатного тарифа и в регионах с более низкой покупательной способностью.
Рассматривались три варианта. Удаление пропусков было простым, но завышало оценку среднего дохода. Подстановка общего среднего сохраняла размер выборки, однако занижала дисперсию и скрывала различия между сегментами. Множественная импутация с учётом тарифа, региона, активности и истории покупок лучше использовала доступную информацию, но требовала проверки модели и анализа чувствительности.
Выбрали множественную импутацию вместе с отдельным сравнением результатов на заполненных данных и при консервативных сценариях для пропущенных доходов. Решение о запуске тарифа приняли только после того, как вывод сохранялся в большинстве сценариев; это снизило риск ориентироваться на завышенную оценку платёжеспособности.
Нет, как правило, нельзя надёжно доказать это только по заполненным значениям. Можно обнаружить связи пропусков с наблюдаемыми признаками, но зависимость от самого пропущенного дохода остаётся ненаблюдаемой. Поэтому используют содержательное обоснование, внешние данные и анализ чувствительности к разным предположениям.
Индикатор показывает, что значение отсутствует, и может быть полезным признаком в прогнозной модели. Но он не восстанавливает распределение пропущенных доходов и не устраняет смещение в описательной статистике. Для оценки среднего нужны модель пропуска, корректные веса, импутация или дополнительные данные.
Если вероятность ответа оценена по неполному набору причин пропуска или некоторые группы представлены крайне редко, веса становятся нестабильными. Несколько наблюдений с очень большими весами могут резко увеличить дисперсию оценки. Поэтому проверяют перекрытие групп, ограничивают или стабилизируют веса и сопоставляют результат с альтернативными методами и сценариями.