В прогнозе дохода модель обучалась на логарифме целевой величины, после чего средний прогноз вернули в исходную шкалу экспонентой. Какое искажение может возникнуть?
Простое применение экспоненты к среднему прогнозу в логарифмической шкале обычно занижает ожидаемый доход в исходной шкале. Причина — нелинейность экспоненты: в общем случае exp(E[log Y]) не равно E[Y]. Полученное значение ближе к геометрическому среднему, а не к арифметическому ожиданию дохода.
Логарифмирование целевой величины применяют, когда данные сильно скошены вправо, разброс увеличивается вместе с уровнем показателя или эффект естественно выражается в относительных изменениях. В такой шкале мультипликативные зависимости становятся ближе к аддитивным, а влияние крупных значений на обучение часто уменьшается.
После построения модели результат нужно интерпретировать в исходной шкале. Именно на этом этапе возникает проблема обратного преобразования: среднее после нелинейного преобразования не совпадает с преобразованием среднего.
Пусть модель оценивает ln(Y), где Y — положительный доход. Если взять среднее предсказанное значение в логарифмической шкале и применить к нему экспоненту, прогноз будет систематически ниже условного среднего E[Y | X], когда остаточная неопределённость ненулевая.
Такой дефект особенно важен для задач планирования выручки, расчёта ожидаемой ценности клиента и бюджетирования. Если прогноз нужен для оценки типичного клиента, смещение может быть приемлемым или даже желательным; если требуется суммарное ожидаемое значение, его нужно корректировать.
Пусть Z = ln(Y). Модель оценивает условное среднее E[Z | X]. Наивное обратное преобразование даёт exp(E[Z | X]). Но для выпуклой функции exp действует неравенство Йенсена: exp(E[Z | X]) ≤ E[exp(Z) | X] = E[Y | X]. Равенство возникает только при отсутствии остаточной вариативности или в отдельных специальных случаях.
Если логарифмические остатки приблизительно нормальны с дисперсией σ², то при известной или оценённой дисперсии можно использовать поправку exp(μ + σ² / 2), где μ — прогноз в логарифмической шкале. При неодинаковой дисперсии по группам нужна условная поправка, а не одна общая константа.
Более общий вариант — smearing-коррекция: вычислить среднее exp(eᵢ) по остаткам обучающей выборки и умножить на exp(прогноз в логарифмической шкале). Она не требует нормальности остатков, но предполагает, что распределение ошибок на новых данных сопоставимо с обучающим.
Следует заранее определить цель прогноза. Для медианного или «типичного» значения наивное обратное преобразование может быть разумным приближением, тогда как для математического ожидания, суммы прогнозов и экономических решений нужна калибровка в исходной шкале. Также необходимо проверять смещение по сегментам и зависимость дисперсии остатков от признаков.
Компания прогнозирует годовой доход клиента. Распределение дохода сильно скошено: небольшая доля клиентов приносит значительно больше остальных. Аналитик обучает модель на логарифме дохода и возвращает прогноз экспонентой.
Рассматривались два варианта. Наивное обратное преобразование просто и стабильно, но занижает ожидаемую выручку. Поправка через нормальность остатков учитывает дисперсию, однако чувствительна к неверному предположению о форме распределения. Smearing-коррекция гибче, но требует проверки стабильности остатков и может быть неточной при сильном сдвиге состава клиентов.
Для бюджетирования выбрали smearing-коррекцию, отдельно проверив её по сегментам и на отложенном периоде. Наивный прогноз оставили для сценариев, где нужен ориентир для типичного клиента, а скорректированный — для суммирования ожидаемой выручки. Такое разделение устранило смешение медианного и среднего прогноза.
Не всегда в каждой конкретной точке, но в среднем наивное преобразование среднего логарифма занижает условное среднее из-за выпуклости экспоненты. При конечной выборке дополнительное смещение может возникать из-за ошибок оценки коэффициентов, неправильной спецификации и изменения распределения данных. Поэтому проверять нужно не только теоретическое неравенство, но и калибровку на данных, близких к рабочим.
Если дисперсия логарифмических ошибок зависит от признаков, то величина корректирующего множителя тоже зависит от клиента или сегмента. Например, у крупных клиентов неопределённость может быть выше, чем у малых. Одна глобальная поправка тогда исправит средний уровень, но оставит систематическое смещение внутри сегментов.
Нужно оценивать качество в исходной шкале на отложенных данных: среднюю ошибку, смещение, калибровку сумм и ошибки по важным сегментам. Одновременно полезно отдельно оценить качество в логарифмической шкале, поскольку хорошая ошибка там не гарантирует хорошего прогноза арифметического среднего. Выбор метрики должен соответствовать бизнес-цели: типичному клиенту, индивидуальному прогнозу или суммарной выручке.