В отчёте средняя длительность сессии выросла после релиза, но медиана снизилась. Какой механизм может объяс...

В отчёте средняя длительность сессии выросла после релиза, но медиана снизилась. Какой механизм может объяснить это расхождение?

Проходите собеседования с ИИ помощником Hintsage

Краткий ответ

Расхождение может возникнуть из-за правого хвоста распределения: небольшое число пользователей стало проводить в продукте аномально много времени и подняло среднее, тогда как у большинства длительность сессии сократилась. Поэтому среднее без анализа распределения не доказывает улучшение пользовательского опыта.

Исторический контекст

Среднее значение долго использовалось как удобный единый показатель для сравнения продукта до и после изменения. Оно хорошо суммирует данные при симметричном распределении, но длительность сессии обычно неоднородна: у большинства пользователей короткие сессии, а у небольшой группы — очень длинные.

Поэтому в продуктовой аналитике стали дополнительно применять медиану, квантили и анализ распределения. Такой подход помогает отличать массовый эффект от влияния небольшой группы экстремальных наблюдений.

Постановка проблемы

Среднее рассчитывается с учётом величины каждого значения, а медиана зависит только от порядка наблюдений. Например, несколько сессий длительностью в несколько часов могут заметно увеличить среднее, почти не изменив медиану.

Если принять решение только по росту среднего, команда может ошибочно решить, что релиз повысил вовлечённость. На практике большинство пользователей могло столкнуться с ухудшением интерфейса, а длинные сессии могли быть вызваны зависанием приложения, оставленной открытой вкладкой или особенностями небольшой группы активных пользователей.

Подробное решение

Сначала нужно проверить, действительно ли показатели рассчитаны на одном уровне: например, одна строка должна представлять одну сессию, а не одно событие. Затем следует сравнить медиану, несколько квантилей, среднее и долю пользователей с экстремально длинными сессиями отдельно до и после релиза.

Если выросли только верхние квантили, а медиана и нижние квантили снизились, наиболее вероятно, что эффект сосредоточен в хвосте. Полезно дополнительно построить распределение по пользователям и сегментам: платформе, типу клиента, версии приложения, стране и новым или возвращающимся пользователям.

Для устойчивого сравнения можно использовать медиану, усечённое среднее или заранее согласованный верхний порог длительности. Но удалять выбросы автоматически нельзя: экстремально длинная сессия может быть как ошибкой трекинга, так и реальным важным поведением. Порог и способ обработки должны быть определены до сравнения или обоснованы отдельно, иначе появляется риск подгонки результата.

Также нужно проверить качество события завершения сессии. Если сессия закрывается только при явном выходе, фоновые процессы и незакрытые вкладки могут искусственно увеличивать длительность. В таком случае расхождение показателей указывает не только на форму распределения, но и на возможный дефект измерения.

Для принятия решения одной длительности сессии недостаточно. Её следует сопоставить с целевыми результатами: выполнением ключевого действия, удержанием, конверсией и негативными сигналами. Длиннее не всегда означает лучше: пользователь может дольше находиться в продукте из-за полезного сценария или из-за того, что не может завершить задачу.

Ситуация из практики

После редизайна страницы оформления заказа средняя длительность сессии выросла на 12%, но медиана снизилась на 8%. Команда сначала рассматривала запуск как улучшение вовлечённости.

Были проверены три варианта:

  • оставить среднее основной метрикой — быстро, но не объясняет расхождение и чувствительно к редким длинным сессиям;
  • заменить среднее медианой — лучше отражает типичного пользователя, но может скрыть значимый эффект для отдельных сегментов;
  • изучить распределение, качество трекинга и бизнес-результат — требует больше анализа, зато позволяет отличить пользу от проблем измерения.

Выбрали третий вариант. Оказалось, что у большинства пользователей сократилось время до завершения заказа, что объясняло падение медианы, а несколько корпоративных клиентов оставляли страницу открытой на длительное время и поднимали среднее. Поскольку конверсия завершения заказа выросла, релиз признали успешным, но длительность сессии перестали использовать как самостоятельный показатель вовлечённости.

Что кандидаты часто упускают

  1. Может ли одинаковое изменение среднего и медианы означать улучшение для большинства пользователей?

Да, но не гарантирует этого. Если обе метрики выросли, это совместимо с массовым увеличением длительности, однако часть пользователей всё ещё могла ухудшить результат. Нужно проверить квантили, распределение индивидуальных изменений и ключевые сегменты.

  1. Почему нельзя просто удалить все значения выше выбранного порога?

Порог может удалить реальные наблюдения и изменить смысл метрики. Например, длительная сессия может быть нормальной для сложного сценария или определённого сегмента. Кроме того, выбор порога после просмотра результатов способен сместить вывод. Лучше заранее определить правила обработки, отдельно классифицировать ошибки трекинга и показывать чувствительность вывода к разумным порогам.

  1. Какая метрика может быть полезнее длительности сессии для оценки такого релиза?

Это зависит от цели изменения. Если релиз упрощает оформление заказа, важнее конверсия в завершённый заказ, время до успешного завершения и доля ошибок, а не сама длительность. Если цель — регулярное потребление контента, можно анализировать активность, глубину потребления и удержание. Метрика должна отражать ценное действие, иначе рост времени может маскировать затруднение пользователя.