После введения бонуса среднее число отправленных сообщений на активного пользователя выросло, но удержание снизилось. Какой механизм делает эту метрику плохим прокси ценности продукта?
Метрика стала объектом оптимизации и перестала надёжно отражать ценность для пользователя. Бонус стимулировал отправлять больше сообщений независимо от их полезности, поэтому локальный рост активности сопровождался ухудшением удержания.
В продуктовой аналитике часто используют прокси-метрики, потому что ценность продукта трудно наблюдать напрямую: она проявляется в долгосрочном использовании, удержании, оплате или рекомендации. Поэтому команды выбирают измеримые сигналы, например число действий, завершённых сценариев или время в продукте.
Проблема возникает, когда команда начинает оптимизировать сам сигнал, а не пользовательскую ценность. Это связано с эффектом, известным как закон Гудхарта: показатель может потерять связь с исходной целью, когда становится целевой метрикой.
Среднее число сообщений на активного пользователя смешивает полезную коммуникацию и действия, совершённые ради бонуса. Рост показателя может быть вызван массовыми короткими или малоценными сообщениями, а не улучшением продукта.
Если принять такой рост за успех, команда рискует закрепить стимулирующую механику, которая повышает нагрузку на пользователей, ухудшает качество контента и ускоряет отток. Дополнительный риск — анализ только среднего значения: оно не показывает, у какой доли пользователей изменилась активность и за счёт каких действий.
Сначала нужно проверить, изменилась ли связь между числом сообщений и целевой ценностью. Для этого сравнивают не только среднее число сообщений, но и удержание, частоту возвратов, жалобы, блокировки, отмены подписки, успешное завершение целевого сценария и качество взаимодействия.
Важно разделить пользователей по воздействию бонуса: получали ли они его, воспользовались ли механикой, когда начали отправлять сообщения и как долго сохранялся эффект. Если рост сообщений сосредоточен у участников бонусной механики, а долгосрочные метрики ухудшаются, это указывает на стимульное поведение, а не на рост ценности.
Полезно анализировать распределение: медиану, квантили, долю пользователей с необычно большим числом сообщений и долю сообщений, соответствующих критериям полезного взаимодействия. Среднее может вырасти из-за небольшой группы очень активных пользователей или из-за повторяющихся действий низкого качества.
Надёжнее оценивать бонус в контролируемом эксперименте с заранее заданными guardrail-метриками. Основная метрика должна отражать целевой результат, а число сообщений может оставаться диагностической. Запуск оправдан только при отсутствии неприемлемого ухудшения удержания и качества поведения, даже если локальная активность выросла.
Компромисс состоит в том, что долгосрочные метрики требуют времени и могут быть менее чувствительными. Поэтому используют набор метрик: ранний прокси-сигнал для скорости анализа, долгосрочный результат для проверки ценности и защитные показатели для выявления вредных побочных эффектов.
В сервисе общения бонус начислялся за каждое отправленное сообщение. Среднее число сообщений выросло на 18%, но через месяц увеличились жалобы на спам, а D30-retention снизился.
Команда рассматривала три варианта. Полностью оставить бонус было быстро, но это усиливало нежелательное поведение. Полностью отменить его было безопаснее, однако можно было потерять полезный эффект для новых пользователей. Третий вариант — ограничить начисление бонусов, учитывать только сообщения в содержательных диалогах и оценивать механику вместе с удержанием и жалобами.
Выбрали третий вариант. В эксперименте основной оценкой сделали удержание и долю пользователей, успешно завершивших целевой сценарий общения; число сообщений использовали как вспомогательную метрику. После ограничения бонуса рост активности стал меньше, но ухудшение удержания исчезло, поэтому механику оставили в изменённом виде.
1. Может ли рост удержания доказать, что выросла ценность продукта?
Нет. Пользователи могут возвращаться из-за вознаграждения, обязательного сценария или высокой стоимости ухода, а не из-за полезности продукта. Нужно проверить устойчивость эффекта после прекращения стимула и оценить качество возвращений, а не только факт визита.
2. Почему нельзя просто заменить среднее число сообщений на медиану?
Медиана уменьшает влияние экстремальных пользователей, но не устраняет проблему плохого прокси. Если большинство пользователей отправляет больше формальных или низкокачественных сообщений, медиана также вырастет без роста ценности. Распределение помогает диагностировать механизм, но целевую метрику нужно связывать с реальным результатом пользователя.
3. Что делать, если активность и удержание растут одновременно?
Это сильнее поддерживает гипотезу о полезности, но не доказывает её автоматически. Следует проверить длительность эффекта, качество взаимодействий, влияние на разные сегменты, жалобы и другие защитные метрики. Также важно убедиться, что результат не вызван изменением состава пользователей или внешним событием, совпавшим с экспериментом.