После запуска функции её эффект в A/B-тесте заметно снижается со временем. Как проверить, что это эффект новизны, а не деградация продукта?
Нужно сравнить эффект не только по календарным датам, но и по времени с момента первого использования функции каждым пользователем. Если uplift высок у пользователей сразу после знакомства с функцией, а затем систематически снижается при сохранении качества контрольной группы и отсутствии технических проблем, это согласуется с эффектом новизны. Если же ухудшение связано с конкретным релизом, сегментом или нарушением метрик качества, вероятнее деградация продукта.
В продуктовых экспериментах ранний эффект часто отличается от долгосрочного: пользователи активно исследуют новую возможность, получают временную пользу или меняют поведение из-за самого факта нововведения. Поэтому одного итогового среднего за весь тест недостаточно для оценки устойчивой ценности функции.
Разделение эффекта по времени появилось как практический способ отличать краткосрочную реакцию на изменение от изменения постоянного поведения. Оно помогает принимать решения не только по статистической значимости, но и по жизненному циклу пользовательского эффекта.
Пусть в первые дни после запуска функция увеличивает конверсию, но через несколько недель разница с контролем почти исчезает. Простое усреднение может скрыть эту динамику: положительный ранний период компенсирует отсутствие долгосрочного эффекта.
Ошибочное решение о полном запуске может привести к затратам на поддержку функции без устойчивого роста продукта. Обратная ошибка тоже возможна: эффект может снижаться не из-за новизны, а из-за бага, плохой производительности или того, что поздние пользователи принципиально отличаются от ранних.
Сначала строят временной профиль эффекта по возрасту воздействия: сравнивают пользователей через один день, неделю и другие одинаковые интервалы после их первого показа или использования функции. Важно не смешивать это с календарным временем: календарный спад может быть вызван сезонностью, рекламной кампанией или изменением состава трафика.
Затем проверяют несколько признаков. При эффекте новизны uplift обычно постепенно уменьшается у одной и той же экспериментальной популяции, а не только у пользователей, пришедших в более поздние даты. При деградации чаще появляются корреляции с версией приложения, устройством, каналом, скоростью ответа или конкретным этапом пользовательского сценария.
Нужно анализировать не только основную метрику, но и защитные метрики: ошибки, время выполнения операции, отказы, отмены, обращения в поддержку и долгосрочное удержание. Если основная метрика падает одновременно с ухудшением технических или поведенческих показателей, это аргумент против объяснения одной лишь новизной.
Сравнение должно сохранять корректность рандомизации. Нельзя просто сравнить ранних пользователей с поздними внутри одной группы и объявить разницу причинным эффектом: эти пользователи могли различаться по мотивации и источнику трафика. Надёжнее оценивать разницу между тестом и контролем в каждом временном срезе, заранее определить горизонт анализа и учитывать доверительные интервалы.
У такого подхода есть ограничения. Для долгосрочных срезов нужны время и достаточный размер выборки, а разбиение на множество периодов увеличивает вероятность случайных находок. Поэтому временные срезы и критерии успеха желательно планировать до просмотра результатов, а техническую диагностику проводить параллельно.
После запуска рекомендации дополнительных товаров рост выручки на пользователя составил 8% в первую неделю, но снизился почти до нуля к шестой неделе. Команда рассматривала три варианта: немедленно раскатить функцию, отключить её как неэффективную или продолжить анализ по возрасту воздействия и качественным метрикам.
Немедленный запуск был быстрым, но мог закрепить краткосрочный эффект. Отключение снижало риск лишней поддержки, однако не объясняло причину спада. Выбрали третий вариант: сохранили эксперимент, построили профили эффекта по времени после первого показа и отдельно проверили скорость ответа и долю ошибок.
Оказалось, что у пользователей без технических ошибок эффект постепенно снижался, а у пользователей с задержками он исчезал почти сразу. Команда исправила производительность и продолжила наблюдение за долгосрочным удержанием. Это позволило не принять техническую деградацию за обычный эффект новизны и оценивать функцию по устойчивому, а не начальному uplift.
Потому что такие недели могут отличаться составом пользователей, каналами привлечения и внешними условиями. Это календарное сравнение не показывает, сколько времени каждый пользователь реально был знаком с функцией. Нужны одинаковые возрастные срезы после воздействия и сохранение сравнения с контрольной группой.
Это может указывать на проблему с повторной ценностью, а не на общий эффект новизны. Первый опыт мог быть полезным, но последующие сценарии — слишком редкими, неудобными или недостаточно ценными. Следует разделить метрики первого и повторного использования, проверить причины отказа и не делать вывод о всей функции по одной агрегированной метрике.
Нужно заранее определить допустимый уровень неопределённости и стоимость временного запуска. Возможны поэтапная раскатка с защитными метриками, продление эксперимента или ограниченный запуск для сегмента с наибольшей доказанной пользой. Статистическая значимость раннего эффекта сама по себе не доказывает устойчивую долгосрочную ценность.