Когортный анализ
Когортный анализ это разбор данных, при котором людей объединяют в группы по времени общего события и дальше следят за каждой группой по отдельности, вместо того чтобы смотреть на базу целиком. Группа называется когортой: все, кто впервые зашёл на сайт в марте, все, кто оформил первый заказ на прошлой неделе, все, кто установил приложение в день запуска рекламы.
Приём нужен из-за одного свойства средних. Отчёт за календарный месяц смешивает людей с разным стажем: в одной строке оказываются вчерашние посетители и покупатели второго года. Стоит притоку новых измениться, и среднее поедет само, без единой правки на сайте.
Собственных метрик у метода нет. Внутри когорт меряют ту же конверсию сайта, ту же выручку и ту же пожизненную ценность клиента, только знаменателем служит не период, а поколение пришедших. Поэтому когорты стоят рядом с юнит-экономикой и со сквозной аналитикой, которая сшивает данные о человеке из разных систем.
Чем когорта отличается от сегмента
Когорту задаёт время входа. Сегмент задаёт признак: канал, город, устройство, сумма первого заказа. Разница кажется формальной, пока дело не доходит до состава группы.
Состав когорты неизменен. Человек, впервые пришедший 3 марта, останется в мартовской когорте и через год, даже если сменит телефон, город и способ оплаты. Состав сегмента плывёт вместе с признаком: группа «пользователи Android» теряет человека в тот день, когда он купил iPhone, и вся её история задним числом становится другой.
Одно другому не мешает, и рабочий срез обычно двойной. «Мартовская когорта из поиска» против «мартовской когорты из таргета» это когорта, нарезанная сегментом, и так находят разницу в качестве трафика.
Ещё одна соседняя нарезка это воронка: она делит путь по этапам, когорты делят его по дате входа, и одно другому не противоречит.
Третье соседство путают реже, но ошибка выходит дороже. A/B-тестирование делит людей случайно и одновременно, поэтому разницу между группами можно отнести к тому, что вы меняли. Когорты разделены временем, и между ними меняется всё сразу: сезон, цены, конкуренты, правила площадок. Когорты описывают, эксперимент доказывает.
Откуда взялось
Понятие пришло из демографии. Норман Райдер в статье «The Cohort as a Concept in the Study of Social Change» (American Sociological Review, декабрь 1965 года) определил когорту как «the aggregate of individuals (within some population definition) who experienced the same event within the same time interval»: совокупность людей внутри некоторой популяции, переживших одно и то же событие в один и тот же промежуток времени.
Главное здесь то, что событием может быть что угодно. До Райдера когортами считали поколения по году рождения, а он показал, что годится любая точка отсчёта, от которой имеет смысл вести время жизни группы. Маркетингу досталась уже общая форма: событием входа стали первый визит, регистрация, установка приложения или первая покупка.
В инструменты приём попал вместе с подписками и мобильными продуктами, где повторное действие составляет суть бизнеса. Штатный отчёт есть в мобильной аналитике AppMetrica: когорта собирается по дате целевого действия, размер задаётся днём, неделей, месяцем или произвольным интервалом, показатели считаются по календарным дням либо по суточным окнам от установки. В Google Analytics 4 инструмент называется «Анализ когорт» и ограничен шестьюдесятью когортами в одном исследовании.
Как это устроено
Три решения, которые задают когорту
Событие входа. GA4 предлагает первый контакт, первое событие в периоде, первую транзакцию, первую конверсию или произвольное событие. Выбор определяет вопрос, на который вы получите ответ: когорты по первому визиту говорят о качестве трафика, когорты по первой покупке об удержании, и числа у них разойдутся в разы.
Шаг. День, неделя или месяц. В GA4 неделя считается с воскресенья по субботу, и это мелочь ровно до сведения отчётов с CRM, где неделя начинается с понедельника. Шаг берут от цикла сделки: при покупке в день визита хватает дня, при решении в квартал дневные когорты рассыпаются в шум.
Возвратное действие и горизонт. Нужно назвать, что считается возвратом (любое событие, покупка, конверсия), и до какого возраста когорты вы смотрите. Горизонт упирается в терпение: ответ по годовой когорте придёт через год, не раньше.
Треугольная таблица и как её читать
Результат рисуют почти всегда одинаково. Строки это когорты сверху вниз по дате входа, столбцы это возраст когорты в шагах. Верхняя строка заполнена целиком, каждая следующая короче, правый нижний угол пустой: июньская когорта ещё не прожила три месяца.
Читают её в трёх направлениях, и это три разных вопроса.
- По строке видно жизнь одного поколения: когда оно покупает, когда затихает.
- По столбцу сравниваются поколения одного возраста. Это главное сравнение: каждый следующий столбец ниже предыдущего означает, что новый трафик хуже старого.
- По диагонали лежит календарная дата, общая для всех когорт сразу. Провал на ней означает событие того месяца: сломанная оплата, редизайн, праздники, смена цен.
Больше всего времени экономит различение столбца и диагонали: просадка в столбце это проблема привлечения, просадка на диагонали проблема продукта или сайта, и лечат их разные отделы.
Почему средняя конверсия падает при растущем трафике
Магазин считает конверсию привычно: заказы месяца поделить на визиты месяца. До июня приток ровный, по 10 000 новых посетителей, в июне подключён канал, который приводит ещё 15 000. Числа условные и посчитаны моделью: заданы только поведение двух каналов и размеры когорт, остальное следствие.
| Месяц | Визиты | Заказы | Конверсия месяца |
|---|---|---|---|
| май | 16 000 | 350 | 2,19 % |
| июнь | 31 000 | 470 | 1,52 % |
| июль | 33 250 | 515 | 1,55 % |
| август | 34 000 | 530 | 1,56 % |
Отчёт читается однозначно: конверсия упала почти на треть и не вернулась. Дальше обычно ищут поломку в корзине, меняют кнопки и переписывают карточки. Те же данные по когортам входа, накопленная доля купивших от размера когорты:
| Когорта | Размер | Месяц 0 | Месяц 1 | Месяц 2 |
|---|---|---|---|---|
| март | 10 000 | 2,00 % | 3,00 % | 3,50 % |
| апрель | 10 000 | 2,00 % | 3,00 % | 3,50 % |
| май | 10 000 | 2,00 % | 3,00 % | 3,50 % |
| июнь | 25 000 | 1,28 % | 1,86 % | 2,12 % |
Старые поколения ведут себя как раньше, просело новое. Внутри него видно, почему: 10 000 человек, пришедшие прежним путём, покупают те же 3,50 %, а 15 000 из нового канала 1,20 %.
Вклад причин считается контрфактом. Если бы те же 25 000 посетителей пришли из старого канала, конверсия июня составила бы 2,10 % против майских 2,19 %: рост трафика сам по себе стоил 0,09 процентного пункта, а смена состава 0,58 пункта. Сайт не участвовал вовсе.
Дальше самое неприятное. Заказов в июне стало 470 против 350: новый канал добавил 120 заказов и уронил среднюю конверсию. Решение «отключить, раз конверсия упала» отрезает деньги. Окупается канал или нет, решают цена заказа и маржа, то есть юнит-экономика, а процент в сводном отчёте на этот вопрос не отвечает вовсе.
Механизм известен статистике давно: агрегат способен двигаться не туда, куда движутся его части. Разбор такого случая Эдвард Симпсон опубликовал в Journal of the Royal Statistical Society в 1951 году, название «парадокс Симпсона» закрепил Колин Блайт в 1972 году. Строгий парадокс требует смены направления на противоположное; выше части стоят на месте, а среднее падает, и это тот же механизм в мягкой форме.
Второй механизм: длина цикла и темп роста
Второй сценарий обходится без смены состава. Канал один, поведение когорт неизменно, но покупка вызревает: в месяц входа покупает 0,5 % когорты, в следующий 1,5 %, ещё через месяц 1,5 %, итого те же 3,50 %. Приток растёт с 10 000 до 40 000 человек.
Календарная конверсия падает вдвое, с 2,19 % в мае до 1,09 % в июне, а когортные кривые всех шести поколений совпадают до сотой доли процента. Причина арифметическая: доля новичков в визитах выросла с 62 % до 87 %, а новичок в первый месяц покупает втрое реже, чем он же на третий. Чем длиннее цикл сделки, тем сильнее календарная конверсия зависит от темпа роста, и быстро растущий бизнес со стабильными когортами обречён смотреть на падающие проценты.
Что делать на практике
- Начните с таблицы событий. Нужны идентификатор человека, дата и канал первого визита, даты и суммы заказов. Сырые визиты отдаёт Logs API Метрики: один запрос до года, квота на счётчик 10 ГБ, данные текущего дня брать нельзя.
- Канал фиксируйте на входе. С последним источником когорта перестаёт отвечать на вопрос о качестве привлечения. Разрывы склейки разобраны в статье сквозная аналитика: когорты наследуют все её ошибки.
- Сравнивайте одинаковый возраст. Июньская когорта на второй неделе жизни сравнима с майской на той же второй неделе.
- Считайте деньги на участника когорты. Два канала с одинаковой конверсией дают разный чек, и об окупаемости говорит накопленная маржа.
- Держите определение постоянным. Событие входа, шаг и горизонт выбираются один раз: смена шага на середине истории обнуляет сравнимость прошлого.
- Проверяйте гипотезу экспериментом. Когорта покажет расхождение, причину подтвердит A/B-тест.
Чем измеряют
- Доля дошедших до целевого действия: какая часть когорты купила, оставила заявку, вернулась.
- Удержание: доля когорты, совершившая любое действие в N-м периоде жизни. Для подписок и приложений это основная метрика.
- Накопленная маржа на участника когорты: та же пожизненная ценность, посчитанная по факту, без прогноза.
- Доля повторных покупок: второй заказ обычно отличается от первого по составу и сумме.
- Срок окупаемости привлечения: месяц жизни когорты, в котором накопленная маржа перекрыла расходы на неё. Считается из тех же расходов, что ДРР и ROMI.
- Цена заявки по когорте: CPL в разрезе поколения, включая звонки, размеченные через Коллтрекинг.
Частые ошибки
- Сравнение когорт разного возраста. Свежая когорта выглядит хуже просто потому, что не успела дожить. Самая частая ложная тревога.
- Незакрытый последний период. Неполный месяц в нижней строке рисует обрыв, который через две недели исчезнет сам.
- Разные события входа в одном отчёте. Когорты по первому визиту и по первой покупке не складываются и не сравниваются.
- Шаг мельче цикла сделки. Дневные когорты в нише с двухмесячным решением дают график без сигнала.
- Сезонность вместо вывода. Декабрьская когорта набрана подарочными покупателями, и её слабое удержание объясняется праздником.
Когда когортный анализ не нужен
Мало данных. Когорта из двухсот человек при конверсии 3 % даёт шесть покупок, и 95-процентный доверительный интервал по методу Клоппера и Пирсона растягивается от 1,11 % до 6,42 %: две такие когорты различаются втрое просто от случая. На пятистах он сужается до 1,69-4,90 %, на двух тысячах до 2,30-3,84 %. Рабочий порог измеряется тысячами входов на шаг, а при десятках новых клиентов в месяц график читается как шум, о чём говорит и статья юнит-экономика.
Товар разовый по своей природе. Свадебное платье, надгробие, установка счётчиков. Повторного действия не будет ни у какой когорты, и таблица выродится в один столбец. Остаётся сравнение каналов по первому заказу, а это обычный отчёт по источникам трафика.
Короткий цикл без отложенных действий. Когда решение принимается в первый визит и повторных покупок нет, когортная таблица совпадёт с календарной до округления. Трудозатраты на сборку данных при этом остаются.
Решение не зависит от ответа. Когда бюджет канала утверждён на квартал и пересмотру не подлежит, разбор его когорт останется упражнением.
Ограничения и спорные места
Когорты не доказывают причину. Между мартовским и июньским поколением меняется всё сразу, и отнести разницу к одной причине без эксперимента нельзя. Контрфакт из расчёта выше возможен лишь потому, что модель задана целиком. На живых данных такого знания нет.
Рост удержания внутри когорты объясняется не лояльностью. Питер Фейдер и Брюс Харди показали в 2007 году, что кривая удержания выполаживается из-за разнородности базы: склонные уйти уходят первыми, и остаются те, у кого эта склонность изначально ниже. Поведение отдельного человека при этом не меняется. В 2018 году те же авторы с соавторами пересмотрели вывод и признали вклад продолжительности отношений. Спор не закрыт, и это причина не выводить обещаний из красивой кривой.
Идентификация вероятностная. Когорта собирается по идентификатору браузера или приложения, а человек и идентификатор совпадают далеко не всегда. Очищенные cookie создают нового участника, домашний и рабочий компьютер дают двух. По когортам ошибка бьёт сильнее, чем по календарным отчётам: она накапливается с возрастом когорты.
Свежие когорты всегда выглядят хуже. Ответ по годовому горизонту приходит через год, а бюджет утверждают сегодня. Обходятся частичным горизонтом: берут возраст, к которому набирается большая часть результата, и сравнивают когорты по нему. Где проходит эта граница, каждый определяет на своих данных.
Канонического события входа не существует. Отчёт по первому визиту и отчёт по первой покупке на одних данных дадут разные оценки каналов, и оба корректны в своих терминах. Два подрядчика на одной базе получат разные цифры, и спор внутри данных неразрешим.
Чужие когортные кривые несопоставимы без методики. Размер шага, событие входа, горизонт и способ учёта возвратов у каждой компании свои, поэтому чужая цифра удержания без этих четырёх параметров не значит ничего.
Инструменты покрывают тему неровно. В мобильной аналитике когортный отчёт штатный, у Google Analytics 4 есть отдельное исследование с потолком в 60 когорт, а справка Яндекс Метрики на 11 сентября 2026 года описывает только смежный отчёт «Время с первого визита». Полную когортную таблицу для сайта собирают выгрузкой сырых данных.
Числа в расчёте выше модельные. Они показывают механизм и воспроизводятся из описанных параметров, но замером по живому магазину и отраслевым эталоном не являются.
Что здесь быстро устаревает
- Состав и лимиты когортных отчётов: число когорт в GA4, набор метрик AppMetrica, появление или исчезновение отчёта в Метрике.
- Квоты и ограничения выгрузок сырых данных, включая период запроса и размер хранилища Logs API.
- Правила хранения идентификаторов в браузерах, от которых зависит склейка визитов в когорту.
- Требования к обработке персональных данных, когда когорты привязаны к контактам.
См. также
- Пожизненная ценность клиента
- Юнит-экономика
- Воронка продаж
- Конверсия сайта
- A/B-тестирование
- Целевая аудитория
Источники
- Ryder N. B. The Cohort as a Concept in the Study of Social Change: определение когорты на с. 845. American Sociological Review, декабрь 1965 года, т. 30, № 6, с. 843-861. https://www.jstor.org/stable/2090964
- Simpson E. H. The Interpretation of Interaction in Contingency Tables: разбор случая, когда объединение таблиц меняет вывод. Journal of the Royal Statistical Society, Series B, июль 1951 года, т. 13, № 2, с. 238-241, doi:10.1111/j.2517-6161.1951.tb00088.x. https://academic.oup.com/jrsssb/article/13/2/238/7026675
- Blyth C. R. On Simpson's Paradox and the Sure-Thing Principle: работа, закрепившая название парадокса. Journal of the American Statistical Association, 1972, т. 67, № 338, с. 364-366. https://www.tandfonline.com/doi/abs/10.1080/01621459.1972.10482387
- «Анализ когорт»: критерии включения и возврата, уровни детализации, типы расчёта, ограничение в 60 когорт. Справка Google Analytics. https://support.google.com/analytics/answer/9670133
- «Когортный анализ»: формирование когорты по дате целевого действия, размер когорты, подсчёт по календарным дням и суточным окнам, доступные показатели. Документация AppMetrica, Яндекс. https://appmetrica.yandex.ru/docs/ru/mobile-reports/cohort-report
- Отчёт «Время с первого визита»: путь в интерфейсе и что показывает отчёт. Справка Яндекс Метрики. https://yandex.ru/support/metrica/ru/visitors/loyalty-first-visit.html
- Logs API: ограничение периода одного запроса, квота 10 ГБ на счётчик, недоступность данных текущего дня. Технологии Яндекс Метрики. https://yandex.ru/dev/metrika/ru/logs/
- Fader P. S., Hardie B. G. S. How to Project Customer Retention: рост удержания когорты как следствие разнородности базы. Journal of Interactive Marketing, 2007, т. 21, № 1, с. 76-90, doi:10.1002/dir.20074; авторская версия на сайте Брюса Харди. https://brucehardie.com/papers/021/
- Fader P. S., Hardie B. G. S., Liu Y., Davin J., Steenburgh T. «How to Project Customer Retention» Revisited: The Role of Duration Dependence: пересмотр вывода 2007 года. Journal of Interactive Marketing, 2018. https://brucehardie.com/papers/037/BdW_JIM_2018-01-10_rev.pdf