A/B-тестирование

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску


A/B-тестирование это сравнение двух вариантов страницы, письма или объявления на живом трафике: посетителей случайно разводят по группам, каждой показывают свой вариант, а исход решают статистическим критерием. Второе название приёма, сплит-тест, означает то же самое. Справка Яндекса про сервис Varioqub описывает основу коротко: «Для проведения эксперимента посетители сайта разбиваются на группы» (источник 1).

Смысл приёма в ответе на вопрос о причине. Обычный отчёт показывает, что после правки Конверсия сайта выросла, но вместе с правкой сменился сезон, добавилась рассылка, конкурент поднял цену, а в рекламе выгорел один креатив и запустился другой. Случайное деление уравнивает всё это между группами, и различающимся остаётся один фактор.

Платой за такой ответ служит объём данных, и платить приходится больше, чем ожидают. Ниже посчитано, сколько визитов нужно, чтобы заметить прирост конверсии с 2% до 2,4%, разобрано, почему привычка остановиться на хорошей цифре ломает статистику, и названы задачи, которые тестом не проверяются вовсе. Про этапы пути и потери между ними написано в статье Воронка продаж, про сведение расходов со сделками в статье Сквозная аналитика.

Чем отличается от соседних понятий

Сравнение «до и после»
Вариант меняют и смотрят динамику. Группы разнесены во времени, поэтому эффект правки смешан с сезоном, рекламой и новостным фоном. Тестом такой замер не является.
A/B/n
Тот же приём с числом вариантов больше двух. Трафик растёт примерно пропорционально их числу, а с числом сравнений растёт вероятность назначить победителя случайно.
Многофакторный тест
Перебираются сочетания элементов: заголовок, картинка, цвет кнопки. Число ячеек равно произведению вариантов, и на трафике малого бизнеса такая схема данных не набирает.
Динамическое распределение трафика
Система пересчитывает метрику каждый час и уводит аудиторию в лидирующий вариант; в Varioqub это отдельный режим на платных тарифах (источник 2). Выручку по ходу он выжимает, а на вопрос, насколько именно вариант лучше, отвечает хуже.
Юзабилити-тест
Качественный метод: несколько человек проходят сценарий вслух. Он объясняет, где люди спотыкаются, и не даёт числа. Два метода отвечают на разные вопросы и друг друга не заменяют.
A/A-тест
Обе группы получают одинаковый вариант. Разницы быть не должно, и когда она находится регулярно, сломана либо разметка целей, либо само деление трафика.

Откуда взялось

Эту логику случайного распределения подопытных единиц описал Рональд Фишер в книге «The Design of Experiments», вышедшей в Эдинбурге в 1935 году (источник 3). Первой областью применения стала медицина, и там же выяснилась цена нарушенной случайности: испытание стрептомицина в Управлении по делам ветеранов США провалилось из-за влияния врачей на отбор пациентов, а британские испытания с ослеплением удались и стали поворотной точкой контролируемых исследований (источник 4).

В веб приём пришёл вместе с возможностью делить трафик программно. У крупных площадок отдельный эксперимент стоит дёшево, а находки редки: Bing проводит больше десяти тысяч экспериментов в год, и смена вёрстки рекламных заголовков, давшая 12% выручки и больше ста миллионов долларов в год по США, случается раз в несколько лет (источник 4).

Для малого и среднего бизнеса история короче и менее радостная. Бесплатный массовый инструмент Google Optimize закрылся 30 сентября 2023 года вместе со всеми активными экспериментами (источник 5). В российском сегменте его место заняли встроенные механизмы площадок: Varioqub в Яндекс Метрике для сайтов и отдельные эксперименты в Яндекс Директе для рекламных кампаний (источники 1, 6).

Как это устроено

Кого делят и чем это запоминают

Здесь единицей деления служит посетитель, а не визит и не показ. Varioqub держит принадлежность к варианту в параметре куки, чтобы человек при повторном заходе увидел ту же версию сайта (источник 1). Отсюда первое техническое ограничение: смена браузера, очистка куки и переход со смартфона на компьютер создают нового посетителя, который может попасть в другую группу.

Рамку задают настройки: доля аудитории выбирается от 1% до 100% и по умолчанию делится поровну между вариантами, период показа задаётся от 1 до 90 дней (источник 2). Справка предупреждает прямо: «Чем больше визитов состоится, тем более чувствительным будет эксперимент и тем менее значительные изменения метрик можно зафиксировать» (источник 1).

Одна метрика решения

Эту метрику назначают до запуска и записывают. Varioqub предлагает конверсию в цель, конверсию по пользователям, доход по цели на визит, время на сайте, глубину просмотра и долю визуальных отказов (источник 7). Выбирать удобнее после теста, и поэтому так делать нельзя: среди десятка показателей всегда найдётся выросший, а вероятность случайной находки растёт с каждым сравнением.

С деньгами метрика решения связана через цену действия и средний чек: процент, выросший при подорожавшем клике, выигрышем не является. Смотреть на результат надо рядом с ценой клика, ценой заявки и показателями из статьи Юнит-экономика.

Значимость и мощность это два разных обещания

Их два, и они про разное. Уровень значимости отвечает, как часто тест объявит разницу там, где её нет. Обычный порог 5%. Мощность отвечает, как часто тест заметит разницу, которая действительно есть; стандартное требование 80%. Первое число защищает от выдуманных побед, второе от пропущенных.

Varioqub считает результат критерием Манна-Уитни с бакетизацией и подсвечивает строку варианта при p-value 0,05, 0,01 и 0,001 тремя градациями цвета (источник 7). Там же сформулировано то, что в отраслевых инструкциях обычно опускают: «принятие гипотезы H0 не означает, что метрика не изменяется. С достаточной уверенностью утверждать можно только то, что эффект не превосходит MDE (Minimum detectable effect)» (источник 7). Отрицательный результат теста говорит о чувствительности прибора, не об отсутствии эффекта.

Сколько трафика нужно, чтобы тест имел смысл

Это главный вопрос, и в пошаговых инструкциях он обычно пропущен. Ниже расчёт по стандартной формуле для двух долей при двустороннем уровне значимости 5% и мощности 80%. В ячейках визиты на каждую группу, общий объём вдвое больше.

Базовая конверсия прирост +5% +10% +20% +50%
1% 637 011 163 096 42 694 7 751
2% 315 207 80 683 21 110 3 826
3% 207 939 53 211 13 915 2 518
5% 122 125 31 235 8 159 1 472
10% 57 764 14 752 3 842 687

Разберём случай из середины таблицы. Конверсия 2%, гипотеза поднимает её до 2,4%. Прирост относительный, двадцатипроцентный, и для правки интерфейса он крупный. Нужно около 21 100 визитов на группу и 42 200 суммарно, при этом в каждой группе должно накопиться примерно 422 заявки.

Теперь переведём это в календарь.

Трафик сайта Срок теста 2% против 2,4% Какой прирост ловится за месяц
1 000 визитов в месяц 42 месяца от +166%, то есть с 2,00% до 5,33%
3 000 14 месяцев от +85%, до 3,70%
10 000 4 месяца от +43%, до 2,86%
30 000 1,4 месяца от +24%, до 2,48%
100 000 13 дней от +13%, до 2,26%

Вывод неприятный и полезный. Сайт с тремя тысячами визитов в месяц ловит за месяц только изменение, которое почти вдвое поднимает конверсию, а таких правок в интерфейсе не бывает. Ниже примерно десяти тысяч визитов в месяц A/B-тестирование деталей страницы перестаёт быть рабочим инструментом, и время дешевле потратить на разбор юзабилити с живыми людьми, записи сессий, скорость загрузки и качество трафика. Крупная перестройка страницы, меняющая предложение целиком, проверяема и на среднем трафике: ловить там надо не доли процента.

Цена ранней остановки

Теперь тест запущен, отчёт обновляется ежедневно, и смотреть в него хочется так же часто. Именно здесь статистика ломается, причём незаметно.

Механизм такой. Порог значимости 5% обещает, что при отсутствии настоящей разницы тест ошибётся в одном случае из двадцати. Обещание относится к одной проверке на заранее назначенной выборке, а каждый новый взгляд в отчёт это отдельный розыгрыш той же лотереи, в которой выигрыш засчитывается, если сошлось хотя бы однажды.

Ниже прямая проверка: две группы с одинаковой конверсией 2%, разницы нет вовсе, тест останавливается при первом же p-value ниже 0,05. Двести тысяч прогонов на строку.

Сколько раз заглянули в отчёт Доля прогонов, где тест показал «значимую» разницу
1 (только в конце) 5,0%
2 8,3%
5 14,2%
10 19,4%
20 24,8%
50 31,9%

Первая строка подтверждает, что расчёт исправен: без подглядываний ошибка равна обещанным 5%. Дальше она растёт до трети. Независимая оценка того же порядка есть в работе о непрерывном мониторинге A/B-тестов: даже при десяти тысячах наблюдений, объёме для онлайн-тестов обычном, ошибка первого рода легко вырастает впятеро (источник 8).

Второе следствие объясняет знакомую картину, когда победа рассасывается. При десяти промежуточных проверках досрочная остановка с «победителем» случается в 18,6% прогонов, и у 77,7% из них разница исчезает, если довести тест до полной выборки. Её не съел сезон: её не существовало.

Лечится это тремя способами: выборку и срок фиксируют до старта и открывают отчёт один раз; берут методы последовательного анализа, рассчитанные на непрерывный просмотр (источник 8); либо смотрят промежуточные цифры как на здоровье теста, без права принять по ним решение.

Что тестировать бесполезно или нельзя

Несколько изменений сразу. Справка Varioqub описывает риск на примере: если одновременно идут эксперимент с цветом кнопки и эксперимент с описанием товара, посетитель попадает в оба и видит оба изменения, что влияет на результаты (источник 9). Развести эксперименты можно настройкой взаимных исключений, но суммарная доля аудитории у непересекающихся экспериментов не может превышать 100%, и на небольшом трафике параллельная работа упирается в тот же дефицит визитов.

Сезонные и праздничные периоды. Поведение в предновогоднюю неделю на февраль не переносится. Тест, начатый в понедельник и оборванный в четверг, меряет ещё и разницу между днями недели, поэтому срок назначают целым числом недель.

Ситуации, где одна аудитория видит оба варианта. Деление держится на куке одного браузера, поэтому человек, открывший сайт с рабочего компьютера и с телефона, увидит обе версии. То же бывает, когда в решении участвуют несколько сотрудников заказчика, когда ссылка ушла в мессенджер со скриншотом и когда аудитория узкая, а участники общаются между собой.

Карточки на маркетплейсах. Витрина чужая, и деления трафика у продавца нет. Площадки дают собственные механизмы: у Wildberries в справочном центре описано А/Б-тестирование главного фото карточки (источник 10). Работают они по правилам площадки, и расчёты выше на них напрямую не переносятся. Предмет разобран в статье Продвижение на маркетплейсах.

Отложенные деньги. Повторные покупки, отток и пожизненная ценность клиента проявляются за горизонтом теста, а период эксперимента в Varioqub ограничен 90 днями (источник 2). Здесь работает Когортный анализ, а показатели вроде ДРР и ROMI считаются на другой длине наблюдения.

Редкие события. Пять заявок в месяц не дадут значимости ни за какой срок. На таком объёме проверяют разве что микроконверсии выше по воронке, помня, что их рост продаж не гарантирует.

Что делать на практике

  1. Посчитать размер выборки до запуска и сверить со своим трафиком. Не сходится, тест не запускать.
  2. Сформулировать гипотезу и назначить одну приёмочную метрику письменно.
  3. Прогнать A/A-тест на своей разметке: он проверяет исправность деления и целей.
  4. Назначить срок целым числом недель и не менять его по ходу.
  5. Не принимать решений по промежуточным цифрам.
  6. Проверить, что группы вышли сопоставимого размера: заметный перекос означает поломку.
  7. Смотреть рядом с приёмочной метрикой на деньги: средний чек, цену заявки, долю возвратов.
  8. Записывать проигравшие тесты. У Microsoft улучшала целевую метрику лишь треть проверенных идей, а в вылизанных интерфейсах вроде Bing и Google доля успеха падает до 10-20% (источник 4).

Частые ошибки

Остановка теста в день, когда цифра понравилась. Выбор метрики после получения результатов. Правка нескольких элементов разом без разведения экспериментов. Перекос в размерах групп, оставленный без проверки. Перенос чужого результата на свой сайт, где кнопка выиграла на чужом трафике и чужой цене. Тест на неделе с распродажей. Вывод «разницы нет» вместо честного «эффект меньше того, что этот тест способен увидеть».

Ограничения и спорные места

Числа в таблицах выше получены расчётом, а не наблюдением. Это модель: стандартная формула для двух долей, двусторонний уровень значимости 5%, мощность 80%, независимые наблюдения. На живом сайте один человек даёт несколько визитов, поведение внутри групп связано, и нужный объём выходит выше расчётного. Насколько выше, публичной оценки для российского малого бизнеса нет.

Инструмент теста сам портит измерение. Визуальный редактор подменяет вёрстку в браузере, из-за чего страница мерцает. Штатное лекарство прячет страницу до загрузки эксперимента, и в примере из справки время ожидания выставлено в 4000 миллисекунд (источник 11). Тест про удобство, добавляющий секунды к показу, меняет ровно то, что измеряет.

Эффект новизны и эффект привычки. Постоянные посетители реагируют на изменение само по себе, не на его смысл. Полная перестройка сайта регулярно проигрывает старой версии на ключевых метриках из-за привыкания к прежнему интерфейсу (источник 4). Разделить привыкание и качество правки коротким тестом не выходит.

Значимость не равна размеру эффекта. Слабый по мощности тест чаще промахивается, и это половина беды: найденное он вдобавок раздувает. В расчёте для настоящего прироста с 2,00% до 2,20% тест на группе в 3 000 визитов замечает эффект в 8% случаев и, когда замечает, показывает в среднем +54% вместо настоящих +10%. На группе в 10 000 замечает в 16% случаев и показывает +27%. На полноценных 80 700 визитах замечает в 80% случаев и показывает +11%. Отсюда разрыв между обещаниями теста и выручкой в отчёте за квартал.

Спор о методе не закрыт. Частотный подход с p-value и байесовский подход с вероятностью превосходства расходятся на пограничных данных. Varioqub считает часть метрик критерием Манна-Уитни, а конверсию по пользователям методом Байеса, показывая вероятность превосходства тестового варианта (источники 7, 12). Отраслевого соглашения о том, какой ответ главный, нет.

Победа в тесте не означает, что вариант хорош. Она значит лишь то, что он обошёл второй из двух написанных, и о непридуманных тест молчит. Поток идей остаётся человеческой работой, которую приём не заменяет.

Что здесь быстро устаревает

  • Набор доступных инструментов. Google Optimize закрылся 30 сентября 2023 года со всеми активными экспериментами (источник 5).
  • Тарифы, лимиты и настройки Varioqub, включая динамическое распределение трафика (источники 2, 13).
  • Правила площадок по экспериментам в рекламе и требования к объёму данных в Директе (источник 6).
  • А/Б-инструменты маркетплейсов: состав, лимиты, условия подписки (источник 10).
  • Механика идентификации в браузерах: деление держится на куке, и ужесточение правил её хранения бьёт по точности разметки.

См. также

Источники

  1. Яндекс. Эксперименты Varioqub. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/ (проверено 11.09.2026)
  2. Яндекс. Создание эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create.md (проверено 11.09.2026)
  3. Fisher R. A. The Design of Experiments. Oliver and Boyd, Эдинбург, 1935.
  4. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020, глава 1. https://experimentguide.com/wp-content/uploads/TrustworthyOnlineControlledExperiments_PracticalGuideToABTesting_Chapter1.pdf (проверено 11.09.2026)
  5. Google. [Sunset September 2023] Google Optimize. Analytics Help, 2023. https://support.google.com/optimize/announcements/9176329 (проверено 11.09.2026)
  6. Яндекс. A/B-эксперименты. Справка Яндекс Директа, 2026. https://yandex.ru/support/direct/ru/campaigns/experiments (проверено 11.09.2026)
  7. Яндекс. Отчет о результатах эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/stat.md (проверено 11.09.2026)
  8. Johari R., Pekelis L., Walsh D. Always Valid Inference: Continuous Monitoring of A/B Tests. arXiv:1512.04922, версия от 16.07.2019. https://arxiv.org/abs/1512.04922 (проверено 11.09.2026). Тот же материал в докладе: Johari R., Koomen P., Pekelis L., Walsh D. Peeking at A/B Tests: Why It Matters, and What to Do about It. KDD '17, с. 1517-1525
  9. Яндекс. Пересечения с экспериментами. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create/intersections.md (проверено 11.09.2026)
  10. Wildberries. А/Б-тестирование главного фото в карточке товара. Справочный центр WB Partners, 2026. https://seller.wildberries.ru/instructions/ru/ru/material/main-photo-ab-testing (проверено 11.09.2026)
  11. Яндекс. Скрытие страницы до начала эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/anti-flicker.md (проверено 11.09.2026)
  12. Яндекс. Расчет метрик методом Байеса. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/stat/bayes.md (проверено 11.09.2026)
  13. Яндекс. Распределение трафика. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create/traffic-distribution.md (проверено 11.09.2026)