A/B-тестирование
A/B-тестирование это сравнение двух вариантов страницы, письма или объявления на живом трафике: посетителей случайно разводят по группам, каждой показывают свой вариант, а исход решают статистическим критерием. Второе название приёма, сплит-тест, означает то же самое. Справка Яндекса про сервис Varioqub описывает основу коротко: «Для проведения эксперимента посетители сайта разбиваются на группы» (источник 1).
Смысл приёма в ответе на вопрос о причине. Обычный отчёт показывает, что после правки Конверсия сайта выросла, но вместе с правкой сменился сезон, добавилась рассылка, конкурент поднял цену, а в рекламе выгорел один креатив и запустился другой. Случайное деление уравнивает всё это между группами, и различающимся остаётся один фактор.
Платой за такой ответ служит объём данных, и платить приходится больше, чем ожидают. Ниже посчитано, сколько визитов нужно, чтобы заметить прирост конверсии с 2% до 2,4%, разобрано, почему привычка остановиться на хорошей цифре ломает статистику, и названы задачи, которые тестом не проверяются вовсе. Про этапы пути и потери между ними написано в статье Воронка продаж, про сведение расходов со сделками в статье Сквозная аналитика.
Чем отличается от соседних понятий
- Сравнение «до и после»
- Вариант меняют и смотрят динамику. Группы разнесены во времени, поэтому эффект правки смешан с сезоном, рекламой и новостным фоном. Тестом такой замер не является.
- A/B/n
- Тот же приём с числом вариантов больше двух. Трафик растёт примерно пропорционально их числу, а с числом сравнений растёт вероятность назначить победителя случайно.
- Многофакторный тест
- Перебираются сочетания элементов: заголовок, картинка, цвет кнопки. Число ячеек равно произведению вариантов, и на трафике малого бизнеса такая схема данных не набирает.
- Динамическое распределение трафика
- Система пересчитывает метрику каждый час и уводит аудиторию в лидирующий вариант; в Varioqub это отдельный режим на платных тарифах (источник 2). Выручку по ходу он выжимает, а на вопрос, насколько именно вариант лучше, отвечает хуже.
- Юзабилити-тест
- Качественный метод: несколько человек проходят сценарий вслух. Он объясняет, где люди спотыкаются, и не даёт числа. Два метода отвечают на разные вопросы и друг друга не заменяют.
- A/A-тест
- Обе группы получают одинаковый вариант. Разницы быть не должно, и когда она находится регулярно, сломана либо разметка целей, либо само деление трафика.
Откуда взялось
Эту логику случайного распределения подопытных единиц описал Рональд Фишер в книге «The Design of Experiments», вышедшей в Эдинбурге в 1935 году (источник 3). Первой областью применения стала медицина, и там же выяснилась цена нарушенной случайности: испытание стрептомицина в Управлении по делам ветеранов США провалилось из-за влияния врачей на отбор пациентов, а британские испытания с ослеплением удались и стали поворотной точкой контролируемых исследований (источник 4).
В веб приём пришёл вместе с возможностью делить трафик программно. У крупных площадок отдельный эксперимент стоит дёшево, а находки редки: Bing проводит больше десяти тысяч экспериментов в год, и смена вёрстки рекламных заголовков, давшая 12% выручки и больше ста миллионов долларов в год по США, случается раз в несколько лет (источник 4).
Для малого и среднего бизнеса история короче и менее радостная. Бесплатный массовый инструмент Google Optimize закрылся 30 сентября 2023 года вместе со всеми активными экспериментами (источник 5). В российском сегменте его место заняли встроенные механизмы площадок: Varioqub в Яндекс Метрике для сайтов и отдельные эксперименты в Яндекс Директе для рекламных кампаний (источники 1, 6).
Как это устроено
Кого делят и чем это запоминают
Здесь единицей деления служит посетитель, а не визит и не показ. Varioqub держит принадлежность к варианту в параметре куки, чтобы человек при повторном заходе увидел ту же версию сайта (источник 1). Отсюда первое техническое ограничение: смена браузера, очистка куки и переход со смартфона на компьютер создают нового посетителя, который может попасть в другую группу.
Рамку задают настройки: доля аудитории выбирается от 1% до 100% и по умолчанию делится поровну между вариантами, период показа задаётся от 1 до 90 дней (источник 2). Справка предупреждает прямо: «Чем больше визитов состоится, тем более чувствительным будет эксперимент и тем менее значительные изменения метрик можно зафиксировать» (источник 1).
Одна метрика решения
Эту метрику назначают до запуска и записывают. Varioqub предлагает конверсию в цель, конверсию по пользователям, доход по цели на визит, время на сайте, глубину просмотра и долю визуальных отказов (источник 7). Выбирать удобнее после теста, и поэтому так делать нельзя: среди десятка показателей всегда найдётся выросший, а вероятность случайной находки растёт с каждым сравнением.
С деньгами метрика решения связана через цену действия и средний чек: процент, выросший при подорожавшем клике, выигрышем не является. Смотреть на результат надо рядом с ценой клика, ценой заявки и показателями из статьи Юнит-экономика.
Значимость и мощность это два разных обещания
Их два, и они про разное. Уровень значимости отвечает, как часто тест объявит разницу там, где её нет. Обычный порог 5%. Мощность отвечает, как часто тест заметит разницу, которая действительно есть; стандартное требование 80%. Первое число защищает от выдуманных побед, второе от пропущенных.
Varioqub считает результат критерием Манна-Уитни с бакетизацией и подсвечивает строку варианта при p-value 0,05, 0,01 и 0,001 тремя градациями цвета (источник 7). Там же сформулировано то, что в отраслевых инструкциях обычно опускают: «принятие гипотезы H0 не означает, что метрика не изменяется. С достаточной уверенностью утверждать можно только то, что эффект не превосходит MDE (Minimum detectable effect)» (источник 7). Отрицательный результат теста говорит о чувствительности прибора, не об отсутствии эффекта.
Сколько трафика нужно, чтобы тест имел смысл
Это главный вопрос, и в пошаговых инструкциях он обычно пропущен. Ниже расчёт по стандартной формуле для двух долей при двустороннем уровне значимости 5% и мощности 80%. В ячейках визиты на каждую группу, общий объём вдвое больше.
| Базовая конверсия | прирост +5% | +10% | +20% | +50% |
|---|---|---|---|---|
| 1% | 637 011 | 163 096 | 42 694 | 7 751 |
| 2% | 315 207 | 80 683 | 21 110 | 3 826 |
| 3% | 207 939 | 53 211 | 13 915 | 2 518 |
| 5% | 122 125 | 31 235 | 8 159 | 1 472 |
| 10% | 57 764 | 14 752 | 3 842 | 687 |
Разберём случай из середины таблицы. Конверсия 2%, гипотеза поднимает её до 2,4%. Прирост относительный, двадцатипроцентный, и для правки интерфейса он крупный. Нужно около 21 100 визитов на группу и 42 200 суммарно, при этом в каждой группе должно накопиться примерно 422 заявки.
Теперь переведём это в календарь.
| Трафик сайта | Срок теста 2% против 2,4% | Какой прирост ловится за месяц |
|---|---|---|
| 1 000 визитов в месяц | 42 месяца | от +166%, то есть с 2,00% до 5,33% |
| 3 000 | 14 месяцев | от +85%, до 3,70% |
| 10 000 | 4 месяца | от +43%, до 2,86% |
| 30 000 | 1,4 месяца | от +24%, до 2,48% |
| 100 000 | 13 дней | от +13%, до 2,26% |
Вывод неприятный и полезный. Сайт с тремя тысячами визитов в месяц ловит за месяц только изменение, которое почти вдвое поднимает конверсию, а таких правок в интерфейсе не бывает. Ниже примерно десяти тысяч визитов в месяц A/B-тестирование деталей страницы перестаёт быть рабочим инструментом, и время дешевле потратить на разбор юзабилити с живыми людьми, записи сессий, скорость загрузки и качество трафика. Крупная перестройка страницы, меняющая предложение целиком, проверяема и на среднем трафике: ловить там надо не доли процента.
Цена ранней остановки
Теперь тест запущен, отчёт обновляется ежедневно, и смотреть в него хочется так же часто. Именно здесь статистика ломается, причём незаметно.
Механизм такой. Порог значимости 5% обещает, что при отсутствии настоящей разницы тест ошибётся в одном случае из двадцати. Обещание относится к одной проверке на заранее назначенной выборке, а каждый новый взгляд в отчёт это отдельный розыгрыш той же лотереи, в которой выигрыш засчитывается, если сошлось хотя бы однажды.
Ниже прямая проверка: две группы с одинаковой конверсией 2%, разницы нет вовсе, тест останавливается при первом же p-value ниже 0,05. Двести тысяч прогонов на строку.
| Сколько раз заглянули в отчёт | Доля прогонов, где тест показал «значимую» разницу |
|---|---|
| 1 (только в конце) | 5,0% |
| 2 | 8,3% |
| 5 | 14,2% |
| 10 | 19,4% |
| 20 | 24,8% |
| 50 | 31,9% |
Первая строка подтверждает, что расчёт исправен: без подглядываний ошибка равна обещанным 5%. Дальше она растёт до трети. Независимая оценка того же порядка есть в работе о непрерывном мониторинге A/B-тестов: даже при десяти тысячах наблюдений, объёме для онлайн-тестов обычном, ошибка первого рода легко вырастает впятеро (источник 8).
Второе следствие объясняет знакомую картину, когда победа рассасывается. При десяти промежуточных проверках досрочная остановка с «победителем» случается в 18,6% прогонов, и у 77,7% из них разница исчезает, если довести тест до полной выборки. Её не съел сезон: её не существовало.
Лечится это тремя способами: выборку и срок фиксируют до старта и открывают отчёт один раз; берут методы последовательного анализа, рассчитанные на непрерывный просмотр (источник 8); либо смотрят промежуточные цифры как на здоровье теста, без права принять по ним решение.
Что тестировать бесполезно или нельзя
Несколько изменений сразу. Справка Varioqub описывает риск на примере: если одновременно идут эксперимент с цветом кнопки и эксперимент с описанием товара, посетитель попадает в оба и видит оба изменения, что влияет на результаты (источник 9). Развести эксперименты можно настройкой взаимных исключений, но суммарная доля аудитории у непересекающихся экспериментов не может превышать 100%, и на небольшом трафике параллельная работа упирается в тот же дефицит визитов.
Сезонные и праздничные периоды. Поведение в предновогоднюю неделю на февраль не переносится. Тест, начатый в понедельник и оборванный в четверг, меряет ещё и разницу между днями недели, поэтому срок назначают целым числом недель.
Ситуации, где одна аудитория видит оба варианта. Деление держится на куке одного браузера, поэтому человек, открывший сайт с рабочего компьютера и с телефона, увидит обе версии. То же бывает, когда в решении участвуют несколько сотрудников заказчика, когда ссылка ушла в мессенджер со скриншотом и когда аудитория узкая, а участники общаются между собой.
Карточки на маркетплейсах. Витрина чужая, и деления трафика у продавца нет. Площадки дают собственные механизмы: у Wildberries в справочном центре описано А/Б-тестирование главного фото карточки (источник 10). Работают они по правилам площадки, и расчёты выше на них напрямую не переносятся. Предмет разобран в статье Продвижение на маркетплейсах.
Отложенные деньги. Повторные покупки, отток и пожизненная ценность клиента проявляются за горизонтом теста, а период эксперимента в Varioqub ограничен 90 днями (источник 2). Здесь работает Когортный анализ, а показатели вроде ДРР и ROMI считаются на другой длине наблюдения.
Редкие события. Пять заявок в месяц не дадут значимости ни за какой срок. На таком объёме проверяют разве что микроконверсии выше по воронке, помня, что их рост продаж не гарантирует.
Что делать на практике
- Посчитать размер выборки до запуска и сверить со своим трафиком. Не сходится, тест не запускать.
- Сформулировать гипотезу и назначить одну приёмочную метрику письменно.
- Прогнать A/A-тест на своей разметке: он проверяет исправность деления и целей.
- Назначить срок целым числом недель и не менять его по ходу.
- Не принимать решений по промежуточным цифрам.
- Проверить, что группы вышли сопоставимого размера: заметный перекос означает поломку.
- Смотреть рядом с приёмочной метрикой на деньги: средний чек, цену заявки, долю возвратов.
- Записывать проигравшие тесты. У Microsoft улучшала целевую метрику лишь треть проверенных идей, а в вылизанных интерфейсах вроде Bing и Google доля успеха падает до 10-20% (источник 4).
Частые ошибки
Остановка теста в день, когда цифра понравилась. Выбор метрики после получения результатов. Правка нескольких элементов разом без разведения экспериментов. Перекос в размерах групп, оставленный без проверки. Перенос чужого результата на свой сайт, где кнопка выиграла на чужом трафике и чужой цене. Тест на неделе с распродажей. Вывод «разницы нет» вместо честного «эффект меньше того, что этот тест способен увидеть».
Ограничения и спорные места
Числа в таблицах выше получены расчётом, а не наблюдением. Это модель: стандартная формула для двух долей, двусторонний уровень значимости 5%, мощность 80%, независимые наблюдения. На живом сайте один человек даёт несколько визитов, поведение внутри групп связано, и нужный объём выходит выше расчётного. Насколько выше, публичной оценки для российского малого бизнеса нет.
Инструмент теста сам портит измерение. Визуальный редактор подменяет вёрстку в браузере, из-за чего страница мерцает. Штатное лекарство прячет страницу до загрузки эксперимента, и в примере из справки время ожидания выставлено в 4000 миллисекунд (источник 11). Тест про удобство, добавляющий секунды к показу, меняет ровно то, что измеряет.
Эффект новизны и эффект привычки. Постоянные посетители реагируют на изменение само по себе, не на его смысл. Полная перестройка сайта регулярно проигрывает старой версии на ключевых метриках из-за привыкания к прежнему интерфейсу (источник 4). Разделить привыкание и качество правки коротким тестом не выходит.
Значимость не равна размеру эффекта. Слабый по мощности тест чаще промахивается, и это половина беды: найденное он вдобавок раздувает. В расчёте для настоящего прироста с 2,00% до 2,20% тест на группе в 3 000 визитов замечает эффект в 8% случаев и, когда замечает, показывает в среднем +54% вместо настоящих +10%. На группе в 10 000 замечает в 16% случаев и показывает +27%. На полноценных 80 700 визитах замечает в 80% случаев и показывает +11%. Отсюда разрыв между обещаниями теста и выручкой в отчёте за квартал.
Спор о методе не закрыт. Частотный подход с p-value и байесовский подход с вероятностью превосходства расходятся на пограничных данных. Varioqub считает часть метрик критерием Манна-Уитни, а конверсию по пользователям методом Байеса, показывая вероятность превосходства тестового варианта (источники 7, 12). Отраслевого соглашения о том, какой ответ главный, нет.
Победа в тесте не означает, что вариант хорош. Она значит лишь то, что он обошёл второй из двух написанных, и о непридуманных тест молчит. Поток идей остаётся человеческой работой, которую приём не заменяет.
Что здесь быстро устаревает
- Набор доступных инструментов. Google Optimize закрылся 30 сентября 2023 года со всеми активными экспериментами (источник 5).
- Тарифы, лимиты и настройки Varioqub, включая динамическое распределение трафика (источники 2, 13).
- Правила площадок по экспериментам в рекламе и требования к объёму данных в Директе (источник 6).
- А/Б-инструменты маркетплейсов: состав, лимиты, условия подписки (источник 10).
- Механика идентификации в браузерах: деление держится на куке, и ужесточение правил её хранения бьёт по точности разметки.
См. также
Источники
- Яндекс. Эксперименты Varioqub. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/ (проверено 11.09.2026)
- Яндекс. Создание эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create.md (проверено 11.09.2026)
- Fisher R. A. The Design of Experiments. Oliver and Boyd, Эдинбург, 1935.
- Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020, глава 1. https://experimentguide.com/wp-content/uploads/TrustworthyOnlineControlledExperiments_PracticalGuideToABTesting_Chapter1.pdf (проверено 11.09.2026)
- Google. [Sunset September 2023] Google Optimize. Analytics Help, 2023. https://support.google.com/optimize/announcements/9176329 (проверено 11.09.2026)
- Яндекс. A/B-эксперименты. Справка Яндекс Директа, 2026. https://yandex.ru/support/direct/ru/campaigns/experiments (проверено 11.09.2026)
- Яндекс. Отчет о результатах эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/stat.md (проверено 11.09.2026)
- Johari R., Pekelis L., Walsh D. Always Valid Inference: Continuous Monitoring of A/B Tests. arXiv:1512.04922, версия от 16.07.2019. https://arxiv.org/abs/1512.04922 (проверено 11.09.2026). Тот же материал в докладе: Johari R., Koomen P., Pekelis L., Walsh D. Peeking at A/B Tests: Why It Matters, and What to Do about It. KDD '17, с. 1517-1525
- Яндекс. Пересечения с экспериментами. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create/intersections.md (проверено 11.09.2026)
- Wildberries. А/Б-тестирование главного фото в карточке товара. Справочный центр WB Partners, 2026. https://seller.wildberries.ru/instructions/ru/ru/material/main-photo-ab-testing (проверено 11.09.2026)
- Яндекс. Скрытие страницы до начала эксперимента. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/anti-flicker.md (проверено 11.09.2026)
- Яндекс. Расчет метрик методом Байеса. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/stat/bayes.md (проверено 11.09.2026)
- Яндекс. Распределение трафика. Справка Varioqub, 2026. https://yandex.ru/support/varioqub/ru/create/traffic-distribution.md (проверено 11.09.2026)