Как читать результат A/B-теста

Разбираю значимость и типичные ошибки
Аналитика

Инструменты 2026 года все чаще показывают не привычную значимость, а байесовскую «вероятность, что B лучше», а ИИ-генерация вариантов множит число прогоняемых тестов. И то и другое повышает риск ложного победителя на этапе чтения: красивую цифру выносят в заголовок отчета, а доверительный интервал и практический смысл остаются в деталях. Эта статья - про то, как прочитать готовый результат в любом инструменте, частотном или байесовском.

Тест отработал, инструмент показал таблицу, вариант B сверху, конверсия выше. Рука тянется внедрить B. И вот здесь рождаются дорогие ошибки: одна цифра прироста обманывает чаще, чем помогает.

Прочитать результат - это отдельный навык, не тот же самый, что запустить тест. Запустить может почти любая платформа в пару кликов. А вот отличить достоверную разницу от случайного разброса по силам не каждому, кто смотрит в отчет. Из-за этого команды катят изменения, которые ничего не двигают, или вовсе режут конверсию, прикрываясь красивым числом значимости.

Эта статья - про то, как читать итоговый результат A/B-теста так, чтобы не обмануться. Подход универсальный: логика одинаковая для отчета любого инструмента, от встроенного эксперимента в конструкторе до отдельной CRO-платформы.

Что показывает результат A/B-теста

Главная ошибка чтения - смотреть на одно число. Результат теста - это не «B лучше на 12%». Это три величины: конверсия контроля (вариант A), конверсия вариации (вариант B) и неопределенность вокруг разницы между ними.

Нормальный отчет показывает по каждому варианту: сколько посетителей попало, сколько из них сконвертировалось, конверсию в процентах, прирост вариации над контролем и цифру статистической значимости (statistical significance). В хорошем отчете рядом стоит доверительный интервал (confidence interval) - и без него выводы делать рано.

Напомню устройство теста коротко, без этого не прочитать таблицу. Контроль - это вариант A, базовая версия. Вариация - вариант B, где изменен один элемент: заголовок, текст кнопки, форма, расположение блока. Трафик делится случайно, классика - поровну, 50 на 50. Переменная одна, иначе непонятно, что дало эффект.

Условный пример. Онлайн-школа в Алматы тестирует заголовок лендинга. Вариант A - старый заголовок, вариант B - новый. A: 4000 посетителей, 128 заявок, конверсия 3,2%. B: 4000 посетителей, 144 заявки, конверсия 3,6%. Прирост +0,4 процентного пункта, или +12,5% относительно контроля. Выглядит как победа. Победа ли это - решают следующие две цифры, не прирост сам по себе.

Здесь же кроется ловушка единиц. Прирост показывают двумя способами, и их путают. Абсолютный прирост - это разница в процентных пунктах: с 3,2% до 3,6% получается +0,4 пункта. Относительный прирост - та же разница в процентах от базы: те же +0,4 пункта дают +12,5% к исходной конверсии. Относительная цифра всегда крупнее и красивее, ее любят в презентациях. При чтении держите в голове обе: «+12,5%» звучит весомо, пока не вспомните, что это +0,4 пункта на скромной базе.

Делюсь практикой и разборами по performance‑маркетингу
подписаться →
@marataxanov

Статистическая значимость: что значат 95 процентов

Значимость отвечает на один вопрос: если бы разницы между A и B на самом деле не было, насколько вероятно увидеть такой разрыв случайно?

Под значимостью лежит p-значение (p-value) - вероятность получить наблюдаемый или еще более крайний результат при условии, что разницы нет (нулевая гипотеза верна). До старта теста задают уровень значимости (alpha), обычно 0,05. Если p-значение меньше 0,05, результат считают статистически значимым: такой разрыв маловероятно объяснить чистой случайностью.

95% значимости - это и есть alpha 0,05. И вот здесь самая частая ловушка чтения. Фраза «значимость 95%» читается многими как «вероятность 95%, что B лучше». Это неверно. На самом деле она означает: будь A и B одинаковыми, разрыв такого размера всплыл бы случайно в 5% тестов. Это утверждение про данные в предположении «разницы нет». Про вероятность выигрыша B оно ничего не говорит.

Стопроцентной уверенности не бывает. Даже на 95% остается 5% шанс, что «победа» - случайность. Прогоните достаточно тестов на пороге 95%, и часть «победителей» окажется случайными колебаниями.

И помните, чего значимость не делает. Она не говорит, насколько велик эффект: для размера эффекта нужны прирост и доверительный интервал. Она не обещает, что разница удержится в будущем на другом трафике. И она не учитывает, сколько вариантов и срезов вы проверили: чем больше проверок, тем больше случайных «находок» на том же пороге. Значимость отвечает на узкий вопрос про один разрыв, не на все вопросы о тесте сразу.

Практический пол для чтения: многие команды хотят минимум 90% значимости, лучше 95%, плюс достаточно конверсий на вариант (например, от 50) и хотя бы несколько дней набора. Высокая цифра значимости на 12 конверсиях хрупкая: пара случайных заявок переворачивает вывод. Сколько данных собрать и когда тест можно останавливать - тема отдельной статьи про момент остановки теста.

Доверительный интервал: почему «плюс 12 процентов» ничего не решает

Прирост в отчете - это точечная оценка, посчитанная по выборке. Она не равна правде обо всех будущих посетителях. Диапазон, в котором с большой вероятностью лежит истинный эффект, показывает доверительный интервал.

Возьмем прирост +12,5% из примера выше. Допустим, доверительный интервал 95% получился [-3%; +28%]. Диапазон захватывает ноль - значит, истинный эффект может оказаться и отрицательным. Победителя нет, какой бы привлекательной ни была точечная оценка.

Узкий интервал означает больше данных и больше определенности. Широкий интервал - данных мало, и «победа» может обернуться чем угодно. Ширина интервала напрямую показывает, насколько доверять заголовку отчета. Многие отчеты выносят прирост крупным шрифтом, а интервал прячут в детали или не показывают вовсе. Если интервала в отчете нет, считайте, что половину результата вы не видите, и ищите его в настройках или в выгрузке.

Правило чтения короткое и жесткое. Если доверительный интервал включает ноль (или включает значение «разницы нет») - тест победителя не нашел. Точка. Положительной точечной оценки для вывода недостаточно.

Условный пример. Сервис доставки в Ташкенте сравнивает две версии формы заказа. Версия B дает +8% к завершению заказа, интервал [+1%; +15%] - нижняя граница выше нуля, вывод устойчивый, можно внедрять. Другой тест на той же форме: прирост +20%, но интервал [-5%; +45%] - шире и пересекает ноль. Вторая цифра крупнее первой, а доверия к ней меньше. Объявлять победу по +20% рано из-за широкого интервала.

Ложные победители: где чтение результата подводит

Ложный победитель - это вариация, объявленная лучшей, хотя на деле она не лучше. Большая часть таких ошибок рождается не в механике теста, а при чтении отчета. Вот где спотыкаются.

  • Значимость без практического смысла. Результат статистически значим, но прирост ничтожен: +0,1 процентного пункта на огромной выборке. Математика разницу подтверждает, бизнесу она не дает ничего. Об этом - в следующем разделе.
  • Интервал захватывает ноль. Точечная оценка положительна, но доверительный интервал тянется в отрицательную зону или касается нуля. Победы нет, как бы ни тянуло ее увидеть.
  • Подбор сегмента после теста. Общий результат плоский, но в одном срезе - мобильные из Баку, новые посетители - вариант B выигрывает. Чем больше срезов перебрать, тем выше шанс наткнуться на случайный «выигрыш». Это гипотеза для следующего теста, не вывод текущего.
  • Слишком мало конверсий. 95% значимости на 15-20 конверсиях на вариант - цифра ломкая. Один-два случайных заказа разворачивают результат. Смотрите на число конверсий в штуках, а не только на проценты.
  • Технически некорректный тест. Доли трафика разъехались: вместо 50 на 50 вышло 60 на 40 (расхождение долей трафика, sample ratio mismatch). Страница мерцала при загрузке (flicker). Один вариант грузился медленнее другого. Любой из этих сбоев обесценивает данные, и красивая значимость ничего не стоит. A/A-тест - две одинаковые версии до запуска эксперимента - проверяет саму платформу: если «разница» вылезает там, где ее быть не может, инструменту верить нельзя.

Есть еще одна причина ложного победителя, и она лежит за пределами чтения отчета: ранняя остановка теста, как только мелькнула значимость (подглядывание, peeking). Это вопрос момента остановки и объема данных, он разобран в статье про момент остановки теста.

Практическая значимость: стоит ли победа внедрения

Статистическая значимость говорит, что разница не случайна. Практическая значимость (practical significance) спрашивает о другом: разница достаточно велика, чтобы ради нее что-то менять?

На большой выборке значимым становится почти любой микросдвиг. Прирост +0,05 процентного пункта на трафике в сотни тысяч визитов будет статзначимым и бизнес-бессмысленным, если внедрение стоит недели разработки. Значимость тут есть, смысла нет.

Поэтому до теста задают минимальный различимый эффект (minimum detectable effect, MDE) - наименьший прирост, ради которого изменение стоит катить. Результат читают относительно этой черты. Значимый прирост ниже MDE - это не победа к внедрению. Это сигнал, что менять незачем.

И читайте победу в деньгах, а не только в процентах. Прирост +12% к конверсии, который добавляет к среднему чеку 30 центов, и те же +12% на дорогой B2B-заявке - это разные деньги. Тест умеет выигрывать на верхней метрике воронки (клики, добавления в корзину) и не двигать ничего ниже: верхняя часть воронки учится быстрее, но не равна бизнес-результату. Как разрывы между шагами связаны с деньгами - в материале про чтение воронки конверсии.

Условный пример. Интернет-магазин в Тбилиси: вариант B поднимает добавления в корзину на 9% (значимо), но завершенные заказы не двигаются с места. Выигрыш застрял выше по воронке и до денег не дошел. Внедрять такую «победу» рано.

Перевод прироста в деньги отсекает большую часть пустых побед. Условный расчет: клиника в Ташкенте получает 2000 заявок в месяц, конверсия лендинга растет на значимые, но скромные +0,3 пункта. В абсолюте это десяток-полтора дополнительных заявок, и если внедрение требует двух недель разработки, выигрыш не окупает работу в обозримый срок. Те же +0,3 пункта на потоке в 50 000 заявок - совсем другой разговор. Цифра одна, ценность зависит от масштаба.

Частотный и байесовский результат: почему две цифры разные

В зависимости от инструмента отчет говорит либо «значимость 95%» (частотный подход, frequentist), либо «вероятность, что B лучше A - 92%» (байесовский подход, Bayesian). Это ответы на разные вопросы, и переносить формулировку с одной на другую нельзя.

Частотный подход рассуждает о данных в предположении «разницы нет»: отсюда p-значение, значимость, доверительный интервал. Байесовский считает напрямую вероятность того, что B обходит A, и на сколько - через апостериорное распределение (теорема Байеса: апостериор равен правдоподобию, умноженному на априор, деленному на свидетельство).

Большинство инструментов для малого трафика используют байесовский подход: на скромных данных он мягче и дает понятную формулировку «вероятность выигрыша». Частотный строже и требует заранее рассчитанного размера выборки (sample size).

Условный пример того, как одна формулировка подменяет другую. B2B-сервис в Баку гоняет тест на байесовском инструменте, и отчет говорит: «вероятность, что B лучше A - 88%». Маркетолог пишет руководству «значимость 88%» и внедряет B. Ошибка двойная. Сначала 88% вероятности выигрыша подменили частотной значимостью, хотя это два разных числа. Затем 88% само по себе ниже привычного порога уверенности: остается заметный шанс, что выигрыша нет вовсе. Цифру переписали в чужих терминах и заодно завысили ожидания.

Ловушка чтения здесь двойная. Не переносите частотную фразу на байесовскую цифру: «вероятность 92%, что B лучше» - это не «значимость 92%». И не сравнивайте лоб в лоб две цифры из двух разных инструментов: они посчитаны по-разному и означают разное. Для чтения отчета достаточно понимать, в какой логике посчитан ваш конкретный инструмент.

Сегменты: подсказка для следующего теста, не вывод этого

Плоский общий результат с ярким сегментом - самый соблазнительный ложный победитель. Глаз цепляется за срез, где B наконец-то выигрывает, и рука тянется внедрить изменение для всех.

Почему это обманывает: каждый дополнительный срез - это еще одна проверка. Переберите десяток срезов, и один-два покажут «значимый» эффект случайно (проблема множественных сравнений). Чем глубже копать постфактум, тем выше шанс выкопать случайность.

Правильное чтение: всплеск в сегменте - это гипотеза, не готовый вывод. Сформулируйте ее и проверьте отдельным тестом, нацеленным на этот сегмент с самого начала. Тогда выборка набирается под него, и результат получается честным. Механика построения сегментов в конкретном инструменте - отдельная тема, она разобрана в статье про сегменты и фильтры Clarity. Здесь речь только о том, как прочитать сегментированный результат и не обмануть себя.

Условный пример. Тест формы в Ереване: общий эффект нулевой, но срез «новые посетители с мобильных» дает +15%. Внедрять по этому срезу нельзя. Ставим новый тест только на новых мобильных и смотрим, держится ли прирост на выборке, которая собрана под них.

Чек-лист чтения готового результата

Прежде чем назвать вариант победителем, прогоните результат по короткому списку. Он не про то, когда останавливать тест: объем данных и момент остановки разобраны в статье про остановку теста. Этот список про то, как прочитать уже собранный итог.

  • Доли трафика сошлись близко к запланированным (50 на 50 в классике). Сильный перекос - признак технического сбоя, результату верить рано.
  • Конверсий на вариант достаточно в абсолюте, а не только высокий процент значимости. Десяток конверсий - не основание для вывода.
  • Порог значимости достигнут: 95% как стандарт, 90% как минимум для черновых решений.
  • Доверительный интервал не захватывает ноль. Если захватывает - победителя нет, и положительная точечная оценка дела не меняет.
  • Прирост выше минимального различимого эффекта и осмыслен в деньгах, а не только в процентах.
  • Находки по отдельным сегментам помечены как гипотезы для следующего теста, не как готовые выводы.

Проваленный пункт означает, что «победа» нуждается в перепроверке. Прочитать результат честно дешевле, чем внедрить ложного победителя и потом искать, почему конверсия не сдвинулась.

От прочитанного результата к деньгам

Верно прочитанный победитель, который поднимает конверсию, снижает стоимость заявки и стоимость привлечения при том же трафике: тот же бюджет приносит больше клиентов. Связь прироста конверсии со стоимостью привлечения разобрана в материале про LTV и CAC для маркетолога.

Ложно объявленный победитель работает наоборот. Команда внедряет изменение, тратит на это квартал, метрика не двигается или проседает, а причину ищут где угодно, только не в той «победе», которой по-честному не было.

Чтение результата - это фильтр между гипотезой и бюджетом. Несколько минут на доверительный интервал стоят дешевле, чем квартал, потраченный на изменение, которого в данных не было. Что делать с прочитанным результатом дальше - внедрять, документировать, запускать следующую итерацию - это CRO-цикл целиком, он разобран в статье про путь от гипотезы к приросту.

Коротко

  • Результат A/B-теста - это три числа, а не одно: конверсия A, конверсия B и неопределенность вокруг разницы.
  • Значимость 95% означает «при отсутствии разницы такой разрыв случаен в 5% тестов», а не «вероятность 95%, что B лучше».
  • Доверительный интервал важнее точечной оценки: если он захватывает ноль, победителя нет.
  • Ложный победитель чаще рождается из чтения: значимость без практического смысла, узкая выборка, подбор сегмента постфактум, технически некорректный тест.
  • Практическая значимость и деньги решают, стоит ли внедрять; статзначимость только подтверждает, что разница не случайна.
  • Частотная и байесовская цифры отвечают на разные вопросы - не смешивайте их и не сравнивайте напрямую.

Частые вопросы

Какая значимость нужна, чтобы объявить победителя?

Стандарт - 95%, минимум для черновых выводов - 90%. Но одной значимости мало: нужно достаточно конверсий на вариант (ориентир - от 50) и доверительный интервал, не пересекающий ноль. Высокий процент значимости на десятке конверсий не считается надежным результатом.

Что делать, если тест значим, но прирост крошечный?

Сверьте прирост с минимальным различимым эффектом (MDE) и с деньгами. Статистически значимый, но ниже порога внедрения результат - не повод катить изменение. На большой выборке значимым становится почти любой микросдвиг, и часть таких «побед» бизнесу ничего не дает.

Можно ли доверять победе в одном сегменте, если общий результат нулевой?

Нет, это гипотеза, не готовый вывод. Чем больше срезов перебрать постфактум, тем выше шанс наткнуться на случайный выигрыш. Проверьте находку отдельным тестом, нацеленным на сегмент с самого начала. Подробнее про работу с сегментами - в статье про сегменты и фильтры Clarity.

Чем отличается «значимость 95%» от «вероятности 92%, что B лучше»?

Первое - частотный подход: это про p-значение и данные в предположении, что разницы нет. Второе - байесовский подход: прямая оценка вероятности того, что B обходит A. Это разные вопросы, и две цифры нельзя сравнивать напрямую или переносить формулировку с одной на другую.

Тест показал победителя быстро - можно останавливать?

Скорая значимость часто обманчива: если останавливать тест в момент, когда впервые мелькнул нужный процент, доля ложных побед растет (подглядывание). Когда тест действительно можно останавливать и сколько данных для этого нужно - в статье про момент остановки теста.

A/A-тест показал разницу - это нормально?

Нет. A/A-тест сравнивает две одинаковые версии, и значимой разницы там быть не должно. Если она появляется, это сигнал проблемы в самой платформе теста или в разметке. До доверия результатам обычных тестов инструмент нужно починить.

Об авторе

Марат Аксанов, performance‑маркетолог. 12 лет в маркетинге и медиа.

Сертифицированный специалист DV360, Google Ads и Google Analytics.

Заказать аудит вашего проекта или консультацию:

Марат Аксанов, performance-маркетолог