Все статьи

A/B-тестирование сайта в 2026: как проверять гипотезы и растить конверсию

Содержание
Коротко: A/B-тест оправдан от нескольких тысяч визитов в месяц - меньше трафика значит тест растянется на месяцы и утонет в сезонности. Значимость проверяют на уровне 95%, размер выборки считают заранее, тест не останавливают раньше срока. В России бесплатный встроенный инструмент - Вариокуб в Яндекс.Метрике; для сложных сценариев есть self-hosted GrowthBook и PostHog.

A/B-тест - это когда двум группам посетителей показывают разные версии страницы и по данным, а не по вкусу дизайнера, решают, какая работает лучше. Оправдан он не всегда: если на сайт приходит меньше пары тысяч визитов в месяц, тест будет ползти неделями и в итоге не наберёт статистической значимости. Сначала - трафик и гипотеза, потом - тест. Не наоборот.

Разберём случай. У клиента с онлайн-школой английского было ощущение, что кнопка "Записаться на пробный урок" теряется на фоне. Трафик - 40 000 визитов в месяц, конверсия в заявку - 3.1%. Поменяли цвет кнопки на контрастный оранжевый, запустили тест через Вариокуб на две недели. Результат: разница в 0.4 п.п. в пользу нового варианта, но при p-value 0.18 - недостаточно, чтобы делать выводы. Кнопка оказалась не проблемой. Настоящей причиной низкой конверсии была форма из семи полей на следующем шаге - её сократили до трёх, и уже это дало прирост конверсии на 22% за месяц.

Мораль простая: тест экономит деньги именно потому, что показывает, где ваша гипотеза была неправильной.

Что такое A/B-тест и когда он вообще нужен

Механика простая: часть трафика видит контрольный вариант A, часть - изменённый B, система случайно распределяет посетителей и считает, в какой группе выше целевое действие - заявка, покупка, клик.

Смысл теста не в том, чтобы "попробовать что-то новое". Смысл - отделить реальный эффект от случайных колебаний. Без достаточного трафика колебания и есть весь ваш результат.

Ориентировочные пороги по объёму трафика (по практике агентств и данным отраслевых разборов searchindustrial.ru):

Трафик в месяц Что нужно для честного теста
До 10 000 визитов Тест реалистичен только при высокой базовой конверсии (от 25%) или при тестировании крупных изменений с большим эффектом
10 000-100 000 визитов Достаточно конверсии от 9% для теста за разумный срок (2-4 недели)
100 000-1 000 000 визитов Хватает конверсии 2-9% - это диапазон большинства интернет-магазинов
Свыше 1 000 000 визитов Можно тестировать даже эффекты в десятые доли процента

Цифры в таблице - ориентир, не догма. Реальный расчёт всегда идёт через калькулятор размера выборки с вашей собственной базовой конверсией; об этом - в разделе про статистическую значимость.

А если трафика меньше порога? Тогда A/B-тест - не ваш инструмент. Правильнее посмотреть Вебвизор и карту кликов в Метрике и чинить очевидные проблемы руками - мы подробно разбирали этот подход в статье про CRO и убийц конверсии.

Что тестировать в первую очередь

Не всё сразу. И точно не всё одновременно в одном тесте - если поменять заголовок, картинку и кнопку разом, вы не узнаете, что именно сработало.

Заголовок и оффер. Одна перефразированная строка меняет CTR кнопки на 10-20% - это один из самых дешёвых тестов с потенциально самым большим эффектом.

CTA-кнопка. Текст, цвет, размер, положение на странице. Личная формулировка вместо безличной, контраст с фоном, расстояние от других элементов - три переменные, которые стоит проверять по отдельности, а не разом.

Форма заявки. Количество полей, порядок вопросов, разбивка на шаги против одной длинной формы. По данным разборов рынка, сокращение полей формы даёт в среднем 20-25% прироста конверсии - но иногда, как в примере выше, эффект даёт не форма на первом экране, а следующий шаг воронки.

Цена и условия. Формат отображения цены, наличие рассрочки, "от" против точной суммы, скидка в процентах против скидки в рублях. Тестировать саму цену стоит осторожно - здесь легко испортить прибыль ради красивой цифры конверсии.

Ещё тестируют структуру страницы, порядок блоков, длину текста, наличие отзывов на первом экране. Но если бюджет теста ограничен - начинайте с заголовка и формы. Именно там обычно живёт самый крупный эффект.

Есть и то, что тестировать почти бессмысленно на низком трафике: мелкие правки типографики, оттенок серого в подвале, порядок пунктов в футере. Эффект от таких изменений настолько мал, что для его обнаружения нужна выборка в сотни тысяч визитов - большинству сайтов такой трафик просто недоступен. Тратить недели теста на подвал сайта, когда форма заявки теряет треть заявок - плохое распределение ресурсов.

Как провести тест правильно

Гипотеза - это прогноз, а не пожелание

"Хочу протестировать кнопку" - не гипотеза. Гипотеза звучит так: "Если заменить синий CTA на оранжевый, конверсия страницы вырастет, потому что оранжевый контрастнее фона и заметнее на скролле". У гипотезы есть изменение, ожидаемый эффект и объяснение почему. Без объяснения "почему" вы не поймёте результат теста, даже если он окажется значимым.

По нашей практике, слабое место почти всегда не в формулировке варианта B, а именно в объяснении "почему". Если на вопрос "почему вы думаете, что это сработает" ответ звучит как "ну, обычно так делают конкуренты" - это не гипотеза, а копирование чужого решения без понимания причины. У конкурента могла быть другая аудитория, другой трафик, другая задача.

Размер выборки считают до старта, не во время

Три параметра нужны заранее: базовая конверсия страницы, минимальный эффект, который вам важен поймать (MDE), и уровень доверия. Стандарт индустрии - значимость 95% (Z-score 1.96) и статистическая мощность 80% (Z-score 0.84). Чем меньший эффект вы хотите обнаружить, тем больше трафика потребуется - разница между "поймать +5 п.п." и "поймать +1 п.п." может быть в разы по объёму нужной выборки. Для расчёта под свои цифры есть бесплатные калькуляторы, например у Романа/ROMI center или у AB Tasty.

Срок - минимум полный цикл, обычно 1-2 недели

Тест короче недели не захватывает разницу в поведении в будни и выходные. Для e-commerce минимальный срок - две недели, а для B2B с длинным циклом сделки иногда и дольше. Останавливать тест раньше срока, даже если "уже видно победителя" - именно так рождается большинство ложных выводов.

Не подглядывайте в результаты каждый день

Это отдельный пункт не случайно - проблема подглядывания (peeking problem) считается главной причиной провала A/B-тестов на практике. Суть в том, что при частой проверке промежуточных данных вы фактически проверяете не одну гипотезу, а десятки - и рано или поздно p-value случайно провалится ниже 0.05. По расчётам GoPractice, уже 2 проверки искажают p-value примерно в 2 раза, 5 проверок - в 3.2 раза. При ежедневном мониторинге двухнедельного теста вероятность ложноположительного результата доходит до 40%, даже если реального эффекта нет вообще.

Смотреть на динамику можно. Принимать решение до конца заранее рассчитанного срока - нельзя.

Инструменты: от бесплатного Вариокуба до self-hosted

Google Optimize закрыт, и равноценной бесплатной замены такого же масштаба на рынке так и не появилось.

Для сайтов, которые уже используют Яндекс.Метрику - а в России это почти всегда так, ведь мы работаем только с ней, не с Google Analytics - логичная точка входа это Вариокуб. Инструмент встроен прямо в интерфейс Метрики, бесплатная базовая версия покрывает большинство задач малого и среднего бизнеса, есть визуальный редактор вариантов без привлечения разработчика и статистика на основе MDE и p-value. Платные тарифы добавляют число одновременных экспериментов и метрик - но начинать можно бесплатно.

Инструмент Модель Для кого
Вариокуб (Яндекс.Метрика) Бесплатно (базовая), платные тарифы за лимиты Сайты с Метрикой, малый и средний бизнес в РФ
VWO, AB Tasty, Convert Платная подписка, международные E-commerce, крупный трафик, мультивариантные тесты
GrowthBook Open source, self-hosted бесплатно Команды с разработчиками, продуктовая аналитика
PostHog Open source, self-hosted или облако Компании, которым нужны аналитика + эксперименты + фича-флаги в одном месте

GrowthBook распространяется под MIT-лицензией и разворачивается на своём сервере без ограничений по числу экспериментов - разумный вариант, если у вас есть команда разработки и хочется полного контроля над данными. PostHog решает похожую задачу, но тянет за собой всю аналитическую платформу целиком, это уже другой уровень инфраструктурных затрат.

Международные VWO, AB Tasty, Kameleoon и Convert остаются функционально сильнее - мультивариантные тесты, глубокая сегментация, готовые интеграции. Но для большинства российских сайтов с трафиком до нескольких сотен тысяч визитов Вариокуба хватает с запасом, и он уже включён в бесплатный тариф Метрики, который вы и так используете.

Отдельно стоит сказать про оплату зарубежных сервисов - VWO, AB Tasty и подобные выставляют счета в валюте, и для российского юрлица это отдельная головная боль с платежами и закрывающими документами. Ещё один довод в пользу Вариокуба или self-hosted решения: не нужно решать проблему, которой в принципе могло не быть.

При выборе между Вариокубом и GrowthBook ориентир простой. Если тестируете элементы интерфейса - кнопки, формы, тексты, блоки - и у вас нет отдельной команды разработки, берите Вариокуб: визуальный редактор позволяет собрать вариант без единой строчки кода. Если тестируете логику продукта, ценообразование, воронку в приложении - там, где нужен доступ к серверным данным и собственная аналитическая база - смотрите в сторону GrowthBook.

Частые ошибки, которые обнуляют результат теста

  • Тестировать несколько изменений сразу и потом гадать, что именно сработало
  • Смотреть на результаты каждый день и останавливать тест, как только увидели зелёную цифру
  • Не считать размер выборки заранее, а "смотреть по ощущениям, когда хватит"
  • Запускать тест на трафике, которого объективно не хватает для нужного эффекта
  • Игнорировать сезонность - тест на майских праздниках не равен тесту в обычную неделю
  • Тестировать элемент, который вообще не влияет на конверсию, вместо того чтобы сначала найти реальное узкое место через Вебвизор

Кстати, про последний пункт - именно поэтому CRO-аудит логично идёт перед запуском тестов, а не вместо них. Сначала находите, где реально теряются заявки, потом проверяете гипотезу тестом, а не наоборот.

Ещё одна вещь, которую часто упускают: результат теста на одной странице не переносится автоматически на другую, даже похожую. Оранжевая кнопка выиграла на лендинге - не значит, что она выиграет в карточке товара. Аудитория, контекст, ожидания пользователя - всё другое.

Тестируйте то, что реально влияет на деньги

A/B-тест - не про эстетику и не про "а вдруг понравится". Это способ не тратить бюджет на изменения, которые кажутся хорошей идеей, но не работают. Если трафика достаточно - считайте выборку заранее, формулируйте гипотезу с объяснением "почему", и не трогайте результат до конца срока. Если трафика не хватает - не мучайте A/B-тест, идите смотреть Вебвизор и чините очевидное руками.

Частые вопросы

Сколько трафика нужно для A/B-теста?

Зависит от текущей конверсии и желаемого эффекта. Для магазина с конверсией 2-3% и трафиком в несколько тысяч визитов в месяц честный тест обычно требует 3-6 недель. Меньше 1000-2000 визитов на вариант в месяц - тест почти всегда даст шум вместо результата.

Через сколько дней можно смотреть на результат теста?

Не раньше, чем закончится заранее определённый срок - обычно 1-2 полных недели. Ежедневная проверка и остановка теста при первом p-value ниже 0.05 - главная причина ложных побед.

Чем заменить Google Optimize в 2026 году?

Полноценного бесплатного аналога того же масштаба нет. Для сайтов в России - Вариокуб внутри Яндекс.Метрики. Для сложных сценариев - GrowthBook или PostHog, self-hosted и бесплатно.

Можно ли тестировать сайт с трафиком 500 визитов в месяц?

Технически да, честно - нет. Эксперимент растянется на месяцы, а за это время поменяется сезон и реклама. Проще и надёжнее: Вебвизор плюс точечные правки.

Что делать, если тест не дал победителя?

Оставить старый вариант, сформулировать следующую гипотезу. Ничья - тоже результат: элемент не так критичен, ресурсы стоит направить в другое место воронки.

Настроим A/B-тестирование для вашего сайта

Проверим, хватает ли вам трафика для честного теста, сформулируем гипотезы и настроим эксперимент - в Вариокубе через Яндекс.Метрику или на стороннем стеке. Без накрутки значимости и решений на глаз.