Статья

Как проводить A/B-тесты в интернет-магазине: метрики, этапы и примеры роста

Как проводить A/B-тесты в интернет-магазине: метрики, этапы и примеры роста

A/B-тестирование — это способ проверить идею на реальных пользователях до того, как выкатывать ее на всю аудиторию. Одной группе показывают текущий вариант, другой — новый, а затем сравнивают результат по заранее выбранной метрике.

Для крупного интернет-магазина A/B-тесты — это не только про цвет кнопки. Они помогают растить CTR промо, конверсию в покупку, средний чек, выручку, продажи фокусных категорий, количество товаров в заказе и повторные покупки.

Возьмем пример онлайн магазина продуктов питания и товаров повседневного спроса. Если у магазина более 400 тысяч пользователей в месяц, то даже рост на 2-4% может дать заметный финансовый эффект. 

Как проходит A/B-тестирование

Хороший тест начинается с гипотезы. Она должна отвечать на четыре вопроса: что меняем, для кого, какую метрику хотим улучшить и почему это должно сработать.

Например: «Если мы покажем новым пользователям стартовую корзину с базовыми товарами, то конверсия в первую покупку вырастет, потому что покупателю будет проще собрать первый заказ».

Дальше выбирается основная метрика. По ней команда принимает решение. Для промо это может быть CTR, для поиска — добавления в корзину и выручка поисковых сессий, для корзины — средний чек и конверсия в оформление, для товарных рекомендаций — выручка после клика или добавления.

Рядом нужны защитные метрики. Они показывают, что рост одного показателя не сломал другой. Например, можно увеличить средний чек, но нельзя допустить падения конверсии в покупку. Можно продвигать фокусную категорию, но нельзя просадить общую выручку.

После этого рассчитывают выборку, делят аудиторию на группы, запускают тест и ждут достаточного объема данных. Завершается тест анализом: команда смотрит uplift, статистическую надежность результата, сегменты и влияние на защитные метрики.

Сколько должен длиться тест

Минимально A/B-тест должен проходить полный бизнес-цикл. В e-commerce обычно это не меньше 1-2 недель, чтобы захватить будни, выходные и колебания спроса. Если есть сезонность, акции, зарплатные дни или крупные промо, их нужно учитывать отдельно.

Тест не стоит завершать только потому, что в первые дни один вариант выглядит лучше. Ранние колебания часто оказываются случайными.

Сколько нужно трафика

Трафик зависит от базовой метрики и ожидаемого эффекта. Чем ниже конверсия и чем меньше ожидаемый uplift, тем больше пользователей понадобится.

Если команда хочет доказать рост конверсии с 2.0% до 2.1%, выборка должна быть большой. Если тестируемая механика может поднять показатель с 2.0% до 3.0%, данных понадобится меньше. Поэтому проектам с небольшим трафиком лучше тестировать заметные изменения, а не микроправки.

Выборку считают от текущей метрики, минимального эффекта, который бизнесу важно заметить, уровня значимости и мощности теста. На практике вопрос звучит так: «Какой минимальный рост оправдывает внедрение?»

Чтобы сделать предварительные расчеты на этапе планирования А/В теста, используйте онлайн калькулятор A/B тестов.

Что такое статистическая значимость и uplift

Статистическая значимость показывает, насколько вероятно, что разница между вариантами возникла не случайно. Если вариант B дал больше покупок, это еще не значит, что он действительно лучше: возможно, группе B просто повезло с аудиторией.

Uplift — это изменение метрики относительно контрольной группы. Он бывает позитивным и негативным. Если конверсия выросла с 5% до 5.5%, uplift составляет +10% относительно исходного уровня. Если средний чек снизился с 7713 до 7400, uplift будет негативным.

Важно смотреть не только знак uplift, но и бизнес-смысл. Рост CTR без роста покупок может быть бесполезен. Рост среднего чека при падении конверсии тоже требует осторожности.

Что дает Gravity Field

Gravity Field позволяет запускать A/B-тесты в разных форматах: контентные блоки, баннеры, рекомендации, pop-up, поиск, каталог, корзина, мобильные сценарии, А/В тесты целых лендингов, поисковых движков или каталогов товаров.

Платформа поддерживает байесовскую статистику, показывает вероятность того, что вариант лучший, и помогает оценивать риск ошибки. Кроме классических A/B-тестов, можно тестировать больше двух вариантов — например A/B/C. Но чем больше вариантов, тем больше нужно трафика, потому что аудитория делится между всеми группами.

Еще одна важная возможность — динамическое распределение трафика через Multi-Armed Bandit. Платформа может постепенно отдавать больше показов варианту, который лучше работает для конкретного сегмента или контекста.

Пример 1. Растим CTR и выручку поиска

В Интернет-магазинах продуктов питания пользователи очень часто сразу переходят к поиску. Это сильный сценарий для роста.

Гипотеза: если при фокусе на поисковой строке показывать персональные подсказки — любимые категории, бренды, «часто ищут сегодня», «молоко», «вода», «бытовая химия», — пользователи быстрее перейдут к выбору товаров.

Что измерять: CTR подсказок, долю сессий главной с поиском, добавления из поиска, конверсию поисковых сессий в покупку, выручку поисковых сессий.

В подобной реализации можно рассчитывать на рост использования поиска с главной на 7.0% и рост выручки поисковых сессий на 2.8%.

Пример 2. Увеличиваем первую покупку

Новые пользователи часто смотрят товары, но не собирают первую корзину.

Гипотеза: если показать блок «Соберите первую корзину» с товарами первой необходимости, покупателю будет проще сделать первый заказ. В блок можно включить молоко, яйца, хлеб, воду, овощи, бытовую химию. Выдача должна учитывать наличие в городе, цену и ограничения по категориям.

Что измерять: конверсию в первую покупку, выручку на нового пользователя, добавления в корзину с главной, средний чек первого заказа, число товарных позиций.

В  данном сценарии ожидаемый эффект — +4.8% к первой покупке и +3.6% к выручке новых пользователей.

Пример 3. Растим продажи фокусных категорий

A/B-тесты помогают управлять не только общей выручкой, но и отдельными категориями. Например, пользователям, которые покупают в основном продукты, можно показать витрину товаров повседневного спроса: товары для дома, посуду, гигиену, бытовую химию.

Что измерять: выручку фокусной категории, долю заказов с этими товарами, средний чек, количество товарных позиций.

Такой тест может увеличить продажи товаров первой необходимости на 6.5% и средний чек на 2.1%.

Пример 4. Увеличиваем средний чек

Для регулярных покупателей можно тестировать крупные упаковки. Например, блок «Запас для дома и дачи» с расчетом цены за единицу и быстрым выбором количества.

Что измерять: средний чек, количество единиц в заказе, добавления крупных упаковок, выручку профессионального ассортимента.

В гипотезе сценарий дает +4.6% к среднему чеку и +3.0% к количеству единиц.

Пример 5. Уменьшаем удаления из корзины

Корзина — критичная зона. В ней пользователь не только финализирует свое решение, но и меняет и дополняет свой заказ.

Гипотеза: если после удаления товара предложить 2-3 более выгодных аналога в наличии, часть пользователей продолжит покупку вместо того, чтобы сокращать заказ.

Что измерять: долю сессий с удалениями, добавления замен, конверсию корзины в покупку, средний чек после удаления.

В  таком сценарии такой тест может снизить удаления на 3.0% и увеличить конверсию корзины в покупку на 2.2%.

Что нельзя делать после запуска

После старта теста не стоит менять механику, аудиторию, метрики или условия показа. Если изменить тест по ходу, результат будет трудно интерпретировать. Исключение — техническая ошибка, которая ломает пользовательский сценарий или сбор данных. В таком случае тест лучше остановить, исправить и запустить заново.

Несколько тестов на одной странице запускать можно, но осторожно. Если они влияют на один и тот же сценарий или одну метрику, результаты смешаются. 

  • Если вы можете выделить эффект от каждой новой опции отдельно, то можно не переживать.
  • Если вам необходимо измерить влияние каждого фактора в отдельности, то следует разводить тесты по аудиториям, сегментам, страницам или запускать последовательно.

Нужен ли аналитик для А/В тестов?

Для простых маркетинговых тестов платформа покажет результат автоматически. Но для сложных e-commerce-решений аналитик полезен: он проверит выборку, сегменты, метрики лежащие за пределами Gravity Field (например, скорость доставки или NPS отзывы), защитные метрики и возможные искажения.

Gravity Field упрощает эту работу за счет встроенной аналитики, байесовской оценки, отчетов по сегментам и возможности анализировать кастомные события.

Когда A/B-тесты не нужны

A/B-тест не нужен, если изменение обязательно по закону, исправляет очевидную ошибку, устраняет критический баг или почти не влияет на поведение пользователя.

Тест также может быть нецелесообразен при слишком низком трафике, слишком маленьком ожидаемом эффекте или когда стоимость эксперимента выше потенциальной выгоды. В таких случаях лучше использовать UX-исследование, экспертную оценку, анализ данных или просто внедрить очевидное исправление.

Вывод

A/B-тестирование в интернет-магазине — это не разовая проверка кнопки, а система роста. Лучшие тесты начинаются с бизнес-задачи: увеличить первую покупку, поднять CTR промо, вырастить выручку поиска, продать больше фокусных товаров, увеличить средний чек или снизить удаления из корзины.

Gravity Field добавляет к классическому A/B-тестированию то, чего не хватает базовым инструментам: байесовскую оценку результата, динамическую аллокацию трафика, сегментный анализ, предиктивный таргетинг и запуск client-side/server-side А/В тестов в одной платформе. Для крупного e-commerce это превращает A/B-тесты в управляемую программу роста.

Если для вашей команды важно принимать решения на основе достоверных данных, а не отраслевых мифов, запросите демо Gravity Field. Платформа, подтвердившая надежность в рамках международного исследования с участием ведущих мировых экспертов по A/B-тестированию, поможет выстроить системный процесс проверки гипотез и ускорить рост вашего продукта.

Посмотрите Gravity Field в действии

Запросить демо