Как провести АВ‑тест

Одну и ту же тему письма или размер скидки можно сначала показать части клиентов, сравнить результат и только потом применить на всю базу. Без такой проверки любое изменение ― ставка. Неизвестно, принесет оно больше выручки или меньше, пока не увидишь цифры. АВ‑тест превращает эту неизвестность в измеримый результат. Ниже ― как правильно поставить тест: от понятия до разбора результата.

Как провести АВ‑тест

Как работает АВ‑тест

Аудиторию делят на группы: одной показывают вариант А, другой ― вариант Б, а затем сравнивают, какой принес больше целевых действий ― открытий, кликов, заказов. Тестировать можно любое изменение ― от темы письма до дизайна кнопки на сайте.

Как провести АВ‑тест

Чтобы тест дал результат, которому можно доверять, важно пройти пять шагов по порядку: от выбора метрики до анализа финальных цифр. Пропущенный шаг ― например, случайный размер выборки или неслучайные группы ― обесценивает даже правильную гипотезу. Тест покажет число, но этому числу нельзя будет верить.

Шаг 1. Выбрать точку роста и метрику

Точка роста ― то, что хочется улучшить: письмо с подборкой рекомендаций редко открывают, конверсия попапа низкая, клиенты уходят с брошенной корзиной. Метрика ― то, в чем измеряется улучшение: выручка, средний чек, конверсия.

Для e‑commerce лучшая метрика обычно ― средний чек или выручка, но измерить их бывает сложно. Тогда берут метрику ближе к целевой: open rate или click rate вместо выручки, если письмо в итоге ведет на сайт.

Шаг 2. Сформулировать гипотезу

Гипотеза объединяет предположение и метрику в одно четкое число, которое тест сможет подтвердить или опровергнуть. «Приведет ли обращение по имени к росту open rate?» ― это вопрос: под любой результат теста можно подогнать любой ответ, и заранее непонятно, что считать успехом. «Обращение по имени в теме письма увеличит open rate на 2%» ― гипотеза: если прирост будет 2% и больше, тест ее подтвердит, если меньше ― опровергнет.

Порог ― тот самый ожидаемый процент ― определяют по двум вещам: сколько стоит внедрить изменение и какой прирост вообще будет заметен на фоне обычных колебаний метрики. Если изменение бесплатное, например слово в теме письма, можно закладывать 1―2%. Если требует разработки ― обычно от 5%, чтобы прирост точно окупил работу команды.

Шаг 3. Рассчитать размер выборки

Размер выборки ― это количество клиентов, которым нужно показать каждый вариант, чтобы результату можно было доверять. Если людей слишком мало, разница между вариантами может оказаться случайной: сегодня может победить вариант А, а при повторном тесте ― вариант Б. Размер выборки считают заранее, чтобы понять, сколько клиентов и сколько дней потребуется, прежде чем подводить итог.

В Mindbox есть бесплатный калькулятор АВ‑тестов: вводишь количество вариантов, средний текущий показатель метрики и ожидаемый прирост ― получаешь нужный размер выборки.

Калькулятор также попросит задать достоверность и мощность.

Достоверность отвечает на вопрос «насколько уверенно можно сказать, что победитель ― не случайность?». Достоверность 95% значит: повтори тест сто раз ― в 95 случаях из 100 он покажет того же победителя. Чем выше достоверность, тем больше нужно клиентов, зато меньше риск внедрить изменение, которое на самом деле не работает.

Мощность отвечает на другой вопрос: «если разница между вариантами реально есть, насколько уверенно тест ее найдет?». При низкой мощности тест может не заметить работающее изменение и по ошибке признать варианты одинаковыми. Стандартное значение ― 80%: восемь тестов из десяти корректно найдут разницу, если она действительно есть.

Две тысячи писем на вариант ― и это только для базового уровня достоверности 95%. Если увеличить показатель до 99% выборка вырастет еще заметнее
Две тысячи писем на вариант ― и это только для базового уровня достоверности 95%. Если увеличить показатель до 99% выборка вырастет еще заметнее

Шаг 4. Разбить участников на группы

Клиентов делят на группы случайно ― например, по последней цифре ID в базе или через инструмент платформы автоматизации маркетинга, который сам присваивает каждому клиенту случайный вариант. «Первая половина списка ― варианту А» не подходит: список обычно отсортирован не случайно, скажем по дате регистрации, и в одной группе может оказаться больше новых клиентов, чем в другой.

Проверить, что участников получилось разделить на группы действительно случайным образом, помогает АА‑тест. Двум группам, которые должны быть одинаковыми, отправляют один и тот же вариант рассылки, как будто это тоже эксперимент. Если результат в группах почти не отличается ― разбиение случайное, тесту можно доверять. Если отличается заметно ― в самих группах что‑то разное, и обычный АВ‑тест после этого может ввести в заблуждение.

Дополнительно можно добавить контрольную группу, которой вообще не отправляют рассылку. С ней тест не только сравнивает варианты между собой, но и показывает, сколько заказов рассылка приносит по сравнению с ее полным отсутствием ― часть клиентов и так совершает целевое действие без коммуникации. Без контрольной группы тест все равно работает и отвечает на вопрос «какой вариант лучше», просто не показывает, работает ли рассылка вообще.

Третья ветка ― контрольная группа ― добавляет ответ на вопрос «работает ли рассылка вообще»
Третья ветка ― контрольная группа ― добавляет ответ на вопрос «работает ли рассылка вообще»

Шаг 5. Разобрать результат теста

Побеждает вариант с более высоким значением метрики, которую выбрали на шаге 1, ― и с разницей, которая прошла проверку на достоверность.

Бренд одежды BUNGLY сравнил ручную и автоматическую переоценку на 68 товарах: в обеих группах сложилась одинаковая средняя скидка 20,5%, но автоматическая переоценка все равно принесла на 51% больше выручки и на 48% больше продаж в штуках ― просто потому, что алгоритм точнее распределял эту скидку между позициями.

Похожий тест провели для рассылок ALL WE NEED: сравнили письмо с персональными товарными рекомендациями и без них. Разница оказалась небольшой ― конверсия в заказ выросла на 0,21 процентного пункта ― но статистически значимой на 95%. Без самого теста этот прирост остался бы просто догадкой, которую никто не подтвердил.

Чек‑лист

  1. Выбрать точку роста и метрику. Что улучшаем и в чем измеряем прирост ― выручке, среднем чеке, open rate.
  2. Сформулировать гипотезу. «Увеличит open rate на N%» ― не «поможет ли»: только конкретная цифра дает тесту однозначный ответ.
  3. Посчитать выборку в калькуляторе. Недостоверный результат хуже, чем его отсутствие.
  4. Разбить группы случайно и проверить АА‑тестом. Контрольная группа ― по желанию, если нужен ответ не только «какой вариант лучше», но и «работает ли рассылка вообще».
  5. Сравнить метрику из шага 1 у обоих вариантов. Побеждает тот, у кого значение выше и разница прошла проверку на достоверность.

Тестировать стоит не только крупные изменения вроде дизайна сайта, но и мелкие ― слово в теме письма, размер скидки, время отправки. Примеры тестов других компаний сэкономят время на составление своего списка гипотез.