10 000 посетителей на A/B-тест, а у вас 200: Что проверять на малом трафике?
Честный A/B-тест требует 10 000 уникальных посетителей: по 5 000 на контроль и на вариант. Клик по услугам в Директе стоит 50–150 ₽, то есть от 500 000 до 1 500 000 ₽ трафика на проверку одной гипотезы. У сайта услуг таких денег нет: 200–300 визитов в месяц — обычная картина. Разбираю, что на таком объёме проверять можно, что бессмысленно, и почему первая же «победа» на 200 визитах почти всегда ложная.
Типичная история, которую я слышу на первом созвоне: «Мы поменяли кнопку, конверсия выросла с 1,5% до 2%». Спрашиваю, сколько было визитов. Отвечают: около 200. То есть 3 заявки против 4. Решение о сайте принято по разнице в одну заявку.
Про тесты самих публикаций я писал отдельно. Здесь — про сайт, на который эти публикации ведут, и про главный вопрос малого бизнеса: как вообще что-то проверять, если трафика на статистику не хватает.
Почему на 200 визитах значимости не будет никогда
Арифметика простая. Конверсия сайта услуг — 2%. На 200 визитов это 4 заявки. Делим трафик пополам: 2 заявки в контроле, 2 в варианте. Любая разница между версиями — это 1 человек, который мог передумать из-за пробки по дороге на работу.
Чем меньше эффект, который вы ловите, тем больше нужно людей. Прирост в 20% виден на небольшом трафике. Прирост в 3% — только на десятках тысяч визитов. На 200 визитах видно ровно одно: изменение в разы. Всё, что меньше, — шум.
Отсюда тезис, с которым я предлагаю поспорить: малый трафик — не повод не тестировать. Это повод тестировать другое. Не то, что двигает результат на проценты, а то, что двигает его в разы. Такие вещи на сайте есть, и их немного.
5 уровней теста по силе сдвига
Я раскладываю всё, что можно менять на странице, на 5 уровней. Сверху — то, что меняет результат кратно, снизу — то, что даёт проценты.
Уровень 1. Концепция страницы. Угол подачи, первый экран, структура целиком. Одна и та же услуга, упакованная как «бесплатная консультация» и как разбор с понятным результатом, даёт конверсию 1% и 10%. Это не 2 варианта кнопки, это 2 разных обещания, и разницу между ними видно на 100 визитах.
Уровень 2. Порядок блоков и тип медиа. В какой момент человек видит цену, когда видит отзывы, есть ли на странице видео с объекта, а не стоковое. Перенос живого видео ближе к первому экрану — один из самых сильных приёмов, которые я знаю: человек убеждается за 20 секунд вместо 3 экранов текста.
Уровень 3. Отзывы. Не «есть или нет», а какие: видео, текст с фото и именем, скриншот переписки. Отзыв без лица на сайте услуг работает как его отсутствие.
Уровень 4. Оффер. Цена, пакеты, гарантия, порог, с которого что-то идёт бесплатно: выезд, аудит, первый месяц. Здесь комбинаций бесконечно, и каждая двигает деньги, а не клики.
Уровень 5. Микроэлементы. Текст на кнопке, заголовки блоков, фото в первом экране, формулировка гарантии. Каждый такой тест даёт 1–2%, и на долгом трафике 5–6 тестов складываются в заметный фундамент.
Правило для малого трафика из этой лестницы вытекает само: работать только на уровнях с 1 по 4. Уровень 5 — для тех, у кого 10 000 визитов в месяц. Тест цвета кнопки на 200 визитах — не тест, а ритуал.
Ловушка ранней победы
Самое нарушаемое правило тестирования — длительность. Минимум 2 недели, даже если разница видна на 3-й день. Причина: нужно захватить 2 полных недельных цикла, потому что в будни и в выходные люди ведут себя по-разному, а новые и вернувшиеся посетители живут в разных ритмах.
На малом трафике ловушка захлопывается ещё быстрее: 3 заявки во вторник выглядят как победа, потому что сравнивать их не с чем.
Вот как это выглядит на моих цифрах. 3 статьи, вышедшие подряд 3, 4 и 5 сентября, за первые сутки собрали 353, 341 и 335 просмотров — разница 5%, лидер очевиден. На 3-й день жизни у тех же материалов было 444, 459 и 533. Лидер первого дня стал последним, аутсайдер — первым. Если бы я принял решение по первым суткам, я бы закрыл самый сильный формат из трёх.
Сервисы тестирования показывают значок значимости на момент, когда вы смотрите. В четверг он есть, после выходных исчезает. Поэтому срок теста я фиксирую до запуска и не открываю результаты раньше.
Одновременно, а не по очереди
«На прошлой неделе поставили новую цену, заявок стало меньше, вернули как было» — это не A/B-тест. Это статистическая динамика: на прошлой неделе крутилась другая реклама, был другой день зарплаты, конкурент запустил акцию.
Контроль и вариант должны жить в одно время на одном и том же трафике. На малом объёме соблазн проверять по очереди особенно велик, потому что пополам делить нечего. Но последовательный тест на 200 визитах — это сравнение шума со вторым шумом.
Как я делаю сплит без дорогих платформ. Две посадочные страницы с разными адресами. Трафик делит либо эксперимент в Директе, который случайно раскидывает аудиторию по сегментам, либо раздел «Эксперименты» в Метрике — он работает на Вариокубе. Оба бесплатны. Случайное распределение — обязательное условие: если контроль видят только с телефона, а вариант только с компьютера, вы сравниваете не версии, а устройства.
И отдельно про устройства: тестировать можно на общем трафике, но смотреть результат надо раздельно. Вариант «выиграл в среднем», а на деле поднял конверсию на десктопе и обвалил на мобильных, где 80% аудитории. Выкатили победителя — убили основной канал.
Один путь — один тест
На малом трафике хочется поменять всё сразу: и первый экран, и цену, и отзывы. Через 1 месяц заявок стало больше, и никто не знает почему. Через 2 — меньше, и никто не знает, что откатывать.
Правило одно: на одном пути пользователя в один момент времени идёт один эксперимент. Меняется одна переменная. Скучно, зато через 4 теста вы знаете, что у вас работает, а не догадываетесь.
Смотреть на деньги, а не на конверсию
Главная ловушка тестирования: вариант выигрывает по конверсии и проигрывает по выручке.
Поставили «бесплатный аудит» вместо «расчёт стоимости» — заявок вдвое больше, но половина из них не собиралась платить. Дали скидку — покупают чаще, средний чек упал, себестоимость выросла, денег в кассе меньше. И наоборот: вариант с меньшей конверсией может приносить больше, потому что приходят те, кто платит.
У малого трафика здесь есть преимущество, которого нет у больших сайтов. 4 заявки в месяц можно прозвонить лично и узнать про каждую: кто это, что ему нужно, сколько он готов платить. Метрика теста на 200 визитах — не процент конверсии, а сумма договоров, которые из этих визитов выросли.
Чем заменить статистику, когда её нет
Количественные данные показывают, что сломалось. Качественные — почему. Когда цифр не хватает, я переворачиваю пропорцию и иду за качественными.
Вебвизор в Метрике. 30 записей сессий на странице говорят больше, чем 200 визитов в сплите. Видно, где человек остановился, что перечитал, на каком поле бросил форму, куда кликнул, думая, что это кнопка.
Карта скроллинга. До какого блока дочитывают. Если цена стоит ниже точки, до которой доходит 20% посетителей, тест цены бессмысленен: её никто не видел.
5 человек из ниши. Показать первый экран людям, похожим на клиента, и спросить не «нравится ли», а «что вам здесь предлагают и за сколько». Вариант, который пересказывают правильно, и есть рабочий. Я так проверяю заголовки статей, и на первых экранах приём работает точно так же.
Разговор с теми, кто оставил заявку. Один вопрос: «что вас убедило написать». Ответ почти всегда указывает на блок, который стоит поднять выше.
Это не замена A/B-теста, это способ поднять уверенность в гипотезе до того, как вы потратите на неё квартал трафика.
С чего начать, когда трафика хватает на 1 тест в квартал
У вас 30 идей, а проверить можно 1. Я ранжирую гипотезы по 3 параметрам от 1 до 10: влияние на результат, уверенность, что сработает, и простота реализации. Перемножаю, тестирую в порядке убывания.
Пример из моего бэклога. Переделать первый экран: влияние 8, уверенность 7, простота 5, итого 280. Добавить всплывающее окно при уходе со страницы: 6, 8, 9, итого 432. Запустить реферальную программу: 9, 6, 4, итого 216. Первым идёт окно при уходе, хотя редизайн первого экрана выглядит амбициознее.
На малом трафике я добавляю одно ограничение: влияние ниже 7 в бэклог не попадает вовсе. Если гипотеза не обещает сдвиг в разы, на 200 визитах вы его не увидите, и квартал уйдёт впустую. А уверенность берётся не из ощущений, а из вебвизора и разговоров с заявками.
Побочный эффект метода: когда маркетолог хочет одно, дизайнер другое, а собственник третье, спор заканчивается за 20 минут. Все ставят оценки, цифры решают.
Первые сутки — под микроскопом
Большинство технических провалов вылезает в первый день. Трафик вместо 50/50 уходит 90/10, потому что не докрутили настройку. Форма на варианте не отправляется с телефона. Цель в Метрике настроена на одну страницу и не видит вторую. Картинка на 10 МБ положила загрузку.
Поймать это на 1-й день дешевле, чем на 13-й, когда квартал трафика уже потрачен. Первые сутки я проверяю каждый час: распределение, события аналитики, обе формы с обоих устройств. Потом не трогаю до срока.
Что сделать на этой неделе
Открыть вебвизор и посмотреть 30 сессий на главной странице услуги. Записать, где люди останавливаются и где уходят.
Выписать все идеи изменений, оценить по 3 параметрам, оставить только те, где влияние 7 и выше.
Взять верхнюю. Сделать вторую посадочную, поделить трафик случайно, зафиксировать срок 2 недели.
Считать не заявки, а деньги из них. И не открывать результат раньше срока.
Что дальше
Прежде чем что-то тестировать, стоит проверить, нет ли на странице ошибок, которые съедают продажи без всякого теста. В следующем материале разберу базовый чек-лист из 10 таких вещей и прогоню по нему сайты одной российской ниши: посмотрим, сколько из них проходят хотя бы половину пунктов. Подписывайтесь, если тема близка.
Я маркетолог: разбираю бизнес до того, как что-то запускать, работаю на связке классического фреймворка и ИИ-агентов и отвечаю за цифру в деньгах. Пишите мне напрямую: адрес страницы и число визитов за месяц. Скажу, какой из 5 уровней тестировать первым и что на вашем трафике вообще можно увидеть, а что нет. Я собираю выборку первых экранов по нишам, ваш в неё войдёт. Дистрибуцию в деловых СМИ и видимость в ИИ-ответах после этого закрывает RUPR Agency.
А какой тест вы запускали последним и сколько визитов в нём было? Если меньше 1 000 — напишите, что вы по нему решили. Соберу разбор таких решений в отдельный материал.