Сколько показов нужно для A/B-теста карточки

Тест идёт второй день, вариант B впереди на 20% — можно останавливать? Почти наверняка нет. Разница на маленькой выборке чаще объясняется случайностью, чем реальным превосходством варианта. Разберём без формул, сколько показов нужно набрать, от чего зависит эта цифра и почему подглядывание в промежуточные результаты портит тест сильнее, чем кажется.

Почему «уже видно, какой лучше» обычно неправда

Представьте, что вы подбрасываете две одинаковые монеты по двадцать раз. У первой выпало 12 орлов, у второй 8. Разница — 50% в относительном выражении. Значит ли это, что первая монета лучше? Очевидно нет: монеты одинаковые, а разница — обычный разброс.

С карточками ровно то же самое. Клик покупателя — случайное событие. Даже если два варианта фото совершенно одинаковы по привлекательности, на коротком отрезке один из них почти наверняка окажется впереди. Это не сигнал, это шум.

Проблема в том, что глаз человека шум не различает. Мы видим «B впереди на 20%» и достраиваем объяснение: конечно, там же фон светлее. Мозг всегда найдёт причину для случайного результата. Именно поэтому нужен формальный критерий — заранее посчитанный объём выборки, до которого тест не оценивается.

Практический вывод: 200 показов на вариант не доказывают ничего вообще. 1 000 показов при CTR около 3% дают примерно по 30 кликов на вариант — этого хватает разве что на то, чтобы заметить разницу в разы, но не в десятки процентов. Реальные различия между двумя приличными фотографиями обычно измеряются десятками процентов, и чтобы их поймать, нужны тысячи показов.

Статистическая значимость простым языком

Статистическая значимость отвечает на один вопрос: насколько вероятно, что наблюдаемая разница возникла случайно, если на самом деле варианты одинаковы. Если такая вероятность мала — обычно берут порог 5% — разницу считают значимой.

Важно понимать, что значимость не говорит «вариант B лучше на 20%». Она говорит только «маловероятно, что варианты одинаковы». Насколько именно B лучше, оценивается отдельно и всегда с погрешностью. Реальный прирост может оказаться и вдвое меньше того, что вы увидели в тесте.

Второе понятие, о котором забывают, — мощность теста. Это способность заметить эффект, если он есть. Тест на маленькой выборке может не показать значимой разницы не потому, что варианты одинаковы, а потому, что данных не хватило. Стандартный ориентир — мощность 80%: то есть при реально существующем эффекте нужного размера тест обнаружит его в четырёх случаях из пяти.

Отсюда практическое правило: перед запуском вы должны ответить на два вопроса. Какой у меня текущий CTR? И какой минимальный прирост мне вообще интересен? Из этих двух цифр и считается нужный объём.

Значимость — не гарантия. Даже при пороге в 5% примерно один тест из двадцати покажет разницу там, где её нет. Это нормальная цена вероятностного метода.

От чего зависит нужный объём выборки

Нужное число показов определяется тремя вещами, и только третью вы можете менять.

  • Базовый CTR. Чем он ниже, тем больше показов нужно. Причина проста: при CTR 1% каждые 10 000 показов дают всего 100 кликов, а выводы делаются именно по кликам, а не по показам. При CTR 8% те же 10 000 показов дают 800 кликов — статистики в разы больше.
  • Размер эффекта, который вы хотите поймать. Это главный множитель. Уловить прирост в полтора раза можно на небольшой выборке. Поймать прирост в 10% относительно — задача на порядок дороже: нужный объём растёт примерно как квадрат от того, во сколько раз меньше эффект.
  • Требования к строгости. Более жёсткий порог значимости и более высокая мощность требуют больше данных. Для решений уровня «какое фото поставить» стандартных 95% значимости и 80% мощности вполне достаточно, ужесточать их незачем.

Таблица: сколько показов нужно на вариант

Ниже — ориентировочные объёмы показов на каждый вариант при пороге значимости 95% и мощности 80%. Цифры округлены, они дают порядок величины, а не точный расчёт. Прирост указан в относительном выражении: например, +30% при базовом CTR 2% означает переход с 2% на 2,6%.

Примерный объём показов на один вариант в зависимости от базового CTR и ожидаемого прироста
Базовый CTRПрирост +20%Прирост +30%Прирост +50%
1%около 40 000около 18 000около 6 000
2%около 20 000около 9 000около 3 000
4%около 10 000около 4 500около 1 500
8%около 4 500около 2 000около 800

Обратите внимание на закономерность: при уменьшении искомого эффекта вдвое нужный объём растёт примерно вчетверо. Поэтому ловить прирост в 5% практически невозможно на обычной карточке.

Откуда берётся ориентир в 10 000 показов

Цифра 10 000 показов на вариант, которая часто встречается как рабочая планка, не взята с потолка. Посмотрите на таблицу выше: при типичном для массовых категорий CTR около 3-4% этот объём позволяет уверенно различить прирост порядка 20-30%. То есть ровно тот масштаб изменений, который даёт удачная замена главного фото.

Это компромисс между надёжностью и скоростью. Можно набрать 40 000 показов на вариант и ловить более тонкие различия, но карточка со средним трафиком будет собирать такую выборку месяц, за который сменится сезон, конкурентное окружение и ваша же позиция в выдаче. Данные, собранные в разных рыночных условиях, сравнивать бессмысленно.

Поэтому в Вилдоне ориентир завершения теста — порядка 10 000 показов на вариант. Метрики подтягиваются из официального API статистики воронки продаж Wildberries, переключение вариантов идёт автоматически по таймеру, и не нужно вручную считать, сколько показов уже набрано.

Если ваш базовый CTR заметно ниже среднего — скажем, около 1% — планку стоит поднимать. Если карточка кликается хорошо и вы проверяете смелую гипотезу с ожидаемым эффектом в полтора раза, можно обойтись меньшим объёмом.

Ошибка подглядывания: почему нельзя останавливать тест досрочно

Это самая дорогая методическая ошибка, и совершают её практически все. Схема такая: селлер запускает тест, каждый день открывает статистику и ждёт момента, когда один вариант вырвется вперёд. Как только разница выглядит убедительной — останавливает тест и объявляет победителя.

Проблема в том, что при таком поведении вы почти гарантированно найдёте «победителя» даже среди двух абсолютно одинаковых вариантов. Разница между вариантами колеблется день ото дня; если проверять её достаточно часто и останавливаться на самом выгодном моменте, вы просто ловите пик случайного колебания. Формально это называется проблемой множественных сравнений: каждый взгляд на данные — ещё одна попытка увидеть разницу, и с ростом числа попыток шанс ложного срабатывания растёт.

Эффект усиливается тем, что на ранних этапах теста разброс максимален. Первые сотни показов дают самые дикие цифры — вариант может быть впереди в два раза, а к концу теста проиграть. Обычно кривая колеблется сильно в начале и постепенно успокаивается к набранной выборке.

Лекарство простое и бесплатное: определите нужный объём показов до запуска, запишите его и не принимайте решение, пока он не набран. Смотреть на промежуточные данные можно — но только чтобы убедиться, что тест идёт и показы копятся, а не чтобы выбирать победителя.

Есть и обратная сторона той же ошибки: продлевать тест, потому что результат не нравится. Если по достижении плановой выборки разница не значима — это ответ «различий не обнаружено», а не приглашение подождать ещё недельку. Дожимая тест до нужного вам вывода, вы получаете ту же ложную находку, только с другой стороны.

Сезонность, день недели и другой шум

Даже правильно посчитанная выборка не спасает, если варианты набирали её в разных условиях. Поведение покупателей на Wildberries неоднородно во времени, и это надо учитывать при планировании.

  • День недели. Будни и выходные различаются и по объёму трафика, и по конверсии. Если вариант A стоял в понедельник-среду, а B в субботу-воскресенье, вы сравнили не фото, а дни.
  • Время суток. Утренний, дневной и вечерний трафик отличаются по составу аудитории. Отсюда требование к интервалу переключения: каждый вариант должен побывать во всех частях суток.
  • Даты выплат и распродаж. В такие периоды меняется чувствительность к цене и общая активность. Тест, целиком попавший в крупную акцию, даёт вывод, который не переносится на обычные дни.
  • Сезон. Смена сезона внутри теста — приговор для сопоставимости. Для сезонных категорий это отдельный аргумент за короткие тесты на карточках с высоким трафиком.
  • Внешние события. Уход или приход крупного конкурента, изменение цены у соседа по выдаче, попадание в подборку. На это вы не влияете, но должны хотя бы фиксировать факт, если заметили.

Универсальная страховка от временного шума — частое чередование вариантов и длительность теста, кратная неделе. Тогда оба варианта получают одинаковую смесь дней и часов.

Что делать, если трафика мало

Ситуация типична: карточка получает 300-500 показов в сутки, а по таблице нужно 10 000 на вариант. Прямой тест займёт больше месяца и потеряет смысл. Варианты действий есть.

Первое — тестировать не эту карточку. Возьмите флагманский артикул с максимальным трафиком в той же категории, проверьте гипотезу на нём, а вывод перенесите на остальной ассортимент. Это не идеально строго, но гораздо лучше, чем гадать.

Второе — искать более крупные эффекты. Если выборки хватает только на различение прироста в полтора раза, не тестируйте оттенок фона. Сравнивайте радикально разные концепции: студийное фото против сцены использования, товар крупно против товара в комплекте. Крупные эффекты ловятся малой выборкой.

Третье — использовать формат, который экономит данные. CTR-тест сравнивает варианты только по кликам, а не по всей воронке, поэтому требует меньше наблюдений для вывода. Он отвечает на вопрос «какая картинка кликабельнее», и для отсева заведомо слабых вариантов этого достаточно.

Чего делать не стоит — принимать решение по 500 показам и убеждать себя, что «тенденция видна». Лучше честно сказать «данных не хватило» и принять решение экспертно, чем получить ложную уверенность в неверном выводе и растиражировать его на весь ассортимент.

Короткий чек-лист перед запуском

Перед тем как нажать «старт», пройдитесь по пяти пунктам. Они занимают десять минут и спасают от бесполезного теста.

  1. Знаю текущий CTR карточки за последние две-три недели.
  2. Понимаю, какой минимальный прирост мне интересен, и по таблице прикинул нужный объём показов на вариант.
  3. Посчитал, сколько дней займёт набор выборки при текущем трафике, и записал дату окончания.
  4. Убедился, что в эти даты не будет крупной акции, смены цены и запуска новых рекламных кампаний на этом артикуле.
  5. Заранее решил, по какой метрике буду принимать решение, и пообещал себе не смотреть на промежуточные результаты как на итог.

Частые вопросы

Как рабочий ориентир — порядка 10 000 показов на каждый вариант. Этого обычно достаточно, чтобы при типичном CTR 3-4% уверенно различить прирост в 20-30%. При низком базовом CTR около 1% объём нужно увеличивать в несколько раз, а при поиске очень крупных различий можно обойтись меньшим.

Это называется ошибкой подглядывания. Разница между вариантами колеблется случайным образом, особенно в начале теста, и если останавливаться в самый выгодный момент, «победителя» можно найти даже среди двух одинаковых фотографий. Нужный объём выборки определяется до запуска, и решение принимается только после его набора.

Это полноценный результат: гипотеза не подтвердилась. Не продлевайте тест в надежде, что разница появится — так вы получите ложный вывод. Либо эффект действительно отсутствует и стоит перейти к более смелым гипотезам, либо он слишком мал, чтобы его ловить на вашем объёме трафика.

Да, и очень сильно. Выводы делаются по кликам, а не по показам: при CTR 1% десять тысяч показов дают всего сто кликов, при CTR 8% — восемьсот. Чем ниже базовая кликабельность, тем больше показов нужно, чтобы набрать сопоставимую статистику.

Даже при очень высоком трафике не стоит укладываться меньше чем в несколько суток, а лучше в целое число недель. Причина не в статистике, а в неоднородности трафика: будни и выходные, утро и вечер ведут себя по-разному, и оба варианта должны получить одинаковую смесь.

Да, для сравнения двух долей есть стандартные калькуляторы, куда подставляются показы и клики каждого варианта. Но на практике удобнее, когда объём выборки и расчёт делает сервис: это снимает соблазн подглядывать в промежуточные цифры и трактовать их в свою пользу.