Тест идёт второй день, вариант B впереди на 20% — можно останавливать? Почти наверняка нет. Разница на маленькой выборке чаще объясняется случайностью, чем реальным превосходством варианта. Разберём без формул, сколько показов нужно набрать, от чего зависит эта цифра и почему подглядывание в промежуточные результаты портит тест сильнее, чем кажется.
Представьте, что вы подбрасываете две одинаковые монеты по двадцать раз. У первой выпало 12 орлов, у второй 8. Разница — 50% в относительном выражении. Значит ли это, что первая монета лучше? Очевидно нет: монеты одинаковые, а разница — обычный разброс.
С карточками ровно то же самое. Клик покупателя — случайное событие. Даже если два варианта фото совершенно одинаковы по привлекательности, на коротком отрезке один из них почти наверняка окажется впереди. Это не сигнал, это шум.
Проблема в том, что глаз человека шум не различает. Мы видим «B впереди на 20%» и достраиваем объяснение: конечно, там же фон светлее. Мозг всегда найдёт причину для случайного результата. Именно поэтому нужен формальный критерий — заранее посчитанный объём выборки, до которого тест не оценивается.
Практический вывод: 200 показов на вариант не доказывают ничего вообще. 1 000 показов при CTR около 3% дают примерно по 30 кликов на вариант — этого хватает разве что на то, чтобы заметить разницу в разы, но не в десятки процентов. Реальные различия между двумя приличными фотографиями обычно измеряются десятками процентов, и чтобы их поймать, нужны тысячи показов.
Статистическая значимость отвечает на один вопрос: насколько вероятно, что наблюдаемая разница возникла случайно, если на самом деле варианты одинаковы. Если такая вероятность мала — обычно берут порог 5% — разницу считают значимой.
Важно понимать, что значимость не говорит «вариант B лучше на 20%». Она говорит только «маловероятно, что варианты одинаковы». Насколько именно B лучше, оценивается отдельно и всегда с погрешностью. Реальный прирост может оказаться и вдвое меньше того, что вы увидели в тесте.
Второе понятие, о котором забывают, — мощность теста. Это способность заметить эффект, если он есть. Тест на маленькой выборке может не показать значимой разницы не потому, что варианты одинаковы, а потому, что данных не хватило. Стандартный ориентир — мощность 80%: то есть при реально существующем эффекте нужного размера тест обнаружит его в четырёх случаях из пяти.
Отсюда практическое правило: перед запуском вы должны ответить на два вопроса. Какой у меня текущий CTR? И какой минимальный прирост мне вообще интересен? Из этих двух цифр и считается нужный объём.
Значимость — не гарантия. Даже при пороге в 5% примерно один тест из двадцати покажет разницу там, где её нет. Это нормальная цена вероятностного метода.
Нужное число показов определяется тремя вещами, и только третью вы можете менять.
Ниже — ориентировочные объёмы показов на каждый вариант при пороге значимости 95% и мощности 80%. Цифры округлены, они дают порядок величины, а не точный расчёт. Прирост указан в относительном выражении: например, +30% при базовом CTR 2% означает переход с 2% на 2,6%.
| Базовый CTR | Прирост +20% | Прирост +30% | Прирост +50% |
|---|---|---|---|
| 1% | около 40 000 | около 18 000 | около 6 000 |
| 2% | около 20 000 | около 9 000 | около 3 000 |
| 4% | около 10 000 | около 4 500 | около 1 500 |
| 8% | около 4 500 | около 2 000 | около 800 |
Обратите внимание на закономерность: при уменьшении искомого эффекта вдвое нужный объём растёт примерно вчетверо. Поэтому ловить прирост в 5% практически невозможно на обычной карточке.
Цифра 10 000 показов на вариант, которая часто встречается как рабочая планка, не взята с потолка. Посмотрите на таблицу выше: при типичном для массовых категорий CTR около 3-4% этот объём позволяет уверенно различить прирост порядка 20-30%. То есть ровно тот масштаб изменений, который даёт удачная замена главного фото.
Это компромисс между надёжностью и скоростью. Можно набрать 40 000 показов на вариант и ловить более тонкие различия, но карточка со средним трафиком будет собирать такую выборку месяц, за который сменится сезон, конкурентное окружение и ваша же позиция в выдаче. Данные, собранные в разных рыночных условиях, сравнивать бессмысленно.
Поэтому в Вилдоне ориентир завершения теста — порядка 10 000 показов на вариант. Метрики подтягиваются из официального API статистики воронки продаж Wildberries, переключение вариантов идёт автоматически по таймеру, и не нужно вручную считать, сколько показов уже набрано.
Если ваш базовый CTR заметно ниже среднего — скажем, около 1% — планку стоит поднимать. Если карточка кликается хорошо и вы проверяете смелую гипотезу с ожидаемым эффектом в полтора раза, можно обойтись меньшим объёмом.
Это самая дорогая методическая ошибка, и совершают её практически все. Схема такая: селлер запускает тест, каждый день открывает статистику и ждёт момента, когда один вариант вырвется вперёд. Как только разница выглядит убедительной — останавливает тест и объявляет победителя.
Проблема в том, что при таком поведении вы почти гарантированно найдёте «победителя» даже среди двух абсолютно одинаковых вариантов. Разница между вариантами колеблется день ото дня; если проверять её достаточно часто и останавливаться на самом выгодном моменте, вы просто ловите пик случайного колебания. Формально это называется проблемой множественных сравнений: каждый взгляд на данные — ещё одна попытка увидеть разницу, и с ростом числа попыток шанс ложного срабатывания растёт.
Эффект усиливается тем, что на ранних этапах теста разброс максимален. Первые сотни показов дают самые дикие цифры — вариант может быть впереди в два раза, а к концу теста проиграть. Обычно кривая колеблется сильно в начале и постепенно успокаивается к набранной выборке.
Лекарство простое и бесплатное: определите нужный объём показов до запуска, запишите его и не принимайте решение, пока он не набран. Смотреть на промежуточные данные можно — но только чтобы убедиться, что тест идёт и показы копятся, а не чтобы выбирать победителя.
Есть и обратная сторона той же ошибки: продлевать тест, потому что результат не нравится. Если по достижении плановой выборки разница не значима — это ответ «различий не обнаружено», а не приглашение подождать ещё недельку. Дожимая тест до нужного вам вывода, вы получаете ту же ложную находку, только с другой стороны.
Даже правильно посчитанная выборка не спасает, если варианты набирали её в разных условиях. Поведение покупателей на Wildberries неоднородно во времени, и это надо учитывать при планировании.
Универсальная страховка от временного шума — частое чередование вариантов и длительность теста, кратная неделе. Тогда оба варианта получают одинаковую смесь дней и часов.
Ситуация типична: карточка получает 300-500 показов в сутки, а по таблице нужно 10 000 на вариант. Прямой тест займёт больше месяца и потеряет смысл. Варианты действий есть.
Первое — тестировать не эту карточку. Возьмите флагманский артикул с максимальным трафиком в той же категории, проверьте гипотезу на нём, а вывод перенесите на остальной ассортимент. Это не идеально строго, но гораздо лучше, чем гадать.
Второе — искать более крупные эффекты. Если выборки хватает только на различение прироста в полтора раза, не тестируйте оттенок фона. Сравнивайте радикально разные концепции: студийное фото против сцены использования, товар крупно против товара в комплекте. Крупные эффекты ловятся малой выборкой.
Третье — использовать формат, который экономит данные. CTR-тест сравнивает варианты только по кликам, а не по всей воронке, поэтому требует меньше наблюдений для вывода. Он отвечает на вопрос «какая картинка кликабельнее», и для отсева заведомо слабых вариантов этого достаточно.
Чего делать не стоит — принимать решение по 500 показам и убеждать себя, что «тенденция видна». Лучше честно сказать «данных не хватило» и принять решение экспертно, чем получить ложную уверенность в неверном выводе и растиражировать его на весь ассортимент.
Перед тем как нажать «старт», пройдитесь по пяти пунктам. Они занимают десять минут и спасают от бесполезного теста.
Как рабочий ориентир — порядка 10 000 показов на каждый вариант. Этого обычно достаточно, чтобы при типичном CTR 3-4% уверенно различить прирост в 20-30%. При низком базовом CTR около 1% объём нужно увеличивать в несколько раз, а при поиске очень крупных различий можно обойтись меньшим.
Это называется ошибкой подглядывания. Разница между вариантами колеблется случайным образом, особенно в начале теста, и если останавливаться в самый выгодный момент, «победителя» можно найти даже среди двух одинаковых фотографий. Нужный объём выборки определяется до запуска, и решение принимается только после его набора.
Это полноценный результат: гипотеза не подтвердилась. Не продлевайте тест в надежде, что разница появится — так вы получите ложный вывод. Либо эффект действительно отсутствует и стоит перейти к более смелым гипотезам, либо он слишком мал, чтобы его ловить на вашем объёме трафика.
Да, и очень сильно. Выводы делаются по кликам, а не по показам: при CTR 1% десять тысяч показов дают всего сто кликов, при CTR 8% — восемьсот. Чем ниже базовая кликабельность, тем больше показов нужно, чтобы набрать сопоставимую статистику.
Даже при очень высоком трафике не стоит укладываться меньше чем в несколько суток, а лучше в целое число недель. Причина не в статистике, а в неоднородности трафика: будни и выходные, утро и вечер ведут себя по-разному, и оба варианта должны получить одинаковую смесь.
Да, для сравнения двух долей есть стандартные калькуляторы, куда подставляются показы и клики каждого варианта. Но на практике удобнее, когда объём выборки и расчёт делает сервис: это снимает соблазн подглядывать в промежуточные цифры и трактовать их в свою пользу.