Калькулятор A/B-тестов для рекламы: значимость и размер выборки

Введите посетителей и конверсии для двух версий, чтобы увидеть, реальна ли разница, или введите коэффициент конверсии и интересующий вас прирост, чтобы узнать, сколько посетителей нужно тесту. Обе формулы приведены полностью, с разобранными примерами.

Бесплатный инструмент Считает в вашем браузере. Ничего не отправляется, не сохраняется и не логируется: на другом конце этой страницы нет сервера.

Два вопроса, один калькулятор

Каждый тест рекламы задаёт два вопроса, в этом порядке. Перед запуском: сколько посетителей нужно, чтобы обнаружить важную для меня разницу? После завершения: разрыв между A и B реальный или это может быть случайность? Используйте две вкладки выше именно в этом порядке. Сначала рассчитать размер выборки — это то, что делает ответ на второй вопрос осмысленным.

“Посетителями” могут быть посетители целевой страницы, клики по ссылке или любой, у кого был равный шанс конвертироваться, если обе версии считаются одинаково. “Конверсии” — это люди, которые сделали то, что вы тестируете.

Как работает тест значимости

Калькулятор выполняет z-тест двух пропорций — тест для больших выборок для сравнения двух коэффициентов, описанный в NIST/SEMATECH e-Handbook of Statistical Methods:

  • Объединённый коэффициент p = (конверсии A + конверсии B) ÷ (посетители A + посетители B).
  • z = (коэффициент B − коэффициент A) ÷ √(p × (1 − p) × (1/посетители A + 1/посетители B)).
  • Двустороннее p-значение = 2 × (1 − Φ(|z|)), где Φ — стандартное нормальное распределение.
  • Интервал для разницы равен (коэффициент B − коэффициент A) ± z × √(коэффициент A × (1 − коэффициент A) ÷ посетители A + коэффициент B × (1 − коэффициент B) ÷ посетители B). Диапазон прироста делит это на коэффициент A, считая коэффициент A известным, поэтому это приближение.

Разобранный пример. Версия A получает 200 конверсий из 10 000 посетителей (2,00%). Версия B получает 245 из 10 000 (2,45%) — относительный прирост 22,5%. Объединённый коэффициент равен 445 ÷ 20 000 = 2,225%, стандартная ошибка — 0,209 процентного пункта, а z = 0,45 ÷ 0,209 = 2,157. Двустороннее p-значение равно 0,031, ниже 0,05, поэтому при доверии 95% побеждает B. 95%-й интервал для разницы — от +0,04 до +0,86 процентного пункта: B лучше, но истинный прирост может быть где угодно примерно от 2% до 43%.

Тест является приближением, которому нужно достаточно данных. Справочник NIST даёт один критерий: не менее 5 успехов и 5 неудач. Калькулятор придерживает свой вердикт и показывает пока недостаточно данных, пока у каждой версии не будет 5 конверсий и 5 неконверсий. Если данных меньше, NIST указывает на точный тест для малых выборок, но для теста рекламы практический ответ — продолжать его.

Как рассчитывается размер выборки

Для двустороннего теста посетителей на версию:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Здесь p1 — ваш текущий показатель, p2 — этот показатель с учётом прироста, а p̄ — их среднее. Это нормальное приближение без поправки на непрерывность, и оно имеет ту же форму, что и формула размера выборки для одной доли в справочнике NIST, но с добавленной второй группой. При доверительной вероятности 95% z1−α/2 равно 1,959964, а при мощности 80% z1−β равно 0,841621.

Разобранный пример. Конверсия 2%, и вы хотите уловить прирост в 20%, то есть 2,0% против 2,4%. Средний показатель — 2,2%. Верхняя строка: 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, в квадрате — 0,3377, а деление на 0,004² даёт 21 109 посетителей на версию, всего 42 218. При 3000 посетителей в день это 15 дней.

Больше всего влияет запрашиваемый вами прирост. При тех же 2% для прироста в 30% нужно 9798 на версию, а для прироста в 10% — 80 682. Уменьшение прироста вдвое увеличивает трафик примерно вчетверо, потому что разрыв стоит в квадрате в знаменателе формулы.

Почему ранняя остановка завышает число ложных срабатываний

Доверительная вероятность 95% означает, что когда A и B на самом деле конвертируют одинаково, одиночный тест при фиксированном размере выборки всё равно объявляет победителя примерно в 5% случаев. Эти 5% верны, только если вы смотрите один раз — в конце.

Проверять результат каждый день и останавливаться в первый же момент, когда он показывает значимость, — это другая процедура. Показатели колеблются по мере поступления данных, и каждый просмотр — это ещё один шанс для случайного разрыва пересечь порог. Остановитесь на первом же пересечении — и вы выбрали самый удачный момент, так что реальная доля ложных срабатываний оказывается выше 5% и растёт тем сильнее, чем чаще вы смотрите. p-значение на экране не знает, что вы подглядывали, поэтому оно по-прежнему выглядит так, будто вы посмотрели один раз.

Решение скучное, но рабочее: определите размер выборки до начала теста, дождитесь, пока он будет достигнут, и прочитайте результат один раз. Заглянуть в середине, чтобы убедиться, что ничего не сломалось, — нормально. Остановиться потому, что число выглядит хорошо, — нет.

Что Meta и Google Ads говорят о длительности теста

  • Рекомендации Meta по A/B-тестированию советуют проводить тесты не менее 7 дней, предупреждают, что более короткие тесты могут дать неубедительные результаты, и ограничивают A/B-тесты 30 днями. Там же предлагается запускать тест дольше, если клиентам обычно требуется больше 7 дней на конверсию.
  • Meta обычно рекомендует расчётную мощность 80% или выше — значение по умолчанию здесь. Результаты A/B-тестов Meta показывают процент уверенности, и значение 65% или выше считается выигрышным результатом A/B-теста. Эта цифра получается собственным методом Meta и не то же самое, что доверительная вероятность на этой странице, поэтому они не совпадут.
  • Meta также не советует тестировать неформально, включая и выключая группы объявлений, потому что аудитории могут пересекаться, и рекомендует одинаковый бюджет для обеих версий.
  • Google Ads рекомендует запускать эксперимент на 2–3 недели, по умолчанию показывает 80-процентный доверительный интервал, а другие уровни — по запросу, и отмечает значимые результаты синей звёздочкой. Его статистический метод использует джекнайф-ресемплинг по 20 корзинам на каждую ветвь, поэтому его интервалы тоже не совпадут с z-тестом в точности.

Чего этот калькулятор не делает

  • Он сравнивает две версии. При трёх и более каждое дополнительное сравнение — это ещё один шанс получить ложного победителя, а простой тест здесь на это поправку не вносит.
  • Он тестирует коэффициенты конверсии, а не выручку с посетителя или сумму заказа — для них нужен другой тест.
  • Это не последовательный тест. Он предполагает, что вы прочитаете результат один раз, при запланированном размере выборки.
  • Он не может определить, был ли ваш раздел честным. Если одна версия получила другую аудиторию, бюджет или время суток, никакая формула это не исправит.

Если вы предпочитаете не считать всё вручную

Hermoso — это маркетинг на автопилоте. Спросите у него, что масштабировать, что остановить и что тестировать дальше, и он прочитает все подключённые вами рекламные платформы, вынесет кампании со слишком малым объёмом данных в отдельную корзину вместо того, чтобы их оценивать, и даст каждому предложенному тесту гипотезу, единственное, что нужно изменить, метрику для решения, бюджет и длительность. Он также создаёт варианты изображений и видео в вашем стиле для тестирования и собирает кампании в ваших собственных рекламных аккаунтах, создавая их на паузе. Он работает в веб-приложении или внутри Claude, ChatGPT и Cursor через свой сервер MCP. Когда у теста появляется победитель, бесплатный калькулятор ROAS подскажет, прибыльна ли эта версия.

Бесплатные инструменты: · Калькулятор ROAS · Проверка длины рекламного текста

Часто задаваемые вопросы

Как узнать, статистически ли значим мой A/B-тест рекламы?

Введите посетителей и конверсии для обеих версий. Калькулятор выполняет z-тест для двух пропорций и выдаёт двустороннее p-значение. При доверии 95% p-значение ниже 0,05 означает, что разница вряд ли случайна. Для 200 из 10 000 против 245 из 10 000 p равно 0,031, так что побеждает B.

Сколько посетителей нужно для A/B-теста?

Это зависит от вашего коэффициента конверсии и наименьшего прироста, который вы хотите обнаружить. При коэффициенте конверсии 2% обнаружение прироста 20% при доверии 95% и мощности 80% требует 21 109 посетителей на версию. Прирост 10% требует 80 682.

Почему калькулятор говорит, что данных пока недостаточно?

z-тест это приближение для больших выборок. Калькулятор ждёт, пока каждая версия не наберёт минимум 5 конверсий и 5 неконверсий, один из критериев, указанных в NIST e-Handbook, прежде чем выдать вердикт.

Можно ли остановить тест, как только он выглядит значимым?

Нет, если вы хотите, чтобы уровень доверия означал именно то, что заявлено. Частые проверки и остановка на первом значимом результате дают случайности больше шансов перейти черту, поэтому реальная доля ложноположительных результатов оказывается выше выбранной вами. Сначала задайте размер выборки и прочтите результат один раз.

Сколько должен длиться A/B-тест Meta?

Meta рекомендует минимум 7 дней, отмечает, что более короткие тесты могут быть неубедительными, и допускает до 30 дней. Google Ads рекомендует 2–3 недели для экспериментов. Используйте вкладку размера выборки с вашим ежедневным трафиком, чтобы понять, сколько нужно вашему тесту.

Отправляется ли куда-нибудь то, что я ввожу?

Нет. Расчёты выполняются в вашем браузере. Нет сетевых запросов, несущих то, что вы вводите, и ничего не сохраняется.

Hermoso подскажет, что масштабировать, что приостановить и что тестировать дальше в ваших рекламных аккаунтах. Начните бесплатно, 250+ бесплатных кредитов за активность, без карты.

Начать бесплатно →   Посмотреть цены