Два питання, один калькулятор
Кожен тест реклами ставить два питання, у цьому порядку. Перед запуском: скільки відвідувачів потрібно, щоб виявити різницю, яка мене цікавить? Після завершення: розрив між A і B справжній, чи це могла бути випадковість? Використовуйте дві вкладки вище саме в цьому порядку. Саме попередній розрахунок розміру вибірки надає сенсу відповіді на друге питання.
“Відвідувачами” можуть бути відвідувачі цільової сторінки, кліки за посиланням чи будь-хто інший, хто отримав однаковий шанс сконвертуватися, доки обидві версії рахуються однаково. “Конверсії” — це люди, які зробили те, що ви тестуєте.
Як працює тест значущості
Калькулятор виконує z-тест для двох пропорцій, тест для великих вибірок для порівняння двох коефіцієнтів, описаний у NIST/SEMATECH e-Handbook of Statistical Methods:
- Об’єднаний коефіцієнт p = (конверсії A + конверсії B) ÷ (відвідувачі A + відвідувачі B).
- z = (коефіцієнт B − коефіцієнт A) ÷ √(p × (1 − p) × (1/відвідувачі A + 1/відвідувачі B)).
- Двостороннє p-значення = 2 × (1 − Φ(|z|)), де Φ — стандартний нормальний розподіл.
- Інтервал для різниці — це (коефіцієнт B − коефіцієнт A) ± z × √(коефіцієнт A × (1 − коефіцієнт A) ÷ відвідувачі A + коефіцієнт B × (1 − коефіцієнт B) ÷ відвідувачі B). Діапазон приросту ділить це на коефіцієнт A, вважаючи коефіцієнт A відомим, тому це наближення.
Приклад розрахунку. Версія A отримує 200 конверсій з 10 000 відвідувачів (2,00%). Версія B отримує 245 з 10 000 (2,45%), відносний приріст 22,5%. Об’єднаний коефіцієнт — 445 ÷ 20 000 = 2,225%, стандартна похибка — 0,209 відсоткового пункту, а z = 0,45 ÷ 0,209 = 2,157. Двостороннє p-значення — 0,031, нижче за 0,05, тому з довірою 95% перемагає B. 95% інтервал для різниці — від +0,04 до +0,86 відсоткового пункту: B краща, але справжній приріст може бути будь-де від приблизно 2% до 43%.
Тест є наближенням, яке потребує достатньо даних. Довідник NIST дає один критерій: щонайменше 5 успіхів і 5 невдач. Калькулятор утримується від вердикту й каже поки недостатньо даних, доки кожна версія не матиме 5 конверсій і 5 неконверсій. За меншої кількості NIST вказує на точний тест для малих вибірок, але для тесту реклами практична відповідь — продовжувати його виконувати.
Як розраховується розмір вибірки
Для двостороннього тесту відвідувачів на версію:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Тут p1 — ваш поточний показник, p2 — цей показник із застосованим приростом, а p̄ — їхнє середнє. Це нормальна апроксимація без поправки на неперервність, і вона має таку саму форму, як формула розміру вибірки для однієї частки в довіднику NIST, з доданою другою групою. За 95% рівня довіри z1−α/2 дорівнює 1.959964, а за 80% потужності z1−β дорівнює 0.841621.
Приклад розрахунку. Коефіцієнт конверсії 2%, і ви хочете вловити приріст 20%, тобто 2.0% проти 2.4%. Середній показник — 2.2%. Верхній рядок: 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, у квадраті це 0.3377, а поділивши на 0.004², отримаємо 21 109 відвідувачів на кожну версію, 42 218 загалом. За 3 000 відвідувачів на день це 15 днів.
Найбільше важить приріст, який ви хочете виявити. На тому самому показнику 2% приріст 30% потребує 9 798 на версію, а приріст 10% — 80 682. Зменшення приросту вдвічі приблизно вчетверо збільшує трафік, бо різниця стоїть у квадраті в знаменнику формули.
Чому дострокова зупинка роздуває кількість хибнопозитивних результатів
Рівень довіри 95% означає, що коли A і B насправді конвертують однаково, один тест із фіксованим розміром вибірки все одно оголошує переможця приблизно у 5% випадків. Ці 5% справджуються лише тоді, коли ви дивитеся один раз, у кінці.
Перевіряти результат щодня та зупинятися першого разу, коли він показує значущість, — це вже інша процедура. Показники коливаються, поки надходять дані, і кожен перегляд — це ще один шанс для випадкової різниці перетнути межу. Зупиніться на першому перетині — і ви обрали найвдаліший момент, тож справжня частка хибнопозитивних результатів виявляється вищою за 5% і зростає тим більше, чим частіше ви дивитеся. Значення p на екрані не знає, що ви підглядали, тож воно все одно показує так, ніби ви дивилися один раз.
Виправлення нудне, але працює: визначте розмір вибірки до початку тесту, дайте йому досягти цього розміру й прочитайте результат один раз. Заглянути посередині, щоб перевірити, чи нічого не зламалося, — це нормально. Зупинятися, бо цифра виглядає добре, — ні.
Що Meta та Google Ads кажуть про тривалість тесту
- Найкращі практики A/B-тестування Meta рекомендують тести тривалістю щонайменше 7 днів, зазначають, що коротші тести можуть давати непереконливі результати, і обмежують A/B-тести 30 днями. Та сама сторінка радить проводити тест довше, якщо клієнти зазвичай конвертують довше ніж за 7 днів.
- Meta зазвичай пропонує оцінену потужність 80% або вище — це потужність за замовчуванням тут. Результати A/B у Meta показують відсоток довіри, і 65% або вище вважається переможним результатом для A/B-тесту. Ця цифра походить із власного методу Meta й не є тим самим, що рівень довіри на цій сторінці, тож вони не збігатимуться.
- Meta також радить не тестувати неформально, вмикаючи й вимикаючи групи оголошень, бо аудиторії можуть перетинатися, і рекомендує однаковий бюджет для обох версій.
- Google Ads рекомендує давати експерименту працювати 2–3 тижні, за замовчуванням показує 80% довірчий інтервал з іншими рівнями на запит і позначає значущі результати синьою зірочкою. Його статистичний метод використовує jackknife-ресемплінг по 20 сегментах на кожну групу, тож його інтервали теж не точно збігатимуться з z-тестом.
Чого цей калькулятор не робить
- Він порівнює дві версії. За трьох або більше кожне додаткове порівняння — це ще один шанс на хибного переможця, і простий тест тут цього не враховує.
- Він тестує коефіцієнти конверсії, а не дохід на відвідувача чи вартість замовлення, для яких потрібен інший тест.
- Це не послідовний тест. Він припускає, що ви читаєте результат один раз, за запланованого розміру вибірки.
- Він не може сказати, чи був ваш розподіл чесним. Якщо одна версія отримала іншу аудиторію, бюджет чи час доби, жодна формула цього не виправить.
Якщо ви не хочете рахувати вручну
Hermoso — це маркетинг на автопілоті. Запитайте в нього, що масштабувати, призупинити й тестувати далі, і він прочитає кожну під'єднану рекламну платформу, винесе кампанії з надто малою кількістю даних в окрему категорію замість того, щоб їх оцінювати, і дасть кожному запропонованому тесту гіпотезу, одну річ, яку треба змінити, метрику, що визначає результат, бюджет і тривалість. Він також створює варіанти зображень і відео у вашому стилі для тестування та будує кампанії на ваших рекламних акаунтах, створені призупиненими. Він працює у вебдодатку або всередині Claude, ChatGPT і Cursor через свій MCP-сервер. Щойно тест має переможця, безкоштовний калькулятор ROAS підкаже, чи він ще й прибутковий.
Безкоштовні інструменти: · Калькулятор ROAS · Перевірка довжини рекламного тексту
Поширені запитання
Як дізнатися, чи мій A/B тест оголошення статистично значущий?
Введіть відвідувачів і конверсії для обох версій. Калькулятор виконує z-тест для двох часток і дає двостороннє p-значення. За 95% довіри p-значення нижче 0,05 означає, що розрив навряд чи випадковий. Для 200 з 10 000 проти 245 з 10 000 p дорівнює 0,031, тож B перемагає.
Скільки відвідувачів потрібно A/B тесту?
Це залежить від вашої частоти конверсії й найменшого приросту, який ви хочете виявити. За частоти конверсії 2% виявлення приросту 20% з 95% довірою і 80% потужністю потребує 21 109 відвідувачів на версію. Приріст 10% потребує 80 682.
Чому калькулятор каже, що даних поки недостатньо?
z-тест це наближення для великих вибірок. Калькулятор чекає, доки кожна версія не матиме принаймні 5 конверсій і 5 неконверсій, один із критеріїв, наведених у NIST e-Handbook, перш ніж дати висновок.
Чи можу я зупинити тест, щойно він виглядає значущим?
Ні, якщо ви хочете, щоб рівень довіри означав те, що він каже. Повторні перевірки й зупинка на першому значущому показнику дають випадковості більше можливостей перетнути межу, тож реальна частота хибнопозитивних результатів виявляється вищою за обрану. Спершу встановіть розмір вибірки й прочитайте результат один раз.
Як довго має тривати A/B тест Meta?
Meta рекомендує щонайменше 7 днів, зазначає, що коротші тести можуть бути непереконливими, і дозволяє до 30 днів. Google Ads рекомендує 2–3 тижні для експериментів. Скористайтеся вкладкою розміру вибірки з вашим денним трафіком, щоб побачити, скільки часу потрібно вашому тесту.
Чи надсилається кудись те, що я вводжу?
Ні. Обчислення виконуються у вашому браузері. Немає мережевого запиту, що передає те, що ви вводите, і нічого не зберігається.
Hermoso підкаже, що масштабувати, призупинити й тестувати далі у ваших рекламних акаунтах. Почніть безплатно, 250+ безплатних кредитів, що можна заробити, без картки.
Почати безкоштовно → Переглянути ціни