Dvě otázky, jedna kalkulačka
Každý test reklamy se ptá na dvě věci, v tomto pořadí. Před spuštěním: kolik návštěvníků potřebuje, aby odhalil rozdíl, na kterém mi záleží? Po skončení: je rozdíl mezi A a B skutečný, nebo může jít o náhodu? Použijte dvě záložky výše v tomto pořadí. Právě to, že nejprve spočítáte velikost vzorku, dává odpovědi na druhou otázku smysl.
“Návštěvníci” mohou být návštěvníci vstupní stránky, kliknutí na odkaz nebo kdokoli jiný, kdo dostal spravedlivou šanci konvertovat, pokud se obě verze počítají stejným způsobem. “Konverze” jsou lidé, kteří udělali to, co testujete.
Jak funguje test významnosti
Kalkulačka provádí z-test dvou podílů, velkovzorkový test pro porovnání dvou měr popsaný v NIST/SEMATECH e-Handbook of Statistical Methods:
- Sdružená míra p = (konverze A + konverze B) ÷ (návštěvníci A + návštěvníci B).
- z = (míra B − míra A) ÷ √(p × (1 − p) × (1/návštěvníci A + 1/návštěvníci B)).
- Oboustranná p-hodnota = 2 × (1 − Φ(|z|)), kde Φ je standardní normální rozdělení.
- Interval pro rozdíl je (míra B − míra A) ± z × √(míra A × (1 − míra A) ÷ návštěvníci A + míra B × (1 − míra B) ÷ návštěvníci B). Rozsah nárůstu to dělí mírou A, čímž míru A považuje za známou, takže jde o aproximaci.
Vyřešený příklad. Verze A získá 200 konverzí z 10 000 návštěvníků (2,00 %). Verze B získá 245 z 10 000 (2,45 %), tedy relativní nárůst 22,5 %. Sdružená míra je 445 ÷ 20 000 = 2,225 %, směrodatná chyba je 0,209 procentního bodu a z = 0,45 ÷ 0,209 = 2,157. Oboustranná p-hodnota je 0,031, pod 0,05, takže při 95% spolehlivosti vyhrává B. 95% interval pro rozdíl se pohybuje od +0,04 do +0,86 procentního bodu: B je lepší, ale skutečný nárůst může být kdekoli od zhruba 2 % do 43 %.
Test je aproximace, která potřebuje dostatek dat. Příručka NIST uvádí jedno kritérium: alespoň 5 úspěchů a 5 neúspěchů. Kalkulačka zadrží svůj verdikt a uvádí zatím není dost dat, dokud každá verze nemá 5 konverzí a 5 nekonverzí. Při nižším počtu NIST odkazuje na přesný test pro malé vzorky, ale u testu reklamy je praktickou odpovědí nechat ho běžet dál.
Jak se počítá velikost vzorku
Pro oboustranný test, návštěvníků na verzi:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Zde je p1 vaše aktuální míra, p2 je tatáž míra s aplikovaným nárůstem a p̄ je jejich průměr. Jde o normální aproximaci bez korekce na spojitost a má stejný tvar jako vzorec pro velikost vzorku u jednoho podílu v příručce NIST, s přidáním druhé skupiny. Při 95% spolehlivosti je z1−α/2 rovno 1,959964 a při 80% síle je z1−β rovno 0,841621.
Řešený příklad. Konverzní poměr 2 % a chcete zachytit nárůst 20 %, tedy 2,0 % oproti 2,4 %. Průměrná míra je 2,2 %. Horní člen je 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, na druhou 0,3377, a po dělení 0,004² vychází 21 109 návštěvníků na verzi, celkem 42 218. Při 3 000 návštěvnících denně je to 15 dní.
Nejvíc záleží na nárůstu, který požadujete. Při stejné 2% míře potřebuje nárůst 30 % 9 798 na verzi a nárůst 10 % 80 682. Poloviční nárůst zhruba zečtyřnásobí potřebný provoz, protože ten rozdíl figuruje umocněný ve jmenovateli vzorce.
Proč předčasné ukončení nafukuje falešné výsledky
95% úroveň spolehlivosti znamená, že když A a B konvertují skutečně stejně, jeden test s pevnou velikostí vzorku přesto vyhlásí vítěze asi v 5 % případů. Těch 5 % platí jen tehdy, když se podíváte jednou, na konci.
Kontrolovat výsledek každý den a zastavit poprvé, kdy se ukáže jako významný, je jiný postup. Míry kolísají, jak přibývají data, a každý pohled je další šance, že náhodný rozdíl překročí hranici. Zastavíte-li u prvního překročení, vybrali jste nejšťastnější okamžik, takže skutečná míra falešně pozitivních výsledků skončí nad 5 % a roste s tím, jak často se díváte. Hodnota p na obrazovce neví, že jste nakukovali, takže ji stále zobrazuje, jako byste se podívali jednou.
Náprava je nudná a funguje: velikost vzorku stanovte před začátkem testu, nechte ho této velikosti dosáhnout a výsledek přečtěte jednou. Nahlédnout uprostřed a zkontrolovat, že nic nedrhne, je v pořádku. Zastavit, protože číslo vypadá dobře, v pořádku není.
Co o délce testu říká Meta a Google Ads
- Osvědčené postupy pro A/B testování od Mety doporučují testy dlouhé alespoň 7 dní, uvádějí, že kratší testy mohou dát neprůkazné výsledky, a A/B testy omezují na 30 dní. Tatáž stránka doporučuje nechat test běžet déle, pokud zákazníkům obvykle trvá konverze déle než 7 dní.
- Meta obvykle doporučuje odhadovanou sílu 80 % nebo vyšší, což je zde výchozí síla. Její výsledky A/B testů zobrazují procento spolehlivosti a výsledek 65 % nebo vyšší považuje u A/B testu za vítězný. To číslo pochází z vlastní metody Mety a není totéž co úroveň spolehlivosti na této stránce, takže se obě nebudou shodovat.
- Meta také nedoporučuje testovat neformálně zapínáním a vypínáním sad reklam, protože se publika mohou překrývat, a doporučuje stejný rozpočet pro obě verze.
- Google Ads doporučuje nechat experiment běžet 2 až 3 týdny, ve výchozím nastavení zobrazuje 80% interval spolehlivosti s možností jiných úrovní na požádání a významné výsledky označuje modrou hvězdičkou. Jeho statistická metoda používá jackknife převzorkování přes 20 segmentů na větev, takže se jeho intervaly se z-testem přesně neshodnou ani ony.
Co tato kalkulačka nedělá
- Porovnává dvě verze. U tří a více je každé další srovnání další šancí na falešného vítěze a jednoduchý test zde na to neupravuje.
- Testuje konverzní poměry, ne tržby na návštěvníka ani hodnotu objednávky, které vyžadují jiný test.
- Není to sekvenční test. Předpokládá, že výsledek přečtete jednou, při naplánované velikosti vzorku.
- Nedokáže posoudit, zda bylo rozdělení férové. Pokud jedna verze dostala jiné publikum, rozpočet nebo denní dobu, žádný vzorec to nespraví.
Pokud nechcete počítat čísla ručně
Hermoso je marketing na autopilota. Zeptejte se ho, co škálovat, pozastavit a otestovat dál, a přečte každou reklamní platformu, kterou máte připojenou, kampaně s příliš malým množstvím dat zařadí do vlastní skupiny místo jejich hodnocení a každému navrženému testu dá hypotézu, jednu věc ke změně, metriku, která rozhodne, rozpočet a dobu trvání. Vytváří také obrazové a video varianty v souladu s vaší značkou k testování a staví kampaně na vašich vlastních reklamních účtech, vytvořené pozastavené. Funguje ve webové aplikaci nebo uvnitř Claude, ChatGPT a Cursor přes svůj MCP server. Jakmile má test vítěze, bezplatná kalkulačka ROAS vám řekne, zda je také ziskový.
Bezplatné nástroje: · Kalkulačka ROAS · Kontrola délky reklamního textu
Často kladené dotazy
Jak poznám, zda je můj A/B test reklamy statisticky významný?
Zadejte návštěvníky a konverze pro obě verze. Kalkulačka spustí z-test dvou podílů a vrátí oboustrannou p-hodnotu. Při 95% spolehlivosti znamená p-hodnota pod 0,05, že rozdíl pravděpodobně není náhoda. Pro 200 z 10 000 proti 245 z 10 000 je p rovno 0,031, takže vyhrává B.
Kolik návštěvníků A/B test potřebuje?
Záleží na vaší konverzní míře a nejmenším nárůstu, který chcete zjistit. Při 2% konverzní míře vyžaduje zjištění 20% nárůstu při 95% spolehlivosti a 80% síle 21 109 návštěvníků na verzi. 10% nárůst vyžaduje 80 682.
Proč kalkulačka říká, že zatím není dost dat?
Z-test je aproximace pro velké vzorky. Kalkulačka čeká, dokud každá verze nemá alespoň 5 konverzí a 5 nekonverzí, což je jedno z kritérií uvedených v NIST e-Handbooku, než vynese verdikt.
Mohu test zastavit, jakmile vypadá významně?
Ne, pokud chcete, aby úroveň spolehlivosti znamenala to, co říká. Opakovaná kontrola a zastavení při prvním významném odečtu dává náhodě více příležitostí překročit hranici, takže skutečná míra falešně pozitivních výsledků skončí vyšší, než jste zvolili. Nejprve nastavte velikost vzorku a výsledek odečtěte jednou.
Jak dlouho by měl A/B test na Metě běžet?
Meta doporučuje alespoň 7 dní, uvádí, že kratší testy mohou být neprůkazné, a povoluje až 30 dní. Google Ads doporučuje pro experimenty 2 až 3 týdny. Použijte záložku velikosti vzorku se svou denní návštěvností a uvidíte, jak dlouho váš test potřebuje.
Posílá se něco, co napíšu, někam?
Ne. Výpočty běží ve vašem prohlížeči. Neexistuje žádný síťový požadavek, který by nesl to, co napíšete, a nic se neukládá.
Hermoso vám napříč vašimi reklamními účty řekne, co škálovat, pozastavit a co testovat dál. Začněte zdarma, 250+ získatelných bezplatných kreditů, bez karty.
Začít zdarma → Zobrazit ceny