Két kérdés, egy kalkulátor
Minden hirdetési teszt két dolgot kérdez, ebben a sorrendben. Mielőtt elindul: hány látogatóra van szükség, hogy megtaláljam a számomra fontos különbséget? Miután véget ért: valódi-e az eltérés A és B között, vagy lehet véletlen is? Használd a fenti két fület ebben a sorrendben. A mintaméret előzetes kiszámítása adja meg a második kérdésre adott válasz értelmét.
A “látogatók” lehetnek a céloldal látogatói, a linkkattintások vagy bárki más, aki tisztességes esélyt kapott a konverzióra, amíg mindkét verziót ugyanúgy számolod. A “konverziók” azok az emberek, akik megtették azt, amit tesztelsz.
Hogyan működik a szignifikanciateszt
A kalkulátor két arány z-tesztjét futtatja, a két arány összehasonlítására szolgáló nagymintás tesztet, amelyet a NIST/SEMATECH e-Handbook of Statistical Methods ír le:
- Egyesített arány p = (A konverziói + B konverziói) ÷ (A látogatói + B látogatói).
- z = (B aránya − A aránya) ÷ √(p × (1 − p) × (1/A látogatói + 1/B látogatói)).
- Kétoldali p-érték = 2 × (1 − Φ(|z|)), ahol Φ a standard normális eloszlás.
- A különbség intervalluma (B aránya − A aránya) ± z × √(A aránya × (1 − A aránya) ÷ A látogatói + B aránya × (1 − B aránya) ÷ B látogatói). A növekedési tartomány ezt elosztja A arányával, ami A arányát ismertnek tekinti, így ez közelítés.
Kidolgozott példa. Az A verzió 10 000 látogatóból 200 konverziót kap (2,00%). A B verzió 10 000-ből 245-öt (2,45%), ami 22,5%-os relatív növekedés. Az egyesített arány 445 ÷ 20 000 = 2,225%, a standard hiba 0,209 százalékpont, z = 0,45 ÷ 0,209 = 2,157. A kétoldali p-érték 0,031, ami 0,05 alatt van, így 95%-os konfidenciaszinten B nyer. A különbség 95%-os intervalluma +0,04 és +0,86 százalékpont között húzódik: B jobb, de a valódi növekedés nagyjából 2% és 43% között lehet.
A teszt egy közelítés, amelynek elegendő adatra van szüksége. A NIST kézikönyve egy kritériumot ad meg: legalább 5 siker és 5 kudarc. A kalkulátor visszatartja a döntését és azt mondja, hogy még nincs elég adat, amíg mindegyik verziónak nincs 5 konverziója és 5 nem-konverziója. Ennél kevesebbel a NIST egy kis mintás egzakt tesztre mutat, de egy hirdetési teszthez a gyakorlati válasz az, hogy hagyd tovább futni.
Hogyan számítódik ki a mintaméret
Kétoldali teszthez a verziónkénti látogatók száma:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Itt p1 a jelenlegi arányod, p2 ugyanez az arány az emelkedés alkalmazása után, p̄ pedig a kettő átlaga. Ez a normál közelítés, folytonossági korrekció nélkül, és ugyanolyan alakú, mint a NIST kézikönyvben szereplő egyarányos mintanagyság-képlet, egy második csoporttal kiegészítve. 95%-os megbízhatóságnál z1−α/2 értéke 1,959964, 80%-os erőnél pedig z1−β értéke 0,841621.
Kidolgozott példa. 2%-os konverziós arány, és egy 20%-os emelkedést akarsz kimutatni, tehát 2,0% szemben 2,4%-kal. Az átlagos arány 2,2%. A felső sor 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, négyzetre emelve 0,3377, majd 0,004²-tel osztva 21 109 látogató verziónként, összesen 42 218. Napi 3 000 látogatónál ez 15 nap.
A kért emelkedés számít a legtöbbet. Ugyanazon a 2%-os arányon egy 30%-os emelkedéshez 9 798, egy 10%-oshoz pedig 80 682 kell verziónként. Ha felezed az emelkedést, az nagyjából megnégyszerezi a forgalmat, mert a különbség négyzetre emelve szerepel a képlet alján.
Miért növeli a korai leállítás a téves pozitívakat
A 95%-os megbízhatósági szint azt jelenti, hogy amikor A és B valójában ugyanúgy konvertál, egy rögzített mintanagyságú egyszeri teszt akkor is kihirdet győztest az esetek kb. 5%-ában. Ez az 5% csak akkor igaz, ha egyszer, a végén nézed meg.
Az eredmény napi ellenőrzése, és a leállítás, amint először szignifikánsnak mutatkozik, egy másik eljárás. Az arányok ingadoznak, ahogy jönnek az adatok, és minden egyes ránézés újabb esély arra, hogy egy véletlenszerű különbség átlépje a határt. Ha az első átlépésnél állsz le, a legszerencsésebb pillanatot választottad ki, így a valós téves pozitív arány 5% fölé kerül, és annál nagyobb, minél gyakrabban nézel rá. A képernyőn lévő p-érték nem tudja, hogy belekukkantottál, ezért úgy mutat, mintha egyszer néztél volna rá.
A megoldás unalmas, de működik: döntsd el a mintanagyságot a teszt indulása előtt, hagyd, hogy elérje ezt a méretet, és egyszer olvasd le az eredményt. Közben rápillantani, hogy nem romlott-e el semmi, rendben van. Leállítani, mert jól néz ki a szám, nem.
Mit mond a Meta és a Google Ads a teszt hosszáról
- A Meta A/B tesztelési legjobb gyakorlatai legalább 7 napos teszteket ajánlanak, szerintük az ennél rövidebbek nem feltétlenül adnak egyértelmű eredményt, és az A/B teszteket 30 napban maximalizálják. Ugyanez az oldal azt javasolja, hogy futtasd hosszabban, ha a vásárlóknak általában több mint 7 napba telik a konverzió.
- A Meta általában 80%-os vagy magasabb becsült erőt javasol, ez itt az alapértelmezett erő. Az A/B eredményei egy megbízhatósági százalékot mutatnak, és a 65%-ot vagy magasabbat tekinti győztes eredménynek egy A/B tesztnél. Ez a szám a Meta saját módszeréből ered, és nem ugyanaz, mint az ezen az oldalon lévő megbízhatósági szint, így a kettő nem fog egyezni.
- A Meta azt is ellenzi, hogy informálisan tesztelj hirdetéssorozatok ki- és bekapcsolgatásával, mert a célközönségek átfedhetik egymást, és azt ajánlja, hogy mindkét verzióhoz ugyanakkora büdzsé tartozzon.
- A Google Ads azt ajánlja, hogy egy kísérletet 2-3 hétig futtass, alapból 80%-os megbízhatósági intervallumot mutat, kérésre más szintekkel, és a szignifikáns eredményeket kék csillaggal jelöli. A statisztikai módszere jackknife újramintavételezést használ karonként 20 vödörben, így az intervallumai sem fognak pontosan egyezni egy z-próbával.
Mit nem csinál ez a kalkulátor
- Két verziót hasonlít össze. Három vagy több esetén minden további összehasonlítás újabb esély a téves győztesre, és az itteni egyszerű próba ezt nem korrigálja.
- Konverziós arányokat tesztel, nem a látogatónkénti bevételt vagy a rendelési értéket, amelyekhez más próba kell.
- Nem szekvenciális teszt. Azt feltételezi, hogy egyszer, a tervezett mintanagyságnál olvasod le az eredményt.
- Nem tudja megmondani, hogy a szétosztásod igazságos volt-e. Ha az egyik verzió más célközönséget, büdzsét vagy napszakot kapott, azt semmilyen képlet nem javítja.
Ha inkább nem fejben számolnád ki
A Hermoso marketing robotpilótán. Kérdezd meg tőle, mit skálázz, állíts le és tesztelj legközelebb, és beolvassa minden csatlakoztatott hirdetési platformodat, a túl kevés adattal rendelkező kampányokat külön vödörbe teszi ahelyett, hogy megítélné őket, és minden javasolt teszthez ad egy hipotézist, az egy dolgot, amit változtatni kell, a döntő metrikát, egy büdzsét és egy időtartamot. Márkahű kép- és videóvariánsokat is készít a teszteléshez, és kampányokat épít a saját hirdetési fiókjaidon, szüneteltetve létrehozva. Működik a webes appban, vagy a Claude, a ChatGPT és a Cursor belsejében az MCP szerverén keresztül. Ha egy tesztnek már van győztese, az ingyenes ROAS kalkulátor megmondja, hogy nyereséges-e is.
Ingyenes eszközök: · ROAS kalkulátor · Hirdetésszöveg hosszellenőrző
Gyakran ismételt kérdések
Honnan tudom, hogy a hirdetésem A/B-tesztje statisztikailag szignifikáns?
Add meg mindkét verzió látogatóit és konverzióit. A kalkulátor kétarányos z-tesztet futtat, és kétoldali p-értéket ad. 95%-os konfidencián a 0.05 alatti p-érték azt jelenti, hogy a különbség valószínűleg nem a véletlen műve. 200/10 000 a 245/10 000 ellenében esetén a p 0.031, tehát a B nyer.
Hány látogatóra van szüksége egy A/B-tesztnek?
A konverziós rátádtól és a legkisebb kimutatni kívánt növekedéstől függ. 2%-os konverziós rátánál egy 20%-os növekedés kimutatása 95%-os konfidencián és 80%-os erővel 21 109 látogatót igényel verziónként. Egy 10%-os növekedéshez 80 682 kell.
Miért írja a kalkulátor, hogy még nincs elég adat?
A z-teszt egy nagymintás közelítés. A kalkulátor megvárja, amíg mindegyik verzióban legalább 5 konverzió és 5 nem-konverzió van, ami a NIST e-Handbookban megadott egyik kritérium, mielőtt ítéletet hoz.
Leállíthatom a tesztet, amint szignifikánsnak tűnik?
Nem, ha azt szeretnéd, hogy a konfidenciaszint azt jelentse, amit mond. Ha ismételten ellenőrzöd, és az első szignifikáns leolvasásnál leállsz, az a véletlennek több esélyt ad átlépni a határt, így a valódi téves pozitív arány magasabb lesz, mint amit kiválasztottál. Előbb állítsd be a mintaméretet, és egyszer olvasd le az eredményt.
Meddig kell futnia egy Meta A/B-tesztnek?
A Meta legalább 7 napot javasol, azt mondja, a rövidebb tesztek nem egyértelműek lehetnek, és legfeljebb 30 napot enged meg. A Google Ads 2–3 hetet javasol a kísérletekhez. Használd a mintaméret-fület a napi forgalmaddal, hogy lásd, mennyi ideig kell futnia a saját tesztednek.
Elküldünk bárhova valamit, amit beírsz?
Nem. A számítások a böngésződben futnak. Nincs hálózati kérés, amely továbbvinné, amit beírsz, és semmit sem tárolunk.
A Hermoso megmondja, mit skálázz, mit szüneteltess és mit tesztelj legközelebb a hirdetési fiókjaidban. Kezdd ingyen, 250+ megszerezhető ingyenes kredit, bankkártya nélkül.
Kezdd ingyenesen → Árak megtekintése