Kaksi kysymystä, yksi laskuri
Jokainen mainostesti kysyy kaksi asiaa, tässä järjestyksessä. Ennen aloitusta: kuinka monta kävijää se tarvitsee löytääkseen minua kiinnostavan eron? Jälkeen lopetuksen: onko A:n ja B:n välinen ero todellinen, vai voisiko se johtua sattumasta? Käytä yllä olevia kahta välilehteä tässä järjestyksessä. Otoskoon selvittäminen ensin on juuri se, mikä tekee toisen kysymyksen vastauksesta merkityksellisen.
“Kävijät” voivat olla laskeutumissivun kävijöitä, linkkiklikkauksia tai ketä tahansa muuta, joka sai reilun mahdollisuuden konvertoida, kunhan molemmat versiot lasketaan samalla tavalla. “Konversiot” ovat ne ihmiset, jotka tekivät sen asian, jota testaat.
Miten merkitsevyystesti toimii
Laskuri suorittaa kahden suhteen z-testin, suurten otosten testin kahden prosentin vertailuun, joka kuvataan julkaisussa NIST/SEMATECH e-Handbook of Statistical Methods:
- Yhdistetty prosentti p = (konversiot A + konversiot B) ÷ (kävijät A + kävijät B).
- z = (prosentti B − prosentti A) ÷ √(p × (1 − p) × (1/kävijät A + 1/kävijät B)).
- Kaksisuuntainen p-arvo = 2 × (1 − Φ(|z|)), jossa Φ on standardinormaalijakauma.
- Eron luottamusväli on (prosentti B − prosentti A) ± z × √(prosentti A × (1 − prosentti A) ÷ kävijät A + prosentti B × (1 − prosentti B) ÷ kävijät B). Nousun vaihteluväli jakaa tämän prosentti A:lla, mikä kohtelee prosentti A:ta tunnettuna, joten se on approksimaatio.
Laskettu esimerkki. Versio A saa 200 konversiota 10 000 kävijästä (2,00 %). Versio B saa 245 kävijästä 10 000 (2,45 %), eli 22,5 % suhteellinen nousu. Yhdistetty prosentti on 445 ÷ 20 000 = 2,225 %, keskivirhe on 0,209 prosenttiyksikköä, ja z = 0,45 ÷ 0,209 = 2,157. Kaksisuuntainen p-arvo on 0,031, alle 0,05, joten 95 %:n luottamustasolla B voittaa. Eron 95 %:n luottamusväli ulottuu +0,04:stä +0,86 prosenttiyksikköön: B on parempi, mutta todellinen nousu voisi olla mitä tahansa noin 2 %:n ja 43 %:n väliltä.
Testi on approksimaatio, joka tarvitsee riittävästi dataa. NIST:n käsikirja antaa yhden kriteerin: vähintään 5 onnistumista ja 5 epäonnistumista. Laskuri pidättää tuomionsa ja sanoo dataa ei vielä riittävästi, kunnes kummallakin versiolla on 5 konversiota ja 5 ei-konversiota. Jos niitä on vähemmän, NIST viittaa tarkkaan testiin pienille otoksille, mutta mainostestissä käytännön vastaus on jatkaa sen ajamista.
Miten otoskoko lasketaan
Kaksisuuntaisessa testissä kävijöitä per versio:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Tässä p1 on nykyinen konversioprosenttisi, p2 on sama prosentti nostolla sovellettuna ja p̄ on niiden keskiarvo. Kyseessä on normaaliapproksimaatio ilman jatkuvuuskorjausta, ja sillä on sama muoto kuin NIST-käsikirjan yhden osuuden otoskoon kaavalla, kun mukaan lisätään toinen ryhmä. 95 %:n luottamustasolla z1−α/2 on 1,959964 ja 80 %:n voimakkuudella z1−β on 0,841621.
Esimerkkilaskelma. 2 %:n konversioprosentti, ja haluat havaita 20 %:n noston, eli 2,0 % vastaan 2,4 %. Keskimääräinen prosentti on 2,2 %. Ylärivi on 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, neliöön korotettuna 0,3377, ja jakamalla luvulla 0,004² saadaan 21 109 kävijää versiota kohti, yhteensä 42 218. Kun kävijöitä on 3 000 päivässä, se on 15 päivää.
Haettava nosto ratkaisee eniten. Samalla 2 %:n prosentilla 30 %:n nosto vaatii 9 798 kävijää versiota kohti ja 10 %:n nosto 80 682. Noston puolittaminen suunnilleen nelinkertaistaa liikenteen, koska ero on neliössä kaavan alalaidassa.
Miksi liian aikainen lopettaminen kasvattaa vääriä positiivisia
95 %:n luottamustaso tarkoittaa, että kun A ja B konvertoivat todellisuudessa samoin, yksittäinen testi kiinteällä otoskoolla julistaa silti voittajan noin 5 % ajasta. Tuo 5 % pätee vain, jos katsot kerran, lopussa.
Tuloksen tarkistaminen joka päivä ja lopettaminen heti kun se näyttää merkitsevän on eri menettely. Prosentit vaeltelevat datan karttuessa, ja jokainen vilkaisu on uusi tilaisuus sattumanvaraisen eron ylittää raja. Lopeta ensimmäiseen ylitykseen, ja olet poiminut onnekkaimman hetken, jolloin todellinen väärien positiivisten osuus päätyy yli 5 %:n ja kasvaa mitä useammin katsot. Ruudun p-arvo ei tiedä kurkkailustasi, joten se näyttää yhä siltä kuin olisit katsonut kerran.
Korjaus on tylsä ja se toimii: päätä otoskoko ennen testin alkua, anna sen saavuttaa se koko ja lue tulos kerran. Keskellä vilkaisu, ettei mikään ole rikki, on ihan kunnossa. Lopettaminen siksi, että luku näyttää hyvältä, ei ole.
Mitä Meta ja Google Ads sanovat testin kestosta
- Metan A/B-testauksen parhaat käytännöt suosittelevat vähintään 7 päivän testejä, toteavat että sitä lyhyemmät testit voivat tuottaa epävarmoja tuloksia ja rajaavat A/B-testit 30 päivään. Sama sivu ehdottaa pidempää ajoa, jos asiakkailta kestää yleensä yli 7 päivää konvertoitua.
- Meta ehdottaa tyypillisesti arvioitua voimakkuutta 80 % tai enemmän, joka on täällä oletusvoimakkuus. Sen A/B-tulokset näyttävät luottamusprosentin, ja se pitää 65 %:a tai enemmän A/B-testin voittavana tuloksena. Tuo luku tulee Metan omasta menetelmästä eikä ole sama asia kuin tällä sivulla oleva luottamustaso, joten ne eivät täsmää.
- Meta myös kehottaa välttämään epämuodollista testausta kytkemällä mainosjoukkoja päälle ja pois, koska kohdeyleisöt voivat mennä päällekkäin, ja suosittelee samaa budjettia molemmille versioille.
- Google Ads suosittelee antamaan kokeen ajaa 2–3 viikkoa, näyttää oletuksena 80 %:n luottamusvälin ja muut tasot pyynnöstä, ja merkitsee merkitsevät tulokset sinisellä tähdellä. Sen tilastollinen menetelmä käyttää jackknife-uudelleenotantaa 20 lokeron yli haaraa kohti, joten sen välit eivät myöskään täsmää z-testiin tarkasti.
Mitä tämä laskuri ei tee
- Se vertaa kahta versiota. Kolmella tai useammalla jokainen ylimääräinen vertailu on uusi tilaisuus väärälle voittajalle, eikä tämän yksinkertainen testi korjaa sitä.
- Se testaa konversioprosentteja, ei kävijäkohtaista tuottoa tai tilauksen arvoa, jotka vaativat eri testin.
- Se ei ole sekventiaalinen testi. Se olettaa, että luet tuloksen kerran, suunnittelemallasi otoskoolla.
- Se ei voi kertoa, oliko jakosi reilu. Jos yksi versio sai eri yleisön, budjetin tai vuorokaudenajan, mikään kaava ei korjaa sitä.
Jos et mieluummin laskisi lukuja käsin
Hermoso on markkinointia autopilotilla. Kysy siltä mitä skaalata, keskeyttää ja testata seuraavaksi, ja se lukee jokaisen yhdistämäsi mainosalustan, laittaa liian vähän dataa omaavat kampanjat omaan lokeroonsa sen sijaan että arvioisi niitä, ja antaa jokaiselle ehdotetulle testille hypoteesin, yhden muutettavan asian, ratkaisevan mittarin, budjetin ja keston. Se tekee myös brändin mukaisia kuva- ja videovariantteja testattavaksi ja rakentaa kampanjoita omille mainostileillesi, luotuna keskeytettyinä. Se toimii verkkosovelluksessa tai Clauden, ChatGPT:n ja Cursorin sisällä sen MCP-palvelimen kautta. Kun testillä on voittaja, ilmainen ROAS-laskuri kertoo onko se myös kannattava.
Ilmaiset työkalut: · ROAS-laskuri · Mainostekstin pituuden tarkistin
Usein kysytyt kysymykset
Mistä tiedän, onko mainokseni A/B-testi tilastollisesti merkitsevä?
Syötä kävijät ja konversiot molemmille versioille. Laskuri suorittaa kahden suhteen z-testin ja antaa kaksisuuntaisen p-arvon. 95 %:n luottamustasolla p-arvo alle 0,05 tarkoittaa, että ero ei todennäköisesti ole sattumaa. Kun 200 / 10 000 vastaan 245 / 10 000, p on 0,031, joten B voittaa.
Kuinka monta kävijää A/B-testi tarvitsee?
Se riippuu konversioprosentistasi ja pienimmästä nostosta, jonka haluat havaita. 2 %:n konversioprosentilla 20 %:n noston havaitseminen 95 %:n luottamuksella ja 80 %:n voimalla vaatii 21 109 kävijää versiota kohti. 10 %:n nosto vaatii 80 682.
Miksi laskuri sanoo, ettei dataa ole vielä tarpeeksi?
Z-testi on suuren otoksen approksimaatio. Laskuri odottaa, kunnes kummallakin versiolla on vähintään 5 konversiota ja 5 ei-konversiota, mikä on yksi NIST e-Handbookin antamista kriteereistä, ennen kuin se antaa tuomion.
Voinko lopettaa testin heti, kun se näyttää merkitsevältä?
En, jos haluat luottamustason tarkoittavan sitä, mitä se sanoo. Toistuva tarkistaminen ja lopettaminen ensimmäisellä merkitsevällä lukemalla antaa sattumalle useamman mahdollisuuden ylittää raja, joten todellinen väärien positiivisten osuus päätyy korkeammaksi kuin valitsemasi. Aseta otoskoko ensin ja lue tulos kerran.
Kuinka kauan Metan A/B-testin pitäisi pyöriä?
Meta suosittelee vähintään 7 päivää, sanoo lyhyempien testien voivan jäädä epäselviksi ja sallii enintään 30 päivää. Google Ads suosittelee kokeiluihin 2–3 viikkoa. Käytä otoskoko-välilehteä päivittäisen liikenteesi kanssa nähdäksesi, kuinka kauan oma testisi tarvitsee.
Lähetetäänkö mitään kirjoittamaani minnekään?
Ei. Laskutoimitukset tehdään selaimessasi. Mikään verkkopyyntö ei kuljeta sitä, mitä kirjoitat, eikä mitään tallenneta.
Hermoso kertoo, mitä skaalata, pysäyttää ja testata seuraavaksi mainostileilläsi. Aloita ilmaiseksi, 250+ ansaittavaa ilmaista krediittiä, ei korttia.
Aloita ilmaiseksi → Katso hinnoittelu