To spørgsmål, én beregner
Hver annoncetest stiller to spørgsmål, i denne rækkefølge. Før den starter: hvor mange besøgende skal den bruge for at finde den forskel, jeg interesserer mig for? Efter den slutter: er springet mellem A og B reelt, eller kan det skyldes tilfældigheder? Brug de to faner ovenfor i den rækkefølge. At regne stikprøvestørrelsen ud først er det, der giver svaret på det andet spørgsmål mening.
“Besøgende” kan være besøgende på landingssiden, linkklik eller enhver anden, der fik en rimelig chance for at konvertere, så længe begge versioner tælles på samme måde. “Konverteringer” er de personer, der gjorde det, du tester for.
Sådan fungerer signifikanstesten
Beregneren kører en z-test for to andele, test til store stikprøver til sammenligning af to rater, beskrevet i NIST/SEMATECH e-Handbook of Statistical Methods:
- Samlet rate p = (konverteringer A + konverteringer B) ÷ (besøgende A + besøgende B).
- z = (rate B − rate A) ÷ √(p × (1 − p) × (1/besøgende A + 1/besøgende B)).
- Tosidet p-værdi = 2 × (1 − Φ(|z|)), hvor Φ er standardnormalfordelingen.
- Intervallet for forskellen er (rate B − rate A) ± z × √(rate A × (1 − rate A) ÷ besøgende A + rate B × (1 − rate B) ÷ besøgende B). Fremgangsintervallet dividerer det med rate A, hvilket behandler rate A som kendt, så det er en approksimation.
Gennemregnet eksempel. Version A får 200 konverteringer ud af 10.000 besøgende (2,00 %). Version B får 245 ud af 10.000 (2,45 %), en relativ fremgang på 22,5 %. Den samlede rate er 445 ÷ 20.000 = 2,225 %, standardfejlen er 0,209 procentpoint, og z = 0,45 ÷ 0,209 = 2,157. Den tosidede p-værdi er 0,031, under 0,05, så med 95 % sikkerhed vinder B. 95 %-intervallet for forskellen går fra +0,04 til +0,86 procentpoint: B er bedre, men den sande fremgang kan være alt fra cirka 2 % til 43 %.
Testen er en approksimation, der kræver nok data. NIST's håndbog giver ét kriterium: mindst 5 succeser og 5 fejl. Beregneren tilbageholder sin dom og siger ikke nok data endnu, indtil hver version har 5 konverteringer og 5 ikke-konverteringer. Med færre end det henviser NIST til en eksakt test til små stikprøver, men for en annoncetest er det praktiske svar at lade den køre videre.
Sådan beregnes stikprøvestørrelsen
For en tosidet test, besøgende pr. version:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Her er p1 din nuværende rate, p2 er den rate med løftet anvendt, og p̄ er deres gennemsnit. Det er normalapproksimationen uden kontinuitetskorrektion, og den har samme form som formlen for stikprøvestørrelse ved en enkelt andel i NIST-håndbogen, med en ekstra gruppe tilføjet. Ved 95% konfidens er z1−α/2 1,959964, og ved 80% styrke er z1−β 0,841621.
Gennemregnet eksempel. En konverteringsrate på 2%, og du vil fange et løft på 20%, altså 2,0% mod 2,4%. Gennemsnitsraten er 2,2%. Den øverste linje er 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, kvadreret bliver det 0,3377, og divideret med 0,004² får du 21.109 besøgende pr. version, 42.218 i alt. Ved 3.000 besøgende om dagen er det 15 dage.
Det løft, du beder om, betyder mest. Ved samme rate på 2% kræver et løft på 30% 9.798 pr. version, og et løft på 10% kræver 80.682. Halverer du løftet, firedobles trafikken groft sagt, fordi forskellen står kvadreret i bunden af formlen.
Hvorfor det blæser antallet af falske positive op at stoppe for tidligt
Et konfidensniveau på 95% betyder, at når A og B reelt konverterer ens, vil en enkelt test ved en fast stikprøvestørrelse stadig udpege en vinder omkring 5% af gangene. De 5% gælder kun, hvis du kigger én gang, til sidst.
At tjekke resultatet hver dag og stoppe første gang, det viser signifikant, er en anden fremgangsmåde. Raterne vandrer, efterhånden som data kommer ind, og hvert kig er endnu en chance for, at en tilfældig forskel krydser grænsen. Stop ved første krydsning, og du har valgt det heldigste øjeblik, så den reelle rate af falske positive ender over 5%, og den vokser, jo oftere du kigger. P-værdien på skærmen ved ikke, at du kiggede, så den aflæses stadig, som om du havde kigget én gang.
Løsningen er kedelig, og den virker: bestem stikprøvestørrelsen før testen starter, lad den nå den størrelse, og aflæs resultatet én gang. At kigge undervejs for at tjekke, at intet er i stykker, er fint. At stoppe, fordi tallet ser godt ud, er det ikke.
Hvad Meta og Google Ads siger om testlængde
- Metas best practices for A/B-test anbefaler test på mindst 7 dage, siger at kortere test kan give uafklarede resultater, og sætter loft over A/B-test på 30 dage. Samme side foreslår at køre længere, hvis kunder normalt bruger mere end 7 dage på at konvertere.
- Meta foreslår typisk en anslået styrke på 80% eller højere, standardstyrken her. Dens A/B-resultater viser en konfidensprocent, og den behandler 65% eller højere som et vindende resultat for en A/B-test. Det tal kommer fra Metas egen metode og er ikke det samme som konfidensniveauet på denne side, så de to vil ikke stemme overens.
- Meta fraråder også at teste uformelt ved at slå annoncesæt til og fra, fordi målgrupper kan overlappe, og anbefaler samme budget til begge versioner.
- Google Ads anbefaler at lade et eksperiment køre i 2 til 3 uger, viser som standard et konfidensinterval på 80% med andre niveauer efter ønske og markerer signifikante resultater med en blå stjerne. Dens statistiske metode bruger jackknife-resampling over 20 bøtter pr. arm, så dens intervaller vil heller ikke stemme nøjagtigt med en z-test.
Hvad denne beregner ikke gør
- Den sammenligner to versioner. Med tre eller flere er hver ekstra sammenligning endnu en chance for en falsk vinder, og den simple test her justerer ikke for det.
- Den tester konverteringsrater, ikke omsætning pr. besøgende eller ordreværdi, som kræver en anden test.
- Det er ikke en sekventiel test. Den antager, at du aflæser resultatet én gang, ved den stikprøvestørrelse, du planlagde.
- Den kan ikke afgøre, om din opdeling var fair. Hvis en version fik en anden målgruppe, et andet budget eller et andet tidspunkt på dagen, retter ingen formel op på det.
Hvis du hellere vil slippe for at regne i hånden
Hermoso er markedsføring på autopilot. Spørg den hvad du skal skalere, sætte på pause og teste næste gang, og den læser alle de annonceplatforme, du har forbundet, lægger kampagner med for lidt data i deres egen bøtte i stedet for at bedømme dem og giver hver foreslået test en hypotese, den ene ting der skal ændres, det måltal der afgør den, et budget og en varighed. Den laver også brandtro billed- og videovarianter til test og bygger kampagner på dine egne annoncekonti, oprettet på pause. Den virker i webappen eller inde i Claude, ChatGPT og Cursor via dens MCP-server. Når en test har en vinder, fortæller den gratis ROAS-beregner dig, om den også er rentabel.
Gratis værktøjer: · ROAS-beregner · Checker til annoncetekstlængde
Ofte stillede spørgsmål
Hvordan ved jeg, om min A/B-test af en annonce er statistisk signifikant?
Indtast besøgende og konverteringer for begge versioner. Beregneren kører en z-test for to andele og giver en tosidet p-værdi. Ved 95% konfidens betyder en p-værdi under 0,05, at forskellen næppe skyldes tilfældigheder. For 200 ud af 10.000 mod 245 ud af 10.000 er p 0,031, så B vinder.
Hvor mange besøgende kræver en A/B-test?
Det afhænger af din konverteringsrate og det mindste løft, du vil kunne opdage. Ved en konverteringsrate på 2% kræver det 21.109 besøgende pr. version at finde et løft på 20% ved 95% konfidens og 80% styrke. Et løft på 10% kræver 80.682.
Hvorfor siger beregneren, at der endnu ikke er nok data?
Z-testen er en tilnærmelse til store stikprøver. Beregneren venter, indtil hver version har mindst 5 konverteringer og 5 ikke-konverteringer, et af kriterierne i NIST e-Handbook, før den giver en dom.
Kan jeg stoppe en test, så snart den ser signifikant ud?
Ikke hvis du vil have, at konfidensniveauet skal betyde det, det siger. At tjekke gentagne gange og stoppe ved den første signifikante aflæsning giver tilfældigheder flere chancer for at krydse grænsen, så den reelle rate af falske positiver ender højere end den, du valgte. Fastsæt stikprøvestørrelsen først, og aflæs resultatet én gang.
Hvor længe bør en A/B-test på Meta køre?
Meta anbefaler mindst 7 dage, siger at kortere tests kan være inkonklusive og tillader op til 30 dage. Google Ads anbefaler 2 til 3 uger til eksperimenter. Brug fanen for stikprøvestørrelse med din daglige trafik for at se, hvor længe din egen test skal køre.
Bliver noget af det, jeg skriver, sendt nogen steder?
Nej. Beregningerne kører i din browser. Der er ingen netværksforespørgsel, der bærer det, du skriver, og intet gemmes.
Hermoso fortæller dig, hvad du skal skalere, sætte på pause og teste næste gang på tværs af dine annoncekonti. Start gratis, 250+ gratis credits at optjene, intet kort.
Start gratis → Se priser