To spørsmål, én kalkulator
Hver annonsetest stiller to spørsmål, i denne rekkefølgen. Før den starter: hvor mange besøkende trengs for å finne forskjellen jeg bryr meg om? Etter at den er ferdig: er forskjellen mellom A og B reell, eller kan det være tilfeldig? Bruk de to fanene ovenfor i den rekkefølgen. Å regne ut utvalgsstørrelsen først er det som gjør at svaret på det andre spørsmålet betyr noe.
“Besøkende” kan være besøkende på landingssiden, lenkeklikk eller alle andre som fikk en reell sjanse til å konvertere, så lenge begge versjonene telles på samme måte. “Konverteringer” er de som gjorde det du tester for.
Slik fungerer signifikanstesten
Kalkulatoren kjører en z-test for to andeler, storutvalgstesten for å sammenligne to rater som er beskrevet i NIST/SEMATECH e-Handbook of Statistical Methods:
- Samlet rate p = (konverteringer A + konverteringer B) ÷ (besøkende A + besøkende B).
- z = (rate B − rate A) ÷ √(p × (1 − p) × (1/besøkende A + 1/besøkende B)).
- Tosidig p-verdi = 2 × (1 − Φ(|z|)), der Φ er standard normalfordeling.
- Intervallet for forskjellen er (rate B − rate A) ± z × √(rate A × (1 − rate A) ÷ besøkende A + rate B × (1 − rate B) ÷ besøkende B). Økningsintervallet deler det på rate A, som behandler rate A som kjent, så det er en tilnærming.
Gjennomgått eksempel. Versjon A får 200 konverteringer av 10 000 besøkende (2,00 %). Versjon B får 245 av 10 000 (2,45 %), en relativ økning på 22,5 %. Samlet rate er 445 ÷ 20 000 = 2,225 %, standardfeilen er 0,209 prosentpoeng, og z = 0,45 ÷ 0,209 = 2,157. Den tosidige p-verdien er 0,031, under 0,05, så med 95 % konfidens vinner B. 95 %-intervallet for forskjellen går fra +0,04 til +0,86 prosentpoeng: B er bedre, men den sanne økningen kan være alt fra omtrent 2 % til 43 %.
Testen er en tilnærming som trenger nok data. NIST-håndboken gir ett kriterium: minst 5 suksesser og 5 feil. Kalkulatoren holder tilbake sin konklusjon og sier ikke nok data ennå inntil hver versjon har 5 konverteringer og 5 ikke-konverteringer. Med færre enn det peker NIST på en eksakt test for små utvalg, men for en annonsetest er det praktiske svaret å la den fortsette.
Slik beregnes utvalgsstørrelsen
For en tosidig test, besøkende per versjon:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Her er p1 din nåværende rate, p2 er den raten med økningen lagt til, og p̄ er gjennomsnittet deres. Det er normaltilnærmingen, uten kontinuitetskorreksjon, og den har samme form som formelen for utvalgsstørrelse ved én andel i NIST-håndboken, med en andre gruppe lagt til. Ved 95 % konfidens er z1−α/2 1,959964, og ved 80 % styrke er z1−β 0,841621.
Regneeksempel. En konverteringsrate på 2 %, og du vil fange opp en økning på 20 %, altså 2,0 % mot 2,4 %. Gjennomsnittsraten er 2,2 %. Toppen er 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, kvadrert blir 0,3377, og delt på 0,004² gir 21 109 besøkende per versjon, 42 218 totalt. Ved 3 000 besøkende om dagen er det 15 dager.
Økningen du ber om, betyr mest. På samme rate på 2 % trenger en økning på 30 % 9 798 per versjon, og en økning på 10 % trenger 80 682. Å halvere økningen firedobler omtrent trafikken, fordi gapet står kvadrert nederst i formelen.
Hvorfor det å stoppe tidlig blåser opp falske positive
Et konfidensnivå på 95 % betyr at når A og B egentlig konverterer likt, kårer én enkelt test ved en fast utvalgsstørrelse likevel en vinner omtrent 5 % av gangene. De 5 % stemmer bare hvis du ser én gang, til slutt.
Å sjekke resultatet hver dag og stoppe første gang det viser signifikant er en annen fremgangsmåte. Ratene vandrer etter hvert som data kommer inn, og hver titt er en ny sjanse for at et tilfeldig gap krysser grensen. Stopp ved første kryssing, og du har plukket det heldigste øyeblikket, så den reelle raten av falske positive havner over 5 %, og den vokser jo oftere du ser. P-verdien på skjermen vet ikke at du tittet, så den leses fortsatt som om du så én gang.
Løsningen er kjedelig og den virker: bestem utvalgsstørrelsen før testen starter, la den nå den størrelsen, og les resultatet én gang. Å titte underveis for å sjekke at ingenting er ødelagt, er greit. Å stoppe fordi tallet ser bra ut, er det ikke.
Hva Meta og Google Ads sier om testlengde
- Metas beste praksis for A/B-testing anbefaler tester på minst 7 dager, sier at tester kortere enn det kan gi uklare resultater, og setter et tak på A/B-tester på 30 dager. Den samme siden foreslår å kjøre lenger hvis kundene vanligvis bruker mer enn 7 dager på å konvertere.
- Meta foreslår vanligvis en estimert styrke på 80 % eller høyere, standardstyrken her. A/B-resultatene viser en konfidens-prosent, og den behandler 65 % eller høyere som et vinnende resultat for en A/B-test. Det tallet kommer fra Metas egen metode og er ikke det samme som konfidensnivået på denne siden, så de to vil ikke stemme overens.
- Meta fraråder også uformell testing ved å skru annonsesett av og på, fordi målgrupper kan overlappe, og anbefaler samme budsjett for begge versjonene.
- Google Ads anbefaler å la et eksperiment kjøre i 2 til 3 uker, viser et konfidensintervall på 80 % som standard med andre nivåer på forespørsel, og markerer signifikante resultater med en blå stjerne. Den statistiske metoden bruker jackknife-resampling over 20 grupper per arm, så intervallene vil heller ikke stemme eksakt med en z-test.
Hva denne kalkulatoren ikke gjør
- Den sammenligner to versjoner. Med tre eller flere er hver ekstra sammenligning en ny sjanse for en falsk vinner, og den enkle testen her justerer ikke for det.
- Den tester konverteringsrater, ikke inntekt per besøkende eller ordreverdi, som trenger en annen test.
- Den er ikke en sekvensiell test. Den antar at du leser resultatet én gang, ved utvalgsstørrelsen du planla.
- Den kan ikke avgjøre om splitten din var rettferdig. Hvis én versjon fikk en annen målgruppe, budsjett eller tid på dagen, retter ingen formel opp i det.
Hvis du heller ikke vil regne på tallene for hånd
Hermoso er markedsføring på autopilot. Spør det hva du skal skalere, pause og teste neste, så leser det alle annonseplattformene du har koblet til, legger kampanjer med for lite data i sin egen bøtte i stedet for å dømme dem, og gir hver foreslåtte test en hypotese, den ene tingen som skal endres, metrikken som avgjør den, et budsjett og en varighet. Det lager også merkevaretilpassede bilde- og videovarianter å teste, og bygger kampanjer på dine egne annonsekontoer, opprettet pauset. Det fungerer i nettappen, eller inne i Claude, ChatGPT og Cursor via MCP-serveren. Når en test har en vinner, forteller den gratis ROAS-kalkulatoren deg om den også er lønnsom.
Gratisverktøy: · ROAS-kalkulator · Lengdesjekker for annonsetekst
Ofte stilte spørsmål
Hvordan vet jeg om A/B-testen av annonsen min er statistisk signifikant?
Angi besøkende og konverteringer for begge versjoner. Kalkulatoren kjører en z-test for to andeler og gir en tosidig p-verdi. Ved 95 % konfidens betyr en p-verdi under 0,05 at gapet sannsynligvis ikke skyldes tilfeldigheter. For 200 av 10 000 mot 245 av 10 000 er p 0,031, så B vinner.
Hvor mange besøkende trenger en A/B-test?
Det avhenger av konverteringsraten din og det minste løftet du vil oppdage. Ved en konverteringsrate på 2 % tar det 21 109 besøkende per versjon å finne et løft på 20 % ved 95 % konfidens og 80 % styrke. Et løft på 10 % tar 80 682.
Hvorfor sier kalkulatoren at det ikke er nok data ennå?
Z-testen er en tilnærming for store utvalg. Kalkulatoren venter til hver versjon har minst 5 konverteringer og 5 ikke-konverteringer, ett av kriteriene oppgitt i NIST e-Handbook, før den gir en dom.
Kan jeg stoppe en test så snart den ser signifikant ut?
Ikke hvis du vil at konfidensnivået skal bety det det sier. Å sjekke gjentatte ganger og stoppe ved første signifikante avlesning gir tilfeldighetene flere muligheter til å krysse grensen, så den reelle falske positive raten ender høyere enn den du valgte. Sett utvalgsstørrelsen først og les resultatet én gang.
Hvor lenge bør en Meta A/B-test kjøre?
Meta anbefaler minst 7 dager, sier at kortere tester kan være usikre, og tillater opptil 30 dager. Google Ads anbefaler 2 til 3 uker for eksperimenter. Bruk utvalgsstørrelse-fanen med din daglige trafikk for å se hvor lenge din egen test trenger.
Blir noe av det jeg skriver sendt noe sted?
Nei. Beregningene kjører i nettleseren din. Det finnes ingen nettverksforespørsel som bærer det du skriver, og ingenting lagres.
Hermoso forteller deg hva du skal skalere, pause og teste videre på tvers av annonsekontoene dine. Start gratis, 250+ opptjenbare gratiskreditter, ingen kort.
Start gratis → Se priser