A/B-testkalkylator för annonser: signifikans och urvalsstorlek

Ange besökare och konverteringar för två versioner för att se om skillnaden är verklig, eller ange din konverteringsgrad och förbättringen du bryr dig om för att se hur många besökare testet behöver. Båda formlerna skrivs ut, med genomräknade exempel.

Gratisverktyg Räknas ut i din webbläsare. Inget skickas, lagras eller loggas: det finns ingen server i andra änden av den här sidan.

Två frågor, en kalkylator

Varje annonstest ställer två frågor, i den här ordningen. Innan det startar: hur många besökare behövs för att hitta den skillnad jag bryr mig om? Efter att det avslutats: är skillnaden mellan A och B verklig, eller kan den bero på slumpen? Använd de två flikarna ovan i den ordningen. Att räkna ut urvalsstorleken först är det som gör svaret på den andra frågan meningsfullt.

“Besökare” kan vara besökare på landningssidan, länkklick eller alla andra som fick en rättvis chans att konvertera, så länge båda versionerna räknas på samma sätt. “Konverteringar” är de som gjorde det du testar för.

Så fungerar signifikanstestet

Kalkylatorn kör ett z-test för två proportioner, det storurvalstest för att jämföra två grader som beskrivs i NIST/SEMATECH e-Handbook of Statistical Methods:

  • Poolad grad p = (konverteringar A + konverteringar B) ÷ (besökare A + besökare B).
  • z = (grad B − grad A) ÷ √(p × (1 − p) × (1/besökare A + 1/besökare B)).
  • Tvåsidigt p-värde = 2 × (1 − Φ(|z|)), där Φ är standardnormalfördelningen.
  • Intervallet för skillnaden är (grad B − grad A) ± z × √(grad A × (1 − grad A) ÷ besökare A + grad B × (1 − grad B) ÷ besökare B). Ökningsintervallet delar det med grad A, vilket behandlar grad A som känd, så det är en approximation.

Genomräknat exempel. Version A får 200 konverteringar av 10 000 besökare (2,00 %). Version B får 245 av 10 000 (2,45 %), en relativ ökning på 22,5 %. Den poolade graden är 445 ÷ 20 000 = 2,225 %, standardfelet är 0,209 procentenheter och z = 0,45 ÷ 0,209 = 2,157. Det tvåsidiga p-värdet är 0,031, under 0,05, så vid 95 % konfidens vinner B. 95 %-intervallet för skillnaden sträcker sig från +0,04 till +0,86 procentenheter: B är bättre, men den sanna ökningen kan ligga någonstans mellan omkring 2 % och 43 %.

Testet är en approximation som behöver tillräckligt med data. NIST:s handbok ger ett kriterium: minst 5 lyckade och 5 misslyckade. Kalkylatorn håller tillbaka sin slutsats och säger inte tillräckligt med data än tills varje version har 5 konverteringar och 5 icke-konverteringar. Med färre än så hänvisar NIST till ett exakt test för små urval, men för ett annonstest är det praktiska svaret att låta det fortsätta.

Så räknas urvalsstorleken ut

För ett tvåsidigt test, besökare per version:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Här är p1 din nuvarande andel, p2 är samma andel med lyftet tillämpat, och p̄ är deras genomsnitt. Det är den normala approximationen, utan kontinuitetskorrigering, och den har samma form som formeln för stickprovsstorlek för en andel i NIST-handboken, med en andra grupp tillagd. Vid 95 % konfidens är z1−α/2 1,959964, och vid 80 % styrka är z1−β 0,841621.

Genomräknat exempel. En konverteringsgrad på 2 % och du vill fånga ett lyft på 20 %, alltså 2,0 % mot 2,4 %. Genomsnittsgraden är 2,2 %. Översta raden är 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, i kvadrat är det 0,3377, och delat med 0,004² ger det 21 109 besökare per version, 42 218 totalt. Vid 3 000 besökare om dagen är det 15 dagar.

Lyftet du efterfrågar spelar störst roll. På samma grad på 2 % kräver ett lyft på 30 % 9 798 per version och ett lyft på 10 % kräver 80 682. Att halvera lyftet fyrdubblar ungefär trafiken, eftersom gapet står i kvadrat längst ner i formeln.

Varför för tidigt avbrott blåser upp falska positiva

En konfidensnivå på 95 % betyder att när A och B verkligen konverterar lika, utropar ett enda test vid en fast stickprovsstorlek ändå en vinnare omkring 5 % av gångerna. De 5 % gäller bara om du tittar en gång, i slutet.

Att kontrollera resultatet varje dag och avbryta första gången det visar signifikant är en annan procedur. Andelarna vandrar när data kommer in, och varje titt är ännu en chans för ett slumpmässigt gap att korsa gränsen. Avbryt vid första korsningen och du har valt det lyckligaste ögonblicket, så den verkliga andelen falska positiva hamnar över 5 % och växer ju oftare du tittar. P-värdet på skärmen vet inte att du tjuvkikade, så det visar ändå som om du hade tittat en gång.

Lösningen är trist och den fungerar: bestäm stickprovsstorleken innan testet startar, låt det nå den storleken och läs resultatet en gång. Att titta mitt i för att se att inget är trasigt är okej. Att avbryta för att siffran ser bra ut är det inte.

Vad Meta och Google Ads säger om testlängd

  • Metas bästa praxis för A/B-testning rekommenderar test på minst 7 dagar, säger att test kortare än så kan ge ovissa resultat och sätter ett tak på 30 dagar för A/B-test. Samma sida föreslår att köra längre om kunder vanligtvis tar mer än 7 dagar att konvertera.
  • Meta föreslår vanligtvis en uppskattad styrka på 80 % eller högre, standardstyrkan här. Dess A/B-resultat visar en konfidensprocent, och det behandlar 65 % eller högre som ett vinnande resultat för ett A/B-test. Den siffran kommer från Metas egen metod och är inte samma sak som konfidensnivån på den här sidan, så de två kommer inte att stämma överens.
  • Meta avråder också från informell testning genom att slå av och på annonsuppsättningar, eftersom målgrupper kan överlappa, och rekommenderar samma budget för båda versionerna.
  • Google Ads rekommenderar att låta ett experiment köra i 2 till 3 veckor, visar ett konfidensintervall på 80 % som standard med andra nivåer på begäran och markerar signifikanta resultat med en blå asterisk. Dess statistiska metod använder jackknife-omsampling över 20 hinkar per gren, så dess intervall kommer inte att matcha ett z-test exakt heller.

Vad den här kalkylatorn inte gör

  • Den jämför två versioner. Med tre eller fler är varje extra jämförelse ännu en chans till en falsk vinnare, och det enkla testet här justerar inte för det.
  • Den testar konverteringsgrader, inte intäkt per besökare eller ordervärde, vilket kräver ett annat test.
  • Det är inte ett sekventiellt test. Det antar att du läser resultatet en gång, vid den stickprovsstorlek du planerade.
  • Den kan inte avgöra om din uppdelning var rättvis. Om en version fick en annan målgrupp, budget eller tid på dagen fixar ingen formel det.

Om du hellre slipper räkna för hand

Hermoso är marknadsföring på autopilot. Fråga det vad du ska skala upp, pausa och testa härnäst så läser det varje annonsplattform du har anslutit, lägger kampanjer med för lite data i en egen hink i stället för att döma dem, och ger varje föreslaget test en hypotes, den enda sak som ska ändras, mätvärdet som avgör det, en budget och en längd. Det skapar också varumärkesanpassade bild- och videovarianter att testa, och bygger kampanjer på dina egna annonskonton, skapade pausade. Det fungerar i webbappen, eller inuti Claude, ChatGPT och Cursor via dess MCP-server. När ett test har en vinnare talar den kostnadsfria ROAS-kalkylatorn om huruvida det också är lönsamt.

Gratisverktyg: · ROAS-kalkylator · Längdkontroll för annonstext

Vanliga frågor

Hur vet jag om mitt A/B-test för annonser är statistiskt signifikant?

Ange besökare och konverteringar för båda versionerna. Kalkylatorn kör ett z-test för två proportioner och ger ett tvåsidigt p-värde. Vid 95 % konfidens betyder ett p-värde under 0,05 att skillnaden sannolikt inte beror på slumpen. För 200 av 10 000 mot 245 av 10 000 är p 0,031, så B vinner.

Hur många besökare behöver ett A/B-test?

Det beror på din konverteringsgrad och den minsta förbättring du vill upptäcka. Vid en konverteringsgrad på 2 % tar det 21 109 besökare per version att hitta en förbättring på 20 % med 95 % konfidens och 80 % styrka. En förbättring på 10 % tar 80 682.

Varför säger kalkylatorn att det inte finns tillräckligt med data ännu?

Z-testet är en approximation för stora urval. Kalkylatorn väntar tills varje version har minst 5 konverteringar och 5 icke-konverteringar, ett kriterium som anges i NIST e-Handbook, innan den ger ett utslag.

Kan jag stoppa ett test så snart det ser signifikant ut?

Inte om du vill att konfidensnivån ska betyda vad den säger. Att kontrollera upprepade gånger och stoppa vid första signifikanta avläsningen ger slumpen fler chanser att korsa gränsen, så den verkliga andelen falska positiva blir högre än den du valde. Bestäm urvalsstorleken först och läs av resultatet en gång.

Hur länge bör ett A/B-test på Meta köras?

Meta rekommenderar minst 7 dagar, säger att kortare test kan bli ofullständiga, och tillåter upp till 30 dagar. Google Ads rekommenderar 2 till 3 veckor för experiment. Använd fliken för urvalsstorlek med din dagliga trafik för att se hur länge ditt eget test behöver.

Skickas något av det jag skriver någonstans?

Nej. Beräkningarna körs i din webbläsare. Det finns ingen nätverksbegäran som bär det du skriver och inget lagras.

Hermoso talar om för dig vad du ska skala upp, pausa och testa härnäst över dina annonskonton. Börja gratis, 250+ intjänbara gratiskrediter, inget kort.

Kom igång gratis →   Se priser