Twee vragen, één calculator
Elke advertentietest stelt twee vragen, in deze volgorde. Vóór de start: hoeveel bezoekers heb ik nodig om het verschil te vinden dat ik belangrijk vind? Na afloop: is het verschil tussen A en B echt, of kan het toeval zijn? Gebruik de twee tabbladen hierboven in die volgorde. Eerst de steekproefgrootte berekenen is wat het antwoord op de tweede vraag betekenis geeft.
“Bezoekers” kunnen bezoekers van een landingspagina zijn, linkklikken of iedereen die een eerlijke kans kreeg om te converteren, zolang beide versies op dezelfde manier worden geteld. “Conversies” zijn de mensen die deden waarop je test.
Hoe de significantietest werkt
De calculator voert een z-test voor twee proporties uit, de large-sample-test voor het vergelijken van twee ratio's zoals beschreven in het NIST/SEMATECH e-Handbook of Statistical Methods:
- Gepoolde ratio p = (conversies A + conversies B) ÷ (bezoekers A + bezoekers B).
- z = (ratio B − ratio A) ÷ √(p × (1 − p) × (1/bezoekers A + 1/bezoekers B)).
- Tweezijdige p-waarde = 2 × (1 − Φ(|z|)), waarbij Φ de standaardnormale verdeling is.
- Het interval voor het verschil is (ratio B − ratio A) ± z × √(ratio A × (1 − ratio A) ÷ bezoekers A + ratio B × (1 − ratio B) ÷ bezoekers B). Het bereik van de stijging deelt dat door ratio A, wat ratio A als bekend behandelt, dus het is een benadering.
Uitgewerkt voorbeeld. Versie A krijgt 200 conversies uit 10.000 bezoekers (2,00%). Versie B krijgt er 245 uit 10.000 (2,45%), een relatieve stijging van 22,5%. De gepoolde ratio is 445 ÷ 20.000 = 2,225%, de standaardfout is 0,209 procentpunt, en z = 0,45 ÷ 0,209 = 2,157. De tweezijdige p-waarde is 0,031, lager dan 0,05, dus bij 95% betrouwbaarheid wint B. Het 95%-interval voor het verschil loopt van +0,04 tot +0,86 procentpunt: B is beter, maar de werkelijke stijging kan overal tussen ongeveer 2% en 43% liggen.
De test is een benadering die genoeg data nodig heeft. Het handboek van NIST geeft één criterium: minstens 5 successen en 5 mislukkingen. De calculator houdt zijn oordeel terug en zegt nog niet genoeg data totdat elke versie 5 conversies en 5 niet-conversies heeft. Met minder dan dat verwijst NIST naar een exacte test voor kleine steekproeven, maar voor een advertentietest is het praktische antwoord om hem te laten doorlopen.
Hoe de steekproefgrootte wordt berekend
Voor een tweezijdige test, bezoekers per versie:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Hier is p1 je huidige percentage, p2 dat percentage met de toename toegepast, en p̄ hun gemiddelde. Het is de normale benadering, zonder continuïteitscorrectie, en het heeft dezelfde vorm als de formule voor de steekproefomvang bij één proportie in het NIST-handboek, met een tweede groep erbij. Bij 95% betrouwbaarheid is z1−α/2 1,959964, en bij 80% power is z1−β 0,841621.
Uitgewerkt voorbeeld. Een conversiepercentage van 2%, en je wilt een toename van 20% opmerken, dus 2,0% tegen 2,4%. Het gemiddelde percentage is 2,2%. De bovenste regel is 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, gekwadrateerd is 0,3377, en gedeeld door 0,004² geeft dat 21.109 bezoekers per versie, 42.218 in totaal. Bij 3.000 bezoekers per dag is dat 15 dagen.
De toename die je wilt opmerken telt het zwaarst. Bij hetzelfde percentage van 2% vereist een toename van 30% 9.798 per versie en een toename van 10% 80.682. Als je de toename halveert wordt het verkeer ruwweg verviervoudigd, omdat het verschil gekwadrateerd onderaan de formule staat.
Waarom vroeg stoppen fout-positieven opblaast
Een betrouwbaarheidsniveau van 95% betekent dat wanneer A en B echt gelijk converteren, een enkele test met een vaste steekproefomvang toch in ongeveer 5% van de gevallen een winnaar aanwijst. Die 5% klopt alleen als je één keer kijkt, aan het einde.
Elke dag het resultaat controleren en de eerste keer dat het significant toont stoppen is een andere procedure. De percentages schommelen naarmate data binnenkomt, en elke blik is weer een kans dat een toevallig verschil de grens overschrijdt. Stop bij de eerste overschrijding en je hebt het gelukkigste moment uitgekozen, dus het echte fout-positieve percentage komt boven de 5% uit, en het groeit naarmate je vaker kijkt. De p-waarde op het scherm weet niet dat je gluurde, dus hij ziet er nog steeds uit alsof je één keer hebt gekeken.
De oplossing is saai en ze werkt: bepaal de steekproefomvang voordat de test start, laat hem die omvang bereiken, en lees het resultaat één keer af. Tussendoor kijken om te controleren of er niets kapot is, is prima. Stoppen omdat het getal er goed uitziet, is dat niet.
Wat Meta en Google Ads zeggen over de testduur
- De best practices voor A/B-testen van Meta raden tests van minstens 7 dagen aan, zeggen dat kortere tests onbesliste resultaten kunnen opleveren, en beperken A/B-tests tot 30 dagen. Dezelfde pagina stelt voor om langer te draaien als klanten er meestal meer dan 7 dagen over doen om te converteren.
- Meta stelt doorgaans een geschatte power van 80% of hoger voor, de standaardpower hier. De A/B-resultaten tonen een percentage betrouwbaarheid, en Meta beschouwt 65% of hoger als een winnend resultaat voor een A/B-test. Dat cijfer komt uit de eigen methode van Meta en is niet hetzelfde als het betrouwbaarheidsniveau op deze pagina, dus de twee zullen niet overeenkomen.
- Meta raadt ook af om informeel te testen door advertentiesets aan en uit te zetten, omdat doelgroepen elkaar kunnen overlappen, en adviseert hetzelfde budget voor beide versies.
- Google Ads raadt aan een experiment 2 tot 3 weken te laten draaien, toont standaard een betrouwbaarheidsinterval van 80% met andere niveaus op aanvraag, en markeert significante resultaten met een blauw sterretje. De statistische methode gebruikt jackknife-resampling over 20 buckets per arm, dus de intervallen zullen ook niet precies overeenkomen met een z-toets.
Wat deze rekenhulp niet doet
- Hij vergelijkt twee versies. Met drie of meer is elke extra vergelijking weer een kans op een valse winnaar, en de simpele test hier corrigeert daar niet voor.
- Hij test conversiepercentages, niet omzet per bezoeker of orderwaarde, die een andere test vereisen.
- Het is geen sequentiële test. Hij gaat ervan uit dat je het resultaat één keer afleest, bij de steekproefomvang die je gepland had.
- Hij kan niet zeggen of je verdeling eerlijk was. Als één versie een andere doelgroep, budget of tijdstip kreeg, lost geen enkele formule dat op.
Als je de cijfers liever niet met de hand uitrekent
Hermoso is marketing op de automatische piloot. Vraag het wat je moet opschalen, pauzeren en als volgende testen en het leest elk advertentieplatform dat je hebt gekoppeld, zet campagnes met te weinig data in hun eigen bucket in plaats van ze te beoordelen, en geeft elke voorgestelde test een hypothese, het ene ding dat je moet wijzigen, de metric die de doorslag geeft, een budget en een duur. Het maakt ook merkconforme beeld- en videovarianten om te testen, en bouwt campagnes op je eigen advertentieaccounts, gepauzeerd aangemaakt. Het werkt in de webapp, of binnen Claude, ChatGPT en Cursor via de MCP-server. Zodra een test een winnaar heeft, vertelt de gratis ROAS-rekenhulp je of hij ook winstgevend is.
Gratis tools: · ROAS-calculator · Checker voor advertentietekstlengte
Veelgestelde vragen
Hoe weet ik of mijn A/B-test voor advertenties statistisch significant is?
Voer bezoekers en conversies in voor beide versies. De calculator voert een z-toets voor twee proporties uit en geeft een tweezijdige p-waarde. Bij 95% betrouwbaarheid betekent een p-waarde onder 0,05 dat het verschil waarschijnlijk geen toeval is. Voor 200 van 10.000 tegen 245 van 10.000 is p 0,031, dus B wint.
Hoeveel bezoekers heeft een A/B-test nodig?
Dat hangt af van je conversiepercentage en de kleinste lift die je wilt detecteren. Bij een conversiepercentage van 2% kost het vinden van een lift van 20% bij 95% betrouwbaarheid en 80% power 21.109 bezoekers per versie. Een lift van 10% kost 80.682.
Waarom zegt de calculator dat er nog niet genoeg data is?
De z-toets is een benadering voor grote steekproeven. De calculator wacht tot elke versie minstens 5 conversies en 5 niet-conversies heeft, een criterium uit het NIST e-Handbook, voordat hij een oordeel geeft.
Kan ik een test stoppen zodra hij significant lijkt?
Niet als je wilt dat het betrouwbaarheidsniveau betekent wat het zegt. Herhaald controleren en stoppen bij de eerste significante meting geeft het toeval meer kansen om de grens te overschrijden, waardoor het echte percentage valse positieven hoger uitkomt dan het percentage dat je koos. Stel eerst de steekproefomvang in en lees het resultaat één keer af.
Hoe lang moet een A/B-test op Meta draaien?
Meta raadt minstens 7 dagen aan, zegt dat kortere tests niet-doorslaggevend kunnen zijn, en staat maximaal 30 dagen toe. Google Ads raadt 2 tot 3 weken aan voor experimenten. Gebruik het tabblad steekproefomvang met je dagelijkse verkeer om te zien hoe lang je eigen test nodig heeft.
Wordt iets dat ik typ ergens naartoe gestuurd?
Nee. De berekeningen draaien in je browser. Er is geen netwerkverzoek dat meedraagt wat je typt en er wordt niets opgeslagen.
Hermoso vertelt je wat je over je advertentieaccounts heen moet opschalen, pauzeren en als volgende testen. Begin gratis, 250+ te verdienen gratis credits, geen kaart.
Gratis starten → Bekijk prijzen