A/B-Test-Rechner für Anzeigen: Signifikanz und Stichprobengröße

Gib Besucher und Conversions für zwei Versionen ein, um zu sehen, ob der Unterschied echt ist, oder gib deine Conversion-Rate und den Uplift ein, der dich interessiert, um zu sehen, wie viele Besucher der Test braucht. Beide Formeln sind ausgeschrieben, mit durchgerechneten Beispielen.

Kostenloses Tool Berechnet alles in deinem Browser. Nichts wird gesendet, gespeichert oder protokolliert: Am anderen Ende dieser Seite gibt es keinen Server.

Zwei Fragen, ein Rechner

Jeder Anzeigentest stellt zwei Fragen, in dieser Reihenfolge. Vorher: Wie viele Besucher braucht er, um den Unterschied zu finden, der mir wichtig ist? Nachher: Ist der Abstand zwischen A und B echt oder könnte er Zufall sein? Nutze die beiden Tabs oben in dieser Reihenfolge. Erst die Stichprobengröße zu bestimmen, gibt der Antwort auf die zweite Frage überhaupt Bedeutung.

“Besucher” können Landingpage-Besucher, Link-Klicks oder alle anderen sein, die eine faire Chance zum Konvertieren hatten, solange beide Versionen auf dieselbe Weise gezählt werden. “Conversions” sind die Leute, die das getan haben, worauf du testest.

So funktioniert der Signifikanztest

Der Rechner führt einen Zwei-Stichproben-z-Test für Anteile durch, den Großstichprobentest zum Vergleich zweier Raten, beschrieben im NIST/SEMATECH e-Handbook of Statistical Methods:

  • Gepoolte Rate p = (Conversions A + Conversions B) ÷ (Besucher A + Besucher B).
  • z = (Rate B − Rate A) ÷ √(p × (1 − p) × (1/Besucher A + 1/Besucher B)).
  • Zweiseitiger p-Wert = 2 × (1 − Φ(|z|)), wobei Φ die Standardnormalverteilung ist.
  • Das Intervall für den Unterschied ist (Rate B − Rate A) ± z × √(Rate A × (1 − Rate A) ÷ Besucher A + Rate B × (1 − Rate B) ÷ Besucher B). Der Zuwachsbereich teilt das durch Rate A und behandelt Rate A als bekannt, es ist also eine Näherung.

Rechenbeispiel. Version A erzielt 200 Conversions aus 10.000 Besuchern (2,00 %). Version B erzielt 245 aus 10.000 (2,45 %), ein relativer Zuwachs von 22,5 %. Die gepoolte Rate ist 445 ÷ 20.000 = 2,225 %, der Standardfehler ist 0,209 Prozentpunkte und z = 0,45 ÷ 0,209 = 2,157. Der zweiseitige p-Wert ist 0,031, unter 0,05, also gewinnt B bei 95 % Konfidenz. Das 95-%-Intervall für den Unterschied reicht von +0,04 bis +0,86 Prozentpunkte: B ist besser, aber der wahre Zuwachs könnte irgendwo zwischen etwa 2 % und 43 % liegen.

Der Test ist eine Näherung, die genug Daten braucht. Das NIST-Handbuch nennt ein Kriterium: mindestens 5 Erfolge und 5 Misserfolge. Der Rechner hält sein Urteil zurück und sagt noch nicht genug Daten, bis jede Version 5 Conversions und 5 Nicht-Conversions hat. Bei weniger verweist NIST auf einen exakten Test für kleine Stichproben, aber bei einem Anzeigentest lautet die praktische Antwort, ihn weiterlaufen zu lassen.

So wird die Stichprobengröße berechnet

Für einen zweiseitigen Test, Besucher pro Version:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Dabei ist p1 deine aktuelle Rate, p2 diese Rate mit dem angewendeten Lift und p̄ ihr Durchschnitt. Es handelt sich um die Normalapproximation ohne Stetigkeitskorrektur und sie hat dieselbe Form wie die Formel für den Stichprobenumfang bei einem Anteil im NIST-Handbuch, ergänzt um eine zweite Gruppe. Bei 95% Konfidenz ist z1−α/2 gleich 1,959964, und bei 80% Power ist z1−β gleich 0,841621.

Rechenbeispiel. Eine Conversion-Rate von 2% und du willst einen Lift von 20% erkennen, also 2,0% gegen 2,4%. Die durchschnittliche Rate ist 2,2%. Die obere Zeile lautet 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, quadriert ergibt 0,3377, und geteilt durch 0,004² ergibt das 21.109 Besucher pro Version, insgesamt 42.218. Bei 3.000 Besuchern pro Tag sind das 15 Tage.

Der Lift, den du erkennen willst, zählt am meisten. Bei derselben Rate von 2% braucht ein Lift von 30% 9.798 pro Version und ein Lift von 10% 80.682. Den Lift zu halbieren vervierfacht etwa den Traffic, weil der Abstand quadriert unten in der Formel steht.

Warum zu frühes Stoppen falsch-positive Ergebnisse aufbläht

Ein Konfidenzniveau von 95% bedeutet: Wenn A und B wirklich gleich gut konvertieren, erklärt ein einzelner Test bei festem Stichprobenumfang trotzdem in etwa 5% der Fälle einen Sieger. Diese 5% gelten nur, wenn du einmal am Ende hinschaust.

Das Ergebnis täglich zu prüfen und beim ersten Mal zu stoppen, wenn es signifikant aussieht, ist ein anderes Verfahren. Die Raten schwanken, während Daten hereinkommen, und jeder Blick ist eine weitere Chance, dass ein Zufallsabstand die Linie überschreitet. Stoppst du beim ersten Überschreiten, hast du den günstigsten Moment erwischt, also liegt die echte Falsch-positiv-Rate am Ende über 5% und sie wächst, je öfter du hinschaust. Der p-Wert auf dem Bildschirm weiß nicht, dass du gespickt hast, also liest er sich, als hättest du nur einmal geschaut.

Die Lösung ist langweilig und sie funktioniert: Lege den Stichprobenumfang vor dem Teststart fest, lass ihn diese Größe erreichen und lies das Ergebnis einmal ab. Zwischendurch zu schauen, ob nichts kaputt ist, ist in Ordnung. Zu stoppen, weil die Zahl gut aussieht, nicht.

Was Meta und Google Ads zur Testdauer sagen

  • Metas Best Practices für A/B-Tests empfehlen Tests von mindestens 7 Tagen, sagen, dass kürzere Tests zu uneindeutigen Ergebnissen führen können, und begrenzen A/B-Tests auf 30 Tage. Dieselbe Seite rät zu einer längeren Laufzeit, wenn Kunden für eine Conversion üblicherweise mehr als 7 Tage brauchen.
  • Meta empfiehlt in der Regel eine geschätzte Power von 80% oder höher, der Standardwert hier. Seine A/B-Ergebnisse zeigen einen Konfidenz-Prozentsatz, und es wertet 65% oder höher als siegreiches Ergebnis eines A/B-Tests. Diese Zahl stammt aus Metas eigener Methode und ist nicht dasselbe wie das Konfidenzniveau auf dieser Seite, deshalb werden die beiden nicht übereinstimmen.
  • Meta rät außerdem von informellem Testen ab, bei dem man Anzeigengruppen ein- und ausschaltet, weil sich Zielgruppen überschneiden können, und empfiehlt für beide Versionen dasselbe Budget.
  • Google Ads empfiehlt, ein Experiment 2 bis 3 Wochen laufen zu lassen, zeigt standardmäßig ein 80%-Konfidenzintervall an, andere Niveaus auf Anfrage, und kennzeichnet signifikante Ergebnisse mit einem blauen Sternchen. Seine statistische Methode nutzt Jackknife-Resampling über 20 Buckets pro Arm, deshalb werden auch seine Intervalle nicht exakt zu einem z-Test passen.

Was dieser Rechner nicht leistet

  • Er vergleicht zwei Versionen. Bei drei oder mehr ist jeder zusätzliche Vergleich eine weitere Chance auf einen falschen Sieger, und der einfache Test hier korrigiert das nicht.
  • Er testet Conversion-Raten, nicht Umsatz pro Besucher oder Bestellwert, die einen anderen Test brauchen.
  • Er ist kein sequentieller Test. Er geht davon aus, dass du das Ergebnis einmal abliest, beim geplanten Stichprobenumfang.
  • Er kann nicht erkennen, ob dein Split fair war. Wenn eine Version eine andere Zielgruppe, ein anderes Budget oder eine andere Tageszeit hatte, behebt keine Formel das.

Wenn du die Zahlen lieber nicht von Hand durchrechnest

Hermoso ist Marketing auf Autopilot. Frag es, was du als Nächstes skalieren, pausieren und testen solltest, und es liest jede Anzeigenplattform, die du verbunden hast, steckt Kampagnen mit zu wenig Daten in einen eigenen Topf statt sie zu bewerten und gibt jedem vorgeschlagenen Test eine Hypothese, die eine Sache, die du änderst, die entscheidende Kennzahl, ein Budget und eine Dauer. Es erstellt außerdem markengerechte Bild- und Videovarianten zum Testen und baut Kampagnen in deinen eigenen Anzeigenkonten, pausiert angelegt. Es funktioniert in der Web-App oder innerhalb von Claude, ChatGPT und Cursor über seinen MCP-Server. Sobald ein Test einen Sieger hat, sagt dir der kostenlose ROAS-Rechner, ob er auch profitabel ist.

Kostenlose Tools: · ROAS-Rechner · Ad-Copy-Längen-Checker

Häufige Fragen

Woher weiß ich, ob mein A/B-Test der Anzeige statistisch signifikant ist?

Gib Besucher und Conversions für beide Versionen ein. Der Rechner führt einen Zwei-Stichproben-z-Test durch und liefert einen zweiseitigen p-Wert. Bei 95 % Konfidenz bedeutet ein p-Wert unter 0,05, dass der Unterschied kaum zufällig ist. Bei 200 von 10.000 gegen 245 von 10.000 ist p 0,031, also gewinnt B.

Wie viele Besucher braucht ein A/B-Test?

Das hängt von deiner Conversion-Rate und dem kleinsten Uplift ab, den du erkennen willst. Bei einer Conversion-Rate von 2 % braucht es 21.109 Besucher pro Version, um einen Uplift von 20 % bei 95 % Konfidenz und 80 % Power zu finden. Ein Uplift von 10 % braucht 80.682.

Warum sagt der Rechner, es gebe noch nicht genug Daten?

Der z-Test ist eine Näherung für große Stichproben. Der Rechner wartet, bis jede Version mindestens 5 Conversions und 5 Nicht-Conversions hat, ein Kriterium aus dem NIST e-Handbook, bevor er ein Urteil fällt.

Kann ich einen Test stoppen, sobald er signifikant aussieht?

Nicht, wenn das Konfidenzniveau noch das bedeuten soll, was es sagt. Wenn du wiederholt nachschaust und beim ersten signifikanten Wert stoppst, gibst du dem Zufall mehr Gelegenheiten, die Schwelle zu überschreiten, sodass die tatsächliche Falsch-Positiv-Rate höher ausfällt als die gewählte. Lege die Stichprobengröße zuerst fest und lies das Ergebnis nur einmal.

Wie lange sollte ein Meta A/B-Test laufen?

Meta empfiehlt mindestens 7 Tage, sagt, dass kürzere Tests nicht aussagekräftig sein können, und erlaubt bis zu 30 Tage. Google Ads empfiehlt 2 bis 3 Wochen für Experimente. Nutze den Tab zur Stichprobengröße mit deinem täglichen Traffic, um zu sehen, wie lange dein eigener Test braucht.

Wird irgendetwas, das ich eingebe, irgendwohin gesendet?

Nein. Die Berechnungen laufen in deinem Browser. Es gibt keine Netzwerkanfrage, die deine Eingaben überträgt, und nichts wird gespeichert.

Hermoso sagt dir über deine Werbekonten hinweg, was du skalieren, pausieren und als Nächstes testen solltest. Starte kostenlos, über 250 verdienbare Gratis-Credits, keine Karte.

Kostenlos starten →   Preise ansehen