Kalkulator testów A/B dla reklam: istotność i wielkość próby

Wpisz liczbę odwiedzających i konwersji dla dwóch wersji, aby zobaczyć, czy różnica jest realna, albo wpisz swój współczynnik konwersji i interesujący Cię przyrost, aby zobaczyć, ilu odwiedzających potrzebuje test. Oba wzory są rozpisane, z rozwiązanymi przykładami.

Darmowe narzędzie Oblicza w Twojej przeglądarce. Nic nie jest wysyłane, zapisywane ani logowane: po drugiej stronie tej strony nie ma żadnego serwera.

Dwa pytania, jeden kalkulator

Każdy test reklamy zadaje dwa pytania, w tej kolejności. Przed startem: ilu odwiedzających potrzeba, aby wykryć różnicę, na której mi zależy? Po zakończeniu: czy różnica między A a B jest prawdziwa, czy może być przypadkowa? Korzystaj z dwóch zakładek powyżej w tej kolejności. To właśnie wyznaczenie wielkości próby na początku sprawia, że odpowiedź na drugie pytanie ma znaczenie.

“Odwiedzający” to mogą być odwiedzający stronę docelową, kliknięcia w link lub ktokolwiek inny, kto dostał uczciwą szansę na konwersję, o ile obie wersje liczone są w ten sam sposób. “Konwersje” to osoby, które wykonały to, co testujesz.

Jak działa test istotności

Kalkulator wykonuje test z dla dwóch proporcji, czyli test dla dużych prób służący do porównywania dwóch współczynników, opisany w NIST/SEMATECH e-Handbook of Statistical Methods:

  • Połączony współczynnik p = (konwersje A + konwersje B) ÷ (odwiedzający A + odwiedzający B).
  • z = (współczynnik B − współczynnik A) ÷ √(p × (1 − p) × (1/odwiedzający A + 1/odwiedzający B)).
  • Dwustronna wartość p = 2 × (1 − Φ(|z|)), gdzie Φ to standardowy rozkład normalny.
  • Przedział dla różnicy to (współczynnik B − współczynnik A) ± z × √(współczynnik A × (1 − współczynnik A) ÷ odwiedzający A + współczynnik B × (1 − współczynnik B) ÷ odwiedzający B). Zakres wzrostu dzieli to przez współczynnik A, traktując współczynnik A jako znany, więc jest to przybliżenie.

Przykład liczbowy. Wersja A uzyskuje 200 konwersji z 10 000 odwiedzających (2,00%). Wersja B uzyskuje 245 z 10 000 (2,45%), czyli względny wzrost o 22,5%. Połączony współczynnik to 445 ÷ 20 000 = 2,225%, błąd standardowy to 0,209 punktu procentowego, a z = 0,45 ÷ 0,209 = 2,157. Dwustronna wartość p wynosi 0,031, poniżej 0,05, więc przy pewności 95% wygrywa B. Przedział 95% dla różnicy biegnie od +0,04 do +0,86 punktu procentowego: B jest lepsze, ale prawdziwy wzrost może wynosić od około 2% do 43%.

Test jest przybliżeniem, które potrzebuje wystarczającej ilości danych. Podręcznik NIST podaje jedno kryterium: co najmniej 5 sukcesów i 5 porażek. Kalkulator wstrzymuje swój werdykt i pokazuje za mało danych, dopóki każda wersja nie ma 5 konwersji i 5 braków konwersji. Przy mniejszej liczbie NIST wskazuje na dokładny test dla małych prób, ale w przypadku testu reklamy praktyczną odpowiedzią jest kontynuowanie go.

Jak wyznaczana jest wielkość próby

Dla testu dwustronnego liczba odwiedzających na wersję:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Tutaj p1 to twój obecny współczynnik, p2 to ten współczynnik po uwzględnieniu wzrostu, a p̄ to ich średnia. To przybliżenie normalne, bez korekty ciągłości, i ma ten sam kształt co wzór na wielkość próby dla pojedynczej proporcji w podręczniku NIST, z dodaną drugą grupą. Przy 95% ufności z1−α/2 wynosi 1,959964, a przy 80% mocy z1−β wynosi 0,841621.

Przykład obliczeń. Współczynnik konwersji 2% i chcesz wychwycić wzrost o 20%, czyli 2,0% względem 2,4%. Średni współczynnik to 2,2%. Górny wiersz to 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, do kwadratu 0,3377, a po podzieleniu przez 0,004² otrzymujesz 21 109 odwiedzających na wersję, łącznie 42 218. Przy 3000 odwiedzających dziennie to 15 dni.

Najważniejszy jest wzrost, o który pytasz. Przy tym samym współczynniku 2% wzrost o 30% wymaga 9798 na wersję, a wzrost o 10% wymaga 80 682. Zmniejszenie wzrostu o połowę mniej więcej czterokrotnie zwiększa ruch, ponieważ różnica występuje w kwadracie na dole wzoru.

Dlaczego wczesne przerwanie zawyża fałszywie pozytywne wyniki

Poziom ufności 95% oznacza, że gdy A i B naprawdę konwertują tak samo, pojedynczy test o ustalonej wielkości próby i tak wskazuje zwycięzcę w około 5% przypadków. Te 5% jest prawdziwe tylko wtedy, gdy spojrzysz raz, na końcu.

Sprawdzanie wyniku codziennie i przerywanie przy pierwszym pojawieniu się istotności to inna procedura. Współczynniki wędrują w miarę napływania danych, a każde spojrzenie to kolejna szansa, że przypadkowa różnica przekroczy granicę. Zatrzymaj się przy pierwszym przekroczeniu, a wybierzesz najszczęśliwszy moment, więc realny współczynnik fałszywie pozytywny przekracza 5% i rośnie tym bardziej, im częściej patrzysz. Wartość p na ekranie nie wie, że podglądałeś, więc wygląda tak, jakbyś spojrzał raz.

Rozwiązanie jest nudne i działa: ustal wielkość próby przed rozpoczęciem testu, pozwól jej osiągnąć tę wielkość i odczytaj wynik raz. Zaglądanie w trakcie, by sprawdzić, czy nic się nie zepsuło, jest w porządku. Przerywanie, bo liczba wygląda dobrze, już nie.

Co Meta i Google Ads mówią o długości testu

  • Najlepsze praktyki testów A/B w Meta zalecają testy trwające co najmniej 7 dni, ostrzegają, że krótsze testy mogą dać niejednoznaczne wyniki, i ograniczają testy A/B do 30 dni. Ta sama strona sugeruje dłuższe testy, jeśli klienci zwykle potrzebują więcej niż 7 dni na konwersję.
  • Meta zazwyczaj sugeruje szacowaną moc 80% lub wyższą, co jest tutaj domyślną mocą. Wyniki testów A/B pokazuje jako procent ufności i traktuje 65% lub wyżej jako zwycięski wynik testu A/B. Ta liczba pochodzi z własnej metody Meta i nie jest tym samym co poziom ufności na tej stronie, więc obie się nie zgodzą.
  • Meta odradza też nieformalne testowanie poprzez włączanie i wyłączanie zestawów reklam, ponieważ grupy odbiorców mogą się pokrywać, i zaleca ten sam budżet dla obu wersji.
  • Google Ads zaleca prowadzenie eksperymentu przez 2 do 3 tygodni, domyślnie pokazuje przedział ufności 80% z innymi poziomami na życzenie i oznacza istotne wyniki niebieską gwiazdką. Jego metoda statystyczna używa resamplingu typu jackknife na 20 kubełkach na grupę, więc jego przedziały też nie będą dokładnie pasować do testu z.

Czego ten kalkulator nie robi

  • Porównuje dwie wersje. Przy trzech lub więcej każde dodatkowe porównanie to kolejna szansa na fałszywego zwycięzcę, a prosty test tutaj tego nie koryguje.
  • Testuje współczynniki konwersji, a nie przychód na odwiedzającego czy wartość zamówienia, które wymagają innego testu.
  • To nie jest test sekwencyjny. Zakłada, że odczytujesz wynik raz, przy zaplanowanej wielkości próby.
  • Nie powie ci, czy twój podział był uczciwy. Jeśli jedna wersja trafiła do innej grupy odbiorców, dostała inny budżet lub pokazywała się o innej porze dnia, żaden wzór tego nie naprawi.

Jeśli wolisz nie liczyć ręcznie

Hermoso to marketing na autopilocie. Zapytaj go, co skalować, wstrzymać i testować dalej, a odczyta każdą podłączoną platformę reklamową, umieści kampanie ze zbyt małą ilością danych w osobnym koszyku zamiast je oceniać i da każdemu proponowanemu testowi hipotezę, jedną rzecz do zmiany, metrykę, która go rozstrzyga, budżet i czas trwania. Tworzy też zgodne z marką warianty obrazów i filmów do testowania oraz buduje kampanie na twoich kontach reklamowych, utworzone jako wstrzymane. Działa w aplikacji webowej lub wewnątrz Claude, ChatGPT i Cursor przez swój serwer MCP. Gdy test wyłoni zwycięzcę, darmowy kalkulator ROAS powie ci, czy jest też rentowny.

Darmowe narzędzia: · Kalkulator ROAS · Licznik długości tekstu reklamy

Najczęściej zadawane pytania

Jak się dowiem, czy mój test A/B reklamy jest istotny statystycznie?

Wpisz liczbę odwiedzających i konwersji dla obu wersji. Kalkulator przeprowadza test z dla dwóch proporcji i podaje dwustronną wartość p. Przy 95% ufności wartość p poniżej 0,05 oznacza, że różnica raczej nie jest przypadkiem. Dla 200 z 10 000 wobec 245 z 10 000 p wynosi 0,031, więc wygrywa B.

Ilu odwiedzających potrzebuje test A/B?

To zależy od Twojego współczynnika konwersji i najmniejszego przyrostu, który chcesz wykryć. Przy współczynniku konwersji 2% wykrycie przyrostu 20% przy 95% ufności i 80% mocy wymaga 21 109 odwiedzających na wersję. Przyrost 10% wymaga 80 682.

Dlaczego kalkulator mówi, że jeszcze za mało danych?

Test z to przybliżenie dla dużych prób. Kalkulator czeka, aż każda wersja będzie mieć co najmniej 5 konwersji i 5 braków konwersji, co jest jednym z kryteriów podanych w NIST e-Handbook, zanim wyda werdykt.

Czy mogę przerwać test, gdy tylko wygląda na istotny?

Nie, jeśli chcesz, by poziom ufności oznaczał to, co mówi. Wielokrotne sprawdzanie i zatrzymanie się przy pierwszym istotnym odczycie daje przypadkowi więcej okazji, by przekroczyć próg, więc rzeczywisty odsetek fałszywie dodatnich wyników kończy się wyżej niż ten, który wybrałeś. Najpierw ustal wielkość próby i odczytaj wynik raz.

Jak długo powinien trwać test A/B na Meta?

Meta zaleca co najmniej 7 dni, mówi, że krótsze testy mogą być niemiarodajne, i dopuszcza do 30 dni. Google Ads zaleca od 2 do 3 tygodni na eksperymenty. Użyj zakładki wielkości próby wraz z Twoim dziennym ruchem, aby zobaczyć, ile czasu potrzebuje Twój test.

Czy cokolwiek, co wpiszę, jest gdzieś wysyłane?

Nie. Obliczenia odbywają się w Twojej przeglądarce. Żadne zapytanie sieciowe nie przenosi tego, co wpisujesz, i nic nie jest przechowywane.

Hermoso mówi Ci, co skalować, wstrzymać i testować dalej na Twoich kontach reklamowych. Zacznij za darmo, ponad 250 darmowych kredytów do zdobycia, bez karty.

Zacznij za darmo →   Zobacz cennik