Două întrebări, un singur calculator
Fiecare test de reclamă pune două întrebări, în această ordine. Înainte de a începe: de câți vizitatori are nevoie ca să detecteze diferența care mă interesează? După ce se termină: diferența dintre A și B este reală sau ar putea fi întâmplătoare? Folosește cele două file de mai sus în această ordine. Calcularea dimensiunii eșantionului mai întâi este ceea ce dă sens răspunsului la a doua întrebare.
“Vizitatorii” pot fi vizitatori ai paginii de destinație, clicuri pe linkuri sau oricine altcineva care a avut o șansă corectă de a converti, atât timp cât ambele versiuni sunt numărate în același fel. “Conversiile” sunt persoanele care au făcut acțiunea pentru care testezi.
Cum funcționează testul de semnificație
Calculatorul rulează un test z pentru două proporții, testul pentru eșantioane mari folosit la compararea a două rate descris în NIST/SEMATECH e-Handbook of Statistical Methods:
- Rata combinată p = (conversii A + conversii B) ÷ (vizitatori A + vizitatori B).
- z = (rata B − rata A) ÷ √(p × (1 − p) × (1/vizitatori A + 1/vizitatori B)).
- Valoarea p bilaterală = 2 × (1 − Φ(|z|)), unde Φ este distribuția normală standard.
- Intervalul pentru diferență este (rata B − rata A) ± z × √(rata A × (1 − rata A) ÷ vizitatori A + rata B × (1 − rata B) ÷ vizitatori B). Intervalul de creștere împarte asta la rata A, care tratează rata A ca fiind cunoscută, deci este o aproximare.
Exemplu rezolvat. Versiunea A obține 200 de conversii din 10.000 de vizitatori (2,00%). Versiunea B obține 245 din 10.000 (2,45%), o creștere relativă de 22,5%. Rata combinată este 445 ÷ 20.000 = 2,225%, eroarea standard este 0,209 puncte procentuale, iar z = 0,45 ÷ 0,209 = 2,157. Valoarea p bilaterală este 0,031, sub 0,05, deci la o încredere de 95% câștigă B. Intervalul de 95% pentru diferență merge de la +0,04 la +0,86 puncte procentuale: B este mai bun, dar creșterea reală ar putea fi oriunde între aproximativ 2% și 43%.
Testul este o aproximare care are nevoie de suficiente date. Manualul NIST oferă un criteriu: cel puțin 5 succese și 5 eșecuri. Calculatorul își reține verdictul și spune încă nu sunt date suficiente până când fiecare versiune are 5 conversii și 5 neconversii. Cu mai puțin de atât, NIST indică un test exact pentru eșantioane mici, dar pentru un test de reclamă răspunsul practic este să îl lași să ruleze în continuare.
Cum se calculează dimensiunea eșantionului
Pentru un test bilateral, vizitatori per versiune:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Aici p1 este rata ta curentă, p2 este acea rată cu creșterea aplicată, iar p̄ este media lor. Este aproximarea normală, fără corecție de continuitate, și are aceeași formă ca formula pentru mărimea eșantionului cu o singură proporție din manualul NIST, cu un al doilea grup adăugat. La 95% încredere z1−α/2 este 1,959964, iar la 80% putere z1−β este 0,841621.
Exemplu rezolvat. O rată de conversie de 2% și vrei să prinzi o creștere de 20%, adică 2,0% față de 2,4%. Rata medie este 2,2%. Linia de sus este 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, la pătrat este 0,3377, iar împărțind la 0,004² rezultă 21.109 vizitatori per versiune, 42.218 în total. La 3.000 de vizitatori pe zi, asta înseamnă 15 zile.
Creșterea pe care o ceri contează cel mai mult. La aceeași rată de 2%, o creștere de 30% are nevoie de 9.798 per versiune, iar o creștere de 10% are nevoie de 80.682. Înjumătățirea creșterii cam cvadruplează traficul, pentru că diferența stă la pătrat la numitorul formulei.
De ce oprirea prematură umflă rezultatele fals pozitive
Un nivel de încredere de 95% înseamnă că, atunci când A și B convertesc cu adevărat la fel, un singur test cu o mărime fixă a eșantionului tot declară un câștigător în aproximativ 5% din cazuri. Acel 5% este adevărat doar dacă te uiți o singură dată, la final.
Verificarea rezultatului în fiecare zi și oprirea prima dată când arată semnificativ este o procedură diferită. Ratele oscilează pe măsură ce vin datele, iar fiecare privire este o nouă șansă ca o diferență întâmplătoare să treacă linia. Oprește-te la prima traversare și ai ales momentul cel mai norocos, așa că rata reală de fals pozitive ajunge peste 5% și crește cu cât te uiți mai des. Valoarea p de pe ecran nu știe că ai tras cu ochiul, așa că tot pare ca și cum te-ai fi uitat o singură dată.
Soluția este plictisitoare și funcționează: decide mărimea eșantionului înainte să înceapă testul, lasă-l să ajungă la acea mărime și citește rezultatul o singură dată. A te uita la mijloc ca să verifici că nu s-a stricat nimic e în regulă. A te opri pentru că numărul arată bine nu este.
Ce spun Meta și Google Ads despre durata testelor
- Bunele practici de testare A/B ale Meta recomandă teste de cel puțin 7 zile, spun că testele mai scurte de atât pot produce rezultate neconcludente și limitează testele A/B la 30 de zile. Aceeași pagină sugerează rularea mai îndelungată dacă clienții au nevoie de obicei de mai mult de 7 zile ca să convertească.
- Meta sugerează de obicei o putere estimată de 80% sau mai mare, puterea implicită de aici. Rezultatele sale A/B arată un procent de încredere, iar un rezultat de 65% sau mai mare îl tratează drept câștigător pentru un test A/B. Acea cifră vine din metoda proprie a Meta și nu este același lucru cu nivelul de încredere de pe această pagină, așa că cele două nu se vor potrivi.
- Meta dezaprobă și testarea informală prin pornirea și oprirea seturilor de reclame, pentru că audiențele se pot suprapune, și recomandă același buget pentru ambele versiuni.
- Google Ads recomandă să lași un experiment să ruleze 2 până la 3 săptămâni, afișează implicit un interval de încredere de 80% cu alte niveluri la cerere și marchează rezultatele semnificative cu un asterisc albastru. Metoda sa statistică folosește reeșantionarea jackknife pe 20 de grupe per ramură, așa că nici intervalele sale nu se vor potrivi exact cu un test z.
Ce nu face acest calculator
- Compară două versiuni. Cu trei sau mai multe, fiecare comparație suplimentară este o nouă șansă de câștigător fals, iar testul simplu de aici nu ajustează pentru asta.
- Testează ratele de conversie, nu venitul per vizitator sau valoarea comenzii, care au nevoie de un alt test.
- Nu este un test secvențial. Presupune că citești rezultatul o singură dată, la mărimea eșantionului pe care ai planificat-o.
- Nu poate spune dacă împărțirea ta a fost corectă. Dacă o versiune a primit o audiență, un buget sau o oră diferită, nicio formulă nu rezolvă asta.
Dacă ai prefera să nu calculezi totul manual
Hermoso este marketing pe pilot automat. Întreabă-l ce să scalezi, ce să pui pe pauză și ce să testezi în continuare și citește fiecare platformă de reclame pe care ai conectat-o, pune campaniile cu prea puține date în propria lor categorie în loc să le judece și oferă fiecărui test sugerat o ipoteză, singurul lucru de schimbat, metrica ce decide, un buget și o durată. De asemenea, creează variante de imagini și videoclipuri conforme cu brandul pentru testare și construiește campanii în propriile tale conturi de reclame, create pe pauză. Funcționează în aplicația web sau în Claude, ChatGPT și Cursor prin serverul său MCP. După ce un test are un câștigător, calculatorul ROAS gratuit îți spune dacă este și profitabil.
Instrumente gratuite: · Calculator ROAS · Verificator al lungimii textelor publicitare
Întrebări frecvente
Cum știu dacă testul meu A/B de reclame este semnificativ statistic?
Introdu vizitatorii și conversiile pentru ambele versiuni. Calculatorul rulează un test z pe două proporții și oferă o valoare p bilaterală. La 95% încredere, o valoare p sub 0.05 înseamnă că diferența este puțin probabil să fie întâmplătoare. Pentru 200 din 10.000 față de 245 din 10.000, p este 0.031, deci B câștigă.
Câți vizitatori are nevoie un test A/B?
Depinde de rata ta de conversie și de cea mai mică creștere pe care vrei să o detectezi. La o rată de conversie de 2%, găsirea unei creșteri de 20% la 95% încredere și 80% putere necesită 21.109 vizitatori per versiune. O creștere de 10% necesită 80.682.
De ce spune calculatorul că nu sunt încă suficiente date?
Testul z este o aproximare pentru eșantioane mari. Calculatorul așteaptă până când fiecare versiune are cel puțin 5 conversii și 5 neconversii, un criteriu dat în NIST e-Handbook, înainte de a da un verdict.
Pot opri un test imediat ce pare semnificativ?
Nu, dacă vrei ca nivelul de încredere să însemne ceea ce spune. Verificarea repetată și oprirea la prima citire semnificativă oferă întâmplării mai multe șanse să treacă linia, așa că rata reală de fals pozitiv ajunge mai mare decât cea pe care ai ales-o. Stabilește mai întâi dimensiunea eșantionului și citește rezultatul o singură dată.
Cât timp ar trebui să ruleze un test A/B Meta?
Meta recomandă cel puțin 7 zile, spune că testele mai scurte pot fi neconcludente și permite până la 30 de zile. Google Ads recomandă 2 până la 3 săptămâni pentru experimente. Folosește fila de dimensiune a eșantionului cu traficul tău zilnic ca să vezi cât timp are nevoie testul tău.
Se trimite undeva ceva din ce scriu?
Nu. Calculele rulează în browserul tău. Nu există nicio cerere de rețea care să transporte ceea ce tastezi și nimic nu este stocat.
Hermoso îți spune ce să scalezi, să pui pe pauză și să testezi în continuare în conturile tale de reclame. Începe gratuit, peste 250 de credite gratuite câștigabile, fără card.
Începe gratuit → Vezi prețurile