Due domande, un calcolatore
Ogni test pubblicitario pone due domande, in quest'ordine. Prima di iniziare: quanti visitatori servono per rilevare la differenza che mi interessa? Dopo la fine: la differenza tra A e B è reale, o potrebbe essere casuale? Usa le due schede qui sopra in quest'ordine. Calcolare prima la dimensione del campione è ciò che rende significativa la risposta alla seconda domanda.
I “visitatori” possono essere i visitatori della landing page, i clic sui link o chiunque altro abbia avuto un'equa possibilità di convertire, purché entrambe le versioni siano conteggiate allo stesso modo. Le “conversioni” sono le persone che hanno fatto ciò che stai testando.
Come funziona il test di significatività
Il calcolatore esegue un test z a due proporzioni, il test per grandi campioni per confrontare due tassi descritto nel NIST/SEMATECH e-Handbook of Statistical Methods:
- Tasso aggregato p = (conversioni A + conversioni B) ÷ (visitatori A + visitatori B).
- z = (tasso B − tasso A) ÷ √(p × (1 − p) × (1/visitatori A + 1/visitatori B)).
- Valore p bilaterale = 2 × (1 − Φ(|z|)), dove Φ è la distribuzione normale standard.
- L'intervallo per la differenza è (tasso B − tasso A) ± z × √(tasso A × (1 − tasso A) ÷ visitatori A + tasso B × (1 − tasso B) ÷ visitatori B). L'intervallo dell'incremento divide quel valore per il tasso A, trattando il tasso A come noto, quindi è un'approssimazione.
Esempio pratico. La versione A ottiene 200 conversioni da 10.000 visitatori (2,00%). La versione B ne ottiene 245 da 10.000 (2,45%), un incremento relativo del 22,5%. Il tasso aggregato è 445 ÷ 20.000 = 2,225%, l'errore standard è 0,209 punti percentuali e z = 0,45 ÷ 0,209 = 2,157. Il valore p bilaterale è 0,031, inferiore a 0,05, quindi con il 95% di confidenza vince B. L'intervallo al 95% per la differenza va da +0,04 a +0,86 punti percentuali: B è migliore, ma l'incremento reale potrebbe essere ovunque tra circa il 2% e il 43%.
Il test è un'approssimazione che richiede dati sufficienti. Il manuale NIST fornisce un criterio: almeno 5 successi e 5 insuccessi. Il calcolatore trattiene il suo verdetto e dice dati ancora insufficienti finché ogni versione non ha 5 conversioni e 5 non conversioni. Con meno di così, NIST rimanda a un test esatto per piccoli campioni, ma per un test pubblicitario la risposta pratica è continuare a eseguirlo.
Come si calcola la dimensione del campione
Per un test bilaterale, visitatori per versione:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Qui p1 è il tuo tasso attuale, p2 è lo stesso tasso con l'incremento applicato e p̄ è la loro media. È l'approssimazione normale, senza correzione di continuità, e ha la stessa forma della formula della dimensione campionaria per proporzione singola nel manuale NIST, con un secondo gruppo aggiunto. Al 95% di confidenza z1−α/2 è 1,959964 e all'80% di potenza z1−β è 0,841621.
Esempio pratico. Un tasso di conversione del 2% e vuoi cogliere un incremento del 20%, quindi 2,0% contro 2,4%. Il tasso medio è 2,2%. Il numeratore è 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, al quadrato è 0,3377, e dividendo per 0,004² si ottengono 21.109 visitatori per versione, 42.218 in tutto. Con 3.000 visitatori al giorno sono 15 giorni.
L'incremento che cerchi conta di più. Sullo stesso tasso del 2%, un incremento del 30% richiede 9.798 per versione e un incremento del 10% ne richiede 80.682. Dimezzare l'incremento quadruplica all'incirca il traffico, perché lo scarto sta al quadrato al denominatore della formula.
Perché fermarsi in anticipo gonfia i falsi positivi
Un livello di confidenza del 95% significa che, quando A e B convertono davvero allo stesso modo, un singolo test con una dimensione campionaria fissa dichiara comunque un vincitore circa il 5% delle volte. Quel 5% vale solo se guardi una volta sola, alla fine.
Controllare il risultato ogni giorno e fermarsi la prima volta che risulta significativo è una procedura diversa. I tassi oscillano man mano che arrivano i dati, e ogni sguardo è un'altra occasione perché uno scarto casuale superi la soglia. Fermandoti al primo superamento hai scelto il momento più fortunato, così il tasso reale di falsi positivi finisce sopra il 5%, e cresce quanto più spesso guardi. Il valore p sullo schermo non sa che hai sbirciato, quindi continua a mostrarsi come se avessi guardato una volta sola.
La soluzione è noiosa e funziona: decidi la dimensione campionaria prima che il test inizi, lascia che la raggiunga e leggi il risultato una volta sola. Controllare a metà per assicurarsi che nulla sia rotto va bene. Fermarsi perché il numero sembra buono no.
Cosa dicono Meta e Google Ads sulla durata dei test
- Le best practice per i test A/B di Meta consigliano test di almeno 7 giorni, avvertono che quelli più brevi possono produrre risultati inconcludenti e limitano i test A/B a 30 giorni. La stessa pagina suggerisce di prolungarli se di solito i clienti impiegano più di 7 giorni per convertire.
- Meta suggerisce in genere una potenza stimata dell'80% o superiore, la potenza predefinita qui. I suoi risultati A/B mostrano una percentuale di confidenza e considera il 65% o più un risultato vincente per un test A/B. Quel valore deriva dal metodo di Meta e non è la stessa cosa del livello di confidenza di questa pagina, quindi i due non coincidono.
- Meta inoltre sconsiglia i test informali fatti attivando e disattivando i gruppi di inserzioni, perché i pubblici possono sovrapporsi, e raccomanda lo stesso budget per entrambe le versioni.
- Google Ads consiglia di lasciar girare un esperimento per 2 o 3 settimane, mostra per impostazione predefinita un intervallo di confidenza dell'80% con altri livelli su richiesta e contrassegna i risultati significativi con un asterisco blu. Il suo metodo statistico usa il ricampionamento jackknife su 20 bucket per braccio, quindi nemmeno i suoi intervalli coincidono esattamente con un test z.
Cosa non fa questo calcolatore
- Confronta due versioni. Con tre o più, ogni confronto aggiuntivo è un'altra occasione per un falso vincitore, e il test semplice qui non lo corregge.
- Verifica i tassi di conversione, non il ricavo per visitatore o il valore dell'ordine, che richiedono un test diverso.
- Non è un test sequenziale. Presuppone che tu legga il risultato una volta sola, alla dimensione campionaria che avevi pianificato.
- Non può dirti se la tua suddivisione è stata equa. Se una versione ha avuto un pubblico, un budget o un orario diversi, nessuna formula lo risolve.
Se preferisci non fare i conti a mano
Hermoso è il marketing in pilota automatico. Chiedigli cosa scalare, mettere in pausa e testare dopo e legge ogni piattaforma pubblicitaria che hai collegato, mette le campagne con pochi dati in un gruppo a parte invece di giudicarle, e assegna a ogni test suggerito un'ipotesi, l'unica cosa da cambiare, la metrica che lo decide, un budget e una durata. Crea anche varianti di immagini e video in linea con il brand da testare, e costruisce campagne sui tuoi account pubblicitari, create in pausa. Funziona nell'app web o dentro Claude, ChatGPT e Cursor tramite il suo server MCP. Una volta che un test ha un vincitore, il calcolatore ROAS gratuito ti dice se è anche redditizio.
Strumenti gratuiti: · Calcolatore ROAS · Contatore di lunghezza del testo pubblicitario
Domande frequenti
Come faccio a sapere se il mio A/B test su un annuncio è statisticamente significativo?
Inserisci visitatori e conversioni di entrambe le versioni. Il calcolatore esegue uno z-test a due proporzioni e fornisce un p-value a due code. Con una confidenza del 95%, un p-value inferiore a 0,05 significa che è improbabile che la differenza sia casuale. Per 200 su 10.000 contro 245 su 10.000, p è 0,031, quindi vince B.
Quanti visitatori servono a un A/B test?
Dipende dal tuo tasso di conversione e dal lift minimo che vuoi rilevare. Con un tasso di conversione del 2%, trovare un lift del 20% con confidenza del 95% e potenza dell’80% richiede 21.109 visitatori per versione. Un lift del 10% ne richiede 80.682.
Perché il calcolatore dice che i dati non bastano ancora?
Lo z-test è un’approssimazione per grandi campioni. Il calcolatore aspetta che ogni versione abbia almeno 5 conversioni e 5 non-conversioni, uno dei criteri indicati nel NIST e-Handbook, prima di dare un verdetto.
Posso fermare un test appena sembra significativo?
Non se vuoi che il livello di confidenza significhi quello che dice. Controllare ripetutamente e fermarsi alla prima lettura significativa dà al caso più occasioni di superare la soglia, quindi il vero tasso di falsi positivi finisce per essere più alto di quello che hai scelto. Fissa prima la dimensione del campione e leggi il risultato una sola volta.
Quanto dovrebbe durare un A/B test su Meta?
Meta consiglia almeno 7 giorni, dice che i test più brevi possono essere inconcludenti e consente fino a 30 giorni. Google Ads consiglia da 2 a 3 settimane per gli esperimenti. Usa la scheda della dimensione del campione con il tuo traffico giornaliero per vedere quanto deve durare il tuo test.
Qualcosa di ciò che digito viene inviato da qualche parte?
No. I calcoli vengono eseguiti nel tuo browser. Non c’è nessuna richiesta di rete che trasporta ciò che digiti e non viene memorizzato nulla.
Hermoso ti dice cosa scalare, mettere in pausa e testare in seguito sui tuoi account pubblicitari. Inizia gratis, oltre 250 crediti gratuiti ottenibili, nessuna carta.
Inizia gratis → Vedi i prezzi