Duas perguntas, uma calculadora
Todo teste de anúncio faz duas perguntas, nesta ordem. Antes de começar: quantos visitantes são necessários para encontrar a diferença que me importa? Depois de terminar: a diferença entre A e B é real ou pode ser acaso? Use as duas abas acima nessa ordem. Calcular o tamanho da amostra primeiro é o que faz a resposta à segunda pergunta ter sentido.
“Visitantes” podem ser visitantes da página de destino, cliques em links ou qualquer outra pessoa que teve uma chance justa de converter, desde que as duas versões sejam contadas da mesma forma. “Conversões” são as pessoas que fizeram aquilo que você está testando.
Como funciona o teste de significância
A calculadora executa um teste z de duas proporções, o teste para grandes amostras que compara duas taxas descrito no NIST/SEMATECH e-Handbook of Statistical Methods:
- Taxa combinada p = (conversões A + conversões B) ÷ (visitantes A + visitantes B).
- z = (taxa B − taxa A) ÷ √(p × (1 − p) × (1/visitantes A + 1/visitantes B)).
- Valor-p bilateral = 2 × (1 − Φ(|z|)), em que Φ é a distribuição normal padrão.
- O intervalo para a diferença é (taxa B − taxa A) ± z × √(taxa A × (1 − taxa A) ÷ visitantes A + taxa B × (1 − taxa B) ÷ visitantes B). A faixa de ganho divide isso pela taxa A, o que trata a taxa A como conhecida, então é uma aproximação.
Exemplo resolvido. A versão A obtém 200 conversões de 10.000 visitantes (2,00%). A versão B obtém 245 de 10.000 (2,45%), um ganho relativo de 22,5%. A taxa combinada é 445 ÷ 20.000 = 2,225%, o erro padrão é 0,209 ponto percentual, e z = 0,45 ÷ 0,209 = 2,157. O valor-p bilateral é 0,031, abaixo de 0,05, então com 95% de confiança B vence. O intervalo de 95% para a diferença vai de +0,04 a +0,86 ponto percentual: B é melhor, mas o ganho real poderia estar em qualquer lugar entre cerca de 2% e 43%.
O teste é uma aproximação que precisa de dados suficientes. O manual do NIST dá um critério: pelo menos 5 sucessos e 5 fracassos. A calculadora retém o seu veredito e diz ainda não há dados suficientes até que cada versão tenha 5 conversões e 5 não conversões. Com menos que isso, o NIST aponta um teste exato para amostras pequenas, mas para um teste de anúncio a resposta prática é mantê-lo em andamento.
Como o tamanho da amostra é calculado
Para um teste bilateral, visitantes por versão:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Aqui p1 é a sua taxa atual, p2 é essa taxa com o aumento aplicado, e p̄ é a média delas. É a aproximação normal, sem correção de continuidade, e tem a mesma forma que a fórmula de tamanho de amostra para uma proporção do manual do NIST, com um segundo grupo adicionado. Com 95% de confiança, z1−α/2 é 1,959964, e com 80% de poder, z1−β é 0,841621.
Exemplo resolvido. Uma taxa de conversão de 2%, e você quer detectar um aumento de 20%, portanto 2,0% contra 2,4%. A taxa média é 2,2%. A linha de cima é 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, ao quadrado dá 0,3377, e dividindo por 0,004² resulta em 21.109 visitantes por versão, 42.218 no total. A 3.000 visitantes por dia, isso são 15 dias.
O aumento que você pede é o que mais importa. Na mesma taxa de 2%, um aumento de 30% precisa de 9.798 por versão e um aumento de 10% precisa de 80.682. Reduzir o aumento à metade quadruplica aproximadamente o tráfego, porque a diferença entra ao quadrado no denominador da fórmula.
Por que parar cedo infla os falsos positivos
Um nível de confiança de 95% significa que, quando A e B convertem realmente igual, um único teste com tamanho de amostra fixo ainda aponta um vencedor cerca de 5% das vezes. Esses 5% só são verdadeiros se você olhar uma vez, no final.
Verificar o resultado todos os dias e parar na primeira vez em que ele mostra significativo é um procedimento diferente. As taxas oscilam à medida que os dados chegam, e cada olhada é mais uma chance de uma diferença aleatória cruzar a linha. Pare no primeiro cruzamento e você escolheu o momento mais sortudo, então a taxa real de falsos positivos acaba ficando acima de 5%, e cresce quanto mais vezes você olha. O valor-p na tela não sabe que você espiou, então continua marcando como se você tivesse olhado uma única vez.
A solução é sem graça e funciona: decida o tamanho da amostra antes do teste começar, deixe-o chegar a esse tamanho e leia o resultado uma única vez. Olhar no meio para verificar se nada quebrou está tudo bem. Parar porque o número está bonito não está.
O que a Meta e o Google Ads dizem sobre a duração do teste
- As práticas recomendadas de teste A/B da Meta recomendam testes de pelo menos 7 dias, dizem que testes mais curtos que isso podem gerar resultados inconclusivos e limitam os testes A/B a 30 dias. A mesma página sugere rodar por mais tempo se os clientes costumam levar mais de 7 dias para converter.
- A Meta geralmente sugere um poder estimado de 80% ou mais, o poder padrão aqui. Os resultados de A/B dela mostram uma porcentagem de confiança, e ela trata 65% ou mais como resultado vencedor em um teste A/B. Esse número vem do método próprio da Meta e não é a mesma coisa que o nível de confiança desta página, então os dois não vão coincidir.
- A Meta também desaconselha testar de forma informal ligando e desligando conjuntos de anúncios, porque os públicos podem se sobrepor, e recomenda o mesmo orçamento para as duas versões.
- O Google Ads recomenda deixar um experimento rodar de 2 a 3 semanas, mostra um intervalo de confiança de 80% por padrão com outros níveis sob solicitação, e marca resultados significativos com um asterisco azul. Seu método estatístico usa reamostragem jackknife sobre 20 blocos por braço, então os intervalos dele também não vão coincidir exatamente com um teste z.
O que esta calculadora não faz
- Ela compara duas versões. Com três ou mais, cada comparação extra é mais uma chance de um falso vencedor, e o teste simples daqui não corrige isso.
- Ela testa taxas de conversão, não receita por visitante ou valor do pedido, que precisam de um teste diferente.
- Não é um teste sequencial. Ela presume que você lê o resultado uma única vez, no tamanho de amostra que você planejou.
- Ela não consegue dizer se a sua divisão foi justa. Se uma versão recebeu público, orçamento ou horário diferentes, nenhuma fórmula conserta isso.
Se você preferir não fazer as contas à mão
O Hermoso é marketing no piloto automático. Pergunte a ele o que escalar, pausar e testar em seguida e ele lê todas as plataformas de anúncios que você conectou, coloca as campanhas com poucos dados em um grupo próprio em vez de julgá-las, e dá a cada teste sugerido uma hipótese, a única coisa a mudar, a métrica que decide, um orçamento e uma duração. Ele também cria variações de imagem e vídeo alinhadas à marca para testar, e monta campanhas nas suas próprias contas de anúncios, já pausadas. Funciona no app web, ou dentro do Claude, do ChatGPT e do Cursor através do seu servidor MCP. Quando um teste tem um vencedor, a calculadora de ROAS gratuita diz se ele também é lucrativo.
Ferramentas gratuitas: · Calculadora de ROAS · Verificador de comprimento de texto de anúncios
Perguntas frequentes
Como sei se o meu teste A/B de anúncio é estatisticamente significativo?
Insira visitantes e conversões das duas versões. A calculadora roda um teste z de duas proporções e dá um valor-p bilateral. Com 95% de confiança, um valor-p abaixo de 0,05 significa que a diferença dificilmente é acaso. Para 200 de 10.000 contra 245 de 10.000, p é 0,031, então B vence.
Quantos visitantes um teste A/B precisa?
Depende da sua taxa de conversão e do menor ganho que você quer detectar. A uma taxa de conversão de 2%, encontrar um ganho de 20% com 95% de confiança e 80% de potência exige 21.109 visitantes por versão. Um ganho de 10% exige 80.682.
Por que a calculadora diz que ainda não há dados suficientes?
O teste z é uma aproximação de amostra grande. A calculadora espera até que cada versão tenha pelo menos 5 conversões e 5 não conversões, um dos critérios do NIST e-Handbook, antes de dar um veredito.
Posso parar um teste assim que ele parecer significativo?
Não, se quiser que o nível de confiança signifique o que diz. Verificar repetidamente e parar na primeira leitura significativa dá mais oportunidades ao acaso de cruzar a linha, então a taxa real de falsos positivos acaba maior do que a que você escolheu. Defina o tamanho da amostra primeiro e leia o resultado uma única vez.
Por quanto tempo um teste A/B da Meta deve rodar?
A Meta recomenda pelo menos 7 dias, diz que testes mais curtos podem ser inconclusivos e permite até 30 dias. O Google Ads recomenda de 2 a 3 semanas para experimentos. Use a aba de tamanho de amostra com seu tráfego diário para ver quanto tempo o seu teste precisa.
Algo que eu digito é enviado para algum lugar?
Não. Os cálculos rodam no seu navegador. Não há requisição de rede carregando o que você digita e nada é armazenado.
O Hermoso diz o que escalar, pausar e testar em seguida nas suas contas de anúncios. Comece grátis, mais de 250 créditos gratuitos para ganhar, sem cartão.
Começar grátis → Ver preços