E-commerceArtigo
Teste A/B no e-commerce com pouco tráfego: a conta que mostra o que dá para testar
Em resumo
Com pouco tráfego, o teste A/B só enxerga mudanças grandes. O ConnectWeek mostra, com a estatística de comparação de duas proporções do manual do NIST, a conta passo a passo: com 6.000 sessões por versão e conversão de 1,5%, a versão nova precisa vender cerca de 32% a mais para passar no teste. Traz tabela por volume de tráfego, fórmula para a planilha, regras e o que testar.
Teste A/B é mostrar duas versões da mesma página a grupos de visitantes sorteados ao acaso e comparar a taxa de conversão de cada grupo. Em loja com pouco tráfego ele funciona, mas só para mudanças grandes: com 6.000 sessões por versão e conversão de 1,5%, a versão nova precisa vender cerca de 32% a mais para que a diferença se distinga do acaso, pelas contas que o ConnectWeek fez com a estatística de comparação de duas proporções do manual de estatística do NIST/SEMATECH, publicado pelo NIST, o instituto de padrões e tecnologia do governo dos Estados Unidos. Este guia mostra a conta passo a passo, uma tabela para saber o que o seu tráfego permite testar, a fórmula pronta para a planilha e o que fazer quando o tráfego não dá.
Como saber se a diferença entre A e B é real?
Toda taxa de conversão oscila sozinha: a mesma página vende um pouco mais numa semana e um pouco menos na outra. O teste estatístico responde a uma pergunta só: a diferença que apareceu é maior do que essa oscilação? A seção 7.3.3 do manual do NIST, consultada pelo ConnectWeek em 8 de outubro de 2026, traz o cálculo para amostras razoavelmente grandes, que o ConnectWeek organiza aqui em três passos:
- Taxa de cada versão: pedidos divididos por sessões, em A e em B.
- Taxa combinada: todos os pedidos divididos por todas as sessões, como se fosse uma versão só.
- Estatística z: a diferença entre as duas taxas, dividida pela raiz quadrada de taxa combinada × (1 − taxa combinada) × (1 ÷ sessões de A + 1 ÷ sessões de B).
O resultado é comparado com um valor de tabela. Para o nível de significância de 5% em teste bilateral, adotado neste guia, esse valor é 1,96: na tabela da distribuição normal do mesmo manual, a área entre zero e 1,96 é 0,475, o que deixa 2,5% em cada ponta. Se o z, em módulo, passar de 1,96, a diferença passa no teste: se as duas versões fossem iguais, um resultado tão extremo apareceria em menos de 5% dos testes. Se não passar, o teste não permite afirmar que uma versão é melhor que a outra, o que é diferente de provar que são iguais.
A conta com um exemplo
O exemplo é hipotético. Uma loja tem cerca de 12.000 sessões a cada quatro semanas e converte 1,5% delas em pedido. Ela testa uma nova página de produto por quatro semanas, com metade do tráfego em cada versão: 6.000 sessões em A e 6.000 em B. A versão A fecha com 90 pedidos (1,5%).
Cenário 1 do exemplo hipotético: B fecha com 104 pedidos, 15,6% a mais que A. A taxa de B é 1,73%; a combinada, 194 ÷ 12.000 = 1,62%. A diferença entre as taxas é 0,00233, e a raiz dá 0,00230. O z fica em 1,01, abaixo de 1,96. Apesar dos 14 pedidos a mais, o teste não permite dizer que B é melhor.
Cenário 2 do exemplo hipotético: B fecha com 119 pedidos, 32,2% a mais. A taxa de B é 1,98%; a combinada, 209 ÷ 12.000 = 1,74%. A diferença é 0,00483, a raiz dá 0,00239 e o z chega a 2,02, acima de 1,96. Com 118 pedidos, o z ficaria em 1,958, logo abaixo do limite: 119 é o primeiro resultado que passa.
A leitura para o dono da loja: com esse tráfego, um resultado 15% maior não passa no teste. Só passa um resultado com cerca de um terço a mais de pedidos.
O que o seu tráfego permite testar?
As tabelas abaixo foram calculadas pelo ConnectWeek com a mesma estatística, para grupos de tamanho igual e significância de 5% bilateral. Mostram o menor resultado da versão B que passa de 1,96.
Métrica: pedidos, com conversão de base de 1,5% (hipótese do exemplo; contas do ConnectWeek)
| Sessões por versão | Pedidos em A | Pedidos mínimos em B | Taxa de B | Ganho mínimo visível |
|---|---|---|---|---|
| 2.000 | 30 | 48 | 2,40% | 60,0% |
| 6.000 | 90 | 119 | 1,98% | 32,2% |
| 20.000 | 300 | 350 | 1,75% | 16,7% |
| 60.000 | 900 | 985 | 1,64% | 9,4% |
Métrica: adição ao carrinho, com taxa de base de 8% (hipótese do exemplo; contas do ConnectWeek)
| Sessões por versão | Adições em A | Adições mínimas em B | Taxa de B | Ganho mínimo visível |
|---|---|---|---|---|
| 2.000 | 160 | 196 | 9,80% | 22,5% |
| 6.000 | 480 | 540 | 9,00% | 12,5% |
| 20.000 | 1.600 | 1.708 | 8,54% | 6,8% |
Duas conclusões saem das tabelas. A primeira: para enxergar cerca de metade do ganho, foi preciso mais que o triplo do tráfego (de 6.000 para 20.000 sessões, o ganho mínimo caiu de 32,2% para 16,7%). A mesma lógica aparece na fórmula de tamanho de amostra da seção 7.2.4.2 do manual do NIST, escrita para comparar uma proporção com um valor de referência: a diferença que se quer detectar entra no denominador, elevada ao quadrado. A segunda: uma métrica que acontece mais vezes, como a adição ao carrinho, deixa ver ganhos menores com o mesmo tráfego (12,5% em vez de 32,2%, com 6.000 sessões). As taxas de base de 1,5% e de 8% são hipóteses do exemplo, não médias de mercado; refaça a conta com as suas.
Um aviso: esses são os resultados mínimos para o teste passar depois de encerrado, supondo que a versão A feche exatamente na taxa de base. Uma melhora real exatamente desse tamanho passaria no teste só em cerca de metade das vezes, pela conta do ConnectWeek, porque os resultados de A e de B também oscilam. Quem quer mais segurança de não deixar passar um ganho verdadeiro precisa de mais tráfego do que a tabela mostra.
Como fazer a conta na planilha?
Ponha as sessões de A na célula A1, os pedidos de A em A2, as sessões de B em B1 e os pedidos de B em B2. Em outra célula, escreva a fórmula abaixo, que usa só operadores e reproduz os três passos do capítulo 1:
=(B2/B1-A2/A1)/(((A2+B2)/(A1+B1))*(1-(A2+B2)/(A1+B1))*(1/A1+1/B1))^0,5
Com os números do cenário 2 (6.000 e 90 em A, 6.000 e 119 em B), o resultado é 2,02. Se o valor ficar acima de 1,96 ou abaixo de −1,96, a diferença passou no teste a 5%. Em planilha configurada para o padrão americano, troque a vírgula de 0,5 por ponto. A aproximação vale para amostras razoavelmente grandes. Para amostras pequenas, o mesmo manual indica o teste exato de Fisher, disponível em programas de estatística. Na avaliação do ConnectWeek, é o caso de um teste com poucas dezenas de sessões ou um punhado de conversões por versão.
Que regras seguir para o resultado valer?
As regras abaixo são recomendação do ConnectWeek para loja pequena e média:
- Escreva a hipótese antes: o que muda, em que métrica e por quê. “Trocar a ordem das fotos aumenta a adição ao carrinho porque a foto de uso responde à dúvida de tamanho.”
- Defina a duração antes de começar e não encerre no primeiro dia em que B aparecer na frente. Com poucos pedidos, a diferença oscila muito de um dia para o outro.
- Rode semanas completas, porque o comportamento de compra pode variar conforme o dia da semana.
- Uma mudança por teste. Se mudar foto, preço e botão de uma vez, não saberá o que funcionou.
- Sorteio por visitante, e não por dia: comparar esta semana com a passada não é teste A/B, porque campanha, clima e data de pagamento mudam junto.
- Fique fora das datas atípicas, como Black Friday e liquidações.
- Anote o resultado, inclusive o que não deu diferença, para não repetir o teste daqui a seis meses.
O que testar quando o tráfego é pequeno?
Se a tabela mostra que a sua loja só enxerga ganhos acima de 30%, a recomendação do ConnectWeek é deixar de lado mudanças de detalhe, como cor de botão, e testar o que pode mudar a decisão de compra:
- a oferta: frete grátis acima de um valor contra desconto no Pix;
- a página de produto inteira: ordem das fotos, tabela de medidas, prova de avaliações;
- o número de etapas do checkout, tema de checkout que converte: os pontos de atrito;
- a recomendação de produtos no carrinho, como em upsell e cross-sell para elevar o tíquete médio.
Use a métrica mais próxima da mudança. Uma alteração na página de produto tende a aparecer primeiro na adição ao carrinho; como mostram as tabelas, medir só o pedido final exige mais tráfego para ver um ganho do mesmo tamanho. Concentre o teste nas páginas mais visitadas, e use o que os clientes digitam na busca interna da loja para escolher o que testar.
E quando nem isso dá?
Se a linha da sua loja na tabela pede um ganho que nenhuma mudança razoável entrega, o teste A/B não é a ferramenta certa agora. Três substitutos honestos, na avaliação do ConnectWeek:
- Corrigir o que está quebrado sem testar. Página lenta, erro no cálculo do frete e botão que não funciona no celular não precisam de estatística. O roteiro de velocidade está em Core Web Vitals para loja virtual.
- Observar cinco clientes comprando, por gravação de sessão ou ao vivo, e anotar onde travam.
- Comparar períodos, sabendo do limite. Antes e depois não isola a mudança de tudo o mais que variou; sirva-se dele para descartar piora grande, não para comemorar ganho pequeno. Os indicadores a acompanhar estão em KPIs do e-commerce com fórmula.
Comece por aqui Novo no assunto? Leia primeiro o que é e-commerce, o texto-base desta cobertura.
Fonte: NIST/SEMATECH e-Handbook of Statistical Methods, seção 7.3.3 (comparação de duas proporções)
Perguntas frequentes
Dá para fazer teste A/B em loja com pouco tráfego?
Dá, mas só para mudanças grandes. Nas contas do ConnectWeek com a estatística de duas proporções do manual do NIST, uma loja com 6.000 sessões por versão e conversão de 1,5% só distingue do acaso um ganho de cerca de 32% nos pedidos; com 2.000 sessões por versão, de 60%.
Como saber se o resultado do teste A/B é significativo?
Calcula-se a estatística z: a diferença entre as taxas de conversão das duas versões, dividida pela raiz de taxa combinada × (1 − taxa combinada) × (1 ÷ sessões de A + 1 ÷ sessões de B). Para 5% de significância em teste bilateral, o resultado precisa passar de 1,96 em módulo, valor da tabela normal do manual do NIST.
Quanto tempo deve durar um teste A/B?
A recomendação do ConnectWeek é definir a duração antes de começar, rodar semanas completas e não encerrar no primeiro dia em que uma versão aparecer na frente. O prazo depende do tráfego: o teste precisa juntar sessões suficientes para que o ganho esperado seja visível.
O que testar quando a loja tem pouco tráfego?
Na recomendação do ConnectWeek, mudanças capazes de alterar a decisão de compra: a oferta (frete grátis contra desconto), a página de produto inteira, o número de etapas do checkout. Um ganho pequeno, como o que se espera de uma troca de cor de botão, só aparece com muito mais tráfego.
Por que medir a adição ao carrinho em vez do pedido?
Porque ela acontece mais vezes. No exemplo do ConnectWeek, com 6.000 sessões por versão, o teste enxerga um ganho de 12,5% na adição ao carrinho (taxa de base de 8%), contra 32,2% nos pedidos (taxa de base de 1,5%). A métrica deve ser a mais próxima da mudança testada.
Comparar as vendas de antes e depois de uma mudança é teste A/B?
Não. No teste A/B, as duas versões rodam ao mesmo tempo, com visitantes sorteados. A comparação de períodos mistura a mudança com tudo o mais que variou, como campanha e data de pagamento; serve para descartar uma piora grande, não para confirmar um ganho pequeno.

