Skip to main content

O que é Significância Estatística?

Significância estatística é a probabilidade de que a diferença entre variantes não seja apenas sorte.

95% de Confiança

Você pode estar 95% confiante que a diferença é real

5% de Chance

Ainda há 5% de chance de ser sorte (falso positivo)

Exemplo Simples

Lição: Quanto maior a amostra, mais confiança você tem nos resultados.

Por que Isso Importa?

Cenário Real

Resposta: NÃO! A amostra é muito pequena. Essa diferença pode ser apenas sorte.

Calculando Significância

Com apenas 200 visitantes, a significância estatística é ~60%. Isso significa:
  • 40% de chance de ser falso positivo
  • Você estaria jogando uma moeda 🎲
Você precisa de ~800-1000 visitantes para ter 95% de confiança.

Nível de Confiança

O padrão da indústria é 95% de confiança (ou p-value < 0.05).

O que Significa na Prática?


Como Calcular

Fórmula Básica (Simplificada)

Para testar diferença entre duas proporções:
Não se preocupe! Use calculadoras online.

Calculadoras Recomendadas

Evan Miller

AB Test Sample Size Calculator

Optimizely

Sample Size Calculator

VWO

AB Test Significance Calculator

AB Testguide

Significance Calculator

Tamanho de Amostra Necessário

Calculadora Rápida

Use esta fórmula aproximada:

Tabela de Referência

MDE = Minimum Detectable Effect (menor diferença que você quer detectar)
Regra prática: Quanto menor a diferença que você quer detectar, maior a amostra necessária.

Exemplos Práticos

Exemplo 1: Amostra Suficiente

Decisão: ✅ Implementar Variante B Justificativa:
  • ✅ Amostra grande (5.000 por variante)
  • ✅ Significância > 95%
  • ✅ Diferença substancial (+30%)
  • ✅ Teste rodou 2 semanas completas

Exemplo 2: Amostra Insuficiente

Decisão: ⏸️ Continuar experimento Justificativa:
  • ❌ Amostra pequena (150 por variante)
  • ❌ Significância < 95% (apenas 78%)
  • ❌ Apenas 3 dias de teste
  • ✅ Resultado promissor → continuar testando

Exemplo 3: Falso Positivo

Decisão: ❌ Não implementar Justificativa:
  • ❌ Amostra muito pequena (80 por variante)
  • ❌ Significância muito baixa (65%)
  • ❌ Alta chance de falso positivo
  • ⚠️ Apesar da diferença dramática (+100%), não é confiável
O que fazer:
  • Continue o experimento por mais 1-2 semanas
  • Precisa de ~400 visitantes por variante

Erros Comuns

Erro 1: Peeking (Espiar Resultados)

Erro 2: Stopping Early

Erro 3: Multiple Testing


P-Value: O que Significa?

P-value é a probabilidade de obter o resultado observado se não houver diferença real.

Exemplo


Intervalo de Confiança

Além de significância, olhe para o intervalo de confiança (confidence interval).

Exemplo

Por que Isso Importa?

Cuidado: Um intervalo de confiança largo indica incerteza, mesmo que o resultado pareça promissor.

Checklist Antes de Decidir

Antes de implementar uma variante vencedora:
1

✅ Significância ≥ 95%

Confiança de pelo menos 95% (p-value < 0.05)
2

✅ Amostra Adequada

Mínimo 100-200 conversões por variante
3

✅ Tempo Suficiente

Pelo menos 1-2 semanas completas
4

✅ Resultado Estável

Não oscila drasticamente dia a dia
5

✅ Faz Sentido

Resultado é plausível e explicável
6

✅ Intervalo de Confiança

Intervalo não inclui zero (ou valores negativos)

Ferramentas e Recursos

Calculadoras

Sample Size

Calcule quantos visitantes precisa

Significance

Calcule significância dos resultados

Duration

Calcule duração necessária

Bayesian

Abordagem Bayesiana (avançado)

Artigos Recomendados


Frequentist vs Bayesian

Existem duas abordagens principais:

Frequentist (Padrão)

O que é:
  • Abordagem tradicional
  • Usa p-value e significância
  • Responde: “Qual a probabilidade de ver esses dados se não houver diferença?”
Prós:
  • ✅ Padrão da indústria
  • ✅ Bem entendido e documentado
  • ✅ Calculadoras amplamente disponíveis
Contras:
  • ❌ Não te diz “qual variante é melhor”
  • ❌ Apenas rejeita ou não rejeita hipótese nula

Bayesian (Avançado)

O que é:
  • Incorpora conhecimento prévio
  • Responde: “Qual a probabilidade da Variante B ser melhor?”
  • Resultado: “94% de chance de B ser melhor que A”
Prós:
  • ✅ Mais intuitivo para interpretar
  • ✅ Permite parar teste mais cedo
  • ✅ Incorpora incerteza naturalmente
Contras:
  • ❌ Menos comum
  • ❌ Requer definir prior (conhecimento prévio)
  • ❌ Mais complexo de implementar
Recomendação: Use Frequentist (padrão) a menos que você seja estatístico ou tenha razão específica para usar Bayesian.

Casos Especiais

Testes com Baixo Tráfego

Se você tem < 1.000 visitantes/mês:

Testes em B2B

Se você tem poucos usuários mas alto valor:

Testes de Revenue


Resumo: Regras de Ouro

95%+ Confiança

Sempre aguarde significância ≥95%

100+ Conversões

Mínimo absoluto por variante

1-2 Semanas

Duração mínima para capturar variação

Não Espie!

Defina critérios antes e não mude

Próximos Passos

Best Practices

Metodologias completas

Debugging

Resolva problemas técnicos

Exemplos

Veja implementações práticas

useExperiment

Documentação do SDK