O analista precisava calcular a capacidade do processo de usinagem e, antes, verificar se a espessura das peças seguia uma distribuição normal. Rodou o teste em oitenta medições e o resultado veio claro: dados não normais. Passou a semana seguinte pesquisando transformações matemáticas para “normalizar” os dados.
Os dados não eram não normais por natureza. Eram a mistura de dois turnos que trabalhavam com ajustes ligeiramente diferentes da máquina. Separados por turno, cada grupo era perfeitamente normal. A transformação teria escondido exatamente a informação mais útil que o teste tinha revelado.
Verificar normalidade é uma etapa comum em análise de dados, e é também uma das mais mal interpretadas. Saber como fazer é a parte fácil. Saber o que o resultado significa, e quando ele importa, é o que evita semanas de trabalho na direção errada.
Três formas de verificar
O histograma. É a primeira olhada: o formato de sino, simétrico, com a maior parte dos dados no centro, sugere normalidade. É útil para detectar problemas grosseiros, como assimetria forte ou dois picos, mas é pouco confiável com poucos dados, porque o formato muda bastante conforme a largura das classes escolhida.
O gráfico de probabilidade normal. É a ferramenta visual mais informativa. Os dados são ordenados e plotados contra os valores que seriam esperados se viessem de uma distribuição normal. Se os pontos ficam próximos de uma linha reta, os dados são compatíveis com a normal. O desvio da reta tem forma, e a forma diz o que está acontecendo: uma curva nas pontas indica caudas mais longas ou mais curtas que a normal; um arco indica assimetria; um degrau no meio indica dois grupos misturados.
Os testes formais. Os mais usados são Anderson-Darling, Shapiro-Wilk e Kolmogorov-Smirnov. Todos testam a mesma hipótese nula: os dados vêm de uma distribuição normal. Um valor-p pequeno, abaixo de 0,05 por convenção, leva a rejeitar a normalidade. Um valor-p alto significa apenas que não há evidência suficiente contra a normalidade, o que não é o mesmo que provar que os dados são normais. A lógica do valor-p é a mesma de qualquer teste de hipótese.
Na prática, o gráfico e o teste funcionam melhor juntos. O teste dá uma resposta objetiva; o gráfico mostra por que a resposta é aquela.
O caso da usinagem, com os números
As oitenta medições de espessura tinham média de 2,024 mm e desvio padrão de 0,0316 mm. O teste de Shapiro-Wilk deu valor-p de 0,006, e o Anderson-Darling apontou na mesma direção: normalidade rejeitada.
O gráfico de probabilidade mostrava um degrau no meio, o sinal típico de mistura. A estratificação por turno confirmou. O turno A tinha média de 1,998 mm e desvio padrão de 0,0143 mm, com valor-p de 0,55 no Shapiro-Wilk. O turno B tinha média de 2,051 mm e desvio padrão de 0,0196 mm, com valor-p de 0,56. Cada turno, separadamente, era normal.
A diferença de 0,053 mm entre as médias dos turnos era maior do que o desvio padrão de cada um. O desvio padrão da mistura, 0,0316 mm, era mais que o dobro do desvio de cada turno isolado. Calcular a capacidade com os dados misturados, ou com os dados transformados, teria produzido um índice baixo e uma conclusão errada sobre a máquina. O problema não era a variabilidade do processo: era a diferença de ajuste entre turnos, que se resolvia padronizando o ajuste.
O tamanho da amostra muda o que o teste consegue ver
Os testes de normalidade têm um comportamento que confunde muita gente: o resultado depende fortemente do número de dados.
Com poucos dados, os testes quase nunca rejeitam a normalidade, porque não têm poder para detectar desvios. Num exemplo de tempos de atendimento, claramente assimétricos, com mediana de 8,7 minutos e média de 9,4, as primeiras dez observações deram valor-p de 0,34 no Shapiro-Wilk: normalidade não rejeitada. As sessenta observações do mesmo processo deram valor-p de 0,0004: normalidade rejeitada com folga. O processo era o mesmo; o que mudou foi a capacidade do teste de enxergar a assimetria.
Com muitos dados, acontece o oposto: os testes rejeitam desvios minúsculos, sem importância prática. Com milhares de observações, quase nenhum dado real passa num teste de normalidade, porque nenhum processo real é perfeitamente normal.
A consequência prática é que o teste não substitui o julgamento. Com poucos dados, um valor-p alto não garante nada. Com muitos, um valor-p baixo pode apontar um desvio irrelevante. O gráfico de probabilidade, que mostra o tamanho e a forma do desvio, é o que permite decidir se ele importa.
Quando a normalidade importa, e quando não importa
Muita análise trava à toa na normalidade, porque ela é tratada como pré-requisito universal. Não é.
Importa bastante quando o resultado depende das caudas da distribuição. É o caso dos índices de capacidade de processo, que estimam a proporção de peças fora da especificação justamente a partir das caudas. Também importa em intervalos de previsão para observações individuais e em cálculos de probabilidade de eventos extremos.
Importa menos em comparações de médias com amostras razoáveis. Pelo teorema central do limite, a distribuição das médias tende à normal mesmo quando os dados individuais não são normais, e testes como o t são razoavelmente robustos a desvios moderados quando as amostras não são muito pequenas.
Não é pré-requisito para cartas de controle. A carta de controle funciona bem para uma grande variedade de distribuições, e a sua função é outra: verificar se o processo é estável. E essa pergunta vem antes da normalidade. Um processo instável, que muda de comportamento ao longo do tempo, produz dados que são mistura de vários estados, e testar a normalidade dessa mistura não faz sentido. O caso da usinagem é exatamente isso.
O que fazer quando os dados não são normais
Primeiro, perguntar por quê, antes de qualquer transformação. Mistura de grupos, como turnos, máquinas ou fornecedores, é a causa mais comum e mais informativa. Pontos atípicos, que podem ser erro de registro ou eventos reais que merecem investigação, vêm em seguida. E há dados que são naturalmente assimétricos, como tempos, que não podem ser negativos e costumam ter cauda longa à direita. Medir o grau dessa assimetria, e o peso das caudas, é o papel dos coeficientes de assimetria e curtose, que ajudam a escolher o tratamento adequado antes de qualquer transformação.
Só quando a assimetria é própria do fenômeno faz sentido tratá-la: usar a distribuição que descreve bem os dados, como a lognormal ou a de Weibull para tempos, usar métodos que não dependem da normalidade, ou, em último caso, transformar os dados. Transformar antes de entender a causa é o erro do analista da abertura: apaga a informação que o teste acabou de revelar.
Ler um resultado estatístico pelo que ele diz sobre o processo, e não como um carimbo de aprovado ou reprovado, é o que se desenvolve na fase de análise de um projeto de melhoria, conteúdo da formação Green Belt.
O analista da usinagem acabou não calculando a capacidade naquela semana. Padronizou o ajuste entre os turnos primeiro, e o índice que calculou depois descrevia a máquina, e não a diferença entre duas equipes.
Perguntas frequentes
Como saber se meus dados seguem uma distribuição normal?
Combinando um gráfico de probabilidade normal com um teste formal, como Anderson-Darling ou Shapiro-Wilk. Se os pontos do gráfico ficam próximos de uma reta e o teste não rejeita a normalidade, os dados são compatíveis com a normal. O histograma ajuda numa primeira olhada, mas é pouco confiável com poucos dados.
Como interpretar o valor-p do teste de normalidade?
A hipótese nula é que os dados são normais. Valor-p abaixo de 0,05, por convenção, leva a rejeitar a normalidade. Valor-p acima disso significa que não há evidência suficiente contra a normalidade, o que não prova que os dados sejam normais, especialmente quando a amostra é pequena.
Qual teste de normalidade usar?
Anderson-Darling e Shapiro-Wilk são os mais usados e costumam ter bom desempenho. O de Kolmogorov-Smirnov é menos sensível na versão padrão. Mais importante que a escolha do teste é olhar o gráfico de probabilidade junto, para entender a forma do desvio.
Por que meu teste rejeita a normalidade com muitos dados?
Porque, com amostras grandes, os testes detectam desvios muito pequenos, sem importância prática. Nenhum processo real é perfeitamente normal. Nessas situações, o gráfico de probabilidade mostra se o desvio é grande o suficiente para afetar a análise que você quer fazer.
Dados não normais podem indicar um problema no processo?
Sim, e com frequência. Uma causa comum é a mistura de grupos com médias diferentes, como turnos, máquinas ou fornecedores. Estratificar os dados antes de concluir qualquer coisa costuma revelar essa mistura, e ela é uma informação valiosa sobre o processo.
Preciso de dados normais para fazer uma carta de controle?
Não. Cartas de controle funcionam bem para uma grande variedade de distribuições. Além disso, a pergunta que a carta responde, se o processo é estável, vem antes da normalidade: dados de um processo instável são mistura de estados diferentes, e testar a normalidade dessa mistura não faz sentido.
Devo transformar os dados que não são normais?
Só depois de entender por que eles não são normais. Se a causa é mistura de grupos ou pontos atípicos, a transformação esconde informação importante. Se a assimetria é própria do fenômeno, como em tempos, usar uma distribuição adequada ou métodos que não dependem da normalidade costuma ser preferível à transformação.