Pular para o conteúdo
Você está aqui: Início / Blog / Multicolinearidade: quando o modelo não consegue separar o efeito de duas variáveis

Multicolinearidade: quando o modelo não consegue separar o efeito de duas variáveis

A analista montou uma regressão para explicar o consumo mensal de energia da fábrica. Testou a produção sozinha: efeito claro, valor-p de 0,000005. Testou as horas-máquina sozinhas: efeito igualmente claro, valor-p de 0,000002. Então colocou as duas juntas no mesmo modelo, esperando um resultado ainda melhor. Nenhuma das duas saiu significativa. O valor-p da produção foi a 0,66.

O modelo não estava errado, e os dados também não. As duas variáveis simplesmente contavam a mesma história: meses de muita produção eram meses de muitas horas-máquina. Quando duas variáveis explicativas andam juntas desse jeito, o modelo sabe que o conjunto explica o consumo, mas não tem como dizer quanto cabe a cada uma. Esse fenômeno tem nome: multicolinearidade.

O que é multicolinearidade

Multicolinearidade é a correlação alta entre variáveis explicativas de uma regressão linear múltipla. Ela não é um erro de cálculo nem um defeito dos dados: é uma limitação do que os dados conseguem informar. Se duas variáveis sempre variaram juntas, os dados não contêm informação sobre o que acontece quando uma muda e a outra não.

No exemplo, a correlação entre produção e horas-máquina nos 24 meses era de 0,96. A figura mostra por quê: os pontos formam quase uma linha.

Produção e horas-máquina quase alinhadasVinte e quatro meses em que produção e horas-máquina sobem e descem quase juntas, com correlação de 0,96. Por isso o modelo não consegue separar o efeito de cada uma sobre o consumo de energia.6507508509501050380420460500540580correlação = 0,96as duas variáveis andam quase juntasprodução (t/mês)horas-máquina
Figura 1. Produção e horas-máquina em 24 meses: correlação de 0,96. Quando uma sobe, a outra sobe quase na mesma proporção.

Os sintomas, com os números do exemplo

Coeficientes individuais sem significância, modelo conjunto com bom ajuste. Com a produção sozinha, o coeficiente de determinação foi de 0,62; com horas-máquina sozinha, 0,65; com as duas juntas, 0,65. O modelo conjunto explica o consumo tão bem quanto qualquer uma das duas, mas nenhum coeficiente individual passa no teste. É o sintoma mais típico: o todo funciona e as partes parecem não funcionar.

Erros padrão inflados. O coeficiente da produção no modelo conjunto foi 0,050, com erro padrão de 0,111, maior que a própria estimativa. O intervalo de confiança vai de negativo a positivo, o que na prática significa que os dados não dizem nem o sinal do efeito.

Coeficientes instáveis. Ajustando o mesmo modelo só com os 12 primeiros meses, o coeficiente da produção foi 0,176. Só com os 12 últimos, foi −0,091. Trocou de sinal. Numa reamostragem repetida 30 vezes, a produção sozinha deu estimativas sempre entre 0,13 e 0,24; junto com horas-máquina, as estimativas foram de −0,21 a +0,28, e 12 das 30 saíram negativas.

Instabilidade do coeficienteCoeficiente da produção estimado em 30 reamostragens dos mesmos dados. No modelo só com produção, as estimativas ficam agrupadas. No modelo com produção e horas-máquina, espalham-se de valores negativos a positivos.-0,4-0,200,20,40,6modelo só com produçãomodelo com produção e horas-máquinacoeficiente muda até de sinalcoeficiente estimado da produção (MWh por tonelada)
Figura 2. O coeficiente da produção estimado em 30 reamostragens dos mesmos dados. Sozinha no modelo, a produção dá estimativas estáveis; junto com horas-máquina, as estimativas vão de −0,21 a +0,28.

Como medir: o fator de inflação da variância

O diagnóstico mais usado é o fator de inflação da variância, conhecido pela sigla VIF. Para cada variável explicativa, ele mede quanto a variância do seu coeficiente aumenta por causa da correlação com as outras. É calculado como 1 dividido por (1 − R²), em que esse R² vem de uma regressão da variável contra todas as outras explicativas.

No exemplo, com correlação de 0,96 entre as duas variáveis, o VIF foi de 13,9. A variância de cada coeficiente ficou quase 14 vezes maior do que seria se as variáveis fossem independentes, e o erro padrão, quase 4 vezes maior.

As referências práticas mais citadas são: VIF abaixo de 5, sem preocupação; entre 5 e 10, atenção; acima de 10, multicolinearidade forte. São convenções, não limites exatos. Em modelos pequenos, com poucos dados, um VIF de 5 já pode tornar os coeficientes inúteis.

Um cuidado: a multicolinearidade nem sempre aparece olhando as variáveis de duas em duas. Com três ou mais explicativas, uma delas pode ser quase uma combinação das outras, como o custo total que é praticamente a soma do custo de material e do custo de mão de obra, sem que nenhum par isolado tenha correlação muito alta. A matriz de correlações não mostra esse caso; o VIF mostra, porque compara cada variável com todas as outras ao mesmo tempo. Por isso o VIF é o diagnóstico recomendado, e a matriz de correlações serve só como primeira olhada.

Quando ela importa, e quando não importa

Não importa muito se o objetivo é prever. O modelo com as duas variáveis preveria o consumo de energia tão bem quanto os modelos com uma só, desde que os meses futuros mantenham a mesma relação entre produção e horas-máquina. A multicolinearidade não piora as previsões dentro do padrão dos dados; ela piora a interpretação dos coeficientes.

Importa muito se o objetivo é entender ou decidir. Se a pergunta é “vale mais a pena reduzir horas-máquina ou otimizar o mix de produção?”, o modelo não tem como responder, porque os dados nunca mostraram as duas variando separadamente. Qualquer resposta tirada desses coeficientes é arbitrária, e o sinal pode inverter com a próxima remessa de dados.

E a previsão também falha fora do padrão. Se a fábrica mudar algo que quebra a relação entre as duas, como um equipamento novo que produz mais com menos horas, o modelo com coeficientes instáveis pode prever muito mal. Por isso, mesmo em modelos de previsão, vale saber que a multicolinearidade está lá.

O que fazer

Manter só uma das variáveis. Se as duas medem essencialmente a mesma coisa, usar só uma é a solução mais simples e mais honesta. No exemplo, qualquer uma delas sozinha explica o consumo tão bem quanto as duas juntas. A escolha de quais variáveis entram no modelo, e com que critério, é o tema da seleção de variáveis.

Combinar as variáveis. Às vezes faz sentido criar uma variável única que represente o fenômeno comum, como uma medida de intensidade de operação, em vez de usar duas que dizem a mesma coisa.

Coletar dados em que elas variem separadamente. É a solução que realmente responde à pergunta sobre o efeito de cada uma, e a única que resolve o problema na origem. Quando é possível controlar as variáveis, o planejamento de experimentos define combinações em que os fatores variam de forma independente, e o problema simplesmente desaparece.

Verificar a estabilidade antes de concluir. Reajustar o modelo em partes dos dados, ou em reamostragens, como na figura 2, mostra rápido se os coeficientes são confiáveis. A técnica de reamostragem bootstrap é a forma sistemática de fazer isso.

O que não resolve é retirar do modelo a variável que saiu não significativa e declarar que ela não tem efeito. No exemplo, a produção saiu com valor-p de 0,66 no modelo conjunto e com valor-p de 0,000005 sozinha. Concluir que a produção não afeta o consumo de energia seria um erro grave, induzido pela multicolinearidade.

Reconhecer esse tipo de armadilha antes de tirar conclusões é parte da análise de dados em projetos de melhoria, e a formação Green Belt já prepara para identificar quando um modelo de regressão está dizendo menos do que parece.

A analista da fábrica acabou ficando com a produção como única variável. O modelo ficou mais simples, explicava o consumo tão bem quanto antes e, principalmente, dava um coeficiente que não mudava de sinal quando chegava um mês novo. A pergunta sobre o peso das horas-máquina ficou registrada para um teste futuro, com dados em que as duas variáveis possam variar separadamente.


Conteúdo revisado pelo Master Black Belt Marcelo Petenate, estatístico, formado pela Unicamp, mestre pela USP e especialista em Lean Six Sigma e melhoria contínua. Nesta revisão, o foco foi o diagnóstico da multicolinearidade pelos sintomas e pelo fator de inflação da variância, e a diferença entre o impacto na previsão e na interpretação dos coeficientes.


Modelos de regressão com várias variáveis, diagnóstico de multicolinearidade e planejamento de experimentos para separar efeitos fazem parte da formação Black Belt da EDTI, voltada a quem conduz as análises mais exigentes dos projetos de melhoria.

Perguntas frequentes

O que é multicolinearidade?

É a correlação alta entre variáveis explicativas de uma regressão múltipla. Quando duas ou mais variáveis variam juntas, o modelo consegue explicar a resposta pelo conjunto, mas não consegue separar quanto do efeito cabe a cada uma, e os coeficientes individuais ficam imprecisos e instáveis.

Como identificar multicolinearidade?

Pelos sintomas e pelo fator de inflação da variância. Os sintomas típicos são coeficientes não significativos num modelo com bom ajuste, erros padrão grandes e coeficientes que mudam muito ou trocam de sinal com pequenas mudanças nos dados. O VIF quantifica o problema para cada variável.

Qual valor de VIF indica multicolinearidade?

Por convenção, VIF abaixo de 5 não preocupa, entre 5 e 10 pede atenção e acima de 10 indica multicolinearidade forte. São referências práticas: em modelos com poucos dados, valores menores já podem comprometer a interpretação dos coeficientes.

Multicolinearidade prejudica a previsão?

Dentro do padrão dos dados usados no ajuste, pouco. O problema maior é na interpretação dos coeficientes. Mas se a relação entre as variáveis mudar no futuro, o modelo pode prever mal, porque seus coeficientes individuais não são confiáveis.

Como resolver a multicolinearidade?

Mantendo só uma das variáveis correlacionadas, combinando-as numa variável única ou coletando dados em que elas variem de forma independente, o que o planejamento de experimentos permite. Retirar a variável não significativa e concluir que ela não tem efeito é um erro.

Qual a diferença entre correlação e multicolinearidade?

Correlação é a relação entre duas variáveis quaisquer. Multicolinearidade é a correlação alta especificamente entre as variáveis explicativas de um mesmo modelo, e ela pode envolver mais de duas: uma variável pode ser quase uma combinação de várias outras, mesmo sem correlação alta com nenhuma delas isoladamente.

A multicolinearidade aparece na regressão simples?

Não. Ela exige pelo menos duas variáveis explicativas no mesmo modelo. Na regressão simples, com uma única variável, não há com o que a variável estar correlacionada.

post

Deixe um comentário

Inscreva-se em nossa newsletter

E receba por email novos conteúdos assim que forem publicados!

Desenvolvido por: