Coeficiente de determinação (R²): o que ele mede, como calcular e quando engana
O relatório de energia da fábrica trazia um modelo de regressão com R² de 0,67, e a gerência leu o número como nota: 67%, razoável, dá para confiar. Seis meses depois, um analista acrescentou cinco variáveis ao modelo e apresentou R² de 0,77. A gerência gostou mais do segundo. Nenhuma das cinco variáveis novas tinha relação com o consumo de energia: eram números aleatórios, gerados para testar o modelo.
O R² é provavelmente o número mais citado e mais mal lido da estatística aplicada. Ele mede uma coisa precisa e útil, e é tratado como se medisse outras três que ele não mede: se o modelo está certo, se a variável causa o resultado, e se as previsões vão funcionar.
O que o R² mede
O coeficiente de determinação, representado por R², é a proporção da variação da variável resposta que é explicada pelo modelo de regressão. Vai de 0 a 1. Um R² de 0,67 significa que 67% da variação observada na resposta acompanha a variação das variáveis explicativas incluídas no modelo, e que 33% fica sem explicação.
A ideia por trás é uma decomposição. A variação total da resposta, medida pela soma dos quadrados das distâncias de cada observação até a média, se divide em duas partes: a que o modelo reproduz e a que sobra nos resíduos. O R² é a fração explicada:
R² = 1 − (soma dos quadrados dos resíduos ÷ soma dos quadrados total)
Na regressão linear simples, com uma única variável explicativa, o R² é exatamente o quadrado do coeficiente de correlação r. Uma correlação de 0,82 corresponde a um R² de 0,67.
O cálculo, com os números da fábrica
Doze meses de dados: produção mensal, entre 390 e 540 toneladas, e consumo de energia, entre 146 e 190 MWh. A regressão do consumo contra a produção deu inclinação de 0,22 MWh por tonelada e intercepto de 56,6 MWh, que é a parcela do consumo que não depende do volume produzido.
A soma dos quadrados total, a variação do consumo em torno da média, foi 1.669. A soma dos quadrados dos resíduos, o que o modelo não reproduz, foi 555. A diferença, 1.114, é a parte explicada. O R² é 1 − 555 ÷ 1.669 = 0,667. A correlação entre produção e consumo foi 0,817, e 0,817 ao quadrado dá o mesmo 0,667.
Interpretação correta: dois terços da variação mensal do consumo de energia acompanham a variação da produção. Não significa que a produção explica 67% do consumo total, nem que o modelo acerta 67% das previsões: significa que, dos altos e baixos do consumo de um mês para outro, dois terços andam junto com os altos e baixos da produção. O terço restante vem de outras fontes, como temperatura ambiente, mix de produtos ou eficiência dos equipamentos, que o modelo não inclui.
As quatro formas de o R² enganar
1. Ele sempre sobe quando você acrescenta variáveis. Foi o que aconteceu na abertura. Com cinco variáveis aleatórias acrescentadas ao modelo da energia, o R² foi de 0,667 para 0,768, sem que nada de real tivesse sido explicado. Isso acontece porque cada variável nova, mesmo sem relação nenhuma com a resposta, se ajusta um pouco ao acaso dos dados. Com poucas observações, o efeito é grande. O antídoto é o R² ajustado, que penaliza variáveis que não acrescentam explicação: no mesmo exemplo, ele caiu de 0,634 para 0,490. Quando o R² sobe e o ajustado desce, o modelo piorou. O ajustado pode até ficar negativo, o que acontece quando as variáveis do modelo explicam menos do que se esperaria por puro acaso, e é um sinal claro de que o modelo não tem valor explicativo. A comparação entre modelos com números diferentes de variáveis está em regressão linear simples e múltipla, e o problema de variáveis explicativas muito correlacionadas entre si, em multicolinearidade.
2. R² alto não prova causa. Duas séries que crescem com o tempo, por motivos independentes, produzem R² alto uma contra a outra. Vendas de sorvete e afogamentos sobem juntos no verão. O R² mede quanto duas coisas variam juntas, e diz nada sobre por quê. É o fenômeno da correlação espúria, e a distinção geral está em correlação e causalidade.
3. R² baixo não quer dizer que a relação não existe. Em processos com muita variação natural, um efeito real e importante pode explicar uma fração pequena da variação total. Num conjunto de 200 observações simuladas, mostrado na figura 1, com efeito real de 0,32 unidade por unidade da variável explicativa, o R² foi de apenas 0,11, e o efeito foi altamente significativo, com valor-p da ordem de um em um milhão. Descartar esse efeito pelo R² baixo seria descartar uma alavanca verdadeira do processo. R² baixo diz que há muitas outras fontes de variação, não que esta não importa.
4. R² perto de zero não significa ausência de relação. O R² da regressão linear mede ajuste a uma reta. Uma relação curva forte, como um processo que tem desempenho máximo numa temperatura intermediária e piora nos dois extremos, pode dar R² linear praticamente nulo. Num exemplo com esse formato, na figura 2, o R² da reta foi 0,003, com uma relação perfeitamente visível nos dados. Olhar o diagrama de dispersão antes de calcular qualquer coisa evita esse erro.
Qual é um bom R²?
A pergunta é frequente e não tem resposta universal, porque depende do que o modelo precisa fazer.
Para previsão individual precisa, como estimar o consumo de um mês específico para negociar contrato de energia, um R² de 0,67 é pouco: o erro de previsão de cada mês ainda será grande. Para entender se uma variável influencia o resultado, o mesmo 0,67 é muito, e até um R² de 0,11 pode ser suficiente, como no exemplo acima, se o efeito for real e relevante.
Em dados físicos e de laboratório, com pouco ruído, R² acima de 0,9 é comum. Em dados de processo industrial, valores entre 0,5 e 0,8 são frequentes. Em dados que envolvem comportamento humano, como vendas ou satisfação, R² de 0,3 já pode ser informativo. Comparar o R² de um modelo com uma régua fixa, sem olhar o contexto, leva a conclusões erradas nos dois sentidos.
O que olhar além do R²
Três verificações transformam o R² de nota em informação.
Os resíduos: se o modelo está bem especificado, as diferenças entre observado e previsto não devem ter padrão, nem crescer com o valor previsto, nem formar curva. A análise de resíduos revela o que o R² esconde, como uma relação curva ajustada por uma reta ou um ponto que distorce todo o modelo.
A significância e o tamanho dos coeficientes: o que interessa na maioria das decisões é quanto a resposta muda por unidade da variável explicativa, e com que incerteza, e não a fração de variação explicada.
O desempenho em dados novos: um modelo com R² alto nos dados usados para ajustá-lo pode prever mal casos que não estavam lá, sobretudo quando há muitas variáveis e poucos dados.
Interpretar um modelo de regressão por inteiro, e não pelo número mais fácil de ler, é parte da análise de dados em projetos de melhoria, conteúdo da formação Green Belt.
O modelo de energia da fábrica voltou para a versão com uma variável. O R² era menor, e o modelo era melhor.
Perguntas frequentes
O que é coeficiente de determinação?
É a proporção da variação da variável resposta explicada por um modelo de regressão, representada por R² e variando de 0 a 1. Um R² de 0,70 indica que 70% da variação da resposta acompanha a variação das variáveis explicativas incluídas no modelo.
Como calcular o R²?
Pela fórmula R² = 1 − (soma dos quadrados dos resíduos ÷ soma dos quadrados total). A soma total mede a variação da resposta em torno da média; a dos resíduos mede o que o modelo não reproduz. Na regressão linear simples, o R² também é o quadrado do coeficiente de correlação.
Qual a diferença entre R² e R² ajustado?
O R² sempre aumenta quando se acrescenta uma variável ao modelo, mesmo sem relação real com a resposta. O R² ajustado penaliza variáveis que não acrescentam explicação e pode diminuir. Para comparar modelos com números diferentes de variáveis, o ajustado é o indicador correto.
Qual é um bom valor de R²?
Depende do uso. Para previsão individual precisa, valores altos são necessários. Para identificar se uma variável influencia o resultado, valores modestos podem bastar. Em dados físicos, R² acima de 0,9 é comum; em dados de comportamento humano, 0,3 já pode ser informativo.
R² alto significa que o modelo está correto?
Não. R² alto pode vir de variáveis demais em relação ao número de dados, de relação espúria entre séries que crescem juntas, ou de pontos extremos que dominam o ajuste. A análise de resíduos e o teste em dados novos são necessários para avaliar o modelo.
R² baixo significa que a variável não importa?
Não necessariamente. Em processos com muita variação natural, um efeito real e relevante pode explicar pouca variação total. O que decide se a variável importa é o tamanho e a significância do seu coeficiente, não a fração de variação explicada.
Qual a relação entre R² e correlação?
Na regressão linear simples, o R² é o quadrado do coeficiente de correlação de Pearson. Uma correlação de 0,9 corresponde a um R² de 0,81. Na regressão múltipla, o R² é o quadrado da correlação entre os valores observados e os previstos pelo modelo.