class: center, middle, inverse, title-slide .title[ # Correlação e Regressão Linear Simples ] .subtitle[ ## Aplicação em Processos Industriais ] .author[ ### Estatística II — Engenharia de Produção ] .date[ ### 2026-08-18 ] --- class: center, middle # Correlação e Regressão Linear Simples ## em Processos Industriais **Estatística II — Engenharia de Produção** --- class: middle ## Problema norteador Uma indústria deseja investigar se o **tempo de parada de uma máquina** está associado ao **número de peças defeituosas** produzido no lote seguinte. A parada está relacionada aos defeitos? A relação observada é suficientemente forte, e generalizável, para justificar uma investigação do processo? --- class: middle ## Objetivos da aula - interpretar um diagrama de dispersão - calcular e interpretar o coeficiente `\(r\)` - testar hipóteses sobre a correlação `\(\rho\)` - ajustar uma regressão linear simples - testar hipóteses sobre o coeficiente angular `\(\beta_1\)` - interpretar `\(b_0\)`, `\(b_1\)`, `\(R^2\)` e os resíduos - construir intervalos de confiança e de previsão - reconhecer limitações e evitar conclusões causais indevidas --- class: middle ## Fundamentos teóricos — covariância A covariância mede a direção conjunta de variação entre `\(X\)` e `\(Y\)`: `$$\operatorname{Cov}(X,Y) = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{n-1}$$` - Covariância positiva: as variáveis tendem a crescer juntas. - Covariância negativa: quando uma cresce, a outra tende a decrescer. - A covariância não é padronizada, por isso não permite comparar a intensidade entre pares de variáveis diferentes. O coeficiente de correlação de Pearson resolve esse problema ao padronizar a covariância pelos desvios-padrão de `\(X\)` e `\(Y\)`<sources>[1]</sources>. --- class: middle ## Fundamentos teóricos — população e amostra | Conceito | População | Amostra | |---|---|---| | Correlação | `\(\rho\)` | `\(r\)` | | Intercepto | `\(\beta_0\)` | `\(b_0\)` | | Inclinação | `\(\beta_1\)` | `\(b_1\)` | | Erro | `\(\varepsilon\)` | `\(e_i\)` (resíduo) | - Parâmetros populacionais (`\(\rho\)`, `\(\beta_0\)`, `\(\beta_1\)`) são desconhecidos e fixos. - Estimadores amostrais (`\(r\)`, `\(b_0\)`, `\(b_1\)`) variam de amostra para amostra. - A inferência estatística usa o estimador amostral para testar hipóteses sobre o parâmetro populacional. --- class: middle ## Fundamentos teóricos — hipóteses e valor-p - `\(H_0\)`: hipótese de nulidade, afirma ausência de efeito ou relação. - `\(H_1\)`: hipótese alternativa, afirma a presença de efeito ou relação. - `\(\alpha\)`: nível de significância, probabilidade de rejeitar `\(H_0\)` quando ela é verdadeira, o Erro Tipo I. - Valor-p: probabilidade de observar um resultado tão ou mais extremo que o obtido, assumindo `\(H_0\)` verdadeira. **Regra de decisão:** se o valor-p for menor que `\(\alpha\)`, rejeita-se `\(H_0\)`. **Atenção:** não rejeitar `\(H_0\)` não prova que `\(H_0\)` seja verdadeira; apenas indica ausência de evidência suficiente contra ela. --- class: middle ## Variáveis, unidade de análise e limitações - `\(X\)`: tempo de parada da máquina, em horas - `\(Y\)`: número de peças defeituosas no lote seguinte - Unidade observacional: lote produzido A primeira amostra utilizada, com `\(n=5\)`, serve apenas para demonstrar o cálculo manual. Ela é pequena demais para sustentar uma decisão industrial real. --- class: middle ## Base de dados — cálculo manual <table class="table" style="color: black; width: auto !important; margin-left: auto; margin-right: auto;"> <thead> <tr> <th style="text-align:left;"> Lote </th> <th style="text-align:right;"> Parada (x), horas </th> <th style="text-align:right;"> Defeitos (y) </th> </tr> </thead> <tbody> <tr> <td style="text-align:left;"> A </td> <td style="text-align:right;"> 2 </td> <td style="text-align:right;"> 48 </td> </tr> <tr> <td style="text-align:left;"> B </td> <td style="text-align:right;"> 4 </td> <td style="text-align:right;"> 56 </td> </tr> <tr> <td style="text-align:left;"> C </td> <td style="text-align:right;"> 5 </td> <td style="text-align:right;"> 64 </td> </tr> <tr> <td style="text-align:left;"> D </td> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 60 </td> </tr> <tr> <td style="text-align:left;"> E </td> <td style="text-align:right;"> 8 </td> <td style="text-align:right;"> 72 </td> </tr> </tbody> </table> --- class: middle ## Diagrama de dispersão <img src="aula-02---corr-e-reg_files/figure-html/dispersao-manual-1.png" alt="" width="70%" style="display: block; margin: auto;" /> Qual direção e intensidade a relação parece ter? --- class: middle ## Tipos de correlação linear <img src="aula-02---corr-e-reg_files/figure-html/tipos-correlacao-1.png" alt="" width="80%" style="display: block; margin: auto;" /> `\(r \approx 0\)` indica ausência de associação **linear** aparente, não necessariamente ausência de qualquer relação. --- class: middle ## Coeficiente de correlação de Pearson `$$r = \frac{n\sum x_iy_i - \left(\sum x_i\right)\left(\sum y_i\right)}{\sqrt{\left[n\sum x_i^2 - \left(\sum x_i\right)^2\right]\left[n\sum y_i^2 - \left(\sum y_i\right)^2\right]}}$$` `$$-1 \le r \le 1$$` O sinal indica a direção; o valor absoluto indica a intensidade da associação linear<sources>[1]</sources>. --- class: middle ## Fundamentos teóricos — condições para a correlação - observações independentes entre si - relação aproximadamente linear entre `\(X\)` e `\(Y\)` - ausência de pontos excessivamente influentes - normalidade bivariada aproximada, exigida pela inferência clássica sobre `\(\rho\)` Quando essas condições não são atendidas, o valor de `\(r\)` pode ser enganoso ou o teste de hipótese pode perder validade. --- class: middle ## Cálculo manual de `\(r\)` ``` ## Somas: ## sum(x) = 25 ## sum(y) = 300 ## sum(x^2) = 145 ## sum(y^2) = 18320 ## sum(xy) = 1576 ## ## r = 0.95 ``` --- class: middle ## Interpretação do coeficiente `$$r \approx 0{,}95$$` Há associação linear positiva forte entre o tempo de parada e o número de defeitos **nesta amostra didática**. O resultado ainda não permite generalizar para a população de lotes da fábrica — isso exige o teste de hipótese a seguir. --- class: middle ## Teste de hipótese para a correlação `$$H_0: \rho = 0 \qquad H_1: \rho \ne 0$$` `$$t = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}}, \qquad gl = n-2$$` ``` ## gl = 3 ## t calculado = 5.27 ## t crítico (alpha = 0,05, bilateral) = 3.182 ``` --- class: middle ## Decisão estatística ``` ## Decisão: Rejeita-se H0 ``` Há evidência estatística de associação linear positiva entre tempo de parada e número de defeitos. A associação observada **não prova causalidade**. Outras variáveis podem influenciar os defeitos: matéria-prima, operador, turno, temperatura, condição da máquina. --- class: middle ## Exercício de fixação — correlação <table class="table" style="color: black; width: auto !important; margin-left: auto; margin-right: auto;"> <thead> <tr> <th style="text-align:right;"> Lote </th> <th style="text-align:right;"> Setup (x), horas </th> <th style="text-align:right;"> Defeitos (y) </th> </tr> </thead> <tbody> <tr> <td style="text-align:right;"> 1 </td> <td style="text-align:right;"> 2 </td> <td style="text-align:right;"> 12 </td> </tr> <tr> <td style="text-align:right;"> 2 </td> <td style="text-align:right;"> 3 </td> <td style="text-align:right;"> 15 </td> </tr> <tr> <td style="text-align:right;"> 3 </td> <td style="text-align:right;"> 4 </td> <td style="text-align:right;"> 14 </td> </tr> <tr> <td style="text-align:right;"> 4 </td> <td style="text-align:right;"> 5 </td> <td style="text-align:right;"> 19 </td> </tr> <tr> <td style="text-align:right;"> 5 </td> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 21 </td> </tr> <tr> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 7 </td> <td style="text-align:right;"> 20 </td> </tr> <tr> <td style="text-align:right;"> 7 </td> <td style="text-align:right;"> 8 </td> <td style="text-align:right;"> 25 </td> </tr> <tr> <td style="text-align:right;"> 8 </td> <td style="text-align:right;"> 9 </td> <td style="text-align:right;"> 27 </td> </tr> </tbody> </table> 1. Construa o diagrama de dispersão 2. Calcule `\(r\)` 3. Teste `\(H_0: \rho = 0\)`, com `\(\alpha = 0{,}05\)` 4. Calcule `\(t\)` e informe os graus de liberdade 5. Interprete o resultado no contexto industrial 6. Explique por que correlação não prova causalidade Avaliação — 10 pontos: diagrama (1,5) · cálculo de `\(r\)` (2,5) · teste de hipótese (3,0) · interpretação (1,5) · limitações e causalidade (1,5) --- class: middle ## Modelo de regressão linear simples `$$Y = \beta_0 + \beta_1 X + \varepsilon$$` `$$\widehat{Y} = b_0 + b_1 X$$` `$$b_1 = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} \qquad b_0 = \bar{y} - b_1\bar{x}$$` Para a regressão e a inferência sobre o modelo, ampliamos a amostra para `\(n=10\)`, reduzindo a sensibilidade a pontos isolados. --- class: middle ## Fundamentos teóricos — pressupostos da regressão `$$E(\varepsilon_i) = 0 \qquad \operatorname{Var}(\varepsilon_i) = \sigma^2 \qquad \operatorname{Cov}(\varepsilon_i,\varepsilon_j) = 0, \; i \ne j$$` - **Linearidade:** a relação entre `\(X\)` e `\(Y\)` é aproximadamente linear. - **Independência:** os erros não são correlacionados entre si. - **Homocedasticidade:** a variância dos erros é constante para todos os valores de `\(X\)`. - **Normalidade aproximada:** os resíduos seguem, aproximadamente, uma distribuição normal. Quando esses pressupostos falham, os testes de hipótese e os intervalos de confiança perdem validade. --- class: middle ## Base de dados ampliada <table class="table" style="color: black; width: auto !important; margin-left: auto; margin-right: auto;"> <thead> <tr> <th style="text-align:right;"> Lote </th> <th style="text-align:right;"> Parada (x), horas </th> <th style="text-align:right;"> Defeitos (y) </th> </tr> </thead> <tbody> <tr> <td style="text-align:right;"> 1 </td> <td style="text-align:right;"> 2 </td> <td style="text-align:right;"> 45 </td> </tr> <tr> <td style="text-align:right;"> 2 </td> <td style="text-align:right;"> 3 </td> <td style="text-align:right;"> 50 </td> </tr> <tr> <td style="text-align:right;"> 3 </td> <td style="text-align:right;"> 4 </td> <td style="text-align:right;"> 52 </td> </tr> <tr> <td style="text-align:right;"> 4 </td> <td style="text-align:right;"> 5 </td> <td style="text-align:right;"> 58 </td> </tr> <tr> <td style="text-align:right;"> 5 </td> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 60 </td> </tr> <tr> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 6 </td> <td style="text-align:right;"> 63 </td> </tr> <tr> <td style="text-align:right;"> 7 </td> <td style="text-align:right;"> 7 </td> <td style="text-align:right;"> 66 </td> </tr> <tr> <td style="text-align:right;"> 8 </td> <td style="text-align:right;"> 8 </td> <td style="text-align:right;"> 70 </td> </tr> <tr> <td style="text-align:right;"> 9 </td> <td style="text-align:right;"> 9 </td> <td style="text-align:right;"> 73 </td> </tr> <tr> <td style="text-align:right;"> 10 </td> <td style="text-align:right;"> 10 </td> <td style="text-align:right;"> 78 </td> </tr> </tbody> </table> --- class: middle ## Estimativa dos coeficientes ``` ## b0 = 37 ## b1 = 4.083 ``` `\(b_0\)`: valor médio estimado de `\(Y\)` quando `\(X=0\)`, com cautela quanto à interpretação fora da faixa observada. `\(b_1\)`: para cada hora adicional de parada, o número médio estimado de defeitos aumenta em aproximadamente `\(b_1\)` unidades, dentro da faixa observada. --- class: middle ## Teste de hipótese para `\(\beta_1\)` `$$H_0: \beta_1 = 0 \qquad H_1: \beta_1 \ne 0$$` ``` ## Estimate Std. Error t value Pr(>|t|) ## (Intercept) 37.000000 0.8410063 43.99491 7.862296e-11 ## x 4.083333 0.1297701 31.46590 1.132175e-09 ``` O teste `\(t\)` para o coeficiente angular e o respectivo valor-p indicam se há evidência de relação linear entre `\(X\)` e `\(Y\)` na população. --- class: middle ## Intervalos de confiança e de previsão ``` ## IC para a média de Y, quando x = 7: ``` ``` ## fit lwr upr ## 1 65.58333 64.79159 66.37508 ``` ``` ## ## IP para uma nova observação, quando x = 7: ``` ``` ## fit lwr upr ## 1 65.58333 63.13386 68.0328 ``` - **Intervalo de confiança:** incerteza sobre a média de `\(Y\)` para um dado `\(X\)`. - **Intervalo de previsão:** incerteza sobre uma nova observação individual de `\(Y\)`. O intervalo de previsão é sempre mais amplo, pois soma a variabilidade da média à variabilidade individual. Previsões só são válidas **dentro da faixa observada** de `\(X\)`. --- class: middle ## Gráfico com a reta ajustada <img src="aula-02---corr-e-reg_files/figure-html/grafico-regressao-1.png" alt="" width="70%" style="display: block; margin: auto;" /> --- class: middle ## Coeficiente de determinação `$$R^2 = \frac{SSR}{SST} = r^2$$` ``` ## R^2 = 0.992 ``` O modelo linear explica essa proporção da variabilidade observada em `\(Y\)` nesta amostra. Isso não mede força de causalidade nem garante que o modelo seja adequado. --- class: middle ## Resíduos e pressupostos .pull-left[ `$$e_i = y_i - \widehat{y}_i$$` Avaliar: - linearidade - independência - variância constante - normalidade aproximada - pontos influentes Se os resíduos exibirem padrão sistemático contra os valores ajustados, o pressuposto de linearidade, ou de variância constante, deve ser questionado. ] .pull-right[ ```{r resid