Suposições do modelo de regressão linear, página 118

Resumo sobre modelos lineares sem o intercepto (regressão pela origem)

Modelo com intercepto : \(\hat{Y} = \hat{B_0} + \hat{B_1}X_1 + E_i ; i=1,...,n\)

Modelo sem intercepto : \(\hat{Y} = \hat{B_0} + E_i ; i=1,...,n\)

Diferença nas retas

Modelo com intercepto:\[\hat{\beta_1}= \frac{\sum_{i=1}^{n} X_iY_i - n\bar{X}\bar{Y}}{\sum_{i=1}^{n} X_i² - n\bar{X}^2}\]

Modelo sem o intercepto:\[\hat{\beta_1^*} = \frac{\sum_{i=1}^{n} X_iY_i}{\sum_{i=1}^{n} X_i²}\]

Só usamos o modelo sem intercepto com forte embasamento teórico como por exemplo chegar na conclusão de que b0 não é significativo pelo p-valor do teste por exemplo

Diferença entre coeficiente de correlação

Com o intercepto: \[ {r^2 = \frac{(\sum_{i=1}^{n} (X_i-\bar{X})(Y_i-\bar{Y}))^2}{\sum_{i=1}^{n} (X_i-\bar{X})^2\sum_{i=1}^{n}(Y_i-\bar{Y})^2}} \] Sem o intercepto:

\[ \ {r^2 = \frac{(\sum_{i=1}^{n} (X_i)(Y_i))^2}{\sum_{i=1}^{n} (X_i)^2\sum_{i=1}^{n}(Y_i)^2}} \]

Existe diferença na inclinação

Sim, o modelo sem o intercepto é forçado a passar na origem já o com intercepto não passa pela origem pois ele possui \(B0\) como inclinação da reta.

Diferença nas variâncias

Modelo com intercepto:

\[ var(\hat{\beta_1}) = \frac{\hat{\sigma}²}{\sum_{i=1}^n (X_i - \bar{X})² } \]

Onde \(\hat{\sigma}² = \frac{\sum_{i=1}^n \hat{u}_i} {n-2}\)

Modelo sem intercepto:

\[ var(\hat{\beta_1}) = \frac{\hat{\sigma}²}{\sum_{i=1}^n X_i^2 }\]

Onde \(\hat{\sigma}^2 = \frac{\sum_{i=1}^n \hat{u}_i^2}{n-1}\)

Resíduo

Modelo com o intercepto:

\[ \sum_{i=1}^n E_i = 0 \]

Já no modelo sem o intercepto não podemos garantir que:

\[ \sum_{i=1}^n E_i = 0 \] Pois sem \(\hat{B}_0\) não podemos garantir que *

Retas dos modelos de variáveis independentes qualitativas e binária

\[ Y = {\alpha}_1 + {\alpha}_2D_i+ {\beta}_1X_1 + {\beta}_2X_1D_i + u_i \] Onde \({\alpha} => intercepto; {\beta}=>inclinação\)

Ao realizar os testes de hipóteses (T-student com t-n graus de liberdade) com a hipótese nula de que $ _i = 0 $ e olhar ao p-valor, aceitamos (não contribui para explicar Y) ou rejeitamos (contribui para explicar Y) a hipótese nula e chegamos a conclusão se a variável é ou não significativa para o modelo. De acordo com isso o modelo pode ter então retas paralelas, concorrentes, dissimilares.

Retas paralelas:

Em regressões paralelas Os coeficientes angulares são iguais, tendo apenas os interceptos diferentes.Acontece quando \({\beta_1}\) é estatisticamente não significativo.

Retas dissimilares:

Em regressões dissimilares os interceptos e os coeficientes angulares são diferentes. Acontece quando \({\alpha}_1\) e \({\beta}_1\) são estatisticamente significativos.

Retas concorrentes:

Em regressões concorrentes os interceptos são iguais mas os coeficientes angulares são diferentes. Acontece quando \({\alpha}_1\) é estatisticamente não significativo.

Retas coincidentes:

Em regressões coincidentes os interceptos e os coeficientes angulares são iguais.Acontece quando \({\alpha}_1\) e \({\beta}_1\) não são estatisticamente significativos.

Prática de regressão com variáveis independentes qualitativas e binária

Número de nascidos vivos antes e depois da pandemia no total das maes

O modelo 1 foi estimado com as variáveis X, D e XD para verificar se existe diferenca na tendencia dos nascimentos durante a pandemia em comparacao com o período anterior.Ao realizar o teste de hipótese como podemos ver na tabela 1 abaixo rejeitamos a hipótese nula de que as não sao significativas para o modelo de acordo com o seu p-valor e a nível 5% de significancia. Logo o modelo possui retas dissimilares em que o tanto os interceptos quanto os coeficientes angulares são diferentes.

As retas para esse modelo sao: Antes da pandemia : \(\hat{Y}= 7852.64 - 94.03X\) Depois da pandemia :\(\hat{Y}= 11022.7 - 266,8X\) \({Tabela -1 }\)

## 
## Call:
## lm(formula = Y ~ X + D + XD, data = Dados)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -68.238 -45.852   9.245  27.950  81.848 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  7852.64     238.51  32.924 5.22e-08 ***
## X             -94.03      14.38  -6.540 0.000611 ***
## D            3170.06     626.30   5.062 0.002307 ** 
## XD           -172.77      30.50  -5.665 0.001302 ** 
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 60.15 on 6 degrees of freedom
## Multiple R-squared:  0.9928, Adjusted R-squared:  0.9892 
## F-statistic: 274.7 on 3 and 6 DF,  p-value: 8.237e-07

Agora vamos iniciar a análise para cada faixa etaria de mae

Maes de até 19 anos

Agora vamos estimar o modelo 2 para verificar se existe diferenca tendencial nos nascidos vivos em comparacao durante a pandemia e antes esse período entre as maes de até 19 anos. Ao estimar o modelo 2 vemos que só rejeitamos a hipotese nula de que X nao é significativo para explicar o modelo, já para D e XD nao rejeitamos a hipotese observando o p-valor e a nivel 5% de significancia logo nao sao significativas para o modelo, ou seja possuem retas coincidentes.

## 
## Call:
## lm(formula = Y1 ~ X + D + XD, data = Dados)
## 
## Residuals:
##    Min     1Q Median     3Q    Max 
## -29.24 -13.60   2.30  11.33  29.82 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) 1636.695     85.395  19.166 1.30e-06 ***
## X            -51.971      5.148 -10.096 5.49e-05 ***
## D            -28.395    224.240  -0.127    0.903    
## XD            -1.229     10.920  -0.113    0.914    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 21.54 on 6 degrees of freedom
## Multiple R-squared:  0.9908, Adjusted R-squared:  0.9862 
## F-statistic: 214.9 on 3 and 6 DF,  p-value: 1.708e-06

Como no modelo 2 que D e XD nao contribuem para explicar o modelo vamos estimar um modelo 3 sem essas variaveis. Esse modelo possue a reta abaixo:\[\hat{Y}=1763.636-60.018X\]

## 
## Call:
## lm(formula = Y1 ~ X, data = Dados)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -30.382 -14.532  -7.282  13.750  39.673 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) 1763.636     49.736   35.46 4.38e-10 ***
## X            -60.018      2.657  -22.59 1.56e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 24.13 on 8 degrees of freedom
## Multiple R-squared:  0.9846, Adjusted R-squared:  0.9826 
## F-statistic: 510.4 on 1 and 8 DF,  p-value: 1.561e-08

Maes de 30 a 34 anos

Vamos estimar agora um modelo 4. no modelo abaixo todas as variaveis sao significativas para o modelo, as retas sao

Antes da pandemia:\(\hat{Y}=5603.40-90.60X\) Depois da pandemia:\(\hat{Y}=7813.9-202.6X\)

## 
## Call:
## lm(formula = Y2 ~ X + D + XD, data = Dados)
## 
## Residuals:
##    Min     1Q Median     3Q    Max 
## -57.00 -32.45   6.75  32.25  59.80 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  5603.40     200.55  27.940 1.39e-07 ***
## X             -90.60      12.09  -7.494 0.000292 ***
## D            2210.50     526.63   4.197 0.005702 ** 
## XD           -112.00      25.65  -4.367 0.004734 ** 
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 50.58 on 6 degrees of freedom
## Multiple R-squared:  0.9889, Adjusted R-squared:  0.9833 
## F-statistic: 177.8 on 3 and 6 DF,  p-value: 2.998e-06

Maes de 35 anos ou mais

Vamos estimar agora o modelo 5.Todas as variaveis sao significativas as retas sao

Antes da pandemia:\(\hat{Y}=614.457+48.457X\) Durante a pandemia:\(\hat{Y}=1606.7-11,3X\)

## 
## Call:
## lm(formula = Y3 ~ X + D + XD, data = Dados)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -8.2286 -1.5036 -0.3571  2.7536  4.1429 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  614.457     17.781   34.56 3.91e-08 ***
## X             48.457      1.072   45.21 7.85e-09 ***
## D            992.243     46.691   21.25 7.08e-07 ***
## XD           -59.757      2.274  -26.28 2.00e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 4.484 on 6 degrees of freedom
## Multiple R-squared:  0.9975, Adjusted R-squared:  0.9962 
## F-statistic: 792.3 on 3 and 6 DF,  p-value: 3.489e-08