TALLER 2: Inferencia sobre el modelo e inferencia sobre parámetros del modelo de Regresión lineal simple

Author

María José Bula Arango, Jackeline González Cardenas,Alvaro Andrés Sánchez Mora, Dayana Paola Severiche Sánchez, María Isabel Torres, Miguel Andrés Turizo Barrios

Problema

Una empresa de logística desea estudiar cómo influye la carga transportada en el consumo de combustible de sus camiones durante un recorrido estándar de 100 km.

Durante varios días se registró la carga transportada por diferentes camiones y el consumo de combustible correspondiente.

El gerente sospecha que existe una relación aproximadamente lineal entre ambas variables y desea construir un modelo que permita estimar el consumo esperado para cualquier nivel de carga, para lo cual ha recolectado la siguiente información:

Obs Carga X (toneladas) Consumo Y (L/100 km)
1 5 21.8
2 6 23.1
3 7 24.4
4 8 25.2
5 9 26.6
6 10 28.1
7 11 28.7
8 12 30.3
9 13 31.2
10 14 32.8
11 15 33.4
12 16 35.1
13 17 35.8
14 18 37.5
15 19 38.0
16 20 39.6
17 21 40.9
18 22 41.7
19 23 43.0
20 24 44.3
21 25 45.1
22 26 46.8
23 27 47.4
24 28 49.2
25 29 50.0
26 30 51.6

Datos y variables

Para el análisis se consideran las siguientes variables:

  • \(X\): carga transportada por el camión, medida en toneladas.
  • \(Y\): consumo de combustible, medido en L/100 km.

El conjunto de datos contiene \(n=26\) observaciones.

Importación de datos y creación de variables en R:

# Importar los datos
library(readxl)

datos1 <- read_excel("C:/Users/jbula/Downloads/datos1.xlsx")

# Variables
carga <- datos1$`Carga (toneladas) X`
consumo <- datos1$`Consumo (L/100 km) Y`

Estimación del modelo

Para estudiar la relación entre la carga transportada y el consumo de combustible se utiliza el modelo de regresión lineal simple:

\[ Y_i=\beta_0+\beta_1X_i+\varepsilon_i \]

donde \(Y_i\) representa el consumo de combustible, \(X_i\) representa la carga transportada, \(\beta_0\) corresponde al intercepto, \(\beta_1\) a la pendiente y \(\varepsilon_i\) al término de error aleatorio.

Los parámetros del modelo se estiman mediante el método de mínimos cuadrados, obteniendo el modelo estimado:

\[ \hat{Y}_i=\hat{\beta}_0+\hat{\beta}_1X_i \] Estimación del modelo en R:

# Modelo de regresión lineal
modelo <- lm(consumo ~ carga)

# Resumen del modelo
summary(modelo)

Call:
lm(formula = consumo ~ carga)

Residuals:
   Min     1Q Median     3Q    Max 
-0.372 -0.207  0.010  0.199  0.320 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)    
(Intercept) 16.020000   0.117534   136.3   <2e-16 ***
carga        1.176000   0.006173   190.5   <2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 0.2361 on 24 degrees of freedom
Multiple R-squared:  0.9993,    Adjusted R-squared:  0.9993 
F-statistic: 3.629e+04 on 1 and 24 DF,  p-value: < 2.2e-16

Ecuación estimada

De acuerdo con los resultados obtenidos mediante R, estimamos los parámetros:

\[ \hat{\beta}_0=16.020 \]

y

\[ \hat{\beta}_1=1.176 \]

Por lo tanto, la ecuación estimada del modelo es:

\[ \boxed{\hat{Y}=16.020+1.176X} \]

La pendiente estimada \(\hat{\beta}_1=1.176\) indica que, en promedio, por cada tonelada adicional de carga transportada, el consumo esperado de combustible aumenta en aproximadamente 1.176 L/100 km.

El intercepto \(\hat{\beta}_0=16.020\) representa el consumo estimado cuando la carga transportada es igual a cero toneladas.

PUNTO 1: Inferencia sobre el modelo mediante ANOVA

El análisis de varianza (ANOVA) permite determinar si el modelo de regresión presenta una relación lineal estadísticamente significativa entre la variable regresora y la variable respuesta.

Para ello se plantean las siguientes hipótesis:

1. Planteamiento de Hipótesis

\[ H_0:\beta_1=0 \]

\[ H_1:\beta_1\neq0 \]

La hipótesis nula establece que la pendiente poblacional es igual a cero, por lo que no existiría una relación lineal significativa entre la carga transportada y el consumo de combustible.

La hipótesis alternativa establece que la pendiente poblacional es diferente de cero, indicando la existencia de una relación lineal significativa entre las variables.

2. Explicación descomposición de la variabilidad

El ANOVA permite descomponer la variabilidad total de la variable respuesta en una parte explicada por el modelo y otra asociada al error:

\[ SST=SSR+SSE \]

donde:

  • \(SST\) es la suma total de cuadrados.
  • \(SSR\) es la suma de cuadrados de la regresión.
  • \(SSE\) es la suma de cuadrados del error.

Los grados de libertad asociados a cada fuente de variación son:

\[ DF_T=n-1 \]

\[ DF_R=1 \]

\[ DF_E=n-2 \]

Debido a que se tienen 26 observaciones:

\[ DF_T=25,\qquad DF_R=1,\qquad DF_E=24 \]

Los cuadrados medios se obtienen mediante:

\[ MSR=\frac{SSR}{DF_R} \]

\[ MSE=\frac{SSE}{DF_E} \]

3. Cálculo del estadístico de prueba

Finalmente, el estadístico de prueba utilizado para la inferencia del modelo es:

\[ F_0=\frac{MSR}{MSE} \]

ANOVA en R:

# ANOVA
anova <- aov(modelo)
summary(anova)
            Df Sum Sq Mean Sq F value Pr(>F)    
carga        1 2022.6  2022.6   36291 <2e-16 ***
Residuals   24    1.3     0.1                   
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

De acuerdo con la tabla ANOVA obtenida mediante R, la regresión presenta un estadístico de prueba:

\[ F_0=36291 \]

El valor-p asociado es:

\[ p\text{-value}<2.2\times10^{-16} \]

Este resultado corresponde a un valor-p mucho menor que el nivel de significancia establecido de \(\alpha=0.05\).

4. Cálculo del estadístico teórico

# F teórico
qf(0.05, 1, 24, lower.tail = FALSE)
[1] 4.259677

R dio: 4.259677

El valor crítico de la distribución F para un nivel de significancia de \(\alpha=0.05\), con 1 grado de libertad para la regresión y 24 grados de libertad para el error, es:

\[ F_{\text{teórico}}=4.259677 \]

La regla de decisión consiste en rechazar \(H_0\) cuando:

\[ F_0>F_{\text{teórico}} \] En este caso:

\[ 36291>4.259677 \]

Por lo tanto, se rechaza la hipótesis nula \(H_0\).

5. Conclusión de la inferencia sobre el modelo

Con un nivel de significancia de \(\alpha=0.05\), se rechaza la hipótesis nula \(H_0:\beta_1=0\), debido a que el estadístico de prueba obtenido mediante ANOVA (\(F_0=36291\)) es mayor que el valor crítico (\(F_{\text{teórico}}=4.259677\)).

Adicionalmente, el valor-p obtenido es menor que \(2.2\times10^{-16}\), por lo que también es menor que el nivel de significancia de 0.05.

Por lo tanto, existe evidencia estadísticamente significativa para afirmar que existe una relación lineal entre la carga transportada y el consumo de combustible. En consecuencia, el modelo de regresión lineal resulta estadísticamente significativo para explicar el consumo de combustible en función de la carga transportada.

PUNTO 2: Inferencia sobre los parámetros del modelo

Una vez establecida la significancia global del modelo, se realiza la inferencia individual sobre los parámetros \(\beta_1\) y \(\beta_0\).

Para las pruebas de hipótesis se utiliza el estadístico \(t\) de Student, con \(n-2=24\) grados de libertad

Inferencia sobre \(\beta_1\)

La pendiente \(\beta_1\) permite determinar el cambio esperado en el consumo de combustible ante un cambio en la carga transportada

1. Planteamiento de hipótesis

Las hipótesis son:

\[ H_0:\beta_1=0 \]

\[ H_1:\beta_1\neq0 \]

2. Cálculo del estadístico de prueba

El estadístico de prueba utilizado es:

\[ t_0=\frac{\hat{\beta}_1}{S(\hat{\beta}_1)} \]

Lo obtenemos de:

summary(modelo)

Call:
lm(formula = consumo ~ carga)

Residuals:
   Min     1Q Median     3Q    Max 
-0.372 -0.207  0.010  0.199  0.320 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)    
(Intercept) 16.020000   0.117534   136.3   <2e-16 ***
carga        1.176000   0.006173   190.5   <2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 0.2361 on 24 degrees of freedom
Multiple R-squared:  0.9993,    Adjusted R-squared:  0.9993 
F-statistic: 3.629e+04 on 1 and 24 DF,  p-value: < 2.2e-16

De la salida de summary(modelo) se obtiene:

\[ \hat{\beta}_1=1.176000 \]

\[ S(\hat{\beta}_1)=0.006173 \]

Así que, el estadístico de prueba es: \[ t_0=\frac{1.176}{0.00617}=190.50 \]

\[ t_0=190.5 \] Este mismo valor también se ve directamente en la salida de R en la fila denominada carga.

carga 1.176000 0.006173 190.5 <2e-16 ***

El valor-p asociado es:

\[ p\text{-value}<2\times10^{-16} \]

3. Cálculo del estadístico teórico

# t teórico
qt(0.05/2, 24, lower.tail = FALSE)
[1] 2.063899

Entonces:

\[ t_{\text{teórico}}=2.063899 \] Como:

\[ |t_0| > t_{\text{teórico}} \] \[ |190.5|>2.063899 \]

se rechaza la hipótesis nula \(H_0:\beta_1=0\).

Además, el valor-p es menor que \(2\times10^{-16}\), por lo que también se cumple que:

\[ p\text{-value}<0.05 \]

Por lo tanto, existe evidencia estadísticamente significativa para afirmar que \(\beta_1\) es diferente de cero.

En términos del problema, la carga transportada tiene una influencia lineal estadísticamente significativa sobre el consumo de combustible. Además, debido a que la estimación de la pendiente es positiva (\(\hat{\beta}_1=1.176\)), un aumento en la carga está asociado con un aumento en el consumo esperado de combustible.

Inferencia sobre \(\beta_0\)

Para determinar si el intercepto del modelo es estadísticamente diferente de cero se plantean las hipótesis:

1. Planteamiento de hipótesis

\[ H_0:\beta_0=0 \]

\[ H_1:\beta_0\neq0 \]

2. Cálculo del estadístico de prueba

El estadístico de prueba utilizado es:

\[ t_0=\frac{\hat{\beta}_0}{S(\hat{\beta}_0)} \]

Este estadístico sigue una distribución \(t\) de Student con \(n-2=24\) grados de libertad.

De la salida de summary(modelo) se obtiene:

(Intercept) 16.020000 0.117534 136.3 <2e-16 ***

Entonces:

\[t_0 = \frac{\hat{\beta}_0}{S(\hat{\beta}_0)} = \frac{16.020000}{0.117534} = 136.3\] Ya tenemos: \[ t_{\text{teórico}}=2.063899 \] Entonces:

\[ |t_0| > t_{\text{teórico}} \] Como:

\[ |136.3|>2.063899 \]

se rechaza la hipótesis nula \(H_0:\beta_0=0\).

Además, el valor-p es menor que \(2\times10^{-16}\), por lo que se cumple que:

\[ p\text{-value}<0.05 \]

Por lo tanto, existe evidencia estadísticamente significativa para afirmar que el intercepto \(\beta_0\) es diferente de cero.

Intervalos de confianza

Como complemento de las pruebas de hipótesis, se calculan intervalos de confianza del 95% para los parámetros del modelo.

Para un parámetro \(\beta_j\), el intervalo de confianza se expresa como:

\[ \hat{\beta}_j \pm t_{1-\frac{\alpha}{2},n-2}S(\hat{\beta}_j) \]

En R se utiliza:

confint(modelo, level = 0.95)
                2.5 %    97.5 %
(Intercept) 15.777422 16.262578
carga        1.163259  1.188741

El intervalo de confianza del 95% para \(\beta_0\) es:

\[ 15.777422 < \beta_0 < 16.262578 \]

Mientras que el intervalo de confianza del 95% para \(\beta_1\) es:

\[ 1.163259 < \beta_1 < 1.188741 \]

En ambos casos, el valor cero no se encuentra dentro del intervalo de confianza. Esto es consistente con los resultados obtenidos mediante las pruebas de hipótesis, en las cuales se rechazaron las hipótesis nulas correspondientes.

Conclusiones

A partir del modelo de regresión lineal simple estimado se obtuvo la ecuación:

\[ \boxed{\hat{Y}=16.020+1.176X} \]

La inferencia mediante ANOVA permitió rechazar la hipótesis nula \(H_0:\beta_1=0\), debido a que el estadístico de prueba obtenido fue \(F_0=36291\), superior al valor crítico \(F_{\text{teórico}}=4.259677\). Además, el valor-p fue menor que \(2.2\times10^{-16}\).

Por lo tanto, existe evidencia estadísticamente significativa de una relación lineal entre la carga transportada y el consumo de combustible.

La prueba individual sobre la pendiente también permitió rechazar \(H_0:\beta_1=0\), obteniéndose \(t_0=190.5\) y un valor-p menor que \(2\times10^{-16}\). Esto confirma que la carga transportada influye significativamente sobre el consumo de combustible.

La estimación de la pendiente fue \(\hat{\beta}_1=1.176\), por lo que se estima que por cada tonelada adicional de carga, el consumo esperado aumenta aproximadamente 1.176 L/100 km.

Por otra parte, la prueba sobre el intercepto permitió rechazar \(H_0:\beta_0=0\), con un estadístico \(t_0=136.3\) y un valor-p menor que \(2\times10^{-16}\).

Finalmente, los intervalos de confianza del 95% obtenidos para \(\beta_0\) y \(\beta_1\) no contienen el valor cero, lo cual es consistente con las pruebas de hipótesis realizadas.