Taller 2: Inferencia sobre el modelo de regresión lineal simple
Problema
Una empresa de logística desea determinar si la carga transportada influye significativamente en el consumo de combustible de sus camiones durante recorridos de 100 km. Para desarrollar el análisis se utilizaron 26 observaciones de carga y consumo.
Ejercicio 1
Realice la inferencia sobre el modelo de regresión lineal simple mediante el análisis de varianza (ANOVA). Plantee las hipótesis, calcule el estadístico de prueba, determine el valor crítico y establezca la conclusión correspondiente.
Paso 1. Ingreso y organización de los datos
Inicialmente, se importó la base de datos que contiene las 26 observaciones. La carga transportada se identificó como variable independiente (\(X\)), mientras que el consumo de combustible se tomó como variable dependiente (\(Y\)).
Paso 2. Creación de las variables
Después de importar la base, se asignaron en R los datos de la columna de carga a la variable carga y los valores de consumo a la variable consumo. En la imagen se observa la lectura del archivo y la selección de ambas columnas, necesarias para construir el modelo.
Paso 3. Estimación del modelo de regresión
Para estudiar la relación entre las variables se utilizó el siguiente modelo de regresión lineal simple:
\[Y_i = \beta_0 + \beta_1X_i + \varepsilon_i\]
El modelo se estimó mediante la función lm(), colocando el consumo como variable respuesta y la carga como variable explicativa. Luego se aplicó summary() para obtener los coeficientes estimados, sus errores estándar, los estadísticos t, los valores p y las medidas generales de ajuste. La imagen presenta el código utilizado y su respectiva salida.
De acuerdo con los resultados, la ecuación estimada es:
\[\boxed{\widehat{Y}=16{,}020+1{,}176X}\]
Esto indica que, por cada tonelada adicional de carga, el consumo esperado aumenta aproximadamente \(1{,}176\) L/100 km.
Paso 4. Planteamiento de las hipótesis del modelo
Para establecer si existe una relación lineal significativa entre la carga y el consumo, se plantearon las siguientes hipótesis:
\[H_0:\beta_1=0\]
\[H_1:\beta_1\neq0\]
La hipótesis nula indica que el modelo no presenta una relación lineal significativa. La hipótesis alternativa establece que la pendiente es diferente de cero y, por tanto, sí existe una relación lineal entre las variables.
Paso 5. Análisis de varianza
El ANOVA permite dividir la variabilidad total del consumo en una parte explicada por la regresión y otra atribuida al error:
\[SST=SSR+SSE\]
El estadístico utilizado para evaluar la significancia global del modelo es:
\[F_0=\frac{MSR}{MSE}\]
La tabla ANOVA se obtuvo aplicando la función aov() al modelo estimado y consultando posteriormente su resumen. En la imagen se muestra el código y la salida con los grados de libertad, sumas de cuadrados, cuadrados medios, estadístico F y valor p.
La salida muestra un estadístico calculado de aproximadamente:
\[F_0=36291\]
El valor p asociado es inferior a \(2{,}2\times10^{-16}\), por lo cual es menor que el nivel de significancia de \(0{,}05\).
Paso 6. Cálculo del estadístico F teórico
El valor crítico se calculó con la función correspondiente a la distribución F, utilizando 1 grado de libertad para la regresión, 24 grados de libertad para el error y un nivel de significancia del 5 %. En la imagen aparece la instrucción utilizada y el resultado generado por R.
El resultado obtenido fue:
\[F_{teórico}=4{,}259677\]
La siguiente captura complementa el cálculo anterior y presenta el valor generado en la consola, utilizado posteriormente para aplicar la regla de decisión.
Paso 7. Regla de decisión y conclusión
La regla de decisión consiste en rechazar la hipótesis nula cuando:
\[F_0>F_{teórico}\]
En este ejercicio:
\[36291>4{,}259677\]
Por lo tanto, se rechaza \(H_0\). Existe evidencia estadísticamente significativa para afirmar que la carga transportada mantiene una relación lineal con el consumo de combustible. En consecuencia, el modelo estimado es significativo.
Ejercicio 2
Realice la inferencia individual sobre los parámetros \(\beta_1\) y \(\beta_0\) del modelo de regresión lineal simple. Además, determine los intervalos de confianza del 95 %.
Paso 1. Inferencia sobre la pendiente
Para determinar si la pendiente es estadísticamente diferente de cero se plantearon las siguientes hipótesis:
\[H_0:\beta_1=0\]
\[H_1:\beta_1\neq0\]
El estadístico de prueba se calcula mediante:
\[t_0=\frac{\widehat{\beta}_1}{S(\widehat{\beta}_1)}\]
Sustituyendo los valores obtenidos en el resumen del modelo:
\[t_0=\frac{1{,}176000}{0{,}006173}\]
\[\boxed{t_0=190{,}5}\]
Paso 2. Cálculo del estadístico t teórico
Para una prueba bilateral, con \(\alpha=0{,}05\) y 24 grados de libertad, se utilizó la distribución t de Student. El cálculo divide el nivel de significancia entre dos porque existen dos regiones de rechazo, una en cada extremo de la distribución. El código y el resultado se encuentran en la imagen del estadístico teórico presentada anteriormente.
El resultado fue:
\[t_{teórico}=2{,}063899\]
Como \(|190{,}5|>2{,}063899\) y el valor p es menor que \(0{,}05\), se rechaza \(H_0\). La carga transportada influye significativamente sobre el consumo de combustible.
Paso 3. Inferencia sobre el intercepto
Para evaluar el intercepto se plantearon las hipótesis:
\[H_0:\beta_0=0\]
\[H_1:\beta_0\neq0\]
El estadístico se calculó de la siguiente manera:
\[t_0=\frac{\widehat{\beta}_0}{S(\widehat{\beta}_0)}\]
\[t_0=\frac{16{,}020000}{0{,}117534}\]
\[\boxed{t_0=136{,}3}\]
Como \(|136{,}3|>2{,}063899\) y el valor p es menor que \(0{,}05\), se rechaza la hipótesis nula. El intercepto es estadísticamente diferente de cero.
Paso 4. Intervalos de confianza
Finalmente, se aplicó la función confint() al modelo para calcular intervalos de confianza del 95 % para el intercepto y la pendiente. La imagen muestra tanto la instrucción utilizada como los límites inferior y superior obtenidos.
La salida completa de la consola permite verificar los límites inferior y superior calculados para cada coeficiente del modelo.
Para el intercepto se obtuvo:
\[15{,}777422<\beta_0<16{,}262578\]
Para la pendiente se obtuvo:
\[1{,}163259<\beta_1<1{,}188741\]
Ninguno de los dos intervalos contiene el valor cero. Este resultado coincide con las pruebas de hipótesis, en las cuales se concluyó que ambos parámetros son estadísticamente significativos.
Interpretación
El análisis ANOVA permitió comprobar que el modelo de regresión es globalmente significativo. De igual manera, las pruebas individuales indicaron que la pendiente y el intercepto son diferentes de cero. Por cada tonelada adicional de carga transportada, el consumo esperado aumenta aproximadamente \(1{,}176\) L/100 km. Los intervalos de confianza respaldan estas conclusiones, debido a que ninguno incluye el valor cero.