En este parcial se estudia la inferencia estadística aplicada a modelos de regresión lineal simple y múltiple. Se utilizan pruebas de hipótesis, estadísticos teóricos y valores p para determinar la existencia de relaciones significativas entre las variables.
Datos
Los datos utilizados para realizar el análisis de regresión lineal múltiple son los siguientes:
Lote
Tiempo de producción
Tamaño
Número de Operarios
Preparación
1
138
80
2
25
2
132
100
3
20
3
151
120
3
30
4
149
150
4
25
5
174
180
4
35
6
169
200
5
30
7
190
220
5
40
8
187
250
6
35
9
211
280
6
45
10
204
300
7
40
11
225
320
7
50
12
221
350
8
45
13
243
380
8
55
14
235
400
9
50
15
263
450
9
60
Ejercicio de regresión lineal simple
La situación relaciona:
Variable respuesta: Consumo de energía (Y).
Variable regresora: Temperatura (X).
Modelo: \(Y=\beta_0+\beta_1X+\varepsilon\).
library(readxl)
Warning: package 'readxl' was built under R version 4.5.3
datos <-read_excel("datos.xlsx", sheet ="Hoja1")# VariablesConsumodeenergía <- datos$`Consumo de energía`Temperaturadeoperación <- datos$`Temperatura de operación`
Modelo y código completo
library(readxl)datos <-read_excel("datos.xlsx", sheet ="Hoja1")# VariablesConsumodeenergía <- datos$`Consumo de energía`Temperaturadeoperación <- datos$`Temperatura de operación`# Modelomodelo <-lm(Consumodeenergía ~ Temperaturadeoperación)summary(modelo)
Call:
lm(formula = Consumodeenergía ~ Temperaturadeoperación)
Residuals:
Min 1Q Median 3Q Max
-2.10996 -0.68499 0.01146 0.81501 1.58990
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 47.02400 1.32753 35.42 2.57e-14 ***
Temperaturadeoperación 1.87858 0.04601 40.83 4.11e-15 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 1.087 on 13 degrees of freedom
Multiple R-squared: 0.9923, Adjusted R-squared: 0.9917
F-statistic: 1667 on 1 and 13 DF, p-value: 4.113e-15
# ANOVAanova <-aov(modelo)summary(anova)
Df Sum Sq Mean Sq F value Pr(>F)
Temperaturadeoperación 1 1970.6 1970.6 1667 4.11e-15 ***
Residuals 13 15.4 1.2
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Para determinar si existe una relación lineal significativa entre la temperatura de operación y el consumo de energía, se utiliza la prueba F.
Las hipótesis son:
\[
H_0:\beta_1=0
\]
\[
H_1:\beta_1\neq0
\]
Con un nivel de significancia de \(\alpha=0.05\), los grados de libertad son:
Grados de libertad del numerador: 1.
Grados de libertad del denominador: 13.
El estadístico F teórico se obtiene mediante:
qf(0.05, 1, 13, lower.tail =FALSE)
[1] 4.667193
El resultado es aproximadamente:
\[
F_{teórico}=4.66
\]
Por lo tanto, la respuesta es:
4.66
Pregunta 2
El valor p obtenido para la prueba F del modelo de regresión lineal simple es:
\[
p=4.11\times10^{-15}
\]
Como:
\[
p<0.05
\]
se rechaza la hipótesis nula.
Por lo tanto, existe evidencia estadística suficiente para afirmar que la temperatura de operación tiene una relación lineal significativa con el consumo de energía.
Respuesta:
\[
\boxed{4.11\times10^{-15}}
\]
Pregunta 3
Si se realiza el Análisis de Varianza, con \(\alpha=0.05\) para el modelo que relaciona las variables de la situación problema, comparando el estadístico de prueba y el estadístico teórico se podría concluir que:
Pregunta 3
Se tienen las siguientes hipótesis:
\[
H_0:\beta_1=0
\]
\[
H_1:\beta_1\neq0
\]
Los valores obtenidos son:
\[
F_0=1667.00
\]
y
\[
F_{teórico}=4.66
\]
Como:
\[
1667.00>4.66
\]
se rechaza \(H_0\).
Por lo tanto, existe evidencia estadística suficiente para concluir que \(\beta_1\neq0\) y que existe una relación lineal entre la temperatura de operación y el consumo de energía.
Respuesta: a. Se rechaza\(H_0\), \(\beta_1\neq0\), por lo tanto existe una relación lineal.
Pregunta 4
Para realizar la inferencia sobre el parámetro \(\beta_1\) se utiliza la distribución t de Student.
Los grados de libertad son:
\[
gl=n-2=15-2=13
\]
Con \(\alpha=0.05\), para una prueba bilateral se utiliza:
qt(0.05/2, 13, lower.tail =FALSE)
[1] 2.160369
El resultado es:
\[
t_{teórico}=2.16
\]
Por lo tanto:
Respuesta: 2.16
Pregunta 5
Para el intercepto \(\beta_0\), el estadístico calculado es aproximadamente:
\[
t_0=35.42
\]
El valor p obtenido es:
\[
p=2.57\times10^{-14}
\]
Como:
\[
p<0.05
\]
se rechaza la hipótesis nula para \(\beta_0\).
Por lo tanto:
\[
\boxed{p=2.57\times10^{-14}}
\]
Pregunta 6
Si se realiza la inferencia sobre el parámetro \(\beta_1\), con \(\alpha=0.05\), comparando el estadístico de prueba y el estadístico teórico se podría concluir que:
Pregunta 6
Para el parámetro \(\beta_1\) se plantean las hipótesis:
\[
H_0:\beta_1=0
\]
\[
H_1:\beta_1\neq0
\]
El estadístico calculado es aproximadamente:
\[
t_0=40.83
\]
y el valor p es:
\[
p=4.11\times10^{-15}
\]
Como:
\[
p<0.05
\]
se rechaza \(H_0\).
Por lo tanto, existe evidencia estadística suficiente para concluir que \(\beta_1\neq0\) y que existe una relación lineal significativa entre la temperatura y el consumo de energía.
Respuesta: d. Se rechaza\(H_0\) y existe una relación lineal significativa.
Regresión lineal múltiple
Para esta parte se analiza la relación entre el Tiempo de producción y las variables Tamaño del lote, Número de operarios y Preparación.
Call:
lm(formula = Tiempoderoducción ~ Tamañodelote + Numerodeoperarios +
Preparación)
Residuals:
Min 1Q Median 3Q Max
-3.1687 -0.7694 0.5379 0.9721 2.6565
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 77.77270 5.69990 13.645 3.08e-08 ***
Tamañodelote 0.14548 0.07542 1.929 0.08 .
Numerodeoperarios 0.95276 2.80055 0.340 0.74
Preparación 1.86935 0.24094 7.759 8.73e-06 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 1.823 on 11 degrees of freedom
Multiple R-squared: 0.9984, Adjusted R-squared: 0.998
F-statistic: 2287 on 3 and 11 DF, p-value: 1.185e-15
El modelo de regresión lineal múltiple permite explicar el Tiempo de producción a partir del Tamaño del lote, el Número de operarios y el tiempo de Preparación.
El análisis ANOVA permite determinar si el modelo de regresión es estadísticamente significativo. La prueba se basa en el estadístico \(F\) y su respectivo valor p.
Los intervalos de confianza permiten estimar el rango en el cual se encuentran los parámetros poblacionales del modelo con un nivel de confianza del 95%.
Pregunta 7
El coeficiente correspondiente al Tamaño del lote es:
\[
\hat{\beta}_1=0.14547677
\]
Con dos cifras decimales truncadas:
\[
\hat{\beta}_1=0.14
\]
Esto significa que, manteniendo constantes las demás variables, por cada unidad adicional en el tamaño del lote, el tiempo de producción aumenta aproximadamente en 0.14 unidades de tiempo.
Respuesta: 0.14
Pregunta 8
El error cuadrático medio obtenido para el modelo es aproximadamente: \[
SSE = SS_Residuals
\]\[
SSE = 37
\]\[
DFE= n-(k+1)
\]
Este valor representa la variabilidad promedio de los errores del modelo.
Respuesta: 3.36
Pregunta 9
El estadístico \(F\) teórico calculado para la regresión lineal múltiple es:
\[
F_{teórico}=3.58
\]
Respuesta: 3.58
Pregunta 10
Si se realiza la inferencia sobre el modelo completo, se podría concluir que:
Pregunta 10
De acuerdo con el análisis realizado, el modelo de regresión lineal múltiple presenta evidencia estadística suficiente para afirmar que las variables Tamaño del lote, Número de operarios y Preparación explican significativamente el Tiempo de producción.
Respuesta: b. El modelo de regresión es significativo.
Conclusión
El modelo de regresión lineal múltiple permite explicar el tiempo de producción a partir del tamaño del lote, el número de operarios y la preparación. Los resultados del ANOVA muestran que el modelo es estadísticamente significativo, ya que el estadístico \(F\) calculado es considerablemente mayor que el valor crítico y el valor p es muy pequeño. Por lo tanto, las variables incluidas aportan información relevante para explicar el comportamiento del tiempo de producción.