Mejora Parcial 2

Integrante:

  • MIGUEL ANDRES TURIZO BARRIOS

Introducción

En este parcial se estudia la inferencia estadística aplicada a modelos de regresión lineal simple y múltiple. Se utilizan pruebas de hipótesis, estadísticos teóricos y valores p para determinar la existencia de relaciones significativas entre las variables.

Datos

Los datos utilizados para realizar el análisis de regresión lineal múltiple son los siguientes:

Lote Tiempo de producción Tamaño Número de Operarios Preparación
1 138 80 2 25
2 132 100 3 20
3 151 120 3 30
4 149 150 4 25
5 174 180 4 35
6 169 200 5 30
7 190 220 5 40
8 187 250 6 35
9 211 280 6 45
10 204 300 7 40
11 225 320 7 50
12 221 350 8 45
13 243 380 8 55
14 235 400 9 50
15 263 450 9 60

Ejercicio de regresión lineal simple

La situación relaciona:

  • Variable respuesta: Consumo de energía (Y).
  • Variable regresora: Temperatura (X).
  • Modelo: \(Y=\beta_0+\beta_1X+\varepsilon\).
library(readxl)
Warning: package 'readxl' was built under R version 4.5.3
datos <- read_excel("datos.xlsx", sheet = "Hoja1")

# Variables
Consumodeenergía <- datos$`Consumo de energía`
Temperaturadeoperación <- datos$`Temperatura de operación`

Modelo y código completo

library(readxl)

datos <- read_excel("datos.xlsx", sheet = "Hoja1")

# Variables
Consumodeenergía <- datos$`Consumo de energía`
Temperaturadeoperación <- datos$`Temperatura de operación`

# Modelo
modelo <- lm(Consumodeenergía ~ Temperaturadeoperación)
summary(modelo)

Call:
lm(formula = Consumodeenergía ~ Temperaturadeoperación)

Residuals:
     Min       1Q   Median       3Q      Max 
-2.10996 -0.68499  0.01146  0.81501  1.58990 

Coefficients:
                       Estimate Std. Error t value Pr(>|t|)    
(Intercept)            47.02400    1.32753   35.42 2.57e-14 ***
Temperaturadeoperación  1.87858    0.04601   40.83 4.11e-15 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 1.087 on 13 degrees of freedom
Multiple R-squared:  0.9923,    Adjusted R-squared:  0.9917 
F-statistic:  1667 on 1 and 13 DF,  p-value: 4.113e-15
# ANOVA
anova <- aov(modelo)
summary(anova)
                       Df Sum Sq Mean Sq F value   Pr(>F)    
Temperaturadeoperación  1 1970.6  1970.6    1667 4.11e-15 ***
Residuals              13   15.4     1.2                     
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
# Ajustados
ajustados <- modelo$fitted.values
ajustados
        1         2         3         4         5         6         7         8 
 80.83847  84.59563  86.47421  90.23138  92.10996  93.98854  97.74570  99.62428 
        9        10        11        12        13        14        15 
103.38145 105.26003 107.13861 110.89577 112.77436 116.53152 118.41010 
# Residuales
residuales <- modelo$residuals
residuales
          1           2           3           4           5           6 
 1.16153295  0.40436963  0.52578797  0.76862464 -2.10995702  0.01146132 
          7           8           9          10          11          12 
-0.74570201 -0.62428367 -0.38144699 -1.26002865  0.86138968 -0.89577364 
         13          14          15 
 1.22564470 -0.53151862  1.58989971 
# F TEÓRICO
qf(0.05, 1, 13, lower.tail = FALSE)
[1] 4.667193
# T TEÓRICO
qt(0.05 / 2, 13, lower.tail = FALSE)
[1] 2.160369
# CONFIANZA
confint(modelo, level = 0.95)
                           2.5 %    97.5 %
(Intercept)            44.156036 49.891958
Temperaturadeoperación  1.779181  1.977982

Pregunta 1

Para determinar si existe una relación lineal significativa entre la temperatura de operación y el consumo de energía, se utiliza la prueba F.

Las hipótesis son:

\[ H_0:\beta_1=0 \]

\[ H_1:\beta_1\neq0 \]

Con un nivel de significancia de \(\alpha=0.05\), los grados de libertad son:

  • Grados de libertad del numerador: 1.
  • Grados de libertad del denominador: 13.

El estadístico F teórico se obtiene mediante:

qf(0.05, 1, 13, lower.tail = FALSE)
[1] 4.667193

El resultado es aproximadamente:

\[ F_{teórico}=4.66 \]

Por lo tanto, la respuesta es:

4.66


Pregunta 2

El valor p obtenido para la prueba F del modelo de regresión lineal simple es:

\[ p=4.11\times10^{-15} \]

Como:

\[ p<0.05 \]

se rechaza la hipótesis nula.

Por lo tanto, existe evidencia estadística suficiente para afirmar que la temperatura de operación tiene una relación lineal significativa con el consumo de energía.

Respuesta:

\[ \boxed{4.11\times10^{-15}} \]


Pregunta 3

Si se realiza el Análisis de Varianza, con \(\alpha=0.05\) para el modelo que relaciona las variables de la situación problema, comparando el estadístico de prueba y el estadístico teórico se podría concluir que:

Pregunta 3

Se tienen las siguientes hipótesis:

\[ H_0:\beta_1=0 \]

\[ H_1:\beta_1\neq0 \]

Los valores obtenidos son:

\[ F_0=1667.00 \]

y

\[ F_{teórico}=4.66 \]

Como:

\[ 1667.00>4.66 \]

se rechaza \(H_0\).

Por lo tanto, existe evidencia estadística suficiente para concluir que \(\beta_1\neq0\) y que existe una relación lineal entre la temperatura de operación y el consumo de energía.

Respuesta: a. Se rechaza \(H_0\), \(\beta_1\neq0\), por lo tanto existe una relación lineal.


Pregunta 4

Para realizar la inferencia sobre el parámetro \(\beta_1\) se utiliza la distribución t de Student.

Los grados de libertad son:

\[ gl=n-2=15-2=13 \]

Con \(\alpha=0.05\), para una prueba bilateral se utiliza:

qt(0.05 / 2, 13, lower.tail = FALSE)
[1] 2.160369

El resultado es:

\[ t_{teórico}=2.16 \]

Por lo tanto:

Respuesta: 2.16


Pregunta 5

Para el intercepto \(\beta_0\), el estadístico calculado es aproximadamente:

\[ t_0=35.42 \]

El valor p obtenido es:

\[ p=2.57\times10^{-14} \]

Como:

\[ p<0.05 \]

se rechaza la hipótesis nula para \(\beta_0\).

Por lo tanto:

\[ \boxed{p=2.57\times10^{-14}} \]


Pregunta 6

Si se realiza la inferencia sobre el parámetro \(\beta_1\), con \(\alpha=0.05\), comparando el estadístico de prueba y el estadístico teórico se podría concluir que:

Pregunta 6

Para el parámetro \(\beta_1\) se plantean las hipótesis:

\[ H_0:\beta_1=0 \]

\[ H_1:\beta_1\neq0 \]

El estadístico calculado es aproximadamente:

\[ t_0=40.83 \]

y el valor p es:

\[ p=4.11\times10^{-15} \]

Como:

\[ p<0.05 \]

se rechaza \(H_0\).

Por lo tanto, existe evidencia estadística suficiente para concluir que \(\beta_1\neq0\) y que existe una relación lineal significativa entre la temperatura y el consumo de energía.

Respuesta: d. Se rechaza \(H_0\) y existe una relación lineal significativa.


Regresión lineal múltiple

Para esta parte se analiza la relación entre el Tiempo de producción y las variables Tamaño del lote, Número de operarios y Preparación.

Datos

Lote Tiempo producción Tamaño Número de Operarios Preparación
1 138 80 2 25
2 132 100 3 30
3 151 120 3 30
4 149 150 4 25
5 174 180 4 35
6 169 200 5 30
7 190 220 5 40
8 187 250 6 35
9 211 280 6 45
10 204 300 7 40
11 225 320 7 50
12 221 350 8 45
13 243 380 8 55
14 235 400 9 50
15 263 450 9 60

Carga de los datos desde Excel

library(readxl)

Datos2 <- read_excel(
  "C:/Users/migue/OneDrive/Escritorio/PARCIAL RECUPERACION/Datos2.xlsx",
  sheet = "Hoja1"
)

Datos2
# A tibble: 15 × 5
    Lote `Tiempo producción` Tamaño `Número de Operarios` Preparación
   <dbl>               <dbl>  <dbl>                 <dbl>       <dbl>
 1     1                 138     80                     2          25
 2     2                 132    100                     3          20
 3     3                 151    120                     3          30
 4     4                 149    150                     4          25
 5     5                 174    180                     4          35
 6     6                 169    200                     5          30
 7     7                 190    220                     5          40
 8     8                 187    250                     6          35
 9     9                 211    280                     6          45
10    10                 204    300                     7          40
11    11                 225    320                     7          50
12    12                 221    350                     8          45
13    13                 243    380                     8          55
14    14                 235    400                     9          50
15    15                 263    450                     9          60

Definición de las variables

Tiempoderoducción <- Datos2$`Tiempo producción`
Tamañodelote <- Datos2$Tamaño
Numerodeoperarios <- Datos2$`Número de Operarios`
Preparación <- Datos2$Preparación

Construcción del modelo de regresión lineal múltiple

modelo2 <- lm(
  Tiempoderoducción ~ Tamañodelote + Numerodeoperarios + Preparación
)

summary(modelo2)

Call:
lm(formula = Tiempoderoducción ~ Tamañodelote + Numerodeoperarios + 
    Preparación)

Residuals:
    Min      1Q  Median      3Q     Max 
-3.1687 -0.7694  0.5379  0.9721  2.6565 

Coefficients:
                  Estimate Std. Error t value Pr(>|t|)    
(Intercept)       77.77270    5.69990  13.645 3.08e-08 ***
Tamañodelote       0.14548    0.07542   1.929     0.08 .  
Numerodeoperarios  0.95276    2.80055   0.340     0.74    
Preparación        1.86935    0.24094   7.759 8.73e-06 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 1.823 on 11 degrees of freedom
Multiple R-squared:  0.9984,    Adjusted R-squared:  0.998 
F-statistic:  2287 on 3 and 11 DF,  p-value: 1.185e-15

El modelo de regresión lineal múltiple permite explicar el Tiempo de producción a partir del Tamaño del lote, el Número de operarios y el tiempo de Preparación.

La ecuación estimada del modelo es:

\[ \hat{Y}=77.7727+0.1455X_1+0.9528X_2+1.8694X_3 \]

Donde:

  • \(Y\): Tiempo de producción.
  • \(X_1\): Tamaño del lote.
  • \(X_2\): Número de operarios.
  • \(X_3\): Preparación.

Análisis de varianza ANOVA

anova2 <- aov(modelo2)

summary(anova2)
                  Df Sum Sq Mean Sq F value   Pr(>F)    
Tamañodelote       1  22174   22174  6670.9  < 2e-16 ***
Numerodeoperarios  1    434     434   130.6 1.92e-07 ***
Preparación        1    200     200    60.2 8.73e-06 ***
Residuals         11     37       3                     
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El análisis ANOVA permite determinar si el modelo de regresión es estadísticamente significativo. La prueba se basa en el estadístico \(F\) y su respectivo valor p.

Valores ajustados

valores_ajustados <- fitted(modelo2)

valores_ajustados
       1        2        3        4        5        6        7        8 
138.0501 132.5657 154.1687 150.1390 173.1968 167.7124 189.3154 185.2857 
       9       10       11       12       13       14       15 
208.3435 202.8591 224.4621 220.4324 243.4902 238.0058 263.9731 

Los valores ajustados corresponden a los tiempos de producción estimados por el modelo para cada observación.

Residuos

residuos <- residuals(modelo2)

residuos
          1           2           3           4           5           6 
-0.05012225 -0.56566539 -3.16870416 -1.13901502  0.80317848  1.28763535 
          7           8           9          10          11          12 
 0.68459658  1.71428571  2.65647922  1.14093608  0.53789731  0.56758645 
         13          14          15 
-0.49022005 -3.00576319 -0.97310513 

Los residuos representan la diferencia entre los valores observados y los valores estimados por el modelo.

Estadístico F teórico

Para la regresión lineal múltiple se tienen 3 variables explicativas y 11 grados de libertad para el error.

F_teorico <- qf(0.05, 3, 11, lower.tail = FALSE)

F_teorico
[1] 3.587434

El valor obtenido es aproximadamente:

\[ F_{teórico}=3.58 \]

Intervalos de confianza de los parámetros

confint(modelo2, level = 0.95)
                        2.5 %     97.5 %
(Intercept)       65.22730443 90.3181025
Tamañodelote      -0.02053134  0.3114849
Numerodeoperarios -5.21121801  7.1167367
Preparación        1.33905023  2.3996504

Los intervalos de confianza permiten estimar el rango en el cual se encuentran los parámetros poblacionales del modelo con un nivel de confianza del 95%.


Pregunta 7

El coeficiente correspondiente al Tamaño del lote es:

\[ \hat{\beta}_1=0.14547677 \]

Con dos cifras decimales truncadas:

\[ \hat{\beta}_1=0.14 \]

Esto significa que, manteniendo constantes las demás variables, por cada unidad adicional en el tamaño del lote, el tiempo de producción aumenta aproximadamente en 0.14 unidades de tiempo.

Respuesta: 0.14


Pregunta 8

El error cuadrático medio obtenido para el modelo es aproximadamente: \[ SSE = SS_Residuals \] \[ SSE = 37 \] \[ DFE= n-(k+1) \]

\[ n = 15 \]

\[ k = 3 \]

\[ k+1 = 4 \]

\[ DFE = 15-4 \] \[ DFE = 11 \] \[ MSE = SSE / DFE \] \[ MSE = 37/11 \]

\[ MSE = 3.36 \]

Este valor representa la variabilidad promedio de los errores del modelo.

Respuesta: 3.36


Pregunta 9

El estadístico \(F\) teórico calculado para la regresión lineal múltiple es:

\[ F_{teórico}=3.58 \]

Respuesta: 3.58


Pregunta 10

Si se realiza la inferencia sobre el modelo completo, se podría concluir que:

Pregunta 10

De acuerdo con el análisis realizado, el modelo de regresión lineal múltiple presenta evidencia estadística suficiente para afirmar que las variables Tamaño del lote, Número de operarios y Preparación explican significativamente el Tiempo de producción.

Respuesta: b. El modelo de regresión es significativo.

Conclusión

El modelo de regresión lineal múltiple permite explicar el tiempo de producción a partir del tamaño del lote, el número de operarios y la preparación. Los resultados del ANOVA muestran que el modelo es estadísticamente significativo, ya que el estadístico \(F\) calculado es considerablemente mayor que el valor crítico y el valor p es muy pequeño. Por lo tanto, las variables incluidas aportan información relevante para explicar el comportamiento del tiempo de producción.