1. Planteamiento del problema

Un Data scientest ha diseñado un modelo de analítica prescriptiva para reducir el tiempo de fallas de las máquinas de un proceso de elaboración de galletas. El científico ha validado efectivamente su modelo de analítica contra la información del sistema de mantenimiento empleado en el centro de atención por lo que ahora se encuentra concentrado en probar tres alternativas de mejora que ha diseñado para concluir cuál de ellas debería implementar. En la tabla siguiente se muestran 30 réplicas tanto del modelo de mantenimiento actual y las tres diferentes propuestas de mejora que ha logrado proponer. Con base en esta información y mostrando todo el procedimiento respectivo que sustente su respuesta indique cual debe ser la conclusión del científico. ¿Qué propuesta debería implementarse? (Considere un nivel de significancia de 5%)

  arbol <-c(23.81,  22.13,  22.64,  21.69,  23.58,  22.14,  18.73,  21.59,
            20.36,  20.53,  20.11,  20.34,  19.19,  22.92,  18.65,  20.6,
            19.83,  20.09,  19.43,  22.06,  21.15,  19.26,  18.08,  20.24,
            18.75,  20.69,  21.62,  23.69,  23.93,  23.19)
  
  redes <-c(23.24,  20.08,  18.01,  23.28,  19.23,  21.22,  21.47,  20.6,
           21.11,   21.27,  21.03,  17.34,  22.8,   21.85,  17.85,  23.15,
           19.57,   19.56,  20.79,  18.04,  20.95,  21.83,  18.17,  22.66,
           18.29,   18.89,  19.49,  19.19,  26.47,  25.25)
  
  regresion <-c(16.13,  17.84,  18.28,  15.61,  17.62,  16.12,  17.29,  16.13,
                16.64,  15.03,  18.16,  16.82,  17.44,  16.76,  17.26,  15.55,
                17.49,  18.42,  17.54,  17.13,  15.5,    16.8,  18.47,  18.42, 
                18.43,  15.56,  16.03,  15.39,  15.12, 17.77)
  
  actual <-c(17.09, 15.77,  18.45,  16.55,  22.23,  22.11,  18.26,  18.04,  
             19.66, 19.76,  18.74,  19.02,  18.54,  16.7,   17.57,  19.89,
             19.06, 18.7,   19.39,  19.68,  19.2,   16.85,  19.91,  19.82,  18.08,
             19.38, 20.3,   21.6,   23.39,  19.33)
  
  
  data2  <- data.frame(ÁrbolC =arbol, Red_N = redes, Regresion = regresion, SActual = actual)
  
  data2
##    ÁrbolC Red_N Regresion SActual
## 1   23.81 23.24     16.13   17.09
## 2   22.13 20.08     17.84   15.77
## 3   22.64 18.01     18.28   18.45
## 4   21.69 23.28     15.61   16.55
## 5   23.58 19.23     17.62   22.23
## 6   22.14 21.22     16.12   22.11
## 7   18.73 21.47     17.29   18.26
## 8   21.59 20.60     16.13   18.04
## 9   20.36 21.11     16.64   19.66
## 10  20.53 21.27     15.03   19.76
## 11  20.11 21.03     18.16   18.74
## 12  20.34 17.34     16.82   19.02
## 13  19.19 22.80     17.44   18.54
## 14  22.92 21.85     16.76   16.70
## 15  18.65 17.85     17.26   17.57
## 16  20.60 23.15     15.55   19.89
## 17  19.83 19.57     17.49   19.06
## 18  20.09 19.56     18.42   18.70
## 19  19.43 20.79     17.54   19.39
## 20  22.06 18.04     17.13   19.68
## 21  21.15 20.95     15.50   19.20
## 22  19.26 21.83     16.80   16.85
## 23  18.08 18.17     18.47   19.91
## 24  20.24 22.66     18.42   19.82
## 25  18.75 18.29     18.43   18.08
## 26  20.69 18.89     15.56   19.38
## 27  21.62 19.49     16.03   20.30
## 28  23.69 19.19     15.39   21.60
## 29  23.93 26.47     15.12   23.39
## 30  23.19 25.25     17.77   19.33

2. Analisis descriptivo

  tablaestadistica <- data.frame(
    Media = sapply(data2, mean),
    Mediana = sapply(data2, median),
    Desviacion_Estandar = sapply(data2, sd),
    Minimo = sapply(data2, min),
    Maximo = sapply(data2, max)
  )
  tablaestadistica
##              Media Mediana Desviacion_Estandar Minimo Maximo
## ÁrbolC    21.03400  20.645            1.705609  18.08  23.93
## Red_N     20.75600  20.870            2.224344  17.34  26.47
## Regresion 16.89167  16.975            1.103312  15.03  18.47
## SActual   19.10233  19.130            1.729648  15.77  23.39

Según la tabla, el sistema actual presenta una media de 19.10, mientras que la alternativa de regresión registra una media de 16.89, siendo esta la más baja entre las alternativas y la que presenta la menor dispersión de los datos.

3. Comparación gráfica

    boxplot(
      data2,
      main= "Distribución de los tiempos de falla",
      xlab= "Alternativa",
      ylab= "Tiempo de falla"
      )

El gráfico indica que el método de regresión presenta los valores más bajos.

4. Planteamiento de la hipótesis

El objetivo principal es determinar si alguna de las propuestas logra reducir el tiempo promedio de falla respecto al sistema actual.

Para cada propuesta se realizará una prueba de hipótesis.

La hipótesis nula representa la situación en la que la propuesta no consigue reducir el tiempo promedio:

H0:μpropuesta≥μactual

La hipótesis alternativa representa la situación que queremos comprobar:

H1:μpropuesta<μactual

Como el objetivo es determinar si el tiempo de falla disminuye, la prueba será de una cola hacia la izquierda.

Se utilizará un nivel de significancia de:

alpha <- 0.05

alpha
## [1] 0.05

El criterio de decisión será el siguiente:

Si p-value < 0.05, se rechaza la hipótesis nula. Si p-value >= 0.05, no se rechaza la hipótesis nula. En términos prácticos, un p-value menor a 0.05 indicará que existe evidencia estadística suficiente para afirmar que la propuesta reduce el tiempo promedio de falla.

5. Pruebas de hipótesis

Para comparar las medias de las propuestas con el sistema actual se utilizará una prueba t de comparación de medias mediante la función t.test() de R.

La opción alternative = “less” permite evaluar específicamente si la primera media es menor que la segunda.

5.1. Árbol de clasificación frente al sistema actual

prueba_arbol <- t.test(
  arbol,
  actual,
  alternative = "less"
)

prueba_arbol
## 
##  Welch Two Sample t-test
## 
## data:  arbol and actual
## t = 4.3555, df = 57.989, p-value = 1
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf 2.673004
## sample estimates:
## mean of x mean of y 
##  21.03400  19.10233

El p-value obtenido es aproximadamente 1, por lo que es mayor que 0.05.

Por lo tanto, no se rechaza la hipótesis nula.

No existe evidencia estadística suficiente para afirmar que el árbol de clasificación reduzca el tiempo promedio de falla respecto al sistema actual.

Además, su media es superior a la del sistema actual, por lo que tampoco presenta una ventaja desde el punto de vista descriptivo.

5.2. Redes neuronales vs sistema actual

prueba_redes <- t.test(
  redes,
  actual,
  alternative = "less"
)

prueba_redes
## 
##  Welch Two Sample t-test
## 
## data:  redes and actual
## t = 3.2145, df = 54.681, p-value = 0.9989
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf 2.514425
## sample estimates:
## mean of x mean of y 
##  20.75600  19.10233

El p-value es superior a 0.05, por lo que no se rechaza la hipótesis nula.

Por lo tanto, no existe evidencia estadística suficiente para afirmar que las redes neuronales reduzcan el tiempo promedio de falla respecto al sistema actual.

Además, su promedio es superior al correspondiente al sistema actual.

5.2. Regresión vs sistema actual

prueba_regresion <- t.test(
  regresion,
  actual,
  alternative = "less"
)

prueba_regresion
## 
##  Welch Two Sample t-test
## 
## data:  regresion and actual
## t = -5.902, df = 49.248, p-value = 1.63e-07
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf -1.58275
## sample estimates:
## mean of x mean of y 
##  16.89167  19.10233

Según el p- value obtenido es 0.000000163 es menor que 0.05, por lo tanto, se rechaza la hipótesis nula.

Existe evidencia estadísticamente significativa para afirmar que los métodos de regresión presentan un tiempo promedio de falla menor que el sistema actual

6. Comparación general de las alternativas

resultados <- data.frame(
  Alternativa = c(
    "Árbol de clasificación",
    "Redes neuronales",
    "Métodos de regresión"
  ),
  
  Media = c(
    mean(arbol),
    mean(redes),
    mean(regresion)
  ),
  
  Media_actual = mean(actual),
  
  Diferencia = c(
    mean(arbol) - mean(actual),
    mean(redes) - mean(actual),
    mean(regresion) - mean(actual)
  ),
  
  P_value = c(
    prueba_arbol$p.value,
    prueba_redes$p.value,
    prueba_regresion$p.value
  ),
  
  Decision = c(
    ifelse(
      prueba_arbol$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    ),
    
    ifelse(
      prueba_redes$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    ),
    
    ifelse(
      prueba_regresion$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    )
  )
)

knitr::kable(
  resultados,
  digits = 5,
  caption = "Resultados de las pruebas de hipótesis"
)
Resultados de las pruebas de hipótesis
Alternativa Media Media_actual Diferencia P_value Decision
Árbol de clasificación 21.03400 19.10233 1.93167 0.99997 No rechazar H0
Redes neuronales 20.75600 19.10233 1.65367 0.99890 No rechazar H0
Métodos de regresión 16.89167 19.10233 -2.21067 0.00000 Rechazar H0

La diferencia se calculó como:

Diferencia=Media de la propuesta−Media del sistema actual

Por lo tanto, un valor negativo representa una reducción del tiempo de falla respecto al sistema actual.

Los resultados muestran que únicamente los métodos de regresión presentan una diferencia negativa acompañada de un p-value menor a 0.05.

7. Conclusiones

A partir del análisis realizado se pueden establecer las siguientes conclusiones:

1. El sistema actual presenta un tiempo promedio de falla de aproximadamente 19.10 unidades.

2. El árbol de clasificación presenta un promedio de aproximadamente 21.03 unidades, superior al sistema actual.

3. Las redes neuronales presentan un promedio de aproximadamente 20.76 unidades, también superior al sistema   actual.

4. Los métodos de regresión presentan el menor tiempo promedio, con aproximadamente 16.89 unidades.

5. Las pruebas de hipótesis muestran que ni el árbol de clasificación ni las redes neuronales presentan evidencia estadística suficiente para afirmar que reducen el tiempo de falla.

6. En el caso de los métodos de regresión, el p-value es menor que 0.05, por lo que se rechaza la hipótesis nula.

7. La reducción promedio obtenida mediante los métodos de regresión es de aproximadamente 2.21 unidades, equivalente a un 11.57%.

En consecuencia, considerando un nivel de significancia del 5%, se recomienda implementar la propuesta basada en métodos de regresión, debido a que es la única alternativa que presenta una reducción estadísticamente significativa del tiempo promedio de falla respecto al sistema actual.