Un Data scientest ha diseñado un modelo de analítica prescriptiva para reducir el tiempo de fallas de las máquinas de un proceso de elaboración de galletas. El científico ha validado efectivamente su modelo de analítica contra la información del sistema de mantenimiento empleado en el centro de atención por lo que ahora se encuentra concentrado en probar tres alternativas de mejora que ha diseñado para concluir cuál de ellas debería implementar. En la tabla siguiente se muestran 30 réplicas tanto del modelo de mantenimiento actual y las tres diferentes propuestas de mejora que ha logrado proponer. Con base en esta información y mostrando todo el procedimiento respectivo que sustente su respuesta indique cual debe ser la conclusión del científico. ¿Qué propuesta debería implementarse? (Considere un nivel de significancia de 5%)
arbol <-c(23.81, 22.13, 22.64, 21.69, 23.58, 22.14, 18.73, 21.59,
20.36, 20.53, 20.11, 20.34, 19.19, 22.92, 18.65, 20.6,
19.83, 20.09, 19.43, 22.06, 21.15, 19.26, 18.08, 20.24,
18.75, 20.69, 21.62, 23.69, 23.93, 23.19)
redes <-c(23.24, 20.08, 18.01, 23.28, 19.23, 21.22, 21.47, 20.6,
21.11, 21.27, 21.03, 17.34, 22.8, 21.85, 17.85, 23.15,
19.57, 19.56, 20.79, 18.04, 20.95, 21.83, 18.17, 22.66,
18.29, 18.89, 19.49, 19.19, 26.47, 25.25)
regresion <-c(16.13, 17.84, 18.28, 15.61, 17.62, 16.12, 17.29, 16.13,
16.64, 15.03, 18.16, 16.82, 17.44, 16.76, 17.26, 15.55,
17.49, 18.42, 17.54, 17.13, 15.5, 16.8, 18.47, 18.42,
18.43, 15.56, 16.03, 15.39, 15.12, 17.77)
actual <-c(17.09, 15.77, 18.45, 16.55, 22.23, 22.11, 18.26, 18.04,
19.66, 19.76, 18.74, 19.02, 18.54, 16.7, 17.57, 19.89,
19.06, 18.7, 19.39, 19.68, 19.2, 16.85, 19.91, 19.82, 18.08,
19.38, 20.3, 21.6, 23.39, 19.33)
data2 <- data.frame(ÁrbolC =arbol, Red_N = redes, Regresion = regresion, SActual = actual)
data2
## ÁrbolC Red_N Regresion SActual
## 1 23.81 23.24 16.13 17.09
## 2 22.13 20.08 17.84 15.77
## 3 22.64 18.01 18.28 18.45
## 4 21.69 23.28 15.61 16.55
## 5 23.58 19.23 17.62 22.23
## 6 22.14 21.22 16.12 22.11
## 7 18.73 21.47 17.29 18.26
## 8 21.59 20.60 16.13 18.04
## 9 20.36 21.11 16.64 19.66
## 10 20.53 21.27 15.03 19.76
## 11 20.11 21.03 18.16 18.74
## 12 20.34 17.34 16.82 19.02
## 13 19.19 22.80 17.44 18.54
## 14 22.92 21.85 16.76 16.70
## 15 18.65 17.85 17.26 17.57
## 16 20.60 23.15 15.55 19.89
## 17 19.83 19.57 17.49 19.06
## 18 20.09 19.56 18.42 18.70
## 19 19.43 20.79 17.54 19.39
## 20 22.06 18.04 17.13 19.68
## 21 21.15 20.95 15.50 19.20
## 22 19.26 21.83 16.80 16.85
## 23 18.08 18.17 18.47 19.91
## 24 20.24 22.66 18.42 19.82
## 25 18.75 18.29 18.43 18.08
## 26 20.69 18.89 15.56 19.38
## 27 21.62 19.49 16.03 20.30
## 28 23.69 19.19 15.39 21.60
## 29 23.93 26.47 15.12 23.39
## 30 23.19 25.25 17.77 19.33
tablaestadistica <- data.frame(
Media = sapply(data2, mean),
Mediana = sapply(data2, median),
Desviacion_Estandar = sapply(data2, sd),
Minimo = sapply(data2, min),
Maximo = sapply(data2, max)
)
tablaestadistica
## Media Mediana Desviacion_Estandar Minimo Maximo
## ÁrbolC 21.03400 20.645 1.705609 18.08 23.93
## Red_N 20.75600 20.870 2.224344 17.34 26.47
## Regresion 16.89167 16.975 1.103312 15.03 18.47
## SActual 19.10233 19.130 1.729648 15.77 23.39
Según la tabla, el sistema actual presenta una media de 19.10, mientras que la alternativa de regresión registra una media de 16.89, siendo esta la más baja entre las alternativas y la que presenta la menor dispersión de los datos.
boxplot(
data2,
main= "Distribución de los tiempos de falla",
xlab= "Alternativa",
ylab= "Tiempo de falla"
)
El gráfico indica que el método de regresión presenta los valores más bajos.
El objetivo principal es determinar si alguna de las propuestas logra reducir el tiempo promedio de falla respecto al sistema actual.
Para cada propuesta se realizará una prueba de hipótesis.
La hipótesis nula representa la situación en la que la propuesta no consigue reducir el tiempo promedio:
H0:μpropuesta≥μactual
La hipótesis alternativa representa la situación que queremos comprobar:
H1:μpropuesta<μactual
Como el objetivo es determinar si el tiempo de falla disminuye, la prueba será de una cola hacia la izquierda.
Se utilizará un nivel de significancia de:
alpha <- 0.05
alpha
## [1] 0.05
El criterio de decisión será el siguiente:
Si p-value < 0.05, se rechaza la hipótesis nula. Si p-value >= 0.05, no se rechaza la hipótesis nula. En términos prácticos, un p-value menor a 0.05 indicará que existe evidencia estadística suficiente para afirmar que la propuesta reduce el tiempo promedio de falla.
Para comparar las medias de las propuestas con el sistema actual se utilizará una prueba t de comparación de medias mediante la función t.test() de R.
La opción alternative = “less” permite evaluar específicamente si la primera media es menor que la segunda.
prueba_arbol <- t.test(
arbol,
actual,
alternative = "less"
)
prueba_arbol
##
## Welch Two Sample t-test
##
## data: arbol and actual
## t = 4.3555, df = 57.989, p-value = 1
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf 2.673004
## sample estimates:
## mean of x mean of y
## 21.03400 19.10233
El p-value obtenido es aproximadamente 1, por lo que es mayor que 0.05.
Por lo tanto, no se rechaza la hipótesis nula.
No existe evidencia estadística suficiente para afirmar que el árbol de clasificación reduzca el tiempo promedio de falla respecto al sistema actual.
Además, su media es superior a la del sistema actual, por lo que tampoco presenta una ventaja desde el punto de vista descriptivo.
prueba_redes <- t.test(
redes,
actual,
alternative = "less"
)
prueba_redes
##
## Welch Two Sample t-test
##
## data: redes and actual
## t = 3.2145, df = 54.681, p-value = 0.9989
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf 2.514425
## sample estimates:
## mean of x mean of y
## 20.75600 19.10233
El p-value es superior a 0.05, por lo que no se rechaza la hipótesis nula.
Por lo tanto, no existe evidencia estadística suficiente para afirmar que las redes neuronales reduzcan el tiempo promedio de falla respecto al sistema actual.
Además, su promedio es superior al correspondiente al sistema actual.
prueba_regresion <- t.test(
regresion,
actual,
alternative = "less"
)
prueba_regresion
##
## Welch Two Sample t-test
##
## data: regresion and actual
## t = -5.902, df = 49.248, p-value = 1.63e-07
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf -1.58275
## sample estimates:
## mean of x mean of y
## 16.89167 19.10233
Según el p- value obtenido es 0.000000163 es menor que 0.05, por lo tanto, se rechaza la hipótesis nula.
Existe evidencia estadísticamente significativa para afirmar que los métodos de regresión presentan un tiempo promedio de falla menor que el sistema actual
resultados <- data.frame(
Alternativa = c(
"Árbol de clasificación",
"Redes neuronales",
"Métodos de regresión"
),
Media = c(
mean(arbol),
mean(redes),
mean(regresion)
),
Media_actual = mean(actual),
Diferencia = c(
mean(arbol) - mean(actual),
mean(redes) - mean(actual),
mean(regresion) - mean(actual)
),
P_value = c(
prueba_arbol$p.value,
prueba_redes$p.value,
prueba_regresion$p.value
),
Decision = c(
ifelse(
prueba_arbol$p.value < alpha,
"Rechazar H0",
"No rechazar H0"
),
ifelse(
prueba_redes$p.value < alpha,
"Rechazar H0",
"No rechazar H0"
),
ifelse(
prueba_regresion$p.value < alpha,
"Rechazar H0",
"No rechazar H0"
)
)
)
knitr::kable(
resultados,
digits = 5,
caption = "Resultados de las pruebas de hipótesis"
)
| Alternativa | Media | Media_actual | Diferencia | P_value | Decision |
|---|---|---|---|---|---|
| Árbol de clasificación | 21.03400 | 19.10233 | 1.93167 | 0.99997 | No rechazar H0 |
| Redes neuronales | 20.75600 | 19.10233 | 1.65367 | 0.99890 | No rechazar H0 |
| Métodos de regresión | 16.89167 | 19.10233 | -2.21067 | 0.00000 | Rechazar H0 |
La diferencia se calculó como:
Diferencia=Media de la propuesta−Media del sistema actual
Por lo tanto, un valor negativo representa una reducción del tiempo de falla respecto al sistema actual.
Los resultados muestran que únicamente los métodos de regresión presentan una diferencia negativa acompañada de un p-value menor a 0.05.
A partir del análisis realizado se pueden establecer las siguientes conclusiones:
1. El sistema actual presenta un tiempo promedio de falla de aproximadamente 19.10 unidades.
2. El árbol de clasificación presenta un promedio de aproximadamente 21.03 unidades, superior al sistema actual.
3. Las redes neuronales presentan un promedio de aproximadamente 20.76 unidades, también superior al sistema actual.
4. Los métodos de regresión presentan el menor tiempo promedio, con aproximadamente 16.89 unidades.
5. Las pruebas de hipótesis muestran que ni el árbol de clasificación ni las redes neuronales presentan evidencia estadística suficiente para afirmar que reducen el tiempo de falla.
6. En el caso de los métodos de regresión, el p-value es menor que 0.05, por lo que se rechaza la hipótesis nula.
7. La reducción promedio obtenida mediante los métodos de regresión es de aproximadamente 2.21 unidades, equivalente a un 11.57%.
En consecuencia, considerando un nivel de significancia del 5%, se recomienda implementar la propuesta basada en métodos de regresión, debido a que es la única alternativa que presenta una reducción estadísticamente significativa del tiempo promedio de falla respecto al sistema actual.