El objetivo es evaluar tres alternativas de mejora para reducir el tiempo de falla de las máquinas en un proceso de elaboración de galletas, en comparación con el sistema actual.
Se cuenta con 30 réplicas para cada una de los métodos aplicados por el Data Scientist:
# Creación del data.frame con los datos de las 30 réplicas
arbol <- c(23.81, 22.13, 22.64, 21.69, 23.58, 22.14, 18.73, 21.59, 20.36, 20.53,
20.11, 20.34, 19.19, 22.92, 18.65, 20.6, 19.83, 20.09, 19.43, 22.06,
21.15, 19.26, 18.08, 20.24, 18.75, 20.69, 21.62, 23.69, 23.93, 23.19)
redn <- c(23.24, 20.08, 18.01, 23.28, 19.23, 21.22, 21.47, 20.6, 21.11, 21.27,
21.03, 17.34, 22.8, 21.85, 17.85, 23.15, 19.57, 19.56, 20.79, 18.04,
20.95, 21.83, 18.17, 22.66, 18.29, 18.89, 19.49, 19.19, 26.47, 25.25)
regresion <- c(16.13, 17.84, 18.28, 15.61, 17.62, 16.12, 17.29, 16.13, 16.64, 15.03,
18.16, 16.82, 17.44, 16.76, 17.26, 15.55, 17.49, 18.42, 17.54, 17.13,
15.5, 16.8, 18.47, 18.42, 18.43, 15.56, 16.03, 15.39, 15.12, 17.77)
actual <- c(17.09, 15.77, 18.45, 16.55, 22.23, 22.11, 18.26, 18.04, 19.66, 19.76,
18.74, 19.02, 18.54, 16.7, 17.57, 19.89, 19.06, 18.7, 19.39, 19.68,
19.2, 16.85, 19.91, 19.82, 18.08, 19.38, 20.3, 21.6, 23.39, 19.33)
Calculamos los promedios y desviaciones estándar para cada método:
data2 <- data.frame(
Metodo = c("ÁrbolC", "Red_N", "Regresion", "SActual"),
Promedio = c(mean(arbol), mean(redn), mean(regresion), mean(actual)),
Desviacion = c(sd(arbol), sd(redn), sd(regresion), sd(actual))
)
data2
## Metodo Promedio Desviacion
## 1 ÁrbolC 21.03400 1.705609
## 2 Red_N 20.75600 2.224344
## 3 Regresion 16.89167 1.103312
## 4 SActual 19.10233 1.729648
Visualización mediante diagramas de caja (Boxplots):
boxplot(arbol, redn, regresion, actual,
names = c("ÁrbolC", "RedN", "Regresion", "SActual"),
col = c("salmon", "lightblue", "lightgreen", "plum"),
main = "Tiempo de Falla según Propuesta",
ylab = "Tiempo de falla")
Análisis de Medias: La propuesta de Métodos de Regresión registra el tiempo medio de falla más bajo del estudio (16.89 minutos), logrando una reducción de 2.21 minutos en comparación con el Sistema Actual (19.10 minutos). En cambio, los Árboles de Clasificación (21.03 min) y las Redes Neuronales (20.76 min) incrementan el tiempo de falla respecto al proceso actual.
Estabilidad y Dispersión: Los Métodos de Regresión también presentan la menor desviación estándar (1.10 minutos), lo que indica que no solo es la opción más rápida, sino también la más consistente y predecible.
Visualización (Boxplot): El diagrama de cajas confirma visualmente la superioridad de la opción de Regresión, al ubicarse completamente por debajo del nivel del Sistema Actual y de las demás alternativas.
Outliers: El Método de Regresión no presenta valores atípicos, lo que demuestra que esta alternativa es sumamente estable, consistente y libre de fallas extremas.A diferencia de los otros métodos de Redes Neuronales y el Sistema actualque sí lo presentan, lo que podría indicar que hubo réplicas donde la máquina sufrió una falla inusualmente larga en comparación con el comportamiento habitual.
Para determinar si algún método reduce significativamente el tiempo de falla respecto al Sistema Actual, planteamos el siguiente sistema de hipótesis con un nivel de significancia del \(5\%\) (\(\alpha = 0.05\)):
t.test(arbol, actual, paired = TRUE, alternative = "less")
##
## Paired t-test
##
## data: arbol and actual
## t = 5.1464, df = 29, p-value = 1
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
## -Inf 2.569422
## sample estimates:
## mean difference
## 1.931667
Resultado: \(p-value > 5\%\) del nivel de significancia
t.test(redn, actual, paired = TRUE, alternative = "less")
##
## Paired t-test
##
## data: redn and actual
## t = 3.3642, df = 29, p-value = 0.9989
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
## -Inf 2.488868
## sample estimates:
## mean difference
## 1.653667
Resultado: \(p-value > 5\%\) del nivel de significancia
t.test(regresion, actual, paired = TRUE, alternative = "less")
##
## Paired t-test
##
## data: regresion and actual
## t = -5.3138, df = 29, p-value = 5.303e-06
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
## -Inf -1.503788
## sample estimates:
## mean difference
## -2.210667
Resultado: \(p-value < 5\%\) del nivel de significancia (\(0.000005303\))
Con un nivel de significancia del \(5\%\) (\(\alpha = 0.05\)):
Para Árbol de Clasificación (\(p > 0.05\)) y Redes Neuronales (\(p > 0.05\)), no existe evidencia estadística para afirmar que reducen el tiempo de falla en comparación con el Sistema Actual.
Para Métodos de Regresión, el p-valor obtenido (\(p = 0.000005\)) es estrictamente menor al \(5\%\) (\(\alpha = 0.05\)), por lo que se rechaza la hipótesis nula (\(H_0\)), por lo tanto este método reduce el tiempo de falla de las máquinas en el proceso de elaboración de galletas.
Recomendación: El científico de datos debe implementar la propuesta de Métodos de Regresión, ya que reduce estadísticamente el tiempo medio de fallas en el proceso de elaboración de galletas.