Un científico de datos ha desarrollado un modelo de analítica prescriptiva orientado a reducir el tiempo de fallas de las máquinas de un proceso de elaboración de galletas. Luego de validar el modelo, se han planteado tres propuestas de mejora: árbol de clasificación, redes neuronales y métodos de regresión.
Para cada propuesta, así como para el sistema actual, se dispone de 30 réplicas.
El objetivo del análisis es determinar cuál de las tres propuestas debería implementarse para reducir el tiempo de falla respecto al sistema actual, utilizando un nivel de significancia de 5%.
A continuación, se ingresan en R las 30 observaciones correspondientes a cada una de las alternativas evaluadas.
arbol <- c(
23.81, 22.13, 22.64, 21.69, 23.58, 22.14, 18.73, 21.59,
20.36, 20.53, 20.11, 20.34, 19.19, 22.92, 18.65, 20.60,
19.83, 20.09, 19.43, 22.06, 21.15, 19.26, 18.08, 20.24,
18.75, 20.69, 21.62, 23.69, 23.93, 23.19
)
redes <- c(
23.24, 20.08, 18.01, 23.28, 19.23, 21.22, 21.47, 20.60,
21.11, 21.27, 21.03, 17.34, 22.80, 21.85, 17.85, 23.15,
19.57, 19.56, 20.79, 18.04, 20.95, 21.83, 18.17, 22.66,
18.29, 18.89, 19.49, 19.19, 26.47, 25.25
)
regresion <- c(
16.13, 17.84, 18.28, 15.61, 17.62, 16.12, 17.29, 16.13,
16.64, 15.03, 18.16, 16.82, 17.44, 16.76, 17.26, 15.55,
17.49, 18.42, 17.54, 17.13, 15.50, 16.80, 18.47, 18.42,
18.43, 15.56, 16.03, 15.39, 15.12, 17.77
)
actual <- c(
17.09, 15.77, 18.45, 16.55, 22.23, 22.11, 18.26, 18.04,
19.66, 19.76, 18.74, 19.02, 18.54, 16.70, 17.57, 19.89,
19.06, 18.70, 19.39, 19.68, 19.20, 16.85, 19.91, 19.82,
18.08, 19.38, 20.30, 21.60, 23.39, 19.33
)
datos <- data.frame(
Arbol = arbol,
Redes = redes,
Regresion = regresion,
Actual = actual
)
head(datos)
## Arbol Redes Regresion Actual
## 1 23.81 23.24 16.13 17.09
## 2 22.13 20.08 17.84 15.77
## 3 22.64 18.01 18.28 18.45
## 4 21.69 23.28 15.61 16.55
## 5 23.58 19.23 17.62 22.23
## 6 22.14 21.22 16.12 22.11
Como primera aproximación, se calculan la media, desviación estándar, valor mínimo y valor máximo de cada alternativa.
La media permitirá comparar el tiempo de falla promedio, mientras que la desviación estándar permitirá observar qué tan dispersos se encuentran los resultados de cada alternativa.
resumen <- data.frame(
Alternativa = c(
"Árbol de clasificación",
"Redes neuronales",
"Métodos de regresión",
"Sistema actual"
),
Media = c(
mean(arbol),
mean(redes),
mean(regresion),
mean(actual)
),
Desviacion = c(
sd(arbol),
sd(redes),
sd(regresion),
sd(actual)
),
Minimo = c(
min(arbol),
min(redes),
min(regresion),
min(actual)
),
Maximo = c(
max(arbol),
max(redes),
max(regresion),
max(actual)
)
)
knitr::kable(resumen, digits = 2)
| Alternativa | Media | Desviacion | Minimo | Maximo |
|---|---|---|---|---|
| Árbol de clasificación | 21.03 | 1.71 | 18.08 | 23.93 |
| Redes neuronales | 20.76 | 2.22 | 17.34 | 26.47 |
| Métodos de regresión | 16.89 | 1.10 | 15.03 | 18.47 |
| Sistema actual | 19.10 | 1.73 | 15.77 | 23.39 |
Los resultados descriptivos muestran que el sistema actual presenta un tiempo de falla promedio de aproximadamente 19.10 unidades.
Las propuestas de árbol de clasificación y redes neuronales presentan medias de aproximadamente 21.03 y 20.76, respectivamente, ambas superiores al promedio del sistema actual.
En cambio, la propuesta basada en métodos de regresión presenta el menor tiempo promedio, con aproximadamente 16.89 unidades.
Por lo tanto, a nivel descriptivo, los métodos de regresión constituyen la única alternativa que muestra una reducción del tiempo promedio respecto al sistema actual.
Sin embargo, la comparación de medias por sí sola no es suficiente para concluir que existe una mejora estadísticamente significativa. Por ello, posteriormente se realizará un contraste de hipótesis.
Como complemento al análisis descriptivo, se presenta un diagrama de cajas que permite comparar visualmente la distribución de los tiempos de falla de las cuatro alternativas.
boxplot(
datos,
main = "Comparación de los tiempos de falla",
xlab = "Alternativa",
ylab = "Tiempo de falla"
)
El diagrama de cajas permite observar que los resultados correspondientes a métodos de regresión se encuentran, en general, en valores inferiores a los de las demás alternativas.
Esta observación coincide con los resultados obtenidos mediante las medias. No obstante, el gráfico constituye únicamente evidencia descriptiva, por lo que es necesario realizar una prueba estadística antes de establecer una conclusión.
El objetivo del caso es determinar si alguna de las propuestas permite reducir el tiempo de falla respecto al sistema actual.
Por lo tanto, para cada propuesta se plantea un contraste de hipótesis de una cola.
La hipótesis nula establece que la propuesta no presenta un tiempo promedio menor que el sistema actual:
\[ H_0: \mu_{propuesta} \geq \mu_{actual} \]
La hipótesis alternativa establece que la propuesta sí presenta un tiempo promedio menor:
\[ H_1: \mu_{propuesta} < \mu_{actual} \]
Se trabajará con un nivel de significancia de:
\[ \alpha = 0.05 \]
El criterio de decisión será:
Para contrastar las medias de cada propuesta con la media del sistema
actual se utiliza la función t.test() de R.
La opción alternative = "less" indica que se desea
evaluar si la media de la propuesta es menor que la media del sistema
actual.
Primero se evalúa si la propuesta basada en árbol de clasificación consigue un tiempo promedio menor que el sistema actual.
prueba_arbol <- t.test(
arbol,
actual,
alternative = "less"
)
prueba_arbol
##
## Welch Two Sample t-test
##
## data: arbol and actual
## t = 4.3555, df = 57.989, p-value = 1
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf 2.673004
## sample estimates:
## mean of x mean of y
## 21.03400 19.10233
El p-value obtenido es aproximadamente 0.99997, el cual es mayor que el nivel de significancia de 0.05.
Por lo tanto, no se rechaza la hipótesis nula.
No existe evidencia estadística para afirmar que el árbol de clasificación reduzca el tiempo promedio de falla respecto al sistema actual.
Este resultado también es consistente con el análisis descriptivo, debido a que el árbol presenta un promedio de 21.03, superior al promedio de 19.10 correspondiente al sistema actual.
A continuación, se evalúa si la propuesta basada en redes neuronales consigue un tiempo promedio menor que el sistema actual.
prueba_redes <- t.test(
redes,
actual,
alternative = "less"
)
prueba_redes
##
## Welch Two Sample t-test
##
## data: redes and actual
## t = 3.2145, df = 54.681, p-value = 0.9989
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf 2.514425
## sample estimates:
## mean of x mean of y
## 20.75600 19.10233
El p-value obtenido es aproximadamente 0.99890, nuevamente superior a 0.05.
Por lo tanto, no se rechaza la hipótesis nula.
No existe evidencia estadística para afirmar que la propuesta basada en redes neuronales reduzca el tiempo promedio de falla respecto al sistema actual.
Además, su tiempo promedio de 20.76 unidades es superior al promedio de 19.10 unidades correspondiente al sistema actual.
Finalmente, se evalúa si la propuesta basada en métodos de regresión consigue reducir el tiempo promedio de falla respecto al sistema actual.
prueba_regresion <- t.test(
regresion,
actual,
alternative = "less"
)
prueba_regresion
##
## Welch Two Sample t-test
##
## data: regresion and actual
## t = -5.902, df = 49.248, p-value = 1.63e-07
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
## -Inf -1.58275
## sample estimates:
## mean of x mean of y
## 16.89167 19.10233
El p-value obtenido es aproximadamente 1.63 × 10^-7, valor considerablemente menor que el nivel de significancia de 0.05.
Por lo tanto, se rechaza la hipótesis nula.
Existe evidencia estadísticamente significativa para afirmar que la propuesta basada en métodos de regresión presenta un tiempo promedio de falla menor que el sistema actual.
Debido a que los métodos de regresión constituyen la única alternativa que presenta una reducción estadísticamente significativa, se calcula la magnitud de la mejora respecto al sistema actual.
reduccion <- mean(actual) - mean(regresion)
reduccion_porcentual <- reduccion / mean(actual) * 100
reduccion
## [1] 2.210667
reduccion_porcentual
## [1] 11.57276
El sistema actual presenta un tiempo promedio de aproximadamente 19.10 unidades, mientras que la propuesta basada en métodos de regresión presenta un promedio de aproximadamente 16.89 unidades.
La diferencia entre ambos sistemas es de aproximadamente 2.21 unidades de tiempo, lo que representa una reducción promedio aproximada de 11.57% respecto al sistema actual.
A partir de las 30 réplicas analizadas para cada alternativa y considerando un nivel de significancia de 5%, se concluye que la propuesta que debería implementarse es la basada en métodos de regresión.
El sistema actual presenta un tiempo promedio de falla de aproximadamente 19.10 unidades, mientras que la propuesta basada en métodos de regresión presenta un promedio de aproximadamente 16.89 unidades.
Asimismo, el contraste de hipótesis realizado para esta alternativa obtiene un p-value considerablemente menor que 0.05, por lo que se rechaza la hipótesis nula y existe evidencia estadísticamente significativa para afirmar que los métodos de regresión reducen el tiempo promedio de falla.
La reducción estimada es de aproximadamente 2.21 unidades de tiempo, equivalente a una disminución promedio de 11.57% respecto al sistema actual.
Por otro lado, las propuestas basadas en árbol de clasificación y redes neuronales presentan tiempos promedio superiores al sistema actual y no muestran evidencia estadística de una reducción.
Por lo tanto, se recomienda implementar la propuesta basada en métodos de regresión.