1. Introducción

El objetivo es evaluar tres alternativas de mejora para reducir el tiempo de falla de las máquinas en un proceso de elaboración de galletas, en comparación con el sistema actual.

Se cuenta con 30 réplicas para cada una de los métodos aplicados por el Data Scientist:

2. Carga de Datos

# Creación del data.frame con los datos de las 30 réplicas
arbol <- c(23.81, 22.13, 22.64, 21.69, 23.58, 22.14, 18.73, 21.59, 20.36, 20.53, 
           20.11, 20.34, 19.19, 22.92, 18.65, 20.6, 19.83, 20.09, 19.43, 22.06, 
           21.15, 19.26, 18.08, 20.24, 18.75, 20.69, 21.62, 23.69, 23.93, 23.19)

redn <- c(23.24, 20.08, 18.01, 23.28, 19.23, 21.22, 21.47, 20.6, 21.11, 21.27, 
          21.03, 17.34, 22.8, 21.85, 17.85, 23.15, 19.57, 19.56, 20.79, 18.04, 
          20.95, 21.83, 18.17, 22.66, 18.29, 18.89, 19.49, 19.19, 26.47, 25.25)

regresion <- c(16.13, 17.84, 18.28, 15.61, 17.62, 16.12, 17.29, 16.13, 16.64, 15.03, 
               18.16, 16.82, 17.44, 16.76, 17.26, 15.55, 17.49, 18.42, 17.54, 17.13, 
               15.5, 16.8, 18.47, 18.42, 18.43, 15.56, 16.03, 15.39, 15.12, 17.77)

actual <- c(17.09, 15.77, 18.45, 16.55, 22.23, 22.11, 18.26, 18.04, 19.66, 19.76, 
            18.74, 19.02, 18.54, 16.7, 17.57, 19.89, 19.06, 18.7, 19.39, 19.68, 
            19.2, 16.85, 19.91, 19.82, 18.08, 19.38, 20.3, 21.6, 23.39, 19.33)

3. Análisis Exploratorio de Datos

Calculamos los promedios y desviaciones estándar para cada método:

data2 <- data.frame(
  Metodo = c("ÁrbolC", "Red_N", "Regresion", "SActual"),
  Promedio = c(mean(arbol), mean(redn), mean(regresion), mean(actual)),
  Desviacion = c(sd(arbol), sd(redn), sd(regresion), sd(actual))
)
data2
##      Metodo Promedio Desviacion
## 1    ÁrbolC 21.03400   1.705609
## 2     Red_N 20.75600   2.224344
## 3 Regresion 16.89167   1.103312
## 4   SActual 19.10233   1.729648

Visualización mediante diagramas de caja (Boxplots):

boxplot(arbol, redn, regresion, actual,
        names = c("ÁrbolC", "RedN", "Regresion", "SActual"),
        col = c("salmon", "lightblue", "lightgreen", "plum"),
        main = "Tiempo de Falla según Propuesta",
        ylab = "Tiempo de falla")

4. Pruebas de Hipótesis (\(t\)-Student por pares)

Para determinar si algún método reduce significativamente el tiempo de falla respecto al Sistema Actual, planteamos el siguiente sistema de hipótesis con un nivel de significancia del \(5\%\) (\(\alpha = 0.05\)):

A) Árbol de Clasificación vs. Sistema Actual

t.test(arbol, actual, paired = TRUE, alternative = "less")
## 
##  Paired t-test
## 
## data:  arbol and actual
## t = 5.1464, df = 29, p-value = 1
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
##      -Inf 2.569422
## sample estimates:
## mean difference 
##        1.931667

Resultado: \(p-value > 5\%\) del nivel de significancia

B) Redes Neuronales vs. Sistema Actual

t.test(redn, actual, paired = TRUE, alternative = "less")
## 
##  Paired t-test
## 
## data:  redn and actual
## t = 3.3642, df = 29, p-value = 0.9989
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
##      -Inf 2.488868
## sample estimates:
## mean difference 
##        1.653667

Resultado: \(p-value > 5\%\) del nivel de significancia

C) Métodos de Regresión vs. Sistema Actual

t.test(regresion, actual, paired = TRUE, alternative = "less")
## 
##  Paired t-test
## 
## data:  regresion and actual
## t = -5.3138, df = 29, p-value = 5.303e-06
## alternative hypothesis: true mean difference is less than 0
## 95 percent confidence interval:
##       -Inf -1.503788
## sample estimates:
## mean difference 
##       -2.210667

Resultado: \(p-value < 5\%\) del nivel de significancia (\(0.000005303\))

5. Conclusión y Recomendación

Con un nivel de significancia del \(5\%\) (\(\alpha = 0.05\)):

Recomendación: El científico de datos debe implementar la propuesta de Métodos de Regresión, ya que reduce estadísticamente el tiempo medio de fallas en el proceso de elaboración de galletas.