1. Introducción

Un científico de datos ha desarrollado un modelo de analítica prescriptiva orientado a reducir el tiempo de fallas de las máquinas de un proceso de elaboración de galletas.

Luego de validar el modelo, se plantearon tres alternativas de mejora:

Para cada alternativa se cuenta con 30 réplicas, las cuales serán comparadas con el sistema actual.

El objetivo del análisis es determinar cuál de las propuestas debería implementarse para reducir el tiempo promedio de falla de las máquinas.

Para realizar la evaluación se utilizará un nivel de significancia del 5%.

2. Carga y organización de los datos

En primer lugar, se ingresan las 30 observaciones correspondientes a cada una de las alternativas evaluadas.

arbol <- c(
  23.81, 22.13, 22.64, 21.69, 23.58, 22.14, 18.73, 21.59,
  20.36, 20.53, 20.11, 20.34, 19.19, 22.92, 18.65, 20.60,
  19.83, 20.09, 19.43, 22.06, 21.15, 19.26, 18.08, 20.24,
  18.75, 20.69, 21.62, 23.69, 23.93, 23.19
)

redes <- c(
  23.24, 20.08, 18.01, 23.28, 19.23, 21.22, 21.47, 20.60,
  21.11, 21.27, 21.03, 17.34, 22.80, 21.85, 17.85, 23.15,
  19.57, 19.56, 20.79, 18.04, 20.95, 21.83, 18.17, 22.66,
  18.29, 18.89, 19.49, 19.19, 26.47, 25.25
)

regresion <- c(
  16.13, 17.84, 18.28, 15.61, 17.62, 16.12, 17.29, 16.13,
  16.64, 15.03, 18.16, 16.82, 17.44, 16.76, 17.26, 15.55,
  17.49, 18.42, 17.54, 17.13, 15.50, 16.80, 18.47, 18.42,
  18.43, 15.56, 16.03, 15.39, 15.12, 17.77
)

actual <- c(
  17.09, 15.77, 18.45, 16.55, 22.23, 22.11, 18.26, 18.04,
  19.66, 19.76, 18.74, 19.02, 18.54, 16.70, 17.57, 19.89,
  19.06, 18.70, 19.39, 19.68, 19.20, 16.85, 19.91, 19.82,
  18.08, 19.38, 20.30, 21.60, 23.39, 19.33
)

A continuación, se organizan las variables en un único data frame para facilitar el análisis.

datos <- data.frame(
  Arbol = arbol,
  Redes = redes,
  Regresion = regresion,
  Actual = actual
)

head(datos)
##   Arbol Redes Regresion Actual
## 1 23.81 23.24     16.13  17.09
## 2 22.13 20.08     17.84  15.77
## 3 22.64 18.01     18.28  18.45
## 4 21.69 23.28     15.61  16.55
## 5 23.58 19.23     17.62  22.23
## 6 22.14 21.22     16.12  22.11

3. Análisis descriptivo

Antes de realizar las pruebas estadísticas, se realiza una primera comparación de las alternativas mediante medidas descriptivas.

Se calcularán la media, desviación estándar, mínimo y máximo de cada grupo.

La media permitirá identificar el tiempo promedio de falla, mientras que la desviación estándar permitirá observar la variabilidad de los resultados.

resumen <- data.frame(
  Alternativa = c(
    "Árbol de clasificación",
    "Redes neuronales",
    "Métodos de regresión",
    "Sistema actual"
  ),
  
  Media = c(
    mean(arbol),
    mean(redes),
    mean(regresion),
    mean(actual)
  ),
  
  Desviacion = c(
    sd(arbol),
    sd(redes),
    sd(regresion),
    sd(actual)
  ),
  
  Minimo = c(
    min(arbol),
    min(redes),
    min(regresion),
    min(actual)
  ),
  
  Maximo = c(
    max(arbol),
    max(redes),
    max(regresion),
    max(actual)
  )
)

knitr::kable(
  resumen,
  digits = 2,
  caption = "Resumen descriptivo de las alternativas"
)
Resumen descriptivo de las alternativas
Alternativa Media Desviacion Minimo Maximo
Árbol de clasificación 21.03 1.71 18.08 23.93
Redes neuronales 20.76 2.22 17.34 26.47
Métodos de regresión 16.89 1.10 15.03 18.47
Sistema actual 19.10 1.73 15.77 23.39

Los resultados permiten observar diferencias entre las alternativas.

El sistema actual presenta un tiempo promedio de falla de aproximadamente 19.10 unidades.

Por otro lado, el árbol de clasificación y las redes neuronales presentan promedios superiores al sistema actual.

En cambio, los métodos de regresión presentan el menor promedio, con aproximadamente 16.89 unidades.

Esto hace que los métodos de regresión sean inicialmente la alternativa más prometedora. Sin embargo, esta diferencia debe ser comprobada mediante una prueba estadística.

4. Comparación gráfica

Para complementar el análisis descriptivo, se utiliza un diagrama de cajas que permite comparar la distribución de los tiempos de falla entre las cuatro alternativas.

boxplot(
  datos,
  main = "Distribución de los tiempos de falla",
  xlab = "Alternativa",
  ylab = "Tiempo de falla"
)

El gráfico permite observar que los métodos de regresión se concentran en valores inferiores respecto a las demás alternativas.

Por lo tanto, tanto el análisis numérico como la representación gráfica sugieren que los métodos de regresión podrían proporcionar una mejora.

Sin embargo, todavía no podemos afirmar que esta diferencia sea estadísticamente significativa.

5. Planteamiento de las hipótesis

El objetivo principal es determinar si alguna de las propuestas logra reducir el tiempo promedio de falla respecto al sistema actual.

Para cada propuesta se realizará una prueba de hipótesis.

La hipótesis nula representa la situación en la que la propuesta no consigue reducir el tiempo promedio:

\[ H_0: \mu_{propuesta} \geq \mu_{actual} \]

La hipótesis alternativa representa la situación que queremos comprobar:

\[ H_1: \mu_{propuesta} < \mu_{actual} \]

Como el objetivo es determinar si el tiempo de falla disminuye, la prueba será de una cola hacia la izquierda.

Se utilizará un nivel de significancia de:

alpha <- 0.05

alpha
## [1] 0.05

El criterio de decisión será el siguiente:

En términos prácticos, un p-value menor a 0.05 indicará que existe evidencia estadística suficiente para afirmar que la propuesta reduce el tiempo promedio de falla.

6. Pruebas de hipótesis

Para comparar las medias de las propuestas con el sistema actual se utilizará una prueba t de comparación de medias mediante la función t.test() de R.

La opción alternative = "less" permite evaluar específicamente si la primera media es menor que la segunda.

6.1 Árbol de clasificación frente al sistema actual

Primero se evalúa si el árbol de clasificación consigue reducir el tiempo promedio de falla.

prueba_arbol <- t.test(
  arbol,
  actual,
  alternative = "less"
)

prueba_arbol
## 
##  Welch Two Sample t-test
## 
## data:  arbol and actual
## t = 4.3555, df = 57.989, p-value = 1
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf 2.673004
## sample estimates:
## mean of x mean of y 
##  21.03400  19.10233

Se obtiene el p-value:

prueba_arbol$p.value
## [1] 0.9999726

Podemos automatizar la decisión estadística:

if (prueba_arbol$p.value < alpha) {
  print("Se rechaza H0.")
} else {
  print("No se rechaza H0.")
}
## [1] "No se rechaza H0."

El p-value obtenido es aproximadamente 1, por lo que es mayor que 0.05.

Por lo tanto, no se rechaza la hipótesis nula.

No existe evidencia estadística suficiente para afirmar que el árbol de clasificación reduzca el tiempo promedio de falla respecto al sistema actual.

Además, su media es superior a la del sistema actual, por lo que tampoco presenta una ventaja desde el punto de vista descriptivo.

6.2 Redes neuronales frente al sistema actual

A continuación, se analiza si las redes neuronales permiten reducir el tiempo promedio de falla.

prueba_redes <- t.test(
  redes,
  actual,
  alternative = "less"
)

prueba_redes
## 
##  Welch Two Sample t-test
## 
## data:  redes and actual
## t = 3.2145, df = 54.681, p-value = 0.9989
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf 2.514425
## sample estimates:
## mean of x mean of y 
##  20.75600  19.10233

El p-value obtenido es:

prueba_redes$p.value
## [1] 0.998903

La decisión puede obtenerse mediante:

if (prueba_redes$p.value < alpha) {
  print("Se rechaza H0.")
} else {
  print("No se rechaza H0.")
}
## [1] "No se rechaza H0."

El p-value es superior a 0.05, por lo que no se rechaza la hipótesis nula.

Por lo tanto, no existe evidencia estadística suficiente para afirmar que las redes neuronales reduzcan el tiempo promedio de falla respecto al sistema actual.

Además, su promedio es superior al correspondiente al sistema actual.

6.3 Métodos de regresión frente al sistema actual

Finalmente, se evalúa la alternativa basada en métodos de regresión.

prueba_regresion <- t.test(
  regresion,
  actual,
  alternative = "less"
)

prueba_regresion
## 
##  Welch Two Sample t-test
## 
## data:  regresion and actual
## t = -5.902, df = 49.248, p-value = 1.63e-07
## alternative hypothesis: true difference in means is less than 0
## 95 percent confidence interval:
##      -Inf -1.58275
## sample estimates:
## mean of x mean of y 
##  16.89167  19.10233

El p-value obtenido es:

prueba_regresion$p.value
## [1] 1.630094e-07

La decisión estadística es:

if (prueba_regresion$p.value < alpha) {
  print("Se rechaza H0.")
} else {
  print("No se rechaza H0.")
}
## [1] "Se rechaza H0."

En este caso, el p-value es aproximadamente:

\[ 1.63 \times 10^{-7} \]

Este valor es considerablemente menor que 0.05.

Por lo tanto, se rechaza la hipótesis nula.

Existe evidencia estadísticamente significativa para afirmar que los métodos de regresión presentan un tiempo promedio de falla menor que el sistema actual.

7. Comparación general de las alternativas

Una vez realizadas las tres pruebas, se resumen los resultados obtenidos.

resultados <- data.frame(
  Alternativa = c(
    "Árbol de clasificación",
    "Redes neuronales",
    "Métodos de regresión"
  ),
  
  Media = c(
    mean(arbol),
    mean(redes),
    mean(regresion)
  ),
  
  Media_actual = mean(actual),
  
  Diferencia = c(
    mean(arbol) - mean(actual),
    mean(redes) - mean(actual),
    mean(regresion) - mean(actual)
  ),
  
  P_value = c(
    prueba_arbol$p.value,
    prueba_redes$p.value,
    prueba_regresion$p.value
  ),
  
  Decision = c(
    ifelse(
      prueba_arbol$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    ),
    
    ifelse(
      prueba_redes$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    ),
    
    ifelse(
      prueba_regresion$p.value < alpha,
      "Rechazar H0",
      "No rechazar H0"
    )
  )
)

knitr::kable(
  resultados,
  digits = 5,
  caption = "Resultados de las pruebas de hipótesis"
)
Resultados de las pruebas de hipótesis
Alternativa Media Media_actual Diferencia P_value Decision
Árbol de clasificación 21.03400 19.10233 1.93167 0.99997 No rechazar H0
Redes neuronales 20.75600 19.10233 1.65367 0.99890 No rechazar H0
Métodos de regresión 16.89167 19.10233 -2.21067 0.00000 Rechazar H0

La diferencia se calculó como:

\[ \text{Diferencia} = \text{Media de la propuesta} - \text{Media del sistema actual} \]

Por lo tanto, un valor negativo representa una reducción del tiempo de falla respecto al sistema actual.

Los resultados muestran que únicamente los métodos de regresión presentan una diferencia negativa acompañada de un p-value menor a 0.05.

8. Magnitud de la mejora

Además de comprobar que la reducción es estadísticamente significativa, es importante determinar qué tan grande es la mejora obtenida.

Para ello se compara el promedio de los métodos de regresión con el promedio del sistema actual.

media_actual <- mean(actual)
media_regresion <- mean(regresion)

reduccion <- media_actual - media_regresion

reduccion_porcentual <- 
  (reduccion / media_actual) * 100

media_actual
## [1] 19.10233
media_regresion
## [1] 16.89167
reduccion
## [1] 2.210667
reduccion_porcentual
## [1] 11.57276

La reducción promedio obtenida es de aproximadamente:

round(reduccion, 2)
## [1] 2.21

unidades de tiempo.

En términos porcentuales:

round(reduccion_porcentual, 2)
## [1] 11.57

%.

Por lo tanto, los métodos de regresión permiten reducir el tiempo promedio de falla aproximadamente en un 11.57% respecto al sistema actual.

9. Conclusiones

A partir del análisis realizado se pueden establecer las siguientes conclusiones:

  1. El sistema actual presenta un tiempo promedio de falla de aproximadamente 19.10 unidades.

  2. El árbol de clasificación presenta un promedio de aproximadamente 21.03 unidades, superior al sistema actual.

  3. Las redes neuronales presentan un promedio de aproximadamente 20.76 unidades, también superior al sistema actual.

  4. Los métodos de regresión presentan el menor tiempo promedio, con aproximadamente 16.89 unidades.

  5. Las pruebas de hipótesis muestran que ni el árbol de clasificación ni las redes neuronales presentan evidencia estadística suficiente para afirmar que reducen el tiempo de falla.

  6. En el caso de los métodos de regresión, el p-value es menor que 0.05, por lo que se rechaza la hipótesis nula.

  7. La reducción promedio obtenida mediante los métodos de regresión es de aproximadamente 2.21 unidades, equivalente a un 11.57%.

En consecuencia, considerando un nivel de significancia del 5%, se recomienda implementar la propuesta basada en métodos de regresión, debido a que es la única alternativa que presenta una reducción estadísticamente significativa del tiempo promedio de falla respecto al sistema actual.