Grupo 1

Integrantes:

-Eloíza Quiroga García

-Erika Franshesca Yujra Coaquira

-Diego Eduardo Moron Garcia

-Arturo Hurtado Castilla

-Gerardo Pablo Poma Huamani

-Angie Reyes Alfaro

Un Data scientest ha diseñado un modelo de analítica prescriptiva para reducir el tiempo de fallas de las máquinas de un proceso de elaboración de galletas.

Para este análisis se dispone de 30 observaciones del tiempo de falla para cada una de las cuatro alternativas evaluadas (la alternativa actual y tres propuestas de mejora). En este contexto, se realizará un análisis estadístico inferencial considerando una diferencia del 5%, con el objetivo de determinar si existen diferencias estadísticamente significativas entre las alternativas. Asimismo, se identificará la propuesta que presenta el mejor desempeño en términos de tiempo de falla y que, en consecuencia, constituye la opción más adecuada para su implementación.

summary(data2)
##      ÁrbolC          Red_N         Regresion        SActual     
##  Min.   :18.08   Min.   :17.34   Min.   :15.03   Min.   :15.77  
##  1st Qu.:19.89   1st Qu.:19.20   1st Qu.:16.05   1st Qu.:18.12  
##  Median :20.64   Median :20.87   Median :16.98   Median :19.13  
##  Mean   :21.03   Mean   :20.76   Mean   :16.89   Mean   :19.10  
##  3rd Qu.:22.14   3rd Qu.:21.84   3rd Qu.:17.73   3rd Qu.:19.80  
##  Max.   :23.93   Max.   :26.47   Max.   :18.47   Max.   :23.39

Interpretacion y analisis de codigo: el resumen de cinco números (mínimo, cuartiles, mediana, máximo) más la media de cada grupo. Es un paso descriptivo, previo a cualquier prueba de hipótesis, pero es muy útil porque te deja ver la forma de cada distribución, no solo su promedio.

boxplot(tiempo ~ grupo, data = data_larga,
        main = "Tiempo de fallas por metodo",
        xlab = "Metodo", ylab = "Tiempo", col = "lightblue")

En el diagrama de cajas, cada caja representa el 50% central de los datos, es decir, los valores comprendidos entre el primer y el tercer cuartil. La línea que aparece dentro de la caja corresponde a la mediana, mientras que los extremos o “bigotes” muestran el rango de valores considerados normales dentro de la distribución. Los puntos que aparecen fuera de los bigotes representan observaciones atípicas o valores inusuales.

Según el boxplot, se selecciona Regresión porque presenta la mediana y la distribución central de tiempos de falla más bajas. Sus valores se concentran en un rango inferior al de las demás alternativas, lo que indica que permite reducir de manera más consistente el tiempo de falla.

PAIRED

with(data2, t.test(ÁrbolC, SActual, alternative = 'two.sided', conf.level = .95, paired = TRUE))
## 
##  Paired t-test
## 
## data:  ÁrbolC and SActual
## t = 5.1464, df = 29, p-value = 1.689e-05
## alternative hypothesis: true mean difference is not equal to 0
## 95 percent confidence interval:
##  1.164004 2.699329
## sample estimates:
## mean difference 
##        1.931667

El método Árbol produce tiempos de falla significativamente diferentes al Sistema Actual. En promedio, la diferencia es de 1.93 unidades.La diferencia promedio observada fue de 1.93 unidades de tiempo de falla, lo que indica que el Árbol de Clasificación presenta, en promedio, tiempos de falla mayores que el Sistema Actual. Dado que el objetivo es minimizar el tiempo de falla, este resultado evidencia que la propuesta basada en Árbol de Clasificación ofrece un desempeño inferior al sistema actualmente implementado.

En consecuencia, no se recomienda la implementación del Árbol de Clasificación, ya que no representa una mejora respecto al Sistema Actual y, por el contrario, incrementa significativamente el tiempo de falla promedio.

with(data2, t.test(Red_N, SActual, alternative = 'two.sided', conf.level = .95, paired = TRUE))
## 
##  Paired t-test
## 
## data:  Red_N and SActual
## t = 3.3642, df = 29, p-value = 0.002174
## alternative hypothesis: true mean difference is not equal to 0
## 95 percent confidence interval:
##  0.6483396 2.6589937
## sample estimates:
## mean difference 
##        1.653667

La diferencia promedio observada fue de −2.21 unidades de tiempo de falla, lo que indica que la Regresión presenta, en promedio, tiempos de falla menores que el Sistema Actual. Debido a que el objetivo es minimizar el tiempo de falla, este resultado demuestra que la Regresión sí representa una mejora frente al sistema actualmente implementado. En consecuencia, se recomienda su implementación, ya que logra reducir significativamente el tiempo de falla promedio.

with(data2, t.test(Regresion, SActual, alternative = 'two.sided', conf.level = .95, paired = TRUE))
## 
##  Paired t-test
## 
## data:  Regresion and SActual
## t = -5.3138, df = 29, p-value = 1.061e-05
## alternative hypothesis: true mean difference is not equal to 0
## 95 percent confidence interval:
##  -3.061533 -1.359801
## sample estimates:
## mean difference 
##       -2.210667

sí hay diferencia significativa, y esta vez la diferencia es negativa (Regresión menos SActual), lo que significa que Regresión tarda 2.21 unidades MENOS en promedio que el Sistema actual — es decir, es mejor que lo que ya tienen.

Interpretación Final

Con base en los resultados obtenidos, se concluye que la alternativa que debe implementarse es el modelo de Regresión. Esta decisión no se fundamenta únicamente en que presenta el menor tiempo promedio de falla, sino en que cumple de manera efectiva con el objetivo principal del análisis: reducir el tiempo de falla de las máquinas. Además, la mejora observada está respaldada por evidencia estadística, ya que las diferencias identificadas son significativas al nivel de significancia del 5%.

Los resultados muestran que existen diferencias estadísticamente significativas entre las alternativas evaluadas y el sistema actualmente utilizado. Desde una perspectiva descriptiva, el modelo de Regresión presenta el menor tiempo promedio de falla, con un valor aproximado de 17.34 unidades, mientras que el Sistema Actual registra un promedio cercano a 19.13 unidades.

En términos prácticos, esto significa que la implementación del modelo de Regresión permitiría reducir el tiempo promedio de falla en aproximadamente 2.21 unidades, lo que representa una mejora relevante en el desempeño del proceso. Por el contrario, las alternativas de Árbol de Clasificación y Red Neuronal muestran tiempos de falla superiores a los del Sistema Actual, por lo que no cumplen con el objetivo de mejora propuesto y, en consecuencia, son descartadas.

Por lo tanto, considerando tanto la magnitud de la mejora obtenida como la evidencia estadística disponible, se recomienda la implementación del modelo de Regresión, al ser la alternativa que proporciona la mayor reducción en el tiempo de falla y el mejor desempeño entre todas las opciones analizadas.