Revisión de los datos (estructura, datos faltantes y estadísticas de los datos)

## tibble [25 × 3] (S3: tbl_df/tbl/data.frame)
##  $ Conf  : num [1:25] 1 0 1 0 1 1 0 0 0 1 ...
##  $ Carga : num [1:25] 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
##  $ Tiempo: num [1:25] 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
##   Conf        Carga            Tiempo     
##  SDD:12   Min.   : 1.000   Min.   :0.300  
##  HDD:13   1st Qu.: 3.100   1st Qu.:1.500  
##           Median : 5.800   Median :3.200  
##           Mean   : 5.648   Mean   :2.828  
##           3rd Qu.: 8.000   3rd Qu.:3.900  
##           Max.   :10.200   Max.   :5.800

Relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro.

Visualización general de la Variable Respuesta

Graficos individuales de todas las variables, excepto la respuesta

## list()

Análisis de regresión lineal simple - Tiempo ~ Carga

Representación gráfica y coeficiente de correlación

## Warning in cor.test.default(Tiempo, Carga, alternative = c("less"), method =
## c("spearman"), : Cannot compute exact p-value with ties
## 
##  Spearman's rank correlation rho
## 
## data:  Tiempo and Carga
## S = 188.72, p-value = 1
## alternative hypothesis: true rho is less than 0
## sample estimates:
##       rho 
## 0.9274163

Con este test de hipótesis nos permite saber que la correlación nunca va a ser 0, por ende, la muestra es buena. Además, la relación es positiva entre la carga del sistema y el tiempo de respuesta para ambos tipos de discos duros. El coeficiente de correlación de Spearman indica una fuerte correlación positiva, lo que sugiere una relación no lineal entre estas variables.

  1. Modelo 1: Regresión Simple
## 
## Call:
## lm(formula = Tiempo ~ Carga, data = datos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

El Modelo 1 de regresión simple revela una relación significativa entre la carga del sistema y el tiempo de respuesta del disco duro. La ecuación de regresión indica que, en promedio, por cada unidad adicional en la carga del sistema, el tiempo de respuesta del disco aumenta en 0.49214 segundos. Este hallazgo se respalda por el alto valor de significancia estadística (p < 0.001) y un R cuadrado ajustado de 0.8517, lo que sugiere que alrededor del 85.17% de la variabilidad en el tiempo de respuesta se explica por la carga del sistema en este modelo. Por lo tanto, el Modelo 1 proporciona una representación adecuada de la relación entre la carga y el tiempo de respuesta del disco duro.

Cabe destacar que la pendiente y la intercepción no son los mismo para cada tipo de disco duro, por lo tanto, la variable “Conf” la agregaré con la operación de multiplicación con el fin de capturar cómo el efecto de la “Carga” sobre el “Tiempo” varía dependiendo del tipo de disco duro (Conf).

  1. Modelo 2. Regresión con interacción entre Carga y Conf
## 
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = datos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.68547 -0.11333  0.06881  0.15302  0.41807 
## 
## Coefficients:
##               Estimate Std. Error t value Pr(>|t|)    
## (Intercept)   -1.37549    0.20902  -6.581 1.62e-06 ***
## Carga          0.71979    0.03367  21.376 9.88e-16 ***
## ConfHDD        2.26391    0.26520   8.536 2.86e-08 ***
## Carga:ConfHDD -0.35734    0.04227  -8.454 3.36e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared:  0.9692, Adjusted R-squared:  0.9648 
## F-statistic: 220.2 on 3 and 21 DF,  p-value: 5.042e-16

El Modelo 2 de regresión incluye la interacción entre la carga del sistema y la configuración del disco duro (SDD o HDD), representada por la variable “Conf”. Los resultados muestran que la interacción entre la carga y la configuración del disco es estadísticamente significativa (p < 0.05), lo que sugiere que el efecto de la carga en el tiempo de respuesta varía según el tipo de disco. Además, los coeficientes para la carga y la configuración del disco son significativos, lo que indica que tanto la carga del sistema como el tipo de disco influyen en el tiempo de respuesta. Es importante destacar que los coeficientes de pendiente e intercepto son diferentes para los dos tipos de discos, lo que sugiere que la relación entre la carga y el tiempo de respuesta varía entre los discos SDD y HDD. La bondad de ajuste del modelo se puede evaluar mediante la comparación del coeficiente de determinación ajustado con el del Modelo 1 y mediante pruebas adicionales de diagnóstico de residuos.

  1. Test ANOVA para comparar modelos
## Analysis of Variance Table
## 
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga * Conf
##   Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
## 1     23 7.8375                                  
## 2     21 1.6990  2    6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El test ANOVA realizado para comparar los modelos muestra que la inclusión de la variable cualitativa “Conf” y su interacción con la carga mejora significativamente el ajuste del modelo (p < 0.001). Esto se evidencia por el valor extremadamente bajo del p-valor, lo que indica que existe una diferencia significativa entre los modelos. Por lo tanto, se concluye que el Modelo 2, que incluye la interacción entre la carga y la configuración del disco, es estadísticamente superior al Modelo 1, que solo considera la carga del sistema.

  1. Representación Gráfica del Modelo 2 y Evaluación de Supuestos
## Warning in abline(modelo2, col = c("blue", "red")): only using the first two of
## 4 regression coefficients

## 
##  One Sample t-test
## 
## data:  residuos
## t = -0.14652, df = 24, p-value = 0.8847
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  -0.4994321  0.4332192
## sample estimates:
##   mean of x 
## -0.03310641
## 
##  studentized Breusch-Pagan test
## 
## data:  modelo2
## BP = 2.6825, df = 3, p-value = 0.4432
## 
##  Durbin-Watson test
## 
## data:  modelo2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
## 
##  Shapiro-Wilk normality test
## 
## data:  residuos
## W = 0.92407, p-value = 0.06348
  1. Conclusión General

En este análisis, se comparó el desempeño de dos clases de discos duros (SDD y HDD) en función de la carga del sistema y el tiempo de respuesta. La relación entre estas variables fue evaluada utilizando modelos de regresión simples y con interacción. El Modelo 1 demostró que la carga del sistema tiene una influencia significativa en el tiempo de respuesta, explicando el 85.17% de la variabilidad. Al incluir la configuración del disco y su interacción con la carga en el Modelo 2, se observó una mejora significativa en el ajuste del modelo, indicando que el efecto de la carga varía según el tipo de disco. Los resultados del test ANOVA confirmaron que el Modelo 2 es estadísticamente superior al Modelo 1. En conclusión, tanto la carga del sistema como el tipo de disco duro son factores importantes que influyen en el tiempo de respuesta, y el modelo con interacción proporciona una mejor comprensión de esta relación.

Punto 2.

## # A tibble: 35 × 5
##      Acc   Exp  Edad   Pot  Sexo
##    <dbl> <dbl> <dbl> <dbl> <dbl>
##  1     0    10    30    90     1
##  2     0    15    40    85     1
##  3     0     7    25    95     1
##  4     1     1    21   145     2
##  5     0    10    29    70     1
##  6     1     2    20   120     2
##  7     0     8    40    95     1
##  8     1    20    25   135     2
##  9     0    18    43    85     1
## 10     1     4    23   110     2
## # ℹ 25 more rows
## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
##  $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
##  $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
##  $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
##  $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
##  $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...

## 'data.frame':    35 obs. of  5 variables:
##  $ Acc : Factor w/ 2 levels "No","Si": 1 1 1 2 1 2 1 2 1 2 ...
##  $ Exp : num  10 15 7 1 10 2 8 20 18 4 ...
##  $ Edad: num  30 40 25 21 29 20 40 25 43 23 ...
##  $ Pot : num  90 85 95 145 70 120 95 135 85 110 ...
##  $ Sexo: Factor w/ 2 levels "Mujer","Hombre": 1 1 1 2 1 2 1 2 1 2 ...
  1. Análisis Exploratorio
##   Acc Exp Edad Pot   Sexo
## 1  No  10   30  90  Mujer
## 2  No  15   40  85  Mujer
## 3  No   7   25  95  Mujer
## 4  Si   1   21 145 Hombre
## 5  No  10   29  70  Mujer
## 6  Si   2   20 120 Hombre
##  Acc          Exp              Edad         Pot            Sexo   
##  No:20   Min.   : 1.000   Min.   :20   Min.   : 70.0   Mujer :21  
##  Si:15   1st Qu.: 6.500   1st Qu.:25   1st Qu.: 90.0   Hombre:14  
##          Median : 9.000   Median :29   Median : 95.0              
##          Mean   : 9.543   Mean   :31   Mean   :101.6              
##          3rd Qu.:12.000   3rd Qu.:36   3rd Qu.:110.0              
##          Max.   :20.000   Max.   :56   Max.   :150.0

  1. Modelos de Regresión Logística

Vamos a ajustar los dos modelos de regresión logística usando la función glm.

Modelo 1: Acc ~ Exp

## 
## Call:
## glm(formula = Acc ~ Exp, family = "binomial", data = datos)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4

Para el Modelo 1: La experiencia (Exp) tiene un efecto negativo y significativo sobre la probabilidad de accidente. Cada año adicional de experiencia reduce las probabilidades de accidente en aproximadamente un 24.56%

Modelo 2: Acc ~ Exp + Sexo

## 
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = "binomial", data = datos)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)   
## (Intercept)   0.8890     1.2252   0.726  0.46808   
## Exp          -0.2400     0.1176  -2.040  0.04131 * 
## SexoHombre    2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

Para el Modelo 2: Tanto la experiencia como el sexo son significativos. La experiencia sigue teniendo un efecto negativo. Ser hombre aumenta significativamente las probabilidades de accidente en comparación con ser mujer.

  1. Ecuaciones de Pronóstico Las ecuaciones de pronóstico para los modelos ajustados son las siguientes:

Modelo 1: logit(Acc) = β0 + β1*Exp Modelo 2: logit(Acc) = β0 + β1Exp + β2SexoHombre

  1. Evaluación de la Bondad de Ajuste

Evaluamos y comparamos los modelos usando diversos indicadores de bondad de ajuste.

Interpretación de los Coeficientes

## Waiting for profiling to be done...
##                  Coef      2.5 %      97.5 %
## (Intercept)  1.941925  0.1848551  4.13862783
## Exp         -0.245607 -0.4859059 -0.06601434
##                e-beta     2.5 %     97.5 %
## (Intercept) 6.9721601 1.2030441 62.7167043
## Exp         0.7822295 0.6151397  0.9361174
## Waiting for profiling to be done...
##                   Coef      2.5 %      97.5 %
## (Intercept)  0.8890341 -1.3776790  3.64897083
## Exp         -0.2399985 -0.5285605 -0.04017264
## SexoHombre   2.9865699  1.1292126  5.58840807
##                e-beta     2.5 %      97.5 %
## (Intercept)  2.432779 0.2521631  38.4350894
## Exp          0.786629 0.5894529   0.9606236
## SexoHombre  19.817589 3.0932200 267.3097416

Ajuste del Modelo - Test de Razón de Verosimilitud

## Analysis of Deviance Table
## 
## Model: binomial, link: logit
## 
## Response: Acc
## 
## Terms added sequentially (first to last)
## 
## 
##      Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
## NULL                    34     47.804            
## Exp   1   7.7977        33     40.006 0.005231 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
## 
## Model: binomial, link: logit
## 
## Response: Acc
## 
## Terms added sequentially (first to last)
## 
## 
##      Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
## NULL                    34     47.804            
## Exp   1   7.7977        33     40.006 0.005231 **
## Sexo  1  10.7571        32     29.249 0.001039 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##                 AIC deviance        R2
## Modelo_RL1 44.00583 40.00583 0.1631205
##                 AIC deviance        R2
## Modelo_RL2 35.24875 29.24875 0.3881471

Los resultados muestran que el Modelo 2 (incluyendo la variable Sexo) tiene un mejor ajuste con menor deviance, menor AIC y mayor R2 comparado con el Modelo 1.

Predicción con el Modelo

##    datos.Acc Class_RL1
## 1         No        No
## 2         No        No
## 3         No        Si
## 4         Si        Si
## 5         No        No
## 6         Si        Si
## 7         No        No
## 8         Si        No
## 9         No        No
## 10        Si        Si
## 11        No        No
## 12        No        No
## 13        Si        No
## 14        Si        Si
## 15        No        No
## 16        No        No
## 17        No        No
## 18        Si        Si
## 19        No        No
## 20        No        Si
## 21        No        Si
## 22        No        No
## 23        Si        Si
## 24        Si        No
## 25        No        No
## 26        No        No
## 27        Si        Si
## 28        Si        No
## 29        No        No
## 30        No        No
## 31        Si        No
## 32        Si        Si
## 33        No        No
## 34        Si        No
## 35        Si        No
##    datos.Acc Class_RL2
## 1         No        No
## 2         No        No
## 3         No        No
## 4         Si        Si
## 5         No        No
## 6         Si        Si
## 7         No        No
## 8         Si        No
## 9         No        No
## 10        Si        Si
## 11        No        No
## 12        No        No
## 13        Si        Si
## 14        Si        Si
## 15        No        Si
## 16        No        Si
## 17        No        No
## 18        Si        Si
## 19        No        No
## 20        No        No
## 21        No        No
## 22        No        No
## 23        Si        Si
## 24        Si        No
## 25        No        No
## 26        No        No
## 27        Si        Si
## 28        Si        No
## 29        No        No
## 30        No        No
## 31        Si        Si
## 32        Si        Si
## 33        No        No
## 34        Si        No
## 35        Si        No

Evaluación de la Bondad de Clasificación

## Setting levels: control = No, case = Si
## Setting direction: controls < cases
## 
## Call:
## roc.default(response = datos$Acc, predictor = Prob_RL1, auc = TRUE,     ci = TRUE)
## 
## Data: Prob_RL1 in 20 controls (datos$Acc No) < 15 cases (datos$Acc Si).
## Area under the curve: 0.7983
## 95% CI: 0.6297-0.967 (DeLong)

## Setting levels: control = No, case = Si
## Setting direction: controls < cases
## 
## Call:
## roc.default(response = datos$Acc, predictor = Prob_RL2, auc = TRUE,     ci = TRUE)
## 
## Data: Prob_RL2 in 20 controls (datos$Acc No) < 15 cases (datos$Acc Si).
## Area under the curve: 0.8683
## 95% CI: 0.7507-0.986 (DeLong)

Los resultados de la curva ROC indicaron:

Modelo 1: AUC de 0.7983 Modelo 2: AUC de 0.8683 Esto sugiere que el Modelo 2 tiene una mejor capacidad discriminativa para predecir accidentes, el cual, tiene lógica priorizar las personas que si tendrán algún accidente.

Se selecciona el Modelo 2 (Acc ~ Exp + Sexo) debido a su mejor rendimiento en términos de bondad de ajuste y capacidad predictiva. Este modelo proporciona una visión más completa y precisa de los factores que influyen en la ocurrencia de accidentes.

  1. Evaluando los indicadores de bondad de clasificación
##          predicho
## observado No Si
##        No 20  0
##        Si  6  9
## Confusion Matrix and Statistics
## 
##           Reference
## Prediction No Si
##         No 20  6
##         Si  0  9
##                                           
##                Accuracy : 0.8286          
##                  95% CI : (0.6635, 0.9344)
##     No Information Rate : 0.5714          
##     P-Value [Acc > NIR] : 0.001202        
##                                           
##                   Kappa : 0.6316          
##                                           
##  Mcnemar's Test P-Value : 0.041227        
##                                           
##             Sensitivity : 0.6000          
##             Specificity : 1.0000          
##          Pos Pred Value : 1.0000          
##          Neg Pred Value : 0.7692          
##              Prevalence : 0.4286          
##          Detection Rate : 0.2571          
##    Detection Prevalence : 0.2571          
##       Balanced Accuracy : 0.8000          
##                                           
##        'Positive' Class : Si              
## 
##          Sensitivity          Specificity       Pos Pred Value 
##            0.6000000            1.0000000            1.0000000 
##       Neg Pred Value            Precision               Recall 
##            0.7692308            1.0000000            0.6000000 
##                   F1           Prevalence       Detection Rate 
##            0.7500000            0.4285714            0.2571429 
## Detection Prevalence    Balanced Accuracy 
##            0.2571429            0.8000000
##                 AIC deviance        R2       AUC
## Modelo_RL2 35.24875 29.24875 0.3881471 0.8683333

El modelo de regresión logística (Modelo_RL2) tiene un buen desempeño general con una alta especificidad (100%) y un buen AUC (0.8683), lo que sugiere que el modelo es muy eficaz en distinguir entre clases. La precisión global del modelo es alta (82.86%), donde el índice Kappa(63.16%) nos confirma que es un indicador confiable, aunque la sensibilidad es moderada (60%). El AIC y la desviación son razonablemente bajos, indicando un buen ajuste del modelo a los datos. En general, estos resultados indican que el modelo es adecuado y efectivo para la tarea de clasificación.