Revisión de los datos (estructura, datos faltantes y estadísticas de los datos)
## tibble [25 × 3] (S3: tbl_df/tbl/data.frame)
## $ Conf : num [1:25] 1 0 1 0 1 1 0 0 0 1 ...
## $ Carga : num [1:25] 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
## $ Tiempo: num [1:25] 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
## Conf Carga Tiempo
## SDD:12 Min. : 1.000 Min. :0.300
## HDD:13 1st Qu.: 3.100 1st Qu.:1.500
## Median : 5.800 Median :3.200
## Mean : 5.648 Mean :2.828
## 3rd Qu.: 8.000 3rd Qu.:3.900
## Max. :10.200 Max. :5.800
Relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro.
Visualización general de la Variable Respuesta
Graficos individuales de todas las variables, excepto la respuesta
## list()
Análisis de regresión lineal simple - Tiempo ~ Carga
Representación gráfica y coeficiente de correlación
## Warning in cor.test.default(Tiempo, Carga, alternative = c("less"), method =
## c("spearman"), : Cannot compute exact p-value with ties
##
## Spearman's rank correlation rho
##
## data: Tiempo and Carga
## S = 188.72, p-value = 1
## alternative hypothesis: true rho is less than 0
## sample estimates:
## rho
## 0.9274163
Con este test de hipótesis nos permite saber que la correlación nunca va a ser 0, por ende, la muestra es buena. Además, la relación es positiva entre la carga del sistema y el tiempo de respuesta para ambos tipos de discos duros. El coeficiente de correlación de Spearman indica una fuerte correlación positiva, lo que sugiere una relación no lineal entre estas variables.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
El Modelo 1 de regresión simple revela una relación significativa entre la carga del sistema y el tiempo de respuesta del disco duro. La ecuación de regresión indica que, en promedio, por cada unidad adicional en la carga del sistema, el tiempo de respuesta del disco aumenta en 0.49214 segundos. Este hallazgo se respalda por el alto valor de significancia estadística (p < 0.001) y un R cuadrado ajustado de 0.8517, lo que sugiere que alrededor del 85.17% de la variabilidad en el tiempo de respuesta se explica por la carga del sistema en este modelo. Por lo tanto, el Modelo 1 proporciona una representación adecuada de la relación entre la carga y el tiempo de respuesta del disco duro.
Cabe destacar que la pendiente y la intercepción no son los mismo para cada tipo de disco duro, por lo tanto, la variable “Conf” la agregaré con la operación de multiplicación con el fin de capturar cómo el efecto de la “Carga” sobre el “Tiempo” varía dependiendo del tipo de disco duro (Conf).
##
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.68547 -0.11333 0.06881 0.15302 0.41807
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.37549 0.20902 -6.581 1.62e-06 ***
## Carga 0.71979 0.03367 21.376 9.88e-16 ***
## ConfHDD 2.26391 0.26520 8.536 2.86e-08 ***
## Carga:ConfHDD -0.35734 0.04227 -8.454 3.36e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
## F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
El Modelo 2 de regresión incluye la interacción entre la carga del sistema y la configuración del disco duro (SDD o HDD), representada por la variable “Conf”. Los resultados muestran que la interacción entre la carga y la configuración del disco es estadísticamente significativa (p < 0.05), lo que sugiere que el efecto de la carga en el tiempo de respuesta varía según el tipo de disco. Además, los coeficientes para la carga y la configuración del disco son significativos, lo que indica que tanto la carga del sistema como el tipo de disco influyen en el tiempo de respuesta. Es importante destacar que los coeficientes de pendiente e intercepto son diferentes para los dos tipos de discos, lo que sugiere que la relación entre la carga y el tiempo de respuesta varía entre los discos SDD y HDD. La bondad de ajuste del modelo se puede evaluar mediante la comparación del coeficiente de determinación ajustado con el del Modelo 1 y mediante pruebas adicionales de diagnóstico de residuos.
## Analysis of Variance Table
##
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga * Conf
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 7.8375
## 2 21 1.6990 2 6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
El test ANOVA realizado para comparar los modelos muestra que la inclusión de la variable cualitativa “Conf” y su interacción con la carga mejora significativamente el ajuste del modelo (p < 0.001). Esto se evidencia por el valor extremadamente bajo del p-valor, lo que indica que existe una diferencia significativa entre los modelos. Por lo tanto, se concluye que el Modelo 2, que incluye la interacción entre la carga y la configuración del disco, es estadísticamente superior al Modelo 1, que solo considera la carga del sistema.
## Warning in abline(modelo2, col = c("blue", "red")): only using the first two of
## 4 regression coefficients
##
## One Sample t-test
##
## data: residuos
## t = -0.14652, df = 24, p-value = 0.8847
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.4994321 0.4332192
## sample estimates:
## mean of x
## -0.03310641
##
## studentized Breusch-Pagan test
##
## data: modelo2
## BP = 2.6825, df = 3, p-value = 0.4432
##
## Durbin-Watson test
##
## data: modelo2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
##
## Shapiro-Wilk normality test
##
## data: residuos
## W = 0.92407, p-value = 0.06348
En este análisis, se comparó el desempeño de dos clases de discos duros (SDD y HDD) en función de la carga del sistema y el tiempo de respuesta. La relación entre estas variables fue evaluada utilizando modelos de regresión simples y con interacción. El Modelo 1 demostró que la carga del sistema tiene una influencia significativa en el tiempo de respuesta, explicando el 85.17% de la variabilidad. Al incluir la configuración del disco y su interacción con la carga en el Modelo 2, se observó una mejora significativa en el ajuste del modelo, indicando que el efecto de la carga varía según el tipo de disco. Los resultados del test ANOVA confirmaron que el Modelo 2 es estadísticamente superior al Modelo 1. En conclusión, tanto la carga del sistema como el tipo de disco duro son factores importantes que influyen en el tiempo de respuesta, y el modelo con interacción proporciona una mejor comprensión de esta relación.
Punto 2.
## # A tibble: 35 × 5
## Acc Exp Edad Pot Sexo
## <dbl> <dbl> <dbl> <dbl> <dbl>
## 1 0 10 30 90 1
## 2 0 15 40 85 1
## 3 0 7 25 95 1
## 4 1 1 21 145 2
## 5 0 10 29 70 1
## 6 1 2 20 120 2
## 7 0 8 40 95 1
## 8 1 20 25 135 2
## 9 0 18 43 85 1
## 10 1 4 23 110 2
## # ℹ 25 more rows
## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
## $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
## $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...
## 'data.frame': 35 obs. of 5 variables:
## $ Acc : Factor w/ 2 levels "No","Si": 1 1 1 2 1 2 1 2 1 2 ...
## $ Exp : num 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: Factor w/ 2 levels "Mujer","Hombre": 1 1 1 2 1 2 1 2 1 2 ...
## Acc Exp Edad Pot Sexo
## 1 No 10 30 90 Mujer
## 2 No 15 40 85 Mujer
## 3 No 7 25 95 Mujer
## 4 Si 1 21 145 Hombre
## 5 No 10 29 70 Mujer
## 6 Si 2 20 120 Hombre
## Acc Exp Edad Pot Sexo
## No:20 Min. : 1.000 Min. :20 Min. : 70.0 Mujer :21
## Si:15 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 Hombre:14
## Median : 9.000 Median :29 Median : 95.0
## Mean : 9.543 Mean :31 Mean :101.6
## 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0
## Max. :20.000 Max. :56 Max. :150.0
Vamos a ajustar los dos modelos de regresión logística usando la función glm.
Modelo 1: Acc ~ Exp
##
## Call:
## glm(formula = Acc ~ Exp, family = "binomial", data = datos)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
Para el Modelo 1: La experiencia (Exp) tiene un efecto negativo y significativo sobre la probabilidad de accidente. Cada año adicional de experiencia reduce las probabilidades de accidente en aproximadamente un 24.56%
Modelo 2: Acc ~ Exp + Sexo
##
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = "binomial", data = datos)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890 1.2252 0.726 0.46808
## Exp -0.2400 0.1176 -2.040 0.04131 *
## SexoHombre 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
Para el Modelo 2: Tanto la experiencia como el sexo son significativos. La experiencia sigue teniendo un efecto negativo. Ser hombre aumenta significativamente las probabilidades de accidente en comparación con ser mujer.
Modelo 1: logit(Acc) = β0 + β1*Exp Modelo 2: logit(Acc) = β0 + β1Exp + β2SexoHombre
Evaluamos y comparamos los modelos usando diversos indicadores de bondad de ajuste.
Interpretación de los Coeficientes
## Waiting for profiling to be done...
## Coef 2.5 % 97.5 %
## (Intercept) 1.941925 0.1848551 4.13862783
## Exp -0.245607 -0.4859059 -0.06601434
## e-beta 2.5 % 97.5 %
## (Intercept) 6.9721601 1.2030441 62.7167043
## Exp 0.7822295 0.6151397 0.9361174
## Waiting for profiling to be done...
## Coef 2.5 % 97.5 %
## (Intercept) 0.8890341 -1.3776790 3.64897083
## Exp -0.2399985 -0.5285605 -0.04017264
## SexoHombre 2.9865699 1.1292126 5.58840807
## e-beta 2.5 % 97.5 %
## (Intercept) 2.432779 0.2521631 38.4350894
## Exp 0.786629 0.5894529 0.9606236
## SexoHombre 19.817589 3.0932200 267.3097416
Ajuste del Modelo - Test de Razón de Verosimilitud
## Analysis of Deviance Table
##
## Model: binomial, link: logit
##
## Response: Acc
##
## Terms added sequentially (first to last)
##
##
## Df Deviance Resid. Df Resid. Dev Pr(>Chi)
## NULL 34 47.804
## Exp 1 7.7977 33 40.006 0.005231 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
##
## Model: binomial, link: logit
##
## Response: Acc
##
## Terms added sequentially (first to last)
##
##
## Df Deviance Resid. Df Resid. Dev Pr(>Chi)
## NULL 34 47.804
## Exp 1 7.7977 33 40.006 0.005231 **
## Sexo 1 10.7571 32 29.249 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## AIC deviance R2
## Modelo_RL1 44.00583 40.00583 0.1631205
## AIC deviance R2
## Modelo_RL2 35.24875 29.24875 0.3881471
Los resultados muestran que el Modelo 2 (incluyendo la variable Sexo) tiene un mejor ajuste con menor deviance, menor AIC y mayor R2 comparado con el Modelo 1.
Predicción con el Modelo
## datos.Acc Class_RL1
## 1 No No
## 2 No No
## 3 No Si
## 4 Si Si
## 5 No No
## 6 Si Si
## 7 No No
## 8 Si No
## 9 No No
## 10 Si Si
## 11 No No
## 12 No No
## 13 Si No
## 14 Si Si
## 15 No No
## 16 No No
## 17 No No
## 18 Si Si
## 19 No No
## 20 No Si
## 21 No Si
## 22 No No
## 23 Si Si
## 24 Si No
## 25 No No
## 26 No No
## 27 Si Si
## 28 Si No
## 29 No No
## 30 No No
## 31 Si No
## 32 Si Si
## 33 No No
## 34 Si No
## 35 Si No
## datos.Acc Class_RL2
## 1 No No
## 2 No No
## 3 No No
## 4 Si Si
## 5 No No
## 6 Si Si
## 7 No No
## 8 Si No
## 9 No No
## 10 Si Si
## 11 No No
## 12 No No
## 13 Si Si
## 14 Si Si
## 15 No Si
## 16 No Si
## 17 No No
## 18 Si Si
## 19 No No
## 20 No No
## 21 No No
## 22 No No
## 23 Si Si
## 24 Si No
## 25 No No
## 26 No No
## 27 Si Si
## 28 Si No
## 29 No No
## 30 No No
## 31 Si Si
## 32 Si Si
## 33 No No
## 34 Si No
## 35 Si No
Evaluación de la Bondad de Clasificación
## Setting levels: control = No, case = Si
## Setting direction: controls < cases
##
## Call:
## roc.default(response = datos$Acc, predictor = Prob_RL1, auc = TRUE, ci = TRUE)
##
## Data: Prob_RL1 in 20 controls (datos$Acc No) < 15 cases (datos$Acc Si).
## Area under the curve: 0.7983
## 95% CI: 0.6297-0.967 (DeLong)
## Setting levels: control = No, case = Si
## Setting direction: controls < cases
##
## Call:
## roc.default(response = datos$Acc, predictor = Prob_RL2, auc = TRUE, ci = TRUE)
##
## Data: Prob_RL2 in 20 controls (datos$Acc No) < 15 cases (datos$Acc Si).
## Area under the curve: 0.8683
## 95% CI: 0.7507-0.986 (DeLong)
Los resultados de la curva ROC indicaron:
Modelo 1: AUC de 0.7983 Modelo 2: AUC de 0.8683 Esto sugiere que el Modelo 2 tiene una mejor capacidad discriminativa para predecir accidentes, el cual, tiene lógica priorizar las personas que si tendrán algún accidente.
Se selecciona el Modelo 2 (Acc ~ Exp + Sexo) debido a su mejor rendimiento en términos de bondad de ajuste y capacidad predictiva. Este modelo proporciona una visión más completa y precisa de los factores que influyen en la ocurrencia de accidentes.
## predicho
## observado No Si
## No 20 0
## Si 6 9
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Si
## No 20 6
## Si 0 9
##
## Accuracy : 0.8286
## 95% CI : (0.6635, 0.9344)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 0.001202
##
## Kappa : 0.6316
##
## Mcnemar's Test P-Value : 0.041227
##
## Sensitivity : 0.6000
## Specificity : 1.0000
## Pos Pred Value : 1.0000
## Neg Pred Value : 0.7692
## Prevalence : 0.4286
## Detection Rate : 0.2571
## Detection Prevalence : 0.2571
## Balanced Accuracy : 0.8000
##
## 'Positive' Class : Si
##
## Sensitivity Specificity Pos Pred Value
## 0.6000000 1.0000000 1.0000000
## Neg Pred Value Precision Recall
## 0.7692308 1.0000000 0.6000000
## F1 Prevalence Detection Rate
## 0.7500000 0.4285714 0.2571429
## Detection Prevalence Balanced Accuracy
## 0.2571429 0.8000000
## AIC deviance R2 AUC
## Modelo_RL2 35.24875 29.24875 0.3881471 0.8683333
El modelo de regresión logística (Modelo_RL2) tiene un buen desempeño general con una alta especificidad (100%) y un buen AUC (0.8683), lo que sugiere que el modelo es muy eficaz en distinguir entre clases. La precisión global del modelo es alta (82.86%), donde el índice Kappa(63.16%) nos confirma que es un indicador confiable, aunque la sensibilidad es moderada (60%). El AIC y la desviación son razonablemente bajos, indicando un buen ajuste del modelo a los datos. En general, estos resultados indican que el modelo es adecuado y efectivo para la tarea de clasificación.