Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).
I. Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación
Se puede observar que la carga de trabajo y el tiempo de respuesta tienen una relación lineal muy fuerte y positiva en ambos tipos de discos duros.
A continuación se realiza la Prueba de correlación de Pearson para los dos tipos de disco duro con el fin de medir la fuerza de la relación entre ambas variables:
> cor_SDD [1] 0.9938293
> cor_HDD [1] 0.9640003
Ambas pruebas obtienen valores cercanos a 1 por lo que se puede concluir que ambos discos tienen una relación fuerte y positiva entre las variables carga de trabajo y tiempo de respuesta. Sin embargo, el disco SDD presenta una relación ligeramente mas fuerte que el disco HDD.
II. Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.
Call:
lm(formula = Tiempo ~ Carga, data = datos)
Residuals:
Min 1Q Median 3Q Max
-1.16824 -0.40281 -0.03945 0.43541 1.07627
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 0.04838 0.26321 0.184 0.856
Carga 0.49214 0.04177 11.783 3.18e-11
(Intercept)
Carga ***
---
Signif. codes:
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Residual standard error: 0.5837 on 23 degrees of freedom
Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
En el modelo 1 se puede observar que por cada aumento de una unidad en la carga de trabajo se espera un aumento en el tiempo de 0.49 segundos.
III. Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2.
Call:
lm(formula = Tiempo ~ Carga * Conf, data = datos)
Residuals:
Min 1Q Median 3Q Max
-0.68547 -0.11333 0.06881 0.15302 0.41807
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) -1.37549 0.20902 -6.581 1.62e-06
Carga 0.71979 0.03367 21.376 9.88e-16
Conf1 2.26391 0.26520 8.536 2.86e-08
Carga:Conf1 -0.35734 0.04227 -8.454 3.36e-08
(Intercept) ***
Carga ***
Conf1 ***
Carga:Conf1 ***
---
Signif. codes:
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Residual standard error: 0.2844 on 21 degrees of freedom
Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
El Modelo 2 indica que cuando la variable carga de trabajo aumentan en una unidad y la configuración del disco se mantiene constante, el tiempo de respuesta aumenta en 0.72 s, mientras que cuando la configuración del disco es 1, el tiempo de respuesta aumenta en 2.26 s.
Este modelo tiene un R- cuadrado ajustado de 0.96, por lo que en comparación con el modelo 1, tiene una mejor bondad de ajuste.
IV. Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.
Analysis of Variance Table
Model 1: Tiempo ~ Carga
Model 2: Tiempo ~ Carga * Conf
Res.Df RSS Df Sum of Sq F Pr(>F)
1 23 7.8375
2 21 1.6990 2 6.1386 37.938 1.067e-07 ***
---
Signif. codes:
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Con el Test ANOVA se puede comprobar que al incluir la variable de configuración del disco se mejora el ajuste del modelo teniendo un valor p cercano a 0 y por lo que se rechaza la hipótesis nula .
V. Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.
One Sample t-test
data: residuos
t = -0.14652, df = 24, p-value = 0.8847
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
-0.4994321 0.4332192
sample estimates:
mean of x
-0.03310641
studentized Breusch-Pagan test
data: Model 2
BP = 2.6825, df = 3, p-value = 0.4432
Durbin-Watson test
data: Model 2
DW = 1.3285, p-value = 0.03421
alternative hypothesis: true autocorrelation is greater than 0
Shapiro-Wilk normality test
data: residuos
W = 0.92407, p-value = 0.06348
Teniendo en cuenta las gráficas y los diferentes test se puede decir que hay presencia de correlación entre las variables, que se rechaza la hipotesis nula y los residuales son independientes y se distribuyen de manera normal.
VI. Concluya de forma general.
Se puede concluir que existe una relación lineal fuerte y positiva entre el tiempo de respuesta y la carga de trabajo para ambos discos, además que el modelo 2 al tener un R-cuadrado mejor y al tener en cuenta la configuración del disco duro se desempeña mejor.
Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:
Acc : haber tenido algún accidente en el último año (0:No; 1:Sí).
Exp : años de experiencia.
Edad : edad del conductor.
Pot : potencia del motor.
Sexo : 1 (mujer), 2 (hombre).
I. Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).
Con los graficos podemos concluir que se presenta mayor siniestralidad cuando los conductores tienen pocos años de experiencia, son hombres y su edad es menor a 30 años, además cuando la potencia del motor de alta.
II. Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).
Modelo 1: Acc ~ Exp
Modelo 2: Acc ~ Exp + Género
Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).
Modelo 1: Acc ~ Exp
Call:
glm(formula = Acc ~ Exp, family = "binomial", data = accidentes1)
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) 1.9419 0.9816 1.978 0.0479 *
Exp -0.2456 0.1044 -2.354 0.0186 *
---
Signif. codes:
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
(Dispersion parameter for binomial family taken to be 1)
Modelo 2: Acc ~ Exp + Género
Call:
glm(formula = Acc ~ Exp + Sexo, family = "binomial", data = accidentes1)
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) 0.8890 1.2252 0.726 0.46808
Exp -0.2400 0.1176 -2.040 0.04131
Sexohombre 2.9866 1.0683 2.796 0.00518
(Intercept)
Exp *
Sexohombre **
---
Signif. codes:
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
(Dispersion parameter for binomial family taken to be 1)
Null deviance: 47.804 on 34 degrees of freedom
Residual deviance: 29.249 on 32 degrees of freedom
AIC: 35.249
Number of Fisher Scoring iterations: 5
III. Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.
Modelo 1
Call:
glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial, data = accidentes1)
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) -23.02338 9.90262 -2.325 0.0201 *
Exp -0.47952 0.33645 -1.425 0.1541
Sexo 3.04940 2.36426 1.290 0.1971
Edad -0.02585 0.08801 -0.294 0.7689
Pot 0.24687 0.10715 2.304 0.0212 *
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
(Dispersion parameter for binomial family taken to be 1)
Null deviance: 47.804 on 34 degrees of freedom
Residual deviance: 12.700 on 30 degrees of freedom
AIC: 22.7
Number of Fisher Scoring iterations: 8
Modelo 2
Call:
glm(formula = Acc ~ Exp + Sexo, family = "binomial")
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) 0.8890 1.2252 0.726 0.46808
Exp -0.2400 0.1176 -2.040 0.04131 *
Sexohombre 2.9866 1.0683 2.796 0.00518 **
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
(Dispersion parameter for binomial family taken to be 1)
Null deviance: 47.804 on 34 degrees of freedom
Residual deviance: 29.249 on 32 degrees of freedom
AIC: 35.249
Number of Fisher Scoring iterations: 5
IV. A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.
Deviance del Modelo 1: 40.00583
AIC del Modelo 1: 44.00583
Deviance del Modelo 2: 29.24875
AIC del Modelo 2: 35.24875
Analysis of Deviance Table
Model: binomial, link: logit
Response: Acc
Terms added sequentially (first to last)
Df Deviance Resid. Df Resid. Dev Pr(>Chi)
NULL 34 47.804
Exp 1 7.7977 33 40.006 0.005231 **
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Analysis of Deviance Table
Model: binomial, link: logit
Response: Acc
Terms added sequentially (first to last)
Df Deviance Resid. Df Resid. Dev Pr(>Chi)
NULL 34 47.804
Exp 1 7.7977 33 40.006 0.005231 **
Sexo 1 10.7571 32 29.249 0.001039 **
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
AUC del Modelo 1: 0.7983333
AUC del Modelo 2: 0.8683333
Se puede observar que el modelo 2 tiene un mejor ajuste que el modelo 1 debido a que tiene mayor AUC y menor AIC y deviance.
V. Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.
e-beta 2.5 % 97.5 %
(Intercept) 2.432779 0.2521631 38.4350894
Exp 0.786629 0.5894529 0.9606236
Sexohombre 19.817589 3.0932200 267.3097416
Teniendo en cuenta en analisis realizado en los puntos anteriores se seleccionó el modelo 2 como el mejor modelo, al revisar el e-beta se puede decir que a mayor experiencia disminuye la siniestralidad y que el sexo masculino tiene mayor probabilidad de ocurrencia de un siniestro.
VI. Para el modelo seleccionado en el punto V. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).
Confusion Matrix and Statistics
Reference
Prediction No Sí
No 20 6
Sí 0 9
Accuracy : 0.8286
95% CI : (0.6635, 0.9344)
No Information Rate : 0.5714
P-Value [Acc > NIR] : 0.001202
Kappa : 0.6316
Mcnemar's Test P-Value : 0.041227
Sensitivity : 0.6000
Specificity : 1.0000
Pos Pred Value : 1.0000
Neg Pred Value : 0.7692
Prevalence : 0.4286
Detection Rate : 0.2571
Detection Prevalence : 0.2571
Balanced Accuracy : 0.8000
'Positive' Class : Sí
La capacidad del modelo de clasificar correctamente los casos es superior al 82% y analizando su sensibilidad se puede decir que el modelo puede clasificar en un 60% los verdaderos positivos.
VII. Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.
Call:
glm(formula = Acc ~ ., family = "binomial", data = accidentes1)
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) -19.97398 9.23723 -2.162 0.0306 *
Exp -0.47952 0.33645 -1.425 0.1541
Edad -0.02585 0.08801 -0.294 0.7689
Pot 0.24687 0.10715 2.304 0.0212 *
Sexohombre 3.04940 2.36426 1.290 0.1971
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
(Dispersion parameter for binomial family taken to be 1)
Null deviance: 47.804 on 34 degrees of freedom
Residual deviance: 12.700 on 30 degrees of freedom
AIC: 22.7
Number of Fisher Scoring iterations: 8
Analysis of Deviance Table
Model 1: Acc ~ Exp + Sexo
Model 2: Acc ~ Exp + Edad + Pot + Sexo
Resid. Df Resid. Dev Df Deviance Pr(>Chi)
1 32 29.249
2 30 12.700 2 16.549 0.0002549 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Call:
roc.default(response = accidentes1$Acc, predictor = Prob_SAT, auc = TRUE, ci = TRUE)
Data: Prob_SAT in 20 controls (accidentes1$Acc No) < 15 cases (accidentes1$Acc Sí).
Area under the curve: 0.9667
95% CI: 0.9054-1 (DeLong)
Confusion Matrix and Statistics
Reference
Prediction No Sí
No 19 1
Sí 1 14
Accuracy : 0.9429
95% CI : (0.8084, 0.993)
No Information Rate : 0.5714
P-Value [Acc > NIR] : 1.128e-06
Kappa : 0.8833
Mcnemar's Test P-Value : 1
Sensitivity : 0.9333
Specificity : 0.9500
Pos Pred Value : 0.9333
Neg Pred Value : 0.9500
Prevalence : 0.4286
Detection Rate : 0.4000
Detection Prevalence : 0.4286
Balanced Accuracy : 0.9417
'Positive' Class : Sí
El modelo tiene una capacidad de clasificar correctamente el 94% de los casos y de acuerdo con su sensibilidad puede el modelo es puede clasificar en un 93% los verdaderos positivos. Por tanto, se puede apreciar una mejora significativa al incluir las variables edad y potencia del motor.
VIII. Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.
De acuerdo con los resultados obtenidos se obtienen las siguientes conclusiones: