Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).
A continuación se presentan los datos:
## # A tibble: 6 × 3
## Conf Carga Tiempo
## <dbl> <dbl> <dbl>
## 1 1 1 0.9
## 2 0 2 0.3
## 3 1 2.4 2
## 4 0 3.1 0.8
## 5 1 4 2.7
## 6 1 4.3 2.6
a) Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación.
Con las gráficas anteriores se pude evidenciar que existe una relación lineal entre carga de trabajo y tiempo de respuesta para ambos discos, por lo que en los 2 casos entre mayor carga de trabajo habrá un mayor tiempo para la respuesta del disco.
b) Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
A partir de lo anterior se puede decir que el modelo de regresión simple muestra que el tiempo de respuesta (Tiempo) está relacionado significativamente con la carga de trabajo (Carga). El coeficiente de Carga es 0.49, lo que indica que, en promedio, el tiempo de respuesta aumenta en 0.49 segundos por cada unidad adicional de carga. El modelo explica aproximadamente el 85.79% de la variabilidad en el tiempo de respuesta (R² = 0.8579), lo que muestra un buen ajuste. El modelo es también estadísticamente significativo (p-value < 0.001).
c) Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2.
##
## Call:
## lm(formula = Tiempo ~ Carga + Conf + Carga:Conf, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.68547 -0.11333 0.06881 0.15302 0.41807
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.37549 0.20902 -6.581 1.62e-06 ***
## Carga 0.71979 0.03367 21.376 9.88e-16 ***
## Conf 2.26391 0.26520 8.536 2.86e-08 ***
## Carga:Conf -0.35734 0.04227 -8.454 3.36e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
## F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
El modelo 2 muestra que tanto la carga del sistema como el tipo de disco duro tienen efectos significativos en el tiempo de respuesta. Los coeficientes revelan que por cada unidad adicional de carga, el tiempo de respuesta aumenta en 0.72 unidades. Además, los discos SSD tienen un tiempo de respuesta 2.26 unidades menor que los HDD. El modelo explica el 96.48% de la variabilidad del tiempo de respuesta, siendo significativo con un p-value muy bajo.
d) Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.
## Analysis of Variance Table
##
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga + Conf + Carga:Conf
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 7.8375
## 2 21 1.6990 2 6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Con el test ANOVA podemos decir que el Modelo 2, que incluye la configuración del disco duro y su interacción con la carga, mejora el ajuste respecto al Modelo 1, que solo considera la carga. Esto se evidencia por el estadístico F de 37.938 con un p-valor muy bajo (1.067e-07).
e) Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.
##
## Shapiro-Wilk normality test
##
## data: residuals(Modelo2)
## W = 0.95551, p-value = 0.3323
##
## studentized Breusch-Pagan test
##
## data: Modelo2
## BP = 2.6825, df = 3, p-value = 0.4432
##
## Durbin-Watson test
##
## data: Modelo2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
De los test anteriores podemos decir que la normalidad de los residuos arrojó un valor p de 0.3323, lo que sugiere que los residuos siguen aproximadamente una distribución normal. En cuanto a la homogeneidad de la varianza de los residuos, se obtuvo un valor p de 0.4432, indicando que la varianza de los residuos es constante a través de los niveles de la variable predictora. Sin embargo, la autocorrelación de los residuos, dio un valor p de 0.03421, revelando evidencia de autocorrelación positiva en los residuos del modelo.
f) Concluya de forma general.
Este análisis comparó el desempeño de discos duros SDD y HDD en relación con el tiempo de respuesta frente a la carga del sistema. Se encontró una relación lineal positiva entre la carga y el tiempo de respuesta para ambos tipos de disco. El Modelo 2, en el que que se incluyó la configuración del disco y su interacción con la carga, mostró un ajuste significativamente mejor que el Modelo 1 según el test ANOVA.
Además, la evaluación de los residuos del Modelo 2 indicó que cumplen con la normalidad y la homogeneidad de la varianza, pero se detectó autocorrelación positiva. Esto sugiere que las observaciones pueden no ser completamente independientes, lo cual es importante considerar al interpretar los resultados del modelo.
Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:
Acc: haber tenido algún accidente en el último año (0:no; 1:sí).
Exp: años de experiencia.
Edad: edad del conductor.
Pot: potencia del motor.
Sexo: 1 (mujer), 2 (hombre).
A continuación veremos parte de los datos para el análisis:
## # A tibble: 6 × 5
## Acc Exp Edad Pot Sexo
## <dbl> <dbl> <dbl> <dbl> <dbl>
## 1 0 10 30 90 1
## 2 0 15 40 85 1
## 3 0 7 25 95 1
## 4 1 1 21 145 2
## 5 0 10 29 70 1
## 6 1 2 20 120 2
## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
## $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
## $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...
## Acc Exp Edad Pot Sexo
## Min. :0.0000 Min. : 1.000 Min. :20 Min. : 70.0 Min. :1.0
## 1st Qu.:0.0000 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 1st Qu.:1.0
## Median :0.0000 Median : 9.000 Median :29 Median : 95.0 Median :1.0
## Mean :0.4286 Mean : 9.543 Mean :31 Mean :101.6 Mean :1.4
## 3rd Qu.:1.0000 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0 3rd Qu.:2.0
## Max. :1.0000 Max. :20.000 Max. :56 Max. :150.0 Max. :2.0
a) Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).
A partir de la visualización de los anteriores gráficos podemos decir lo siguiente:
Los clientes hombres de la aseguradora son lo que se ven involucrados en siniestros con mayor frecuencia, esto aunque representan solo el 40% de la población de clientes de la aseguradora.
La mayoría de clientes de la aseguradora son menores de 40 años.
Como era de esperarse los clientes con mayor experiencia se ven involucrados en siniestros con menor frecuencia que aquellos con poca experiencia.
Se evidencia que los clientes con menor potencia en el motor de sus vehículos usualmente se ven involucrados en menos siniestros.
De manera leve, pero apreciable, los clientes con menor edad se ven involucrados en más siniestros que aquellos con más edad.
b) Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística:
Modelo 1: Acc ~ Exp
Modelo 2: Acc ~ Exp + genero
Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).
##
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = datos2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
##
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = datos2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -2.0975 1.5546 -1.349 0.17725
## Exp -0.2400 0.1176 -2.040 0.04131 *
## Sexo 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
c) Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.
Modelo 1: Acc ~ Exp:
Siniestralidad = 1.9419 - 0.2456 * Experiencia
Esto según el modelo 1. Sin embargo, el intercepto debería ser 1 o 0 según los datos.
Modelo 2: Acc ~ Exp + genero:
Siniestralidad = −2.0975 − 0.2400 * Experiencia + 2.9866 * Sexo
Esto según el modelo 2. Sin embargo, el intercepto debería ser 1 o 0 según los datos. Además en la gráfica del modelo pueden apreciarse cambios muy grandes en la variable a predecir a medida que cambian las variables predictoras.
d) A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.
## Analysis of Deviance Table
##
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 34 47.804
## 2 33 40.006 1 7.7977 0.005231 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Según lo anterior el modelo 1 aporta para predecir la siniestralidad respecto al modelo más sencillo que puede usarse para este fin.
## Analysis of Deviance Table
##
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp + Sexo
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 34 47.804
## 2 32 29.249 2 18.555 9.351e-05 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + Sexo
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 33 40.006
## 2 32 29.249 1 10.757 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
De lo anterior podemos decir que el Modelo 2 es significativamente mejor para predecir si ocurrieron accidentes que el Modelo nulo. Esto significa que tanto la experiencia del conductor como su género ayudan a explicar mejor la ocurrencia de accidentes según los datos analizados.
Mientras que en comparación con el Modelo 1, que solo incluye la variable Experiencia, el Modelo 4, que añade la variable Sexo, muestra una mejora significativa para predecir si ocurrieron accidentes. El valor p bajo (0.001039) indica que la diferencia en la capacidad predictiva entre ambos modelos es estadísticamente significativa. Esto indica que las 2 variables predictivas del modelo 2 son útiles para predecir la siniestralidad.
e) Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.
Por los anteriores análisis se elige el modelo 2, pues ambos coeficientes (Experiencia y Sexo) tienen valores p significativamente bajos (< 0.05), lo que indica que son estadísticamente significativos.
f) Para el modelo seleccionado en el punto e. Evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).
Mejor punto de corte: Que este sea 0.84 significa que el modelo asigna una probabilidad de accidente (Accidente = 1) mayor o igual a 0.84.
AUC: Que haya dado 0.87 indica que el modelo tiene una buena capacidad discriminativa, para discernir que clientes son propensos a verse involucrados en accidentes.
g) Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.
##
## Call:
## glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial,
## data = datos2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -23.02338 9.90262 -2.325 0.0201 *
## Exp -0.47952 0.33645 -1.425 0.1541
## Sexo 3.04940 2.36426 1.290 0.1971
## Edad -0.02585 0.08801 -0.294 0.7689
## Pot 0.24687 0.10715 2.304 0.0212 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp + Sexo
## Model 2: Acc ~ Exp + Sexo + Edad + Pot
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 32 29.249
## 2 30 12.700 2 16.549 0.0002549 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Lo anterior indica que que el Modelo 3 tiene un mejor ajuste a los datos comparado con el Modelo 2. Aunque la variable Edad y Sexo no son estadísticamente significativas según sus p-valores (0.769 y 0.197 respectivamente), la variable Potencia del motor es significativa (p = 0.021), contribuyendo al mejor ajuste del Modelo 5. Lo anterior también podría indicar que amerita testear más modelos con distintas combinaciones de variables, con el fin de encontrar aquel con un buen balance entre precisión y simpleza en cuanto a variables predictoras.
h) Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.
Luego de todos los análisis realizados en este informe se recomienda a la compañía elegir el Modelo 3 (Acc ~ Exp + Sexo + Edad + Pot), debido a que demostró ser aquel con mejores indicadores entre los 3 evaluados, esto teniendo en cuenta que las variables predictoras que utiliza son facilmente recolectables, por lo que el modelo proporcionará una buena precisión para clasificar a sus clientes sin requerir grandes esfuerzos para el despliegue del modelo.