Con la intención de comparar el desempeño de dos clases de discos duros (0 : SSD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).
Se han realizado múltiples ensayos bajo ambas configuraciones y bajo variación de la carga del sistema. Los resultados se presentan en la siguiente tabla:
| Conf | Carga | Tiempo |
|---|---|---|
| 1 | 1.0 | 0.9 |
| 0 | 2.0 | 0.3 |
| 1 | 2.4 | 2.0 |
| 0 | 3.1 | 0.8 |
| 1 | 4.0 | 2.7 |
| 1 | 4.3 | 2.6 |
| 0 | 5.8 | 2.5 |
| 0 | 6.6 | 3.2 |
| 0 | 7.5 | 3.7 |
| 1 | 8.0 | 3.9 |
| 0 | 9.0 | 5.3 |
| 1 | 9.2 | 4.2 |
| 1 | 10.2 | 3.9 |
| 1 | 1.8 | 1.1 |
| 1 | 2.0 | 1.5 |
| 0 | 2.5 | 0.5 |
| 0 | 3.9 | 1.5 |
| 0 | 4.2 | 1.6 |
| 1 | 5.5 | 3.3 |
| 0 | 6.4 | 3.3 |
| 1 | 7.0 | 3.5 |
| 0 | 8.0 | 4.3 |
| 1 | 8.2 | 4.0 |
| 1 | 9.1 | 4.3 |
| 0 | 9.5 | 5.8 |
I. Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación.
A priori, en el gráfico se puede observar que la carga de trabajo y el tiempo de respuesta tienen una relación lineal positiva en ambos tipos de discos duros. Sin embargo, se procede a realizar la Prueba de correlación de Pearson para cada tipo de disco con el objetivo de determinar o medir la fuerza de la relación entre ambas variables:
##
## Pearson's product-moment correlation
##
## data: Datos_DD_0$Carga and Datos_DD_0$Tiempo
## t = 28.334, df = 10, p-value = 1
## alternative hypothesis: true correlation is less than 0
## 95 percent confidence interval:
## -1.0000000 0.9979347
## sample estimates:
## cor
## 0.9938293
##
## Pearson's product-moment correlation
##
## data: Datos_DD_1$Carga and Datos_DD_1$Tiempo
## t = 12.024, df = 11, p-value = 1
## alternative hypothesis: true correlation is less than 0
## 95 percent confidence interval:
## -1.0000000 0.9871297
## sample estimates:
## cor
## 0.9640003
Como se puede observar en ambas pruebas, el coeficiente de correlación de Pearson arroja valores cercanos a 1, por lo que se puede concluir que para ambos tipos de discos duros, existe una relación positiva fuerte o lineal directa entre las variables carga de trabajo y tiempo de respuesta. Teniendo en cuenta lo anterior, se evidencia que es viable aplicar un Modelo de Regresión Lineal a este conjunto de datos.
II. Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = Datos_DD)
##
## Coefficients:
## (Intercept) Carga
## 0.04838 0.49214
## Analysis of Variance Table
##
## Response: Tiempo
## Df Sum Sq Mean Sq F value Pr(>F)
## Carga 1 47.313 47.313 138.84 3.177e-11 ***
## Residuals 23 7.838 0.341
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Call:
## lm(formula = Tiempo ~ Carga, data = Datos_DD)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
En primera instancia, mediante el Modelo 1 se estima una ecuación lineal que modela la relación entre las variables carga de trabajo (X) y tiempo de respuesta (Y) teniendo en consideración ambos tipos de discos, es decir, no considera la configuración del disco duro. El modelo nos indica que si la carga de trabajo toma un valor de 0, el tiempo de respuesta del disco sería de 0.048 segundos, del mismo modo, cuando la carga de trabajo aumenta en una unidad, el tiempo de respuesta aumenta en 0.49 segundos.
El modelo arroja un R2 ajustado de 0.86, por lo que explica el 85% de la variabilidad de Y (tiempo de respuesta).
III. Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2.
##
## Call:
## lm(formula = Tiempo ~ Carga + Conf + (Carga * Conf), data = Datos_DD)
##
## Coefficients:
## (Intercept) Carga Conf1 Carga:Conf1
## -1.3755 0.7198 2.2639 -0.3573
## Analysis of Variance Table
##
## Response: Tiempo
## Df Sum Sq Mean Sq F value Pr(>F)
## Carga 1 47.313 47.313 584.8051 < 2.2e-16 ***
## Conf 1 0.357 0.357 4.4132 0.04791 *
## Carga:Conf 1 5.782 5.782 71.4618 3.364e-08 ***
## Residuals 21 1.699 0.081
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Call:
## lm(formula = Tiempo ~ Carga + Conf + (Carga * Conf), data = Datos_DD)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.68547 -0.11333 0.06881 0.15302 0.41807
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.37549 0.20902 -6.581 1.62e-06 ***
## Carga 0.71979 0.03367 21.376 9.88e-16 ***
## Conf1 2.26391 0.26520 8.536 2.86e-08 ***
## Carga:Conf1 -0.35734 0.04227 -8.454 3.36e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
## F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
El Modelo 2 estima una ecuación lineal que modela la relación entre las variables carga de trabajo (X) y tiempo de respuesta (Y) considerando la configuración del disco duro como variable Dummy.
El modelo nos indica que cuando todas las variables independientes (tiempo de respuesta y configuración del disco) toman un valor de 0, el tiempo de respuesta del disco sería de -1.37 segundos. Del mismo modo, cuando la carga de trabajo aumenta en una unidad, manteniendo constante la configuración del disco, el tiempo de respuesta aumenta en 0.72 segundos. Adicionalmente, cuando la configuración del disco es 1 (HDD), el tiempo de respuesta aumenta en 2.26 segundos, es decir que se espera un aumento en el tiempo de respuesta en comparación de cuando de la configuración del disco es 0 (SSD), lo cual tiene sentido puesto que el disco SSD utiliza una tecnología más eficiente. Sin embargo, b3 nos indica que el efecto de la carga de trabajo en el tiempo de respuesta del disco disminuye cuando la configuración del disco es 1 (HDD).
El modelo arroja un R2 ajustado de 0.96, por lo que explica el 96% de la variabilidad de Y (tiempo de respuesta). Es decir que, en comparación con el Modelo 1, el Modelo 2 tiene una mejor bondad de ajuste.
IV. Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.
Mediante el test ANOVA se evalúa y compara la bondad de ajuste de los modelos mediante una una prueba de hipótesis en donde se busca responder la pregunta ¿El Modelo 2 aporta significativamente a explicar la variabilidad de Y (tiempo de respuesta)?:
H0: El modelo NO contribuye a explicar Y (tiempo de respuesta).
H1: El modelo SÍ contribuye a explicar el comportamiento de Y (tiempo de respuesta).
## Analysis of Variance Table
##
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga + Conf + (Carga * Conf)
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 7.8375
## 2 21 1.6990 2 6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Como se puede observar, el test ANOVA permitió probar que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo pues, el Valor-p es aproximadamente 0, por lo cual se rechaza la hipótesis nula (H0) y se concluye que existe una cantidad significativa de variación en Y que es explicada través del Modelo 2.
V. Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.
##
## One Sample t-test
##
## data: residuos
## t = -0.14652, df = 24, p-value = 0.8847
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.4994321 0.4332192
## sample estimates:
## mean of x
## -0.03310641
##
## studentized Breusch-Pagan test
##
## data: Modelo_2
## BP = 2.6825, df = 3, p-value = 0.4432
##
## Durbin-Watson test
##
## data: Modelo_2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
##
## Shapiro-Wilk normality test
##
## data: residuos
## W = 0.92407, p-value = 0.06348
Como se puede observar en la validación de los supuestos sobre el término error, se cumple el supuesto de Media cero, Varianza constante (Homogeniedad), Independencia (los residuales son independientes), y Normalidad (los residuos se distribuyen de manera normal). Lo anterior, debido a que en que todas las pruebas el Valor-p es mayor al alpha (0.05), por lo cual NO se rechazan las hipótesis nulas.
VI. Concluya de forma general.
Como se pudo observar a lo largo del análisis, el modelo que mejor representa el desempeño de las diferentes configuraciones de discos (SSD y HHD) es el Modelo 2, el cual además de tomar las variables carga de trabajo y tiempo de respuesta, también toma en consideración la configuración del disco duro como variable Dummy, mejorando la explicación de la variabilidad de Y en aproximadamente un 11% respecto al Modelo 1. Adicionalmente, el Modelo 2 cumple con los supuestos sobre el error, lo que es un indicio de que los resultados del modelo son válidos y confiables.
Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:
Acc : haber tenido algún accidente en el último año (0:No; 1:Sí).
Exp : años de experiencia.
Edad : edad del conductor.
Pot : potencia del motor.
Sexo : 1 (mujer), 2 (hombre).
I. Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).
| Acc | Exp | Edad | Pot | Sexo |
|---|---|---|---|---|
| 0 | 10 | 30 | 90 | 1 |
| 0 | 15 | 40 | 85 | 1 |
| 0 | 7 | 25 | 95 | 1 |
| 1 | 1 | 21 | 145 | 2 |
| 0 | 10 | 29 | 70 | 1 |
| 1 | 2 | 20 | 120 | 2 |
| 0 | 8 | 40 | 95 | 1 |
| 1 | 20 | 25 | 135 | 2 |
| 0 | 18 | 43 | 85 | 1 |
| 1 | 4 | 23 | 110 | 2 |
| 0 | 12 | 35 | 90 | 1 |
| 0 | 14 | 32 | 95 | 1 |
| 1 | 15 | 24 | 110 | 2 |
| 1 | 3 | 23 | 90 | 2 |
| 0 | 10 | 27 | 80 | 2 |
| 0 | 15 | 25 | 90 | 2 |
| 0 | 11 | 29 | 95 | 1 |
| 1 | 5 | 24 | 150 | 2 |
| 0 | 8 | 26 | 90 | 1 |
| 0 | 6 | 25 | 85 | 1 |
| 0 | 7 | 37 | 90 | 1 |
| 0 | 15 | 38 | 85 | 1 |
| 1 | 5 | 24 | 95 | 2 |
| 1 | 8 | 23 | 130 | 1 |
| 0 | 12 | 31 | 90 | 1 |
| 0 | 10 | 27 | 105 | 1 |
| 1 | 4 | 45 | 120 | 2 |
| 1 | 9 | 56 | 110 | 1 |
| 0 | 9 | 32 | 90 | 1 |
| 0 | 10 | 29 | 90 | 1 |
| 1 | 8 | 34 | 150 | 2 |
| 1 | 5 | 45 | 110 | 2 |
| 0 | 20 | 46 | 95 | 2 |
| 1 | 9 | 26 | 90 | 1 |
| 1 | 9 | 26 | 100 | 1 |
## 'data.frame': 35 obs. of 5 variables:
## $ Acc : num 0 0 0 1 0 1 0 1 0 1 ...
## $ Exp : num 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: num 1 1 1 2 1 2 1 2 1 2 ...
De acuerdo con la estructura del dataframe, se tiene que las variables Acc y Sexo son del tipo categórico por lo que se procede a convertirlas en factor:
## Acc Exp Edad Pot Sexo
## No:20 Min. : 1.000 Min. :20 Min. : 70.0 Mujer :21
## Sí:15 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 Hombre:14
## Median : 9.000 Median :29 Median : 95.0
## Mean : 9.543 Mean :31 Mean :101.6
## 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0
## Max. :20.000 Max. :56 Max. :150.0
De acuerdo con el análisis exploratorio realizado, el cual fue enfocado en la relación entre la siniestralidad y el conjunto de variables predictoras, se puede observar que se presenta una mayor concentración de siniestralidad cuando los años de experiencia son pocos, la potencia del motor es alta y la edad del conductor es menor a los 30 años. Adicionalmente, si nos centramos en el sexo, se evidencia que se presenta una mayor siniestralidad cuando el conductor es hombre.
II. Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística:
Modelo 1: Acc ~ Exp
Modelo 2: Acc ~ Exp + Género
Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).
##
## Call:
## glm(formula = Acc_A ~ Exp_A, family = "binomial", data = Accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp_A -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
##
## Call:
## glm(formula = Acc_A ~ Exp_A + Sexo_A, family = "binomial")
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890 1.2252 0.726 0.46808
## Exp_A -0.2400 0.1176 -2.040 0.04131 *
## Sexo_AHombre 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
III. Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.
En términos del logartimo de ODDs, las ecuaciones de pronóstico son las siguientes:
Modelo 1 = b0 + b1(Exp)
Modelo 1 = 1.942 - 0.246(Exp)
## Coef 2.5 % 97.5 %
## (Intercept) 1.941925 0.1848551 4.13862783
## Exp_A -0.245607 -0.4859059 -0.06601434
Modelo 2 = b0 + b1(Exp) + b2(Sexo)
Modelo 2 = 0.889 - 0.240(Exp) + 2.987(Sexo)
## Coef 2.5 % 97.5 %
## (Intercept) 0.8890341 -1.3776790 3.64897083
## Exp_A -0.2399985 -0.5285605 -0.04017264
## Sexo_AHombre 2.9865699 1.1292126 5.58840807
IV. A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.
##
## Call:
## roc.default(response = Accidentes$Acc, predictor = Prob_A1, auc = TRUE, ci = TRUE)
##
## Data: Prob_A1 in 20 controls (Accidentes$Acc No) < 15 cases (Accidentes$Acc Sí).
## Area under the curve: 0.7983
## 95% CI: 0.6297-0.967 (DeLong)
##
## Call:
## roc.default(response = Accidentes$Acc, predictor = Prob_A2, auc = TRUE, ci = TRUE)
##
## Data: Prob_A2 in 20 controls (Accidentes$Acc No) < 15 cases (Accidentes$Acc Sí).
## Area under the curve: 0.8683
## 95% CI: 0.7507-0.986 (DeLong)
## AIC deviance R2 AUC
## Modelo_A1 44.00583 40.00583 0.1631205 0.7983333
## AIC deviance R2 AUC
## Modelo_A2 35.24875 29.24875 0.3881471 0.8683333
## Analysis of Deviance Table
##
## Model 1: Acc_A ~ Exp_A
## Model 2: Acc_A ~ Exp_A + Sexo_A
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 33 40.006
## 2 32 29.249 1 10.757 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Para evaluar la bondad de ajuste de los modelos, se calculó ROC, AIC, AUC, Deviance y Verosimilitud. Como se puede observar, el Modelo 2 presenta un menor AIC y Deviance, y un mayor AUC y R2 que el Modelo 1, por lo cual se puede concluir que el Modelo 2 tiene un mejor ajuste respecto al Modelo 1. Por otro lado, en el Test de Verosimilitud, se probó que la inclusión de la variable Sexo mejora significativamente el ajuste del modelo, por lo que se rechaza la hipótesis nula (H0) y se concluye que el modelo más extenso (Modelo 2) explica mejor a Y (Siniestralidad).
V. Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.
Modelo 2 = b0 + b1(Exp) + b2(Sexo)
Modelo 2 = 2.433 + 0.787(Exp) + 19.818(Sexo)
## e-beta 2.5 % 97.5 %
## (Intercept) 2.432779 0.2521631 38.4350894
## Exp_A 0.786629 0.5894529 0.9606236
## Sexo_AHombre 19.817589 3.0932200 267.3097416
De acuerdo con el análisis realizado en el numeral anterior, se selecciona el Modelo 2 como el mejor modelo. En términos de coeficientes e-beta, un incremento en la variable años de experiencia desfavorece la ocurrencia de la siniestralidad. De igual manera, un incremento en la variable categórica sexo, favorece la ocurrencia de la siniestralidad y, debido a que “mujer” corresponde a 1 y “hombre” a 2, esto se interpreta que cuando la variable toma el valor 2 (hombre), aumenta la probabilidad de siniestro (en comparación de cuando toma el valor 1).
VI. Para el modelo seleccionado en el punto V. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).
De acuerdo con el ROC, el mejor punto de corte para el Modelo 2 es 0.845.
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Sí
## No 20 6
## Sí 0 9
##
## Accuracy : 0.8286
## 95% CI : (0.6635, 0.9344)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 0.001202
##
## Kappa : 0.6316
##
## Mcnemar's Test P-Value : 0.041227
##
## Sensitivity : 0.6000
## Specificity : 1.0000
## Pos Pred Value : 1.0000
## Neg Pred Value : 0.7692
## Prevalence : 0.4286
## Detection Rate : 0.2571
## Detection Prevalence : 0.2571
## Balanced Accuracy : 0.8000
##
## 'Positive' Class : Sí
##
La evaluación de la bondad de la clasificación indica que el modelo clasifica correctamente el 83% de los casos. Por otro lado, la sensibilidad del modelo o la capacidad de clasificar a los verdaderos positivos, es del 60% y, la especificidad o la capacidad de clasificar a los verdaderos negativos es del 100%, es decir, que clasifica perfectamente a los verdaderos negativos y tiene oportunidades de mejora en la clasificación de los verdaderos positivos.
VII. Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.
##
## Call:
## glm(formula = Acc_A ~ Exp_A + Sexo_A + Edad_A + Pot_A, family = "binomial")
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -19.97398 9.23723 -2.162 0.0306 *
## Exp_A -0.47952 0.33645 -1.425 0.1541
## Sexo_AHombre 3.04940 2.36426 1.290 0.1971
## Edad_A -0.02585 0.08801 -0.294 0.7689
## Pot_A 0.24687 0.10715 2.304 0.0212 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
##
## Model 1: Acc_A ~ Exp_A + Sexo_A
## Model 2: Acc_A ~ Exp_A + Sexo_A + Edad_A + Pot_A
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 32 29.249
## 2 30 12.700 2 16.549 0.0002549 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Call:
## roc.default(response = Accidentes$Acc, predictor = Prob_A3, auc = TRUE, ci = TRUE)
##
## Data: Prob_A3 in 20 controls (Accidentes$Acc No) < 15 cases (Accidentes$Acc Sí).
## Area under the curve: 0.9667
## 95% CI: 0.9054-1 (DeLong)
De acuerdo con el Test de Verosimilitud, la inclusión de las variables edad y potencia del motor mejora significativamente el ajuste del modelo, por lo que se rechaza la hipótesis nula (H0) y se concluye que el modelo más extenso (Modelo 3) explica mejor a Y (Siniestralidad). Adicionalmente, se observa que el AIC es menor y el AUC es mayor (en comparación al Modelo 2), lo que significa que el Modelo 3 tiene una mejor bondad de ajuste respecto al Modelo 2.
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Sí
## No 19 1
## Sí 1 14
##
## Accuracy : 0.9429
## 95% CI : (0.8084, 0.993)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 1.128e-06
##
## Kappa : 0.8833
##
## Mcnemar's Test P-Value : 1
##
## Sensitivity : 0.9333
## Specificity : 0.9500
## Pos Pred Value : 0.9333
## Neg Pred Value : 0.9500
## Prevalence : 0.4286
## Detection Rate : 0.4000
## Detection Prevalence : 0.4286
## Balanced Accuracy : 0.9417
##
## 'Positive' Class : Sí
##
Por otro lado, la evaluación de la bondad de la clasificación indica que el Modelo 3 clasifica correctamente el 94% de los casos. Por otro lado, la sensibilidad del modelo o la capacidad de clasificar a los verdaderos positivos, es del 94% y, la especificidad o la capacidad de clasificar a los verdaderos negativos es del 95%. Lo anterior evidencia un mejor desempeño de la clasificación del Modelo 3 respecto al Modelo 2, en especial en términos de sensibilidad.
VIII. Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.
De acuerdo con lo evidenciado en el numeral anterior, se decide realizar el reporte de hallazgos con base en el Modelo 3.
## e-beta 2.5 % 97.5 %
## (Intercept) 0.0000 0.0000 0.0019
## Exp_A 0.6191 0.1941 0.9696
## Sexo_AHombre 21.1026 0.4472 22363.0315
## Edad_A 0.9745 0.8179 1.1933
## Pot_A 1.2800 1.0934 1.6894
En términos de coeficientes e-beta, la ecuación del Modelo 3 es la siguiente:
Modelo 3 = b0 + b1(Exp) + b2(Sexo) + b3(Edad) + b4(Potencia)
Modelo 3 = 0 + 0.619(Exp) + 21.103(Sexo) + 0.976(Edad) + 1.280(Potencia)
La ecuación del Modelo 3 indica que un incremento en los años de experiencia y en la edad del conductor desfavorece la ocurrencia de la siniestralidad (principalmente la edad sobre la experiencia). De igual manera, un incremento en la variable potencia del motor y sexo favorece la ocurrencia de la siniestralidad (ver análisis de la variable categórica sexo en el númeral V.). Adicionalmente, se evidencia que organizando de mayor a menor el impacto de las variables predictoras sobre la favorabilidad en la ocurrencia de la siniestralidad, en primer lugar tenemos al sexo, en segundo lugar tenemos a la potencia del motor, en tercer lugar a la edad del conductor y, finalmente, los años de experiencia.
De acuerdo con lo anterior, recomendaríamos a la compañía de seguros lo siguiente:
1. Un costo mayor a la póliza de los hombres, puesto que su probabilidad de siniestro es significativamente mayor a la de las mujeres.
2. Considerar una diferenciación en los costos de las pólizas en función de los años de experiencia y la edad del conductor, debido a que se evidencia que la siniestralidad disminuye cuando ambas variables aumentan.
3. En los costos de las pólizas también se debe considerar la potencia del motor del vehículo ya que, de acuerdo con el modelo, el incremento en la potencia favorece la ocurrencia de la siniestralidad. Lo anterior probablemente es debido a que con una mayor potencia en el motor se pueden alcanzar velocidades más altas, lo cual incrementa las probabilidades de accidentabilidad.