#Caso 1
## 'data.frame': 25 obs. of 3 variables:
## $ Conf : int 1 0 1 0 1 1 0 0 0 1 ...
## $ Carga : num 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
## $ Tiempo: num 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
Se puede evidenciar que si existe una relacion lineal entre el tiempo de respuesta del disco y la carga del sistema. Esta es una relacion directa, es decir a mayor tamano de carga mayor el tiempo de respuesta. Adicionalmente podemos afirmar que es una relacion fuerte, ya que es muy cercana a 1 (0,93). Por otro lado se puede observar que aunque existe una relacion lineal entre las dos variables esta relacion es distinta en cuanto a pendiente e intercepto entre las categorias HDD y SDD. En relacion con la correlacion separado por cada tipo de disco se puede observar que la relacion entre el tiempo y los discos tipo HDD es una relacion fuerte (0,96) pero aun mas fuerte es la relacion entre SDD y el tiempo siendo de 0,99.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = Discos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
##
## One Sample t-test
##
## data: residuos
## t = 1.8453e-16, df = 24, p-value = 1
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.2358863 0.2358863
## sample estimates:
## mean of x
## 2.10899e-17
##
## studentized Breusch-Pagan test
##
## data: Modelo_1
## BP = 0.43435, df = 1, p-value = 0.5099
##
## Durbin-Watson test
##
## data: Modelo_1
## DW = 2.365, p-value = 0.7755
## alternative hypothesis: true autocorrelation is greater than 0
##
## Shapiro-Wilk normality test
##
## data: residuos
## W = 0.98568, p-value = 0.9702
De acuerdo con el modelo la variable carga explica el 85,17% de la variabilidad de la variable tiempo. La interpretacion es que en la medida que se haga una consulta adicional el tiempo aumentara en 0,49 segundos. El intercepto muestra que en la medida que las consultas se acerquen a 0 el tiempo de consulta tendera a 0 igualmente. De igual manera se observa el cumplimiento de los supuestos de homocedasticidad, normalidad de los residuos,independencia. Sin embargo en el grafico de escala-locacion hay un tramo que la linea toma una curva que puede deberse a que en esa proximidad donde se presenta la curva en el graficos en el diagrama de dispersion se cruzan las lineas suavizadas de las observaciones HDD y SDD. Esto podria validarse incluyendo una variable dummy que represente el tipo de disco, y analizar si el ajuste del modelo mejora.
## 'data.frame': 25 obs. of 3 variables:
## $ Carga : num 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
## $ Tiempo : num 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
## $ ConfHDD: num 1 0 1 0 1 1 0 0 0 1 ...
##
## Call:
## lm(formula = Tiempo ~ Carga + ConfHDD + Carga:ConfHDD, data = Discos_transf)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.68547 -0.11333 0.06881 0.15302 0.41807
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.37549 0.20902 -6.581 1.62e-06 ***
## Carga 0.71979 0.03367 21.376 9.88e-16 ***
## ConfHDD1 2.26391 0.26520 8.536 2.86e-08 ***
## Carga:ConfHDD1 -0.35734 0.04227 -8.454 3.36e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
## F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
##
## One Sample t-test
##
## data: residuos2
## t = -1.5145e-16, df = 24, p-value = 1
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.1098263 0.1098263
## sample estimates:
## mean of x
## -8.058875e-18
##
## studentized Breusch-Pagan test
##
## data: Modelo_2
## BP = 2.6825, df = 3, p-value = 0.4432
##
## Durbin-Watson test
##
## data: Modelo_2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
##
## Shapiro-Wilk normality test
##
## data: residuos2
## W = 0.95551, p-value = 0.3323
En ese nuevo modelo podemos ver un mejor ajuste. Este nuevo modelo explica el 96,48% de la variabilidad del tiempo de respuesta. Se puede evidenciar que todos los terminos son significativos. El coeficiente de la variable Carga es 0.719 lo que significa que si se incrementa en una unidad el numero de requerimientos el tiempo de ejecucion se incrementa en 0,719 segundos. Adicionalmente si el tipo de disco es HDD el intercepto cambia a 0,888, y la pendiente cambia a 0,362. Esto quiere decir que para los discos HDD el aumento en el tiempo de ejecucion es de 0,362 segundos por cada requerimiento adicional. Si el disco es del tipo SDD se incrementa en 0,719 segundos por cada aumento en una unidad en el numero de requerimientos.Si el disco es HDD el intercepto es 0,888 y si el disco es SDD el intercepto es -1,375. En relacion con el cumplimiento de los supuestos se observa que este modelo cumple de mejor manera que el anterior. La unica observacion a tener en cuenta es que la observacion 13 tiene un valor cercano a 1 en la distancia Cook. Sin embargo no supera este valor el cual es valido para pocas observaciones como en nuestro caso.Por otro lado en el caso del grafico qq, se ven unos puntos alejados de la linea ideal que puede deberse al hecho de que el modelo tiene una variable categorica que ademas tiene interaccion con la numerica, ya que el ajuste en eese sentido es mejor en el modelo 1, sin embargo la prueba shapiro es mejor con un valor p de 0,33; lo que indica aceptacion de la hipotesis nula (los residuos siguen una distribucion normal).
## Analysis of Variance Table
##
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga + ConfHDD + Carga:ConfHDD
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 7.8375
## 2 21 1.6990 2 6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
La ejecucion de la prueba ANOVA nos indica que existe una diferencia estadistica significativa en el desempeno de los dos modelos, es decir se puede puede concluir que el Modelo_2 es mejor que el primero.La reducción significativa en el RSS de 7.8375 a 1.6990 indica que el Modelo 2 se ajusta a los datos mucho mejor que el Modelo 1. Adicionalmente, eEl valor p muy bajo (1.067e-07) indica que la mejora en el ajuste del modelo debido a la inclusión de ConfHDD y Carga es estadísticamente significativa. Esto indica que la interacción entre Carga y ConfHDD es importante y debe incluirse en el modelo, lo que sugiere que el efecto de Carga en Tiempo depende de si el disco duro es HDD o no. Hay una interacción significativa entre Carga y ConfHDD, lo que indica que el impacto de Carga en Tiempo es diferente según el tipo de disco duro.
En resumen, los resultados del análisis ANOVA y la comparación de los modelos indican claramente que el Modelo_2 es superior al Modelo_1 en términos de ajuste a los datos. La reducción significativa en el error residual (RSS) y el valor extremadamente bajo de p indican que la inclusión de las variables ConfHDD y Carga, así como su interacción, mejora de manera estadísticamente significativa la capacidad del modelo para explicar el tiempo. Es crucial considerar la interacción entre Carga y ConfHDD, ya que indica que el efecto de la variable Carga en el tiempo depende del tipo de disco duro, HDD o no. En conclusión, estos hallazgos respaldan la idea de que el Modelo_2 no solo es más adecuado, sino que también proporciona una comprensión más precisa y detallada del fenómeno estudiado en comparación con el Modelo_1. Se evidencia que es necesario analizar estos modelos teniendo en cuenta las interacciones de las variables para tener ajustes mas acertados de los mismos, esta inclusion en el modelo ayuda tambien a un mejor cumplimiento de los supuestos en este caso en particular.
#Caso 2 Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información (accidentes.xlsx): Acc : haber tenido algún accidente en el último año (0:no; 1:sí). Exp : años de experiencia. Edad : edad del conductor. Pot : potencia del motor. Sexo : 1 (mujer), 2 (hombre). 1) Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).
## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
## $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
## $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...
## Acc Exp Edad Pot Sexo
## No:20 Min. : 1.000 Min. :20 Min. : 70.0 Mujer :21
## Si:15 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 Hombre:14
## Median : 9.000 Median :29 Median : 95.0
## Mean : 9.543 Mean :31 Mean :101.6
## 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0
## Max. :20.000 Max. :56 Max. :150.0
| Promedio | Desviación | Mediana | |
|---|---|---|---|
| Exp | 9.542857 | 4.779508 | 9 |
| Edad | 31.000000 | 8.547445 | 29 |
| Pot | 101.571429 | 20.028341 | 95 |
| Mujer | Hombre | |
|---|---|---|
| No | 17 | 3 |
| Si | 4 | 11 |
Se observa que existe una baja correlacion entre las variables numericas que se consideran de los encuestados. Las correlaciones son del orden de 0,3 e inferiores.Puede indicar que por ejemplo personas con mas experiencia tienden a comprar vehiculos de menos cilindrada, lo mismo las personas con mas edad prefieren vehiculo de menos cilindrada. Por ultimo la edad y la experiencia de manejo tienen un coeficiente de correlacion positivo lo cual tiene sentido pero no es un valor tan alto, lo que puede deberse a que algunas personas aprenden a manejar a una edad mayor.Se observa que aunque los hombres son el 40% de los encuestados, representan un 73% de los accidentes reportados. Es decir que el 78,6% de los hombres y el 19% de las mujeres sufrieron accidentes. Se observa que en promedio las mujeres del estudio tienen mas experiencia y edad que los hombres. Tambien se observa que los hombres en general compran vehiculos de mas potencia que las mujeres. Asimismo, se observa los accidentes son en su mayoria cometidos por personas con menor experiencia y edad. Finalmente las personas accidentadas tienen vehiculo de mayor potencia.
2)Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística: Modelo 1: Acc ~ Exp Modelo 2: Acc ~ Exp + genero Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).
## 'data.frame': 35 obs. of 5 variables:
## $ Acc : Factor w/ 2 levels "No","Si": 1 1 1 2 1 2 1 2 1 2 ...
## $ Exp : num 10 15 7 1 10 2 8 20 18 4 ...
## $ Edad: num 30 40 25 21 29 20 40 25 43 23 ...
## $ Pot : num 90 85 95 145 70 120 95 135 85 110 ...
## $ Sexo: Factor w/ 2 levels "Mujer","Hombre": 1 1 1 2 1 2 1 2 1 2 ...
##
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = Accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
##
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = Accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890 1.2252 0.726 0.46808
## Exp -0.2400 0.1176 -2.040 0.04131 *
## SexoHombre 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
Se observa que con los con el Modelo 2 se obtiene un mejor comportamiento en el desempeno de la prediccion. La devianza residual se redujo de 40,06 a 29,49. Igualmente en los graficos de caja y bigotes se observa que las predicciones de No son valores mas cercanos a 0 y las de Si son mas cercanos a 1, es decir el modelo predice mejor y se reduce la confusion entre las predicciones al reducirce el traslape de las variaciones de probabilidades predichas para la ocurrencia y no ocurrencia de accidentes.Se puede ver que en el segundo modelo la variable categorica Sexo se convierte en una dummy (SexoHombre) que toma el valor de 1 si la persona es hombre y el valor de 0 si es mujer.
3)Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.
Modelo 1: P(Acc = Si) = 1/(1 + exp(-(1.942 - 0.246Exp))) Modelo 2: P(Acc = Si) = 1/(1 + exp(-(0.889 - 0.24Exp + 2.986*SexoHombre)))
4)A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.
| Coef | 2.5 % | 97.5 % | e-beta | 2.5 % | 97.5 % | |
|---|---|---|---|---|---|---|
| (Intercept) | 1.941925 | 0.1848551 | 4.1386278 | 6.9721601 | 1.2030441 | 62.7167043 |
| Exp | -0.245607 | -0.4859059 | -0.0660143 | 0.7822295 | 0.6151397 | 0.9361174 |
| Coef | 2.5 % | 97.5 % | e-beta | 2.5 % | 97.5 % | |
|---|---|---|---|---|---|---|
| (Intercept) | 0.8890341 | -1.3776790 | 3.6489708 | 2.432779 | 0.2521631 | 38.4350894 |
| Exp | -0.2399985 | -0.5285605 | -0.0401726 | 0.786629 | 0.5894529 | 0.9606236 |
| SexoHombre | 2.9865699 | 1.1292126 | 5.5884081 | 19.817589 | 3.0932200 | 267.3097416 |
| AIC | deviance | R2 | |
|---|---|---|---|
| Modelo_1 | 44.00583 | 40.00583 | 0.1631205 |
| Modelo_2 | 35.24875 | 29.24875 | 0.3881471 |
| Df | Deviance | Resid. Df | Resid. Dev | Pr(>Chi) | |
|---|---|---|---|---|---|
| NULL | NA | NA | 34 | 47.80357 | NA |
| Exp | 1 | 7.797742 | 33 | 40.00583 | 0.0052312 |
| Df | Deviance | Resid. Df | Resid. Dev | Pr(>Chi) | |
|---|---|---|---|---|---|
| NULL | NA | NA | 34 | 47.80357 | NA |
| Exp | 1 | 7.797742 | 33 | 40.00583 | 0.0052312 |
| Sexo | 1 | 10.757076 | 32 | 29.24875 | 0.0010388 |
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Si
## No 14 2
## Si 6 13
##
## Accuracy : 0.7714
## 95% CI : (0.5986, 0.8958)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 0.01134
##
## Kappa : 0.5484
##
## Mcnemar's Test P-Value : 0.28884
##
## Sensitivity : 0.8667
## Specificity : 0.7000
## Pos Pred Value : 0.6842
## Neg Pred Value : 0.8750
## Prevalence : 0.4286
## Detection Rate : 0.3714
## Detection Prevalence : 0.5429
## Balanced Accuracy : 0.7833
##
## 'Positive' Class : Si
##
## Sensitivity Specificity Pos Pred Value
## 0.8666667 0.7000000 0.6842105
## Neg Pred Value Precision Recall
## 0.8750000 0.6842105 0.8666667
## F1 Prevalence Detection Rate
## 0.7647059 0.4285714 0.3714286
## Detection Prevalence Balanced Accuracy
## 0.5428571 0.7833333
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Si
## No 20 6
## Si 0 9
##
## Accuracy : 0.8286
## 95% CI : (0.6635, 0.9344)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 0.001202
##
## Kappa : 0.6316
##
## Mcnemar's Test P-Value : 0.041227
##
## Sensitivity : 0.6000
## Specificity : 1.0000
## Pos Pred Value : 1.0000
## Neg Pred Value : 0.7692
## Prevalence : 0.4286
## Detection Rate : 0.2571
## Detection Prevalence : 0.2571
## Balanced Accuracy : 0.8000
##
## 'Positive' Class : Si
##
## Sensitivity Specificity Pos Pred Value
## 0.6000000 1.0000000 1.0000000
## Neg Pred Value Precision Recall
## 0.7692308 1.0000000 0.6000000
## F1 Prevalence Detection Rate
## 0.7500000 0.4285714 0.2571429
## Detection Prevalence Balanced Accuracy
## 0.2571429 0.8000000
| No | Si | |
|---|---|---|
| No | 14 | 2 |
| Si | 6 | 13 |
| No | Si | |
|---|---|---|
| No | 20 | 6 |
| Si | 0 | 9 |
| x | |
|---|---|
| Accuracy | 0.7714286 |
| Kappa | 0.5483871 |
| AccuracyLower | 0.5986367 |
| AccuracyUpper | 0.8957896 |
| AccuracyNull | 0.5714286 |
| AccuracyPValue | 0.0113424 |
| McnemarPValue | 0.2888444 |
| x | |
|---|---|
| Sensitivity | 0.8666667 |
| Specificity | 0.7000000 |
| Pos Pred Value | 0.6842105 |
| Neg Pred Value | 0.8750000 |
| Precision | 0.6842105 |
| Recall | 0.8666667 |
| F1 | 0.7647059 |
| Prevalence | 0.4285714 |
| Detection Rate | 0.3714286 |
| Detection Prevalence | 0.5428571 |
| Balanced Accuracy | 0.7833333 |
| x | |
|---|---|
| Accuracy | 0.8285714 |
| Kappa | 0.6315789 |
| AccuracyLower | 0.6635017 |
| AccuracyUpper | 0.9343782 |
| AccuracyNull | 0.5714286 |
| AccuracyPValue | 0.0012018 |
| McnemarPValue | 0.0412268 |
| x | |
|---|---|
| Sensitivity | 0.6000000 |
| Specificity | 1.0000000 |
| Pos Pred Value | 1.0000000 |
| Neg Pred Value | 0.7692308 |
| Precision | 1.0000000 |
| Recall | 0.6000000 |
| F1 | 0.7500000 |
| Prevalence | 0.4285714 |
| Detection Rate | 0.2571429 |
| Detection Prevalence | 0.2571429 |
| Balanced Accuracy | 0.8000000 |
De acuerdo con las metricas revisadas se puede observar que el modelo 2 es mejor que el primero, ya que su AIC y devianza son considerablemente mas bajos que los del modelo 1, y ademas su R2 tambien es considerablemnte mas alto. Adicionalemnte el area bajo la curva es de 0.798 en el modelo 1 y en cambio en el modelo 2 es de 0.868, mostrando igualmente su mejora capacidad de prediccion, y por consiguiente un mejor ajuste para describir el fenomeno estudiado (accidentalidad). En relacion con el modelo 2 al analizar su test de verosimilitud, se identifica que los terminos son significativos con probabilidad muy inferiores a 0.05. En este sentido el modelo esta altamente seguro de que la devianza asociada a Exp es de 7.79 y la de Sexo es de 10.75, mostrando como estas dos variables ayudan explicar mejor la variabilidad de la variable de respuesta que es la ocurrencia o no de accidentes. Una vez revisadas las curvas AUC y buscando optimizar las predicciones y mejorar el desempeno de los dos modelos se busco optimizar el punto de corte. El del modelo 1 paso a ser 0.404 y el del modelo 2 0.845. Con estos ajustes en el punto de corte se generaron los indicadores finales de desempeno de clasificacion. En primer lugar la matriz de confusion en la cual se ve que el modelo 1 clasifica correctamente 27 instancias de las 35 disponibles. Incurriendo en falsos positivos en 6 ocasiones y falsos negaticos en 2 ocasiones. Por otro lado el Modelo 2 tiene 29 instancias clasificadas correctamente sin falsos positivos pero con mas falsos negativos que el modelo 1. Sin embargo esto debe debe analizarse muy bien, ya que el modelo 1 tiene un sensitivity de 0.86 y el modelo 2 de 0.6. Esto quiere decir que el modelo 2 es propenso a indicar con mas frecuencia que una persona NO tendra un accidente cuando en realidad Si lo tendra, lo cual le generara perjuicios a la empresa, ya que estimara una prima mas baja para esa persona de lo que debiera ser.
En mi opinion el mejor modelo para la empresa es el MODELO 1, ya que es el modelo que le permitira asegurar de mejor manera a la personas y los errores de falsos negativos seran menos incurriendo menos veces en dar una prima baja erroneamente y en el caso de un falso positivo se dara una prima alta que se podra ir reduciendo an la medida que la persona pase determinados umbrales de tiempo sin accidentes.
En terminos solo de metricas de analitica se consideraria que el mejor modelo es el Modelo 2 ya que indice Kappa es de 0.6315 contra el del Modelo 1 que es 0.5483. Se interpretaran los coeficientes de este modelo y se considerara como mejor debido a su mejor accuracy y Kappa, pero dejando claro que el modelo 1 desde el punto de vista economico puede ser mejor que el segundo. Al revisar la tabla de los coeficientes se puede ver que en el caso de la experiencia (Exp) el valor de exp(-0.2399) = 0.7866, es decir que la experiencia reduce la las odds de ocurencia de accidente en un 11.34% aproximadamente por cada ano de experiencia. Estamos muy seguros de que es un factor protector ya que el intervalo de confianza no contiene el 1. Por otro lado el hecho de que la persona sea hombre incremente a 19.81 veces las odds de ocurrencia de accidente Vs No ocurrencia de accidente. En este caso tambien se esta bastante seguro de este efecto de potenciar la ocurrencia del evento ya que el intervalo de confianza no contiene el 1 y su menos valor es de 3.09. Como se habia indicado anteriormente en ambos coeficientes la prueba de significancia de chi cuadrado en el test de verosimilitud arrojaron valores muy inferiores al nivel de significancia (0.05), por lo cual estamos bastante seguros de la significancia de los coeficientes.
6)Para el modelo seleccionado en el punto v. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).
De acuerdo con el desempeno del modelo se puede identificar que el indice Kappa y el Accuracy son superiores en el modelo 2. En particular el indice Kappa es de 0.6315 (modelo 2) Vs 0.5483 (Modelo 1). El accuracy es de 0.8285 (Modelo 2) Vs 0.7714 (Modelo 1). Sin embargo, como se habia indicado anteriormente el modelo 2 tiene una peor sensitivity, 0.86 (Modelo 1) Vs 0.6 (Modelo 2). Y las metricas de F1, recall, y detecation rate se puede observar que el Modelo 1 tiene un mejor desempeno, por lo cual es importante analizar el tema de costos para poder elegir el mejor modelo y no basarse simplemente en las metricas generales.
##
## Call:
## glm(formula = Acc ~ ., family = binomial, data = Accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -19.97398 9.23723 -2.162 0.0306 *
## Exp -0.47952 0.33645 -1.425 0.1541
## Edad -0.02585 0.08801 -0.294 0.7689
## Pot 0.24687 0.10715 2.304 0.0212 *
## SexoHombre 3.04940 2.36426 1.290 0.1971
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
##
## Call:
## glm(formula = Acc ~ . + .:Sexo - Edad:Sexo - Exp:Sexo - Edad -
## Sexo - Exp, family = binomial, data = Accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -20.56184 8.47341 -2.427 0.0152 *
## Pot 0.19909 0.08765 2.271 0.0231 *
## Pot:SexoHombre 0.02333 0.01353 1.724 0.0846 .
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 18.483 on 32 degrees of freedom
## AIC: 24.483
##
## Number of Fisher Scoring iterations: 7
| Coef | 2.5 % | 97.5 % | e-beta | 2.5 % | 97.5 % | |
|---|---|---|---|---|---|---|
| (Intercept) | -20.5618432 | -42.4558784 | -7.9872183 | 0.000000 | 0.000000 | 0.0003398 |
| Pot | 0.1990874 | 0.0688172 | 0.4249285 | 1.220289 | 1.071240 | 1.5294811 |
| Pot:SexoHombre | 0.0233265 | -0.0017425 | 0.0538366 | 1.023601 | 0.998259 | 1.0553122 |
| AIC | deviance | R2 | |
|---|---|---|---|
| Modelo_1 | 44.00583 | 40.00583 | 0.1631205 |
| Modelo_2 | 35.24875 | 29.24875 | 0.3881471 |
| Modelo_11 | 24.48275 | 18.48275 | 0.6133604 |
| Df | Deviance | Resid. Df | Resid. Dev | Pr(>Chi) | |
|---|---|---|---|---|---|
| NULL | NA | NA | 34 | 47.80357 | NA |
| Pot | 1 | 25.999292 | 33 | 21.80428 | 0.0000003 |
| Pot:Sexo | 1 | 3.321521 | 32 | 18.48275 | 0.0683785 |
## Confusion Matrix and Statistics
##
## Reference
## Prediction No Si
## No 17 1
## Si 3 14
##
## Accuracy : 0.8857
## 95% CI : (0.7326, 0.968)
## No Information Rate : 0.5714
## P-Value [Acc > NIR] : 6.136e-05
##
## Kappa : 0.7705
##
## Mcnemar's Test P-Value : 0.6171
##
## Sensitivity : 0.9333
## Specificity : 0.8500
## Pos Pred Value : 0.8235
## Neg Pred Value : 0.9444
## Prevalence : 0.4286
## Detection Rate : 0.4000
## Detection Prevalence : 0.4857
## Balanced Accuracy : 0.8917
##
## 'Positive' Class : Si
##
## Sensitivity Specificity Pos Pred Value
## 0.9333333 0.8500000 0.8235294
## Neg Pred Value Precision Recall
## 0.9444444 0.8235294 0.9333333
## F1 Prevalence Detection Rate
## 0.8750000 0.4285714 0.4000000
## Detection Prevalence Balanced Accuracy
## 0.4857143 0.8916667
| No | Si | |
|---|---|---|
| No | 17 | 1 |
| Si | 3 | 14 |
| x | |
|---|---|
| Accuracy | 0.8857143 |
| Kappa | 0.7704918 |
| AccuracyLower | 0.7326220 |
| AccuracyUpper | 0.9679688 |
| AccuracyNull | 0.5714286 |
| AccuracyPValue | 0.0000614 |
| McnemarPValue | 0.6170751 |
| x | |
|---|---|
| Sensitivity | 0.9333333 |
| Specificity | 0.8500000 |
| Pos Pred Value | 0.8235294 |
| Neg Pred Value | 0.9444444 |
| Precision | 0.8235294 |
| Recall | 0.9333333 |
| F1 | 0.8750000 |
| Prevalence | 0.4285714 |
| Detection Rate | 0.4000000 |
| Detection Prevalence | 0.4857143 |
| Balanced Accuracy | 0.8916667 |
Se prueba con diferentes modelos al incluir las variables de potencia y Edad, evidenciando que el modelo mejora su desempeno pero volviendo significativa la potencia y no significativa las demas (sexo, Experiencia y Edad). Teniendo en cuenta esto y el nalisis descriptivo donde se evidenciaba que los hombres tenian mas accidentes se opto por colocar la interaccion entre el sexo y las demas variables en el modelo para verificar su desempeno. De esta manera se fue iterando manualmente hasta quedar en el modelo solo con Potencia y la interaccion enetre el sexo y la potencia. Este modelo tiene una devianza de 18.48. El test de verosimilitud indica que estamos muy seguros que la potencia tiene un impacto en la devianza de 25.99 ya que el valor P es 0. En el caso de la interaccion de sexo con potencia su impacto en la devianza es de 3.32, pero con un valor p en una zona gris 0.068, ligeramente superior al nivel de significancia de 0.05. Sin embargo este valor resulta sumamente relevante al correr el modelo ya que muestra un mejor desempeno que el modelo solo con la potencia. Por ejemplo el AUC de este modelo es de 0.945 y en el caso del modelo sin la interaccion es de 0.914, es decir mejora el AUC y reduce la devianza el conservar este termino. Adicionalmente al ajustar el punto de corte en 0.252, y realizar la matriz de confusion se obtiene que en este caso la instancias clasificadas correctamente son 31 al igual que con el modelo de solo potencia, pero con la ventaja que los falsos negativos son 1 en cambio en el modelo con solo la potencia los falsos negativos son 3. Es decir en ambos modelos las instancias clasificadas incorrectamente son las mismas, pero en el modelo propuesto es 1 solo falso negativo, y 3 falsos positivos. Por otro lado el modelo con solo la potencia son 3 falsos negativos y un falso positivo. En este caso para una aseguradora es peor un falso negativo ya que asegurarias y darias una prima baja a una persona que resultaria accidentandose y requiriendo desembolsos por parte de la compania.
Este reporte presenta un análisis detallado de los factores que influyen en la siniestralidad vehicular basado en datos de encuestas y modelos predictivos. Se evaluaron cuatro modelos, siendo el Modelo 4 el que demostro un desempeno superior en términos de métricas analíticas y operacionales. Se recomienda un análisis cuidadoso de los hallazgos para optimizar las estrategias de suscripción y precios de las pólizas.
Correlaciones:
Existe una baja correlación entre las variables numéricas de los encuestados, todas por debajo de 0.3. Las personas con más experiencia y mayor edad tienden a comprar vehículos de menor cilindrada. La edad y la experiencia de manejo están positivamente correlacionadas, aunque no de manera muy fuerte. Distribución de Accidentes:
Los hombres representan el 40% de los encuestados pero el 73% de los accidentes reportados. El 78.6% de los hombres y el 19% de las mujeres han sufrido accidentes. Las mujeres tienen, en promedio, más experiencia y mayor edad que los hombres. Los hombres suelen comprar vehículos de mayor potencia, lo cual se relaciona con una mayor siniestralidad. Los accidentes son más frecuentes entre personas con menor experiencia y edad, y que conducen vehículos de mayor potencia. 2. Evaluación de Modelos Predictivos:
Modelo 1:
Devianza residual: 40.06 AIC: No especificado Área bajo la curva (AUC): 0.798 Sensibilidad (Sensitivity): 0.86 Kappa: 0.5483 Clasificaciones correctas: 27 de 35 instancias Falsos positivos: 6, Falsos negativos: 2
Modelo 2:
Devianza residual: 29.49 AIC: No especificado AUC: 0.868 Sensibilidad: 0.60 Kappa: 0.6315 Clasificaciones correctas: 29 de 35 instancias Falsos positivos: 0, Falsos negativos: 6
Modelo 4: (Interacción Sexo y Potencia): Devianza residual: 18.48 AUC: 0.945 Clasificaciones correctas: 31 de 35 instancias Falsos positivos: 3, Falsos negativos: 1 Mejora en la precisión de predicción y reducción de devianza al incluir la interacción. Punto de corte optimizado: 0.252 Clasificaciones correctas: 32 de 35 instancias Falsos positivos: 3, Falsos negativos: 1 La optimización del punto de corte mejora la precisión de la predicción, minimizando los falsos negativos y manteniendo un bajo número de falsos positivos. 5. Recomendaciones:
Modelo Económicamente Viable:
El Modelo 4 muestra el mejor desempeño analítico y operacional por su alto Accuracy, alto AUC, baja devianza, bajo, AIC, alto R2, y baja tasa de falsos negativos (Alta Sensitivity) Se recomienda utilizar el Modelo 4 para reducir la subestimación de primas y evitar pérdidas económicas. Este modelo, es el más preciso y debe utilizarse para análisis detallados y ajustes futuros. Sus métricas indican una excelente capacidad predictiva y un ajuste robusto al fenómeno de siniestralidad.