#Caso 1

## 'data.frame':    25 obs. of  3 variables:
##  $ Conf  : int  1 0 1 0 1 1 0 0 0 1 ...
##  $ Carga : num  1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
##  $ Tiempo: num  0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
  1. Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación.

Se puede evidenciar que si existe una relacion lineal entre el tiempo de respuesta del disco y la carga del sistema. Esta es una relacion directa, es decir a mayor tamano de carga mayor el tiempo de respuesta. Adicionalmente podemos afirmar que es una relacion fuerte, ya que es muy cercana a 1 (0,93). Por otro lado se puede observar que aunque existe una relacion lineal entre las dos variables esta relacion es distinta en cuanto a pendiente e intercepto entre las categorias HDD y SDD. En relacion con la correlacion separado por cada tipo de disco se puede observar que la relacion entre el tiempo y los discos tipo HDD es una relacion fuerte (0,96) pero aun mas fuerte es la relacion entre SDD y el tiempo siendo de 0,99.

  1. Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.
## 
## Call:
## lm(formula = Tiempo ~ Carga, data = Discos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

## 
##  One Sample t-test
## 
## data:  residuos
## t = 1.8453e-16, df = 24, p-value = 1
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  -0.2358863  0.2358863
## sample estimates:
##   mean of x 
## 2.10899e-17
## 
##  studentized Breusch-Pagan test
## 
## data:  Modelo_1
## BP = 0.43435, df = 1, p-value = 0.5099
## 
##  Durbin-Watson test
## 
## data:  Modelo_1
## DW = 2.365, p-value = 0.7755
## alternative hypothesis: true autocorrelation is greater than 0
## 
##  Shapiro-Wilk normality test
## 
## data:  residuos
## W = 0.98568, p-value = 0.9702

De acuerdo con el modelo la variable carga explica el 85,17% de la variabilidad de la variable tiempo. La interpretacion es que en la medida que se haga una consulta adicional el tiempo aumentara en 0,49 segundos. El intercepto muestra que en la medida que las consultas se acerquen a 0 el tiempo de consulta tendera a 0 igualmente. De igual manera se observa el cumplimiento de los supuestos de homocedasticidad, normalidad de los residuos,independencia. Sin embargo en el grafico de escala-locacion hay un tramo que la linea toma una curva que puede deberse a que en esa proximidad donde se presenta la curva en el graficos en el diagrama de dispersion se cruzan las lineas suavizadas de las observaciones HDD y SDD. Esto podria validarse incluyendo una variable dummy que represente el tipo de disco, y analizar si el ajuste del modelo mejora.

  1. Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2. Recom. Note que la pendiente y el intercepto no son los mismos para los dos tipos de discos. 5)Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.
## 'data.frame':    25 obs. of  3 variables:
##  $ Carga  : num  1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
##  $ Tiempo : num  0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
##  $ ConfHDD: num  1 0 1 0 1 1 0 0 0 1 ...
## 
## Call:
## lm(formula = Tiempo ~ Carga + ConfHDD + Carga:ConfHDD, data = Discos_transf)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.68547 -0.11333  0.06881  0.15302  0.41807 
## 
## Coefficients:
##                Estimate Std. Error t value Pr(>|t|)    
## (Intercept)    -1.37549    0.20902  -6.581 1.62e-06 ***
## Carga           0.71979    0.03367  21.376 9.88e-16 ***
## ConfHDD1        2.26391    0.26520   8.536 2.86e-08 ***
## Carga:ConfHDD1 -0.35734    0.04227  -8.454 3.36e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared:  0.9692, Adjusted R-squared:  0.9648 
## F-statistic: 220.2 on 3 and 21 DF,  p-value: 5.042e-16

## 
##  One Sample t-test
## 
## data:  residuos2
## t = -1.5145e-16, df = 24, p-value = 1
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  -0.1098263  0.1098263
## sample estimates:
##     mean of x 
## -8.058875e-18
## 
##  studentized Breusch-Pagan test
## 
## data:  Modelo_2
## BP = 2.6825, df = 3, p-value = 0.4432
## 
##  Durbin-Watson test
## 
## data:  Modelo_2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
## 
##  Shapiro-Wilk normality test
## 
## data:  residuos2
## W = 0.95551, p-value = 0.3323

En ese nuevo modelo podemos ver un mejor ajuste. Este nuevo modelo explica el 96,48% de la variabilidad del tiempo de respuesta. Se puede evidenciar que todos los terminos son significativos. El coeficiente de la variable Carga es 0.719 lo que significa que si se incrementa en una unidad el numero de requerimientos el tiempo de ejecucion se incrementa en 0,719 segundos. Adicionalmente si el tipo de disco es HDD el intercepto cambia a 0,888, y la pendiente cambia a 0,362. Esto quiere decir que para los discos HDD el aumento en el tiempo de ejecucion es de 0,362 segundos por cada requerimiento adicional. Si el disco es del tipo SDD se incrementa en 0,719 segundos por cada aumento en una unidad en el numero de requerimientos.Si el disco es HDD el intercepto es 0,888 y si el disco es SDD el intercepto es -1,375. En relacion con el cumplimiento de los supuestos se observa que este modelo cumple de mejor manera que el anterior. La unica observacion a tener en cuenta es que la observacion 13 tiene un valor cercano a 1 en la distancia Cook. Sin embargo no supera este valor el cual es valido para pocas observaciones como en nuestro caso.Por otro lado en el caso del grafico qq, se ven unos puntos alejados de la linea ideal que puede deberse al hecho de que el modelo tiene una variable categorica que ademas tiene interaccion con la numerica, ya que el ajuste en eese sentido es mejor en el modelo 1, sin embargo la prueba shapiro es mejor con un valor p de 0,33; lo que indica aceptacion de la hipotesis nula (los residuos siguen una distribucion normal).

## Analysis of Variance Table
## 
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga + ConfHDD + Carga:ConfHDD
##   Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
## 1     23 7.8375                                  
## 2     21 1.6990  2    6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

La ejecucion de la prueba ANOVA nos indica que existe una diferencia estadistica significativa en el desempeno de los dos modelos, es decir se puede puede concluir que el Modelo_2 es mejor que el primero.La reducción significativa en el RSS de 7.8375 a 1.6990 indica que el Modelo 2 se ajusta a los datos mucho mejor que el Modelo 1. Adicionalmente, eEl valor p muy bajo (1.067e-07) indica que la mejora en el ajuste del modelo debido a la inclusión de ConfHDD y Carga es estadísticamente significativa. Esto indica que la interacción entre Carga y ConfHDD es importante y debe incluirse en el modelo, lo que sugiere que el efecto de Carga en Tiempo depende de si el disco duro es HDD o no. Hay una interacción significativa entre Carga y ConfHDD, lo que indica que el impacto de Carga en Tiempo es diferente según el tipo de disco duro.

En resumen, los resultados del análisis ANOVA y la comparación de los modelos indican claramente que el Modelo_2 es superior al Modelo_1 en términos de ajuste a los datos. La reducción significativa en el error residual (RSS) y el valor extremadamente bajo de p indican que la inclusión de las variables ConfHDD y Carga, así como su interacción, mejora de manera estadísticamente significativa la capacidad del modelo para explicar el tiempo. Es crucial considerar la interacción entre Carga y ConfHDD, ya que indica que el efecto de la variable Carga en el tiempo depende del tipo de disco duro, HDD o no. En conclusión, estos hallazgos respaldan la idea de que el Modelo_2 no solo es más adecuado, sino que también proporciona una comprensión más precisa y detallada del fenómeno estudiado en comparación con el Modelo_1. Se evidencia que es necesario analizar estos modelos teniendo en cuenta las interacciones de las variables para tener ajustes mas acertados de los mismos, esta inclusion en el modelo ayuda tambien a un mejor cumplimiento de los supuestos en este caso en particular.


#Caso 2 Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información (accidentes.xlsx): Acc : haber tenido algún accidente en el último año (0:no; 1:sí). Exp : años de experiencia. Edad : edad del conductor. Pot : potencia del motor. Sexo : 1 (mujer), 2 (hombre). 1) Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).

## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
##  $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
##  $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
##  $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
##  $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
##  $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...
##  Acc          Exp              Edad         Pot            Sexo   
##  No:20   Min.   : 1.000   Min.   :20   Min.   : 70.0   Mujer :21  
##  Si:15   1st Qu.: 6.500   1st Qu.:25   1st Qu.: 90.0   Hombre:14  
##          Median : 9.000   Median :29   Median : 95.0              
##          Mean   : 9.543   Mean   :31   Mean   :101.6              
##          3rd Qu.:12.000   3rd Qu.:36   3rd Qu.:110.0              
##          Max.   :20.000   Max.   :56   Max.   :150.0
Resumen Experiencia,Edad,Potencia
Promedio Desviación Mediana
Exp 9.542857 4.779508 9
Edad 31.000000 8.547445 29
Pot 101.571429 20.028341 95
Tabla de Contingencia de los accidentes por genero
Mujer Hombre
No 17 3
Si 4 11

Se observa que existe una baja correlacion entre las variables numericas que se consideran de los encuestados. Las correlaciones son del orden de 0,3 e inferiores.Puede indicar que por ejemplo personas con mas experiencia tienden a comprar vehiculos de menos cilindrada, lo mismo las personas con mas edad prefieren vehiculo de menos cilindrada. Por ultimo la edad y la experiencia de manejo tienen un coeficiente de correlacion positivo lo cual tiene sentido pero no es un valor tan alto, lo que puede deberse a que algunas personas aprenden a manejar a una edad mayor.Se observa que aunque los hombres son el 40% de los encuestados, representan un 73% de los accidentes reportados. Es decir que el 78,6% de los hombres y el 19% de las mujeres sufrieron accidentes. Se observa que en promedio las mujeres del estudio tienen mas experiencia y edad que los hombres. Tambien se observa que los hombres en general compran vehiculos de mas potencia que las mujeres. Asimismo, se observa los accidentes son en su mayoria cometidos por personas con menor experiencia y edad. Finalmente las personas accidentadas tienen vehiculo de mayor potencia.

2)Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística: Modelo 1: Acc ~ Exp Modelo 2: Acc ~ Exp + genero Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).

## 'data.frame':    35 obs. of  5 variables:
##  $ Acc : Factor w/ 2 levels "No","Si": 1 1 1 2 1 2 1 2 1 2 ...
##  $ Exp : num  10 15 7 1 10 2 8 20 18 4 ...
##  $ Edad: num  30 40 25 21 29 20 40 25 43 23 ...
##  $ Pot : num  90 85 95 145 70 120 95 135 85 110 ...
##  $ Sexo: Factor w/ 2 levels "Mujer","Hombre": 1 1 1 2 1 2 1 2 1 2 ...
## 
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = Accidentes)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4
## 
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = Accidentes)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)   
## (Intercept)   0.8890     1.2252   0.726  0.46808   
## Exp          -0.2400     0.1176  -2.040  0.04131 * 
## SexoHombre    2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

Se observa que con los con el Modelo 2 se obtiene un mejor comportamiento en el desempeno de la prediccion. La devianza residual se redujo de 40,06 a 29,49. Igualmente en los graficos de caja y bigotes se observa que las predicciones de No son valores mas cercanos a 0 y las de Si son mas cercanos a 1, es decir el modelo predice mejor y se reduce la confusion entre las predicciones al reducirce el traslape de las variaciones de probabilidades predichas para la ocurrencia y no ocurrencia de accidentes.Se puede ver que en el segundo modelo la variable categorica Sexo se convierte en una dummy (SexoHombre) que toma el valor de 1 si la persona es hombre y el valor de 0 si es mujer.

3)Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.

Modelo 1: P(Acc = Si) = 1/(1 + exp(-(1.942 - 0.246Exp))) Modelo 2: P(Acc = Si) = 1/(1 + exp(-(0.889 - 0.24Exp + 2.986*SexoHombre)))

4)A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.

Intervalos de confianza Modelo 1
Coef 2.5 % 97.5 % e-beta 2.5 % 97.5 %
(Intercept) 1.941925 0.1848551 4.1386278 6.9721601 1.2030441 62.7167043
Exp -0.245607 -0.4859059 -0.0660143 0.7822295 0.6151397 0.9361174
Intervalos de confianza Modelo 2
Coef 2.5 % 97.5 % e-beta 2.5 % 97.5 %
(Intercept) 0.8890341 -1.3776790 3.6489708 2.432779 0.2521631 38.4350894
Exp -0.2399985 -0.5285605 -0.0401726 0.786629 0.5894529 0.9606236
SexoHombre 2.9865699 1.1292126 5.5884081 19.817589 3.0932200 267.3097416
Bondad de Ajuste Modelos 1 y 2
AIC deviance R2
Modelo_1 44.00583 40.00583 0.1631205
Modelo_2 35.24875 29.24875 0.3881471
Test Verosimilitud Modelo 1
Df Deviance Resid. Df Resid. Dev Pr(>Chi)
NULL NA NA 34 47.80357 NA
Exp 1 7.797742 33 40.00583 0.0052312
Test Verosimilitud Modelo 2
Df Deviance Resid. Df Resid. Dev Pr(>Chi)
NULL NA NA 34 47.80357 NA
Exp 1 7.797742 33 40.00583 0.0052312
Sexo 1 10.757076 32 29.24875 0.0010388

## Confusion Matrix and Statistics
## 
##           Reference
## Prediction No Si
##         No 14  2
##         Si  6 13
##                                           
##                Accuracy : 0.7714          
##                  95% CI : (0.5986, 0.8958)
##     No Information Rate : 0.5714          
##     P-Value [Acc > NIR] : 0.01134         
##                                           
##                   Kappa : 0.5484          
##                                           
##  Mcnemar's Test P-Value : 0.28884         
##                                           
##             Sensitivity : 0.8667          
##             Specificity : 0.7000          
##          Pos Pred Value : 0.6842          
##          Neg Pred Value : 0.8750          
##              Prevalence : 0.4286          
##          Detection Rate : 0.3714          
##    Detection Prevalence : 0.5429          
##       Balanced Accuracy : 0.7833          
##                                           
##        'Positive' Class : Si              
## 
##          Sensitivity          Specificity       Pos Pred Value 
##            0.8666667            0.7000000            0.6842105 
##       Neg Pred Value            Precision               Recall 
##            0.8750000            0.6842105            0.8666667 
##                   F1           Prevalence       Detection Rate 
##            0.7647059            0.4285714            0.3714286 
## Detection Prevalence    Balanced Accuracy 
##            0.5428571            0.7833333
## Confusion Matrix and Statistics
## 
##           Reference
## Prediction No Si
##         No 20  6
##         Si  0  9
##                                           
##                Accuracy : 0.8286          
##                  95% CI : (0.6635, 0.9344)
##     No Information Rate : 0.5714          
##     P-Value [Acc > NIR] : 0.001202        
##                                           
##                   Kappa : 0.6316          
##                                           
##  Mcnemar's Test P-Value : 0.041227        
##                                           
##             Sensitivity : 0.6000          
##             Specificity : 1.0000          
##          Pos Pred Value : 1.0000          
##          Neg Pred Value : 0.7692          
##              Prevalence : 0.4286          
##          Detection Rate : 0.2571          
##    Detection Prevalence : 0.2571          
##       Balanced Accuracy : 0.8000          
##                                           
##        'Positive' Class : Si              
## 
##          Sensitivity          Specificity       Pos Pred Value 
##            0.6000000            1.0000000            1.0000000 
##       Neg Pred Value            Precision               Recall 
##            0.7692308            1.0000000            0.6000000 
##                   F1           Prevalence       Detection Rate 
##            0.7500000            0.4285714            0.2571429 
## Detection Prevalence    Balanced Accuracy 
##            0.2571429            0.8000000
Matriz de confusion Modelo 1
No Si
No 14 2
Si 6 13
Matriz de confusion Modelo 2
No Si
No 20 6
Si 0 9
Indicadores de desempeno generales Modelo 1
x
Accuracy 0.7714286
Kappa 0.5483871
AccuracyLower 0.5986367
AccuracyUpper 0.8957896
AccuracyNull 0.5714286
AccuracyPValue 0.0113424
McnemarPValue 0.2888444
Indicadores de desempeno por clase Modelo 1
x
Sensitivity 0.8666667
Specificity 0.7000000
Pos Pred Value 0.6842105
Neg Pred Value 0.8750000
Precision 0.6842105
Recall 0.8666667
F1 0.7647059
Prevalence 0.4285714
Detection Rate 0.3714286
Detection Prevalence 0.5428571
Balanced Accuracy 0.7833333
Indicadores de desempeno generales Modelo 2
x
Accuracy 0.8285714
Kappa 0.6315789
AccuracyLower 0.6635017
AccuracyUpper 0.9343782
AccuracyNull 0.5714286
AccuracyPValue 0.0012018
McnemarPValue 0.0412268
Indicadores de desempeno por clase Modelo 2
x
Sensitivity 0.6000000
Specificity 1.0000000
Pos Pred Value 1.0000000
Neg Pred Value 0.7692308
Precision 1.0000000
Recall 0.6000000
F1 0.7500000
Prevalence 0.4285714
Detection Rate 0.2571429
Detection Prevalence 0.2571429
Balanced Accuracy 0.8000000

De acuerdo con las metricas revisadas se puede observar que el modelo 2 es mejor que el primero, ya que su AIC y devianza son considerablemente mas bajos que los del modelo 1, y ademas su R2 tambien es considerablemnte mas alto. Adicionalemnte el area bajo la curva es de 0.798 en el modelo 1 y en cambio en el modelo 2 es de 0.868, mostrando igualmente su mejora capacidad de prediccion, y por consiguiente un mejor ajuste para describir el fenomeno estudiado (accidentalidad). En relacion con el modelo 2 al analizar su test de verosimilitud, se identifica que los terminos son significativos con probabilidad muy inferiores a 0.05. En este sentido el modelo esta altamente seguro de que la devianza asociada a Exp es de 7.79 y la de Sexo es de 10.75, mostrando como estas dos variables ayudan explicar mejor la variabilidad de la variable de respuesta que es la ocurrencia o no de accidentes. Una vez revisadas las curvas AUC y buscando optimizar las predicciones y mejorar el desempeno de los dos modelos se busco optimizar el punto de corte. El del modelo 1 paso a ser 0.404 y el del modelo 2 0.845. Con estos ajustes en el punto de corte se generaron los indicadores finales de desempeno de clasificacion. En primer lugar la matriz de confusion en la cual se ve que el modelo 1 clasifica correctamente 27 instancias de las 35 disponibles. Incurriendo en falsos positivos en 6 ocasiones y falsos negaticos en 2 ocasiones. Por otro lado el Modelo 2 tiene 29 instancias clasificadas correctamente sin falsos positivos pero con mas falsos negativos que el modelo 1. Sin embargo esto debe debe analizarse muy bien, ya que el modelo 1 tiene un sensitivity de 0.86 y el modelo 2 de 0.6. Esto quiere decir que el modelo 2 es propenso a indicar con mas frecuencia que una persona NO tendra un accidente cuando en realidad Si lo tendra, lo cual le generara perjuicios a la empresa, ya que estimara una prima mas baja para esa persona de lo que debiera ser.

  1. Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.

En mi opinion el mejor modelo para la empresa es el MODELO 1, ya que es el modelo que le permitira asegurar de mejor manera a la personas y los errores de falsos negativos seran menos incurriendo menos veces en dar una prima baja erroneamente y en el caso de un falso positivo se dara una prima alta que se podra ir reduciendo an la medida que la persona pase determinados umbrales de tiempo sin accidentes.

En terminos solo de metricas de analitica se consideraria que el mejor modelo es el Modelo 2 ya que indice Kappa es de 0.6315 contra el del Modelo 1 que es 0.5483. Se interpretaran los coeficientes de este modelo y se considerara como mejor debido a su mejor accuracy y Kappa, pero dejando claro que el modelo 1 desde el punto de vista economico puede ser mejor que el segundo. Al revisar la tabla de los coeficientes se puede ver que en el caso de la experiencia (Exp) el valor de exp(-0.2399) = 0.7866, es decir que la experiencia reduce la las odds de ocurencia de accidente en un 11.34% aproximadamente por cada ano de experiencia. Estamos muy seguros de que es un factor protector ya que el intervalo de confianza no contiene el 1. Por otro lado el hecho de que la persona sea hombre incremente a 19.81 veces las odds de ocurrencia de accidente Vs No ocurrencia de accidente. En este caso tambien se esta bastante seguro de este efecto de potenciar la ocurrencia del evento ya que el intervalo de confianza no contiene el 1 y su menos valor es de 3.09. Como se habia indicado anteriormente en ambos coeficientes la prueba de significancia de chi cuadrado en el test de verosimilitud arrojaron valores muy inferiores al nivel de significancia (0.05), por lo cual estamos bastante seguros de la significancia de los coeficientes.

6)Para el modelo seleccionado en el punto v. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).

De acuerdo con el desempeno del modelo se puede identificar que el indice Kappa y el Accuracy son superiores en el modelo 2. En particular el indice Kappa es de 0.6315 (modelo 2) Vs 0.5483 (Modelo 1). El accuracy es de 0.8285 (Modelo 2) Vs 0.7714 (Modelo 1). Sin embargo, como se habia indicado anteriormente el modelo 2 tiene una peor sensitivity, 0.86 (Modelo 1) Vs 0.6 (Modelo 2). Y las metricas de F1, recall, y detecation rate se puede observar que el Modelo 1 tiene un mejor desempeno, por lo cual es importante analizar el tema de costos para poder elegir el mejor modelo y no basarse simplemente en las metricas generales.

  1. Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.
## 
## Call:
## glm(formula = Acc ~ ., family = binomial, data = Accidentes)
## 
## Coefficients:
##              Estimate Std. Error z value Pr(>|z|)  
## (Intercept) -19.97398    9.23723  -2.162   0.0306 *
## Exp          -0.47952    0.33645  -1.425   0.1541  
## Edad         -0.02585    0.08801  -0.294   0.7689  
## Pot           0.24687    0.10715   2.304   0.0212 *
## SexoHombre    3.04940    2.36426   1.290   0.1971  
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 12.700  on 30  degrees of freedom
## AIC: 22.7
## 
## Number of Fisher Scoring iterations: 8
## 
## Call:
## glm(formula = Acc ~ . + .:Sexo - Edad:Sexo - Exp:Sexo - Edad - 
##     Sexo - Exp, family = binomial, data = Accidentes)
## 
## Coefficients:
##                 Estimate Std. Error z value Pr(>|z|)  
## (Intercept)    -20.56184    8.47341  -2.427   0.0152 *
## Pot              0.19909    0.08765   2.271   0.0231 *
## Pot:SexoHombre   0.02333    0.01353   1.724   0.0846 .
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 18.483  on 32  degrees of freedom
## AIC: 24.483
## 
## Number of Fisher Scoring iterations: 7
Intervalos de confianza Modelo 4
Coef 2.5 % 97.5 % e-beta 2.5 % 97.5 %
(Intercept) -20.5618432 -42.4558784 -7.9872183 0.000000 0.000000 0.0003398
Pot 0.1990874 0.0688172 0.4249285 1.220289 1.071240 1.5294811
Pot:SexoHombre 0.0233265 -0.0017425 0.0538366 1.023601 0.998259 1.0553122
Bondad de Ajuste Modelos 1, 2 y 4
AIC deviance R2
Modelo_1 44.00583 40.00583 0.1631205
Modelo_2 35.24875 29.24875 0.3881471
Modelo_11 24.48275 18.48275 0.6133604
Test Verosimilitud Modelo 4
Df Deviance Resid. Df Resid. Dev Pr(>Chi)
NULL NA NA 34 47.80357 NA
Pot 1 25.999292 33 21.80428 0.0000003
Pot:Sexo 1 3.321521 32 18.48275 0.0683785

## Confusion Matrix and Statistics
## 
##           Reference
## Prediction No Si
##         No 17  1
##         Si  3 14
##                                          
##                Accuracy : 0.8857         
##                  95% CI : (0.7326, 0.968)
##     No Information Rate : 0.5714         
##     P-Value [Acc > NIR] : 6.136e-05      
##                                          
##                   Kappa : 0.7705         
##                                          
##  Mcnemar's Test P-Value : 0.6171         
##                                          
##             Sensitivity : 0.9333         
##             Specificity : 0.8500         
##          Pos Pred Value : 0.8235         
##          Neg Pred Value : 0.9444         
##              Prevalence : 0.4286         
##          Detection Rate : 0.4000         
##    Detection Prevalence : 0.4857         
##       Balanced Accuracy : 0.8917         
##                                          
##        'Positive' Class : Si             
## 
##          Sensitivity          Specificity       Pos Pred Value 
##            0.9333333            0.8500000            0.8235294 
##       Neg Pred Value            Precision               Recall 
##            0.9444444            0.8235294            0.9333333 
##                   F1           Prevalence       Detection Rate 
##            0.8750000            0.4285714            0.4000000 
## Detection Prevalence    Balanced Accuracy 
##            0.4857143            0.8916667
Matriz de confusion Modelo 4
No Si
No 17 1
Si 3 14
Indicadores de desempeno generales Modelo 4
x
Accuracy 0.8857143
Kappa 0.7704918
AccuracyLower 0.7326220
AccuracyUpper 0.9679688
AccuracyNull 0.5714286
AccuracyPValue 0.0000614
McnemarPValue 0.6170751
Indicadores de desempeno por clase Modelo 4
x
Sensitivity 0.9333333
Specificity 0.8500000
Pos Pred Value 0.8235294
Neg Pred Value 0.9444444
Precision 0.8235294
Recall 0.9333333
F1 0.8750000
Prevalence 0.4285714
Detection Rate 0.4000000
Detection Prevalence 0.4857143
Balanced Accuracy 0.8916667

Se prueba con diferentes modelos al incluir las variables de potencia y Edad, evidenciando que el modelo mejora su desempeno pero volviendo significativa la potencia y no significativa las demas (sexo, Experiencia y Edad). Teniendo en cuenta esto y el nalisis descriptivo donde se evidenciaba que los hombres tenian mas accidentes se opto por colocar la interaccion entre el sexo y las demas variables en el modelo para verificar su desempeno. De esta manera se fue iterando manualmente hasta quedar en el modelo solo con Potencia y la interaccion enetre el sexo y la potencia. Este modelo tiene una devianza de 18.48. El test de verosimilitud indica que estamos muy seguros que la potencia tiene un impacto en la devianza de 25.99 ya que el valor P es 0. En el caso de la interaccion de sexo con potencia su impacto en la devianza es de 3.32, pero con un valor p en una zona gris 0.068, ligeramente superior al nivel de significancia de 0.05. Sin embargo este valor resulta sumamente relevante al correr el modelo ya que muestra un mejor desempeno que el modelo solo con la potencia. Por ejemplo el AUC de este modelo es de 0.945 y en el caso del modelo sin la interaccion es de 0.914, es decir mejora el AUC y reduce la devianza el conservar este termino. Adicionalmente al ajustar el punto de corte en 0.252, y realizar la matriz de confusion se obtiene que en este caso la instancias clasificadas correctamente son 31 al igual que con el modelo de solo potencia, pero con la ventaja que los falsos negativos son 1 en cambio en el modelo con solo la potencia los falsos negativos son 3. Es decir en ambos modelos las instancias clasificadas incorrectamente son las mismas, pero en el modelo propuesto es 1 solo falso negativo, y 3 falsos positivos. Por otro lado el modelo con solo la potencia son 3 falsos negativos y un falso positivo. En este caso para una aseguradora es peor un falso negativo ya que asegurarias y darias una prima baja a una persona que resultaria accidentandose y requiriendo desembolsos por parte de la compania.

  1. Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.

Este reporte presenta un análisis detallado de los factores que influyen en la siniestralidad vehicular basado en datos de encuestas y modelos predictivos. Se evaluaron cuatro modelos, siendo el Modelo 4 el que demostro un desempeno superior en términos de métricas analíticas y operacionales. Se recomienda un análisis cuidadoso de los hallazgos para optimizar las estrategias de suscripción y precios de las pólizas.

  1. Análisis Descriptivo:

Correlaciones:

Existe una baja correlación entre las variables numéricas de los encuestados, todas por debajo de 0.3. Las personas con más experiencia y mayor edad tienden a comprar vehículos de menor cilindrada. La edad y la experiencia de manejo están positivamente correlacionadas, aunque no de manera muy fuerte. Distribución de Accidentes:

Los hombres representan el 40% de los encuestados pero el 73% de los accidentes reportados. El 78.6% de los hombres y el 19% de las mujeres han sufrido accidentes. Las mujeres tienen, en promedio, más experiencia y mayor edad que los hombres. Los hombres suelen comprar vehículos de mayor potencia, lo cual se relaciona con una mayor siniestralidad. Los accidentes son más frecuentes entre personas con menor experiencia y edad, y que conducen vehículos de mayor potencia. 2. Evaluación de Modelos Predictivos:

Modelo 1:

Devianza residual: 40.06 AIC: No especificado Área bajo la curva (AUC): 0.798 Sensibilidad (Sensitivity): 0.86 Kappa: 0.5483 Clasificaciones correctas: 27 de 35 instancias Falsos positivos: 6, Falsos negativos: 2

Modelo 2:

Devianza residual: 29.49 AIC: No especificado AUC: 0.868 Sensibilidad: 0.60 Kappa: 0.6315 Clasificaciones correctas: 29 de 35 instancias Falsos positivos: 0, Falsos negativos: 6

Modelo 4: (Interacción Sexo y Potencia): Devianza residual: 18.48 AUC: 0.945 Clasificaciones correctas: 31 de 35 instancias Falsos positivos: 3, Falsos negativos: 1 Mejora en la precisión de predicción y reducción de devianza al incluir la interacción. Punto de corte optimizado: 0.252 Clasificaciones correctas: 32 de 35 instancias Falsos positivos: 3, Falsos negativos: 1 La optimización del punto de corte mejora la precisión de la predicción, minimizando los falsos negativos y manteniendo un bajo número de falsos positivos. 5. Recomendaciones:

Modelo Económicamente Viable:

El Modelo 4 muestra el mejor desempeño analítico y operacional por su alto Accuracy, alto AUC, baja devianza, bajo, AIC, alto R2, y baja tasa de falsos negativos (Alta Sensitivity) Se recomienda utilizar el Modelo 4 para reducir la subestimación de primas y evitar pérdidas económicas. Este modelo, es el más preciso y debe utilizarse para análisis detallados y ajustes futuros. Sus métricas indican una excelente capacidad predictiva y un ajuste robusto al fenómeno de siniestralidad.