Punto 1

Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).

A continuación se presentan los datos:

## # A tibble: 6 × 3
##    Conf Carga Tiempo
##   <dbl> <dbl>  <dbl>
## 1     1   1      0.9
## 2     0   2      0.3
## 3     1   2.4    2  
## 4     0   3.1    0.8
## 5     1   4      2.7
## 6     1   4.3    2.6

a) Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación.

Con las gráficas anteriores se pude evidenciar que existe una relación lineal entre carga de trabajo y tiempo de respuesta para ambos discos, por lo que en los 2 casos entre mayor carga de trabajo habrá un mayor tiempo para la respuesta del disco.

b) Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.

## 
## Call:
## lm(formula = Tiempo ~ Carga, data = datos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

A partir de lo anterior se puede decir que el modelo de regresión simple muestra que el tiempo de respuesta (Tiempo) está relacionado significativamente con la carga de trabajo (Carga). El coeficiente de Carga es 0.49, lo que indica que, en promedio, el tiempo de respuesta aumenta en 0.49 segundos por cada unidad adicional de carga. El modelo explica aproximadamente el 85.79% de la variabilidad en el tiempo de respuesta (R² = 0.8579), lo que muestra un buen ajuste. El modelo es también estadísticamente significativo (p-value < 0.001).

c) Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2.

## 
## Call:
## lm(formula = Tiempo ~ Carga + Conf + Carga:Conf, data = datos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.68547 -0.11333  0.06881  0.15302  0.41807 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) -1.37549    0.20902  -6.581 1.62e-06 ***
## Carga        0.71979    0.03367  21.376 9.88e-16 ***
## Conf         2.26391    0.26520   8.536 2.86e-08 ***
## Carga:Conf  -0.35734    0.04227  -8.454 3.36e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared:  0.9692, Adjusted R-squared:  0.9648 
## F-statistic: 220.2 on 3 and 21 DF,  p-value: 5.042e-16

El modelo 2 muestra que tanto la carga del sistema como el tipo de disco duro tienen efectos significativos en el tiempo de respuesta. Los coeficientes revelan que por cada unidad adicional de carga, el tiempo de respuesta aumenta en 0.72 unidades. Además, los discos SSD tienen un tiempo de respuesta 2.26 unidades menor que los HDD. El modelo explica el 96.48% de la variabilidad del tiempo de respuesta, siendo significativo con un p-value muy bajo.

d) Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.

## Analysis of Variance Table
## 
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga + Conf + Carga:Conf
##   Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
## 1     23 7.8375                                  
## 2     21 1.6990  2    6.1386 37.938 1.067e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Con el test ANOVA podemos decir que el Modelo 2, que incluye la configuración del disco duro y su interacción con la carga, mejora el ajuste respecto al Modelo 1, que solo considera la carga. Esto se evidencia por el estadístico F de 37.938 con un p-valor muy bajo (1.067e-07).

e) Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.

## 
##  Shapiro-Wilk normality test
## 
## data:  residuals(Modelo2)
## W = 0.95551, p-value = 0.3323
## 
##  studentized Breusch-Pagan test
## 
## data:  Modelo2
## BP = 2.6825, df = 3, p-value = 0.4432
## 
##  Durbin-Watson test
## 
## data:  Modelo2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0

De los test anteriores podemos decir que la normalidad de los residuos arrojó un valor p de 0.3323, lo que sugiere que los residuos siguen aproximadamente una distribución normal. En cuanto a la homogeneidad de la varianza de los residuos, se obtuvo un valor p de 0.4432, indicando que la varianza de los residuos es constante a través de los niveles de la variable predictora. Sin embargo, la autocorrelación de los residuos, dio un valor p de 0.03421, revelando evidencia de autocorrelación positiva en los residuos del modelo.

f) Concluya de forma general.

Este análisis comparó el desempeño de discos duros SDD y HDD en relación con el tiempo de respuesta frente a la carga del sistema. Se encontró una relación lineal positiva entre la carga y el tiempo de respuesta para ambos tipos de disco. El Modelo 2, en el que que se incluyó la configuración del disco y su interacción con la carga, mostró un ajuste significativamente mejor que el Modelo 1 según el test ANOVA.

Además, la evaluación de los residuos del Modelo 2 indicó que cumplen con la normalidad y la homogeneidad de la varianza, pero se detectó autocorrelación positiva. Esto sugiere que las observaciones pueden no ser completamente independientes, lo cual es importante considerar al interpretar los resultados del modelo.

Punto 2

Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:

Acc: haber tenido algún accidente en el último año (0:no; 1:sí).

Exp: años de experiencia.

Edad: edad del conductor.

Pot: potencia del motor.

Sexo: 1 (mujer), 2 (hombre).

A continuación veremos parte de los datos para el análisis:

## # A tibble: 6 × 5
##     Acc   Exp  Edad   Pot  Sexo
##   <dbl> <dbl> <dbl> <dbl> <dbl>
## 1     0    10    30    90     1
## 2     0    15    40    85     1
## 3     0     7    25    95     1
## 4     1     1    21   145     2
## 5     0    10    29    70     1
## 6     1     2    20   120     2
## tibble [35 × 5] (S3: tbl_df/tbl/data.frame)
##  $ Acc : num [1:35] 0 0 0 1 0 1 0 1 0 1 ...
##  $ Exp : num [1:35] 10 15 7 1 10 2 8 20 18 4 ...
##  $ Edad: num [1:35] 30 40 25 21 29 20 40 25 43 23 ...
##  $ Pot : num [1:35] 90 85 95 145 70 120 95 135 85 110 ...
##  $ Sexo: num [1:35] 1 1 1 2 1 2 1 2 1 2 ...
##       Acc              Exp              Edad         Pot             Sexo    
##  Min.   :0.0000   Min.   : 1.000   Min.   :20   Min.   : 70.0   Min.   :1.0  
##  1st Qu.:0.0000   1st Qu.: 6.500   1st Qu.:25   1st Qu.: 90.0   1st Qu.:1.0  
##  Median :0.0000   Median : 9.000   Median :29   Median : 95.0   Median :1.0  
##  Mean   :0.4286   Mean   : 9.543   Mean   :31   Mean   :101.6   Mean   :1.4  
##  3rd Qu.:1.0000   3rd Qu.:12.000   3rd Qu.:36   3rd Qu.:110.0   3rd Qu.:2.0  
##  Max.   :1.0000   Max.   :20.000   Max.   :56   Max.   :150.0   Max.   :2.0

a) Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).

A partir de la visualización de los anteriores gráficos podemos decir lo siguiente:

b) Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística:

Modelo 1: Acc ~ Exp

Modelo 2: Acc ~ Exp + genero

Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).

## 
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = datos2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4
## 
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = datos2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)   
## (Intercept)  -2.0975     1.5546  -1.349  0.17725   
## Exp          -0.2400     0.1176  -2.040  0.04131 * 
## Sexo          2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

c) Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.

Modelo 1: Acc ~ Exp:

Siniestralidad = 1.9419 - 0.2456 * Experiencia

Esto según el modelo 1. Sin embargo, el intercepto debería ser 1 o 0 según los datos.

Modelo 2: Acc ~ Exp + genero:

Siniestralidad = −2.0975 − 0.2400 * Experiencia + 2.9866 * Sexo

Esto según el modelo 2. Sin embargo, el intercepto debería ser 1 o 0 según los datos. Además en la gráfica del modelo pueden apreciarse cambios muy grandes en la variable a predecir a medida que cambian las variables predictoras.

d) A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.

## Analysis of Deviance Table
## 
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp
##   Resid. Df Resid. Dev Df Deviance Pr(>Chi)   
## 1        34     47.804                        
## 2        33     40.006  1   7.7977 0.005231 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Según lo anterior el modelo 1 aporta para predecir la siniestralidad respecto al modelo más sencillo que puede usarse para este fin.

## Analysis of Deviance Table
## 
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp + Sexo
##   Resid. Df Resid. Dev Df Deviance  Pr(>Chi)    
## 1        34     47.804                          
## 2        32     29.249  2   18.555 9.351e-05 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
## 
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + Sexo
##   Resid. Df Resid. Dev Df Deviance Pr(>Chi)   
## 1        33     40.006                        
## 2        32     29.249  1   10.757 0.001039 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

De lo anterior podemos decir que el Modelo 2 es significativamente mejor para predecir si ocurrieron accidentes que el Modelo nulo. Esto significa que tanto la experiencia del conductor como su género ayudan a explicar mejor la ocurrencia de accidentes según los datos analizados.

Mientras que en comparación con el Modelo 1, que solo incluye la variable Experiencia, el Modelo 4, que añade la variable Sexo, muestra una mejora significativa para predecir si ocurrieron accidentes. El valor p bajo (0.001039) indica que la diferencia en la capacidad predictiva entre ambos modelos es estadísticamente significativa. Esto indica que las 2 variables predictivas del modelo 2 son útiles para predecir la siniestralidad.

e) Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.

Por los anteriores análisis se elige el modelo 2, pues ambos coeficientes (Experiencia y Sexo) tienen valores p significativamente bajos (< 0.05), lo que indica que son estadísticamente significativos.

f) Para el modelo seleccionado en el punto e. Evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).

Mejor punto de corte: Que este sea 0.84 significa que el modelo asigna una probabilidad de accidente (Accidente = 1) mayor o igual a 0.84.

AUC: Que haya dado 0.87 indica que el modelo tiene una buena capacidad discriminativa, para discernir que clientes son propensos a verse involucrados en accidentes.

g) Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.

## 
## Call:
## glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial, 
##     data = datos2)
## 
## Coefficients:
##              Estimate Std. Error z value Pr(>|z|)  
## (Intercept) -23.02338    9.90262  -2.325   0.0201 *
## Exp          -0.47952    0.33645  -1.425   0.1541  
## Sexo          3.04940    2.36426   1.290   0.1971  
## Edad         -0.02585    0.08801  -0.294   0.7689  
## Pot           0.24687    0.10715   2.304   0.0212 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 12.700  on 30  degrees of freedom
## AIC: 22.7
## 
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
## 
## Model 1: Acc ~ Exp + Sexo
## Model 2: Acc ~ Exp + Sexo + Edad + Pot
##   Resid. Df Resid. Dev Df Deviance  Pr(>Chi)    
## 1        32     29.249                          
## 2        30     12.700  2   16.549 0.0002549 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Lo anterior indica que que el Modelo 3 tiene un mejor ajuste a los datos comparado con el Modelo 2. Aunque la variable Edad y Sexo no son estadísticamente significativas según sus p-valores (0.769 y 0.197 respectivamente), la variable Potencia del motor es significativa (p = 0.021), contribuyendo al mejor ajuste del Modelo 5. Lo anterior también podría indicar que amerita testear más modelos con distintas combinaciones de variables, con el fin de encontrar aquel con un buen balance entre precisión y simpleza en cuanto a variables predictoras.

h) Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.

Luego de todos los análisis realizados en este informe se recomienda a la compañía elegir el Modelo 3 (Acc ~ Exp + Sexo + Edad + Pot), debido a que demostró ser aquel con mejores indicadores entre los 3 evaluados, esto teniendo en cuenta que las variables predictoras que utiliza son facilmente recolectables, por lo que el modelo proporcionará una buena precisión para clasificar a sus clientes sin requerir grandes esfuerzos para el despliegue del modelo.