Laboratorio 4

1. Desempeño de dos clases de discos duros

La eficiencia y el rendimiento de los sistemas de almacenamiento son importantes para el desempeño general de los entornos tecnológicos. Dos tipos comunes de discos duros son las Unidades de Estado Sólido (SSD) y los Discos Duros Mecánicos (HDD), los cuales presentan características y comportamientos distintos bajo diversas condiciones de carga. Por lo que este informe tiene como objetivo comparar el desempeño de estos dos tipos de discos duros en términos de su tiempo de respuesta en segundos frente a diferentes niveles de carga del sistema, medido como el número de consultas por minuto.

Para este estudio, se han realizado múltiples ensayos variando la carga del sistema tanto para discos SSD como para HDD. Se ha recopilado información detallada sobre el tiempo de respuesta correspondiente a cada nivel de carga.

El dataset está conformado por tres variables:

  • Conf = clase de disco duro, 0 si es SDD y 1 si es HDD.
  • Carga = carga del sistema (número de consultas por minuto)
  • Tiempo = tiempo de respuesta del disco (segundos)
## tibble [25 × 3] (S3: tbl_df/tbl/data.frame)
##  $ Conf  : num [1:25] 1 0 1 0 1 1 0 0 0 1 ...
##  $ Carga : num [1:25] 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
##  $ Tiempo: num [1:25] 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...

Teniendo en cuenta que la variable Conf es una variable binaria, donde 0 es SDD y 1 es HDD, se establece como factor, para crear una representación adecuada de los datos en el análisis estadístico. Esto permite una interpretación más clara y precisa de cómo la clase de disco duro influye en el tiempo de respuesta frente a la carga del sistema. Además, al tratar la variable Conf como un factor, facilita la comparación y la interpretación de los resultados al considerar las diferencias entre los dos tipos de discos duros de manera más intuitiva.

##   Conf        Carga            Tiempo     
##  SDD:12   Min.   : 1.000   Min.   :0.300  
##  HDD:13   1st Qu.: 3.100   1st Qu.:1.500  
##           Median : 5.800   Median :3.200  
##           Mean   : 5.648   Mean   :2.828  
##           3rd Qu.: 8.000   3rd Qu.:3.900  
##           Max.   :10.200   Max.   :5.800

Para visualizar cómo se comportan las Unidades de Estado Sólido (SSD) y los Discos Duros Mecánicos (HDD) bajo diferentes niveles de carga, se representa gráficamente la relación entre el tiempo de respuesta y la carga de trabajo.

El análisis visual sugiere la existencia de una posible relación lineal entre la carga del sistema y el tiempo de respuesta del disco para cada tipo de disco. Para medir la fuerza de esta relación, se calcula el coeficiente de correlación de Pearson para todo el conjunto de datos. Los resultados muestran una correlación positiva muy fuerte cor = 0.93 entre la carga del sistema y el tiempo de respuesta del disco. Esto indica que a medida que aumenta la carga del sistema (medida en número de consultas por minuto), el tiempo de respuesta del disco tiende a aumentar significativamente. La alta significancia estadística p < 0.001 y el intervalo de confianza del 95% entre -1 y 0.96 confirma la relación positiva.

## 
##  Pearson's product-moment correlation
## 
## data:  DB$Carga and DB$Tiempo
## t = 11.783, df = 23, p-value = 1
## alternative hypothesis: true correlation is less than 0
## 95 percent confidence interval:
##  -1.00000  0.96272
## sample estimates:
##       cor 
## 0.9262224

Por lo que se propone ajustar un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga del sistema y el tiempo de respuesta del disco, sin considerar inicialmente la configuración específica del disco duro.

## 
## Call:
## lm(formula = Tiempo ~ Carga, data = DB)
## 
## Coefficients:
## (Intercept)        Carga  
##     0.04838      0.49214

Con base en estos resultados, la siguiente ecuación representa este primer modelo de regresión simple:

\[ \text{Tiempo} = 0.04838 + 0.49214 \times \text{Carga} \]

Los resultados del resumen del modelo de regresión simple (Modelo 1) indican lo siguiente:

## 
## Call:
## lm(formula = Tiempo ~ Carga, data = DB)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

Respecto a los coeficientes del modelo:

  • El intercepto tiene un valor estimado de 0.04838, lo que indica que cuando la carga del sistema es 0, se espera que el tiempo de respuesta del disco sea aproximadamente 0.04838 segundos.
  • La pendiente tiene un valor estimado de 0.49214, lo que indica que por cada unidad adicional de carga del sistema (número de consultas por minuto), se espera que el tiempo de respuesta del disco aumente en promedio en 0.49214 segundos.

Por otro lado, también se puede decir que ambos coeficientes son altamente significativos con valores de p< 0.001. Además, el R-cuadrado ajustado es 0.8517, lo que indica que alrededor del 85.17% de la variabilidad en el tiempo de respuesta del disco se explica por la variable de carga del sistema en este modelo. Esto sugiere que el modelo de regresión simple proporciona un buen ajuste a los datos.

Ahora, se propone obtener un nuevo modelo de regresión (Modelo 2) que incluya tanto la carga del sistema como el tipo de disco como variables predictoras, así como su interacción, para evaluar cómo la relación entre la carga del sistema y el tiempo de respuesta del disco puede variar según el tipo de disco utilizado.

## 
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = DB)
## 
## Coefficients:
##   (Intercept)          Carga        ConfHDD  Carga:ConfHDD  
##       -1.3755         0.7198         2.2639        -0.3573

Con base en estos resultados, la siguiente ecuación representa este segundo modelo de regresión:

\[ \text{Tiempo} = \beta_0 + \beta_1 \times \text{Carga} + \beta_2 \times \text{Conf} + \beta_3 \times \text{Carga} \times \text{Conf} \]

Donde:

\[ \text{Tiempo} = -1.37549 + 0.71979 \times \text{Carga} + 2.26391 \times \text{Conf} - 0.35734 \times \text{Carga} \times \text{Conf} \]

## 
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = DB)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.68547 -0.11333  0.06881  0.15302  0.41807 
## 
## Coefficients:
##               Estimate Std. Error t value Pr(>|t|)    
## (Intercept)   -1.37549    0.20902  -6.581 1.62e-06 ***
## Carga          0.71979    0.03367  21.376 9.88e-16 ***
## ConfHDD        2.26391    0.26520   8.536 2.86e-08 ***
## Carga:ConfHDD -0.35734    0.04227  -8.454 3.36e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared:  0.9692, Adjusted R-squared:  0.9648 
## F-statistic: 220.2 on 3 and 21 DF,  p-value: 5.042e-16

Respecto a los coeficientes del modelo:

  • Intercepto: tiene un valor estimado de \(\beta_0 = -1.37549\) el cual indica que cuando tanto la carga del sistema como el tipo de disco Conf son cero, el tiempo de respuesta esperado del disco es aproximadamente -1.37549 segundos. Sin embargo, en el contexto práctico, este valor del intercepto puede no tener una interpretación directa debido a la naturaleza de las variables predictoras.

  • Carga: el coeficiente estimado es \(\beta_1 = 0.71979\) el cual indica que por cada unidad adicional de carga del sistema (medida en número de consultas por minuto), se espera que el tiempo de respuesta del disco aumente en promedio en 0.71979 segundos, manteniendo constante el efecto de la variable Conf.

  • ConfHDD: el coeficiente estimado es \(\beta_2 = 2.26391\) el cual indica la diferencia en el tiempo de respuesta esperado entre los discos duros HDD y SDD cuando la carga del sistema es cero. En este caso, se espera que los discos duros HDD tengan un tiempo de respuesta aproximadamente 2.26391 segundos mayor que los discos duros SDD.

  • Interacción (Carga): el coeficiente estimado es \(\beta_3 = -0.35734\) el cual indica cómo cambia la pendiente de la relación entre la carga del sistema y el tiempo de respuesta del disco cuando se pasa de un disco SDD a un disco HDD. Un valor negativo indica que la relación entre la carga del sistema y el tiempo de respuesta es menos pronunciada para los discos HDD en comparación con los discos SDD.

En cuanto a la significancia estadística de este modelo se puede decir que todos los coeficientes son altamente significativos, con valores de p-values muy pequeños p<0.001, lo que indica una alta certeza en la relación estimada entre las variables predictoras y la variable de respuesta (tiempo de respuesta del disco).

El \(R^2_{\text{ajustado}} = 0.9648\) es alto, lo que sugiere que aproximadamente el 96.48% de la variabilidad en el tiempo de respuesta del disco se explica por las variables incluidas en el modelo (Carga, Conf y su interacción). Esto indica que el modelo proporciona un ajuste muy bueno a los datos observados.

Ahora, con el fin de probar si la inclusión de la variable cualitativa Conf y su interacción con la carga mejora significativamente el ajuste del modelo, se realiza el test ANOVA.

Para el Modelo 2, se obtiene que:

## Analysis of Variance Table
## 
## Response: Tiempo
##            Df Sum Sq Mean Sq  F value    Pr(>F)    
## Carga       1 47.313  47.313 584.8051 < 2.2e-16 ***
## Conf        1  0.357   0.357   4.4132   0.04791 *  
## Carga:Conf  1  5.782   5.782  71.4618 3.364e-08 ***
## Residuals  21  1.699   0.081                       
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Este resultado se puede interpretar así:

  • Para Carga: tiene un efecto significativo en el tiempo de respuesta del disco (F-value = 584.81 es muy alto y el p<0.001 muy bajo) confirmando que la carga del sistema tiene un efecto significativo en el tiempo de respuesta del disco.
  • Para Conf: también tiene un efecto significativo en el tiempo de respuesta del disco (F-value = 4.41 y p=0.048 muy bajo), indicando que el tipo de disco (HDD o SDD) también influye significativamente en el tiempo de respuesta del disco.
  • Para la interacción de Carga y Conf: también es altamente significativa (F-value = 71.46 alto y el p<0.0011). Esto indica que el efecto de la carga del sistema en el tiempo de respuesta del disco varía dependiendo del tipo de disco utilizado.

A comparación del Modelo 1, que se obtiene que:

## Analysis of Variance Table
## 
## Response: Tiempo
##           Df Sum Sq Mean Sq F value    Pr(>F)    
## Carga      1 47.313  47.313  138.84 3.177e-11 ***
## Residuals 23  7.838   0.341                      
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
  • Carga: tiene un efecto significativo en el tiempo de respuesta del disco (F = 138.84, p < 0.001). Esto indica que el modelo de regresión simple explica una cantidad significativa de la variabilidad en el tiempo de respuesta del disco.

Además de esto, analizando los residuals, de ambos test se obtiene que:

  • Para el Modelo 1, la suma residual es 7.838 y el mean square residual es 0.341, lo que indica la cantidad de variabilidad no explicada por el modelo.
  • Para el Modelo 2, la suma residual es 1.699 y el mean square residual es 0.081, lo que indica que hay menos variabilidad no explicada por este modelo, en comparación con el Modelo 1.

La representación gráfica del ajuste de un modelo es esencial para visualizar cómo las variables predictoras se relacionan con la variable de respuesta y para evaluar la calidad del ajuste del modelo. El Modelo 2 incorpora tanto la carga del sistema como el tipo de disco duro (SDD o HDD) y su interacción por lo que es importante examinar cómo este modelo captura la relación entre la carga del sistema, el tiempo de respuesta del disco y cómo difieren estas relaciones entre los tipos de discos duros.

A pesar de que la gráfica muestra un buen ajuste del Modelo 2 a los datos, es indispensable realizar análisis adicionales para confirmar la validez del modelo a través de la verificación de los supuestos de los modelos de regresión lineal, con el fin de comprobar su idoneidad y su utilidad para realizar inferencias.

Estos gráficos de diagnóstico para evaluar la adecuación del modelo, indican lo siguiente:

El gráfico “Residuals vs Fitted” muestra la relación entre los residuos estandarizados y los valores ajustados del modelo, ayudando a verificar el supuesto de Homocedasticidad, aquí se observa una ligera tendencia de que los puntos se dispersen más a medida que se alejan de la línea horizontal (residuo = 0). Esto podría indicar la presencia de una heterocedasticidad leve.

Sin embargo, la homocedasticidad se refiere a tener varianza de los errores constante. Por lo que se procede a determinar haciendo uso del test Breusch-Pagan, en el que se hace la prueba de hipótesis:

\[ H_0 = \text{Los errores tienen varianza constante} \]

\[ H_1 = \text{Los errores no tienen varianza constante} \]

Un p-value pequeño en el test indica que los residuos no tienen varianza constante.

## 
##  studentized Breusch-Pagan test
## 
## data:  Modelo_2
## BP = 2.6825, df = 3, p-value = 0.4432

Por lo que en este caso, con una confiabilidad del 95% y un valor-P mayor al error permitido (5%), no se rechaza la hipótesis nula. De acuerdo con la prueba de Breusch-Pagan, no hay evidencia suficiente para concluir que la varianza de los errores en el Modelo 2 sea heterocedástica. En otras palabras, la prueba sugiere que la varianza de los residuos es constante en todas las observaciones del modelo. Por lo que, al no existir evidencia suficiente, se puede decir que el Modelo 2 cumple con el primer supuesto.

El gráfico “Q-Q Residuals” compara la distribución de los residuos con una distribución normal teórica, ayudando a verificar el supuesto de Normalidad de los residuos. Si los residuos son normales, los puntos del gráfico deberían caer aproximadamente en una línea recta.

En este caso, los puntos del gráfico se desvían de la línea recta en algunos puntos. Esto indica que los residuos no son completamente normales. Sin embargo, la desviación no es muy grande, por lo que no se puede descartar completamente la normalidad.

Sin embargo, también se procede a evaluar la normalidad del modelo con la prueba estadística de Shapiro-Wil, en el que se hace la prueba de hipótesis:

\[ H_0 = \text{Los residuales distribuyen normal} \]

\[ H_1 = \text{Los residuales no distribuyen normal} \] Un p-value alto (p > 0.05) sugiere que no hay evidencia suficiente para rechazar la hipótesis nula de normalidad.

## 
##  Shapiro-Wilk normality test
## 
## data:  residuos
## W = 0.92407, p-value = 0.06348

El p-value de 0.06348 es ligeramente superior al nivel de significancia (5%). En este caso, con una confiabilidad del 95% y un p-value mayor al error permitido, no se rechaza la hipótesis nula de normalidad. Por lo que no hay evidencia suficiente para concluir que los residuos del Modelo 2 no siguen una distribución normal. En otras palabras, la prueba sugiere que los residuos podrían ser aproximadamente normales, cumpliendo con el segundo supuesto.

El gráfico “Scale-Location” muestra la distribución de los residuos en función de su magnitud. Se utiliza para identificar posibles valores atípicos, también se usa para apoyar el supuesto de Homocedasticidad.

En este caso, se puede observar que los puntos del gráfico se dispersan aleatoriamente alrededor de la línea horizontal, sin mostrar patrones sistemáticos. Esto sugiere que no hay evidencia evidente de heterocedasticidad en los residuos del modelo.

El gráfico “Residuals vs Leverage” muestra la relación entre el apalancamiento (leverage) y los residuos estandarizados en el modelo de regresión lineal. El apalancamiento de una observación es una medida de la influencia que tiene esa observación en el ajuste de la línea de regresión. Este gráfico ayuda a verificar el supuesto de “Independencia de los errores”. Se espera que los residuos no estén correlacionados entre sí.

En este caso, se puede observar que algunos puntos se encuentran por encima de la línea horizontal, mientras que otros se encuentran por debajo. Esto indica que algunas observaciones tienen un mayor apalancamiento que otras, y por lo tanto, tienen una mayor influencia en el ajuste de la línea de regresión.

Sin embargo, también se procede a evaluar la independencia de los errores con la prueba estadística de Durbin-Watson, en el que se hace la prueba de hipótesis:

\[ H_0 = \text{No existe autocorrelación en los residuos} \]

\[ H_1 = \text{Existe autocorrelación en los residuos} \]

## 
##  Durbin-Watson test
## 
## data:  Modelo_2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0

En este caso, el p-value de 0.03421 es menor que un nivel de significancia común (como 0.05). Esto significa que se puede rechazar la hipótesis nula de no autocorrelación a favor de la hipótesis alternativa de autocorrelación positiva.

La prueba de Durbin-Watson sugiere la presencia de autocorrelación positiva en los residuos del Modelo 2. Es decir, que existe evidencia suficiente para concluir que los errores en el modelo no son independientes entre sí, lo que incumple con el supuesto de independencia de los errores.

En general, los cuatro gráficos indican que el modelo de regresión lineal es un buen ajuste para los datos. Adicional, se realiza el test para verificar la media cero, en el que se hace la prueba de hipótesis:

\[ H_0 = \text{La media de los residuos es igual a cero} \]

\[ H_1 = \text{La media de los residuos no es igual a cero} \]

## 
##  One Sample t-test
## 
## data:  residuos
## t = -0.14652, df = 24, p-value = 0.8847
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  -0.4994321  0.4332192
## sample estimates:
##   mean of x 
## -0.03310641

Esto sugiere que las observaciones pueden no ser completamente independientes, lo cual es importante considerar al interpretar los resultados del modelo.

Un p-value alto (0.8847) indica que no hay evidencia suficiente para rechazar la hipótesis nula con una confiabilidad del 95%. Esto sugiere que la media de los residuos no es estadísticamente diferente de cero.

Basándose en la interpretación de las pruebas estadísticas realizadas para verificar el cumplimiento de los supuestos, se puede afirmar que el Modelo 2 cumple con tres de los cuatro supuestos: media cero, homocedasticidad y normalidad. Sin embargo, se detecta autocorrelación positiva en los residuos, lo que indica que los errores no son independientes entre sí. Es importante destacar que, si bien se incumple un supuesto, esto no necesariamente invalida por completo el modelo.

Para finalizar, se puede concluir que ambos modelos mostraron una relación significativa y positiva entre la carga del sistema y el tiempo de respuesta del disco; es decir, que a medida que aumenta la carga del sistema, el tiempo de respuesta del disco tiende a incrementarse, lo cual es consistente con la operación esperada de los sistemas de almacenamiento.

Sin embargo, el Modelo 2 que incorpora el tipo de disco, como una variable Dummy, y su interacción con la carga del sistema, demostró que el tipo de disco tiene un efecto significativo en el tiempo de respuesta. Demostrando, además, una mejor bondad de ajuste en comparación con el Modelo 1, según los criterios del \(R^2_{\text{ajustado}}\) y los p-values altamente significativos.


2. Caracterización de la siniestralidad de los asegurados durante el último año

Para una compañía del sector de los seguros de automóvil es fundamental entender los factores que influyen en la siniestralidad para la gestión de riesgos y la optimización de las políticas de seguros. Para este fin se realiza un estudio para caracterizar la siniestralidad de sus asegurados durante el último año para el cual se dispone de datos detallados de una muestra aleatoria de 35 asegurados.

Los datos incluyen la siguiente información:

  • Acc: Haber tenido algún accidente en el último año (0: no; 1: sí).
  • Exp: Años de experiencia del conductor.
  • Edad: Edad del conductor.
  • Pot: Potencia del motor del vehículo.
  • Sexo: Género del conductor (1: mujer, 2: hombre).

La estructura de los datos es la siguiente:

##  Acc          Exp              Edad         Pot            Sexo   
##  No:20   Min.   : 1.000   Min.   :20   Min.   : 70.0   Mujer :21  
##  Sí:15   1st Qu.: 6.500   1st Qu.:25   1st Qu.: 90.0   Hombre:14  
##          Median : 9.000   Median :29   Median : 95.0              
##          Mean   : 9.543   Mean   :31   Mean   :101.6              
##          3rd Qu.:12.000   3rd Qu.:36   3rd Qu.:110.0              
##          Max.   :20.000   Max.   :56   Max.   :150.0

Se puede notar que el rango de edad de los asegurados es entre los 20 y 56 años, tienen una experiencia entre 1 y 20 años y una potencia de motor de entre 70 y 150. Destacando, además, que el 57.14% (20 personas) de los asegurados han sufrido algún accidente en el último año, y el 42.86% (15 personas) no. Y que el 60% (21 personas) son mujeres, y el 40% (14 personas) son hombres.

Se inicia con análisis exploratorio, para proporcionar una descripción inicial de la distribución de las variables Edad, Exp y Pot en la muestra de asegurados.

El primer gráfico muestra la distribución de la edad de los 35 asegurados incluidos en la muestra. Sabemos que la edad es entre los 20 y 56 años, por lo que se puede ver que la mayor concentración de asegurados está en el rango de edad entre 30 y 40 años. Además, se observa una leve tendencia a la derecha, lo que indica que hay una mayor proporción de asegurados en los rangos de edad más altos (40-50 años).

El segundo gráfico muestra la distribución de la experiencia en la conducción de los asegurados. Se puede observar que la mayor concentración de asegurados se encuentra en el rango de experiencia entre 5 y 10 años. Además, se observa una tendencia a la derecha, lo que indica que hay una mayor proporción de asegurados con mayor experiencia en la conducción (más de 10 años).

El tercer gráfico muestra la distribución de la potencia del motor de los vehículos asegurados en la muestra. La cual cuenta con la mayor concentración en el rango de potencia entre 80 y 100.

Ahora, la distribución de estas variables se puede analizar en función de la siniestralidad de la siguiente manera:

El primer boxplot muestra la Edad en función de la Siniestralidad. La mediana de la edad para los asegurados que tuvieron un accidente es de 24 años, mientras que para aquellos que no lo tuvieron es de 31 años. Se observan dos datos atípicos dentro del grupo de asegurados con accidentes, correspondientes a las edades de 56 y 45 años. Aunque la diferencia en la mediana de la edad entre los grupos con y sin accidentes no es significativa, estos valores atípicos podrían sugerir una posible tendencia de que los asegurados más jóvenes tengan un mayor riesgo de siniestralidad.

El segundo boxplot muestra la Experiencia en función de la Siniestralidad. La mediana de la experiencia en la conducción es mayor para los asegurados que no tuvieron un accidente (10 años) en comparación con los que lo tuvieron (5 años). Los cuartiles muestran que el 50% central de los asegurados sin accidentes tiene entre 7 y 10 años de experiencia, mientras que para los asegurados con accidentes el rango es entre 4 y 5 años. Además, se observa un dato atípico correspondiente a los asegurados con accidentes con 20 años de experiencia. La diferencia en la mediana de la experiencia entre los grupos con y sin accidentes parece ser significativa, lo cual sugiere que la experiencia en la conducción influye considerablemente en la probabilidad de tener un accidente.

El tercer boxplot muestra la Potencia en función de la Siniestralidad. . La mediana de la potencia del motor es mayor para los asegurados que tuvieron un accidente (110) que para los que no lo tuvieron (90). Los cuartiles indican que el 50% central de los asegurados con accidentes tiene entre 90 y 110 de potencia, mientras que para los asegurados sin accidentes el rango es entre 85 y 90. Esta diferencia en las medianas sugiere que los vehículos con mayor potencia pueden estar asociados con un mayor riesgo de accidentes.

El género también juega un papel destacado para la comprensión de cómo las variables influyen en la siniestralidad. Recordemos que el 60% de las asegurados con mujeres y el 40% son hombres. Según el gráfico, se puede observar que de los asegurados accidentados el 73% de la muestra son hombres, y el 27% son mujeres. Mientras que de los no accidentados, el 85% son mujeres y el 15% son hombres.

## `summarise()` has grouped output by 'Acc'. You can override using the `.groups`
## argument.

Por lo que se puede decir que el género juega un papel crucial en la comprensión de las tasas de siniestralidad entre los asegurados, sin embargo, hay que tener en cuenta el tamaño de la muestra y que la proporción de hombres es del 40%.

También es importante comprender cómo las diferentes variables se interrelacionan entre sí y cómo estas relaciones pueden influir en el riesgo de accidentes. Por lo que se realiza un análisis bivariado que proporciona una visión detallada de las interdependencias entre las variables:

##            Edad        Exp        Pot
## Edad  1.0000000  0.3016585 -0.1546259
## Exp   0.3016585  1.0000000 -0.2995256
## Pot  -0.1546259 -0.2995256  1.0000000
  • Edad y Experiencia de Conducción: existe una correlación positiva moderada (0.3017) entre la edad y la experiencia del conductor. Esto indica que a medida que los conductores son mayores, tienden a tener más años de experiencia, lo cual es intuitivo y esperado.

  • Potencia del Motor y Edad: existe una correlación negativa (-0.1546) entre la potencia del motor y la edad, la cual sugiere que los conductores más jóvenes tienden a preferir vehículos con mayor potencia, aunque esta relación es débil.

  • Potencia del Motor y Experiencia de Conducción: la correlación negativa moderada (-0.2995) entre la potencia del motor y la experiencia de conducción indica que los conductores con más experiencia tienden a preferir vehículos con menor potencia.

Ahora, para entender mejor los factores que influyen en la siniestralidad de los asegurados, se llevará a cabo un análisis utilizando modelos de regresión logística. Este tipo de modelo es adecuado para predecir la probabilidad de ocurrencia de un evento binario, en este caso, si un asegurado ha tenido un accidente o no (variable Acc). Por lo cual se plantean los siguientes modelos:

Modelo 1: Siniestralidad en función de la Experiencia

\[ \text{Modelo 1:} \quad \text{Acc} \sim \text{Exp} \]

## 
## Call:
## glm(formula = Acc ~ Exp, family = "binomial", data = DB2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4

Por lo que la ecuación de regresión logística estaría dada por:

\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp}\]

\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = 1.9419 - 0.2456 \cdot \text{Exp}\]

Los parámetros del modelo 1 se pueden interpretar en términos de la razón de probabilidad de que ocurra un accidente.

Coeficiente del Intercepto:

  • (\(\beta_0 = 1.9419\))
  • Odds: \(exp(\beta_0) = exp(1.9419) ≈ 6.973\)
  • Interpretación: indica que cuando la experiencia es cero, la probabilidad de que ocurra un accidente son aproximadamente 6.973 a 1.

Coeficiente de Experiencia:

  • (\(\beta_0 = -0.2456\))
  • Odds: \(exp(\beta_1) = exp(-0.2456) ≈ 0.7823\)
  • Interpretación: indica que por cada año adicional de experiencia, la probabilidad de que ocurra un accidente disminuyen en un factor de aproximadamente 0.7823

Este modelo indica que la experiencia en la conducción reduce significativamente la probabilidad de que un asegurado tenga un accidente. Por cada año adicional de experiencia, la probabilidad de tener un accidente disminuye en aproximadamente un 21.77%. Este resultado es estadísticamente significativo con un valor p de 0.0186, lo que sugiere una fuerte evidencia de que la experiencia influye en la siniestralidad.

Modelo 2: Siniestralidad en función de la Experiencia y Género

\[ \text{Modelo 2:} \quad \text{Acc} \sim \text{Exp} + \text{Género} \]

## 
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = DB2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)   
## (Intercept)   0.8890     1.2252   0.726  0.46808   
## Exp          -0.2400     0.1176  -2.040  0.04131 * 
## SexoHombre    2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

Por lo que la ecuación de regresión logística estaría dada por:

\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo}_\text{Hombre}\] \[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = 0.8890 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo}_\text{Hombre}\]

La interpretación de los parámetros sería:

Coeficiente del Intercepto:

  • (\(\beta_0 = 0.8890\))
  • Odds: $exp(_0) = exp(0.8890) ≈ 2.43
  • Interpretación: indica que cuando las variables de Exp y Sexo son iguales a cero, se espera que la probabilidad de que ocurra un accidente sea aproximadamente 2.43 veces mayor que la probabilidad de que no ocurra un accidente.

Coeficiente del Experiencia:

  • (\(\beta_1 = -0.2400\))
  • Odds: \(exp(\beta_1) = exp(-0.2400) ≈ 0.7862\)
  • Interpretación: indica que por cada año adicional en Experiencia, la probabilidad de tener un accidente se multiplica por 0.7862, es decir que disminuye en un 21.38%.

Coeficiente del Género:

  • (\(\beta_2 = 2.9866\))
  • Odds: \(exp(\beta_2) = exp(2.9866) ≈ 19.79\)
  • Interpretación: indica que los hombres tienen una probabilidad de aproximadamente 19.79 veces mayor de tener un accidente en comparación con las mujeres.

Para evaluar el rendimiento de los modelos, se representará gráficamente los valores observados frente a los valores predichos para ambos modelos. Esta visualización permitirá una comprensión clara de la precisión del ajuste y la capacidad predictiva de cada modelo.

Por lo que las ecuaciones de pronóstico de estos modelos vendrían a ser:

Modelo 1: \(\text{Acc} \sim \text{Exp}\)

\[ P(\text{Acc} = 1 \mid \text{Exp}) = \frac{1}{1 + e^{-(1.9419 - 0.2456 \cdot \text{Exp})}} \]

Donde:

  • \(P(\text{Acc} = 1 \mid \text{Exp})\) es la probabilidad de tener un accidente dado un valor de Experiencia (Exp).
  • \(\beta_0 = 1.9419\) (intercepto del modelo)
  • \(\beta_1 = -0.2456\) (coeficiente asociado a la variable Exp)
Modelo 2: \(\text{Acc} \sim \text{Exp} + \text{Sexo}\)

Para el Modelo 2, asumiendo que \(\text{Sexo} = 1\) representa a las mujeres y \(\text{Sexo} = 2\) a los hombres:

\[ P(\text{Acc} = 1 \mid \text{Exp}, \text{Sexo}) = \frac{1}{1 + e^{-(0.8890 - 0.2400 \cdot \text{Exp} + 2.9866 \cdot \text{Sexo})}} \]

Donde: - \(P(\text{Acc} = 1 \mid \text{Exp}, \text{Sexo})\) es la probabilidad de tener un accidente dado un valor de Experiencia (Exp) y Género (Sexo). - \(\beta_0 = 0.8890\) (intercepto del modelo) - \(\beta_1 = -0.2400\) (coeficiente asociado a la variable Exp) - \(\beta_2 = 2.9866\) (coeficiente asociado a la variable Sexo, donde \(\text{Sexo} = 1\) para mujeres y \(\text{Sexo} = 2\) para hombres)

Al comparar la matriz de confusión de los dos modelos ajustados se obtiene que, para el Modelo 1:

##     
##      Pred. Acci. Pred. No Acci
##   No           3            17
##   Sí           8             7
  • Verdaderos Positivos (TP): 7 (Casos reales de Accidentes que fueron correctamente predichos como Accidentes).
  • Falsos Negativos (FN): 8 (Casos reales de Accidentes que fueron incorrectamente predichos como No Accidentes).
  • Falsos Positivos (FP): 17 (Casos reales de No Accidentes que fueron incorrectamente predichos como Accidentes).
  • Verdaderos Negativos (TN): 3 (Casos reales de No Accidentes que fueron correctamente predichos como No Accidentes).

Mientras que para el Modelo 2:

##     
##      Pred. Acci. Pred. No Acci
##   No           2            18
##   Sí          10             5
  • Verdaderos Positivos (TP): 5
  • Falsos Negativos (FN): 10
  • Falsos Positivos (FP): 18
  • Verdaderos Negativos (TN): 2

Por otro lado, para comparar los modelos y la bondad de ajuste de ambos, se aplican las siguientes medidas:

Para la deviance:

## [1] "Deviance del primer modelo: 40.0058257766585"
## [1] "Deviance del segundo modelo: 29.2487498324224"

La deviance representa una medida de la bondad de ajuste del modelo, donde valores más bajos indican un mejor ajuste del modelo a los datos observados. En este caso, el Modelo 2 tiene una deviance más baja (29.24875) en comparación con el Modelo 1 (40.00583), lo cual sugiere que el Modelo 2 se ajusta mejor a los datos observados en términos de su capacidad para predecir la variable respuesta (Accidente).

Para el AIC:

## [1] "AIC del primer modelo: 44.0058257766585"
## [1] "AIC del segundo modelo: 35.2487498324224"

Un valor menor de AIC indica un modelo que proporciona un buen ajuste con un número relativamente bajo de parámetros. En este caso, el Modelo 2 tiene un AIC más bajo (35.24875) en comparación con el Modelo 1 (44.00583), lo cual indica que el Modelo 2 es preferido debido a su mejor capacidad de ajuste y su mayor capacidad predictiva ajustada por el número de parámetros.

Para el AUC:

## [1] "AIC del primer modelo: 0.798333333333333"
## [1] "AIC del segundo modelo: 0.868333333333333"

El AUC es una medida de la capacidad discriminatoria del modelo. Un AUC cercano a 1 indica un buen rendimiento del modelo para distinguir entre clases. En este caso, un AUC de 0.7983333 sugiere que el modelo 1 tiene una capacidad discriminatoria moderada. Mientras que el AUC del modelo 2 es más alto que el del modelo 1, indicando una mejor capacidad discriminatoria para predecir la variable de interés (Accidentado vs No accidentado).

Curva ROC La curva ROC del Modelo 1 se encuentra más cerca de la esquina superior izquierda del gráfico, lo que indica un mejor rendimiento de discriminación. La curva ROC del Modelo 2 se encuentra más cerca de la diagonal, lo que indica un rendimiento de discriminación menos preciso.

El AUC del Modelo 1 es más alto (0.80), lo que confirma su mejor rendimiento de discriminación. El AUC del Modelo 2 es más bajo (0.87), lo que confirma su menor precisión en la clasificación.

La especificidad representa la proporción de individuos sin accidente que se clasifican correctamente como sin accidente. En ambos modelos, la especificidad aumenta a medida que disminuye la sensibilidad.

La sensibilidad representa la proporción de individuos con accidente que se clasifican correctamente como con accidente. En ambos modelos, la sensibilidad aumenta a medida que aumenta la especificidad.

El Modelo 1 tiene un mejor rendimiento de discriminación que el Modelo 2, según lo indicado por la curva ROC más cercana a la esquina superior izquierda del gráfico y un AUC más alto.

El Modelo 1 es más preciso para clasificar correctamente a los individuos con y sin accidente. El Modelo 2 puede ser menos preciso para clasificar correctamente a los individuos con y sin accidente.

Para el Test de razón de verosimilitud

Para el modelo 1:

## Analysis of Deviance Table
## 
## Model: binomial, link: logit
## 
## Response: Acc
## 
## Terms added sequentially (first to last)
## 
## 
##      Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
## NULL                    34     47.804            
## Exp   1   7.7977        33     40.006 0.005231 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
  • Deviance para Exp: 7.7977 La adición de la variable Exp (Experiencia) al modelo inicial redujo la deviance en 7.7977 unidades. Y el valor p (Pr(>Chi)) es 0.005231, lo cual indica que la variable Exp es estadísticamente significativa para explicar la variabilidad en la variable de respuesta (Acc).

Para el modelo 2:

## Analysis of Deviance Table
## 
## Model: binomial, link: logit
## 
## Response: Acc
## 
## Terms added sequentially (first to last)
## 
## 
##      Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
## NULL                    34     47.804            
## Exp   1   7.7977        33     40.006 0.005231 **
## Sexo  1  10.7571        32     29.249 0.001039 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
  • Deviance para Exp: 7.7977 La adición de la variable Exp al modelo 2 redujo la deviance en 7.7977 unidades, similar al modelo 1. El valor p para Exp es 0.005231, indicando su significancia.

  • Deviance para Sexo: 10.7571 La adición de la variable Sexo al modelo redujo la deviance adicional en 10.7571 unidades. El valor p para Sexo es 0.001039, lo cual indica que la variable Sexo también es altamente significativa para explicar la variabilidad en Acc.

En ambos casos, la prueba de deviance (deviance chi-square test) muestra que la adición de las variables predictoras (Exp en el Modelo 1 y Exp + Sexo en el Modelo 2) mejora significativamente la capacidad explicativa del modelo en comparación con el modelo nulo.

Los valores pequeños de p (< 0.05) indican que tanto Exp en el Modelo 1 como Exp y Sexo en el Modelo 2 son significativos para explicar la variabilidad en la respuesta (Acc). El Modelo 2 (Acc ~ Exp + Sexo) muestra una mejora adicional en la deviance respecto al Modelo 1 (Acc ~ Exp), lo cual sugiere que la inclusión de Sexo mejora significativamente la capacidad predictiva del modelo.

Elección del mejor modelo Considerando todas las métricas evaluadas, el Modelo 2 (Acc ~ Exp + Sexo) parece ser mejor, dado que:

  • Tiene una deviance más baja, lo que indica un mejor ajuste a los datos observados.
  • Tiene un AIC más bajo, lo que sugiere una mejor capacidad predictiva ajustada por el número de parámetros.
  • Tiene un AUC más alto, indicando una mejor capacidad discriminativa.
  • La significancia estadística de ambas variables predictoras (Exp y Sexo) en el test de razón de verosimilitud confirma su importancia en el modelo.

Por lo tanto, el Modelo 2 no solo ofrece un mejor rendimiento general en la predicción de accidentes, sino que también mejora significativamente con la inclusión de la variable Sexo. Esto sugiere que la inclusión de Sexo como predictor adicional en el modelo puede ser crucial para mejorar su precisión y utilidad en aplicaciones prácticas de predicción de accidentes.

Teniendo en cuenta la interpretación de sus coeficientes presentada anteriormente, se puede decir que el Modelo 2 muestra que la experiencia y el sexo son variables significativas para predecir la probabilidad de accidente. La experiencia reduce la probabilidad de accidente, mientras que ser hombre aumenta significativamente esta probabilidad en comparación con ser mujer.

Ahora se procede a identificar el mejor punto de corte. Este se identifica para maximizar la capacidad de un modelo de regresión logística para discriminar entre las clases positivas y negativas, es decir, para clasificar correctamente las observaciones en función de sus probabilidades predichas.

Interpretación del Mejor Punto de Corte El Mejor Punto de Corte (Threshold) es 0.845, es decir, es el umbral óptimo para decidir si una predicción es positiva (accidente) o negativa (no accidente). Si la probabilidad predicha por el modelo es mayor que 0.845, el evento se clasifica como un accidente. Si la probabilidad predicha es menor o igual a 0.845, el evento se clasifica como no accidente.

La Especificidad de 1.000, indica que el modelo tiene una especificidad del 100% en el mejor punto de corte, ya que la especificidad mide la proporción de verdaderos negativos (no accidentes) correctamente identificados por el modelo.

La Sensibilidad de 0.600 indica que el modelo tiene una sensibilidad del 60% en el mejor punto de corte. La sensibilidad mide la proporción de verdaderos positivos (accidentes) correctamente identificados por el modelo. Una sensibilidad del 60% significa que el modelo identifica correctamente el 60% de los accidentes, pero pierde (falsos negativos) el 40% de ellos.

El AUC (Área Bajo la Curva) de 0.868 indica que el modelo tiene una buena capacidad de discriminación entre las clases positivas (accidentes) y negativas (no accidentes). Un AUC de 0.868 significa que hay una probabilidad del 86.8% de que el modelo clasifique correctamente un par aleatorio de observaciones donde una es un accidente y la otra no lo es.

En pro de verificar si existe una mejora significativa en el modelo 2, se adicionan las variables edad y potencia del motor para crear el modelo 3.

Modelo 3: Siniestralidad en función de la Experiencia, Sexo, Edad y Potencia

\[ \text{Modelo 3:} \quad \text{Acc} \sim \text{Exp} + \text{Sexo} + \text{Edad} + \text{Potencia} \]

## 
## Call:
## glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial, 
##     data = DB2)
## 
## Coefficients:
##              Estimate Std. Error z value Pr(>|z|)  
## (Intercept) -19.97398    9.23723  -2.162   0.0306 *
## Exp          -0.47952    0.33645  -1.425   0.1541  
## SexoHombre    3.04940    2.36426   1.290   0.1971  
## Edad         -0.02585    0.08801  -0.294   0.7689  
## Pot           0.24687    0.10715   2.304   0.0212 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 12.700  on 30  degrees of freedom
## AIC: 22.7
## 
## Number of Fisher Scoring iterations: 8

Por lo que la ecuación de regresión logística estaría dada por:

\[ \log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo} + \beta_3 \cdot \text{Edad} + \beta_4 \cdot \text{Pot} \]

\[ \log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = −19.97398 - 0.47952 \cdot \text{Exp} + 3.04940 2 \cdot \text{Sexo} − 0.02585 \cdot \text{Edad} + 0.24687 \cdot \text{Pot} \]

  • El intercepto es significativo (p = 0.0306), lo que indica que hay un efecto significativo incluso cuando todas las otras variables predictoras son cero.
  • La variable Pot también es significativa (p = 0.0212), lo que sugiere que tiene un efecto significativo en la probabilidad de accidente, aumentando el log-odds cuando su valor aumenta.
  • Las variables Exp, Sexo y Edad no son significativas (p > 0.05), lo que indica que, en este modelo, no se ha encontrado evidencia suficiente para afirmar que estas variables tengan un efecto significativo sobre la probabilidad de accidente después de considerar las otras variables en el modelo.

Se realiza la comparación entre el análisis de varianza del modelo 2 y el modelo 3:

## Analysis of Deviance Table
## 
## Model 1: Acc ~ Exp + Sexo
## Model 2: Acc ~ Exp + Sexo + Edad + Pot
##   Resid. Df Resid. Dev Df Deviance  Pr(>Chi)    
## 1        32     29.249                          
## 2        30     12.700  2   16.549 0.0002549 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El Modelo 2 tiene 32 grados de libertad residual y una desviación residual de 29.249. El Modelo 3 tiene 30 grados de libertad residual y una desviación residual de 12.700.

Los resultados muestran que el Modelo 3 es significativamente mejor que el Modelo 2, ya que:

  • La diferencia en la deviance entre el Modelo 2 y el Modelo 3 es de 16.549.
  • El p-value asociado (0.0002549) es extremadamente bajo, indicando que esta diferencia es estadísticamente significativa.

Estos resultados sugieren que agregar las variables Edad y Pot al modelo mejora significativamente su capacidad para explicar la variabilidad en la variable de respuesta Acc, aunque no tengan efectos significativos individualmente, como se mencionó anteriormente. Por lo tanto, el Modelo 3 proporciona un mejor ajuste a los datos observados en comparación con el Modelo 2.

Los indicadores de bondad de ajuste del Modelo 3 son:

## [1] "Deviance: 12.6995331628849"
## [1] "AIC: 22.6995331628849"
## [1] "AUC: 0.966666666666667"
  • El Modelo 3 tiene una deviance significativamente menor que el Modelo 2 (12.6995 vs. 29.2487). Esto indica que el Modelo 3 se ajusta mejor a los datos observados que el Modelo 2.
  • En comparación, el Modelo 3 tiene un valor de AIC más bajo que el Modelo 2 (22.6995 vs. 35.2487), lo cual sugiere que el Modelo 3 es preferible desde el punto de vista del AIC.
  • El Modelo 3 tiene un AUC más alto que el Modelo 2 (0.9667 vs. 0.8683). Esto indica que el Modelo 3 tiene una mejor capacidad predictiva en términos de distinguir entre los casos positivos y negativos en comparación con el Modelo 2.

Finalmente, se concluye que el Modelo 3 muestra una mejor capacidad de ajuste a los datos observados, un mejor equilibrio entre la bondad del ajuste y la complejidad del modelo según el AIC, y una mejor capacidad discriminatoria según el AUC en comparación con el Modelo 2. Por lo tanto, se podría preferir el Modelo 3 como el modelo final con base a estos criterios de evaluación.