La eficiencia y el rendimiento de los sistemas de almacenamiento son importantes para el desempeño general de los entornos tecnológicos. Dos tipos comunes de discos duros son las Unidades de Estado Sólido (SSD) y los Discos Duros Mecánicos (HDD), los cuales presentan características y comportamientos distintos bajo diversas condiciones de carga. Por lo que este informe tiene como objetivo comparar el desempeño de estos dos tipos de discos duros en términos de su tiempo de respuesta en segundos frente a diferentes niveles de carga del sistema, medido como el número de consultas por minuto.
Para este estudio, se han realizado múltiples ensayos variando la carga del sistema tanto para discos SSD como para HDD. Se ha recopilado información detallada sobre el tiempo de respuesta correspondiente a cada nivel de carga.
El dataset está conformado por tres variables:
## tibble [25 × 3] (S3: tbl_df/tbl/data.frame)
## $ Conf : num [1:25] 1 0 1 0 1 1 0 0 0 1 ...
## $ Carga : num [1:25] 1 2 2.4 3.1 4 4.3 5.8 6.6 7.5 8 ...
## $ Tiempo: num [1:25] 0.9 0.3 2 0.8 2.7 2.6 2.5 3.2 3.7 3.9 ...
Teniendo en cuenta que la variable Conf es una variable binaria, donde 0 es SDD y 1 es HDD, se establece como factor, para crear una representación adecuada de los datos en el análisis estadístico. Esto permite una interpretación más clara y precisa de cómo la clase de disco duro influye en el tiempo de respuesta frente a la carga del sistema. Además, al tratar la variable Conf como un factor, facilita la comparación y la interpretación de los resultados al considerar las diferencias entre los dos tipos de discos duros de manera más intuitiva.
## Conf Carga Tiempo
## SDD:12 Min. : 1.000 Min. :0.300
## HDD:13 1st Qu.: 3.100 1st Qu.:1.500
## Median : 5.800 Median :3.200
## Mean : 5.648 Mean :2.828
## 3rd Qu.: 8.000 3rd Qu.:3.900
## Max. :10.200 Max. :5.800
Para visualizar cómo se comportan las Unidades de Estado Sólido (SSD) y los Discos Duros Mecánicos (HDD) bajo diferentes niveles de carga, se representa gráficamente la relación entre el tiempo de respuesta y la carga de trabajo.
El análisis visual sugiere la existencia de una posible relación lineal entre la carga del sistema y el tiempo de respuesta del disco para cada tipo de disco. Para medir la fuerza de esta relación, se calcula el coeficiente de correlación de Pearson para todo el conjunto de datos. Los resultados muestran una correlación positiva muy fuerte cor = 0.93 entre la carga del sistema y el tiempo de respuesta del disco. Esto indica que a medida que aumenta la carga del sistema (medida en número de consultas por minuto), el tiempo de respuesta del disco tiende a aumentar significativamente. La alta significancia estadística p < 0.001 y el intervalo de confianza del 95% entre -1 y 0.96 confirma la relación positiva.
##
## Pearson's product-moment correlation
##
## data: DB$Carga and DB$Tiempo
## t = 11.783, df = 23, p-value = 1
## alternative hypothesis: true correlation is less than 0
## 95 percent confidence interval:
## -1.00000 0.96272
## sample estimates:
## cor
## 0.9262224
Por lo que se propone ajustar un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga del sistema y el tiempo de respuesta del disco, sin considerar inicialmente la configuración específica del disco duro.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = DB)
##
## Coefficients:
## (Intercept) Carga
## 0.04838 0.49214
Con base en estos resultados, la siguiente ecuación representa este primer modelo de regresión simple:
\[ \text{Tiempo} = 0.04838 + 0.49214 \times \text{Carga} \]
Los resultados del resumen del modelo de regresión simple (Modelo 1) indican lo siguiente:
##
## Call:
## lm(formula = Tiempo ~ Carga, data = DB)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
Respecto a los coeficientes del modelo:
Por otro lado, también se puede decir que ambos coeficientes son altamente significativos con valores de p< 0.001. Además, el R-cuadrado ajustado es 0.8517, lo que indica que alrededor del 85.17% de la variabilidad en el tiempo de respuesta del disco se explica por la variable de carga del sistema en este modelo. Esto sugiere que el modelo de regresión simple proporciona un buen ajuste a los datos.
Ahora, se propone obtener un nuevo modelo de regresión (Modelo 2) que incluya tanto la carga del sistema como el tipo de disco como variables predictoras, así como su interacción, para evaluar cómo la relación entre la carga del sistema y el tiempo de respuesta del disco puede variar según el tipo de disco utilizado.
##
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = DB)
##
## Coefficients:
## (Intercept) Carga ConfHDD Carga:ConfHDD
## -1.3755 0.7198 2.2639 -0.3573
Con base en estos resultados, la siguiente ecuación representa este segundo modelo de regresión:
\[ \text{Tiempo} = \beta_0 + \beta_1 \times \text{Carga} + \beta_2 \times \text{Conf} + \beta_3 \times \text{Carga} \times \text{Conf} \]
Donde:
\[ \text{Tiempo} = -1.37549 + 0.71979 \times \text{Carga} + 2.26391 \times \text{Conf} - 0.35734 \times \text{Carga} \times \text{Conf} \]
##
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = DB)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.68547 -0.11333 0.06881 0.15302 0.41807
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.37549 0.20902 -6.581 1.62e-06 ***
## Carga 0.71979 0.03367 21.376 9.88e-16 ***
## ConfHDD 2.26391 0.26520 8.536 2.86e-08 ***
## Carga:ConfHDD -0.35734 0.04227 -8.454 3.36e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.2844 on 21 degrees of freedom
## Multiple R-squared: 0.9692, Adjusted R-squared: 0.9648
## F-statistic: 220.2 on 3 and 21 DF, p-value: 5.042e-16
Respecto a los coeficientes del modelo:
Intercepto: tiene un valor estimado de \(\beta_0 = -1.37549\) el cual indica que cuando tanto la carga del sistema como el tipo de disco Conf son cero, el tiempo de respuesta esperado del disco es aproximadamente -1.37549 segundos. Sin embargo, en el contexto práctico, este valor del intercepto puede no tener una interpretación directa debido a la naturaleza de las variables predictoras.
Carga: el coeficiente estimado es \(\beta_1 = 0.71979\) el cual indica que por cada unidad adicional de carga del sistema (medida en número de consultas por minuto), se espera que el tiempo de respuesta del disco aumente en promedio en 0.71979 segundos, manteniendo constante el efecto de la variable Conf.
ConfHDD: el coeficiente estimado es \(\beta_2 = 2.26391\) el cual indica la diferencia en el tiempo de respuesta esperado entre los discos duros HDD y SDD cuando la carga del sistema es cero. En este caso, se espera que los discos duros HDD tengan un tiempo de respuesta aproximadamente 2.26391 segundos mayor que los discos duros SDD.
Interacción (Carga): el coeficiente estimado es \(\beta_3 = -0.35734\) el cual indica cómo cambia la pendiente de la relación entre la carga del sistema y el tiempo de respuesta del disco cuando se pasa de un disco SDD a un disco HDD. Un valor negativo indica que la relación entre la carga del sistema y el tiempo de respuesta es menos pronunciada para los discos HDD en comparación con los discos SDD.
En cuanto a la significancia estadística de este modelo se puede decir que todos los coeficientes son altamente significativos, con valores de p-values muy pequeños p<0.001, lo que indica una alta certeza en la relación estimada entre las variables predictoras y la variable de respuesta (tiempo de respuesta del disco).
El \(R^2_{\text{ajustado}} = 0.9648\) es alto, lo que sugiere que aproximadamente el 96.48% de la variabilidad en el tiempo de respuesta del disco se explica por las variables incluidas en el modelo (Carga, Conf y su interacción). Esto indica que el modelo proporciona un ajuste muy bueno a los datos observados.
Ahora, con el fin de probar si la inclusión de la variable cualitativa Conf y su interacción con la carga mejora significativamente el ajuste del modelo, se realiza el test ANOVA.
Para el Modelo 2, se obtiene que:
## Analysis of Variance Table
##
## Response: Tiempo
## Df Sum Sq Mean Sq F value Pr(>F)
## Carga 1 47.313 47.313 584.8051 < 2.2e-16 ***
## Conf 1 0.357 0.357 4.4132 0.04791 *
## Carga:Conf 1 5.782 5.782 71.4618 3.364e-08 ***
## Residuals 21 1.699 0.081
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Este resultado se puede interpretar así:
A comparación del Modelo 1, que se obtiene que:
## Analysis of Variance Table
##
## Response: Tiempo
## Df Sum Sq Mean Sq F value Pr(>F)
## Carga 1 47.313 47.313 138.84 3.177e-11 ***
## Residuals 23 7.838 0.341
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Además de esto, analizando los residuals, de ambos test se obtiene que:
La representación gráfica del ajuste de un modelo es esencial para visualizar cómo las variables predictoras se relacionan con la variable de respuesta y para evaluar la calidad del ajuste del modelo. El Modelo 2 incorpora tanto la carga del sistema como el tipo de disco duro (SDD o HDD) y su interacción por lo que es importante examinar cómo este modelo captura la relación entre la carga del sistema, el tiempo de respuesta del disco y cómo difieren estas relaciones entre los tipos de discos duros.
A pesar de que la gráfica muestra un buen ajuste del Modelo 2 a los datos, es indispensable realizar análisis adicionales para confirmar la validez del modelo a través de la verificación de los supuestos de los modelos de regresión lineal, con el fin de comprobar su idoneidad y su utilidad para realizar inferencias.
Estos gráficos de diagnóstico para evaluar la adecuación del modelo, indican lo siguiente:
El gráfico “Residuals vs Fitted” muestra la relación entre los residuos estandarizados y los valores ajustados del modelo, ayudando a verificar el supuesto de Homocedasticidad, aquí se observa una ligera tendencia de que los puntos se dispersen más a medida que se alejan de la línea horizontal (residuo = 0). Esto podría indicar la presencia de una heterocedasticidad leve.
Sin embargo, la homocedasticidad se refiere a tener varianza de los errores constante. Por lo que se procede a determinar haciendo uso del test Breusch-Pagan, en el que se hace la prueba de hipótesis:
\[ H_0 = \text{Los errores tienen varianza constante} \]
\[ H_1 = \text{Los errores no tienen varianza constante} \]
Un p-value pequeño en el test indica que los residuos no tienen varianza constante.
##
## studentized Breusch-Pagan test
##
## data: Modelo_2
## BP = 2.6825, df = 3, p-value = 0.4432
Por lo que en este caso, con una confiabilidad del 95% y un valor-P mayor al error permitido (5%), no se rechaza la hipótesis nula. De acuerdo con la prueba de Breusch-Pagan, no hay evidencia suficiente para concluir que la varianza de los errores en el Modelo 2 sea heterocedástica. En otras palabras, la prueba sugiere que la varianza de los residuos es constante en todas las observaciones del modelo. Por lo que, al no existir evidencia suficiente, se puede decir que el Modelo 2 cumple con el primer supuesto.
El gráfico “Q-Q Residuals” compara la distribución de los residuos con una distribución normal teórica, ayudando a verificar el supuesto de Normalidad de los residuos. Si los residuos son normales, los puntos del gráfico deberían caer aproximadamente en una línea recta.
En este caso, los puntos del gráfico se desvían de la línea recta en algunos puntos. Esto indica que los residuos no son completamente normales. Sin embargo, la desviación no es muy grande, por lo que no se puede descartar completamente la normalidad.
Sin embargo, también se procede a evaluar la normalidad del modelo con la prueba estadística de Shapiro-Wil, en el que se hace la prueba de hipótesis:
\[ H_0 = \text{Los residuales distribuyen normal} \]
\[ H_1 = \text{Los residuales no distribuyen normal} \] Un p-value alto (p > 0.05) sugiere que no hay evidencia suficiente para rechazar la hipótesis nula de normalidad.
##
## Shapiro-Wilk normality test
##
## data: residuos
## W = 0.92407, p-value = 0.06348
El p-value de 0.06348 es ligeramente superior al nivel de significancia (5%). En este caso, con una confiabilidad del 95% y un p-value mayor al error permitido, no se rechaza la hipótesis nula de normalidad. Por lo que no hay evidencia suficiente para concluir que los residuos del Modelo 2 no siguen una distribución normal. En otras palabras, la prueba sugiere que los residuos podrían ser aproximadamente normales, cumpliendo con el segundo supuesto.
El gráfico “Scale-Location” muestra la distribución de los residuos en función de su magnitud. Se utiliza para identificar posibles valores atípicos, también se usa para apoyar el supuesto de Homocedasticidad.
En este caso, se puede observar que los puntos del gráfico se dispersan aleatoriamente alrededor de la línea horizontal, sin mostrar patrones sistemáticos. Esto sugiere que no hay evidencia evidente de heterocedasticidad en los residuos del modelo.
El gráfico “Residuals vs Leverage” muestra la relación entre el apalancamiento (leverage) y los residuos estandarizados en el modelo de regresión lineal. El apalancamiento de una observación es una medida de la influencia que tiene esa observación en el ajuste de la línea de regresión. Este gráfico ayuda a verificar el supuesto de “Independencia de los errores”. Se espera que los residuos no estén correlacionados entre sí.
En este caso, se puede observar que algunos puntos se encuentran por encima de la línea horizontal, mientras que otros se encuentran por debajo. Esto indica que algunas observaciones tienen un mayor apalancamiento que otras, y por lo tanto, tienen una mayor influencia en el ajuste de la línea de regresión.
Sin embargo, también se procede a evaluar la independencia de los errores con la prueba estadística de Durbin-Watson, en el que se hace la prueba de hipótesis:
\[ H_0 = \text{No existe autocorrelación en los residuos} \]
\[ H_1 = \text{Existe autocorrelación en los residuos} \]
##
## Durbin-Watson test
##
## data: Modelo_2
## DW = 1.3285, p-value = 0.03421
## alternative hypothesis: true autocorrelation is greater than 0
En este caso, el p-value de 0.03421 es menor que un nivel de significancia común (como 0.05). Esto significa que se puede rechazar la hipótesis nula de no autocorrelación a favor de la hipótesis alternativa de autocorrelación positiva.
La prueba de Durbin-Watson sugiere la presencia de autocorrelación positiva en los residuos del Modelo 2. Es decir, que existe evidencia suficiente para concluir que los errores en el modelo no son independientes entre sí, lo que incumple con el supuesto de independencia de los errores.
En general, los cuatro gráficos indican que el modelo de regresión lineal es un buen ajuste para los datos. Adicional, se realiza el test para verificar la media cero, en el que se hace la prueba de hipótesis:
\[ H_0 = \text{La media de los residuos es igual a cero} \]
\[ H_1 = \text{La media de los residuos no es igual a cero} \]
##
## One Sample t-test
##
## data: residuos
## t = -0.14652, df = 24, p-value = 0.8847
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.4994321 0.4332192
## sample estimates:
## mean of x
## -0.03310641
Esto sugiere que las observaciones pueden no ser completamente independientes, lo cual es importante considerar al interpretar los resultados del modelo.
Un p-value alto (0.8847) indica que no hay evidencia suficiente para rechazar la hipótesis nula con una confiabilidad del 95%. Esto sugiere que la media de los residuos no es estadísticamente diferente de cero.
Basándose en la interpretación de las pruebas estadísticas realizadas para verificar el cumplimiento de los supuestos, se puede afirmar que el Modelo 2 cumple con tres de los cuatro supuestos: media cero, homocedasticidad y normalidad. Sin embargo, se detecta autocorrelación positiva en los residuos, lo que indica que los errores no son independientes entre sí. Es importante destacar que, si bien se incumple un supuesto, esto no necesariamente invalida por completo el modelo.
Para finalizar, se puede concluir que ambos modelos mostraron una relación significativa y positiva entre la carga del sistema y el tiempo de respuesta del disco; es decir, que a medida que aumenta la carga del sistema, el tiempo de respuesta del disco tiende a incrementarse, lo cual es consistente con la operación esperada de los sistemas de almacenamiento.
Sin embargo, el Modelo 2 que incorpora el tipo de disco, como una variable Dummy, y su interacción con la carga del sistema, demostró que el tipo de disco tiene un efecto significativo en el tiempo de respuesta. Demostrando, además, una mejor bondad de ajuste en comparación con el Modelo 1, según los criterios del \(R^2_{\text{ajustado}}\) y los p-values altamente significativos.
Para una compañía del sector de los seguros de automóvil es fundamental entender los factores que influyen en la siniestralidad para la gestión de riesgos y la optimización de las políticas de seguros. Para este fin se realiza un estudio para caracterizar la siniestralidad de sus asegurados durante el último año para el cual se dispone de datos detallados de una muestra aleatoria de 35 asegurados.
Los datos incluyen la siguiente información:
La estructura de los datos es la siguiente:
## Acc Exp Edad Pot Sexo
## No:20 Min. : 1.000 Min. :20 Min. : 70.0 Mujer :21
## Sí:15 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 Hombre:14
## Median : 9.000 Median :29 Median : 95.0
## Mean : 9.543 Mean :31 Mean :101.6
## 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0
## Max. :20.000 Max. :56 Max. :150.0
Se puede notar que el rango de edad de los asegurados es entre los 20 y 56 años, tienen una experiencia entre 1 y 20 años y una potencia de motor de entre 70 y 150. Destacando, además, que el 57.14% (20 personas) de los asegurados han sufrido algún accidente en el último año, y el 42.86% (15 personas) no. Y que el 60% (21 personas) son mujeres, y el 40% (14 personas) son hombres.
Se inicia con análisis exploratorio, para proporcionar una descripción inicial de la distribución de las variables Edad, Exp y Pot en la muestra de asegurados.
El primer gráfico muestra la distribución de la edad de los 35 asegurados incluidos en la muestra. Sabemos que la edad es entre los 20 y 56 años, por lo que se puede ver que la mayor concentración de asegurados está en el rango de edad entre 30 y 40 años. Además, se observa una leve tendencia a la derecha, lo que indica que hay una mayor proporción de asegurados en los rangos de edad más altos (40-50 años).
El segundo gráfico muestra la distribución de la experiencia en la conducción de los asegurados. Se puede observar que la mayor concentración de asegurados se encuentra en el rango de experiencia entre 5 y 10 años. Además, se observa una tendencia a la derecha, lo que indica que hay una mayor proporción de asegurados con mayor experiencia en la conducción (más de 10 años).
El tercer gráfico muestra la distribución de la potencia del motor de los vehículos asegurados en la muestra. La cual cuenta con la mayor concentración en el rango de potencia entre 80 y 100.
Ahora, la distribución de estas variables se puede analizar en función de la siniestralidad de la siguiente manera:
El primer boxplot muestra la Edad en función de la Siniestralidad. La mediana de la edad para los asegurados que tuvieron un accidente es de 24 años, mientras que para aquellos que no lo tuvieron es de 31 años. Se observan dos datos atípicos dentro del grupo de asegurados con accidentes, correspondientes a las edades de 56 y 45 años. Aunque la diferencia en la mediana de la edad entre los grupos con y sin accidentes no es significativa, estos valores atípicos podrían sugerir una posible tendencia de que los asegurados más jóvenes tengan un mayor riesgo de siniestralidad.
El segundo boxplot muestra la Experiencia en función de la Siniestralidad. La mediana de la experiencia en la conducción es mayor para los asegurados que no tuvieron un accidente (10 años) en comparación con los que lo tuvieron (5 años). Los cuartiles muestran que el 50% central de los asegurados sin accidentes tiene entre 7 y 10 años de experiencia, mientras que para los asegurados con accidentes el rango es entre 4 y 5 años. Además, se observa un dato atípico correspondiente a los asegurados con accidentes con 20 años de experiencia. La diferencia en la mediana de la experiencia entre los grupos con y sin accidentes parece ser significativa, lo cual sugiere que la experiencia en la conducción influye considerablemente en la probabilidad de tener un accidente.
El tercer boxplot muestra la Potencia en función de la Siniestralidad. . La mediana de la potencia del motor es mayor para los asegurados que tuvieron un accidente (110) que para los que no lo tuvieron (90). Los cuartiles indican que el 50% central de los asegurados con accidentes tiene entre 90 y 110 de potencia, mientras que para los asegurados sin accidentes el rango es entre 85 y 90. Esta diferencia en las medianas sugiere que los vehículos con mayor potencia pueden estar asociados con un mayor riesgo de accidentes.
El género también juega un papel destacado para la comprensión de cómo las variables influyen en la siniestralidad. Recordemos que el 60% de las asegurados con mujeres y el 40% son hombres. Según el gráfico, se puede observar que de los asegurados accidentados el 73% de la muestra son hombres, y el 27% son mujeres. Mientras que de los no accidentados, el 85% son mujeres y el 15% son hombres.
## `summarise()` has grouped output by 'Acc'. You can override using the `.groups`
## argument.
Por lo que se puede decir que el género juega un papel crucial en la comprensión de las tasas de siniestralidad entre los asegurados, sin embargo, hay que tener en cuenta el tamaño de la muestra y que la proporción de hombres es del 40%.
También es importante comprender cómo las diferentes variables se interrelacionan entre sí y cómo estas relaciones pueden influir en el riesgo de accidentes. Por lo que se realiza un análisis bivariado que proporciona una visión detallada de las interdependencias entre las variables:
## Edad Exp Pot
## Edad 1.0000000 0.3016585 -0.1546259
## Exp 0.3016585 1.0000000 -0.2995256
## Pot -0.1546259 -0.2995256 1.0000000
Edad y Experiencia de Conducción: existe una correlación positiva moderada (0.3017) entre la edad y la experiencia del conductor. Esto indica que a medida que los conductores son mayores, tienden a tener más años de experiencia, lo cual es intuitivo y esperado.
Potencia del Motor y Edad: existe una correlación negativa (-0.1546) entre la potencia del motor y la edad, la cual sugiere que los conductores más jóvenes tienden a preferir vehículos con mayor potencia, aunque esta relación es débil.
Potencia del Motor y Experiencia de Conducción: la correlación negativa moderada (-0.2995) entre la potencia del motor y la experiencia de conducción indica que los conductores con más experiencia tienden a preferir vehículos con menor potencia.
Ahora, para entender mejor los factores que influyen en la siniestralidad de los asegurados, se llevará a cabo un análisis utilizando modelos de regresión logística. Este tipo de modelo es adecuado para predecir la probabilidad de ocurrencia de un evento binario, en este caso, si un asegurado ha tenido un accidente o no (variable Acc). Por lo cual se plantean los siguientes modelos:
\[ \text{Modelo 1:} \quad \text{Acc} \sim \text{Exp} \]
##
## Call:
## glm(formula = Acc ~ Exp, family = "binomial", data = DB2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
Por lo que la ecuación de regresión logística estaría dada por:
\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp}\]
\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = 1.9419 - 0.2456 \cdot \text{Exp}\]
Los parámetros del modelo 1 se pueden interpretar en términos de la razón de probabilidad de que ocurra un accidente.
Coeficiente del Intercepto:
Coeficiente de Experiencia:
Este modelo indica que la experiencia en la conducción reduce significativamente la probabilidad de que un asegurado tenga un accidente. Por cada año adicional de experiencia, la probabilidad de tener un accidente disminuye en aproximadamente un 21.77%. Este resultado es estadísticamente significativo con un valor p de 0.0186, lo que sugiere una fuerte evidencia de que la experiencia influye en la siniestralidad.
\[ \text{Modelo 2:} \quad \text{Acc} \sim \text{Exp} + \text{Género} \]
##
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = DB2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890 1.2252 0.726 0.46808
## Exp -0.2400 0.1176 -2.040 0.04131 *
## SexoHombre 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
Por lo que la ecuación de regresión logística estaría dada por:
\[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo}_\text{Hombre}\] \[\log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = 0.8890 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo}_\text{Hombre}\]
La interpretación de los parámetros sería:
Coeficiente del Intercepto:
Coeficiente del Experiencia:
Coeficiente del Género:
Para evaluar el rendimiento de los modelos, se representará gráficamente los valores observados frente a los valores predichos para ambos modelos. Esta visualización permitirá una comprensión clara de la precisión del ajuste y la capacidad predictiva de cada modelo.
Por lo que las ecuaciones de pronóstico de estos modelos vendrían a ser:
\[ P(\text{Acc} = 1 \mid \text{Exp}) = \frac{1}{1 + e^{-(1.9419 - 0.2456 \cdot \text{Exp})}} \]
Donde:
Para el Modelo 2, asumiendo que \(\text{Sexo} = 1\) representa a las mujeres y \(\text{Sexo} = 2\) a los hombres:
\[ P(\text{Acc} = 1 \mid \text{Exp}, \text{Sexo}) = \frac{1}{1 + e^{-(0.8890 - 0.2400 \cdot \text{Exp} + 2.9866 \cdot \text{Sexo})}} \]
Donde: - \(P(\text{Acc} = 1 \mid \text{Exp}, \text{Sexo})\) es la probabilidad de tener un accidente dado un valor de Experiencia (Exp) y Género (Sexo). - \(\beta_0 = 0.8890\) (intercepto del modelo) - \(\beta_1 = -0.2400\) (coeficiente asociado a la variable Exp) - \(\beta_2 = 2.9866\) (coeficiente asociado a la variable Sexo, donde \(\text{Sexo} = 1\) para mujeres y \(\text{Sexo} = 2\) para hombres)
Al comparar la matriz de confusión de los dos modelos ajustados se obtiene que, para el Modelo 1:
##
## Pred. Acci. Pred. No Acci
## No 3 17
## Sí 8 7
Mientras que para el Modelo 2:
##
## Pred. Acci. Pred. No Acci
## No 2 18
## Sí 10 5
Por otro lado, para comparar los modelos y la bondad de ajuste de ambos, se aplican las siguientes medidas:
Para la deviance:
## [1] "Deviance del primer modelo: 40.0058257766585"
## [1] "Deviance del segundo modelo: 29.2487498324224"
La deviance representa una medida de la bondad de ajuste del modelo, donde valores más bajos indican un mejor ajuste del modelo a los datos observados. En este caso, el Modelo 2 tiene una deviance más baja (29.24875) en comparación con el Modelo 1 (40.00583), lo cual sugiere que el Modelo 2 se ajusta mejor a los datos observados en términos de su capacidad para predecir la variable respuesta (Accidente).
Para el AIC:
## [1] "AIC del primer modelo: 44.0058257766585"
## [1] "AIC del segundo modelo: 35.2487498324224"
Un valor menor de AIC indica un modelo que proporciona un buen ajuste con un número relativamente bajo de parámetros. En este caso, el Modelo 2 tiene un AIC más bajo (35.24875) en comparación con el Modelo 1 (44.00583), lo cual indica que el Modelo 2 es preferido debido a su mejor capacidad de ajuste y su mayor capacidad predictiva ajustada por el número de parámetros.
Para el AUC:
## [1] "AIC del primer modelo: 0.798333333333333"
## [1] "AIC del segundo modelo: 0.868333333333333"
El AUC es una medida de la capacidad discriminatoria del modelo. Un AUC cercano a 1 indica un buen rendimiento del modelo para distinguir entre clases. En este caso, un AUC de 0.7983333 sugiere que el modelo 1 tiene una capacidad discriminatoria moderada. Mientras que el AUC del modelo 2 es más alto que el del modelo 1, indicando una mejor capacidad discriminatoria para predecir la variable de interés (Accidentado vs No accidentado).
Curva ROC La curva ROC del Modelo 1 se encuentra más cerca de la esquina superior izquierda del gráfico, lo que indica un mejor rendimiento de discriminación. La curva ROC del Modelo 2 se encuentra más cerca de la diagonal, lo que indica un rendimiento de discriminación menos preciso.
El AUC del Modelo 1 es más alto (0.80), lo que confirma su mejor rendimiento de discriminación. El AUC del Modelo 2 es más bajo (0.87), lo que confirma su menor precisión en la clasificación.
La especificidad representa la proporción de individuos sin accidente que se clasifican correctamente como sin accidente. En ambos modelos, la especificidad aumenta a medida que disminuye la sensibilidad.
La sensibilidad representa la proporción de individuos con accidente que se clasifican correctamente como con accidente. En ambos modelos, la sensibilidad aumenta a medida que aumenta la especificidad.
El Modelo 1 tiene un mejor rendimiento de discriminación que el Modelo 2, según lo indicado por la curva ROC más cercana a la esquina superior izquierda del gráfico y un AUC más alto.
El Modelo 1 es más preciso para clasificar correctamente a los individuos con y sin accidente. El Modelo 2 puede ser menos preciso para clasificar correctamente a los individuos con y sin accidente.
Para el Test de razón de verosimilitud
Para el modelo 1:
## Analysis of Deviance Table
##
## Model: binomial, link: logit
##
## Response: Acc
##
## Terms added sequentially (first to last)
##
##
## Df Deviance Resid. Df Resid. Dev Pr(>Chi)
## NULL 34 47.804
## Exp 1 7.7977 33 40.006 0.005231 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Para el modelo 2:
## Analysis of Deviance Table
##
## Model: binomial, link: logit
##
## Response: Acc
##
## Terms added sequentially (first to last)
##
##
## Df Deviance Resid. Df Resid. Dev Pr(>Chi)
## NULL 34 47.804
## Exp 1 7.7977 33 40.006 0.005231 **
## Sexo 1 10.7571 32 29.249 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Deviance para Exp: 7.7977 La adición de la variable Exp al modelo 2 redujo la deviance en 7.7977 unidades, similar al modelo 1. El valor p para Exp es 0.005231, indicando su significancia.
Deviance para Sexo: 10.7571 La adición de la variable Sexo al modelo redujo la deviance adicional en 10.7571 unidades. El valor p para Sexo es 0.001039, lo cual indica que la variable Sexo también es altamente significativa para explicar la variabilidad en Acc.
En ambos casos, la prueba de deviance (deviance chi-square test) muestra que la adición de las variables predictoras (Exp en el Modelo 1 y Exp + Sexo en el Modelo 2) mejora significativamente la capacidad explicativa del modelo en comparación con el modelo nulo.
Los valores pequeños de p (< 0.05) indican que tanto Exp en el Modelo 1 como Exp y Sexo en el Modelo 2 son significativos para explicar la variabilidad en la respuesta (Acc). El Modelo 2 (Acc ~ Exp + Sexo) muestra una mejora adicional en la deviance respecto al Modelo 1 (Acc ~ Exp), lo cual sugiere que la inclusión de Sexo mejora significativamente la capacidad predictiva del modelo.
Elección del mejor modelo Considerando todas las métricas evaluadas, el Modelo 2 (Acc ~ Exp + Sexo) parece ser mejor, dado que:
Por lo tanto, el Modelo 2 no solo ofrece un mejor rendimiento general en la predicción de accidentes, sino que también mejora significativamente con la inclusión de la variable Sexo. Esto sugiere que la inclusión de Sexo como predictor adicional en el modelo puede ser crucial para mejorar su precisión y utilidad en aplicaciones prácticas de predicción de accidentes.
Teniendo en cuenta la interpretación de sus coeficientes presentada anteriormente, se puede decir que el Modelo 2 muestra que la experiencia y el sexo son variables significativas para predecir la probabilidad de accidente. La experiencia reduce la probabilidad de accidente, mientras que ser hombre aumenta significativamente esta probabilidad en comparación con ser mujer.
Ahora se procede a identificar el mejor punto de corte. Este se identifica para maximizar la capacidad de un modelo de regresión logística para discriminar entre las clases positivas y negativas, es decir, para clasificar correctamente las observaciones en función de sus probabilidades predichas.
Interpretación del Mejor Punto de Corte El Mejor Punto de Corte
(Threshold) es 0.845, es decir, es el umbral óptimo para
decidir si una predicción es positiva (accidente) o negativa (no
accidente). Si la probabilidad predicha por el modelo es mayor que
0.845, el evento se clasifica como un accidente. Si la probabilidad
predicha es menor o igual a 0.845, el evento se clasifica como no
accidente.
La Especificidad de 1.000, indica que el modelo tiene una especificidad del 100% en el mejor punto de corte, ya que la especificidad mide la proporción de verdaderos negativos (no accidentes) correctamente identificados por el modelo.
La Sensibilidad de 0.600 indica que el modelo tiene una sensibilidad del 60% en el mejor punto de corte. La sensibilidad mide la proporción de verdaderos positivos (accidentes) correctamente identificados por el modelo. Una sensibilidad del 60% significa que el modelo identifica correctamente el 60% de los accidentes, pero pierde (falsos negativos) el 40% de ellos.
El AUC (Área Bajo la Curva) de 0.868 indica que el modelo tiene una buena capacidad de discriminación entre las clases positivas (accidentes) y negativas (no accidentes). Un AUC de 0.868 significa que hay una probabilidad del 86.8% de que el modelo clasifique correctamente un par aleatorio de observaciones donde una es un accidente y la otra no lo es.
En pro de verificar si existe una mejora significativa en el modelo 2, se adicionan las variables edad y potencia del motor para crear el modelo 3.
\[ \text{Modelo 3:} \quad \text{Acc} \sim \text{Exp} + \text{Sexo} + \text{Edad} + \text{Potencia} \]
##
## Call:
## glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial,
## data = DB2)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -19.97398 9.23723 -2.162 0.0306 *
## Exp -0.47952 0.33645 -1.425 0.1541
## SexoHombre 3.04940 2.36426 1.290 0.1971
## Edad -0.02585 0.08801 -0.294 0.7689
## Pot 0.24687 0.10715 2.304 0.0212 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
Por lo que la ecuación de regresión logística estaría dada por:
\[ \log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = \beta_0 + \beta_1 \cdot \text{Exp} + \beta_2 \cdot \text{Sexo} + \beta_3 \cdot \text{Edad} + \beta_4 \cdot \text{Pot} \]
\[ \log \left( \frac{P(\text{Acc} = 1)}{1 - P(\text{Acc} = 1)} \right) = −19.97398 - 0.47952 \cdot \text{Exp} + 3.04940 2 \cdot \text{Sexo} − 0.02585 \cdot \text{Edad} + 0.24687 \cdot \text{Pot} \]
Se realiza la comparación entre el análisis de varianza del modelo 2 y el modelo 3:
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp + Sexo
## Model 2: Acc ~ Exp + Sexo + Edad + Pot
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 32 29.249
## 2 30 12.700 2 16.549 0.0002549 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
El Modelo 2 tiene 32 grados de libertad residual y una desviación residual de 29.249. El Modelo 3 tiene 30 grados de libertad residual y una desviación residual de 12.700.
Los resultados muestran que el Modelo 3 es significativamente mejor que el Modelo 2, ya que:
Estos resultados sugieren que agregar las variables Edad y Pot al modelo mejora significativamente su capacidad para explicar la variabilidad en la variable de respuesta Acc, aunque no tengan efectos significativos individualmente, como se mencionó anteriormente. Por lo tanto, el Modelo 3 proporciona un mejor ajuste a los datos observados en comparación con el Modelo 2.
Los indicadores de bondad de ajuste del Modelo 3 son:
## [1] "Deviance: 12.6995331628849"
## [1] "AIC: 22.6995331628849"
## [1] "AUC: 0.966666666666667"
Finalmente, se concluye que el Modelo 3 muestra una mejor capacidad de ajuste a los datos observados, un mejor equilibrio entre la bondad del ajuste y la complejidad del modelo según el AIC, y una mejor capacidad discriminatoria según el AUC en comparación con el Modelo 2. Por lo tanto, se podría preferir el Modelo 3 como el modelo final con base a estos criterios de evaluación.