Laboratorio N0 4.(Regresión Lineal Y Regresión logistica)

Primera parte

Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD).Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto). Se han realizado múltiples ensayos bajo ambas configuraciones y bajo variación de la carga del sistema. Los resultados se presentan en la siguiente tabla:

Ensayo 1

Conf Carga Tiempo
1 1.0 0.9
0 2.0 0.3
1 2.4 2.0
0 3.1 0.8
1 4.0 2.7
1 4.3 2.6
0 5.8 2.5
1 6.6 3.2
0 7.5 3.7
1 8.0 3.9
1 9.0 5.3
1 9.2 4.2
1 10.2 3.9

Ensayo 2

Conf Carga Tiempo
1 1.8 1.1
1 2.0 1.5
0 2.5 0.5
0 3.9 1.5
0 4.2 1.6
1 5.5 3.3
0 6.4 3.3
1 7.0 3.5
0 8.0 4.3
1 8.2 4.0
1 9.1 4.3
0 9.5 5.8

NOTA: PARA EFECTOR DE ESTE PUNTO LA VARIABLE “Carga” es igual a “carga de trabajo”, “Conf” es igual a “Configuración del sistema” y “Tiempo” es igual a “Tiempo de respuesta”

  • Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación.

De estas grafica se puede encontrar que existe una relación lineal fuerte entre las variables de Carga del sistema y Tiempo de respuesta del disco tanto para los HDD (0.95) y SSD (0.99), entendiendo que relaciones debiles se les considera a aquellas con un coeficiente de correlación por debajo de 0.5

  • Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.

Para dar respuesta a esta pregunta se crea el modelo y se hace un analisis del mismo por medio de su resumen y el test anova, los resultados se desciben y analizan a continuación.

SUMMARY

## 
## Call:
## lm(formula = Tiempo ~ Carga, data = glo_ens)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

Primero podemos obsevar que el valor del parametro de Carga tiene un valor de 0.49214, analizando este parametro nos encontramos que presenta un error estandar de 0.04177 lo que es un indicativo de que la estimación dada por este parametro es precisa, confiable y presenta una variabildiad baja, ademas presenta una valor de p de 3.18e-11 lo que indica que se rechaza la hipotesis nula lo que a su vez nos dice que este parametro es significativamente diferente se 0, aportando en la predicción de la variable “Tiempo de respuesta del disco”.

Por otra parte el intercepto tiene un valor de 0.04838 con un valor de p del 0.856 siendo entonces mayor que 0.05 lo que genera la aprobación de la hipotesis nula, indicando que no hay suficiente evidencia para concluir que el intercepto es significativamente diferente de cero a este nivel de significancia.

Por ultimo el error estándar residual (RSE) es de 0.5837, lo que muestra cuánta variación en la respuesta no es explicada por el modelo. Un valor más bajo de RSE indica que el modelo se ajusta mejor a los datos. El R-cuadrado múltiple (Multiple R-squared) es 0.8579, lo que significa que aproximadamente el 85.79% de la variación en el tiempo de respuesta es explicada por la carga del sistema, sugiriendo que el modelo tiene un buen ajuste. El R-cuadrado ajustado (Adjusted R-squared) es 0.8517 y ajusta el valor teniendo en cuenta el número de variables en el modelo, proporcionando una comparación más precisa entre modelos con diferente número de predictores. El F-statistic es 138.8 con un valor p de 3.177e-11. Un valor F-statistic alto y un valor p muy bajo indican que el modelo con predictores es significativamente mejor que un modelo sin predictores, lo que significa que los predictores del modelo son relevantes.

ANOVA

## Analysis of Variance Table
## 
## Response: Tiempo
##           Df Sum Sq Mean Sq F value    Pr(>F)    
## Carga      1 47.313  47.313  138.84 3.177e-11 ***
## Residuals 23  7.838   0.341                      
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

La tabla de Análisis de Varianza (ANOVA) para la variable respuesta “Tiempo de respuesta del disco” muestra que para la variable “Carga del sistema” hay 1 grado de libertad (Df) con una suma de cuadrados (Sum Sq) de 47.313 y una media de cuadrados (Mean Sq) también de 47.313. El valor F asociado es 138.84 con un valor p extremadamente bajo de 3.177e-11, lo que denota una significancia muy alta y que la probabilidad de que el efecto observado de la carga sobre el tiempo de respuesta sea debido al azar es extremadamente baja. Para los residuos, hay 23 grados de libertad con una suma de cuadrados de 7.838 y una media de cuadrados de 0.341. Estos resultados indican que la variable “Carga del sistema” es un predictor altamente significativo del “Tiempo de respuesta del disco”.

  • Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2. Recom. Note que la pendiente y el intercepto no son los mismos para los dos tipos de discos

Para la generación de este modelo debemos de incluir la variable Tipo de disco, esto se realizara tomando como referencia la siguiente ecuación:

Para \(\text{Configuración del discos duro} = 0\):

\[ \text{Tiempo de respuesta del disco} = \beta_0 + \beta_1 \times \text{Carga del sistema} \]

Para \(\text{Configuración del discos duro} = 1\):

\[ \text{Tiempo de respuesta del disco} = (\beta_0 + \beta_2) + (\beta_1 + \beta_3) \times \text{Carga del sistema} \]

Se realiza una anlisis del resumen obtenido para las configuraciones del modelo 2

SUMMARY

## 
## Call:
## lm(formula = Tiempo ~ Carga * Conf, data = glo_ens)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.86903 -0.17046 -0.02585  0.12307  0.99716 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) -1.33183    0.27799  -4.791 9.83e-05 ***
## Carga        0.71112    0.04783  14.868 1.28e-12 ***
## Conf         2.13824    0.34656   6.170 4.03e-06 ***
## Carga:Conf  -0.32263    0.05717  -5.643 1.33e-05 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.3642 on 21 degrees of freedom
## Multiple R-squared:  0.9495, Adjusted R-squared:  0.9423 
## F-statistic: 131.6 on 3 and 21 DF,  p-value: 8.955e-14

De este resumen se encuentra que las ecuaciones tendrian la siguiente forma

Para \(\text{Configuración del discos duro} = 0\):

\[ \text{Tiempo de respuesta del disco} = -1.33183 + 0.71112 \times \text{Carga del sistema} \]

Para \(\text{Configuración del discos duro} = 1\):

\[ \text{Tiempo de respuesta del disco} = (-1.33183 + 2.13824) + (0.71112 - 0.32263) \times \text{Carga del sistema} \] \[ \text{Tiempo de respuesta del disco} = 0.80641 + 0.38849 \times \text{Carga del sistema} \]

De la información anterior generada por el SUMMARY nos indica que para el modelo 2 todos los parametros _0 ,_1 ,_2 y _3 se rechaza la hipotesis nula por sus valores de p mayores a 0.05 lo que indican que dichos parametros aporta a la predicción de la variable tiempo de respuesta del disco. El error estándar residual es 0.3642, lo que indica una variación relativamente baja no explicada por el modelo. El R-cuadrado múltiple es 0.9495, sugiriendo que el modelo explica el 94.95% de la variabilidad en el “Tiempo de respuesta”, y el R-cuadrado ajustado es 0.9423. El F-statistic de 131.6 con un valor p de 8.955e-14 indica que el modelo es altamente significativo.

  • Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.
## Analysis of Variance Table
## 
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga * Conf
##   Res.Df    RSS Df Sum of Sq     F    Pr(>F)    
## 1     23 7.8375                                 
## 2     21 2.7849  2    5.0526 19.05 1.913e-05 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El test ANOVA indica que la inclusión de la variable cualitativa “Configuración del discos duro” y su interacción con “Carga del sistema” mejora significativamente el ajuste del modelo. Esto se evidencia por el valor p extremadamente bajo (1.913e-05), que es mucho menor que el nivel de significancia comúnmente usado de 0.05. El alto valor del F-statistic (19.05) refuerza esta conclusión, indicando que el modelo con la interacción (Tiempo ~ Carga * Conf) proporciona una mejora significativa en la explicación de la variabilidad en el “Tiempo de respuesta del disco” comparado con el modelo que solo incluye “Carga del sistema”. Por lo tanto, se concluye que la inclusión de “Configuración del discos duro” y su interacción con “Carga del sistema” es estadísticamente significativa y mejora el ajuste del modelo.

  • Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.

A continuación se presenta una grafica del ajuste del modelo.

Por medio del siguiente grafico verificaremos el cumplimiento de los supuestos sobre el termino error.

De esta grafica se puede conclir que los residuos están distribuidos en su mayoría de manera aleatoria alrededor de la línea horizontal en cero, lo que sugiere que se cumple el supuesto de linealidad. No se observan patrones claros ni tendencias significativas, indicando que los residuos tienen una varianza constante. Además, la ausencia de puntos excesivamente alejados sugiere que no hay influencias significativas de outliers. En conjunto, estos resultados indican que los supuestos del término de error se cumplen adecuadamente, validando la fiabilidad del modelo ajustado.

  • Concluya de forma general.

El Modelo 2, que incluye la interacción entre Carga y Conf, muestra un R-cuadrado significativamente más alto (0.9495 vs 0.8579) y un R-cuadrado ajustado mayor (0.9423 vs 0.8517) en comparación con el Modelo 1, indicando que explica mejor la variabilidad en el tiempo de respuesta. Además, el valor p del test ANOVA (1.913e-05) confirma que la inclusión de Conf y su interacción con Carga mejora significativamente el ajuste del modelo. Por tanto, el Modelo 2 es claramente superior al Modelo 1 en términos de ajuste y capacidad explicativa, haciendo que sea la elección preferida para entender la relación entre Carga, Conf y Tiempo.

Segunda parte

Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información (accidentes.xlsx), donde:

  • Acc : haber tenido algún accidente en el último año (0:no; 1:sí).
  • Exp : años de experiencia.
  • Edad : edad del conductor.
  • Pot : potencia del motor.
  • Sexo : 0 (mujer), 1 (hombre).

Realice lo siguiente acorde a la infomración anterior:

  • Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).

Para realizar este analisis de manera rapida y efectiva se plantea un analisis de correlación por medio de los coeficientes, entendiendo que tenemos datos heterogenios aplciamos la función hetcor que calcula la correlación de datos heterogenios.

##             Acc        Exp       Edad        Pot       Sexo
## Acc   1.0000000 -0.4429689 -0.1781849  0.7061185  0.5892557
## Exp  -0.4429689  1.0000000  0.3016585 -0.2995256 -0.2055161
## Edad -0.1781849  0.3016585  1.0000000 -0.1546259 -0.1938396
## Pot   0.7061185 -0.2995256 -0.1546259  1.0000000  0.5258912
## Sexo  0.5892557 -0.2055161 -0.1938396  0.5258912  1.0000000

Si nos enfocamos netamente en la variable Acc la cual representan los siniestros podemos evidencias que la correlación mas fuerte se encuentra con respecto a la variable potencia del motor, si lo extraemos a la realidad puede tener sentido el tener un carro con mayor potencia implicara mayor posibilidad de velocidad y a su vez de accidentalidad, tenemos tambien el sexo con una correlación con una fuerza media en comparación a edad y experiencia, lo que puede indicar que es posbile una leve influencia de esta variable en el calculo la accidentalidad.

  • Utilice la función glm, del software R, para ajustar los siguientes modelos de regresión logística: Modelo 1: Acc ~ Exp Modelo 2: Acc ~ Exp + genero Represente gráficamente el ajuste de los 2 modelos (observados vs predichos). Al analizar los graficos obtenidos podemos ver que el modelo no se ajusta adecuadamente, de entrada sabemos que tampoco estamos adaptando al modelo a el mejor threshold. por otra parte el modelo que intutivamente se comparta peor es el modelo 1 con una sola variable independiente, por consiguiente vale la pena anlizar mas adelante como se puede mejorar el modelo 2, entendiendo que claramente se necesitan mas parametros para generar una mejor predicción en este caso en particular.

Nota: para esta caso se esperaria que todos los puntos en el eje de predicción se acomodaran en cero o en uno dependiento de la observación * Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.

Para poder escribir la ecuación asociada a los dos modelos hacemos uso de summary

SUMMARY MODELO 1

## 
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = data2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4

La ecuación obtenida es:

\[ P(\text{Acc} = 1) = \frac{1}{1 + e^{-(1.9419 - 0.2456 \times \text{Exp})}} \]

SUMMARY MODELO 2

## 
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = data2)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)   
## (Intercept)   0.8890     1.2252   0.726  0.46808   
## Exp          -0.2400     0.1176  -2.040  0.04131 * 
## Sexo          2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

la ecuación obtenida es:

\[ P(\text{Acc} = 1) = \frac{1}{1 + e^{-(0.889 - 0.2400 \times \text{Exp} - 2.9866 \times \text{Sexo})}} \]

  • A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.

Analisis por Deviance

## Modelo 1 - Deviance: 40.00583
## Modelo 2 - Deviance: 29.24875

Entendiedo que menores valores de deviance indican un mejor ajuste, como la deviance residual del modelo 2 es significativamente menor que la del modelo 1, el modelo 2 ajusta mejor a los datos.

Analisis por AIC

## Modelo 1 - AIC: 44.00583
## Modelo 2 - AIC: 35.24875

Entendiendo que el AIC es una medida de la calidad de un modelo estadístico para un conjunto dado de datos. Proporciona una forma de equilibrio entre la bondad de ajuste y la complejidad del modelo (número de parámetros), al igual que la desviance el modelo presenta un menor valor indicando un mejor equilibrio entre ajuste y complejidad.

Analisis por curva ROC

Tentantivamente podriamos indicar que el modelo 2 tiene una curva ROC que se aproxima mas a las cordenadas (1,1) pero esto se concretara mas abajo calculando el AUC

Analisis por AUC

## Modelo 1 - AUC: 0.7983333
## Modelo 2 - AUC: 0.8683333

El AUC del Modelo 2 es mayor que el del Modelo 1, esto sugiere que el Modelo 2 tiene un mejor rendimiento en términos de clasificación binaria y tiene una mejor proporciò entre Especificidad y Sensibilidad

Analisis por test de razón de verosimilitud

## Likelihood ratio test
## 
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + Sexo
##   #Df  LogLik Df  Chisq Pr(>Chisq)   
## 1   2 -20.003                        
## 2   3 -14.624  1 10.757   0.001039 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El Modelo 2 tiene una log-verosimilitud más alta (menos negativa) que el Modelo 1, lo que sugiere que el Modelo 2 se ajusta mejor a los datos.

Chi-square Statistic es 10.757 con un valor p asociado de 0.001039. Este valor p es muy bajo, menor que 0.05, lo que indica que la mejora en el ajuste al pasar del Modelo 1 al Modelo 2 es estadísticamente significativa.

  • Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.

MODELO 1

Intercepto

Estimación: 1.9419 Interpretación: El intercepto representa el log-odds de haber tenido un accidente cuando Exp es 0. Este valor es estadísticamente significativo, como lo indica su valor p de 0.0479 (p < 0.05). Esto sugiere que, en ausencia de experiencia, hay una base significativa en la probabilidad de haber tenido un accidente.

Exp (Experiencia)

Estimación: -0.2456 Interpretación: Cada año adicional de experiencia se asocia con una disminución en los log-odds de haber tenido un accidente en 0.2456. Este coeficiente es estadísticamente significativo con un valor p de 0.0186 (p < 0.05). Esto sugiere que la experiencia tiene un efecto protector contra la probabilidad de haber tenido un accidente, es decir, a mayor experiencia, menor probabilidad de accidentes.

MODELO 2

Intercepto

Estimación: 0.8890 Interpretación: El intercepto representa el log-odds de haber tenido un accidente cuando Exp es 0 y Sexo es 0 (mujer). Este valor no es estadísticamente significativo, como lo indica su valor p de 0.46808 (p > 0.05). Por lo tanto, no se puede concluir que el intercepto sea diferente de cero con significancia estadística.

Exp (Experiencia)

Estimación: -0.2400 Interpretación: Cada año adicional de experiencia se asocia con una disminución en los log-odds de haber tenido un accidente en 0.2400. Este coeficiente es estadísticamente significativo con un valor p de 0.04131 (p < 0.05). Esto sugiere que la experiencia tiene un efecto protector contra la probabilidad de haber tenido un accidente, es decir, a mayor experiencia, menor probabilidad de accidentes.

Sexo Estimación: 2.9866 Interpretación: Ser hombre (Sexo = 1) en comparación con ser mujer (Sexo = 0) se asocia con un aumento en los log-odds de haber tenido un accidente en 2.9866. Este coeficiente es altamente significativo con un valor p de 0.00518 (p < 0.01). Esto indica que, manteniendo constante la experiencia, los hombres tienen una mayor probabilidad de haber tenido un accidente en comparación con las mujeres.

Conclusiòn

El Modelo 2 es preferido sobre el Modelo 1 debido a su mejor ajuste y la significancia estadística de los coeficientes adicionales que incluye. La experiencia (Exp) tiene un efecto protector significativo contra la probabilidad de haber tenido un accidente en ambos modelos. Sin embargo, la inclusión del sexo (Sexo) en el Modelo 2 proporciona una comprensión adicional significativa de los factores que afectan la probabilidad de haber tenido un accidente, mostrando que los hombres tienen una mayor probabilidad de accidentes en comparación con las mujeres, independientemente de la experiencia. Por lo tanto, el Modelo 2 es el modelo más adecuado para predecir la probabilidad de haber tenido un accidente considerando tanto la experiencia como el sexo del conductor.

  • Para el modelo seleccionado en el punto v. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).
## El mejor punto de corte: 0.8449838

Se analizara entonces con base a dicho punto de corte las distitnas metricas de desempeño del modelo

## Accuracy: 0.8285714
## Sensitivity (Recall): 0.6
## Specificity: 1
## Precision: 1
## F1 Score: 0.75

De estas merticas se puede concluir por ejemplo que el modelo 2 tiene un buen rendimiento en la clasificación con una exactitud (accuracy) de 82.86%, indicando que el modelo clasifica correctamente el 82.86% de los casos. La sensibilidad (recall) del 60% sugiere que el modelo identifica el 60% de los casos positivos (accidentes), mientras que una especificidad del 100% indica que el modelo clasifica perfectamente los casos negativos (sin accidentes). La precisión del 100% significa que todos los casos predichos como positivos son realmente positivos. El F1 Score de 0.75, que es una medida balanceada entre precisión y sensibilidad, refleja un buen equilibrio entre estos dos aspectos. En general, el Modelo 2 demuestra ser efectivo en la predicción de accidentes, aunque podría beneficiarse de mejoras en la sensibilidad.

  • Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor. Se crea entonces un modelo 3 con la adicciòn de esas dos variables, se verificara su desempeño en comparaciòn con las metrias anteriores del modelo2
## Accuracy: 0.9428571
## Sensitivity (Recall): 0.9333333
## Specificity: 0.95
## Precision: 0.9333333
## F1 Score: 0.9333333

De esto se puede deducir que la adición de las variables Edad y Pot al modelo ha resultado en una mejora significativa en todos los indicadores clave de rendimiento, excepto en la especificidad, donde hay una ligera disminución. La mayor mejora se observa en la sensibilidad y el F1 Score, lo que indica que el Modelo 3 es más efectivo para identificar correctamente los casos positivos (accidentes) mientras mantiene un alto nivel de precisión y exactitud general.

En conclusión el Modelo 3 proporciona un mejor rendimiento global y es más efectivo para predecir la probabilidad de haber tenido un accidente. La inclusión de las variables Edad y Pot añade valor significativo al modelo, haciéndolo más robusto y útil para aplicaciones prácticas donde es vital minimizar los falsos negativos y maximizar la detección correcta de los casos positivos.

  • Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.

INTRODUCCIÓN

Por medio de este corto reporte se analizara los factores que afectan la siniestralidad (accidentalidad) entre los conductores. A través de la construcción y evaluación de varios modelos de regresión logística, se han identificado variables clave que influyen en la probabilidad de haber tenido un accidente.

METODOLOGÍA Se analizaron tres modelos de regresión logística para predecir la probabilidad de haber tenido un accidente:

  1. Modelo 1: Acc ~ Exp
  2. Modelo 2: Acc ~ Exp + Sexo
  3. Modelo 3: Acc ~ Exp + Sexo + Edad + Pot Cada modelo fue evaluado utilizando métricas de bondad de ajuste y clasificación, incluyendo exactitud, sensibilidad, especificidad, precisión y F1 Score. Se utilizó la curva ROC y el índice Youden para identificar el mejor punto de corte para cada modelo.

RESULTADOS

Se obtuvieron los siguientes resultados:

Modelo 2: • Accuracy: 82.86% • Sensitivity (Recall): 60% • Specificity: 100% • Precision: 100% • F1 Score: 75%

Modelo 3: • Accuracy: 94.29% • Sensitivity (Recall): 93.33% • Specificity: 95% • Precision: 93.33% • F1 Score: 93.33%

ANALISIS DE FACTORES

Experiencia (Exp): o Cada año adicional de experiencia se asocia con una disminución significativa en la probabilidad de haber tenido un accidente. La experiencia tiene un efecto protector, reduciendo los accidentes a medida que aumenta.

Sexo: o Ser hombre se asocia con una mayor probabilidad de haber tenido un accidente en comparación con ser mujer. Este hallazgo es estadísticamente significativo y sugiere que el sexo del conductor es un factor importante en la siniestralidad.

Edad: o La inclusión de la edad en el Modelo 3 muestra una mejora en el rendimiento del modelo, sugiriendo que la edad del conductor también es un factor significativo. Conductores de diferentes grupos de edad pueden tener diferentes niveles de riesgo de accidentes.

Potencia del motor (Pot): o La potencia del motor es otro factor que mejora significativamente el modelo. Conductores de vehículos con motores más potentes tienen diferentes probabilidades de haber tenido un accidente, lo cual es importante para considerar en las políticas de seguridad y aseguramiento.

CONCLUSIÓN

El análisis ha demostrado que la experiencia del conductor, el sexo, la edad y la potencia del motor son factores significativos que afectan la siniestralidad. El Modelo 3 (Acc ~ Exp + Sexo + Edad + Pot) fue identificado como el mejor modelo, proporcionando una predicción más precisa y equilibrada de los accidentes. Recomendaciones 1. Programas de Capacitación: Implementar programas de capacitación continua para conductores, especialmente aquellos con menos experiencia, puede ayudar a reducir la siniestralidad. 2. Políticas de Evaluación de Riesgos: Incorporar la evaluación del sexo, la edad y la potencia del motor en las políticas de evaluación de riesgos y en la asignación de primas de seguro. 3. Fomento de la Seguridad Vial: Promover prácticas de conducción segura y concienciar sobre los riesgos asociados con vehículos de mayor potencia, particularmente entre conductores jóvenes. 4. Monitoreo y Análisis Continuo: Continuar monitoreando y analizando datos de siniestralidad para ajustar políticas y programas de acuerdo con los hallazgos más recientes y las tendencias emergentes.