Punto 1: Comparación de desempeño de dos clases de discos duros

i. Representación gráfica de la relación entre tiempo de respuesta y carga del sistema

Se procede a mostrar la relación entre el tiempo de respuesta y la carga del sistema para los dos tipos de discos duros.

Podemos observar en el gráfico que si parece haber una relación lineal entre la carga del sistema y el tiempo de respuesta para cada tipo de disco duro.

Coeficientes de correlación

Se procede a calcular los coeficientes de correlación de Pearson para medir la fuerza de la relación lineal entre la carga del sistema y el tiempo de respuesta para ambos tipos de disco.

## Coeficiente de correlación para SDD: 0.9909945
## Coeficiente de correlación para HDD: 0.9618358

Los coeficientes de correlación obtenidos indican una fuerte relación lineal entre la carga del sistema y el tiempo de respuesta para ambos tipos de discos duros.

SDD (0): Coeficiente de correlación de 0.991 HDD (1): Coeficiente de correlación de 0.962

Ambos coeficientes son muy cercanos a 1, por lo tanto se puede concluir que la carga del sistema y el tiempo de respuesta están altamente correlacionados de manera lineal para ambos tipos de discos.

ii. Ajuste del primer modelo de regresión simple (Modelo 1)

Se procede a ajustar un modelo de regresión lineal simple sin incluir la configuración del disco duro.

## 
## Call:
## lm(formula = Tiempo ~ Carga, data = data)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.16824 -0.40281 -0.03945  0.43541  1.07627 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  0.04838    0.26321   0.184    0.856    
## Carga        0.49214    0.04177  11.783 3.18e-11 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared:  0.8579, Adjusted R-squared:  0.8517 
## F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

Evaluación de la Bondad de Ajuste

El alto valor de R² (donde el 85.79% de la variabilidad en el tiempo de respuesta se puede explicar mediante la variabilidad en la carga del sistema) y el bajo error estándar residual indican que el modelo ajusta bien los datos. La significancia del coeficiente de Carga (p-valor < 0.001) y el modelo en general indica que la carga del sistema es un buen predictor del tiempo de respuesta.

Interpretación de resultados

El modelo de regresión lineal simple muestra una fuerte relación entre la carga del sistema y el tiempo de respuesta, con una alta capacidad explicativa (R² = 0.8579). El coeficiente de Carga es significativo, indicando que a medida que aumenta la carga de trabajo, el tiempo de respuesta también aumenta.

iii. Obtención del segundo modelo incluyendo la variable Dummy y su interacción

## 
## Call:
## lm(formula = Tiempo ~ Carga * as.factor(Conf), data = data)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.65754 -0.12362  0.06308  0.16101  0.43457 
## 
## Coefficients:
##                        Estimate Std. Error t value Pr(>|t|)    
## (Intercept)            -1.32327    0.21947  -6.030 5.53e-06 ***
## Carga                   0.70407    0.03438  20.477 2.34e-15 ***
## as.factor(Conf)1        2.21824    0.27991   7.925 9.58e-08 ***
## Carga:as.factor(Conf)1 -0.34500    0.04432  -7.784 1.27e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.3019 on 21 degrees of freedom
## Multiple R-squared:  0.9653, Adjusted R-squared:  0.9603 
## F-statistic: 194.7 on 3 and 21 DF,  p-value: 1.756e-15

Evaluación de la Bondad de Ajuste

R-cuadrado (R² = 0.9653):

El valor de R² indica que el 96.53% de la variabilidad en el tiempo de respuesta se puede explicar mediante la variabilidad en la carga del sistema y el tipo de disco. Esto sugiere que el modelo tiene un muy buen ajuste.

R-cuadrado ajustado (Adjusted R² = 0.9603):

Este valor ajusta el R² según el número de predictores en el modelo. En este caso, sigue siendo muy alto, lo que refuerza que el modelo tiene un excelente ajuste.

Error estándar residual (0.3019):

Tiene un valor bajo lo que indica un mejor ajuste.

Estadístico F (194.7) y p-valor del modelo (1.756e-15):

Un alto valor del estadístico F y un p-valor extremadamente bajo indican que el modelo es significativo en su conjunto.

Anotación sobre la Pendiente e Intercepto

Como se puede observar en los coeficientes, la pendiente y el intercepto no son los mismos para los dos tipos de discos:

Para HDD: Intercepto: -1.32327 Pendiente: 0.70407

Para SDD: Intercepto: -1.32327 + 2.21824 = 0.89497 Pendiente: 0.70407 - 0.34500 = 0.35907

Esto indica que el tiempo de respuesta inicial es mayor para SDD en comparación con HDD, pero la tasa de aumento del tiempo de respuesta con la carga de trabajo es menor para SDD en comparación con HDD.

iv. Prueba ANOVA

Se realiza la prueba ANOVA para confirmar la mejora del ajuste del modelo con la inclusión de la variable cualitativa y su interacción.

## Analysis of Variance Table
## 
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga * as.factor(Conf)
##   Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
## 1     23 7.8375                                  
## 2     21 1.9137  2    5.9238 32.502 3.723e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

La prueba ANOVA muestra que la inclusión de la variable cualitativa Conf y su interacción con la carga en el Modelo 2 mejora significativamente el ajuste del modelo. Esto concluye que tanto el tipo de disco como la interacción entre la carga y el tipo de disco son factores importantes para predecir el tiempo de respuesta.

Resumen de los Resultados
RSS (Residual Sum of Squares):
Modelo 1: 7.8375
Modelo 2: 1.9137

La suma residual de cuadrados se reduce de forma importante al pasar del Modelo 1 al Modelo 2, lo que indica que el Modelo 2 tiene un mejor ajuste a los datos.

Modelo 1 (Tiempo ~ Carga):

Este modelo incluye solo la carga como predictor del tiempo de respuesta. Tiene una suma residual de cuadrados de 7.8375 y 23 grados de libertad residuales.

Modelo 2 (Tiempo ~ Carga * Conf):

Este modelo incluye la carga, el tipo de disco, y su interacción como predictores del tiempo de respuesta. Tiene una suma residual de cuadrados de 1.9137 y 21 grados de libertad residuales. La mejora en el ajuste del modelo es significativa con un valor F de 32.502 y un p-valor de 3.723e-07.

v. Evaluación de los Supuestos del Modelo 2

Se procede a interpretar los gráficos diagnósticos para evaluar si los residuos cumplen con los supuestos de homocedasticidad, normalidad y no autocorrelación.

Residuals vs Fitted:

Los residuos parecen estar dispersos aleatoriamente alrededor de la línea horizontal, lo que sugiere que no hay una fuerte evidencia de heterocedasticidad. Sin embargo, hay una ligera tendencia en los residuos, lo que podría indicar una pequeña desviación de la homocedasticidad.

Normal Q-Q:

La mayoría de los puntos siguen aproximadamente la línea diagonal, lo que sugiere que los residuos se distribuyen de manera aproximadamente normal. Sin embargo, hay algunas desviaciones en los extremos.

Scale-Location:

La dispersión de los puntos parece razonablemente constante a lo largo de los valores ajustados, aunque hay una ligera tendencia ascendente. Esto podría indicar una pequeña desviación de la homocedasticidad.

Conclusión de la Evaluación de Supuestos

Normalidad de los Residuos: Los residuos se distribuyen de manera aproximadamente normal, aunque con algunas desviaciones en los extremos. Heterocedasticidad: Hay una ligera tendencia que podría indicar heterocedasticidad, pero no es muy pronunciada.

vi. Conclusión General

La inclusión de la variable cualitativa (tipo de disco) y su interacción con la carga del sistema mejora significativamente el ajuste del modelo, proporcionando una mejor comprensión de la relación entre la carga del sistema y el tiempo de respuesta para los dos tipos de discos duros.

Punto 2 Compañía de seguros

i. Análisis exploratorio de datos

##       Acc              Exp              Edad         Pot             Sexo    
##  Min.   :0.0000   Min.   : 1.000   Min.   :20   Min.   : 70.0   Min.   :1.0  
##  1st Qu.:0.0000   1st Qu.: 6.500   1st Qu.:25   1st Qu.: 90.0   1st Qu.:1.0  
##  Median :0.0000   Median : 9.000   Median :29   Median : 95.0   Median :1.0  
##  Mean   :0.4286   Mean   : 9.543   Mean   :31   Mean   :101.6   Mean   :1.4  
##  3rd Qu.:1.0000   3rd Qu.:12.000   3rd Qu.:36   3rd Qu.:110.0   3rd Qu.:2.0  
##  Max.   :1.0000   Max.   :20.000   Max.   :56   Max.   :150.0   Max.   :2.0

1. Distribución de la siniestralidad por Experiencia

Los conductores que no han tenido accidentes tienden a tener una mayor experiencia en años comparado con aquellos que han tenido accidentes. La mediana de los años de experiencia es mayor para los conductores sin accidentes. Hay más variabilidad en los años de experiencia entre los conductores que han tenido accidentes, lo que indica que tanto conductores novatos como experimentados pueden tener accidentes, pero es más común entre los menos experimentados.

2. Distribución de la siniestralidad por Edad

La edad de los conductores que no han tenido accidentes tiende a ser mayor en comparación con aquellos que han tenido accidentes. La mediana de la edad es mayor para los conductores sin accidentes. Hay más variabilidad en la edad entre los conductores que han tenido accidentes, lo que sugiere que los accidentes no están restringidos a un grupo de edad específico, pero son más comunes entre los conductores más jóvenes.

3. Distribución de la siniestralidad por Potencia del Motor

Los vehículos que han tenido accidentes tienden a tener motores de mayor potencia en comparación con aquellos que no han tenido accidentes. La mediana de la potencia del motor es mayor para los vehículos involucrados en accidentes. Hay una mayor dispersión en la potencia del motor entre los vehículos que han tenido accidentes, lo que sugiere que los vehículos con motores más potentes pueden estar más involucrados en accidentes.

4. Distribución de la siniestralidad por Sexo

La mayoría de los conductores sin accidentes son del sexo femenino, mientras que los conductores con accidentes son predominantemente del sexo masculino.

Resumen del Análisis Exploratorio de Datos

Experiencia: Los conductores con más años de experiencia tienden a tener menos accidentes. Edad: Los conductores más jóvenes tienden a tener más accidentes. Potencia del Motor: Los vehículos con motores más potentes están más frecuentemente involucrados en accidentes. Sexo: Los hombres tienen una mayor proporción de accidentes en comparación con las mujeres.

Lo anterior indica que la experiencia, la edad, la potencia del motor y el sexo son factores importantes a considerar en la siniestralidad de los asegurados.

ii. Ajuste de los Modelos de Regresión Logística

Modelo 1: Acc ~ Exp
## 
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = data_accidentes)
## 
## Coefficients:
##             Estimate Std. Error z value Pr(>|z|)  
## (Intercept)   1.9419     0.9816   1.978   0.0479 *
## Exp          -0.2456     0.1044  -2.354   0.0186 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 40.006  on 33  degrees of freedom
## AIC: 44.006
## 
## Number of Fisher Scoring iterations: 4
Modelo 2: Acc ~ Exp + Sexo
## 
## Call:
## glm(formula = Acc ~ Exp + as.factor(Sexo), family = binomial, 
##     data = data_accidentes)
## 
## Coefficients:
##                  Estimate Std. Error z value Pr(>|z|)   
## (Intercept)        0.8890     1.2252   0.726  0.46808   
## Exp               -0.2400     0.1176  -2.040  0.04131 * 
## as.factor(Sexo)2   2.9866     1.0683   2.796  0.00518 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 29.249  on 32  degrees of freedom
## AIC: 35.249
## 
## Number of Fisher Scoring iterations: 5

Predicciones y Representación Gráfica

Se procede a predecir las probabilidades de accidentes utilizando los dos modelos y a graficar los resultados.

Predicciones

iii. Ecuaciones de pronóstico asociadas a los 2 modelos.

##              Estimate Std. Error   z value   Pr(>|z|)
## (Intercept)  1.941925  0.9816478  1.978230 0.04790277
## Exp         -0.245607  0.1043575 -2.353517 0.01859678
##                    Estimate Std. Error    z value    Pr(>|z|)
## (Intercept)       0.8890341  1.2252410  0.7255994 0.468084395
## Exp              -0.2399985  0.1176225 -2.0404126 0.041309249
## as.factor(Sexo)2  2.9865699  1.0682727  2.7956998 0.005178748

Ecuación del Modelo 1: Acc ~ Exp

\[ \log\left(\frac{p}{1-p}\right) = 1.941925 - 0.245607 \cdot \text{Exp} \]

Ecuación del Modelo 1: Acc ~ Exp + género

\[ \log\left(\frac{p}{1-p}\right) = 0.8890341 - 0.2399985 \cdot \text{Exp} + 2.9865699 \cdot \text{Sexo}_2 \]

iv. Evaluación y comparación del ajuste de los 2 modelos anteriores.

Calcular la Deviance y el AIC

## Modelo 1 - Deviance: 40.00583 AIC: 44.00583
## Modelo 2 - Deviance: 29.24875 AIC: 35.24875

Generar la curva ROC y calcular el AUC

## Modelo 1 - AUC: 0.7983333
## Modelo 2 - AUC: 0.8683333

Realizar el test de razón de verosimilitud

## Analysis of Deviance Table
## 
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + as.factor(Sexo)
##   Resid. Df Resid. Dev Df Deviance Pr(>Chi)   
## 1        33     40.006                        
## 2        32     29.249  1   10.757 0.001039 **
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Deviance:

El Modelo 2 tiene una deviance menor que el Modelo 1, lo que indica un mejor ajuste del Modelo 2.

AIC:

El AIC del Modelo 2 es menor que el del Modelo 1, lo que sugiere que el Modelo 2 es mejor considerando el equilibrio entre ajuste y complejidad del modelo.

AUC:

El Modelo 2 tiene un AUC mayor (0.8683333) en comparación con el Modelo 1 (0.7983333), lo que indica que el Modelo 2 tiene una mejor capacidad discriminativa para predecir accidentes.

Test de razón de verosimilitud:

El p-valor (0.001039) es muy bajo, lo que indica que el Modelo 2, que incluye la variable adicional Sexo, mejora significativamente el ajuste en comparación con el Modelo 1.

v. Interpretación de los Coeficientes modelo 2

Intercepto (β0): 0.8890341

Este coeficiente representa el logit (log-odds) de la probabilidad de tener un accidente cuando Exp (experiencia) es 0 y el sexo es el de referencia (Sexo = 1). Interpretación: No es significativo (p-valor = 0.468), lo que sugiere que cuando la experiencia es 0, el intercepto no tiene un impacto significativo en la probabilidad de tener un accidente.

Exp (𝛽1): -0.2399985

Este coeficiente indica el cambio en el logit de la probabilidad de tener un accidente por cada año adicional de experiencia. Interpretación: Cada año adicional de experiencia reduce el logit de la probabilidad de tener un accidente en aproximadamente 0.24. Es significativo con un p-valor = 0.041, lo que indica que la experiencia tiene un efecto protector contra los accidentes.

factor(Sexo) (𝛽2): 2.9865699

Este coeficiente representa el cambio en el logit de la probabilidad de tener un accidente cuando el sexo cambia del valor de referencia (Sexo = 1) al segundo nivel (Sexo = 2). Interpretación: Cuando el sexo es masculino, el logit de la probabilidad de tener un accidente aumenta en aproximadamente 2.99. Es altamente significativo con un p-valor = 0.005, lo que indica que el sexo es un factor importante en la probabilidad de tener un accidente.

Validación de la Significancia de los Coeficientes

Para validar la significancia de los coeficientes, se utilizan los p-valores asociados a cada coeficiente. Los resultados indican:

Intercepto: No es significativo (p-valor = 0.468) Exp: Es significativo (p-valor = 0.041) Sexo: Es altamente significativo (p-valor = 0.005)

Conclusión

El Modelo 2 (Acc ~ Exp + Sexo) es el mejor modelo. La experiencia (Exp) y el sexo (Sexo) son factores significativos en la probabilidad de tener un accidente. Cada año adicional de experiencia reduce la probabilidad de tener un accidente, y el sexo masculino aumenta significativamente la probabilidad de tener un accidente.

vi. Indicadores de bondad de clasificación

Identificar el Mejor Punto de Corte

##   threshold
## 1 0.8449838

vi. Mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor

## 
## Call:
## glm(formula = Acc ~ Exp + as.factor(Sexo) + Edad + Pot, family = binomial, 
##     data = data_accidentes)
## 
## Coefficients:
##                   Estimate Std. Error z value Pr(>|z|)  
## (Intercept)      -19.97398    9.23723  -2.162   0.0306 *
## Exp               -0.47952    0.33645  -1.425   0.1541  
## as.factor(Sexo)2   3.04940    2.36426   1.290   0.1971  
## Edad              -0.02585    0.08801  -0.294   0.7689  
## Pot                0.24687    0.10715   2.304   0.0212 *
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 47.804  on 34  degrees of freedom
## Residual deviance: 12.700  on 30  degrees of freedom
## AIC: 22.7
## 
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
## 
## Model 1: Acc ~ Exp + as.factor(Sexo)
## Model 2: Acc ~ Exp + as.factor(Sexo) + Edad + Pot
##   Resid. Df Resid. Dev Df Deviance  Pr(>Chi)    
## 1        32     29.249                          
## 2        30     12.700  2   16.549 0.0002549 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Interpretación de los Coeficientes del Modelo 3

Exp:

El coeficiente de -0.47952 no es significativo (p-valor > 0.05), sugiriendo que la experiencia no tiene un impacto significativo en la probabilidad de accidente en este modelo.

Sexo

El coeficiente de 3.04940 no es significativo (p-valor > 0.05), indicando que el sexo tampoco es un factor significativo en este modelo.

Edad:

El coeficiente de -0.02585 no es significativo (p-valor > 0.05), sugiriendo que la edad no tiene un impacto significativo en la probabilidad de accidente.

Potencia (Pot):

El coeficiente de 0.24687 es significativo (p-valor < 0.05), indicando que la potencia del motor tiene un impacto significativo en la probabilidad de accidente.

Análisis del Test de Razón de Verosimilitud

El test de razón de verosimilitud muestra un p-valor de 0.0002549, que es muy bajo, lo que indica que la adición de las variables Edad y Pot mejora significativamente el ajuste del modelo.