Se procede a mostrar la relación entre el tiempo de respuesta y la carga del sistema para los dos tipos de discos duros.
Podemos observar en el gráfico que si parece haber una relación lineal entre la carga del sistema y el tiempo de respuesta para cada tipo de disco duro.
Se procede a calcular los coeficientes de correlación de Pearson para medir la fuerza de la relación lineal entre la carga del sistema y el tiempo de respuesta para ambos tipos de disco.
## Coeficiente de correlación para SDD: 0.9909945
## Coeficiente de correlación para HDD: 0.9618358
Los coeficientes de correlación obtenidos indican una fuerte relación lineal entre la carga del sistema y el tiempo de respuesta para ambos tipos de discos duros.
SDD (0): Coeficiente de correlación de 0.991 HDD (1): Coeficiente de correlación de 0.962
Ambos coeficientes son muy cercanos a 1, por lo tanto se puede concluir que la carga del sistema y el tiempo de respuesta están altamente correlacionados de manera lineal para ambos tipos de discos.
Se procede a ajustar un modelo de regresión lineal simple sin incluir la configuración del disco duro.
##
## Call:
## lm(formula = Tiempo ~ Carga, data = data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.16824 -0.40281 -0.03945 0.43541 1.07627
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.04838 0.26321 0.184 0.856
## Carga 0.49214 0.04177 11.783 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5837 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
El alto valor de R² (donde el 85.79% de la variabilidad en el tiempo de respuesta se puede explicar mediante la variabilidad en la carga del sistema) y el bajo error estándar residual indican que el modelo ajusta bien los datos. La significancia del coeficiente de Carga (p-valor < 0.001) y el modelo en general indica que la carga del sistema es un buen predictor del tiempo de respuesta.
El modelo de regresión lineal simple muestra una fuerte relación entre la carga del sistema y el tiempo de respuesta, con una alta capacidad explicativa (R² = 0.8579). El coeficiente de Carga es significativo, indicando que a medida que aumenta la carga de trabajo, el tiempo de respuesta también aumenta.
##
## Call:
## lm(formula = Tiempo ~ Carga * as.factor(Conf), data = data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.65754 -0.12362 0.06308 0.16101 0.43457
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -1.32327 0.21947 -6.030 5.53e-06 ***
## Carga 0.70407 0.03438 20.477 2.34e-15 ***
## as.factor(Conf)1 2.21824 0.27991 7.925 9.58e-08 ***
## Carga:as.factor(Conf)1 -0.34500 0.04432 -7.784 1.27e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.3019 on 21 degrees of freedom
## Multiple R-squared: 0.9653, Adjusted R-squared: 0.9603
## F-statistic: 194.7 on 3 and 21 DF, p-value: 1.756e-15
El valor de R² indica que el 96.53% de la variabilidad en el tiempo de respuesta se puede explicar mediante la variabilidad en la carga del sistema y el tipo de disco. Esto sugiere que el modelo tiene un muy buen ajuste.
Este valor ajusta el R² según el número de predictores en el modelo. En este caso, sigue siendo muy alto, lo que refuerza que el modelo tiene un excelente ajuste.
Tiene un valor bajo lo que indica un mejor ajuste.
Un alto valor del estadístico F y un p-valor extremadamente bajo indican que el modelo es significativo en su conjunto.
Como se puede observar en los coeficientes, la pendiente y el intercepto no son los mismos para los dos tipos de discos:
Para HDD: Intercepto: -1.32327 Pendiente: 0.70407
Para SDD: Intercepto: -1.32327 + 2.21824 = 0.89497 Pendiente: 0.70407 - 0.34500 = 0.35907
Esto indica que el tiempo de respuesta inicial es mayor para SDD en comparación con HDD, pero la tasa de aumento del tiempo de respuesta con la carga de trabajo es menor para SDD en comparación con HDD.
Se realiza la prueba ANOVA para confirmar la mejora del ajuste del modelo con la inclusión de la variable cualitativa y su interacción.
## Analysis of Variance Table
##
## Model 1: Tiempo ~ Carga
## Model 2: Tiempo ~ Carga * as.factor(Conf)
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 7.8375
## 2 21 1.9137 2 5.9238 32.502 3.723e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
La prueba ANOVA muestra que la inclusión de la variable cualitativa Conf y su interacción con la carga en el Modelo 2 mejora significativamente el ajuste del modelo. Esto concluye que tanto el tipo de disco como la interacción entre la carga y el tipo de disco son factores importantes para predecir el tiempo de respuesta.
La suma residual de cuadrados se reduce de forma importante al pasar del Modelo 1 al Modelo 2, lo que indica que el Modelo 2 tiene un mejor ajuste a los datos.
Este modelo incluye solo la carga como predictor del tiempo de respuesta. Tiene una suma residual de cuadrados de 7.8375 y 23 grados de libertad residuales.
Este modelo incluye la carga, el tipo de disco, y su interacción como predictores del tiempo de respuesta. Tiene una suma residual de cuadrados de 1.9137 y 21 grados de libertad residuales. La mejora en el ajuste del modelo es significativa con un valor F de 32.502 y un p-valor de 3.723e-07.
Se procede a interpretar los gráficos diagnósticos para evaluar si los residuos cumplen con los supuestos de homocedasticidad, normalidad y no autocorrelación.
Los residuos parecen estar dispersos aleatoriamente alrededor de la línea horizontal, lo que sugiere que no hay una fuerte evidencia de heterocedasticidad. Sin embargo, hay una ligera tendencia en los residuos, lo que podría indicar una pequeña desviación de la homocedasticidad.
La mayoría de los puntos siguen aproximadamente la línea diagonal, lo que sugiere que los residuos se distribuyen de manera aproximadamente normal. Sin embargo, hay algunas desviaciones en los extremos.
La dispersión de los puntos parece razonablemente constante a lo largo de los valores ajustados, aunque hay una ligera tendencia ascendente. Esto podría indicar una pequeña desviación de la homocedasticidad.
Normalidad de los Residuos: Los residuos se distribuyen de manera aproximadamente normal, aunque con algunas desviaciones en los extremos. Heterocedasticidad: Hay una ligera tendencia que podría indicar heterocedasticidad, pero no es muy pronunciada.
La inclusión de la variable cualitativa (tipo de disco) y su interacción con la carga del sistema mejora significativamente el ajuste del modelo, proporcionando una mejor comprensión de la relación entre la carga del sistema y el tiempo de respuesta para los dos tipos de discos duros.
## Acc Exp Edad Pot Sexo
## Min. :0.0000 Min. : 1.000 Min. :20 Min. : 70.0 Min. :1.0
## 1st Qu.:0.0000 1st Qu.: 6.500 1st Qu.:25 1st Qu.: 90.0 1st Qu.:1.0
## Median :0.0000 Median : 9.000 Median :29 Median : 95.0 Median :1.0
## Mean :0.4286 Mean : 9.543 Mean :31 Mean :101.6 Mean :1.4
## 3rd Qu.:1.0000 3rd Qu.:12.000 3rd Qu.:36 3rd Qu.:110.0 3rd Qu.:2.0
## Max. :1.0000 Max. :20.000 Max. :56 Max. :150.0 Max. :2.0
Los conductores que no han tenido accidentes tienden a tener una mayor experiencia en años comparado con aquellos que han tenido accidentes. La mediana de los años de experiencia es mayor para los conductores sin accidentes. Hay más variabilidad en los años de experiencia entre los conductores que han tenido accidentes, lo que indica que tanto conductores novatos como experimentados pueden tener accidentes, pero es más común entre los menos experimentados.
La edad de los conductores que no han tenido accidentes tiende a ser mayor en comparación con aquellos que han tenido accidentes. La mediana de la edad es mayor para los conductores sin accidentes. Hay más variabilidad en la edad entre los conductores que han tenido accidentes, lo que sugiere que los accidentes no están restringidos a un grupo de edad específico, pero son más comunes entre los conductores más jóvenes.
Los vehículos que han tenido accidentes tienden a tener motores de mayor potencia en comparación con aquellos que no han tenido accidentes. La mediana de la potencia del motor es mayor para los vehículos involucrados en accidentes. Hay una mayor dispersión en la potencia del motor entre los vehículos que han tenido accidentes, lo que sugiere que los vehículos con motores más potentes pueden estar más involucrados en accidentes.
La mayoría de los conductores sin accidentes son del sexo femenino, mientras que los conductores con accidentes son predominantemente del sexo masculino.
Resumen del Análisis Exploratorio de Datos
Experiencia: Los conductores con más años de experiencia tienden a tener menos accidentes. Edad: Los conductores más jóvenes tienden a tener más accidentes. Potencia del Motor: Los vehículos con motores más potentes están más frecuentemente involucrados en accidentes. Sexo: Los hombres tienen una mayor proporción de accidentes en comparación con las mujeres.
Lo anterior indica que la experiencia, la edad, la potencia del motor y el sexo son factores importantes a considerar en la siniestralidad de los asegurados.
##
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = data_accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
##
## Call:
## glm(formula = Acc ~ Exp + as.factor(Sexo), family = binomial,
## data = data_accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890 1.2252 0.726 0.46808
## Exp -0.2400 0.1176 -2.040 0.04131 *
## as.factor(Sexo)2 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
Se procede a predecir las probabilidades de accidentes utilizando los dos modelos y a graficar los resultados.
Predicciones
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.941925 0.9816478 1.978230 0.04790277
## Exp -0.245607 0.1043575 -2.353517 0.01859678
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 0.8890341 1.2252410 0.7255994 0.468084395
## Exp -0.2399985 0.1176225 -2.0404126 0.041309249
## as.factor(Sexo)2 2.9865699 1.0682727 2.7956998 0.005178748
\[ \log\left(\frac{p}{1-p}\right) = 1.941925 - 0.245607 \cdot \text{Exp} \]
\[ \log\left(\frac{p}{1-p}\right) = 0.8890341 - 0.2399985 \cdot \text{Exp} + 2.9865699 \cdot \text{Sexo}_2 \]
## Modelo 1 - Deviance: 40.00583 AIC: 44.00583
## Modelo 2 - Deviance: 29.24875 AIC: 35.24875
## Modelo 1 - AUC: 0.7983333
## Modelo 2 - AUC: 0.8683333
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + as.factor(Sexo)
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 33 40.006
## 2 32 29.249 1 10.757 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
El Modelo 2 tiene una deviance menor que el Modelo 1, lo que indica un mejor ajuste del Modelo 2.
El AIC del Modelo 2 es menor que el del Modelo 1, lo que sugiere que el Modelo 2 es mejor considerando el equilibrio entre ajuste y complejidad del modelo.
El Modelo 2 tiene un AUC mayor (0.8683333) en comparación con el Modelo 1 (0.7983333), lo que indica que el Modelo 2 tiene una mejor capacidad discriminativa para predecir accidentes.
El p-valor (0.001039) es muy bajo, lo que indica que el Modelo 2, que incluye la variable adicional Sexo, mejora significativamente el ajuste en comparación con el Modelo 1.
Este coeficiente representa el logit (log-odds) de la probabilidad de tener un accidente cuando Exp (experiencia) es 0 y el sexo es el de referencia (Sexo = 1). Interpretación: No es significativo (p-valor = 0.468), lo que sugiere que cuando la experiencia es 0, el intercepto no tiene un impacto significativo en la probabilidad de tener un accidente.
Este coeficiente indica el cambio en el logit de la probabilidad de tener un accidente por cada año adicional de experiencia. Interpretación: Cada año adicional de experiencia reduce el logit de la probabilidad de tener un accidente en aproximadamente 0.24. Es significativo con un p-valor = 0.041, lo que indica que la experiencia tiene un efecto protector contra los accidentes.
Este coeficiente representa el cambio en el logit de la probabilidad de tener un accidente cuando el sexo cambia del valor de referencia (Sexo = 1) al segundo nivel (Sexo = 2). Interpretación: Cuando el sexo es masculino, el logit de la probabilidad de tener un accidente aumenta en aproximadamente 2.99. Es altamente significativo con un p-valor = 0.005, lo que indica que el sexo es un factor importante en la probabilidad de tener un accidente.
Para validar la significancia de los coeficientes, se utilizan los p-valores asociados a cada coeficiente. Los resultados indican:
Intercepto: No es significativo (p-valor = 0.468) Exp: Es significativo (p-valor = 0.041) Sexo: Es altamente significativo (p-valor = 0.005)
El Modelo 2 (Acc ~ Exp + Sexo) es el mejor modelo. La experiencia (Exp) y el sexo (Sexo) son factores significativos en la probabilidad de tener un accidente. Cada año adicional de experiencia reduce la probabilidad de tener un accidente, y el sexo masculino aumenta significativamente la probabilidad de tener un accidente.
Identificar el Mejor Punto de Corte
## threshold
## 1 0.8449838
##
## Call:
## glm(formula = Acc ~ Exp + as.factor(Sexo) + Edad + Pot, family = binomial,
## data = data_accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -19.97398 9.23723 -2.162 0.0306 *
## Exp -0.47952 0.33645 -1.425 0.1541
## as.factor(Sexo)2 3.04940 2.36426 1.290 0.1971
## Edad -0.02585 0.08801 -0.294 0.7689
## Pot 0.24687 0.10715 2.304 0.0212 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp + as.factor(Sexo)
## Model 2: Acc ~ Exp + as.factor(Sexo) + Edad + Pot
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 32 29.249
## 2 30 12.700 2 16.549 0.0002549 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
El coeficiente de -0.47952 no es significativo (p-valor > 0.05), sugiriendo que la experiencia no tiene un impacto significativo en la probabilidad de accidente en este modelo.
El coeficiente de 3.04940 no es significativo (p-valor > 0.05), indicando que el sexo tampoco es un factor significativo en este modelo.
El coeficiente de -0.02585 no es significativo (p-valor > 0.05), sugiriendo que la edad no tiene un impacto significativo en la probabilidad de accidente.
El coeficiente de 0.24687 es significativo (p-valor < 0.05), indicando que la potencia del motor tiene un impacto significativo en la probabilidad de accidente.
El test de razón de verosimilitud muestra un p-valor de 0.0002549, que es muy bajo, lo que indica que la adición de las variables Edad y Pot mejora significativamente el ajuste del modelo.