Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).
Este valor indica una correlación muy fuerte y positiva entre el tiempo de respuesta y la carga de trabajo para los discos HDD.
Este valor indica una correlación extremadamente fuerte y positiva entre el tiempo de respuesta y la carga de trabajo para los discos SDD.
Ambos tipos de discos duros (HDD y SDD) muestran una relación lineal positiva muy fuerte entre el tiempo de respuesta y la carga de trabajo. Sin embargo, el disco duro sólido (SDD) muestra una correlación ligeramente más fuerte (r=0.99r = 0.99r=0.99) en comparación con el disco duro tradicional (HDD) (r=0.96r = 0.96r=0.96).
##
## Call:
## lm(formula = Carga ~ Tiempo, data = datos_RL)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.8047 -0.9571 0.3035 0.7238 2.6833
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.7183 0.4726 1.52 0.142
## Tiempo 1.7432 0.1479 11.78 3.18e-11 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 1.099 on 23 degrees of freedom
## Multiple R-squared: 0.8579, Adjusted R-squared: 0.8517
## F-statistic: 138.8 on 1 and 23 DF, p-value: 3.177e-11
Basado en el análisis anterior, se puede concluir que el modelo de regresión simple demuestra una relación significativa entre el tiempo de respuesta (Tiempo) y la carga de trabajo (Carga). El coeficiente de Tiempo es 1.7432, lo que sugiere que, en promedio, la carga de trabajo incrementa en 1.7432 unidades por cada segundo adicional en el tiempo de respuesta. Este modelo logra explicar aproximadamente el 85.79% de la variabilidad en la carga de trabajo (R² = 0.8579), lo que refleja un buen ajuste a los datos. Además, el modelo es estadísticamente significativo (p-value < 0.001).
El análisis de los residuos muestra una distribución equilibrada alrededor de cero, indicando que el modelo no presenta un sesgo significativo. El error estándar residual de 1.099 representa la dispersión de los puntos de datos alrededor de la línea de regresión.
##
## Call:
## lm(formula = Carga ~ Tiempo + Conf, data = datos_RL)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.58844 -0.76620 0.09794 0.68252 2.88252
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.9192 0.5148 1.786 0.088 .
## Tiempo 1.7521 0.1483 11.815 5.36e-11 ***
## ConfHDD -0.4350 0.4409 -0.987 0.335
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 1.099 on 22 degrees of freedom
## Multiple R-squared: 0.8639, Adjusted R-squared: 0.8515
## F-statistic: 69.83 on 2 and 22 DF, p-value: 2.965e-10
El modelo de regresión lineal múltiple muestra que el tiempo de respuesta (Tiempo) está significativamente relacionado con la carga de trabajo (Carga), con un coeficiente de 1.7521 que es altamente significativo (p < 0.001). Esto sugiere que, en promedio, la carga de trabajo aumenta en 1.7521 unidades por cada segundo adicional de tiempo de respuesta.
Aunque el coeficiente de la configuración del disco (Conf) no es significativo (p = 0.335), el modelo explica una alta proporción de la variabilidad en la carga (R² = 0.8639), lo que indica un buen ajuste. La pendiente y el intercp no son significativamente diferentes para los dos tipos de discos, lo que sugiere que la configuración del disco no tiene un impacto significativo en la carga de trabajo cuando se controla por el tiempo.
En resumen, el tiempo de respuesta sigue siendo un predictor fuerte y significativo de la carga de trabajo, mientras que la configuración del disco (SDD o HDD) no muestra un efecto significativo en este modelo.
## Analysis of Variance Table
##
## Model 1: Carga ~ Tiempo
## Model 2: Carga ~ Tiempo + Conf
## Res.Df RSS Df Sum of Sq F Pr(>F)
## 1 23 27.761
## 2 22 26.584 1 1.1764 0.9735 0.3345
El valor de F (0.9735) y su correspondiente valor p (0.3345) indican que la inclusión de la variable Conf (que representa el tipo de disco, SDD o HDD) no proporciona una mejora significativa en el ajuste del modelo comparado con el Modelo 1. Es decir, la configuración del disco no tiene un efecto significativo en la predicción de la carga de trabajo cuando se controla por el tiempo de respuesta.
Dado que el p-valor (0.3345) es mucho mayor que el umbral común de significancia (0.05), no rechazamos la hipótesis nula de que el coeficiente de Conf es igual a cero. Por lo tanto, no hay evidencia suficiente para afirmar que el tipo de disco influye significativamente en la carga de trabajo más allá del impacto del tiempo de respuesta.
Residuos vs. Valores Ajustados: La gráfica muestra una dispersión aleatoria de los residuos alrededor de la línea horizontal, lo que sugiere que la relación lineal entre la carga de trabajo y el tiempo es adecuada. Sin embargo, hay algunos puntos que parecen desviarse, lo que podría indicar la presencia de valores atípicos.
Q-Q Plot de los Residuos: La mayoría de los puntos siguen la línea de referencia, lo que indica que los residuos se distribuyen aproximadamente de manera normal. Algunas desviaciones en los extremos sugieren la presencia de valores atípicos.
Scale-Location (Escala-Ubicación): La gráfica muestra una dispersión aproximadamente constante a lo largo de los valores ajustados, lo que sugiere homocedasticidad (varianza constante de los residuos). Sin embargo, hay algunas ligeras desviaciones que podrían indicar heterocedasticidad.
Residuos vs. Apalancamiento: Esta gráfica identifica puntos con alta influencia en el modelo. Los puntos etiquetados (por ejemplo, 13 y 25) tienen una alta influencia según la distancia de Cook, sugiriendo que estos puntos pueden estar afectando significativamente el modelo.
##
## One Sample t-test
##
## data: residuos
## t = 0.043783, df = 24, p-value = 0.9654
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.4448100 0.4640912
## sample estimates:
## mean of x
## 0.009640626
##
## studentized Breusch-Pagan test
##
## data: Model_RL2
## BP = 3.8691, df = 2, p-value = 0.1445
##
## Durbin-Watson test
##
## data: Model_RL2
## DW = 2.2174, p-value = 0.665
## alternative hypothesis: true autocorrelation is greater than 0
##
## Shapiro-Wilk normality test
##
## data: residuos
## W = 0.93039, p-value = 0.08874
Prueba t para una Muestra (One Sample t-test): Esta prueba verifica si la media de los residuos es igual a cero. El p-valor alto (0.9654) indica que no hay evidencia suficiente para rechazar la hipótesis nula de que la media de los residuos es cero, lo que sugiere que los residuos no tienen un sesgo significativo.
Prueba de Breusch-Pagan (Studentized Breusch-Pagan test): Esta prueba verifica la heterocedasticidad. El p-valor (0.1445) sugiere que no hay evidencia significativa de heterocedasticidad, apoyando la suposición de varianza constante de los residuos.
Prueba de Durbin-Watson: Esta prueba verifica la autocorrelación de los residuos. El p-valor alto (0.665) indica que no hay evidencia significativa de autocorrelación en los residuos, sugiriendo independencia de los errores.
Prueba de Normalidad de Shapiro-Wilk: Esta prueba verifica la normalidad de los residuos. El p-valor (0.08874) indica que no hay evidencia suficiente para rechazar la hipótesis nula de que los residuos se distribuyen normalmente.
El análisis muestra que existe una relación lineal significativa entre el tiempo de respuesta y la carga de trabajo tanto para los discos SSD como para los HDD. El modelo de regresión lineal simple es adecuado para explicar la variabilidad en el tiempo de respuesta en función de la carga de trabajo, con un ajuste muy bueno. La adición de la variable que distingue entre tipos de discos no mejora significativamente el modelo, lo que sugiere que la carga de trabajo es el principal factor que afecta el tiempo de respuesta. Los supuestos del modelo de regresión se cumplen en gran medida, lo que respalda la validez de los resultados obtenidos.
Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:
Acc : haber tenido algún accidente en el último año (0:no; 1:sí).
Exp : años de experiencia.
Edad : edad del conductor.
Pot : potencia del motor.
Sexo : 1 (mujer), 2 (hombre).
El análisis de la asociación entre la siniestralidad y las variables predictoras (edad, experiencia, potencia del motor) reveló que la mayoría de los datos se concentran en el nivel de siniestralidad cero, lo que dificulta la identificación de patrones claros. Los gráficos de dispersión y los boxplots no mostraron tendencias significativas, ya que tanto hombres como mujeres están presentes en todos los rangos de edad, experiencia y potencia del motor, sin una relación evidente con el número de accidentes. Sin embargo, los boxplots sugieren algunas diferencias notables: las mujeres tienden a tener una edad y experiencia menores y menor potencia del motor en comparación con los hombres, especialmente en los niveles de siniestralidad mayores. La falta de variabilidad en los datos limita la capacidad de observar asociaciones significativas. Se recomienda realizar un análisis más detallado con modelos estadísticos y considerar la recolección de más datos para mejorar la comprensión de los factores asociados con la siniestralidad.
Se utiliza la función glm, del software R, para ajustar los siguientes modelos de regresión logística:
Modelo 1: Acc ~ Exp
Modelo 2: Acc ~ Exp + genero
##
## Call:
## glm(formula = Acc ~ Exp, family = binomial, data = accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) 1.9419 0.9816 1.978 0.0479 *
## Exp -0.2456 0.1044 -2.354 0.0186 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 40.006 on 33 degrees of freedom
## AIC: 44.006
##
## Number of Fisher Scoring iterations: 4
##
## Call:
## glm(formula = Acc ~ Exp + Sexo, family = binomial, data = accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -2.0975 1.5546 -1.349 0.17725
## Exp -0.2400 0.1176 -2.040 0.04131 *
## Sexo 2.9866 1.0683 2.796 0.00518 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 29.249 on 32 degrees of freedom
## AIC: 35.249
##
## Number of Fisher Scoring iterations: 5
De acuerdo con los resumenes de cada modelo, se identifica la ecuación de pronostico.
Modelo 1: Acc ~ Exp
Siniestralidad = 1.9419 - 0.2456 * Exp
Modelo 2: Acc ~ Exp + genero
Siniestralidad = −2.0975 − 0.2400 * Exp + 2.9866 * Sexo
## Analysis of Deviance Table
##
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 34 47.804
## 2 33 40.006 1 7.7977 0.005231 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
##
## Model 1: Acc ~ 1
## Model 2: Acc ~ Exp + Sexo
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 34 47.804
## 2 32 29.249 2 18.555 9.351e-05 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp
## Model 2: Acc ~ Exp + Sexo
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 33 40.006
## 2 32 29.249 1 10.757 0.001039 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
En el análisis de los modelos de regresión logística para predecir la probabilidad de accidentes basados en la experiencia (Exp) y el sexo (Sexo), se observó que los modelos que incorporan ambas variables predictoras mostraron una mejora significativa en el ajuste respecto a los modelos más simples que solo consideraron la experiencia. Esto se evidenció a través de una reducción considerable en la deviance residual y valores de AIC más bajos en los modelos más complejos. Las pruebas de razón de verosimilitud confirmaron que la inclusión del sexo como predictor es estadísticamente significativa para explicar la variabilidad en la probabilidad de accidentes.
En términos de deviance residual y AIC, el Modelo 2 es el que sugiere un mejor ajuste a los datos.
Cuando la experiencia (Exp) y el sexo (Sexo) son cero, la probabilidad logística de accidentes es exp(-2.098) / (1 + exp(-2.098)), que es la probabilidad base para el grupo de referencia. En este caso, todos los coeficientes tienen un p-valor bajo (generalmente < 0.05), lo que indica que son estadísticamente significativos.
El umbral óptimo de clasificación, establecido en 0.84, señala que el modelo predice que la probabilidad de accidente (Accidente = 1) es al menos del 84%. Esto sugiere que cuando el modelo asigna una probabilidad igual o superior a este umbral, existe una alta confianza en la predicción de que un accidente ocurrirá. Por otro lado, el valor del AUC de 0.87 refleja una excelente capacidad del modelo para distinguir qué clientes tienen una mayor propensión a verse involucrados en accidentes, lo que lo convierte en una herramienta efectiva para evaluar el riesgo en este contexto específico.
##
## Call:
## glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial,
## data = accidentes)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -23.02338 9.90262 -2.325 0.0201 *
## Exp -0.47952 0.33645 -1.425 0.1541
## Sexo 3.04940 2.36426 1.290 0.1971
## Edad -0.02585 0.08801 -0.294 0.7689
## Pot 0.24687 0.10715 2.304 0.0212 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 47.804 on 34 degrees of freedom
## Residual deviance: 12.700 on 30 degrees of freedom
## AIC: 22.7
##
## Number of Fisher Scoring iterations: 8
## Analysis of Deviance Table
##
## Model 1: Acc ~ Exp + Sexo
## Model 2: Acc ~ Exp + Sexo + Edad + Pot
## Resid. Df Resid. Dev Df Deviance Pr(>Chi)
## 1 32 29.249
## 2 30 12.700 2 16.549 0.0002549 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
El modelo ampliado tiene una deviance residual de 12.700, mientras que el modelo anterior (Acc ~ Exp + Sexo) tenía una deviance residual de 29.249.
La diferencia en la deviance residual entre los dos modelos es significativa (16.549 con p-valor de 0.0002549), lo que indica que el modelo que incorpora Edad y Potencia del motor mejora significativamente la capacidad de ajuste respecto al modelo más simple que solo incluía Experiencia y Sexo.
El AIC del modelo ampliado (22.7) es menor que el AIC del modelo anterior (35.25), lo cual también sugiere una mejora en la calidad del ajuste del modelo al agregar las variables Edad y Potencia del motor.
Se concluye entonces que el modelo que incluye Experiencia, Sexo, Edad y Potencia del motor (Acc ~ Exp + Sexo + Edad + Pot) muestra una mejora significativa en el ajuste en comparación con el modelo que solo incluye Experiencia y Sexo.
-La experiencia y el sexo de los conductores son factores significativos que influyen en la siniestralidad. Los conductores con menos experiencia y ciertos grupos de sexo pueden tener un mayor riesgo de accidentes.
-La edad del conductor y la potencia del motor del vehículo también desempeñan roles importantes. Conductores más jóvenes y vehículos de mayor potencia tienden a estar asociados con una mayor probabilidad de accidentes.
Se recomienda implementar programas de formación y capacitación específicos para conductores menos experimentados. De igual manera es importante evaluar políticas de seguro diferenciadas según la edad y tipo de vehículo e incorporar asistencias para mitigar los riesgos asociados con la potencia del motor.