Con la intención de comparar el desempeño de dos clases de discos duros (0 : SDD, 1: HDD). Este desempeño es medido a través de la variable Y: tiempo de respuesta del disco (segundos), la cual se relaciona, posiblemente bajo una dependencia no lineal, de X: la carga del sistema (Número de consultas por minuto).

I. Represente gráficamente la relación observada entre el tiempo de respuesta y la carga de trabajo, para los dos tipos de disco duro. ¿Se evidencia una relación lineal? Mida la fuerza de esta relación para ambos tipos de disco a través de los coeficientes de correlación

Se puede observar que la carga de trabajo y el tiempo de respuesta tienen una relación lineal muy fuerte y positiva en ambos tipos de discos duros.

A continuación se realiza la Prueba de correlación de Pearson para los dos tipos de disco duro con el fin de medir la fuerza de la relación entre ambas variables:

Prueba de correlación de Pearson para los discos SDD y HDD

> cor_SDD [1] 0.9938293 
> cor_HDD [1] 0.9640003

Ambas pruebas obtienen valores cercanos a 1 por lo que se puede concluir que ambos discos tienen una relación fuerte y positiva entre las variables carga de trabajo y tiempo de respuesta. Sin embargo, el disco SDD presenta una relación ligeramente mas fuerte que el disco HDD.

II. Ajuste un primer modelo de regresión simple (Modelo 1) que reproduzca la relación entre la carga y el tiempo de respuesta, sin incluir la configuración del disco duro. Evalúe la bondad de ajuste de este modelo e interprete los resultados obtenidos.

Modelo 1

Call:
lm(formula = Tiempo ~ Carga, data = datos)

Residuals:
     Min       1Q   Median       3Q      Max 
-1.16824 -0.40281 -0.03945  0.43541  1.07627 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)
(Intercept)  0.04838    0.26321   0.184    0.856
Carga        0.49214    0.04177  11.783 3.18e-11
               
(Intercept)    
Carga       ***
---
Signif. codes:  
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 0.5837 on 23 degrees of freedom
Multiple R-squared:  0.8579,    Adjusted R-squared:  0.8517 
F-statistic: 138.8 on 1 and 23 DF,  p-value: 3.177e-11

En el modelo 1 se puede observar que por cada aumento de una unidad en la carga de trabajo se espera un aumento en el tiempo de 0.49 segundos.

III. Obtenga un nuevo modelo (Modelo 2) en el que incluya el tipo de disco (Variable Dummy) y su interacción con la carga del equipo. Evalué la bondad de ajuste del nuevo modelo, e interprete los coeficientes del Modelo 2.

Modelo 2

Call:
lm(formula = Tiempo ~ Carga * Conf, data = datos)

Residuals:
     Min       1Q   Median       3Q      Max 
-0.68547 -0.11333  0.06881  0.15302  0.41807 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)
(Intercept) -1.37549    0.20902  -6.581 1.62e-06
Carga        0.71979    0.03367  21.376 9.88e-16
Conf1        2.26391    0.26520   8.536 2.86e-08
Carga:Conf1 -0.35734    0.04227  -8.454 3.36e-08
               
(Intercept) ***
Carga       ***
Conf1       ***
Carga:Conf1 ***
---
Signif. codes:  
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 0.2844 on 21 degrees of freedom
Multiple R-squared:  0.9692,    Adjusted R-squared:  0.9648 
F-statistic: 220.2 on 3 and 21 DF,  p-value: 5.042e-16

El Modelo 2 indica que cuando la variable carga de trabajo aumentan en una unidad y la configuración del disco se mantiene constante, el tiempo de respuesta aumenta en 0.72 s, mientras que cuando la configuración del disco es 1, el tiempo de respuesta aumenta en 2.26 s.

Este modelo tiene un R- cuadrado ajustado de 0.96, por lo que en comparación con el modelo 1, tiene una mejor bondad de ajuste.

IV. Mediante el test ANOVA correspondiente, pruebe que la inclusión de la variable cualitativa configuración del disco y su interacción con la carga mejora significativamente el ajuste del modelo.

Analysis of Variance Table

Model 1: Tiempo ~ Carga
Model 2: Tiempo ~ Carga * Conf
  Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
1     23 7.8375                                  
2     21 1.6990  2    6.1386 37.938 1.067e-07 ***
---
Signif. codes:  
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Con el Test ANOVA se puede comprobar que al incluir la variable de configuración del disco se mejora el ajuste del modelo teniendo un valor p cercano a 0 y por lo que se rechaza la hipótesis nula .

V. Represente gráficamente el ajuste del Modelo 2 y evalúe el cumplimiento de los supuestos sobre el termino error.

Validación de los supuestos sobre el termino de error

One Sample t-test

data:  residuos
t = -0.14652, df = 24, p-value = 0.8847
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
-0.4994321  0.4332192
sample estimates:
mean of x 
-0.03310641
studentized Breusch-Pagan test

data:  Model 2
BP = 2.6825, df = 3, p-value = 0.4432
Durbin-Watson test

data:  Model 2
DW = 1.3285, p-value = 0.03421
alternative hypothesis: true autocorrelation is greater than 0
Shapiro-Wilk normality test

data:  residuos
W = 0.92407, p-value = 0.06348

Teniendo en cuenta las gráficas y los diferentes test se puede decir que hay presencia de correlación entre las variables, que se rechaza la hipotesis nula y los residuales son independientes y se distribuyen de manera normal.

VI. Concluya de forma general.

Se puede concluir que existe una relación lineal fuerte y positiva entre el tiempo de respuesta y la carga de trabajo para ambos discos, además que el modelo 2 al tener un R-cuadrado mejor y al tener en cuenta la configuración del disco duro se desempeña mejor.

Punto 2

Una compañía de seguros de automóvil desea caracterizar la siniestralidad de sus asegurados durante el último año. Para ello dispone información de una muestra aleatoria de 35 asegurados con la siguiente información:

Acc : haber tenido algún accidente en el último año (0:No; 1:Sí).

Exp : años de experiencia.

Edad : edad del conductor.

Pot : potencia del motor.

Sexo : 1 (mujer), 2 (hombre).

I. Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).

Con los graficos podemos concluir que se presenta mayor siniestralidad cuando los conductores tienen pocos años de experiencia, son hombres y su edad es menor a 30 años, además cuando la potencia del motor de alta.

II. Con herramientas del análisis exploratorio, estudie la asociación entre la siniestralidad y el conjunto de variables predictoras (Edad, Experiencia, Potencia del motor y Sexo).

Modelo 1: Acc ~ Exp

Modelo 2: Acc ~ Exp + Género

Represente gráficamente el ajuste de los 2 modelos (observados vs predichos).

Modelo 1: Acc ~ Exp

Call:
glm(formula = Acc ~ Exp, family = "binomial", data = accidentes1)

Coefficients:
            Estimate Std. Error z value Pr(>|z|)  
(Intercept)   1.9419     0.9816   1.978   0.0479 *
Exp          -0.2456     0.1044  -2.354   0.0186 *
---
Signif. codes:  
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

(Dispersion parameter for binomial family taken to be 1)

Modelo 2: Acc ~ Exp + Género

Call:
glm(formula = Acc ~ Exp + Sexo, family = "binomial", data = accidentes1)

Coefficients:
            Estimate Std. Error z value Pr(>|z|)
(Intercept)   0.8890     1.2252   0.726  0.46808
Exp          -0.2400     0.1176  -2.040  0.04131
Sexohombre    2.9866     1.0683   2.796  0.00518
              
(Intercept)   
Exp         * 
Sexohombre  **
---
Signif. codes:  
0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

(Dispersion parameter for binomial family taken to be 1)

    Null deviance: 47.804  on 34  degrees of freedom
Residual deviance: 29.249  on 32  degrees of freedom
AIC: 35.249

Number of Fisher Scoring iterations: 5

III. Escriba las ecuaciones de pronóstico asociadas a los 2 modelos.

Modelo 1

Call:
glm(formula = Acc ~ Exp + Sexo + Edad + Pot, family = binomial, data = accidentes1)
 
Coefficients:
              Estimate Std. Error z value Pr(>|z|)  
(Intercept) -23.02338    9.90262  -2.325   0.0201 *
Exp          -0.47952    0.33645  -1.425   0.1541  
Sexo          3.04940    2.36426   1.290   0.1971  
Edad         -0.02585    0.08801  -0.294   0.7689  
Pot           0.24687    0.10715   2.304   0.0212 *
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
 
(Dispersion parameter for binomial family taken to be 1)
 
Null deviance: 47.804  on 34  degrees of freedom
Residual deviance: 12.700  on 30  degrees of freedom
AIC: 22.7

Number of Fisher Scoring iterations: 8

Modelo 2

Call:
glm(formula = Acc ~ Exp + Sexo, family = "binomial")
 
Coefficients:
             Estimate Std. Error z value Pr(>|z|)   
(Intercept)   0.8890     1.2252   0.726  0.46808   
Exp          -0.2400     0.1176  -2.040  0.04131 * 
Sexohombre    2.9866     1.0683   2.796  0.00518 **
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
 
(Dispersion parameter for binomial family taken to be 1)
 
Null deviance: 47.804  on 34  degrees of freedom
Residual deviance: 29.249  on 32  degrees of freedom
AIC: 35.249
 
Number of Fisher Scoring iterations: 5

IV. A través de indicadores de bondad de ajuste (incluyendo Deviance, AIC, la curva ROC, el AUC y los test de razón de verosimilitud correspondientes), evalúe y compare el ajuste de los 2 modelos anteriores.

Deviance del Modelo 1: 40.00583 
AIC del Modelo 1: 44.00583 
Deviance del Modelo 2: 29.24875
AIC del Modelo 2: 35.24875 
Analysis of Deviance Table

Model: binomial, link: logit

Response: Acc

Terms added sequentially (first to last)


     Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
NULL                    34     47.804            
Exp   1   7.7977        33     40.006 0.005231 **
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Analysis of Deviance Table

Model: binomial, link: logit

Response: Acc

Terms added sequentially (first to last)
 
 
      Df Deviance Resid. Df Resid. Dev Pr(>Chi)   
NULL                    34     47.804            
Exp   1   7.7977        33     40.006 0.005231 **
Sexo  1  10.7571        32     29.249 0.001039 **
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
AUC del Modelo 1: 0.7983333 
AUC del Modelo 2: 0.8683333 

Se puede observar que el modelo 2 tiene un mejor ajuste que el modelo 1 debido a que tiene mayor AUC y menor AIC y deviance.

V. Seleccione el mejor de los modelos anteriores, interprete los coeficientes estimados y valide su significancia.

                e-beta     2.5 %      97.5 %
(Intercept)  2.432779 0.2521631  38.4350894
Exp          0.786629 0.5894529   0.9606236
Sexohombre   19.817589 3.0932200 267.3097416

Teniendo en cuenta en analisis realizado en los puntos anteriores se seleccionó el modelo 2 como el mejor modelo, al revisar el e-beta se puede decir que a mayor experiencia disminuye la siniestralidad y que el sexo masculino tiene mayor probabilidad de ocurrencia de un siniestro.

VI. Para el modelo seleccionado en el punto V. evalúe los indicadores de bondad de clasificación (luego de identificar el mejor punto de corte).

Confusion Matrix and Statistics
 
          Reference
Prediction No Sí
        No 20  6
        Sí  0  9
                                           
                Accuracy : 0.8286          
                 95% CI : (0.6635, 0.9344)
     No Information Rate : 0.5714          
     P-Value [Acc > NIR] : 0.001202        
                                           
                   Kappa : 0.6316          
                                           
  Mcnemar's Test P-Value : 0.041227        
                                           
             Sensitivity : 0.6000          
             Specificity : 1.0000          
          Pos Pred Value : 1.0000          
          Neg Pred Value : 0.7692          
              Prevalence : 0.4286          
          Detection Rate : 0.2571          
    Detection Prevalence : 0.2571          
       Balanced Accuracy : 0.8000          
                                           
        'Positive' Class : Sí              
 

La capacidad del modelo de clasificar correctamente los casos es superior al 82% y analizando su sensibilidad se puede decir que el modelo puede clasificar en un 60% los verdaderos positivos.

VII. Determine si existe una mejora significativa en el modelo seleccionado, cuando se adicionan las variables edad y potencia del motor.

Call:
glm(formula = Acc ~ ., family = "binomial", data = accidentes1)
 
Coefficients:
              Estimate Std. Error z value Pr(>|z|)  
(Intercept) -19.97398    9.23723  -2.162   0.0306 *
Exp          -0.47952    0.33645  -1.425   0.1541  
Edad         -0.02585    0.08801  -0.294   0.7689  
Pot           0.24687    0.10715   2.304   0.0212 *
Sexohombre    3.04940    2.36426   1.290   0.1971  
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
 
(Dispersion parameter for binomial family taken to be 1)
 
     Null deviance: 47.804  on 34  degrees of freedom
Residual deviance: 12.700  on 30  degrees of freedom
AIC: 22.7
 
Number of Fisher Scoring iterations: 8
Analysis of Deviance Table
 
Model 1: Acc ~ Exp + Sexo
Model 2: Acc ~ Exp + Edad + Pot + Sexo
   Resid. Df Resid. Dev Df Deviance  Pr(>Chi)    
 1        32     29.249                          
 2        30     12.700  2   16.549 0.0002549 ***
 ---
 Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Call:
roc.default(response = accidentes1$Acc, predictor = Prob_SAT, auc = TRUE,     ci = TRUE)
 
Data: Prob_SAT in 20 controls (accidentes1$Acc No) < 15 cases (accidentes1$Acc Sí).
Area under the curve: 0.9667
95% CI: 0.9054-1 (DeLong)
Confusion Matrix and Statistics
 
           Reference
 Prediction No Sí
         No 19  1
         Sí  1 14
                                          
                Accuracy : 0.9429         
                  95% CI : (0.8084, 0.993)
     No Information Rate : 0.5714         
     P-Value [Acc > NIR] : 1.128e-06      
                                          
                   Kappa : 0.8833         
                                          
  Mcnemar's Test P-Value : 1              
                                          
             Sensitivity : 0.9333         
             Specificity : 0.9500         
          Pos Pred Value : 0.9333         
          Neg Pred Value : 0.9500         
              Prevalence : 0.4286         
          Detection Rate : 0.4000         
    Detection Prevalence : 0.4286         
       Balanced Accuracy : 0.9417         
                                          
        'Positive' Class : Sí  

El modelo tiene una capacidad de clasificar correctamente el 94% de los casos y de acuerdo con su sensibilidad puede el modelo es puede clasificar en un 93% los verdaderos positivos. Por tanto, se puede apreciar una mejora significativa al incluir las variables edad y potencia del motor.

VIII. Haciendo uso de sus habilidades de modelación, genera un breve reporte de sus hallazgos en el cual oriente a la compañía sobre los factores que afectan la siniestralidad.

De acuerdo con los resultados obtenidos se obtienen las siguientes conclusiones:

  1. Los hombres tienden a tener una mayor probabilidad de accidentarse con respecto a las mujeres.
  2. La edad del conductor y los años de experiencia disminuyen la probabilidad de ocurrencia de siniestros cuando estas variables aumentan
  3. Se debe tener en cuenta que mientras mayor sea potencia del motor aumenta la siniestralidad, probablemente porque se pueden alcanzar mayores velocidades.