Importar la base de datos

# file.choose()
df <- read.csv("/Users/gabotejeda/Desktop/HousePriceData.csv")

Entender la base de datos

summary(df)
##   Observation      Dist_Taxi      Dist_Market    Dist_Hospital  
##  Min.   :  1.0   Min.   :  146   Min.   : 1666   Min.   : 3227  
##  1st Qu.:237.0   1st Qu.: 6477   1st Qu.: 9367   1st Qu.:11302  
##  Median :469.0   Median : 8228   Median :11149   Median :13189  
##  Mean   :468.4   Mean   : 8235   Mean   :11022   Mean   :13091  
##  3rd Qu.:700.0   3rd Qu.: 9939   3rd Qu.:12675   3rd Qu.:14855  
##  Max.   :932.0   Max.   :20662   Max.   :20945   Max.   :23294  
##                                                                 
##      Carpet         Builtup           Parking      City_Category
##  Min.   :  775   Min.   :  932   Length   :905   Length   :905  
##  1st Qu.: 1317   1st Qu.: 1579   N.unique :  4   N.unique :  3  
##  Median : 1478   Median : 1774   N.blank  :  0   N.blank  :  0  
##  Mean   : 1511   Mean   : 1794   Min.nchar:  4   Min.nchar:  5  
##  3rd Qu.: 1654   3rd Qu.: 1985   Max.nchar: 12   Max.nchar:  5  
##  Max.   :24300   Max.   :12730                                  
##  NAs    :7                                                      
##     Rainfall       House_Price       
##  Min.   :-110.0   Min.   :  1492000  
##  1st Qu.: 600.0   1st Qu.:  4623000  
##  Median : 780.0   Median :  5860000  
##  Mean   : 786.9   Mean   :  6083992  
##  3rd Qu.: 970.0   3rd Qu.:  7200000  
##  Max.   :1560.0   Max.   :150000000  
## 
str(df)
## 'data.frame':    905 obs. of  10 variables:
##  $ Observation  : int  1 2 3 4 5 6 7 8 9 10 ...
##  $ Dist_Taxi    : int  9796 8294 11001 8301 10510 6665 13153 5882 7495 8233 ...
##  $ Dist_Market  : int  5250 8186 14399 11188 12629 5142 11869 9948 11589 7067 ...
##  $ Dist_Hospital: int  10703 12694 16991 12289 13921 9972 17811 13315 13370 11400 ...
##  $ Carpet       : int  1659 1461 1340 1451 1770 1442 1542 1261 1090 1030 ...
##  $ Builtup      : int  1961 1752 1609 1748 2111 1733 1858 1507 1321 1235 ...
##  $ Parking      : chr  "Open" "Not Provided" "Not Provided" "Covered" ...
##  $ City_Category: chr  "CAT B" "CAT B" "CAT A" "CAT B" ...
##  $ Rainfall     : int  530 210 720 620 450 760 1030 1020 680 1130 ...
##  $ House_Price  : int  6649000 3982000 5401000 5373000 4662000 4526000 7224000 3772000 4631000 4415000 ...
head(df)
##   Observation Dist_Taxi Dist_Market Dist_Hospital Carpet Builtup      Parking
## 1           1      9796        5250         10703   1659    1961         Open
## 2           2      8294        8186         12694   1461    1752 Not Provided
## 3           3     11001       14399         16991   1340    1609 Not Provided
## 4           4      8301       11188         12289   1451    1748      Covered
## 5           5     10510       12629         13921   1770    2111 Not Provided
## 6           6      6665        5142          9972   1442    1733         Open
##   City_Category Rainfall House_Price
## 1         CAT B      530     6649000
## 2         CAT B      210     3982000
## 3         CAT A      720     5401000
## 4         CAT B      620     5373000
## 5         CAT B      450     4662000
## 6         CAT B      760     4526000

Crear un mapa de correlación

library(corrplot)
## corrplot 0.95 loaded
df_cor <- df[sapply(df, is.numeric)]
df_cor$Observation <- NULL

correlacion <- cor(df_cor, use = "complete.obs")
corrplot(correlacion)

Preparar las variables como factores y quitar NAs

df$Parking <- as.factor(df$Parking)
df$City_Category <- as.factor(df$City_Category)

df <- na.omit(df)

Crear Modelo

regresion <- lm(House_Price ~ . - Observation, data = df)
summary(regresion)
## 
## Call:
## lm(formula = House_Price ~ . - Observation, data = df)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -3586934  -837542   -65314   784513  4577689 
## 
## Coefficients:
##                       Estimate Std. Error t value Pr(>|t|)    
## (Intercept)          5.568e+06  3.688e+05  15.097  < 2e-16 ***
## Dist_Taxi            2.834e+01  2.694e+01   1.052   0.2931    
## Dist_Market          1.237e+01  2.089e+01   0.592   0.5538    
## Dist_Hospital        5.071e+01  3.021e+01   1.679   0.0936 .  
## Carpet               9.907e+03  1.428e+02  69.398  < 2e-16 ***
## Builtup             -7.575e+03  2.412e+02 -31.403  < 2e-16 ***
## ParkingNo Parking   -6.170e+05  1.393e+05  -4.429 1.06e-05 ***
## ParkingNot Provided -5.077e+05  1.239e+05  -4.096 4.58e-05 ***
## ParkingOpen         -2.597e+05  1.131e+05  -2.297   0.0218 *  
## City_CategoryCAT B  -1.883e+06  9.641e+04 -19.529  < 2e-16 ***
## City_CategoryCAT C  -2.902e+06  1.062e+05 -27.321  < 2e-16 ***
## Rainfall            -9.984e+01  1.548e+02  -0.645   0.5191    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 1228000 on 886 degrees of freedom
## Multiple R-squared:  0.9429, Adjusted R-squared:  0.9422 
## F-statistic:  1329 on 11 and 886 DF,  p-value: < 2.2e-16

Modificar modelo de regresión

regresion2 <- lm(House_Price ~ Carpet + Builtup + Parking + City_Category,
                 data = df)

summary(regresion2)
## 
## Call:
## lm(formula = House_Price ~ Carpet + Builtup + Parking + City_Category, 
##     data = df)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -3430967  -802513   -46915   775070  4263090 
## 
## Coefficients:
##                       Estimate Std. Error t value Pr(>|t|)    
## (Intercept)          6477702.2   272077.2  23.808  < 2e-16 ***
## Carpet                  9968.8      143.3  69.584  < 2e-16 ***
## Builtup                -7611.6      243.3 -31.279  < 2e-16 ***
## ParkingNo Parking    -536301.8   139943.6  -3.832 0.000136 ***
## ParkingNot Provided  -457380.4   125020.1  -3.658 0.000269 ***
## ParkingOpen          -236576.3   114356.8  -2.069 0.038857 *  
## City_CategoryCAT B  -1918518.1    97007.4 -19.777  < 2e-16 ***
## City_CategoryCAT C  -2908756.6   107359.6 -27.094  < 2e-16 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 1243000 on 890 degrees of freedom
## Multiple R-squared:  0.9412, Adjusted R-squared:  0.9407 
## F-statistic:  2034 on 7 and 890 DF,  p-value: < 2.2e-16

```

LS0tCnRpdGxlOiAiUmVncmVzc2lvbiAtIEhvdXNlIFByaWNlIERhdGEiCmF1dGhvcjogIkdhYnJpZWwgVGVqZWRhIEEwMTE3ODQ1OSIKZGF0ZTogIjIwMjYtMDgtMjEiCm91dHB1dDogCiAgaHRtbF9kb2N1bWVudDoKICAgIHRvYzogVFJVRQogICAgdG9jX2Zsb2F0OiBUUlVFCiAgICBjb2RlX2Rvd25sb2FkOiBUUlVFCiAgICB0aGVtZTogY29zbW8KLS0tCgohW10oaHR0cHM6Ly9tZWRpYS50ZW5vci5jb20vemw1bEdtN21rNUlBQUFBTS9oYXBweS1kYW5jZS5naWYpCgojIDxzcGFuIHN0eWxlPSJjb2xvcjpwdXJwbGUiPiBJbXBvcnRhciBsYSBiYXNlIGRlIGRhdG9zIDwvc3Bhbj4KCmBgYHtyfQojIGZpbGUuY2hvb3NlKCkKZGYgPC0gcmVhZC5jc3YoIi9Vc2Vycy9nYWJvdGVqZWRhL0Rlc2t0b3AvSG91c2VQcmljZURhdGEuY3N2IikKYGBgCgojIDxzcGFuIHN0eWxlPSJjb2xvcjpwdXJwbGUiPiBFbnRlbmRlciBsYSBiYXNlIGRlIGRhdG9zIDwvc3Bhbj4KCmBgYHtyfQpzdW1tYXJ5KGRmKQpzdHIoZGYpCmhlYWQoZGYpCmBgYAoKIyA8c3BhbiBzdHlsZT0iY29sb3I6cHVycGxlIj4gQ3JlYXIgdW4gbWFwYSBkZSBjb3JyZWxhY2nDs24gPC9zcGFuPgoKYGBge3J9CmxpYnJhcnkoY29ycnBsb3QpCgpkZl9jb3IgPC0gZGZbc2FwcGx5KGRmLCBpcy5udW1lcmljKV0KZGZfY29yJE9ic2VydmF0aW9uIDwtIE5VTEwKCmNvcnJlbGFjaW9uIDwtIGNvcihkZl9jb3IsIHVzZSA9ICJjb21wbGV0ZS5vYnMiKQpjb3JycGxvdChjb3JyZWxhY2lvbikKYGBgCgojIDxzcGFuIHN0eWxlPSJjb2xvcjpwdXJwbGUiPiBQcmVwYXJhciBsYXMgdmFyaWFibGVzIGNvbW8gZmFjdG9yZXMgeSBxdWl0YXIgTkFzIDwvc3Bhbj4KCmBgYHtyfQpkZiRQYXJraW5nIDwtIGFzLmZhY3RvcihkZiRQYXJraW5nKQpkZiRDaXR5X0NhdGVnb3J5IDwtIGFzLmZhY3RvcihkZiRDaXR5X0NhdGVnb3J5KQoKZGYgPC0gbmEub21pdChkZikKYGBgCgojIDxzcGFuIHN0eWxlPSJjb2xvcjpwdXJwbGUiPiBDcmVhciBNb2RlbG8gPC9zcGFuPgoKYGBge3J9CnJlZ3Jlc2lvbiA8LSBsbShIb3VzZV9QcmljZSB+IC4gLSBPYnNlcnZhdGlvbiwgZGF0YSA9IGRmKQpzdW1tYXJ5KHJlZ3Jlc2lvbikKYGBgCgojIDxzcGFuIHN0eWxlPSJjb2xvcjpwdXJwbGUiPiBNb2RpZmljYXIgbW9kZWxvIGRlIHJlZ3Jlc2nDs24gPC9zcGFuPgoKYGBge3J9CnJlZ3Jlc2lvbjIgPC0gbG0oSG91c2VfUHJpY2UgfiBDYXJwZXQgKyBCdWlsdHVwICsgUGFya2luZyArIENpdHlfQ2F0ZWdvcnksCiAgICAgICAgICAgICAgICAgZGF0YSA9IGRmKQoKc3VtbWFyeShyZWdyZXNpb24yKQpgYGAKCmBgYAoKCg==