María, fundadora de C&A Bienes Raíces en Cali, ha recibido una solicitud de asesoría para la compra de dos viviendas por parte de una compañía internacional que desea ubicar a dos de sus empleados con sus familias en la ciudad. Las características de las viviendas solicitadas son: para la primera vivienda se requiere una casa en la zona Norte con área construida de 200 metros cuadrados, un parqueadero, tres baños, cuatro habitaciones, estrato entre 4 y 5, y un crédito preaprobado de 350 millones de pesos. Para la segunda vivienda se solicita un apartamento en la zona Sur con área construida de 300 metros cuadrados, tres parqueaderos, dos baños, cinco habitaciones, estrato entre 5 y 6, y un crédito preaprobado de 850 millones de pesos.
El objetivo de este análisis es implementar métodos de regresión lineal múltiple para explicar los factores que determinan el precio de las viviendas en Cali, predecir el precio de las dos viviendas solicitadas, identificar ofertas potenciales que cumplan con las características y presupuesto establecidos, y finalmente recomendar las mejores opciones para cada solicitud, brindando a María un informe ejecutivo que le permita tomar decisiones informadas.
El análisis se desarrollará en seis etapas principales. En primer lugar, se realizará un filtrado y depuración de los datos para seleccionar únicamente las propiedades que corresponden a cada solicitud específica. En segundo lugar, se llevará a cabo un análisis exploratorio para entender las relaciones entre las variables y el precio de las viviendas. En tercer lugar, se estimarán modelos de regresión lineal múltiple para cada segmento del mercado. En cuarto lugar, se verificarán los supuestos del modelo para garantizar su validez. En quinto lugar, se realizarán predicciones para las viviendas solicitadas. Finalmente, se seleccionarán y recomendarán las mejores ofertas disponibles dentro del presupuesto establecido para cada caso.
## Rows: 8,322
## Columns: 13
## $ id <dbl> 1147, 1169, 1350, 5992, 1212, 1724, 2326, 4386, 1209, 159…
## $ zona <chr> "Zona Oriente", "Zona Oriente", "Zona Oriente", "Zona Sur…
## $ piso <chr> NA, NA, NA, "02", "01", "01", "01", "01", "02", "02", "02…
## $ estrato <dbl> 3, 3, 3, 4, 5, 5, 4, 5, 5, 5, 6, 4, 5, 6, 4, 5, 5, 4, 5, …
## $ preciom <dbl> 250, 320, 350, 400, 260, 240, 220, 310, 320, 780, 750, 62…
## $ areaconst <dbl> 70, 120, 220, 280, 90, 87, 52, 137, 150, 380, 445, 355, 2…
## $ parqueaderos <dbl> 1, 1, 2, 3, 1, 1, 2, 2, 2, 2, NA, 3, 2, 2, 1, 4, 2, 2, 2,…
## $ banios <dbl> 3, 2, 2, 5, 2, 3, 2, 3, 4, 3, 7, 5, 6, 2, 4, 4, 4, 3, 2, …
## $ habitaciones <dbl> 6, 3, 4, 3, 3, 3, 3, 4, 6, 3, 6, 5, 6, 2, 5, 5, 4, 3, 3, …
## $ tipo <chr> "Casa", "Casa", "Casa", "Casa", "Apartamento", "Apartamen…
## $ barrio <chr> "20 de julio", "20 de julio", "20 de julio", "3 de julio"…
## $ longitud <dbl> -76.51168, -76.51237, -76.51537, -76.54000, -76.51350, -7…
## $ latitud <dbl> 3.43382, 3.43369, 3.43566, 3.43500, 3.45891, 3.36971, 3.4…
La base de datos vivienda contiene 8,322 registros y 13 variables que describen las características de las propiedades en Cali. Entre las variables categóricas se encuentran la zona de ubicación, el piso que ocupa la vivienda, el tipo de vivienda (casa o apartamento) y el barrio. Las variables numéricas incluyen un identificador único, el precio en millones de pesos, el área construida en metros cuadrados, el estrato socioeconómico, el número de parqueaderos, baños y habitaciones, así como las coordenadas geográficas de longitud y latitud.
## preciom areaconst estrato banios
## Min. : 58.0 Min. : 30.0 Min. :3.000 Min. : 0.000
## 1st Qu.: 220.0 1st Qu.: 80.0 1st Qu.:4.000 1st Qu.: 2.000
## Median : 330.0 Median : 123.0 Median :5.000 Median : 3.000
## Mean : 433.9 Mean : 174.9 Mean :4.634 Mean : 3.111
## 3rd Qu.: 540.0 3rd Qu.: 229.0 3rd Qu.:5.000 3rd Qu.: 4.000
## Max. :1999.0 Max. :1745.0 Max. :6.000 Max. :10.000
## NAs :2 NAs :3 NAs :3 NAs :3
## habitaciones parqueaderos
## Min. : 0.000 Min. : 1.000
## 1st Qu.: 3.000 1st Qu.: 1.000
## Median : 3.000 Median : 2.000
## Mean : 3.605 Mean : 1.835
## 3rd Qu.: 4.000 3rd Qu.: 2.000
## Max. :10.000 Max. :10.000
## NAs :3 NAs :1605
Los precios de las viviendas varían entre 58 y 1999 millones de pesos, con una mediana de 330 millones y una media de 433.9 millones. Esta diferencia entre la media y la mediana indica que la distribución del precio presenta una asimetría positiva, es decir, existen algunas propiedades de alto valor que elevan el promedio por encima de la mediana, lo cual es común en el mercado inmobiliario. El primer cuartil se ubica en 220 millones y el tercer cuartil en 540 millones, lo que indica que el 50% de las propiedades se concentran en un rango de precios entre 220 y 540 millones de pesos.
En cuanto al área construida, el promedio es de 174.9 metros cuadrados, con una mediana de 123 metros cuadrados, lo que nuevamente sugiere una asimetría positiva donde algunas propiedades muy grandes elevan el promedio. El rango del área construida va desde 30 hasta 1745 metros cuadrados, con el 50% de las propiedades concentradas entre 80 y 229 metros cuadrados. El estrato socioeconómico promedio se ubica en 4.6, con una mediana de 5, lo que refleja que la mayoría de las propiedades se concentran en estratos medios y medio-altos.
El número de habitaciones tiene una mediana de 3 habitaciones por vivienda, con un promedio de 3.6 habitaciones, mientras que los baños presentan una mediana de 3 y un promedio de 3.1. En el caso de los parqueaderos, la situación es particularmente problemática: aunque la mediana es de 2 y el promedio de 1.8, esta variable presenta 1605 valores faltantes, lo que representa aproximadamente el 19% de los registros de la base de datos. Esta alta proporción de datos perdidos es una limitación importante que deberá considerarse en el análisis, especialmente porque el número de parqueaderos es una característica solicitada en ambas viviendas. Las demás variables presentan valores faltantes en mucha menor proporción: solo 2 en preciom, 3 en areaconst, 3 en estrato y 3 en banios y habitaciones.
##
## Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
## 124 1920 1198 351 4726
##
## Apartamento Casa
## 5100 3219
##
## Apartamento Casa
## Zona Centro 24 100
## Zona Norte 1198 722
## Zona Oeste 1029 169
## Zona Oriente 62 289
## Zona Sur 2787 1939
Al analizar la distribución geográfica de las propiedades, observamos que la base de datos contiene 8,322 viviendas distribuidas en cinco zonas de Cali. La Zona Sur concentra la mayor cantidad de propiedades con 4,726 registros, seguida por la Zona Norte con 1,920, la Zona Oeste con 1,198, la Zona Oriente con 351 y finalmente la Zona Centro con solo 124 propiedades. Esta marcada diferencia en la distribución geográfica es relevante porque sugiere que el mercado inmobiliario en Cali tiene una mayor oferta en ciertas zonas, lo cual podría influir en los precios y en la disponibilidad de opciones para los compradores.
En cuanto al tipo de vivienda, la base de datos contiene 5,100 apartamentos y 3,219 casas, lo que indica una mayor oferta de apartamentos en el mercado inmobiliario de Cali. Al cruzar la información de zona y tipo de vivienda, encontramos que en la Zona Norte hay 722 casas y 1,198 apartamentos, mientras que en la Zona Sur hay 1,939 casas y 2,787 apartamentos. Esta distribución es especialmente relevante para nuestro análisis, ya que para la primera solicitud necesitamos casas en la Zona Norte (722 propiedades disponibles) y para la segunda solicitud necesitamos apartamentos en la Zona Sur (2,787 propiedades disponibles). Ambos subconjuntos tienen un tamaño muestral suficiente para construir modelos estadísticamente robustos. También es importante destacar que la Zona Centro tiene solo 100 casas y 24 apartamentos, lo que refleja una oferta limitada en esa zona de la ciudad.
## Warning in validateCoords(lng, lat, funcName): Data contains 3 rows with either
## missing or invalid lat/lon values and will be ignored
El mapa interactivo muestra la ubicación geográfica de todas las propiedades en la base de datos, con colores diferenciados por zona: rojo para la Zona Norte, verde para la Zona Sur, amarillo para la Zona Centro, morado para la Zona Oriente y gris para otras zonas. Esta visualización permite verificar que las propiedades están efectivamente distribuidas en las zonas correspondientes y que no existen errores graves de georreferenciación. Al hacer clic en cada punto, se puede obtener información detallada sobre la propiedad, incluyendo el barrio, el tipo de vivienda y el precio en millones de pesos.
Para atender la primera solicitud, necesitamos enfocarnos exclusivamente en casas ubicadas en la Zona Norte de Cali. Por lo cual, este filtro nos permite construir un modelo específico para este segmento del mercado inmobiliario, evitando que propiedades de otras zonas o de otros tipos distorsionen las relaciones que buscamos identificar.
## Registros obtenidos: 722
## Tipos de propiedad: Casa
## Zonas incluidas: Zona Norte
Como resultado del filtro, obtenemos 722 registros que corresponden exclusivamente a casas ubicadas en la Zona Norte.
##
## Casa
## 722
##
## Zona Norte
## 722
## Tipos únicos en base1: Casa
## Zonas únicas en base1: Zona Norte
Las tablas de comprobación confirman que el filtro funcionó correctamente: todos los registros en base1 son casas y todas están ubicadas en la Zona Norte. No existen propiedades de otros tipos ni de otras zonas en este subconjunto, lo que garantiza que el modelo que construiremos a continuación será específico para el segmento de mercado que nos interesa analizar.
Para verificar que todas las propiedades efectivamente están ubicadas en la Zona Norte y detectar posibles errores de georreferenciación, se genera un mapa interactivo con las coordenadas de cada propiedad.
El mapa interactivo permite visualizar la ubicación geográfica de todas las casas en la Zona Norte. Observamos que la mayoría de las propiedades se concentran en el área norte de Cali, aunque podrían aparecer algunos puntos que se ubican geográficamente fuera de los límites esperados para esta zona. La presencia de puntos fuera de la Zona Norte puede deberse a varias razones. En primer lugar, pueden existir errores de georreferenciación en los datos, donde las coordenadas de longitud y latitud no son completamente precisas. En segundo lugar, la clasificación administrativa de algunos barrios puede ser ambigua, con límites que no están claramente definidos y que generan confusión en la asignación de la zona. En tercer lugar, algunos barrios pueden tener nombres compartidos o zonas que se extienden más allá de los límites tradicionales, lo que lleva a que propiedades en el límite norte de la ciudad aparezcan etiquetadas como Zona Norte pero con coordenadas que sugieren otra ubicación. A pesar de estos posibles casos, el volumen de puntos fuera de zona es mínimo y no afecta significativamente el análisis.
## preciom areaconst estrato banios habitaciones parqueaderos
## 0 0 0 0 0 287
Como se puede observar, la variable parqueaderos presenta 287 valores faltantes en la base de casas de la Zona Norte, lo que representa aproximadamente el 40% de los registros.
## Total de registros: 722
## Registros con parqueaderos NA: 287
## Proporción de faltantes: 39.8 %
##
## 1 2 3 4 5 6 7 8 9 10 <NA>
## 161 158 49 40 11 8 5 1 1 1 287
La distribución de la variable parqueaderos en los casos donde sí está disponible muestra que la mayoría de las casas en la Zona Norte tienen entre 1 y 3 parqueaderos. Específicamente, 161 propiedades tienen 1 parqueadero, 158 tienen 2 parqueaderos, 49 tienen 3 parqueaderos, y las cantidades van disminuyendo progresivamente hasta alcanzar casos excepcionales con hasta 10 parqueaderos.
Al ser un porcentaje tan grande, se realiza la imputación por mediana, debido que el número de parqueaderos es una característica que en la Zona Norte tiende a ser relativamente homogénea, con la mayoría de las propiedades teniendo entre 1 y 2 espacios, y solo una minoría teniendo 3 o más. Asimismo, la correlación entre parqueaderos y precio es moderada (0.41), por lo que el impacto de una imputación razonable sobre las estimaciones del modelo no será excesivo. Por ultimo, permite mantener los 722 registros en el análisis nos permite conservar el poder estadístico del modelo y evitar posibles sesgos por eliminación de casos.
## [1] 0
En el histograma de la derecha, correspondiente a los datos después de la imputación, la barra roja de valores faltantes ha desaparecido por completo. En su lugar, observamos un incremento notable en la frecuencia del valor 2, que ahora se convierte en el valor más frecuente, con un total de 445 casos (los 158 originales más los 287 imputados). Es importante notar que el resto de la distribución permanece prácticamente inalterada: las frecuencias de los valores 1, 3, 4, 5, 6, 7, 8, 9 y 10 son exactamente las mismas que antes. Esto confirma que la imputación con la mediana no distorsiona la distribución original de la variable, sino que simplemente asigna el valor más representativo a los casos faltantes, preservando la estructura general de los datos.
## Valores atípicos en precio: 15
## Rango normal de precios: [ -359.19 , 1251 ]
El análisis de datos faltantes revela que en la base filtrada de casas en la Zona Norte, las variables preciom, areaconst, estrato, banios y habitaciones no presentan valores NA, lo cual es una excelente noticia para la calidad del análisis. Sin embargo, la variable parqueaderos muestra 287 valores faltantes, lo que representa aproximadamente el 40% de los 722 registros de la base. Esta alta proporción de datos perdidos en el número de parqueaderos es una limitación importante que deberá considerarse al momento de construir el modelo, especialmente porque esta característica es solicitada en la vivienda que estamos analizando.
En cuanto a los valores atípicos en el precio, identificamos 15 propiedades con precios que se encuentran fuera del rango de tres desviaciones estándar por encima o por debajo de la media. El rango normal de precios se extiende desde -359.19 hasta 1251 millones de pesos, aunque el límite inferior negativo es simplemente un artefacto estadístico que no tiene sentido económico, ya que los precios no pueden ser negativos. Esto indica que la distribución de precios tiene una asimetría positiva, con algunas propiedades de valor muy alto que elevan el límite superior. Las 15 propiedades atípicas representan aproximadamente el 2% de la muestra, una proporción pequeña que no distorsionará significativamente el modelo.
Antes de construir el modelo de regresión, es fundamental explorar las relaciones entre las variables para entender qué factores influyen en el precio de las casas en la Zona Norte. Para ello, calculamos la matriz de correlación entre el precio y las características de las propiedades.
La matriz de correlación revela relaciones importantes entre el precio y
las características de las viviendas en la Zona Norte. La correlación
más fuerte se observa entre el área construida y el precio, con un
coeficiente de 0.69, lo que indica que el tamaño de la vivienda es el
principal determinante del precio en esta zona. Esta relación es lógica
y esperada, ya que a mayor área construida, mayor es el valor de la
propiedad. Le sigue en importancia el estrato socioeconómico, con una
correlación de 0.53 con el precio, lo que refleja que las propiedades
ubicadas en barrios de mayor estrato tienden a tener precios
significativamente más altos. El número de baños presenta una
correlación de 0.51 con el precio, muy similar a la del estrato, lo que
sugiere que esta característica también es un factor relevante en la
determinación del valor de las casas en la Zona Norte.
En cuanto a las otras características, el número de parqueaderos muestra una correlación de 0.41 con el precio, seguido por las habitaciones con 0.37. Aunque estas correlaciones son positivas, son considerablemente más bajas que las observadas para el área, el estrato y los baños, lo que indica que estas variables tienen un impacto menor sobre el precio de las viviendas. Es particularmente interesante notar que el número de parqueaderos, a pesar de tener una correlación moderada de 0.41, no es tan determinante como podría esperarse, posiblemente porque en la Zona Norte la mayoría de las propiedades ya cuentan con espacio para estacionamiento.
También es importante observar las correlaciones entre las variables independientes. Existe una correlación considerable entre el número de baños y las habitaciones, con un coeficiente de 0.59, lo cual es lógico porque las casas más grandes con más habitaciones suelen tener también más baños. De manera similar, el área construida se correlaciona moderadamente con el número de baños (0.46) y con las habitaciones (0.42). El estrato muestra correlaciones moderadas con el área (0.35), los baños (0.35) y los parqueaderos (0.26). Estas correlaciones entre predictores no son lo suficientemente altas como para generar problemas de multicolinealidad severa, pero sí sugieren que existe cierta redundancia en la información que aportan estas variables al modelo, especialmente entre baños y habitaciones.
## Warning: `line.width` does not currently support multiple values.
## Warning: `line.width` does not currently support multiple values.
## Warning: `line.width` does not currently support multiple values.
## Warning: `line.width` does not currently support multiple values.
El gráfico de dispersión interactivo muestra la relación entre el precio y el área construida, con colores que distinguen los diferentes estratos socioeconómicos (3, 4, 5 y 6) y el tamaño de los puntos que representa el número de habitaciones. Observamos una clara tendencia positiva: a medida que aumenta el área construida, el precio tiende a incrementarse, aunque esta relación no es perfectamente lineal y existe una dispersión considerable, especialmente en áreas grandes donde los precios varían ampliamente. Los colores revelan que las propiedades de estrato 6 (representadas en el color más oscuro) tienden a concentrarse en la parte superior del gráfico, con precios que pueden superar los 1500 millones de pesos para áreas superiores a los 300 metros cuadrados. En contraste, las propiedades de estrato 3 (representadas en el color más claro) se ubican en la parte inferior del gráfico, con precios que rara vez superan los 600 millones de pesos, incluso para áreas similares. Esto confirma que el estrato añade poder explicativo al modelo, ya que dos casas con el mismo área pueden tener precios muy diferentes dependiendo del estrato en el que se ubiquen.
El diagrama de cajas por estrato permite visualizar cómo se distribuye el precio de las casas en cada nivel socioeconómico. Observamos que a medida que aumenta el estrato, también lo hace la mediana del precio, lo que confirma la relación positiva entre estas dos variables. Para el estrato 3, la mediana se sitúa alrededor de los 300 millones de pesos, con una caja que se extiende aproximadamente entre 240 y 400 millones, y presenta algunos valores atípicos que alcanzan los 600 millones. En el estrato 4, la mediana asciende a aproximadamente 380 millones, con un rango intercuartílico que va desde 300 hasta 550 millones, y se observan valores atípicos que llegan hasta los 800 millones. El estrato 5 muestra una mediana de aproximadamente 450 millones, con una caja que se extiende entre 320 y 650 millones, y presenta varios valores atípicos que superan los 900 millones, llegando incluso hasta los 1200 millones. Finalmente, el estrato 6 tiene la mediana más alta, alrededor de 600 millones, con una caja que va desde 380 hasta 900 millones.
En el estrato 5 también observamos una dispersión considerable con varios valores atípicos por encima de los 900 millones, lo que indica que incluso en estratos medios-altos pueden existir propiedades con precios excepcionalmente altos. Los valores atípicos en todos los estratos representan propiedades que, por sus características particulares (posiblemente ubicación privilegiada, acabados de lujo o terrenos especialmente grandes), tienen precios muy superiores al promedio de su estrato.
El gráfico de precio versus número de baños muestra una relación positiva pero con una dispersión considerable. Las propiedades con más baños tienden a tener precios más altos, pero esta relación no es tan fuerte ni tan clara como la que observamos con el área construida. La mayoría de las casas en la Zona Norte tienen entre 2 y 4 baños, con algunos casos extremos de hasta 8 o 9 baños que corresponden a propiedades de muy alto valor. Es interesante notar que para un mismo número de baños, las propiedades de estrato más alto (color más oscuro) tienden a tener precios superiores, lo que refuerza la importancia de incluir el estrato como variable en el modelo.
Con base en el análisis exploratorio de datos y habiendo resuelto el problema de los valores faltantes en parqueaderos, procedemos a estimar el modelo de regresión lineal múltiple. El modelo propuesto busca explicar el precio de las casas en la Zona Norte en función de sus características físicas y socioeconómicas, utilizando la siguiente especificación:
preciom = β₀ + β₁(areaconst) + β₂(estrato) + β₃(habitaciones) + β₄(parqueaderos) + β₅(banios) + ε
Donde: - β₀ es el intercepto - β₁, β₂, β₃, β₄, β₅ son los coeficientes de las variables independientes - ε es el término de error
##
## Call:
## lm(formula = preciom ~ areaconst + estrato + habitaciones + parqueaderos +
## banios, data = base1_imputada)
##
## Residuals:
## Min 1Q Median 3Q Max
## -924.94 -77.71 -17.66 45.90 1081.29
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -251.05177 30.11848 -8.335 3.94e-16 ***
## areaconst 0.81090 0.04352 18.634 < 2e-16 ***
## estrato 84.61108 7.17727 11.789 < 2e-16 ***
## habitaciones 0.95948 4.10569 0.234 0.81529
## parqueaderos 16.55976 5.70396 2.903 0.00381 **
## banios 24.57669 5.35583 4.589 5.26e-06 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 158.2 on 716 degrees of freedom
## Multiple R-squared: 0.6548, Adjusted R-squared: 0.6524
## F-statistic: 271.6 on 5 and 716 DF, p-value: < 2.2e-16
El coeficiente para el área construida es de 0.81 millones de pesos por metro cuadrado, con un valor p extremadamente bajo (< 2e-16).Esto significa que, manteniendo todas las demás variables constantes, por cada metro cuadrado adicional de área construida, el precio de la casa aumenta en 0.81 millones de pesos, es decir, aproximadamente 810 mil pesos por metro cuadrado.
El coeficiente para el estrato es de 84.61 millones de pesos por nivel de estrato, también altamente significativo (p < 2e-16). Ya que, manteniendo las demás variables constantes, por cada nivel de estrato que aumente la propiedad, el precio se incrementa en aproximadamente 84.61 millones de pesos. Por ejemplo, dos casas idénticas en términos de área, habitaciones, baños y parqueaderos, pero una ubicada en estrato 4 y otra en estrato 5, tendrían una diferencia de precio de aproximadamente 84.6 millones de pesos, siendo más costosa la del estrato 5.
El coeficiente para los baños es de 24.58 millones de pesos por baño adicional, con un valor p de 5.26e-06, lo que indica que esta variable también es estadísticamente significativa. Esto significa que, manteniendo las demás variables constantes, por cada baño adicional que tenga la casa, el precio aumenta en aproximadamente 24.58 millones de pesos. Este resultado es consistente con el análisis exploratorio, donde los baños mostraron una correlación moderada con el precio. Sin embargo, es importante notar que el efecto marginal de un baño adicional es considerablemente menor que el del área construida o el estrato, lo cual tiene sentido porque el área construida captura en parte el tamaño general de la vivienda y el estrato captura su ubicación.
El coeficiente para los parqueaderos es de 16.56 millones de pesos por parqueadero adicional, con un valor p de 0.00381, que es inferior al nivel de significancia del 5% (0.05) pero superior al nivel del 1% (0.01). Esto indica que esta variable es estadísticamente significativa al nivel del 5%, pero no al nivel del 1%. Esto significa que, manteniendo las demás variables constantes, podemos afirmar con un 95% de confianza que agregar un parqueadero adicional incrementa el precio de la casa en aproximadamente 16.56 millones de pesos. Este resultado es particularmente interesante porque contrasta con el análisis exploratorio, donde los parqueaderos mostraron la correlación más baja con el precio. La significancia estadística de esta variable sugiere que, contrariamente a lo que podríamos pensar, el número de parqueaderos sí tiene un efecto sobre el precio, aunque es el más pequeño de todas las variables significativas.
El coeficiente para las habitaciones es de 0.96 millones de pesos por habitación adicional, con un valor p de 0.815, que es claramente superior al nivel de significancia del 5%. Esto indica que esta variable no es estadísticamente significativa, por lo que no podemos afirmar que el número de habitaciones tenga un efecto real sobre el precio de las casas en la Zona Norte. Este hallazgo es consistente con el análisis exploratorio y tiene una explicación lógica: el número de habitaciones está altamente correlacionado con el área construida (0.42) y con el número de baños (0.59), por lo que su efecto sobre el precio ya está siendo capturado por estas otras variables. En términos prácticos, esto sugiere que en la Zona Norte, los compradores valoran más el tamaño total de la vivienda (reflejado en el área construida) y su distribución (reflejada en los baños) que el número específico de habitaciones. Una casa con 3 habitaciones y 200 metros cuadrados puede tener un precio similar a una con 4 habitaciones y el mismo área, si las demás características son comparables.
El intercepto del modelo es de -251.05 millones de pesos y es estadísticamente significativo (p = 3.94e-16). Aunque el intercepto por sí solo no tiene una interpretación práctica directa en este contexto, su significancia estadística es importante para asegurar que el modelo está correctamente especificado y que el intercepto captura el efecto base sobre el cual se suman los efectos de las variables independientes.
El R² del modelo es de 0.6548, lo que significa que aproximadamente el 65.48% de la variabilidad en el precio de las casas en la Zona Norte es explicada por las variables incluidas en el modelo (área construida, estrato, habitaciones, parqueaderos y baños). Este es un valor bastante bueno, especialmente considerando que se trata de datos del mercado inmobiliario, donde siempre existe una considerable variabilidad no explicada debido a factores como la calidad de los acabados, la antigüedad de la vivienda, la vista, la cercanía a centros comerciales o parques, entre otros. Un R² de 0.65 indica que el modelo tiene un poder explicativo sólido y que las variables seleccionadas capturan adecuadamente los principales determinantes del precio.
El R² ajustado es de 0.6524, muy similar al R², lo que indica que el modelo no está sobreajustado y que las variables incluidas aportan información relevante sin introducir ruido innecesario. La cercanía entre ambos valores sugiere que el modelo está bien equilibrado en términos de complejidad y poder explicativo, y que no hay variables redundantes que estén inflando artificialmente el R².
El error estándar residual es de 158.2 millones de pesos, lo que representa la desviación típica de los residuos del modelo. Este valor indica que, en promedio, las predicciones del modelo se desvían del precio real en aproximadamente 158.2 millones de pesos. Considerando que los precios en la base de datos de casas en la Zona Norte van desde aproximadamente 58 hasta 1999 millones, con una media de alrededor de 382 millones, este error representa un margen de predicción moderado. Es posible que este margen se reduzca si se incluyeran variables adicionales que capturen características no observadas en el modelo actual, como la calidad de los acabados o la antigüedad de la propiedad.
El estadístico F del modelo es de 271.6 con un valor p extremadamente bajo (< 2.2e-16), lo que indica que el modelo en su conjunto es estadísticamente significativo. Esto significa que al menos una de las variables independientes tiene un efecto real sobre el precio, y que el modelo es útil para predecir el valor de las casas en la Zona Norte. En este caso, sabemos que cuatro de las cinco variables (área, estrato, parqueaderos y baños) son estadísticamente significativas, lo que confirma la validez del modelo.
Para garantizar que las inferencias y predicciones del modelo sean válidas, es necesario verificar que se cumplan los supuestos fundamentales de la regresión lineal múltiple. Estos supuestos son: linealidad, independencia de los errores, homocedasticidad (varianza constante de los errores) y normalidad de los errores.
El primer gráfico de diagnóstico muestra los residuos en función de los
valores ajustados (predichos) por el modelo. Este gráfico nos permite
evaluar dos supuestos importantes: la linealidad de la relación y la
homocedasticidad. Observamos que los residuos se distribuyen de manera
aleatoria alrededor de la línea horizontal en cero, sin presentar un
patrón curvilíneo claro. Esto sugiere que el supuesto de linealidad se
cumple razonablemente bien, es decir, que la relación entre las
variables independientes y el precio es aproximadamente lineal. No
obstante, notamos que la dispersión de los residuos tiende a aumentar
ligeramente a medida que los valores ajustados aumentan, lo que podría
indicar cierta heterocedasticidad. También observamos algunos residuos
extremos, especialmente en la parte superior del gráfico (valores
ajustados altos), que corresponden a propiedades con precios
excepcionalmente altos que el modelo subestima o sobreestima
considerablemente, con residuos que alcanzan hasta los 1000 millones de
pesos.
El gráfico Q-Q (cuantil-cuantil) compara los cuantiles teóricos de una distribución normal con los cuantiles observados de los residuos estandarizados. Observamos que los puntos se alinean bastante bien con la línea diagonal en el centro del gráfico, pero presentan desviaciones significativas en los extremos, especialmente en la cola superior donde hay varios puntos que se alejan considerablemente de la línea, con residuos estandarizados que alcanzan valores entre -3.2 y 3.2. Esto indica que la distribución de los residuos tiene colas más pesadas que una distribución normal, lo que sugiere que el supuesto de normalidad no se cumple. Esta desviación en los extremos es consistente con la presencia de valores atípicos en el precio, como habíamos identificado en el análisis exploratorio. La violación de la normalidad es severa, como lo confirman las pruebas estadísticas que veremos a continuación.
En el gráfico de Escala-Ubicación (Homocedasticidad), observamos que la línea suavizada (curva roja) muestra una tendencia ascendente a lo largo del rango de valores ajustados, lo que sugiere que la varianza de los errores aumenta a medida que aumentan los valores ajustados. Esto indica la presencia de heterocedasticidad, es decir, que los errores no tienen varianza constante, lo cual es común en modelos de precios donde la variabilidad tiende a ser mayor para propiedades de alto valor.
La línea de contorno de Cook (distancia de Cook) indica puntos que tienen una influencia desproporcionada sobre los coeficientes del modelo. Observamos que algunos puntos se encuentran fuera de las regiones de contorno, especialmente en la parte superior derecha del gráfico, lo que sugiere que existen algunas observaciones con alto apalancamiento y residuos grandes que podrían ser influyentes. Estos puntos corresponden a propiedades con características excepcionales, como áreas muy grandes o precios extremadamente altos, que merecen ser examinadas con atención. Sin embargo, la mayoría de los puntos se encuentran dentro de las regiones de contorno, lo que indica que el modelo es relativamente estable y no está dominado por unas pocas observaciones.
##
## Shapiro-Wilk normality test
##
## data: residuals(modelo1)[1:5000]
## W = 0.83433, p-value < 2.2e-16
##
## studentized Breusch-Pagan test
##
## data: modelo1
## BP = 132.24, df = 5, p-value < 2.2e-16
## areaconst estrato habitaciones parqueaderos banios
## 1.523989 1.433058 1.621630 1.120670 1.918323
La prueba de Shapiro-Wilk arroja un estadístico W de 0.83433 con un valor p < 2.2e-16, lo que indica que rechazamos la hipótesis nula de normalidad de los residuos. Esto confirma lo que observamos en el gráfico Q-Q: los residuos no siguen una distribución normal. Esta violación del supuesto de normalidad es severa y común en modelos con variables de precio, donde la distribución tiende a ser asimétrica con colas pesadas. Es importante tener en cuenta que, aunque el teorema del límite central nos indica que con un tamaño de muestra grande (n = 722) las estimaciones de los coeficientes son robustas, la violación de la normalidad afecta los intervalos de confianza y las pruebas de hipótesis.
La prueba de Breusch-Pagan evalúa la hipótesis nula de que la varianza de los errores es constante. El estadístico de prueba es BP = 132.24 con 5 grados de libertad y un valor p < 2.2e-16, lo que indica que rechazamos la hipótesis nula de homocedasticidad. Esto confirma la presencia de heterocedasticidad en el modelo, consistente con lo observado en el gráfico de escala-ubicación. La heterocedasticidad significa que la varianza de los errores no es constante a lo largo de los valores ajustados, lo cual es común en modelos de precios donde la variabilidad tiende a ser mayor para propiedades de mayor valor.
El VIF mide el grado de multicolinealidad entre las variables independientes. Valores de VIF superiores a 5 o 10 indican problemas de multicolinealidad severa. Todos los valores de VIF son inferiores a 2, lo que indica que no hay problemas de multicolinealidad en el modelo. Esto significa que las variables independientes no están excesivamente correlacionadas entre sí, y que cada una aporta información única al modelo. La correlación más alta observada fue entre baños y habitaciones (0.59), pero esta no es lo suficientemente alta como para generar problemas de multicolinealidad, como lo confirman los bajos valores de VIF.
## Número de puntos influyentes: 46
## Proporción de puntos influyentes: 6.37 %
El gráfico de distancia de Cook muestra la influencia de cada
observación en las estimaciones del modelo. La línea roja horizontal
representa el umbral de 4/n (4/722 ≈ 0.0055). Observamos que la mayoría
de los puntos se encuentran por debajo de este umbral, lo que indica que
no tienen una influencia desproporcionada sobre el modelo. Sin embargo,
identificamos algunos puntos con distancias de Cook superiores a 0.2, e
incluso algunos que alcanzan valores cercanos a 0.8, lo que indica que
son observaciones altamente influyentes. Estos puntos corresponden a
propiedades con características excepcionales que el modelo no logra
capturar adecuadamente. Dado que el número de puntos influyentes es
pequeño (menos del 2% de la muestra) y que el R² del modelo es
relativamente alto (0.65), consideramos que no es necesario eliminar
estas observaciones, pero recomendamos a María que tenga precaución al
interpretar las predicciones para propiedades con características
extremas.
El análisis de residuos versus cada variable independiente permite
verificar si existe algún patrón sistemático que indique que la relación
no es lineal. Observamos que para la mayoría de las variables, los
residuos se distribuyen aleatoriamente alrededor de cero sin mostrar
patrones claros. Sin embargo, en el gráfico de residuos versus área
construida, notamos una ligera tendencia a que los residuos sean
positivos para áreas muy pequeñas (menores a 200 m²) y muy grandes
(superiores a 800 m²), mientras que son negativos para áreas
intermedias, lo que sugiere que la relación podría tener un componente
no lineal. De manera similar, en el gráfico de residuos versus estrato,
observamos que los residuos son más variables en estrato 6, lo que
indica que el modelo predice mejor en estratos medios que en el estrato
más alto. En cuanto a las habitaciones, los residuos se distribuyen de
manera bastante uniforme alrededor de cero para todos los valores, sin
patrones claros, lo que sugiere que la relación con esta variable es
adecuadamente capturada por el modelo lineal.
En general, el modelo de regresión lineal múltiple construido para las casas en la Zona Norte presenta algunas violaciones de los supuestos de la regresión lineal. La principal limitación es la violación del supuesto de normalidad de los residuos (Shapiro-Wilk: W = 0.834, p < 2.2e-16) y la presencia de heterocedasticidad (Breusch-Pagan: BP = 132.24, p < 2.2e-16). Sin embargo, la linealidad se mantiene adecuadamente y la multicolinealidad no es un problema grave (VIF < 2 en todas las variables). Estas violaciones, aunque comunes en modelos de precios, sugieren que podríamos mejorar el modelo mediante transformaciones como:
Transformación logarítmica de la variable respuesta: Aplicar log(precio) podría mejorar la normalidad de los residuos y estabilizar la varianza. Esto es especialmente recomendable cuando la variable respuesta tiene una distribución asimétrica con colas pesadas, como es el caso de los precios de vivienda. Esta transformación también podría reducir el problema de heterocedasticidad detectado.
Errores estándar robustos: Dado que se ha detectado heterocedasticidad, se podrían utilizar errores estándar robustos (HC) para corregir las inferencias estadísticas sin necesidad de transformar los datos. Esto permitiría mantener el modelo en su escala original mientras se corrigen los problemas de inferencia.
3.Inclusión de términos polinómicos: Agregar términos como areaconst² podría capturar relaciones no lineales que el modelo lineal actual está ignorando, especialmente la relación observada en los residuos versus área donde los residuos son positivos en los extremos y negativos en el medio.
Para realizar la predicción, necesitamos definir un valor específico para el estrato, ya que la solicitud indica un rango entre 4 y 5. Dado que no tenemos información adicional que nos permita determinar si la vivienda sería de estrato 4 o 5, utilizaremos el estrato 4 como referencia, que es el límite inferior del rango. Esta decisión es conservadora y nos permite estimar un precio mínimo esperado para la vivienda.
## === PREDICCIÓN PARA VIVIENDA 1 ===
## Características:
## - Área: 200 m²
## - Estrato: 4
## - Habitaciones: 4
## - Parqueaderos: 1
## - Baños: 3
## Precio estimado: $ 343.7 millones
## Intervalo de predicción (95%):
## - Límite inferior: $ 32.62 millones
## - Límite superior: $ 654.79 millones
## Presupuesto disponible: $350 millones
## ¿Dentro del presupuesto? SÍ ✓
El modelo estima que una casa en la Zona Norte con área construida de 200 metros cuadrados, estrato 4, 4 habitaciones, 1 parqueadero y 3 baños tendría un precio aproximado de 343.7 millones de pesos. El intervalo de predicción del 95% indica que, con un 95% de confianza, el precio real de una casa con estas características se encontraría entre 32.62 y 654.79 millones de pesos.
Es importante destacar que esta predicción se basa en el modelo construido con los datos disponibles, que explica aproximadamente el 65% de la variabilidad en los precios. El margen de error de la predicción es de aproximadamente ±311 millones de pesos, lo que representa un rango de incertidumbre considerable. Esta incertidumbre se debe a la variabilidad natural del mercado inmobiliario y a la presencia de factores no incluidos en el modelo, como la calidad de los acabados, la antigüedad de la vivienda o la ubicación específica dentro de la zona. El límite inferior del intervalo de predicción (32.62 millones) parece excesivamente bajo y refleja la alta variabilidad de los datos, así como la presencia de valores atípicos que amplían los intervalos de predicción.
El precio estimado de 343.7 millones de pesos se encuentra ligeramente por debajo del presupuesto de 350 millones disponible para esta compra, con un margen de apenas 6.3 millones de pesos. Esto indica que es factible encontrar una propiedad que cumpla con las características solicitadas dentro del presupuesto establecido, aunque el margen es muy ajustado. María deberá ser cuidadosa al seleccionar las opciones, priorizando aquellas que se acerquen más a las características solicitadas y que tengan precios que permitan cierto margen para negociación.
se realiza la predicción con el estrato 5 para ver su comportamiento
## === ANÁLISIS DE SENSIBILIDAD ===
## Si la vivienda fuera de estrato 5 (límite superior):
## Precio estimado: $ 428.31 millones
## Diferencia con estrato 4: $ 84.61 millones
El análisis de sensibilidad muestra que si la propiedad fuera de estrato 5 en lugar de estrato 4, el precio estimado aumentaría en aproximadamente 84.61 millones de pesos, alcanzando los 428.31 millones. Esta diferencia corresponde precisamente al coeficiente estimado para el estrato en el modelo, que es de 84.61 millones por cada nivel de estrato. Esto significa que, para una casa de 200 m² con 4 habitaciones, 1 parqueadero y 3 baños, la diferencia entre estar en estrato 4 o estrato 5 es de aproximadamente 85 millones de pesos.
Este resultado es fundamental para la estrategia de búsqueda de María. Si logra identificar propiedades en estrato 4 dentro de la Zona Norte, el precio estimado de 343.7 millones está dentro del presupuesto de 350 millones, aunque con un margen muy ajustado. Por el contrario, si las opciones disponibles son principalmente de estrato 5, el precio estimado de 428.31 millones supera el presupuesto en aproximadamente 78 millones, lo que haría inviable la compra dentro del presupuesto disponible. En este caso, sería necesario buscar alternativas con características diferentes, como un área construida menor (por ejemplo, 180 m² en lugar de 200 m²) o reducir el número de baños, para ajustar el precio al presupuesto disponible.
Con base en la predicción del modelo y el presupuesto disponible de 350 millones de pesos, procedemos a identificar las mejores opciones entre las casas disponibles en la Zona Norte. Para ello, utilizamos un enfoque de similitud que considera múltiples criterios:
El puntaje de similitud se calcula ponderando las diferencias de la siguiente manera: - Área: Mayor ponderación (2), ya que es el predictor más importante - Estrato: Ponderación alta (3), por su fuerte efecto en el precio - Baños: Ponderación media (2), por su efecto significativo - Habitaciones: Ponderación baja (1), por no ser significativa - Parqueaderos: No se incluye en el score por su efecto marginal
| barrio | preciom | areaconst | estrato | banios | habitaciones | parqueaderos | score |
|---|---|---|---|---|---|---|---|
| los andes | 280 | 180 | 4 | 3 | 4 | 2 | 0.80 |
| zona norte | 265 | 162 | 4 | 3 | 4 | 1 | 1.52 |
| acopi | 280 | 180 | 4 | 3 | 3 | 2 | 1.80 |
| la merced | 320 | 200 | 4 | 4 | 4 | 2 | 2.00 |
| versalles | 271 | 226 | 4 | 3 | 3 | 2 | 2.04 |
Oferta 1: Los Andes Esta propiedad presenta el score más bajo (0.80), lo que indica que es la más similar a lo solicitado. Ubicada en el barrio Los Andes, tiene un precio de 280 millones, área de 180 m², estrato 4, 3 baños, 4 habitaciones y 2 parqueaderos. Aunque el área es 20 m² menor a la solicitada, el precio es significativamente menor que el presupuesto (70 millones por debajo), lo que deja un amplio margen para negociación o gastos adicionales. La combinación de estrato 4 y el número de baños y habitaciones exactamente como se solicitan la convierten en la candidata ideal.
Oferta 2: Zona Norte Esta propiedad tiene un score de 1.52 y está ubicada en la Zona Norte. Presenta un precio de 265 millones, área de 162 m², estrato 4, 3 baños, 4 habitaciones y 1 parqueadero. Su principal diferencia con la oferta 1 es el área más reducida (38 m² menos que lo solicitado), aunque su precio es aún más bajo (85 millones por debajo del presupuesto). Esta opción podría ser atractiva si el comprador está dispuesto a sacrificar área a cambio de un precio significativamente menor.
Oferta 3: Acopi Con un score de 1.80, esta propiedad en el barrio Acopi tiene un precio de 280 millones, área de 180 m², estrato 4, 3 baños, 3 habitaciones y 2 parqueaderos. La principal diferencia es que tiene una habitación menos de las solicitadas (3 en lugar de 4), lo que se refleja en su score ligeramente mayor. Sin embargo, su precio es muy competitivo y mantiene las demás características solicitadas.
Oferta 4: La Merced Esta propiedad tiene un score de 2.00 y está ubicada en el barrio La Merced. Presenta un precio de 320 millones, área de 200 m² (exactamente la solicitada), estrato 4, 4 baños (uno más de lo solicitado), 4 habitaciones y 2 parqueaderos. Aunque el área y las habitaciones coinciden perfectamente con lo solicitado, el baño adicional incrementa ligeramente el precio y el score. Su precio de 320 millones deja un margen de 30 millones sobre el presupuesto, lo que la convierte en una opción viable aunque algo más costosa.
Oferta 5: Versalles Con un score de 2.04, esta propiedad en el barrio Versalles tiene un precio de 271 millones, área de 226 m² (26 m² más de lo solicitado), estrato 4, 3 baños, 3 habitaciones (una menos) y 2 parqueaderos. Aunque el área es mayor a la solicitada, el precio es razonable y la propiedad ofrece más espacio del requerido. La principal desventaja es que tiene una habitación menos, lo que podría no ser aceptable para una familia de 4 personas.
Para facilitar la visualización y comparación de las ofertas, generamos un mapa interactivo que muestra la ubicación de las 5 propiedades seleccionadas.
# Obtener coordenadas de las ofertas seleccionadas
ofertas1_coords <- base1_imputada %>%
filter(preciom <= 350) %>%
mutate(
diff_area = abs(areaconst - 200),
diff_estrato = abs(estrato - 4),
diff_banios = abs(banios - 3),
diff_habitaciones = abs(habitaciones - 4),
score = (diff_area / 50) * 2 +
diff_estrato * 3 +
diff_banios * 2 +
diff_habitaciones * 1
) %>%
arrange(score) %>%
head(5)
# Mapa interactivo
leaflet(ofertas1_coords) %>%
addTiles() %>%
addCircleMarkers(
lng = ~longitud,
lat = ~latitud,
radius = 8,
color = ~case_when(
score == min(score) ~ "#00B4D8", # Mejor opción en azul
TRUE ~ "#FF6B6B" # Alternativas en rojo
),
fillOpacity = 0.8,
popup = ~paste(
"<b>", barrio, "</b><br>",
"Precio: $", preciom, "M<br>",
"Área: ", areaconst, "m²<br>",
"Estrato: ", estrato, "<br>",
"Baños: ", banios, "<br>",
"Habitaciones: ", habitaciones, "<br>",
"Score: ", round(score, 2)
),
label = ~paste(barrio, "- $", preciom, "M"),
labelOptions = labelOptions(noHide = FALSE)
) %>%
addControl(
html = "<h4 style='background:white;padding:8px;'>🏠 Ofertas Recomendadas - Vivienda 1</h4>",
position = "topright"
) %>%
addLegend(
colors = c("#00B4D8", "#FF6B6B"),
labels = c("Mejor Opción", "Alternativas"),
position = "bottomright"
)Priorizar Los Andes como primera opción, ya que esta propiedad ofrece la mejor combinación de características similares a lo solicitado y un precio muy por debajo del presupuesto. El margen de 70 millones permite una negociación favorable y cubrir gastos adicionales. Asimismo, considerar la Zona Norte como segunda opción. Si la primera opción no está disponible, esta propiedad ofrece un precio aún más bajo (265 millones) a cambio de un área más reducida (162 m²). Podría ser adecuada si el comprador valora más el ahorro que el espacio.
Evaluar La Merced si se prioriza el área, debido a que si el área de 200 m² es un requisito indispensable, esta propiedad es la única que cumple exactamente con esa característica, aunque tiene un baño adicional y un precio más alto (320 millones). De la misma maneera visitar las propiedades al menos las 3 primeras opciones para evaluar aspectos no capturados por el modelo, como la calidad de los acabados, la iluminación natural y el estado de conservación.
Verificar la ubicación exacta, aunque todas las propiedades están en la Zona Norte, es importante verificar su ubicación específica, considerando la cercanía a vías principales, centros comerciales y colegios, factores que el modelo no captura pero que son importantes para la calidad de vida.
Para atender la segunda solicitud, necesitamos enfocarnos exclusivamente en apartamentos ubicados en la Zona Sur de Cali. Este filtro es fundamental porque nos permite construir un modelo específico para este segmento del mercado inmobiliario.
## Registros obtenidos: 2787
## Tipos de propiedad: Apartamento
## Zonas incluidas: Zona Sur
Como resultado del filtro, obtenemos 2,787 registros que corresponden exclusivamente a apartamentos ubicados en la Zona Sur.
##
## Apartamento
## 2787
##
## Zona Sur
## 2787
## Tipos únicos en base2: Apartamento
## Zonas únicas en base2: Zona Sur
Todos los registros en base2 son apartamentos y todas están ubicadas en la Zona Sur. No existen propiedades de otros tipos ni de otras zonas en este subconjunto.
## preciom areaconst estrato banios habitaciones parqueaderos
## 0 0 0 0 0 406
## Total de registros: 2787
## Registros con parqueaderos NA: 406
## Proporción de faltantes: 14.6 %
##
## 1 2 3 4 10 <NA>
## 1551 718 79 31 2 406
En este caso, El análisis de datos faltantes revela que en la base de apartamentos en la Zona Sur, las variables preciom, areaconst, estrato, banios y habitaciones no presentan valores NA. Sin embargo, la variable parqueaderos muestra 406 valores faltantes, lo que representa aproximadamente el 14.6% de los registros. Esta proporción es [menor/mayor] que la observada en la base de casas de la Zona Norte. Aplicaremos el mismo criterio de imputación: reemplazar los valores faltantes con la mediana (2 parqueaderos), que es el valor más frecuente en los casos donde la información está disponible.
## [1] 0
La matriz de correlación para los apartamentos en la Zona Sur revela relaciones significativamente más fuertes que las observadas en las casas de la Zona Norte, lo que sugiere que el mercado de apartamentos en esta zona presenta patrones más definidos y predecibles. La correlación más fuerte se observa entre el área construida y el precio, con un coeficiente de 0.76, ligeramente superior al 0.69 observado en la Zona Norte. Esto indica que el área construida es incluso un predictor más determinante para los apartamentos en la Zona Sur que para las casas en la Zona Norte.
El estrato socioeconómico muestra una correlación de 0.67 con el precio, también superior al 0.53 observado en la Zona Norte. Esto sugiere que en la Zona Sur, la ubicación socioeconómica tiene un peso aún más importante en la determinación del precio de los apartamentos, posiblemente porque la Zona Sur presenta una mayor heterogeneidad en términos de calidad de los barrios y acceso a servicios.
El número de baños presenta una correlación sorprendentemente alta con el precio, alcanzando 0.72, lo que la convierte en la segunda variable más correlacionada con el precio después del área construida. Este valor es considerablemente superior al 0.51 observado en la Zona Norte, lo que indica que en los apartamentos de la Zona Sur, contar con más baños es un factor mucho más valorado que en las casas de la Zona Norte. Esto podría deberse a que los apartamentos suelen tener espacios más reducidos, por lo que un baño adicional representa una mejora significativa en la funcionalidad y el confort.
El número de parqueaderos muestra una correlación de 0.54 con el precio, también superior al 0.41 observado en la Zona Norte. Esto sugiere que en la Zona Sur, el parqueadero es más valorado que en la Norte, posiblemente porque en esta zona el espacio para estacionamiento es más limitado o porque los compradores de apartamentos en la Zona Sur valoran más la comodidad de tener un parqueadero exclusivo.
En contraste, el número de habitaciones presenta la correlación más baja con el precio, con solo 0.33, inferior incluso al 0.37 observado en la Zona Norte. Esto indica que, al igual que en la Zona Norte, el número de habitaciones no es un factor determinante en el precio de los apartamentos en la Zona Sur.
El gráfico de dispersión para apartamentos en la Zona Sur muestra una relación positiva y bastante clara entre el área construida y el precio, con una tendencia ascendente bien definida. Al igual que en la Zona Norte, las propiedades de estrato 6 (representadas en color púrpura) se concentran en la parte superior del gráfico, con precios que pueden superar los 1500 millones de pesos para áreas superiores a los 200 metros cuadrados. En contraste, las propiedades de estrato 3 (en color verde) se ubican en la parte inferior, con precios que rara vez superan los 500 millones, incluso para áreas de hasta 200 metros cuadrados. Esta clara separación por estratos confirma que el estrato socioeconómico es un determinante fundamental del precio en la Zona Sur, con un efecto incluso más pronunciado que en la Zona Norte. La dispersión de los puntos es menor que en la Zona Norte, lo que sugiere que el modelo para apartamentos en la Zona Sur podría tener un mejor ajuste que el modelo para casas en la Zona Norte.
##
## Call:
## lm(formula = preciom ~ areaconst + estrato + habitaciones + parqueaderos +
## banios, data = base2_imputada)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1233.80 -45.98 -2.05 42.25 927.76
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -314.61850 13.51614 -23.277 < 2e-16 ***
## areaconst 1.45139 0.04876 29.766 < 2e-16 ***
## estrato 68.93151 2.66560 25.860 < 2e-16 ***
## habitaciones -16.28835 3.41634 -4.768 1.96e-06 ***
## parqueaderos 51.59374 3.16010 16.327 < 2e-16 ***
## banios 49.11206 3.02770 16.221 < 2e-16 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 95.01 on 2781 degrees of freedom
## Multiple R-squared: 0.7544, Adjusted R-squared: 0.754
## F-statistic: 1709 on 5 and 2781 DF, p-value: < 2.2e-16
R² = 0.7544: Explica aproximadamente el 75.44% de la variabilidad en el precio de los apartamentos en la Zona Sur, significativamente superior al 65.48% observado en la Zona Norte.
R² Ajustado = 0.754: Prácticamente idéntico al R², lo que indica que el modelo no está sobreajustado.
Error estándar residual = 95.01 millones: Menor que los 158.2 millones observados en la Zona Norte, lo que indica predicciones más precisas.
Prueba F = 1709 con p < 2.2e-16: Altamente significativa, confirmando que el modelo es útil para predecir precios.
Coeficientes
Área construida: El coeficiente es de 1.45 millones de pesos por metro cuadrado, con un valor p < 2e-16, altamente significativo. Esto significa que, manteniendo todas las demás variables constantes, por cada metro cuadrado adicional de área construida, el precio del apartamento aumenta en 1.45 millones de pesos. Este valor es casi el doble del observado en la Zona Norte (0.81 millones/m²), lo que indica que en la Zona Sur, el área tiene un efecto mucho más pronunciado sobre el precio de los apartamentos.
Estrato: El coeficiente es de 68.93 millones de pesos por nivel de estrato, con un valor p < 2e-16. Esto significa que, manteniendo las demás variables constantes, por cada nivel de estrato que aumente la propiedad, el precio se incrementa en aproximadamente 68.93 millones de pesos. Este valor es ligeramente menor que el observado en la Zona Norte (84.61 millones), lo que indica que el estrato tiene un peso ligeramente menor en la Zona Sur para los apartamentos.
Baños: El coeficiente es de 49.11 millones de pesos por baño adicional, con un valor p < 2e-16. Esto significa que, manteniendo las demás variables constantes, por cada baño adicional que tenga el apartamento, el precio aumenta en aproximadamente 49.11 millones de pesos. Este valor es aproximadamente el doble del observado en la Zona Norte (24.58 millones), confirmando que los baños son mucho más valorados en los apartamentos de la Zona Sur.
Parqueaderos: El coeficiente es de 51.59 millones de pesos por parqueadero adicional, con un valor p < 2e-16. Esto significa que, manteniendo las demás variables constantes, por cada parqueadero adicional, el precio aumenta en aproximadamente 51.59 millones de pesos. Este valor es más del triple del observado en la Zona Norte (16.56 millones), lo que indica que en la Zona Sur, contar con parqueadero es extremadamente valorado, posiblemente porque el espacio para estacionamiento es más escaso.
Habitaciones: El coeficiente es de -16.29 millones de pesos por habitación adicional, con un valor p de 1.96e-06, altamente significativo. Sorprendentemente, el coeficiente es negativo, lo que indica que, manteniendo las demás variables constantes, por cada habitación adicional, el precio del apartamento disminuye en aproximadamente 16.29 millones de pesos. Este resultado, aunque contraintuitivo, tiene una explicación lógica: en los apartamentos, un mayor número de habitaciones puede implicar habitaciones más pequeñas y menos espacio común, lo que podría reducir el valor percibido. Alternativamente, podría ser un reflejo de que los apartamentos con más habitaciones tienden a ser más antiguos o están ubicados en zonas menos deseables dentro de la Zona Sur.
##
## Shapiro-Wilk normality test
##
## data: residuals(modelo2)[1:5000]
## W = 0.79864, p-value < 2.2e-16
##
## studentized Breusch-Pagan test
##
## data: modelo2
## BP = 929.2, df = 5, p-value < 2.2e-16
## areaconst estrato habitaciones parqueaderos banios
## 2.027751 1.555176 1.441342 1.310740 2.470269
La validación de supuestos para el modelo de apartamentos en la Zona Sur muestra resultados similares a los observados en la Zona Norte. La prueba de Shapiro-Wilk arroja un estadístico W de 0.79864 con un valor p < 2.2e-16, lo que indica que rechazamos la hipótesis nula de normalidad de los residuos. La prueba de Breusch-Pagan muestra un estadístico BP = 929.2 con un valor p < 2.2e-16, lo que indica presencia de heterocedasticidad. Los valores de VIF para todas las variables son inferiores a 2.5, con un máximo de 2.47 para banios, lo que indica que no hay problemas de multicolinealidad. A pesar de estas violaciones, el modelo tiene un excelente poder explicativo (R² = 0.754) y un error estándar residual bajo (95.01 millones), lo que lo hace útil para predicciones.
Con el fin de mejorar el modelo se realizan las siguientes sugerencias:
Transformación logarítmica de la variable respuesta: Aplicar log(precio) podría mejorar significativamente la normalidad de los residuos y estabilizar la varianza. Dado que la violación de normalidad es más severa en este modelo (W = 0.79864), esta transformación podría ser particularmente beneficiosa.
Errores estándar robustos: Dado que se ha detectado heterocedasticidad severa (BP = 929.2), se recomienda utilizar errores estándar robustos (HC) para corregir las inferencias estadísticas. Esto permitiría mantener el modelo en su escala original mientras se corrigen los problemas de inferencia.
Inclusión de términos polinómicos: Agregar términos como areaconst² podría capturar relaciones no lineales que el modelo lineal actual está ignorando, especialmente considerando la alta influencia del área en el precio de los apartamentos en la Zona Sur.
Considerar la interacción entre variables: Dado que el área y los baños tienen efectos tan fuertes en la Zona Sur, explorar interacciones como areaconst * banios podría revelar si el efecto del área sobre el precio varía según el número de baños.
Eliminación de valores atípicos: El gráfico de residuos vs apalancamiento muestra algunos puntos con alta influencia. Investigar estas observaciones para determinar si representan errores en los datos y, en caso afirmativo, eliminarlos podría mejorar el ajuste del modelo.
Modelos alternativos: Considerar modelos de regresión robusta o modelos lineales generalizados que no asuman normalidad de los errores podría ser apropiado dado la severidad de la violación de este supuesto.
## === PREDICCIÓN PARA VIVIENDA 2 ===
## Características:
## - Área: 300 m²
## - Estrato: 5
## - Habitaciones: 5
## - Parqueaderos: 3
## - Baños: 2
## Precio estimado: $ 637.02 millones
## Intervalo de predicción (95%):
## - Límite inferior: $ 449.17 millones
## - Límite superior: $ 824.87 millones
## Presupuesto disponible: $850 millones
## ¿Dentro del presupuesto? SÍ ✓
La predicción para la Vivienda 2 muestra que un apartamento en la Zona Sur con 300 m², estrato 5, 5 habitaciones, 3 parqueaderos y 2 baños tendría un precio estimado de 637.02 millones de pesos. El intervalo de predicción del 95% indica que, con un 95% de confianza, el precio real de un apartamento con estas características se encontraría entre 449.17 y 824.87 millones de pesos.
Este precio estimado se encuentra significativamente por debajo del presupuesto de 850 millones, con un margen de 212.98 millones de pesos. Este amplio margen sugiere que María tiene un presupuesto amplio para encontrar una propiedad que cumpla con las características solicitadas, e incluso podría considerar opciones con características superiores (como estrato 6 o un baño adicional) que aún podrían ajustarse al presupuesto disponible.
El intervalo de predicción, que va desde 449.17 hasta 824.87 millones, muestra que incluso en el escenario más pesimista (límite superior), el precio máximo estimado se encuentra dentro del presupuesto de 850 millones. Esto brinda una seguridad adicional a María, ya que prácticamente cualquier apartamento con estas características en la Zona Sur debería poder adquirirse dentro del presupuesto disponible.
## === 5 MEJORES OFERTAS PARA VIVIENDA 2 ===
## Presupuesto: $850 millones
Las 5 ofertas seleccionadas representan las mejores opciones disponibles dentro del presupuesto de 850 millones, ordenadas por su puntaje de similitud. A continuación, analizamos cada una de ellas:
Oferta 1: Capri Esta propiedad presenta el score más bajo (4.20), lo que indica que es la más similar a lo solicitado. Ubicada en el barrio Capri, tiene un precio de 350 millones, área de 270 m², estrato 5, 3 baños, 4 habitaciones y 3 parqueaderos. Aunque el área es 30 m² menor a la solicitada, el precio es significativamente menor que el presupuesto (500 millones por debajo), lo que deja un amplio margen. La principal diferencia es que tiene una habitación menos de las solicitadas (4 en lugar de 5) y un baño adicional (3 en lugar de 2).
Oferta 2: Pampa Linda Con un score de 5.32, esta propiedad en el barrio Pampa Linda tiene un precio de 450 millones, área de 267 m², estrato 5, 3 baños, 3 habitaciones y 3 parqueaderos. Su principal diferencia es que tiene dos habitaciones menos de las solicitadas (3 en lugar de 5) y un baño adicional. Sin embargo, su precio es muy competitivo y mantiene las demás características.
Oferta 3: Capri Esta segunda propiedad en el barrio Capri tiene un score de 5.60, precio de 350 millones, área de 260 m², estrato 5, 3 baños, 3 habitaciones y 3 parqueaderos. Es similar a la oferta 1 pero con un área ligeramente menor y una habitación menos.
Oferta 4: Seminario Con un score de 7.00, esta propiedad en el barrio Seminario tiene un precio de 670 millones, área de 300 m² (exactamente la solicitada), estrato 5, 5 baños (tres más de lo solicitado), 6 habitaciones (una más) y 3 parqueaderos. Aunque el área y los parqueaderos coinciden perfectamente, el exceso de baños y habitaciones incrementa significativamente el precio.
Oferta 5: Cuarto de Legua Con un score de 7.18, esta propiedad en el barrio Cuarto de Legua tiene un precio de 410 millones, área de 295.55 m² (muy cercana a la solicitada), estrato 5, 4 baños (dos más), 4 habitaciones (una menos) y 2 parqueaderos (uno menos). Su principal desventaja es que tiene un parqueadero menos de lo solicitado.
## Número de ofertas con coordenadas: 5
## Registros sin coordenadas: 0
| id | barrio | preciom | areaconst | estrato | banios | habitaciones | parqueaderos | score | longitud | latitud |
|---|---|---|---|---|---|---|---|---|---|---|
| 6175 | capri | 350 | 270.00 | 5 | 3 | 4 | 3 | 4.200 | -76.54100 | 3.39200 |
| 7680 | pampa linda | 450 | 267.00 | 5 | 3 | 3 | 3 | 5.320 | -76.55117 | 3.40481 |
| 6205 | capri | 350 | 260.00 | 5 | 3 | 3 | 3 | 5.600 | -76.54134 | 3.38954 |
| 7512 | seminario | 670 | 300.00 | 5 | 5 | 6 | 3 | 7.000 | -76.55000 | 3.40900 |
| 8113 | cuarto de legua | 410 | 295.55 | 5 | 4 | 4 | 2 | 7.178 | -76.55527 | 3.40750 |
El mapa interactivo muestra la ubicación de las 5 ofertas seleccionadas en la Zona Sur de Cali. La mejor opción (marcada en azul) se encuentra en el barrio Capri, mientras que las alternativas (en verde) se distribuyen en diferentes barrios de la zona. Esta visualización permite a María evaluar no solo las características de cada propiedad, sino también su ubicación específica dentro de la Zona Sur, considerando factores como la cercanía a vías principales, centros comerciales y colegios.
# Crear tabla comparativa de modelos (versión simple)
comparacion_modelos <- data.frame(
Aspecto = c(
"Tamaño de muestra",
"R²",
"R² Ajustado",
"Error estándar residual",
"Prueba F",
"Área construida (M/m²)",
"Estrato (M/nivel)",
"Baños (M/baño)",
"Parqueaderos (M/parq)",
"Habitaciones (M/hab)",
"Normalidad (Shapiro-Wilk)",
"Heterocedasticidad (BP)",
"Multicolinealidad (VIF max)"
),
`Vivienda 1 (Casa, Zona Norte)` = c(
nrow(base1_imputada),
paste0(round(summary(modelo1)$r.squared, 4), " (", round(summary(modelo1)$r.squared*100, 2), "%)"),
round(summary(modelo1)$adj.r.squared, 4),
paste0(round(summary(modelo1)$sigma, 2), " M"),
paste0(round(summary(modelo1)$fstatistic[1], 1), " (p < 2.2e-16)"),
paste0(round(coef(modelo1)["areaconst"], 2), " ***"),
paste0(round(coef(modelo1)["estrato"], 2), " ***"),
paste0(round(coef(modelo1)["banios"], 2), " ***"),
paste0(round(coef(modelo1)["parqueaderos"], 2), " **"),
paste0(round(coef(modelo1)["habitaciones"], 2), " (n.s.)"),
"W = 0.834 (p < 2.2e-16)",
"BP = 132.24 (p < 2.2e-16)",
round(max(vif(modelo1)), 2)
),
`Vivienda 2 (Apartamento, Zona Sur)` = c(
nrow(base2_imputada),
paste0(round(summary(modelo2)$r.squared, 4), " (", round(summary(modelo2)$r.squared*100, 2), "%)"),
round(summary(modelo2)$adj.r.squared, 4),
paste0(round(summary(modelo2)$sigma, 2), " M"),
paste0(round(summary(modelo2)$fstatistic[1], 1), " (p < 2.2e-16)"),
paste0(round(coef(modelo2)["areaconst"], 2), " ***"),
paste0(round(coef(modelo2)["estrato"], 2), " ***"),
paste0(round(coef(modelo2)["banios"], 2), " ***"),
paste0(round(coef(modelo2)["parqueaderos"], 2), " ***"),
paste0(round(coef(modelo2)["habitaciones"], 2), " ***"),
"W = 0.799 (p < 2.2e-16)",
"BP = 929.2 (p < 2.2e-16)",
round(max(vif(modelo2)), 2)
),
check.names = FALSE
)
# Mostrar tabla
knitr::kable(comparacion_modelos,
caption = "Comparación de Modelos de Regresión Lineal Múltiple",
align = c("l", "l", "l"))| Aspecto | Vivienda 1 (Casa, Zona Norte) | Vivienda 2 (Apartamento, Zona Sur) |
|---|---|---|
| Tamaño de muestra | 722 | 2787 |
| R² | 0.6548 (65.48%) | 0.7544 (75.44%) |
| R² Ajustado | 0.6524 | 0.754 |
| Error estándar residual | 158.23 M | 95.01 M |
| Prueba F | 271.6 (p < 2.2e-16) | 1708.8 (p < 2.2e-16) |
| Área construida (M/m²) | 0.81 *** | 1.45 *** |
| Estrato (M/nivel) | 84.61 *** | 68.93 *** |
| Baños (M/baño) | 24.58 *** | 49.11 *** |
| Parqueaderos (M/parq) | 16.56 ** | 51.59 *** |
| Habitaciones (M/hab) | 0.96 (n.s.) | -16.29 *** |
| Normalidad (Shapiro-Wilk) | W = 0.834 (p < 2.2e-16) | W = 0.799 (p < 2.2e-16) |
| Heterocedasticidad (BP) | BP = 132.24 (p < 2.2e-16) | BP = 929.2 (p < 2.2e-16) |
| Multicolinealidad (VIF max) | 1.92 | 2.47 |
La comparación revela diferencias sustanciales entre ambos mercados. El modelo de la Zona Sur tiene un poder explicativo significativamente mayor (75.44% vs 65.48%) y un error estándar mucho menor (95.01 M vs 158.2 M), lo que indica que el mercado de apartamentos en la Zona Sur es más homogéneo y predecible que el de casas en la Zona Norte. Esto puede deberse a que los apartamentos tienden a ser más estandarizados en sus características, mientras que las casas presentan una mayor variabilidad en términos de diseño, acabados y ubicación específica dentro de la zona.
En cuanto a los coeficientes, se observan diferencias notables. El área construida tiene un efecto casi el doble en la Zona Sur (1.45 M/m² vs 0.81 M/m²), lo que indica que en los apartamentos cada metro cuadrado adicional es mucho más valorado. Los baños y parqueaderos también tienen un efecto mucho más pronunciado en la Zona Sur (49.11 M vs 24.58 M para baños; 51.59 M vs 16.56 M para parqueaderos). Por el contrario, el estrato tiene un efecto ligeramente mayor en la Zona Norte (84.61 M vs 68.93 M).
El hallazgo más sorprendente es el coeficiente negativo de las habitaciones en la Zona Sur (-16.29 M), que contrasta con la no significancia de esta variable en la Zona Norte. Esto sugiere que en los apartamentos de la Zona Sur, un mayor número de habitaciones podría estar asociado con espacios más reducidos y menos área común, lo que reduce el valor percibido por los compradores. En la Zona Norte, en cambio, el número de habitaciones simplemente no es un factor determinante del precio.
El análisis de regresión lineal múltiple permitió modelar el precio de viviendas en dos segmentos del mercado de Cali: casas en la Zona Norte y apartamentos en la Zona Sur. Ambos modelos resultaron estadísticamente significativos y útiles para la toma de decisiones, aunque con diferencias importantes en su poder explicativo y en los factores que determinan el precio en cada zona.
Para la Vivienda 1 (casa en Zona Norte), el modelo explica el 65.48% de la variabilidad del precio (R² = 0.6548), con un error estándar de 158.2 millones. Las variables significativas fueron área construida, estrato, baños y parqueaderos. El precio estimado para las características solicitadas es de 343.7 millones, ligeramente por debajo del presupuesto de 350 millones. Se identificaron 5 ofertas potenciales, destacando una en el barrio Los Andes con un precio de 280 millones que deja un margen de 70 millones para negociación.
Para la Vivienda 2 (apartamento en Zona Sur), el modelo tiene un mejor ajuste, explicando el 75.44% de la variabilidad (R² = 0.7544), con un error estándar de 95.01 millones. Todas las variables resultaron significativas, incluyendo las habitaciones con un coeficiente negativo (-16.29 millones). El precio estimado para las características solicitadas es de 637.02 millones, muy por debajo del presupuesto de 850 millones. La mejor oferta identificada se encuentra en el barrio Capri, con un precio de 350 millones que deja un margen de 500 millones.
La diferencia más relevante es que el mercado de apartamentos en la Zona Sur es más predecible y homogéneo, con un R² superior en 10 puntos porcentuales y un error estándar 63 millones menor. En la Zona Sur, el área, los baños y los parqueaderos tienen un efecto mucho más pronunciado sobre el precio que en la Zona Norte. El coeficiente negativo de las habitaciones en la Zona Sur sugiere que, en apartamentos, un mayor número de habitaciones puede implicar espacios más reducidos, lo que reduce el valor percibido.
Ambos modelos presentan violaciones de normalidad y heterocedasticidad, comunes en modelos de precios de vivienda. Para futuros análisis se recomienda considerar transformaciones logarítmicas o errores estándar robustos. Adicionalmente, el modelo no incluye variables como antigüedad, calidad de acabados o cercanía a equipamientos, lo que limita su precisión en casos particulares.
Vivienda 1 (Casa, Zona Norte, $350 M)
Vivienda 2 (Apartamento, Zona Sur, $850 M)