El mercado inmobiliario urbano se caracteriza por la interacción de múltiples factores relacionados con las características físicas, económicas y espaciales de las viviendas. El análisis de estas características permite identificar patrones en la oferta y generar información útil para apoyar procesos de valoración, segmentación y toma de decisiones estratégicas.
En este trabajo se analiza una base de datos correspondiente a viviendas ubicadas en la ciudad de Cali, Colombia. El conjunto de datos contiene información sobre variables como zona, estrato socioeconómico, precio, área construida, número de parqueaderos, baños, habitaciones, tipo de vivienda, barrio y ubicación geográfica.
El propósito del análisis es obtener una visión integral de la oferta inmobiliaria mediante diferentes técnicas estadísticas multivariadas. Para ello, se aplicará un Análisis de Componentes Principales (PCA), un análisis de conglomerados y un análisis de correspondencias. Adicionalmente, se utilizarán herramientas de visualización para facilitar la interpretación de los resultados y analizar la distribución espacial de las propiedades.
Los resultados permitirán identificar las principales características que explican la variabilidad de las viviendas, establecer segmentos de propiedades con características similares y estudiar las relaciones existentes entre las variables categóricas asociadas con la oferta inmobiliaria.
La base de datos utilizada en este estudio corresponde al conjunto de datos vivienda, incluido en el paquete paqueteMODELOS. Esta base contiene información sobre la oferta de viviendas de la ciudad de Cali y permite analizar diferentes características relacionadas con el precio, las condiciones físicas, el tipo de vivienda y su ubicación.
## [1] 8322 13
La base de datos está conformada por 8.322 observaciones y 13 variables.
Las 13 variables disponibles en la base son:
names(vivienda)
## [1] "id" "zona" "piso" "estrato" "preciom"
## [6] "areaconst" "parqueaderos" "banios" "habitaciones" "tipo"
## [11] "barrio" "longitud" "latitud"
str(vivienda)
## spc_tbl_ [8,322 × 13] (S3: spec_tbl_df/tbl_df/tbl/data.frame)
## $ id : num [1:8322] 1147 1169 1350 5992 1212 ...
## $ zona : chr [1:8322] "Zona Oriente" "Zona Oriente" "Zona Oriente" "Zona Sur" ...
## $ piso : chr [1:8322] NA NA NA "02" ...
## $ estrato : num [1:8322] 3 3 3 4 5 5 4 5 5 5 ...
## $ preciom : num [1:8322] 250 320 350 400 260 240 220 310 320 780 ...
## $ areaconst : num [1:8322] 70 120 220 280 90 87 52 137 150 380 ...
## $ parqueaderos: num [1:8322] 1 1 2 3 1 1 2 2 2 2 ...
## $ banios : num [1:8322] 3 2 2 5 2 3 2 3 4 3 ...
## $ habitaciones: num [1:8322] 6 3 4 3 3 3 3 4 6 3 ...
## $ tipo : chr [1:8322] "Casa" "Casa" "Casa" "Casa" ...
## $ barrio : chr [1:8322] "20 de julio" "20 de julio" "20 de julio" "3 de julio" ...
## $ longitud : num [1:8322] -76.5 -76.5 -76.5 -76.5 -76.5 ...
## $ latitud : num [1:8322] 3.43 3.43 3.44 3.44 3.46 ...
## - attr(*, "spec")=List of 3
## ..$ cols :List of 13
## .. ..$ id : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ zona : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
## .. ..$ piso : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
## .. ..$ estrato : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ preciom : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ areaconst : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ parqueaderos: list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ banios : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ habitaciones: list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ tipo : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
## .. ..$ barrio : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
## .. ..$ longitud : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## .. ..$ latitud : list()
## .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
## ..$ default: list()
## .. ..- attr(*, "class")= chr [1:2] "collector_guess" "collector"
## ..$ delim : chr ";"
## ..- attr(*, "class")= chr "col_spec"
## - attr(*, "problems")=<pointer: (nil)>
La estructura de la base muestra que algunas variables están almacenadas como datos numéricos (num), mientras que otras se encuentran almacenadas como caracteres (chr). Sin embargo, el tipo de almacenamiento en R no necesariamente coincide con la naturaleza estadística de la variable. Por ejemplo, estrato está almacenada como numérica, pero representa categorías ordenadas de nivel socioeconómico, por lo que se considera una variable cualitativa ordinal.
Para facilitar la interpretación de la información disponible, las variables se clasifican de acuerdo con su naturaleza estadística y el tipo de dato con el que se encuentran almacenadas en R.
| Variable | Descripcion | Tipo_R | Tipo_variable |
|---|---|---|---|
| id | Identificador de la vivienda | Numérica | Identificadora |
| zona | Zona geográfica donde se encuentra la vivienda | Carácter | Cualitativa nominal |
| piso | Piso en el que se encuentra la vivienda | Carácter | Cualitativa ordinal |
| estrato | Estrato socioeconómico | Numérica | Cualitativa ordinal |
| preciom | Precio de la vivienda | Numérica | Cuantitativa continua |
| areaconst | Área construida de la vivienda | Numérica | Cuantitativa continua |
| parqueaderos | Número de parqueaderos | Numérica | Cuantitativa discreta |
| banios | Número de baños | Numérica | Cuantitativa discreta |
| habitaciones | Número de habitaciones | Numérica | Cuantitativa discreta |
| tipo | Tipo de vivienda | Carácter | Cualitativa nominal |
| barrio | Barrio donde se encuentra la vivienda | Carácter | Cualitativa nominal |
| longitud | Longitud geográfica | Numérica | Cuantitativa continua |
| latitud | Latitud geográfica | Numérica | Cuantitativa continua |
Las variables cuantitativas proporcionan información sobre las características físicas y económicas de las viviendas, mientras que las variables cualitativas permiten estudiar la composición y distribución de la oferta según categorías como la zona, el tipo de vivienda y el barrio.
En particular, preciom y areaconst son variables cuantitativas continuas, mientras que parqueaderos, banios y habitaciones son variables cuantitativas discretas, debido a que representan conteos. Por otra parte, zona, tipo y barrio son variables cualitativas nominales. estrato se considera cualitativa ordinal, debido a que sus categorías representan niveles socioeconómicos ordenados.
La variable id, aunque aparece almacenada como numérica, cumple únicamente una función de identificación de cada registro y, por esta razón, no será utilizada como variable explicativa en los análisis multivariados.
Finalmente, longitud y latitud corresponden a coordenadas geográficas. Estas variables serán utilizadas posteriormente para representar espacialmente la oferta inmobiliaria.
Principalmente se realiza una analisis exploratorio a la data, para ver observar posibles problemas enla calidad de los datos y asi realizar su debida limpieza si es necesario, ademas de observar la distribuccion de las variables.
Se presentan las primeras observaciones de la base de datos con el propósito de verificar la estructura de los registros y obtener una primera aproximación a la información disponible.
## # A tibble: 6 × 13
## id zona piso estrato preciom areaconst parqueaderos banios habitaciones
## <dbl> <chr> <chr> <dbl> <dbl> <dbl> <dbl> <dbl> <dbl>
## 1 1147 Zona O… <NA> 3 250 70 1 3 6
## 2 1169 Zona O… <NA> 3 320 120 1 2 3
## 3 1350 Zona O… <NA> 3 350 220 2 2 4
## 4 5992 Zona S… 02 4 400 280 3 5 3
## 5 1212 Zona N… 01 5 260 90 1 2 3
## 6 1724 Zona N… 01 5 240 87 1 3 3
## # ℹ 4 more variables: tipo <chr>, barrio <chr>, longitud <dbl>, latitud <dbl>
La identificación de valores faltantes es importante dentro del análisis exploratorio, pues permite evaluar la calidad de la información disponible y determinar si es necesario realizar algún tratamiento antes de aplicar las técnicas estadísticas multivariadas.
## id zona piso estrato preciom areaconst
## 3 3 2638 3 2 3
## parqueaderos banios habitaciones tipo barrio longitud
## 1605 3 3 3 3 3
## latitud
## 3
Porcentajes de los faltantes
## id zona piso estrato preciom areaconst
## 0.04 0.04 31.70 0.04 0.02 0.04
## parqueaderos banios habitaciones tipo barrio longitud
## 19.29 0.04 0.04 0.04 0.04 0.04
## latitud
## 0.04
Para una mejor viasualización de los resultados se presenta la siguiente tabla:
| Variable | Faltantes | Porcentaje |
|---|---|---|
| id | 3 | 0.04 |
| zona | 3 | 0.04 |
| piso | 2638 | 31.70 |
| estrato | 3 | 0.04 |
| preciom | 2 | 0.02 |
| areaconst | 3 | 0.04 |
| parqueaderos | 1605 | 19.29 |
| banios | 3 | 0.04 |
| habitaciones | 3 | 0.04 |
| tipo | 3 | 0.04 |
| barrio | 3 | 0.04 |
| longitud | 3 | 0.04 |
| latitud | 3 | 0.04 |
La variable parqueaderos presenta 1.605 valores
faltantes, equivalentes al 19,29 % de las observaciones. Debido a que la
documentación de la base no establece que estos valores representen
ausencia de parqueaderos, no se interpretaron los valores faltantes como
cero.
Dado que parqueaderos será utilizada posteriormente en
el análisis de componentes principales y en el análisis de
conglomerados, se realizó una imputación mediante la mediana de los
valores observados. La mediana corresponde a 2 parqueaderos y permite
conservar las observaciones disponibles sin asumir que los valores
faltantes representan una categoría específica.
Por otra parte, la variable piso presenta 2.638 valores
faltantes (31,70 %). Esta variable no se imputará en este momento,
debido a que no será utilizada como variable cuantitativa en el análisis
de componentes principales ni en el análisis de conglomerados. Sin
embargo, se conservará en la base para posibles análisis
posteriores.
## [1] 0
colSums(is.na(vivienda_limpia))
## id zona piso estrato preciom areaconst
## 3 3 2638 3 2 3
## parqueaderos banios habitaciones tipo barrio longitud
## 0 3 3 3 3 3
## latitud
## 3
Asimismo, se realiza el tratamiento de faltantes para las variables que tienen entre 2 y 3 faltantes, donde se eliminan debido a que representan menos del 0,5% de la data, por lo que no afecta el tamaño de la muestra.
## [1] 8319 13
## preciom areaconst parqueaderos banios habitaciones
## 0 0 0 0 0
Como resultado del tratamiento de los valores faltantes, la base analítica pasó de 8.322 a 8.319 observaciones. La reducción corresponde únicamente a tres registros que presentaban valores faltantes en las variables cuantitativas seleccionadas para el análisis multivariado.
Finalmente, se verificó que las cinco variables seleccionadas para
estos análisis (preciom, areaconst,
parqueaderos, banios y
habitaciones) no presentan valores faltantes en la base
analítica.
## [1] 0
Como se observa en el resultado la base de datos, no se encontraron registros duplicados, por lo que no es necesario realizar alguna eliminación adicional.
En esta etapa se observara como se comportan las variables.
## preciom areaconst parqueaderos banios
## Min. : 58.0 Min. : 30.0 Min. : 1.000 Min. : 0.000
## 1st Qu.: 220.0 1st Qu.: 80.0 1st Qu.: 1.000 1st Qu.: 2.000
## Median : 330.0 Median : 123.0 Median : 2.000 Median : 3.000
## Mean : 433.9 Mean : 174.9 Mean : 1.867 Mean : 3.111
## 3rd Qu.: 540.0 3rd Qu.: 229.0 3rd Qu.: 2.000 3rd Qu.: 4.000
## Max. :1999.0 Max. :1745.0 Max. :10.000 Max. :10.000
## habitaciones
## Min. : 0.000
## 1st Qu.: 3.000
## Median : 3.000
## Mean : 3.605
## 3rd Qu.: 4.000
## Max. :10.000
| Variable | Media | Mediana | Desviacion | Minimo | Maximo |
|---|---|---|---|---|---|
| Precio (millones de pesos) | 433.90 | 330 | 328.67 | 58 | 1999 |
| Área construida (m²) | 174.93 | 123 | 142.96 | 30 | 1745 |
| Parqueaderos | 1.87 | 2 | 1.01 | 1 | 10 |
| Baños | 3.11 | 3 | 1.43 | 0 | 10 |
| Habitaciones | 3.61 | 3 | 1.46 | 0 | 10 |
Los resultados muestran diferencias importantes en la distribución de las características de las viviendas. El precio presenta una media de 433,90 millones de pesos y una mediana de 330 millones, lo que indica una diferencia considerable entre ambas medidas. Esto sugiere una distribución con valores elevados que incrementan el promedio, situación que puede estar relacionada con la presencia de viviendas de precios altos.
El área construida presenta un comportamiento similar. La media es de 174,93 m², mientras que la mediana es de 123 m². La diferencia entre ambas medidas indica una distribución con viviendas de áreas considerablemente superiores al valor central observado. El rango también es amplio, desde 30 m² hasta 1.745 m².
En cuanto al número de parqueaderos, las viviendas presentan una media de 1,87 y una mediana de 2, con valores entre 1 y 10. Esto indica que la oferta se concentra principalmente alrededor de uno o dos parqueaderos por vivienda.
En conjunto, los resultados evidencian una importante heterogeneidad en la oferta inmobiliaria, especialmente en el precio y el área construida. Esta variabilidad justifica la aplicación posterior de técnicas multivariadas como el análisis de componentes principales y el análisis de conglomerados, con el propósito de identificar las principales dimensiones de variación y segmentar las viviendas según sus características.
Sin embargo, durante la revisión de los estadísticos descriptivos se
identificaron valores de cero en las variables banios y
habitaciones. La inspección de estos registros mostró casos
como viviendas con varios baños pero cero habitaciones, así como
viviendas de áreas considerablemente grandes con cero baños y
habitaciones. Debido a que estos valores no resultan consistentes con
las características esperadas de una vivienda, se consideraron como
valores no válidos y se realizara la transformación en valores
faltantes.
Posteriormente, los valores faltantes de banios y
habitaciones seran imputados mediante la mediana de cada
variable. Esta estrategia permite conservar las observaciones y reducir
la influencia de valores extremos sobre las medidas de tendencia
central.
Dimensiones finales de la base
## [1] 8319 13
Despues del tratamiento se puede observar que el minimo para balos y habitaciones ahora es 1, lo cual, es razonable en la perspectiva de una vivienda y el número de registros se mantiene, sin perder información que puede ser importante en el análisis.
## preciom areaconst parqueaderos banios
## Min. : 58.0 Min. : 30.0 Min. : 1.000 Min. : 1.000
## 1st Qu.: 220.0 1st Qu.: 80.0 1st Qu.: 1.000 1st Qu.: 2.000
## Median : 330.0 Median : 123.0 Median : 2.000 Median : 3.000
## Mean : 433.9 Mean : 174.9 Mean : 1.867 Mean : 3.128
## 3rd Qu.: 540.0 3rd Qu.: 229.0 3rd Qu.: 2.000 3rd Qu.: 4.000
## Max. :1999.0 Max. :1745.0 Max. :10.000 Max. :10.000
## habitaciones
## Min. : 1.000
## 1st Qu.: 3.000
## Median : 3.000
## Mean : 3.629
## 3rd Qu.: 4.000
## Max. :10.000
Para complementar los estadísticos descriptivos, se analizará la distribución de las variables cuantitativas mediante histogramas.
Los histogramas permiten observar la distribución de las cinco variables
cuantitativas analizadas. El precio y el área construida presentan
distribuciones asimétricas con sesgo positivo, concentrando la mayoría
de las observaciones en valores bajos y presentando una cola extendida
hacia valores elevados. Esta asimetría explica la diferencia observada
entre la media y la mediana en ambas variables.
Por su parte, el número de parqueaderos, baños y habitaciones presentan distribuciones con una mayor concentración en valores específicos: la mayoría de las viviendas tienen entre 1 y 2 parqueaderos, entre 2 y 3 baños, y entre 3 y 4 habitaciones. Esta información complementa los estadísticos descriptivos y confirma la heterogeneidad de la oferta inmobiliaria analizada.
Se realiza la distribucción para las variables categóricas
Zona
| Categoria | Frecuencia | Porcentaje |
|---|---|---|
| Zona Centro | 124 | 1.49 |
| Zona Norte | 1920 | 23.08 |
| Zona Oeste | 1198 | 14.40 |
| Zona Oriente | 351 | 4.22 |
| Zona Sur | 4726 | 56.81 |
En cuanto a la zona, se observa una marcada concentración de la oferta en la Zona Sur, que representa el 56,81 % de las viviendas analizadas, seguida por la Zona Norte con 23,08 % y la Zona Oeste con 14,40 %. Las zonas Oriente y Centro presentan una participación considerablemente menor, con 4,22 % y 1,49 %, respectivamente.
Tipo de vivienda
| Categoria | Frecuencia | Porcentaje |
|---|---|---|
| Apartamento | 5100 | 61.31 |
| Casa | 3219 | 38.69 |
En el tipo de vivienda, los apartamentos representan el 61,31 % de las observaciones, mientras que las casas corresponden al 38,69 %. Esto indica un predominio de la oferta de apartamentos dentro de la base analizada.
Estrato
| Categoria | Frecuencia | Porcentaje |
|---|---|---|
| 3 | 1453 | 17.47 |
| 4 | 2129 | 25.59 |
| 5 | 2750 | 33.06 |
| 6 | 1987 | 23.89 |
En relación con el estrato socioeconómico, la mayor proporción corresponde al estrato 5, con 33,06 %, seguido del estrato 4 con 25,59 % y el estrato 6 con 23,89 %. El estrato 3 representa el 17,47 % de las viviendas. Por tanto, la información disponible presenta una mayor concentración en los estratos 4, 5 y 6.
Barrio
| Categoria | Frecuencia | Porcentaje | |
|---|---|---|---|
| 415 | valle del lili | 1008 | 12.12 |
| 107 | ciudad jardín | 516 | 6.20 |
| 299 | pance | 409 | 4.92 |
| 212 | la flora | 366 | 4.40 |
| 378 | santa teresita | 262 | 3.15 |
| 143 | el caney | 208 | 2.50 |
| 152 | el ingenio | 202 | 2.43 |
| 217 | la hacienda | 164 | 1.97 |
| 3 | acopi | 158 | 1.90 |
| 254 | los cristales | 154 | 1.85 |
Por ultimo, la variable barrio presenta 436 categorías diferentes. Debido a la elevada cantidad de categorías, se presentan los diez barrios con mayor número de viviendas. Valle del Lili concentra la mayor cantidad de observaciones, con 1.008 viviendas (12,12 %), seguido de Ciudad Jardín con 516 (6,20 %) y Pance con 409 (4,92 %). Esta diversidad de barrios evidencia una importante heterogeneidad espacial dentro de la oferta inmobiliaria analizada.
Las gráficas revelan una clara concentración de la oferta inmobiliaria en la Zona Sur, que agrupa más de 4.500 viviendas, seguida por la Zona Norte y Zona Oeste. En cuanto al tipo de vivienda, los apartamentos predominan sobre las casas, representando aproximadamente el 61% de la oferta total.
Por estrato socioeconómico, se observa una mayor participación en los estratos 4, 5 y 6, con el estrato 5 como el más representativo. Finalmente, Valle del Lili, Ciudad Jardín y Pance son los barrios con mayor número de viviendas, lo que evidencia una oferta concentrada en sectores específicos de la ciudad.
Los diagramas de caja permiten identificar la presencia de valores
atípicos en las variables cuantitativas. Se observa que todas las
variables presentan observaciones que superan el límite superior
definido por el criterio del rango intercuartílico, especialmente en las
variables de precio, área construida y número de habitaciones.
Sin embargo, estos valores no fueron eliminados del análisis, ya que en el contexto inmobiliario propiedades con precios elevados, superficies amplias o un número considerable de habitaciones y parqueaderos corresponden a viviendas reales dentro del mercado. Su inclusión permite preservar la variabilidad natural de los datos y evitar sesgos en los análisis multivariados posteriores.
| Q1.25% | Q3.75% | IQR | Limite_inferior.25% | Limite_superior.75% | Numero_atipicos | |
|---|---|---|---|---|---|---|
| preciom | 220 | 540 | 320 | -260.0 | 1020.0 | 552 |
| areaconst | 80 | 229 | 149 | -143.5 | 452.5 | 382 |
| parqueaderos | 1 | 2 | 1 | -0.5 | 3.5 | 567 |
| banios | 2 | 4 | 2 | -1.0 | 7.0 | 72 |
| habitaciones | 3 | 4 | 1 | 1.5 | 5.5 | 822 |
La identificación de valores atípicos se realizó mediante el criterio del rango intercuartílico (IQR), considerando como potencialmente atípicas las observaciones inferiores a Q1 - 1,5(IQR) o superiores a Q3 + 1,5(IQR).
Los resultados muestran la presencia de observaciones atípicas en
todas las variables cuantitativas analizadas. El mayor número se
presenta en habitaciones, con 822 observaciones, seguido de
parqueaderos con 567, preciom con 552 y
areaconst con 382. En banios se identificaron
72 observaciones.
Estos resultados deben interpretarse con precaución, debido a que el criterio IQR identifica valores extremos desde una perspectiva estadística, pero no necesariamente representan errores en los datos. En el contexto inmobiliario, propiedades con un precio elevado, una superficie amplia o un número considerable de habitaciones y parqueaderos pueden corresponder a viviendas reales.
Por esta razón, los valores identificados como atípicos no serán eliminados automáticamente. Su tratamiento se determinará considerando su coherencia con el contexto de la información y su posible influencia sobre las técnicas multivariadas que se aplicarán posteriormente.
Por ello se observaran los valores extremos de cada variable del análisis
## [1] 1999 1950 1950 1950 1940 1900 1900 1900 1900 1900
## [1] 1745 1600 1586 1500 1500 1440 1365 1250 1200 1200
## [1] 10 10 10 10 10 10 10 10 9 9
## [1] 10 10 10 10 10 10 10 10 10 9
## [1] 10 10 10 10 10 10 10 10 10 10
La revisión de los valores extremos permitió identificar observaciones estadísticamente atípicas en las cinco variables cuantitativas. Sin embargo, los valores máximos observados se encuentran dentro de rangos plausibles para el contexto inmobiliario: el precio máximo es de 1.999 millones de pesos, el área máxima es de 1.745 m² y las variables de parqueaderos, baños y habitaciones alcanzan un máximo de 10.
Por lo anterior, no se encontraron evidencias suficientes para considerar estos valores como errores de registro. En consecuencia, las observaciones atípicas se conservarán en la base de datos para los análisis posteriores. No obstante, su posible influencia será considerada especialmente en el análisis de componentes principales y de conglomerados.
La matriz de correlaciones muestra que todas las variables cuantitativas presentan relaciones positivas entre sí, aunque con diferentes niveles de intensidad.
## preciom areaconst parqueaderos banios habitaciones
## preciom 1.00 0.69 0.62 0.68 0.27
## areaconst 0.69 1.00 0.52 0.67 0.54
## parqueaderos 0.62 0.52 1.00 0.49 0.25
## banios 0.68 0.67 0.49 1.00 0.59
## habitaciones 0.27 0.54 0.25 0.59 1.00
| preciom | areaconst | parqueaderos | banios | habitaciones | |
|---|---|---|---|---|---|
| preciom | 1.00 | 0.69 | 0.62 | 0.68 | 0.27 |
| areaconst | 0.69 | 1.00 | 0.52 | 0.67 | 0.54 |
| parqueaderos | 0.62 | 0.52 | 1.00 | 0.49 | 0.25 |
| banios | 0.68 | 0.67 | 0.49 | 1.00 | 0.59 |
| habitaciones | 0.27 | 0.54 | 0.25 | 0.59 | 1.00 |
La relación más alta se observa entre el precio de la vivienda
(preciom) y el área construida (areaconst),
con una correlación de 0,69. Esto indica que las viviendas con mayor
área construida tienden a presentar precios más elevados. De manera
similar, el precio presenta correlaciones relativamente fuertes con el
número de baños (0,68) y de parqueaderos (0,62).
También se observa una relación importante entre el área construida y el número de baños (0,67), mientras que la relación entre área construida y habitaciones es moderada (0,54). El número de baños y habitaciones presenta igualmente una asociación moderada (0,59).
Las correlaciones más bajas corresponden a precio-habitaciones (0,27) y parqueaderos-habitaciones (0,25), lo que indica una relación lineal más débil entre estas variables.
En general, la presencia de correlaciones moderadas y altas entre varias características de las viviendas indica que existe información compartida entre ellas. Esto proporciona una base adecuada para aplicar el Análisis de Componentes Principales, ya que esta técnica permite resumir la variabilidad conjunta de las variables mediante un número reducido de componentes.
El mapa de calor permite visualizar la intensidad de las asociaciones entre las variables cuantitativas. Los valores más próximos a 1 representan relaciones positivas más fuertes. Se destacan especialmente las relaciones entre precio y área construida, precio y baños, y área construida y baños, en concordancia con los resultados obtenidos en la matriz de correlaciones.
El objetivo del PCA en este caso es reducir la dimensionalidad de las cinco variables cuantitativas que caracterizan las viviendas, conservando la mayor cantidad posible de información.
Las variables con las que se trabajaran son:
Debido a que las variables cuantitativas presentan diferentes unidades de medida y escalas de variación, se realizó una estandarización previa al PCA. De esta manera, se evita que las variables con mayor magnitud numérica dominen la construcción de los componentes y se permite que cada característica contribuya de manera comparable al análisis.
## Importance of components:
## PC1 PC2 PC3 PC4 PC5
## Standard deviation 1.7785 0.9324 0.66824 0.57596 0.43504
## Proportion of Variance 0.6326 0.1739 0.08931 0.06635 0.03785
## Cumulative Proportion 0.6326 0.8065 0.89580 0.96215 1.00000
La varianza explicada presenta una disminución progresiva entre los componentes principales. El primer componente concentra el 63,26 % de la variabilidad total, mientras que el segundo aporta un 17,39 % adicional. En conjunto, los dos primeros componentes representan el 80,65 % de la variabilidad de las variables analizadas. Los componentes restantes presentan contribuciones menores, por lo que los dos primeros componentes constituyen una representación adecuada de la estructura multidimensional de las viviendas.
## PC1 PC2 PC3 PC4 PC5
## preciom 0.4718238 0.38008355 0.4385339 -0.082706011 0.65860953
## areaconst 0.4899959 -0.06147971 0.2182987 0.758110331 -0.36570292
## parqueaderos 0.4057929 0.50601313 -0.7549056 -0.045235540 -0.08575573
## banios 0.4909868 -0.16515695 0.2490573 -0.645233599 -0.50328844
## habitaciones 0.3626988 -0.75394339 -0.3579408 0.007469311 0.41453778
| Variable | PC1 | PC2 | |
|---|---|---|---|
| preciom | preciom | 0.472 | 0.380 |
| areaconst | areaconst | 0.490 | -0.061 |
| parqueaderos | parqueaderos | 0.406 | 0.506 |
| banios | banios | 0.491 | -0.165 |
| habitaciones | habitaciones | 0.363 | -0.754 |
El primer componente principal (PC1) presenta cargas positivas en todas las variables analizadas. Las mayores contribuciones corresponden al área construida (0,490), número de baños (0,491) y precio de la vivienda (0,472), seguidas por el número de parqueaderos (0,406) y habitaciones (0,363). Esto indica que PC1 representa una dimensión general asociada con el tamaño, el valor económico y el nivel de equipamiento de las viviendas. Por tanto, las propiedades con valores altos en este componente tienden a presentar simultáneamente mayores dimensiones, precios y características habitacionales.
En cuanto a el segundo componente principal (PC2) presenta una estructura diferente. La mayor carga corresponde al número de habitaciones (-0,754), mientras que el número de parqueaderos (0,506) y el precio de la vivienda (0,380) presentan cargas positivas. Esto indica que PC2 establece principalmente un contraste entre las viviendas con mayor número de habitaciones y aquellas que presentan una mayor cantidad de parqueaderos y un mayor precio. El área construida y el número de baños presentan una contribución relativamente baja en este componente.
El gráfico de cargas permite visualizar la contribución de las variables a los dos primeros componentes principales. En el eje PC1 se observa que todas las variables presentan cargas positivas, destacándose el precio, el área construida y el número de baños. Por esta razón, PC1 puede interpretarse como una dimensión general asociada con el tamaño, valor económico y equipamiento de las viviendas.
Por su parte, PC2 presenta una estructura de contraste. El número de habitaciones presenta una carga negativa elevada, mientras que el número de parqueaderos y el precio presentan cargas positivas. Esto indica que este componente diferencia principalmente las viviendas según su composición habitacional frente a características asociadas con el precio y el número de parqueaderos.
La orientación similar de las variables precio, área construida y baños es consistente con las correlaciones observadas previamente, que mostraron asociaciones positivas entre estas características. En conjunto, los dos primeros componentes permiten representar el 80,65 % de la variabilidad de las variables cuantitativas, facilitando la interpretación de la estructura del mercado inmobiliario.
Se utilizaran las mismas cinco variables numéricas que en el PCA
Se estanderizan las variables debido a que estan en escalas diferentes y asi evitar una posible influencia desproporcionada en la formación de los grupos.
¿Cuántos conglomerados se deben utilizar?
Para identificar la similitud entre las viviendas se calculó una matriz de distancias utilizando la distancia euclidiana sobre las variables cuantitativas previamente estandarizadas: precio, área construida, parqueaderos, baños y habitaciones. La estandarización permite que las diferencias entre las variables sean comparables y evita que aquellas expresadas en escalas mayores tengan una influencia desproporcionada en el cálculo de las distancias.
La distancia euclidiana permite cuantificar qué tan diferentes son dos viviendas considerando simultáneamente sus características. Valores pequeños indican mayor similitud, mientras que valores grandes representan mayores diferencias. Por ejemplo, las viviendas 2 y 5 presentan una distancia de 0,28, lo que indica una alta similitud en las características analizadas, mientras que las viviendas 1 y 4 presentan una distancia de 3,57, evidenciando una diferencia considerable.
## 1 2 3 4 5 6
## 1 0.000000 2.2595560 2.154610 3.565448 2.2267491 2.1094465
## 2 2.259556 0.0000000 1.401809 3.120835 0.2781384 0.7846943
## 3 2.154610 1.4018087 0.000000 2.489115 1.5392581 1.7170221
## 4 3.565448 3.1208354 2.489115 0.000000 3.2211089 2.8233357
## 5 2.226749 0.2781384 1.539258 3.221109 0.0000000 0.7122916
## 6 2.109447 0.7846943 1.717022 2.823336 0.7122916 0.0000000
Por ejemplo, la distancia entre las viviendas 2 y 5 es de aproximadamente 0,28, lo que indica una alta similitud entre sus características. En contraste, la distancia entre las viviendas 1 y 4 es de aproximadamente 3,57, evidenciando una diferencia mayor.
Debido al tamaño de la base de datos, que contiene 8.319 viviendas, no se presenta la matriz completa, sino una sección de las primeras seis observaciones como referencia del cálculo realizado.
A partir de la matriz de distancias se realizó un agrupamiento jerárquico utilizando el método de Ward. Este procedimiento busca formar conglomerados internamente homogéneos, minimizando el incremento de la variabilidad dentro de los grupos en cada etapa de agrupamiento. De esta manera, las viviendas que presentan características similares tienden a incorporarse al mismo conglomerado.
Este método busca formar grupos en los que las viviendas sean lo más similares posible dentro de cada conglomerado, procurando que la variabilidad interna de los grupos sea pequeña.
El resultado del agrupamiento jerárquico se representa mediante un dendrograma. Este gráfico permite observar de manera visual cómo las viviendas se van agrupando progresivamente.
La altura de cada unión representa la distancia a la que se combinan los grupos. Las uniones realizadas a menor altura corresponden a grupos más similares, mientras que las uniones a mayor altura representan grupos con diferencias más marcadas.
El dendrograma muestra el proceso de agrupamiento jerárquico de las 8.319 viviendas. Las líneas verticales en negro representan la fusión de grupos, donde la altura indica la distancia a la que se combinan: uniones a menor altura reflejan mayor similitud entre las viviendas, mientras que uniones a mayor altura indican grupos más diferenciados.
Se observan dos grandes bloques que se separan a una distancia aproximada de 184, y dentro de cada uno se identifican subdivisiones internas. Las líneas de corte en rojo, trazadas a una altura cercana a 85, permiten obtener cuatro conglomerados. Esta decisión se fundamenta en que a partir de este punto las uniones posteriores combinan grupos con diferencias más marcadas, lo que justifica mantener cuatro segmentos como una solución interpretable y manejable para el análisis.
## [1] 32.22839 38.54912 38.63181 39.83036 41.72120 46.42411 63.84223
## [8] 81.19377 85.00540 184.45519
Para determinar el número de conglomerados se analizaron las últimas distancias de fusión obtenidas en el agrupamiento jerárquico. Se observa un incremento importante en las distancias, especialmente entre 85,01 y 184,46. Este aumento indica que la siguiente unión combinaría grupos con características considerablemente diferentes.
Asimismo, alrededor de una distancia de 80 se identifican cuatro grandes grupos antes de las siguientes fusiones. Por esta razón, se seleccionaron cuatro conglomerados como una solución que permite mantener grupos relativamente homogéneos y diferenciados entre sí.
Por esta razón, se seleccionaron cuatro conglomerados, buscando mantener grupos relativamente homogéneos internamente y diferenciados entre sí.
| Conglomerado | Frecuencia | Porcentaje |
|---|---|---|
| 1 | 3384 | 40.68 |
| 2 | 3101 | 37.28 |
| 3 | 788 | 9.47 |
| 4 | 1046 | 12.57 |
| conglomerado | preciom | areaconst | parqueaderos | banios | habitaciones |
|---|---|---|---|---|---|
| 1 | 402.03 | 163.30 | 1.72 | 3.30 | 3.65 |
| 2 | 207.94 | 79.06 | 1.40 | 1.85 | 2.78 |
| 3 | 576.08 | 345.16 | 2.09 | 5.21 | 6.35 |
| 4 | 1099.80 | 368.56 | 3.55 | 4.82 | 4.04 |
El conglomerado 1, que concentra el 40,68 % de las viviendas, presenta características intermedias, con un precio promedio de 402,03 millones de pesos y un área construida promedio de 163,30 m².
El conglomerado 2, representa el 37,28 % de las viviendas, corresponde al segmento de menor precio y tamaño. Presenta un precio promedio de 207,94 millones de pesos y un área promedio de 79,06 m², además de los menores promedios de baños y habitaciones.
Mientras el conglomerado 3, presenta el 9,47 % de las viviendas, se caracteriza por presentar viviendas de gran tamaño y una alta capacidad habitacional. Su área promedio es de 345,16 m² y registra los mayores promedios de habitaciones (6,35) y baños (5,21).
Finalmente, el conglomerado 4, que reúne el 12,57 % de las viviendas, representa el segmento de mayor valor económico. Presenta un precio promedio de 1.099,80 millones de pesos, un área de 368,56 m² y el mayor promedio de parqueaderos, con 3,55.
En conjunto, los resultados muestran que la segmentación está determinada principalmente por diferencias en el precio, el tamaño de la vivienda y sus características habitacionales.
El gráfico muestra la distribución de los cuatro conglomerados en el
plano definido por los dos primeros componentes principales, que en
conjunto explican el 80.65 % de la variabilidad total de las variables
cuantitativas. Se observa una separación clara entre los grupos,
especialmente en el eje PC1, que representa la dimensión general de
tamaño, valor económico y equipamiento de las viviendas.
El conglomerado 2 (celeste) se ubica en el extremo izquierdo del gráfico, correspondiente a viviendas de menor precio y tamaño, mientras que el conglomerado 4 (morado) se concentra en el extremo derecho, representando las viviendas de mayor valor económico. Los conglomerados 1 (rojo) y 3 (verde) ocupan posiciones intermedias; no obstante, el conglomerado 3 presenta una mayor dispersión en el eje PC2, lo que refleja viviendas de gran tamaño pero con características habitacionales diversas. Esta separación confirma que los cuatro conglomerados son estadísticamente distinguibles y que el PCA captura adecuadamente las diferencias entre ellos.
El análisis de correspondencia se utiliza para explorar las relaciones entre variables categóricas mediante la representación de sus categorías en un espacio de menor dimensión. A diferencia del análisis de componentes principales, que se aplicó sobre variables cuantitativas, el análisis de correspondencia permite estudiar asociaciones entre categorías. Las variable que se utilizaran son:
Ademas, la variable barrio al tener un número de registro tan grande con 436 barrios, se vuelve dificil poder interpretarla y producirla en una gráfica, por lo que se debe llevar con cuidado.
Para este análisis se seleccionaron inicialmente las variables
zona y tipo, debido a que presentan un número
reducido de categorías y permiten analizar la posible relación entre la
ubicación de la vivienda y su tipo.
Para iniciar el análisis se construyó una tabla de contingencia entre
las variables zona y tipo. Esta tabla muestra
la frecuencia de casas y apartamentos presentes en cada zona.
| Apartamento | Casa | |
|---|---|---|
| Zona Centro | 24 | 100 |
| Zona Norte | 1198 | 722 |
| Zona Oeste | 1029 | 169 |
| Zona Oriente | 62 | 289 |
| Zona Sur | 2787 | 1939 |
Para facilitar la comparación entre las zonas, se calcularon las proporciones de cada tipo de vivienda dentro de cada zona. El cálculo por filas permite comparar la composición de las zonas independientemente de su número total de viviendas.
| Apartamento | Casa | |
|---|---|---|
| Zona Centro | 19.35 | 80.65 |
| Zona Norte | 62.40 | 37.60 |
| Zona Oeste | 85.89 | 14.11 |
| Zona Oriente | 17.66 | 82.34 |
| Zona Sur | 58.97 | 41.03 |
Las proporciones muestran diferencias importantes en la composición del tipo de vivienda según la zona. La zona Oeste presenta el mayor predominio de apartamentos, con 85,89 %, mientras que en las zonas Oriente y Centro predominan las casas, con 82,34 % y 80,65 %, respectivamente.
En las zonas Norte y Sur predominan los apartamentos, aunque la diferencia respecto a las casas es menor. Estos resultados sugieren que el tipo de vivienda podría estar relacionado con la zona de ubicación, por lo que esta relación se evalúa mediante una prueba de independencia.
Se aplica la prueba chi-cuadrado de Pearson para determinar si existe independencia entre la zona y el tipo de vivienda. La hipótesis nula establece que ambas variables son independientes, mientras que la hipótesis alternativa plantea que existe una asociación entre ellas.
##
## Pearson's Chi-squared test
##
## data: tabla_zona_tipo
## X-squared = 690.93, df = 4, p-value < 2.2e-16
El estadístico chi-cuadrado obtenido fue de 690,93 con 4 grados de libertad y un valor p inferior a 2,2 × 10⁻¹⁶. Debido a que el valor p es menor que 0,05, se rechaza la hipótesis nula de independencia.
Por lo tanto, existe evidencia estadísticamente significativa de una asociación entre la zona y el tipo de vivienda. Esto indica que la distribución de casas y apartamentos presenta diferencias entre las zonas de la ciudad.
Debido a que la prueba chi-cuadrado evidenció una asociación significativa entre la zona y el tipo de vivienda, se realizó un análisis de correspondencia para identificar cómo se relacionan específicamente las categorías de ambas variables.
| Dimension | Inercia | Porcentaje |
|---|---|---|
| 1 | 0.0831 | 100 |
| 2 | 0.0000 | 0 |
La primera dimensión concentra el 100 % de la inercia del análisis, mientras que la segunda presenta una inercia prácticamente nula. Por lo tanto, la asociación entre zona y tipo de vivienda puede representarse completamente mediante una sola dimensión.
Este resultado se explica por la estructura de la tabla de
contingencia, ya que la variable tipo posee únicamente dos
categorías. En consecuencia, el número máximo de dimensiones efectivas
es uno.
| Zona | Dimension1 |
|---|---|
| Zona Centro | -0.8613 |
| Zona Norte | 0.0224 |
| Zona Oeste | 0.5048 |
| Zona Oriente | -0.8960 |
| Zona Sur | -0.0479 |
| Tipo | Dimension1 |
|---|---|
| Apartamento | 0.2290 |
| Casa | -0.3627 |
La categoría Apartamento presenta una coordenada
positiva de 0,2290 en la primera dimensión, mientras que
Casa presenta una coordenada negativa de -0,3627. Por
tanto, la dimensión 1 permite diferenciar principalmente ambos tipos de
vivienda.
Al comparar estas posiciones con las coordenadas de las zonas, se
observa que Oriente y Centro se ubican en el lado negativo del eje,
próximo a la categoría Casa, mientras que Oeste se
encuentra en el lado positivo, próximo a Apartamento. Las
zonas Norte y Sur presentan coordenadas cercanas al origen, por lo que
muestran una asociación menos marcada con alguno de los dos tipos.
La interpretación es consistente con la distribución porcentual observada previamente y permite identificar una relación espacial entre la zona de ubicación y el tipo de vivienda.
Para visualizar la asociación entre las categorías de zona y tipo de vivienda, se representan las coordenadas de ambas variables en el espacio de la primera dimensión.
El gráfico de correspondencia confirma visualmente la asociación entre
la zona y el tipo de vivienda. La cercanía entre
Oeste y
Apartamento indica que en esta zona predominan los
apartamentos, mientras que Oriente y Centro se
ubican cerca de Casa, lo que evidencia una mayor presencia
de casas en estas zonas.
Las zonas Norte y Sur se posicionan cerca
del origen del eje, lo que sugiere que en estas zonas la distribución
entre casas y apartamentos es más equilibrada, sin una marcada
preferencia por un tipo específico. Este resultado es consistente con la
distribución porcentual y la prueba chi-cuadrado presentadas
anteriormente, confirmando que existe una relación espacial entre la
ubicación de la vivienda y su tipología.
##
## Apartamento Casa
## 3 639 814
## 4 1404 725
## 5 1766 984
## 6 1291 696
##
## Apartamento Casa
## 3 43.98 56.02
## 4 65.95 34.05
## 5 64.22 35.78
## 6 64.97 35.03
La distribución porcentual muestra diferencias en el tipo de vivienda según el estrato socioeconómico. En el estrato 3 predominan las casas, que representan el 56,02 % de las viviendas, mientras que los apartamentos representan el 43,98 %.
En los estratos 4, 5 y 6 se observa el patrón contrario, con un predominio de apartamentos. Estos representan el 65,95 % en el estrato 4, el 64,22 % en el estrato 5 y el 64,97 % en el estrato 6.
Estos resultados sugieren que existe una relación entre el estrato socioeconómico y el tipo de vivienda, la cual se evalúa mediante la prueba chi-cuadrado.
## Estrato Tipo Porcentaje
## 1 3 Apartamento 43.98
## 2 4 Apartamento 65.95
## 3 5 Apartamento 64.22
## 4 6 Apartamento 64.97
## 5 3 Casa 56.02
## 6 4 Casa 34.05
## 7 5 Casa 35.78
## 8 6 Casa 35.03
La gráfica permite visualizar las diferencias en la composición del tipo
de vivienda según el estrato socioeconómico. En el estrato 3 se observa
un predominio de casas (56.02 %) sobre apartamentos (43.98 %), mientras
que en los estratos 4, 5 y 6 ocurre lo contrario, con una mayor
proporción de apartamentos que supera el 60 % en todos los casos.
Este patrón sugiere que a medida que aumenta el estrato socioeconómico, la oferta de vivienda se inclina hacia los apartamentos. Esta relación puede estar asociada a la tipología de vivienda predominante en zonas de estratos medios y altos, donde la oferta de apartamentos es más frecuente, posiblemente por la mayor densidad de construcción en estas áreas.
##
## Pearson's Chi-squared test
##
## data: tabla_estrato_tipo
## X-squared = 224.33, df = 3, p-value < 2.2e-16
La prueba chi-cuadrado de Pearson obtuvo un estadístico de 224,33 con 3 grados de libertad y un valor p inferior a 2,2 × 10⁻¹⁶. Debido a que el valor p es menor que 0,05, se rechaza la hipótesis nula de independencia.
Por lo tanto, existe evidencia estadísticamente significativa de una asociación entre el estrato socioeconómico y el tipo de vivienda. La distribución de casas y apartamentos presenta diferencias según el estrato.
##
## Apartamento Casa
## 3 639 814
## 4 1404 725
## 5 1766 984
## 6 1291 696
| Dimension | Inercia | Porcentaje |
|---|---|---|
| 1 | 0.027 | 100 |
| 2 | 0.000 | 0 |
Debido a que la prueba chi-cuadrado evidenció una asociación estadísticamente significativa entre el estrato y el tipo de vivienda, se realizó un análisis de correspondencia para identificar cómo se relacionan las categorías de ambas variables.
La primera dimensión concentra el 100 % de la inercia, con un valor de 0,027, mientras que la segunda dimensión presenta una inercia prácticamente nula. Por lo tanto, la relación entre el estrato socioeconómico y el tipo de vivienda puede representarse completamente mediante una sola dimensión.
| Estrato | Dimension1 |
|---|---|
| 3 | -0.3558 |
| 4 | 0.0953 |
| 5 | 0.0598 |
| 6 | 0.0753 |
| Tipo | Dimension1 |
|---|---|
| Apartamento | 0.1305 |
| Casa | -0.2067 |
La primera dimensión diferencia principalmente el estrato 3 de los
estratos 4, 5 y 6. El estrato 3 presenta una coordenada negativa de
-0,3558, ubicándose en el mismo lado del eje que la categoría
Casa, cuya coordenada es -0,2067.
En contraste, los estratos 4, 5 y 6 presentan coordenadas positivas
de 0,0953, 0,0598 y 0,0753, respectivamente, y se ubican en el mismo
lado que la categoría Apartamento, cuya coordenada es
0,1305.
Este resultado coincide con la distribución porcentual observada previamente: en el estrato 3 predominan las casas, mientras que en los estratos 4, 5 y 6 predominan los apartamentos. Por tanto, el análisis de correspondencia permite visualizar una asociación entre el estrato socioeconómico y el tipo de vivienda.
El gráfico de correspondencia entre estrato y tipo de vivienda permite
visualizar la asociación identificada previamente mediante la prueba
chi-cuadrado. La primera dimensión, que concentra el 100 % de la
inercia, diferencia claramente el estrato 3 de los estratos 4, 5 y
6.
El estrato 3 se ubica en el lado negativo del eje, en la misma
dirección que la categoría Casa, lo que indica que en este
estrato predominan las casas. En contraste, los estratos 4, 5 y 6 se
sitúan en el lado positivo del eje, junto con la categoría
Apartamento, evidenciando que en estos estratos la oferta
de apartamentos es mayor. Este patrón sugiere que a medida que aumenta
el estrato socioeconómico, la oferta de vivienda se inclina hacia los
apartamentos, posiblemente asociado a la tipología de vivienda
predominante en zonas de estratos medios y altos.
El análisis realizado permitió obtener una caracterización integral de la oferta inmobiliaria estudiada, evidenciando que las viviendas presentan diferencias importantes tanto en sus características físicas y económicas como en su ubicación y clasificación socioeconómica. Esta heterogeneidad confirma que el mercado analizado está compuesto por perfiles diversos de propiedades y no por un único patrón de vivienda.
Desde la perspectiva cuantitativa, las características relacionadas con el tamaño y el equipamiento de las viviendas presentan una asociación importante con el precio. En particular, la relación entre precio y área construida muestra que las viviendas de mayor tamaño tienden a ubicarse en segmentos de mayor valor. Sin embargo, las diferencias entre las variables indican que el precio no puede analizarse a partir de una sola característica.
La aplicación del PCA permitió sintetizar las cinco variables cuantitativas en un número reducido de dimensiones, facilitando la interpretación conjunta de las características de las viviendas. La primera componente representa principalmente una dimensión asociada con el tamaño, el valor económico y el equipamiento, mientras que la segunda permite diferenciar características relacionadas con las habitaciones frente al precio y los parqueaderos.
La segmentación mediante conglomerados complementó este resultado al evidenciar la existencia de cuatro perfiles diferenciados de viviendas. Los grupos identificados muestran que existen segmentos de menor valor y tamaño, viviendas de características intermedias y propiedades de mayor tamaño y valor económico. Esta diferenciación permite comprender que la oferta inmobiliaria puede analizarse mediante grupos con características relativamente homogéneas.
Por otra parte, las variables categóricas evidenciaron que la distribución de las viviendas no es independiente de su ubicación y estrato socioeconómico. Las diferencias encontradas entre zonas y tipos de vivienda, así como entre estrato y tipo de vivienda, muestran que las características espaciales y socioeconómicas también contribuyen a explicar la composición de la oferta inmobiliaria.
En términos generales, el análisis demuestra la utilidad de combinar diferentes técnicas estadísticas para estudiar fenómenos inmobiliarios. Mientras el análisis de correlación y el PCA permitieron comprender las relaciones entre las características cuantitativas, los conglomerados facilitaron la identificación de perfiles y el análisis de correspondencia permitió interpretar asociaciones entre categorías. Esta integración proporciona una visión más completa del mercado que el análisis individual de cada variable.
A partir de los hallazgos obtenidos, se plantean las siguientes recomendaciones:
Aplicar estrategias diferenciadas según el perfil de las viviendas. La existencia de cuatro conglomerados sugiere que la oferta inmobiliaria puede abordarse mediante segmentos con características diferentes. En futuros estudios o procesos de comercialización, se recomienda adaptar el análisis a las necesidades y características de cada segmento.
Incorporar la localización en los procesos de valoración. Las diferencias encontradas entre las zonas muestran la importancia de la ubicación dentro del análisis inmobiliario. Por ello, los modelos de valoración y segmentación deberían considerar tanto las características físicas de las viviendas como su localización.
Considerar variables socioeconómicas en futuros análisis. La asociación entre estrato y tipo de vivienda evidencia que las características socioeconómicas aportan información relevante para comprender la composición de la oferta. Su incorporación puede contribuir a obtener segmentaciones más precisas.
Ampliar la información disponible. Para profundizar en el estudio del mercado sería conveniente incorporar variables como antigüedad del inmueble, estado de conservación, administración, características del entorno, distancia a servicios y vías principales, entre otras. Estas variables permitirían analizar factores adicionales asociados con el valor de las viviendas.
Profundizar en el componente espacial. La base dispone de coordenadas geográficas, por lo que futuros estudios podrían utilizar herramientas de análisis espacial para identificar patrones de concentración de precios, áreas construidas y tipos de vivienda, así como posibles diferencias entre sectores de la ciudad.
Desarrollar modelos de valoración inmobiliaria. Los resultados obtenidos pueden servir como punto de partida para investigaciones posteriores orientadas a explicar o predecir el precio de las viviendas mediante modelos estadísticos o de aprendizaje automático.
Actualizar periódicamente la información. Debido a que las condiciones del mercado inmobiliario pueden cambiar con el tiempo, se recomienda actualizar la información y repetir los análisis para determinar si los perfiles y asociaciones identificados se mantienen o presentan modificaciones.