1.Introducción

El mercado inmobiliario urbano se caracteriza por la interacción de múltiples factores relacionados con las características físicas, económicas y espaciales de las viviendas. El análisis de estas características permite identificar patrones en la oferta y generar información útil para apoyar procesos de valoración, segmentación y toma de decisiones estratégicas.

En este trabajo se analiza una base de datos correspondiente a viviendas ubicadas en la ciudad de Cali, Colombia. El conjunto de datos contiene información sobre variables como zona, estrato socioeconómico, precio, área construida, número de parqueaderos, baños, habitaciones, tipo de vivienda, barrio y ubicación geográfica.

El propósito del análisis es obtener una visión integral de la oferta inmobiliaria mediante diferentes técnicas estadísticas multivariadas. Para ello, se aplicará un Análisis de Componentes Principales (PCA), un análisis de conglomerados y un análisis de correspondencias. Adicionalmente, se utilizarán herramientas de visualización para facilitar la interpretación de los resultados y analizar la distribución espacial de las propiedades.

Los resultados permitirán identificar las principales características que explican la variabilidad de las viviendas, establecer segmentos de propiedades con características similares y estudiar las relaciones existentes entre las variables categóricas asociadas con la oferta inmobiliaria.

2. Descripción de la base de datos

La base de datos utilizada en este estudio corresponde al conjunto de datos vivienda, incluido en el paquete paqueteMODELOS. Esta base contiene información sobre la oferta de viviendas de la ciudad de Cali y permite analizar diferentes características relacionadas con el precio, las condiciones físicas, el tipo de vivienda y su ubicación.

2.1 Dimensiones de la base

## [1] 8322   13

La base de datos está conformada por 8.322 observaciones y 13 variables.

Las 13 variables disponibles en la base son:

names(vivienda)
##  [1] "id"           "zona"         "piso"         "estrato"      "preciom"     
##  [6] "areaconst"    "parqueaderos" "banios"       "habitaciones" "tipo"        
## [11] "barrio"       "longitud"     "latitud"

2.2 Estructura de la data

str(vivienda)
## spc_tbl_ [8,322 × 13] (S3: spec_tbl_df/tbl_df/tbl/data.frame)
##  $ id          : num [1:8322] 1147 1169 1350 5992 1212 ...
##  $ zona        : chr [1:8322] "Zona Oriente" "Zona Oriente" "Zona Oriente" "Zona Sur" ...
##  $ piso        : chr [1:8322] NA NA NA "02" ...
##  $ estrato     : num [1:8322] 3 3 3 4 5 5 4 5 5 5 ...
##  $ preciom     : num [1:8322] 250 320 350 400 260 240 220 310 320 780 ...
##  $ areaconst   : num [1:8322] 70 120 220 280 90 87 52 137 150 380 ...
##  $ parqueaderos: num [1:8322] 1 1 2 3 1 1 2 2 2 2 ...
##  $ banios      : num [1:8322] 3 2 2 5 2 3 2 3 4 3 ...
##  $ habitaciones: num [1:8322] 6 3 4 3 3 3 3 4 6 3 ...
##  $ tipo        : chr [1:8322] "Casa" "Casa" "Casa" "Casa" ...
##  $ barrio      : chr [1:8322] "20 de julio" "20 de julio" "20 de julio" "3 de julio" ...
##  $ longitud    : num [1:8322] -76.5 -76.5 -76.5 -76.5 -76.5 ...
##  $ latitud     : num [1:8322] 3.43 3.43 3.44 3.44 3.46 ...
##  - attr(*, "spec")=List of 3
##   ..$ cols   :List of 13
##   .. ..$ id          : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ zona        : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
##   .. ..$ piso        : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
##   .. ..$ estrato     : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ preciom     : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ areaconst   : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ parqueaderos: list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ banios      : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ habitaciones: list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ tipo        : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
##   .. ..$ barrio      : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_character" "collector"
##   .. ..$ longitud    : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   .. ..$ latitud     : list()
##   .. .. ..- attr(*, "class")= chr [1:2] "collector_double" "collector"
##   ..$ default: list()
##   .. ..- attr(*, "class")= chr [1:2] "collector_guess" "collector"
##   ..$ delim  : chr ";"
##   ..- attr(*, "class")= chr "col_spec"
##  - attr(*, "problems")=<pointer: (nil)>

La estructura de la base muestra que algunas variables están almacenadas como datos numéricos (num), mientras que otras se encuentran almacenadas como caracteres (chr). Sin embargo, el tipo de almacenamiento en R no necesariamente coincide con la naturaleza estadística de la variable. Por ejemplo, estrato está almacenada como numérica, pero representa categorías ordenadas de nivel socioeconómico, por lo que se considera una variable cualitativa ordinal.

2.3 Clasificación de las variables

Para facilitar la interpretación de la información disponible, las variables se clasifican de acuerdo con su naturaleza estadística y el tipo de dato con el que se encuentran almacenadas en R.

Clasificación de las variables de la base de datos
Variable Descripcion Tipo_R Tipo_variable
id Identificador de la vivienda Numérica Identificadora
zona Zona geográfica donde se encuentra la vivienda Carácter Cualitativa nominal
piso Piso en el que se encuentra la vivienda Carácter Cualitativa ordinal
estrato Estrato socioeconómico Numérica Cualitativa ordinal
preciom Precio de la vivienda Numérica Cuantitativa continua
areaconst Área construida de la vivienda Numérica Cuantitativa continua
parqueaderos Número de parqueaderos Numérica Cuantitativa discreta
banios Número de baños Numérica Cuantitativa discreta
habitaciones Número de habitaciones Numérica Cuantitativa discreta
tipo Tipo de vivienda Carácter Cualitativa nominal
barrio Barrio donde se encuentra la vivienda Carácter Cualitativa nominal
longitud Longitud geográfica Numérica Cuantitativa continua
latitud Latitud geográfica Numérica Cuantitativa continua

Las variables cuantitativas proporcionan información sobre las características físicas y económicas de las viviendas, mientras que las variables cualitativas permiten estudiar la composición y distribución de la oferta según categorías como la zona, el tipo de vivienda y el barrio.

En particular, preciom y areaconst son variables cuantitativas continuas, mientras que parqueaderos, banios y habitaciones son variables cuantitativas discretas, debido a que representan conteos. Por otra parte, zona, tipo y barrio son variables cualitativas nominales. estrato se considera cualitativa ordinal, debido a que sus categorías representan niveles socioeconómicos ordenados.

La variable id, aunque aparece almacenada como numérica, cumple únicamente una función de identificación de cada registro y, por esta razón, no será utilizada como variable explicativa en los análisis multivariados.

Finalmente, longitud y latitud corresponden a coordenadas geográficas. Estas variables serán utilizadas posteriormente para representar espacialmente la oferta inmobiliaria.

3. Análisis exploratorio

Principalmente se realiza una analisis exploratorio a la data, para ver observar posibles problemas enla calidad de los datos y asi realizar su debida limpieza si es necesario, ademas de observar la distribuccion de las variables.

3.1 Primeras observaciones

Se presentan las primeras observaciones de la base de datos con el propósito de verificar la estructura de los registros y obtener una primera aproximación a la información disponible.

## # A tibble: 6 × 13
##      id zona    piso  estrato preciom areaconst parqueaderos banios habitaciones
##   <dbl> <chr>   <chr>   <dbl>   <dbl>     <dbl>        <dbl>  <dbl>        <dbl>
## 1  1147 Zona O… <NA>        3     250        70            1      3            6
## 2  1169 Zona O… <NA>        3     320       120            1      2            3
## 3  1350 Zona O… <NA>        3     350       220            2      2            4
## 4  5992 Zona S… 02          4     400       280            3      5            3
## 5  1212 Zona N… 01          5     260        90            1      2            3
## 6  1724 Zona N… 01          5     240        87            1      3            3
## # ℹ 4 more variables: tipo <chr>, barrio <chr>, longitud <dbl>, latitud <dbl>

3.2 Valores faltantes

La identificación de valores faltantes es importante dentro del análisis exploratorio, pues permite evaluar la calidad de la información disponible y determinar si es necesario realizar algún tratamiento antes de aplicar las técnicas estadísticas multivariadas.

##           id         zona         piso      estrato      preciom    areaconst 
##            3            3         2638            3            2            3 
## parqueaderos       banios habitaciones         tipo       barrio     longitud 
##         1605            3            3            3            3            3 
##      latitud 
##            3

Porcentajes de los faltantes

##           id         zona         piso      estrato      preciom    areaconst 
##         0.04         0.04        31.70         0.04         0.02         0.04 
## parqueaderos       banios habitaciones         tipo       barrio     longitud 
##        19.29         0.04         0.04         0.04         0.04         0.04 
##      latitud 
##         0.04

Para una mejor viasualización de los resultados se presenta la siguiente tabla:

Cantidad y porcentaje de valores faltantes
Variable Faltantes Porcentaje
id 3 0.04
zona 3 0.04
piso 2638 31.70
estrato 3 0.04
preciom 2 0.02
areaconst 3 0.04
parqueaderos 1605 19.29
banios 3 0.04
habitaciones 3 0.04
tipo 3 0.04
barrio 3 0.04
longitud 3 0.04
latitud 3 0.04

3.3 Tratamiento de valores faltantes

La variable parqueaderos presenta 1.605 valores faltantes, equivalentes al 19,29 % de las observaciones. Debido a que la documentación de la base no establece que estos valores representen ausencia de parqueaderos, no se interpretaron los valores faltantes como cero.

Dado que parqueaderos será utilizada posteriormente en el análisis de componentes principales y en el análisis de conglomerados, se realizó una imputación mediante la mediana de los valores observados. La mediana corresponde a 2 parqueaderos y permite conservar las observaciones disponibles sin asumir que los valores faltantes representan una categoría específica.

Por otra parte, la variable piso presenta 2.638 valores faltantes (31,70 %). Esta variable no se imputará en este momento, debido a que no será utilizada como variable cuantitativa en el análisis de componentes principales ni en el análisis de conglomerados. Sin embargo, se conservará en la base para posibles análisis posteriores.

## [1] 0
colSums(is.na(vivienda_limpia))
##           id         zona         piso      estrato      preciom    areaconst 
##            3            3         2638            3            2            3 
## parqueaderos       banios habitaciones         tipo       barrio     longitud 
##            0            3            3            3            3            3 
##      latitud 
##            3

Asimismo, se realiza el tratamiento de faltantes para las variables que tienen entre 2 y 3 faltantes, donde se eliminan debido a que representan menos del 0,5% de la data, por lo que no afecta el tamaño de la muestra.

## [1] 8319   13
##      preciom    areaconst parqueaderos       banios habitaciones 
##            0            0            0            0            0

Como resultado del tratamiento de los valores faltantes, la base analítica pasó de 8.322 a 8.319 observaciones. La reducción corresponde únicamente a tres registros que presentaban valores faltantes en las variables cuantitativas seleccionadas para el análisis multivariado.

Finalmente, se verificó que las cinco variables seleccionadas para estos análisis (preciom, areaconst, parqueaderos, banios y habitaciones) no presentan valores faltantes en la base analítica.

3.4 Registros duplicados

## [1] 0

Como se observa en el resultado la base de datos, no se encontraron registros duplicados, por lo que no es necesario realizar alguna eliminación adicional.

3.5 Estadísticos descriptivos

En esta etapa se observara como se comportan las variables.

##     preciom         areaconst       parqueaderos        banios      
##  Min.   :  58.0   Min.   :  30.0   Min.   : 1.000   Min.   : 0.000  
##  1st Qu.: 220.0   1st Qu.:  80.0   1st Qu.: 1.000   1st Qu.: 2.000  
##  Median : 330.0   Median : 123.0   Median : 2.000   Median : 3.000  
##  Mean   : 433.9   Mean   : 174.9   Mean   : 1.867   Mean   : 3.111  
##  3rd Qu.: 540.0   3rd Qu.: 229.0   3rd Qu.: 2.000   3rd Qu.: 4.000  
##  Max.   :1999.0   Max.   :1745.0   Max.   :10.000   Max.   :10.000  
##   habitaciones   
##  Min.   : 0.000  
##  1st Qu.: 3.000  
##  Median : 3.000  
##  Mean   : 3.605  
##  3rd Qu.: 4.000  
##  Max.   :10.000
Estadísticos descriptivos de las variables cuantitativas
Variable Media Mediana Desviacion Minimo Maximo
Precio (millones de pesos) 433.90 330 328.67 58 1999
Área construida (m²) 174.93 123 142.96 30 1745
Parqueaderos 1.87 2 1.01 1 10
Baños 3.11 3 1.43 0 10
Habitaciones 3.61 3 1.46 0 10

Los resultados muestran diferencias importantes en la distribución de las características de las viviendas. El precio presenta una media de 433,90 millones de pesos y una mediana de 330 millones, lo que indica una diferencia considerable entre ambas medidas. Esto sugiere una distribución con valores elevados que incrementan el promedio, situación que puede estar relacionada con la presencia de viviendas de precios altos.

El área construida presenta un comportamiento similar. La media es de 174,93 m², mientras que la mediana es de 123 m². La diferencia entre ambas medidas indica una distribución con viviendas de áreas considerablemente superiores al valor central observado. El rango también es amplio, desde 30 m² hasta 1.745 m².

En cuanto al número de parqueaderos, las viviendas presentan una media de 1,87 y una mediana de 2, con valores entre 1 y 10. Esto indica que la oferta se concentra principalmente alrededor de uno o dos parqueaderos por vivienda.

En conjunto, los resultados evidencian una importante heterogeneidad en la oferta inmobiliaria, especialmente en el precio y el área construida. Esta variabilidad justifica la aplicación posterior de técnicas multivariadas como el análisis de componentes principales y el análisis de conglomerados, con el propósito de identificar las principales dimensiones de variación y segmentar las viviendas según sus características.

Sin embargo, durante la revisión de los estadísticos descriptivos se identificaron valores de cero en las variables banios y habitaciones. La inspección de estos registros mostró casos como viviendas con varios baños pero cero habitaciones, así como viviendas de áreas considerablemente grandes con cero baños y habitaciones. Debido a que estos valores no resultan consistentes con las características esperadas de una vivienda, se consideraron como valores no válidos y se realizara la transformación en valores faltantes.

Posteriormente, los valores faltantes de banios y habitaciones seran imputados mediante la mediana de cada variable. Esta estrategia permite conservar las observaciones y reducir la influencia de valores extremos sobre las medidas de tendencia central.

3.5.1 Tratamiento de las variables baños y habitaciones

Dimensiones finales de la base

## [1] 8319   13

Despues del tratamiento se puede observar que el minimo para balos y habitaciones ahora es 1, lo cual, es razonable en la perspectiva de una vivienda y el número de registros se mantiene, sin perder información que puede ser importante en el análisis.

##     preciom         areaconst       parqueaderos        banios      
##  Min.   :  58.0   Min.   :  30.0   Min.   : 1.000   Min.   : 1.000  
##  1st Qu.: 220.0   1st Qu.:  80.0   1st Qu.: 1.000   1st Qu.: 2.000  
##  Median : 330.0   Median : 123.0   Median : 2.000   Median : 3.000  
##  Mean   : 433.9   Mean   : 174.9   Mean   : 1.867   Mean   : 3.128  
##  3rd Qu.: 540.0   3rd Qu.: 229.0   3rd Qu.: 2.000   3rd Qu.: 4.000  
##  Max.   :1999.0   Max.   :1745.0   Max.   :10.000   Max.   :10.000  
##   habitaciones   
##  Min.   : 1.000  
##  1st Qu.: 3.000  
##  Median : 3.000  
##  Mean   : 3.629  
##  3rd Qu.: 4.000  
##  Max.   :10.000

3.5.2 Distribución de las variables cuantitativas

Para complementar los estadísticos descriptivos, se analizará la distribución de las variables cuantitativas mediante histogramas.

Los histogramas permiten observar la distribución de las cinco variables cuantitativas analizadas. El precio y el área construida presentan distribuciones asimétricas con sesgo positivo, concentrando la mayoría de las observaciones en valores bajos y presentando una cola extendida hacia valores elevados. Esta asimetría explica la diferencia observada entre la media y la mediana en ambas variables.

Por su parte, el número de parqueaderos, baños y habitaciones presentan distribuciones con una mayor concentración en valores específicos: la mayoría de las viviendas tienen entre 1 y 2 parqueaderos, entre 2 y 3 baños, y entre 3 y 4 habitaciones. Esta información complementa los estadísticos descriptivos y confirma la heterogeneidad de la oferta inmobiliaria analizada.

3.5.3 Variables categóricas

Se realiza la distribucción para las variables categóricas

Zona

Distribución de las viviendas según zona
Categoria Frecuencia Porcentaje
Zona Centro 124 1.49
Zona Norte 1920 23.08
Zona Oeste 1198 14.40
Zona Oriente 351 4.22
Zona Sur 4726 56.81

En cuanto a la zona, se observa una marcada concentración de la oferta en la Zona Sur, que representa el 56,81 % de las viviendas analizadas, seguida por la Zona Norte con 23,08 % y la Zona Oeste con 14,40 %. Las zonas Oriente y Centro presentan una participación considerablemente menor, con 4,22 % y 1,49 %, respectivamente.

Tipo de vivienda

Distribución de las viviendas según tipo
Categoria Frecuencia Porcentaje
Apartamento 5100 61.31
Casa 3219 38.69

En el tipo de vivienda, los apartamentos representan el 61,31 % de las observaciones, mientras que las casas corresponden al 38,69 %. Esto indica un predominio de la oferta de apartamentos dentro de la base analizada.

Estrato

Distribución de las viviendas según estrato socioeconómico
Categoria Frecuencia Porcentaje
3 1453 17.47
4 2129 25.59
5 2750 33.06
6 1987 23.89

En relación con el estrato socioeconómico, la mayor proporción corresponde al estrato 5, con 33,06 %, seguido del estrato 4 con 25,59 % y el estrato 6 con 23,89 %. El estrato 3 representa el 17,47 % de las viviendas. Por tanto, la información disponible presenta una mayor concentración en los estratos 4, 5 y 6.

Barrio

Diez barrios con mayor número de viviendas
Categoria Frecuencia Porcentaje
415 valle del lili 1008 12.12
107 ciudad jardín 516 6.20
299 pance 409 4.92
212 la flora 366 4.40
378 santa teresita 262 3.15
143 el caney 208 2.50
152 el ingenio 202 2.43
217 la hacienda 164 1.97
3 acopi 158 1.90
254 los cristales 154 1.85

Por ultimo, la variable barrio presenta 436 categorías diferentes. Debido a la elevada cantidad de categorías, se presentan los diez barrios con mayor número de viviendas. Valle del Lili concentra la mayor cantidad de observaciones, con 1.008 viviendas (12,12 %), seguido de Ciudad Jardín con 516 (6,20 %) y Pance con 409 (4,92 %). Esta diversidad de barrios evidencia una importante heterogeneidad espacial dentro de la oferta inmobiliaria analizada.

Gráfica de variables categóricas

Las gráficas revelan una clara concentración de la oferta inmobiliaria en la Zona Sur, que agrupa más de 4.500 viviendas, seguida por la Zona Norte y Zona Oeste. En cuanto al tipo de vivienda, los apartamentos predominan sobre las casas, representando aproximadamente el 61% de la oferta total.

Por estrato socioeconómico, se observa una mayor participación en los estratos 4, 5 y 6, con el estrato 5 como el más representativo. Finalmente, Valle del Lili, Ciudad Jardín y Pance son los barrios con mayor número de viviendas, lo que evidencia una oferta concentrada en sectores específicos de la ciudad.

3.6 Valores atípicos

Los diagramas de caja permiten identificar la presencia de valores atípicos en las variables cuantitativas. Se observa que todas las variables presentan observaciones que superan el límite superior definido por el criterio del rango intercuartílico, especialmente en las variables de precio, área construida y número de habitaciones.

Sin embargo, estos valores no fueron eliminados del análisis, ya que en el contexto inmobiliario propiedades con precios elevados, superficies amplias o un número considerable de habitaciones y parqueaderos corresponden a viviendas reales dentro del mercado. Su inclusión permite preservar la variabilidad natural de los datos y evitar sesgos en los análisis multivariados posteriores.

Identificación de valores atípicos mediante el criterio del IQR
Q1.25% Q3.75% IQR Limite_inferior.25% Limite_superior.75% Numero_atipicos
preciom 220 540 320 -260.0 1020.0 552
areaconst 80 229 149 -143.5 452.5 382
parqueaderos 1 2 1 -0.5 3.5 567
banios 2 4 2 -1.0 7.0 72
habitaciones 3 4 1 1.5 5.5 822

La identificación de valores atípicos se realizó mediante el criterio del rango intercuartílico (IQR), considerando como potencialmente atípicas las observaciones inferiores a Q1 - 1,5(IQR) o superiores a Q3 + 1,5(IQR).

Los resultados muestran la presencia de observaciones atípicas en todas las variables cuantitativas analizadas. El mayor número se presenta en habitaciones, con 822 observaciones, seguido de parqueaderos con 567, preciom con 552 y areaconst con 382. En banios se identificaron 72 observaciones.

Estos resultados deben interpretarse con precaución, debido a que el criterio IQR identifica valores extremos desde una perspectiva estadística, pero no necesariamente representan errores en los datos. En el contexto inmobiliario, propiedades con un precio elevado, una superficie amplia o un número considerable de habitaciones y parqueaderos pueden corresponder a viviendas reales.

Por esta razón, los valores identificados como atípicos no serán eliminados automáticamente. Su tratamiento se determinará considerando su coherencia con el contexto de la información y su posible influencia sobre las técnicas multivariadas que se aplicarán posteriormente.

Por ello se observaran los valores extremos de cada variable del análisis

##  [1] 1999 1950 1950 1950 1940 1900 1900 1900 1900 1900
##  [1] 1745 1600 1586 1500 1500 1440 1365 1250 1200 1200
##  [1] 10 10 10 10 10 10 10 10  9  9
##  [1] 10 10 10 10 10 10 10 10 10  9
##  [1] 10 10 10 10 10 10 10 10 10 10

La revisión de los valores extremos permitió identificar observaciones estadísticamente atípicas en las cinco variables cuantitativas. Sin embargo, los valores máximos observados se encuentran dentro de rangos plausibles para el contexto inmobiliario: el precio máximo es de 1.999 millones de pesos, el área máxima es de 1.745 m² y las variables de parqueaderos, baños y habitaciones alcanzan un máximo de 10.

Por lo anterior, no se encontraron evidencias suficientes para considerar estos valores como errores de registro. En consecuencia, las observaciones atípicas se conservarán en la base de datos para los análisis posteriores. No obstante, su posible influencia será considerada especialmente en el análisis de componentes principales y de conglomerados.

3.7 Correlación

La matriz de correlaciones muestra que todas las variables cuantitativas presentan relaciones positivas entre sí, aunque con diferentes niveles de intensidad.

##              preciom areaconst parqueaderos banios habitaciones
## preciom         1.00      0.69         0.62   0.68         0.27
## areaconst       0.69      1.00         0.52   0.67         0.54
## parqueaderos    0.62      0.52         1.00   0.49         0.25
## banios          0.68      0.67         0.49   1.00         0.59
## habitaciones    0.27      0.54         0.25   0.59         1.00
Matriz de correlación de las variables cuantitativas
preciom areaconst parqueaderos banios habitaciones
preciom 1.00 0.69 0.62 0.68 0.27
areaconst 0.69 1.00 0.52 0.67 0.54
parqueaderos 0.62 0.52 1.00 0.49 0.25
banios 0.68 0.67 0.49 1.00 0.59
habitaciones 0.27 0.54 0.25 0.59 1.00

La relación más alta se observa entre el precio de la vivienda (preciom) y el área construida (areaconst), con una correlación de 0,69. Esto indica que las viviendas con mayor área construida tienden a presentar precios más elevados. De manera similar, el precio presenta correlaciones relativamente fuertes con el número de baños (0,68) y de parqueaderos (0,62).

También se observa una relación importante entre el área construida y el número de baños (0,67), mientras que la relación entre área construida y habitaciones es moderada (0,54). El número de baños y habitaciones presenta igualmente una asociación moderada (0,59).

Las correlaciones más bajas corresponden a precio-habitaciones (0,27) y parqueaderos-habitaciones (0,25), lo que indica una relación lineal más débil entre estas variables.

En general, la presencia de correlaciones moderadas y altas entre varias características de las viviendas indica que existe información compartida entre ellas. Esto proporciona una base adecuada para aplicar el Análisis de Componentes Principales, ya que esta técnica permite resumir la variabilidad conjunta de las variables mediante un número reducido de componentes.

El mapa de calor permite visualizar la intensidad de las asociaciones entre las variables cuantitativas. Los valores más próximos a 1 representan relaciones positivas más fuertes. Se destacan especialmente las relaciones entre precio y área construida, precio y baños, y área construida y baños, en concordancia con los resultados obtenidos en la matriz de correlaciones.

4. Análisis de Componentes Principales (PCA)

El objetivo del PCA en este caso es reducir la dimensionalidad de las cinco variables cuantitativas que caracterizan las viviendas, conservando la mayor cantidad posible de información.

Las variables con las que se trabajaran son:

4.1 Preparación y estandarización de las variables

Debido a que las variables cuantitativas presentan diferentes unidades de medida y escalas de variación, se realizó una estandarización previa al PCA. De esta manera, se evita que las variables con mayor magnitud numérica dominen la construcción de los componentes y se permite que cada característica contribuya de manera comparable al análisis.

## Importance of components:
##                           PC1    PC2     PC3     PC4     PC5
## Standard deviation     1.7785 0.9324 0.66824 0.57596 0.43504
## Proportion of Variance 0.6326 0.1739 0.08931 0.06635 0.03785
## Cumulative Proportion  0.6326 0.8065 0.89580 0.96215 1.00000

La varianza explicada presenta una disminución progresiva entre los componentes principales. El primer componente concentra el 63,26 % de la variabilidad total, mientras que el segundo aporta un 17,39 % adicional. En conjunto, los dos primeros componentes representan el 80,65 % de la variabilidad de las variables analizadas. Los componentes restantes presentan contribuciones menores, por lo que los dos primeros componentes constituyen una representación adecuada de la estructura multidimensional de las viviendas.

4.2 Cargas de los componentes principales

##                    PC1         PC2        PC3          PC4         PC5
## preciom      0.4718238  0.38008355  0.4385339 -0.082706011  0.65860953
## areaconst    0.4899959 -0.06147971  0.2182987  0.758110331 -0.36570292
## parqueaderos 0.4057929  0.50601313 -0.7549056 -0.045235540 -0.08575573
## banios       0.4909868 -0.16515695  0.2490573 -0.645233599 -0.50328844
## habitaciones 0.3626988 -0.75394339 -0.3579408  0.007469311  0.41453778
Cargas de las variables en los dos primeros componentes principales
Variable PC1 PC2
preciom preciom 0.472 0.380
areaconst areaconst 0.490 -0.061
parqueaderos parqueaderos 0.406 0.506
banios banios 0.491 -0.165
habitaciones habitaciones 0.363 -0.754

El primer componente principal (PC1) presenta cargas positivas en todas las variables analizadas. Las mayores contribuciones corresponden al área construida (0,490), número de baños (0,491) y precio de la vivienda (0,472), seguidas por el número de parqueaderos (0,406) y habitaciones (0,363). Esto indica que PC1 representa una dimensión general asociada con el tamaño, el valor económico y el nivel de equipamiento de las viviendas. Por tanto, las propiedades con valores altos en este componente tienden a presentar simultáneamente mayores dimensiones, precios y características habitacionales.

En cuanto a el segundo componente principal (PC2) presenta una estructura diferente. La mayor carga corresponde al número de habitaciones (-0,754), mientras que el número de parqueaderos (0,506) y el precio de la vivienda (0,380) presentan cargas positivas. Esto indica que PC2 establece principalmente un contraste entre las viviendas con mayor número de habitaciones y aquellas que presentan una mayor cantidad de parqueaderos y un mayor precio. El área construida y el número de baños presentan una contribución relativamente baja en este componente.

4.3 Gráfico de las cargas

El gráfico de cargas permite visualizar la contribución de las variables a los dos primeros componentes principales. En el eje PC1 se observa que todas las variables presentan cargas positivas, destacándose el precio, el área construida y el número de baños. Por esta razón, PC1 puede interpretarse como una dimensión general asociada con el tamaño, valor económico y equipamiento de las viviendas.

Por su parte, PC2 presenta una estructura de contraste. El número de habitaciones presenta una carga negativa elevada, mientras que el número de parqueaderos y el precio presentan cargas positivas. Esto indica que este componente diferencia principalmente las viviendas según su composición habitacional frente a características asociadas con el precio y el número de parqueaderos.

La orientación similar de las variables precio, área construida y baños es consistente con las correlaciones observadas previamente, que mostraron asociaciones positivas entre estas características. En conjunto, los dos primeros componentes permiten representar el 80,65 % de la variabilidad de las variables cuantitativas, facilitando la interpretación de la estructura del mercado inmobiliario.

5. Análisis de conglomerados

5.1 Preparación de datos

Se utilizaran las mismas cinco variables numéricas que en el PCA

Se estanderizan las variables debido a que estan en escalas diferentes y asi evitar una posible influencia desproporcionada en la formación de los grupos.

5.2 Matriz de distacias (euclidiana)

¿Cuántos conglomerados se deben utilizar?

Para identificar la similitud entre las viviendas se calculó una matriz de distancias utilizando la distancia euclidiana sobre las variables cuantitativas previamente estandarizadas: precio, área construida, parqueaderos, baños y habitaciones. La estandarización permite que las diferencias entre las variables sean comparables y evita que aquellas expresadas en escalas mayores tengan una influencia desproporcionada en el cálculo de las distancias.

La distancia euclidiana permite cuantificar qué tan diferentes son dos viviendas considerando simultáneamente sus características. Valores pequeños indican mayor similitud, mientras que valores grandes representan mayores diferencias. Por ejemplo, las viviendas 2 y 5 presentan una distancia de 0,28, lo que indica una alta similitud en las características analizadas, mientras que las viviendas 1 y 4 presentan una distancia de 3,57, evidenciando una diferencia considerable.

##          1         2        3        4         5         6
## 1 0.000000 2.2595560 2.154610 3.565448 2.2267491 2.1094465
## 2 2.259556 0.0000000 1.401809 3.120835 0.2781384 0.7846943
## 3 2.154610 1.4018087 0.000000 2.489115 1.5392581 1.7170221
## 4 3.565448 3.1208354 2.489115 0.000000 3.2211089 2.8233357
## 5 2.226749 0.2781384 1.539258 3.221109 0.0000000 0.7122916
## 6 2.109447 0.7846943 1.717022 2.823336 0.7122916 0.0000000

Por ejemplo, la distancia entre las viviendas 2 y 5 es de aproximadamente 0,28, lo que indica una alta similitud entre sus características. En contraste, la distancia entre las viviendas 1 y 4 es de aproximadamente 3,57, evidenciando una diferencia mayor.

Debido al tamaño de la base de datos, que contiene 8.319 viviendas, no se presenta la matriz completa, sino una sección de las primeras seis observaciones como referencia del cálculo realizado.

5.3 Agrupamiento jerárquico

A partir de la matriz de distancias se realizó un agrupamiento jerárquico utilizando el método de Ward. Este procedimiento busca formar conglomerados internamente homogéneos, minimizando el incremento de la variabilidad dentro de los grupos en cada etapa de agrupamiento. De esta manera, las viviendas que presentan características similares tienden a incorporarse al mismo conglomerado.

Este método busca formar grupos en los que las viviendas sean lo más similares posible dentro de cada conglomerado, procurando que la variabilidad interna de los grupos sea pequeña.

5.4 Dendrograma

El resultado del agrupamiento jerárquico se representa mediante un dendrograma. Este gráfico permite observar de manera visual cómo las viviendas se van agrupando progresivamente.

La altura de cada unión representa la distancia a la que se combinan los grupos. Las uniones realizadas a menor altura corresponden a grupos más similares, mientras que las uniones a mayor altura representan grupos con diferencias más marcadas.

El dendrograma muestra el proceso de agrupamiento jerárquico de las 8.319 viviendas. Las líneas verticales en negro representan la fusión de grupos, donde la altura indica la distancia a la que se combinan: uniones a menor altura reflejan mayor similitud entre las viviendas, mientras que uniones a mayor altura indican grupos más diferenciados.

Se observan dos grandes bloques que se separan a una distancia aproximada de 184, y dentro de cada uno se identifican subdivisiones internas. Las líneas de corte en rojo, trazadas a una altura cercana a 85, permiten obtener cuatro conglomerados. Esta decisión se fundamenta en que a partir de este punto las uniones posteriores combinan grupos con diferencias más marcadas, lo que justifica mantener cuatro segmentos como una solución interpretable y manejable para el análisis.

5.4.1 Determinación del número de conglomerados

##  [1]  32.22839  38.54912  38.63181  39.83036  41.72120  46.42411  63.84223
##  [8]  81.19377  85.00540 184.45519

Para determinar el número de conglomerados se analizaron las últimas distancias de fusión obtenidas en el agrupamiento jerárquico. Se observa un incremento importante en las distancias, especialmente entre 85,01 y 184,46. Este aumento indica que la siguiente unión combinaría grupos con características considerablemente diferentes.

Asimismo, alrededor de una distancia de 80 se identifican cuatro grandes grupos antes de las siguientes fusiones. Por esta razón, se seleccionaron cuatro conglomerados como una solución que permite mantener grupos relativamente homogéneos y diferenciados entre sí.

Por esta razón, se seleccionaron cuatro conglomerados, buscando mantener grupos relativamente homogéneos internamente y diferenciados entre sí.

5.5 Distribución de las viviendas

Distribución de las viviendas según conglomerado
Conglomerado Frecuencia Porcentaje
1 3384 40.68
2 3101 37.28
3 788 9.47
4 1046 12.57

5.6 Perfil de los conglomerados

Perfil promedio de los conglomerados
conglomerado preciom areaconst parqueaderos banios habitaciones
1 402.03 163.30 1.72 3.30 3.65
2 207.94 79.06 1.40 1.85 2.78
3 576.08 345.16 2.09 5.21 6.35
4 1099.80 368.56 3.55 4.82 4.04

El conglomerado 1, que concentra el 40,68 % de las viviendas, presenta características intermedias, con un precio promedio de 402,03 millones de pesos y un área construida promedio de 163,30 m².

El conglomerado 2, representa el 37,28 % de las viviendas, corresponde al segmento de menor precio y tamaño. Presenta un precio promedio de 207,94 millones de pesos y un área promedio de 79,06 m², además de los menores promedios de baños y habitaciones.

Mientras el conglomerado 3, presenta el 9,47 % de las viviendas, se caracteriza por presentar viviendas de gran tamaño y una alta capacidad habitacional. Su área promedio es de 345,16 m² y registra los mayores promedios de habitaciones (6,35) y baños (5,21).

Finalmente, el conglomerado 4, que reúne el 12,57 % de las viviendas, representa el segmento de mayor valor económico. Presenta un precio promedio de 1.099,80 millones de pesos, un área de 368,56 m² y el mayor promedio de parqueaderos, con 3,55.

En conjunto, los resultados muestran que la segmentación está determinada principalmente por diferencias en el precio, el tamaño de la vivienda y sus características habitacionales.

5.7 Visualización

El gráfico muestra la distribución de los cuatro conglomerados en el plano definido por los dos primeros componentes principales, que en conjunto explican el 80.65 % de la variabilidad total de las variables cuantitativas. Se observa una separación clara entre los grupos, especialmente en el eje PC1, que representa la dimensión general de tamaño, valor económico y equipamiento de las viviendas.

El conglomerado 2 (celeste) se ubica en el extremo izquierdo del gráfico, correspondiente a viviendas de menor precio y tamaño, mientras que el conglomerado 4 (morado) se concentra en el extremo derecho, representando las viviendas de mayor valor económico. Los conglomerados 1 (rojo) y 3 (verde) ocupan posiciones intermedias; no obstante, el conglomerado 3 presenta una mayor dispersión en el eje PC2, lo que refleja viviendas de gran tamaño pero con características habitacionales diversas. Esta separación confirma que los cuatro conglomerados son estadísticamente distinguibles y que el PCA captura adecuadamente las diferencias entre ellos.

6. Análisis de correspondencia

El análisis de correspondencia se utiliza para explorar las relaciones entre variables categóricas mediante la representación de sus categorías en un espacio de menor dimensión. A diferencia del análisis de componentes principales, que se aplicó sobre variables cuantitativas, el análisis de correspondencia permite estudiar asociaciones entre categorías. Las variable que se utilizaran son:

Ademas, la variable barrio al tener un número de registro tan grande con 436 barrios, se vuelve dificil poder interpretarla y producirla en una gráfica, por lo que se debe llevar con cuidado.

Para este análisis se seleccionaron inicialmente las variables zona y tipo, debido a que presentan un número reducido de categorías y permiten analizar la posible relación entre la ubicación de la vivienda y su tipo.

6.1 Tabla de contingencia

6.1.1 Relación entre zona y tipo de vivienda

Para iniciar el análisis se construyó una tabla de contingencia entre las variables zona y tipo. Esta tabla muestra la frecuencia de casas y apartamentos presentes en cada zona.

Distribución de viviendas según zona y tipo
Apartamento Casa
Zona Centro 24 100
Zona Norte 1198 722
Zona Oeste 1029 169
Zona Oriente 62 289
Zona Sur 2787 1939

6.1.2 Distribución porcentual

Para facilitar la comparación entre las zonas, se calcularon las proporciones de cada tipo de vivienda dentro de cada zona. El cálculo por filas permite comparar la composición de las zonas independientemente de su número total de viviendas.

Porcentaje de tipos de vivienda dentro de cada zona
Apartamento Casa
Zona Centro 19.35 80.65
Zona Norte 62.40 37.60
Zona Oeste 85.89 14.11
Zona Oriente 17.66 82.34
Zona Sur 58.97 41.03

Las proporciones muestran diferencias importantes en la composición del tipo de vivienda según la zona. La zona Oeste presenta el mayor predominio de apartamentos, con 85,89 %, mientras que en las zonas Oriente y Centro predominan las casas, con 82,34 % y 80,65 %, respectivamente.

En las zonas Norte y Sur predominan los apartamentos, aunque la diferencia respecto a las casas es menor. Estos resultados sugieren que el tipo de vivienda podría estar relacionado con la zona de ubicación, por lo que esta relación se evalúa mediante una prueba de independencia.

6.1.3. Prueba de independencia chi-cuadrado

Se aplica la prueba chi-cuadrado de Pearson para determinar si existe independencia entre la zona y el tipo de vivienda. La hipótesis nula establece que ambas variables son independientes, mientras que la hipótesis alternativa plantea que existe una asociación entre ellas.

## 
##  Pearson's Chi-squared test
## 
## data:  tabla_zona_tipo
## X-squared = 690.93, df = 4, p-value < 2.2e-16

El estadístico chi-cuadrado obtenido fue de 690,93 con 4 grados de libertad y un valor p inferior a 2,2 × 10⁻¹⁶. Debido a que el valor p es menor que 0,05, se rechaza la hipótesis nula de independencia.

Por lo tanto, existe evidencia estadísticamente significativa de una asociación entre la zona y el tipo de vivienda. Esto indica que la distribución de casas y apartamentos presenta diferencias entre las zonas de la ciudad.

6.1.4. Análisis de correspondencia

Debido a que la prueba chi-cuadrado evidenció una asociación significativa entre la zona y el tipo de vivienda, se realizó un análisis de correspondencia para identificar cómo se relacionan específicamente las categorías de ambas variables.

Inercia explicada por las dimensiones
Dimension Inercia Porcentaje
1 0.0831 100
2 0.0000 0

La primera dimensión concentra el 100 % de la inercia del análisis, mientras que la segunda presenta una inercia prácticamente nula. Por lo tanto, la asociación entre zona y tipo de vivienda puede representarse completamente mediante una sola dimensión.

Este resultado se explica por la estructura de la tabla de contingencia, ya que la variable tipo posee únicamente dos categorías. En consecuencia, el número máximo de dimensiones efectivas es uno.

6.1.5. Coordenadas de las categorías

Coordenadas de las zonas en la dimensión 1
Zona Dimension1
Zona Centro -0.8613
Zona Norte 0.0224
Zona Oeste 0.5048
Zona Oriente -0.8960
Zona Sur -0.0479
Coordenadas de los tipos de vivienda en la dimensión 1
Tipo Dimension1
Apartamento 0.2290
Casa -0.3627

La categoría Apartamento presenta una coordenada positiva de 0,2290 en la primera dimensión, mientras que Casa presenta una coordenada negativa de -0,3627. Por tanto, la dimensión 1 permite diferenciar principalmente ambos tipos de vivienda.

Al comparar estas posiciones con las coordenadas de las zonas, se observa que Oriente y Centro se ubican en el lado negativo del eje, próximo a la categoría Casa, mientras que Oeste se encuentra en el lado positivo, próximo a Apartamento. Las zonas Norte y Sur presentan coordenadas cercanas al origen, por lo que muestran una asociación menos marcada con alguno de los dos tipos.

La interpretación es consistente con la distribución porcentual observada previamente y permite identificar una relación espacial entre la zona de ubicación y el tipo de vivienda.

Gráfica tipo de vivienda según zona

Para visualizar la asociación entre las categorías de zona y tipo de vivienda, se representan las coordenadas de ambas variables en el espacio de la primera dimensión.

El gráfico de correspondencia confirma visualmente la asociación entre la zona y el tipo de vivienda. La cercanía entre Oeste y Apartamento indica que en esta zona predominan los apartamentos, mientras que Oriente y Centro se ubican cerca de Casa, lo que evidencia una mayor presencia de casas en estas zonas.

Las zonas Norte y Sur se posicionan cerca del origen del eje, lo que sugiere que en estas zonas la distribución entre casas y apartamentos es más equilibrada, sin una marcada preferencia por un tipo específico. Este resultado es consistente con la distribución porcentual y la prueba chi-cuadrado presentadas anteriormente, confirmando que existe una relación espacial entre la ubicación de la vivienda y su tipología.

6.2 Análisis de correspondencia: estrato y tipo de vivienda

6.2.1 Tabla de contingencia

##    
##     Apartamento Casa
##   3         639  814
##   4        1404  725
##   5        1766  984
##   6        1291  696

6.2.2 Distribución porcentual

##    
##     Apartamento  Casa
##   3       43.98 56.02
##   4       65.95 34.05
##   5       64.22 35.78
##   6       64.97 35.03

La distribución porcentual muestra diferencias en el tipo de vivienda según el estrato socioeconómico. En el estrato 3 predominan las casas, que representan el 56,02 % de las viviendas, mientras que los apartamentos representan el 43,98 %.

En los estratos 4, 5 y 6 se observa el patrón contrario, con un predominio de apartamentos. Estos representan el 65,95 % en el estrato 4, el 64,22 % en el estrato 5 y el 64,97 % en el estrato 6.

Estos resultados sugieren que existe una relación entre el estrato socioeconómico y el tipo de vivienda, la cual se evalúa mediante la prueba chi-cuadrado.

6.2.3 Gráfica

##   Estrato        Tipo Porcentaje
## 1       3 Apartamento      43.98
## 2       4 Apartamento      65.95
## 3       5 Apartamento      64.22
## 4       6 Apartamento      64.97
## 5       3        Casa      56.02
## 6       4        Casa      34.05
## 7       5        Casa      35.78
## 8       6        Casa      35.03

La gráfica permite visualizar las diferencias en la composición del tipo de vivienda según el estrato socioeconómico. En el estrato 3 se observa un predominio de casas (56.02 %) sobre apartamentos (43.98 %), mientras que en los estratos 4, 5 y 6 ocurre lo contrario, con una mayor proporción de apartamentos que supera el 60 % en todos los casos.

Este patrón sugiere que a medida que aumenta el estrato socioeconómico, la oferta de vivienda se inclina hacia los apartamentos. Esta relación puede estar asociada a la tipología de vivienda predominante en zonas de estratos medios y altos, donde la oferta de apartamentos es más frecuente, posiblemente por la mayor densidad de construcción en estas áreas.

6.2.4 Prueba chi-cuadrado

## 
##  Pearson's Chi-squared test
## 
## data:  tabla_estrato_tipo
## X-squared = 224.33, df = 3, p-value < 2.2e-16

La prueba chi-cuadrado de Pearson obtuvo un estadístico de 224,33 con 3 grados de libertad y un valor p inferior a 2,2 × 10⁻¹⁶. Debido a que el valor p es menor que 0,05, se rechaza la hipótesis nula de independencia.

Por lo tanto, existe evidencia estadísticamente significativa de una asociación entre el estrato socioeconómico y el tipo de vivienda. La distribución de casas y apartamentos presenta diferencias según el estrato.

6.2.5 Análisis de correspondencia

##    
##     Apartamento Casa
##   3         639  814
##   4        1404  725
##   5        1766  984
##   6        1291  696
Inercia explicada por las dimensiones: Estrato y tipo
Dimension Inercia Porcentaje
1 0.027 100
2 0.000 0

Debido a que la prueba chi-cuadrado evidenció una asociación estadísticamente significativa entre el estrato y el tipo de vivienda, se realizó un análisis de correspondencia para identificar cómo se relacionan las categorías de ambas variables.

La primera dimensión concentra el 100 % de la inercia, con un valor de 0,027, mientras que la segunda dimensión presenta una inercia prácticamente nula. Por lo tanto, la relación entre el estrato socioeconómico y el tipo de vivienda puede representarse completamente mediante una sola dimensión.

6.2.6 Coordenadas

Coordenadas de los estratos en la dimensión 1
Estrato Dimension1
3 -0.3558
4 0.0953
5 0.0598
6 0.0753
Coordenadas del tipo de vivienda en la dimensión 1
Tipo Dimension1
Apartamento 0.1305
Casa -0.2067

La primera dimensión diferencia principalmente el estrato 3 de los estratos 4, 5 y 6. El estrato 3 presenta una coordenada negativa de -0,3558, ubicándose en el mismo lado del eje que la categoría Casa, cuya coordenada es -0,2067.

En contraste, los estratos 4, 5 y 6 presentan coordenadas positivas de 0,0953, 0,0598 y 0,0753, respectivamente, y se ubican en el mismo lado que la categoría Apartamento, cuya coordenada es 0,1305.

Este resultado coincide con la distribución porcentual observada previamente: en el estrato 3 predominan las casas, mientras que en los estratos 4, 5 y 6 predominan los apartamentos. Por tanto, el análisis de correspondencia permite visualizar una asociación entre el estrato socioeconómico y el tipo de vivienda.

Gráfica

El gráfico de correspondencia entre estrato y tipo de vivienda permite visualizar la asociación identificada previamente mediante la prueba chi-cuadrado. La primera dimensión, que concentra el 100 % de la inercia, diferencia claramente el estrato 3 de los estratos 4, 5 y 6.

El estrato 3 se ubica en el lado negativo del eje, en la misma dirección que la categoría Casa, lo que indica que en este estrato predominan las casas. En contraste, los estratos 4, 5 y 6 se sitúan en el lado positivo del eje, junto con la categoría Apartamento, evidenciando que en estos estratos la oferta de apartamentos es mayor. Este patrón sugiere que a medida que aumenta el estrato socioeconómico, la oferta de vivienda se inclina hacia los apartamentos, posiblemente asociado a la tipología de vivienda predominante en zonas de estratos medios y altos.

7. Conclusiones

El análisis realizado permitió obtener una caracterización integral de la oferta inmobiliaria estudiada, evidenciando que las viviendas presentan diferencias importantes tanto en sus características físicas y económicas como en su ubicación y clasificación socioeconómica. Esta heterogeneidad confirma que el mercado analizado está compuesto por perfiles diversos de propiedades y no por un único patrón de vivienda.

Desde la perspectiva cuantitativa, las características relacionadas con el tamaño y el equipamiento de las viviendas presentan una asociación importante con el precio. En particular, la relación entre precio y área construida muestra que las viviendas de mayor tamaño tienden a ubicarse en segmentos de mayor valor. Sin embargo, las diferencias entre las variables indican que el precio no puede analizarse a partir de una sola característica.

La aplicación del PCA permitió sintetizar las cinco variables cuantitativas en un número reducido de dimensiones, facilitando la interpretación conjunta de las características de las viviendas. La primera componente representa principalmente una dimensión asociada con el tamaño, el valor económico y el equipamiento, mientras que la segunda permite diferenciar características relacionadas con las habitaciones frente al precio y los parqueaderos.

La segmentación mediante conglomerados complementó este resultado al evidenciar la existencia de cuatro perfiles diferenciados de viviendas. Los grupos identificados muestran que existen segmentos de menor valor y tamaño, viviendas de características intermedias y propiedades de mayor tamaño y valor económico. Esta diferenciación permite comprender que la oferta inmobiliaria puede analizarse mediante grupos con características relativamente homogéneas.

Por otra parte, las variables categóricas evidenciaron que la distribución de las viviendas no es independiente de su ubicación y estrato socioeconómico. Las diferencias encontradas entre zonas y tipos de vivienda, así como entre estrato y tipo de vivienda, muestran que las características espaciales y socioeconómicas también contribuyen a explicar la composición de la oferta inmobiliaria.

En términos generales, el análisis demuestra la utilidad de combinar diferentes técnicas estadísticas para estudiar fenómenos inmobiliarios. Mientras el análisis de correlación y el PCA permitieron comprender las relaciones entre las características cuantitativas, los conglomerados facilitaron la identificación de perfiles y el análisis de correspondencia permitió interpretar asociaciones entre categorías. Esta integración proporciona una visión más completa del mercado que el análisis individual de cada variable.

8. Recomendaciones

A partir de los hallazgos obtenidos, se plantean las siguientes recomendaciones:

  1. Aplicar estrategias diferenciadas según el perfil de las viviendas. La existencia de cuatro conglomerados sugiere que la oferta inmobiliaria puede abordarse mediante segmentos con características diferentes. En futuros estudios o procesos de comercialización, se recomienda adaptar el análisis a las necesidades y características de cada segmento.

  2. Incorporar la localización en los procesos de valoración. Las diferencias encontradas entre las zonas muestran la importancia de la ubicación dentro del análisis inmobiliario. Por ello, los modelos de valoración y segmentación deberían considerar tanto las características físicas de las viviendas como su localización.

  3. Considerar variables socioeconómicas en futuros análisis. La asociación entre estrato y tipo de vivienda evidencia que las características socioeconómicas aportan información relevante para comprender la composición de la oferta. Su incorporación puede contribuir a obtener segmentaciones más precisas.

  4. Ampliar la información disponible. Para profundizar en el estudio del mercado sería conveniente incorporar variables como antigüedad del inmueble, estado de conservación, administración, características del entorno, distancia a servicios y vías principales, entre otras. Estas variables permitirían analizar factores adicionales asociados con el valor de las viviendas.

  5. Profundizar en el componente espacial. La base dispone de coordenadas geográficas, por lo que futuros estudios podrían utilizar herramientas de análisis espacial para identificar patrones de concentración de precios, áreas construidas y tipos de vivienda, así como posibles diferencias entre sectores de la ciudad.

  6. Desarrollar modelos de valoración inmobiliaria. Los resultados obtenidos pueden servir como punto de partida para investigaciones posteriores orientadas a explicar o predecir el precio de las viviendas mediante modelos estadísticos o de aprendizaje automático.

  7. Actualizar periódicamente la información. Debido a que las condiciones del mercado inmobiliario pueden cambiar con el tiempo, se recomienda actualizar la información y repetir los análisis para determinar si los perfiles y asociaciones identificados se mantienen o presentan modificaciones.