Introducción

El propósito de este trabajo es caracterizar la oferta inmobiliaria urbana a partir de la base vivienda, que contiene información de 8.322 propiedades residenciales publicadas en OLX y recopiladas mediante webscraping.

El análisis busca responder tres preguntas generales: cómo está compuesta la oferta, qué características de los inmuebles se relacionan entre sí y qué segmentos o patrones territoriales pueden identificarse. Para ello se realiza una revisión de calidad de los datos, análisis descriptivo y bivariado, Análisis de Componentes Principales (ACP), Análisis de Conglomerados y Análisis de Correspondencias.

El código se mantiene dentro del archivo RMarkdown para garantizar la reproducibilidad, pero se oculta en el HTML final para facilitar la lectura de los resultados.

1. Carga y exploración de los datos

1.1 Carga de la base

Se carga la base vivienda del paquete paqueteMODELOS. En esta etapa se comprueba el número de registros y las variables disponibles antes de realizar cualquier transformación.

Dimensiones generales de la base de datos
Indicador Valor
Número de viviendas 8322
Número de variables 13

La base contiene 8.322 viviendas y 13 variables. Estas incluyen características físicas, económicas, socioeconómicas y geográficas de los inmuebles.

1.2 Variables disponibles

Variables incluidas en la base
Variable Tipo Ejemplo
id numeric 1147
zona character Zona Oriente
piso character 02
estrato numeric 3
preciom numeric 250
areaconst numeric 70
parqueaderos numeric 1
banios numeric 3
habitaciones numeric 6
tipo character Casa
barrio character 20 de julio
longitud numeric -76.51168
latitud numeric 3.43382

La base combina variables cuantitativas como precio, área, parqueaderos, baños y habitaciones con variables categóricas como zona, tipo y barrio. Esta combinación permite aplicar técnicas multivariadas numéricas y categóricas.

2. Calidad y preparación de los datos

Antes de aplicar los modelos se revisan los valores faltantes y algunos registros que pueden generar problemas de interpretación. El objetivo no es eliminar datos automáticamente, sino documentar su calidad y tomar decisiones justificadas.

2.1 Datos faltantes

Datos faltantes por variable
Variable Datos_faltantes Porcentaje
piso 2638 31.70
parqueaderos 1605 19.29
id 3 0.04
zona 3 0.04
estrato 3 0.04
areaconst 3 0.04
banios 3 0.04
habitaciones 3 0.04
tipo 3 0.04
barrio 3 0.04
longitud 3 0.04
latitud 3 0.04
preciom 2 0.02

La mayoría de las variables presenta menos de 0,05 % de datos faltantes. Las principales excepciones son piso (31,70 %) y parqueaderos (19,29 %). Por esta razón, no se realiza una eliminación general de registros ni una imputación automática.

2.2 Datos faltantes según tipo de vivienda

Se revisa si la falta de información en piso y parqueaderos se concentra de manera diferente entre casas y apartamentos.

Datos faltantes en piso según tipo de vivienda
Tipo Con_dato Faltante Porcentaje_faltante
Apartamento 3719 1381 27.08
Casa 1965 1254 38.96
Datos faltantes en parqueaderos según tipo de vivienda
Tipo Con_dato Faltante Porcentaje_faltante
Apartamento 4231 869 17.04
Casa 2486 733 22.77

La proporción de faltantes es mayor en las casas. Sin embargo, el dato también falta en una cantidad importante de apartamentos, por lo que el tipo de vivienda por sí solo no es suficiente para definir un tratamiento automático.

2.3 Evaluación del patrón de faltantes

Para verificar si la ausencia del dato está asociada con el tipo de vivienda se utiliza la prueba Chi-cuadrado de independencia.

Las hipótesis son:

  • H0: la ausencia del dato es independiente del tipo de vivienda.
  • H1: la ausencia del dato está asociada con el tipo de vivienda.

La V de Cramér complementa la prueba e indica la magnitud de la asociación.

Asociación entre tipo de vivienda y ausencia de información
Variable Chi_cuadrado Grados_libertad P_valor V_Cramer
Piso 128.10 1 < 0,001 0.12
Parqueaderos 41.33 1 < 0,001 0.07

En ambos casos el p-valor es inferior a 0,05, por lo que se rechaza la independencia. No obstante, la V de Cramér es baja. Esto indica que el tipo de vivienda explica solo una parte limitada de la asociación con la ausencia del dato; con este análisis no es posible establecer qué otras variables podrían estar relacionadas.

2.4 Decisiones de preparación

A partir de la revisión anterior se adoptan decisiones conservadoras:

  • piso se conserva en la base original, pero no se utiliza como variable activa en los análisis multivariados numéricos debido a su alta proporción de faltantes.
  • parqueaderos se conserva. Cuando una técnica requiere una matriz completa, se utilizan únicamente los casos completos y se informa cuántos registros permanecen.
  • Los valores extremos no se eliminan automáticamente porque pueden representar segmentos reales del mercado.
  • La base original vivienda se mantiene disponible y las transformaciones necesarias se realizan sobre copias de trabajo.

3. Análisis descriptivo de la oferta

El análisis descriptivo permite conocer la forma general de la base antes de aplicar técnicas multivariadas. Se revisan primero las variables cuantitativas y después las variables categóricas.

3.1 Variables cuantitativas principales

Estadísticos descriptivos de las variables cuantitativas
Variable N Faltantes Media Mediana Desv_Estandar Minimo Q1 Q3 Maximo
Precio 8320 2 433.89 330 328.65 58 220 540 1999
Área construida 8319 3 174.93 123 142.96 30 80 229 1745
Parqueaderos 6717 1605 1.84 2 1.12 1 1 2 10
Baños 8319 3 3.11 3 1.43 0 2 4 10
Habitaciones 8319 3 3.61 3 1.46 0 3 4 10

En precio y área construida la media es mayor que la mediana. Esto muestra una asimetría hacia valores altos: la mayor parte de los inmuebles se concentra en rangos bajos y medios, mientras una proporción menor presenta precios o áreas considerablemente mayores.

3.2 Distribución del precio y del área construida

Los histogramas permiten observar la forma de la distribución y los diagramas de caja facilitan la identificación visual de observaciones alejadas del centro de los datos.

La distribución del precio presenta una cola hacia la derecha. Por tanto, unos pocos inmuebles de precio elevado aumentan el promedio general.

El área construida presenta un comportamiento similar: existe una concentración en tamaños bajos y medios y una cola extendida hacia propiedades de mayor tamaño.

Los gráficos confirman la presencia de observaciones elevadas. Estas observaciones se consideran estadísticamente atípicas, pero no se interpretan de forma automática como errores.

3.3 Valores atípicos mediante el rango intercuartílico

Se utiliza el criterio Q3 + 1,5 × RIC para identificar valores atípicos superiores en precio y área.

Valores atípicos superiores según el criterio del RIC
Variable Limite_superior Numero_atipicos Porcentaje
Precio 1020.0 552 6.63
Área construida 452.5 382 4.59

Se identifican 552 viviendas (6.63 %) con precio atípicamente alto y 382 (4.59 %) con áreas construidas elevadas. Debido a que representan una proporción relevante de la oferta y pueden corresponder a propiedades reales de mayor valor o tamaño, se mantienen en los análisis.

3.4 Revisión de valores cero en baños y habitaciones

Los valores cero pueden ser reales en algunos casos, pero también pueden reflejar información no registrada. Por eso se revisa su frecuencia y coincidencia.

Revisión de valores cero en baños y habitaciones
Situacion Registros
Baños = 0 45
Habitaciones = 0 66
Baños = 0 y habitaciones = 0 35
Solo baños = 0 10
Solo habitaciones = 0 31
Al menos una variable = 0 76

Se encontraron casos poco plausibles, como viviendas grandes registradas con cero baños o cero habitaciones. En los análisis multivariados estos ceros se tratan como posibles faltantes, sin modificar los valores de la base original.

3.5 Variables categóricas

Se revisa la composición de la oferta por tipo de vivienda, zona y estrato.

Composición de la oferta por tipo, zona y estrato
Variable Categoria Frecuencia Porcentaje
Tipo de vivienda Apartamento 5100 61.28
Tipo de vivienda Casa 3219 38.68
Tipo de vivienda NA 3 0.04
Zona Zona Centro 124 1.49
Zona Zona Norte 1920 23.07
Zona Zona Oeste 1198 14.40
Zona Zona Oriente 351 4.22
Zona Zona Sur 4726 56.79
Zona NA 3 0.04
Estrato 3 1453 17.46
Estrato 4 2129 25.58
Estrato 5 2750 33.04
Estrato 6 1987 23.88
Estrato NA 3 0.04

La oferta está compuesta principalmente por apartamentos (61,28 %). La Zona Sur (56,79 %) concentra más de la mitad de los registros y la mayor participación corresponde a los estratos 4, 5 y 6. La base no contiene oferta de estratos 1 y 2, aspecto que debe tenerse presente al generalizar los resultados.

3.6 Estandarización y concentración de barrios

La variable barrio presenta muchas categorías y algunas diferencias de escritura. Para evitar que mayúsculas, tildes o espacios generen categorías artificialmente distintas, se realiza una estandarización básica.

Veinte barrios con mayor número de inmuebles
Barrio Frecuencia Porcentaje
valle del lili 1009 12.13
ciudad jardin 540 6.49
pance 412 4.95
la flora 368 4.42
santa teresita 263 3.16
el caney 209 2.51
el ingenio 203 2.44
la hacienda 166 2.00
normandia 159 1.91
acopi 158 1.90
los cristales 154 1.85
el limonar 135 1.62
prados del norte 127 1.53
el refugio 120 1.44
aguacatal 109 1.31
ciudad 2000 96 1.15
caney 88 1.06
cristales 83 1.00
urbanizacion la flora 83 1.00
brisas de los 82 0.99

Antes de la limpieza se identificaban 436 denominaciones y después quedaron 389 categorías estandarizadas. Los 20 barrios más frecuentes concentran 54.86 % de los registros con barrio informado.

La estandarización reduce diferencias de escritura, aunque no garantiza que denominaciones semánticamente similares, como cristales y los cristales, correspondan necesariamente al mismo barrio. Por ello no se realizan fusiones manuales adicionales sin una validación externa.

4. Análisis bivariado

El análisis bivariado permite estudiar relaciones entre pares de variables antes de pasar a técnicas multivariadas. Se inicia con tipo × zona, porque ambas son variables categóricas y su relación es relevante para comprender la distribución territorial de la oferta.

4.1 Relación entre tipo de vivienda y zona

Las hipótesis de la prueba Chi-cuadrado son:

  • H0: el tipo de vivienda y la zona son independientes.
  • H1: el tipo de vivienda y la zona están asociados.

4.1.1 Tabla de contingencia

Número de inmuebles según tipo de vivienda y zona
Tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
Apartamento 24 1198 1029 62 2787
Casa 100 722 169 289 1939

4.1.2 Distribución territorial de cada tipo

Cada fila de la siguiente tabla suma aproximadamente 100 %. Esto responde a la pregunta: ¿en qué zonas se distribuyen las casas y los apartamentos?

Distribución porcentual de cada tipo de vivienda según zona
Tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
Apartamento 0.47 23.49 20.18 1.22 54.65
Casa 3.11 22.43 5.25 8.98 60.24

La Zona Sur concentra la mayor proporción de casas y apartamentos. La Zona Oeste tiene una participación relativa mucho mayor dentro de los apartamentos que dentro de las casas, mientras que Zona Oriente presenta el comportamiento contrario.

4.1.3 Composición de la oferta dentro de cada zona

Cada columna suma aproximadamente 100 %. Esto responde: ¿qué tipo de vivienda predomina dentro de cada zona?

Composición porcentual del tipo de vivienda dentro de cada zona
Tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
Apartamento 19.35 62.4 85.89 17.66 58.97
Casa 80.65 37.6 14.11 82.34 41.03

La Zona Oeste está compuesta principalmente por apartamentos (85.89 %), mientras que en la Zona Oriente predominan las casas (82.34 %).

4.1.4 Resultado de la prueba

Prueba de asociación entre tipo de vivienda y zona
Indicador Resultado
Chi-cuadrado 690.93
Grados de libertad 4
p-valor < 0,001
V de Cramér 0.288
Frecuencia esperada mínima 47.98

El p-valor es inferior a 0,05, por lo que se rechaza la hipótesis de independencia. Existe una asociación estadísticamente significativa entre el tipo de vivienda y la zona. La V de Cramér es 0.288, que bajo una lectura descriptiva corresponde a una asociación débil.

Desde el punto de vista inmobiliario, esto indica que la composición de la oferta cambia territorialmente y que algunas zonas presentan perfiles más orientados hacia casas o apartamentos.

5. Relaciones entre variables cuantitativas

5.1 Preparación de la base multivariada

Los análisis numéricos posteriores requieren una matriz completa. Se crea una copia de trabajo con precio, área construida, parqueaderos, baños y habitaciones.

Los ceros sospechosos de baños y habitaciones se tratan como datos no informados únicamente en esta copia. Posteriormente se conservan los casos completos para las cinco variables seleccionadas.

Registros disponibles para los análisis multivariados
Indicador Valor
Registros originales 8322.00
Registros utilizados 6688.00
Porcentaje de la base utilizado 80.37

Los análisis multivariados utilizan 6.688 viviendas, equivalentes al 80.37 % de la base original. La reducción se debe principalmente a la ausencia de información en parqueaderos.

5.2 Matriz de correlaciones

La correlación de Pearson permite observar si dos variables cuantitativas tienden a aumentar o disminuir conjuntamente. Valores próximos a 1 indican una relación positiva fuerte; valores próximos a 0 indican poca relación lineal.

Matriz de correlaciones entre características de los inmuebles
Variable Precio Área construida Parqueaderos Baños Habitaciones
Precio 1.000 0.684 0.690 0.681 0.272
Área construida 0.684 1.000 0.588 0.677 0.544
Parqueaderos 0.690 0.588 1.000 0.582 0.293
Baños 0.681 0.677 0.582 1.000 0.601
Habitaciones 0.272 0.544 0.293 0.601 1.000

El precio presenta sus asociaciones lineales más altas con parqueaderos (0.69), área construida (0.684) y baños (0.681).

La relación entre precio y habitaciones es menor (0.272). En esta base, el número de habitaciones por sí solo diferencia menos el precio que el área, los baños o los parqueaderos. Estas relaciones justifican explorar si varias variables pueden resumirse mediante componentes comunes.

6. Análisis de Componentes Principales

6.1 Objetivo

El Análisis de Componentes Principales (ACP) busca reducir la dimensionalidad. En lugar de analizar cinco variables por separado, construye componentes que resumen la mayor cantidad posible de variabilidad de los datos.

6.2 Estandarización y ejecución del modelo

Las variables tienen escalas diferentes. Por esta razón se utiliza scale. = TRUE, de forma que ninguna variable domine el ACP únicamente por tener valores numéricos mayores.

6.3 Varianza explicada

Varianza explicada por los componentes principales
Componente Valor_propio Varianza_explicada Varianza_acumulada
CP1 3.28 65.55 65.55
CP2 0.85 17.04 82.59
CP3 0.36 7.23 89.81
CP4 0.32 6.40 96.22
CP5 0.19 3.78 100.00

El primer componente explica 65.55 % de la variabilidad total. Los dos primeros componentes explican conjuntamente 82.59 %, por lo que una representación en dos dimensiones conserva una proporción alta de la información original.

6.4 Gráfico de sedimentación

El descenso marcado después de los primeros componentes confirma que gran parte de la información se concentra al inicio de la solución.

6.5 Cargas de los componentes

Las cargas muestran el peso de cada variable en la construcción de los componentes. Se interpretan principalmente por su magnitud absoluta y por su dirección.

Cargas de las variables en los componentes principales
Variable PC1 PC2 PC3 PC4 PC5
Precio 0.464 0.420 -0.365 -0.195 -0.661
Área construida 0.481 -0.059 -0.434 0.679 0.339
Parqueaderos 0.435 0.426 0.768 0.169 0.103
Baños 0.487 -0.151 -0.111 -0.684 0.510
Habitaciones 0.355 -0.785 0.276 0.067 -0.421

6.6 Representación de las variables en CP1 y CP2

Este gráfico muestra cómo se ubican las cinco variables originales dentro de los dos primeros componentes principales.

La lectura es:

  • CP1 se interpreta de izquierda a derecha y resume principalmente el tamaño, valor y nivel de dotación del inmueble.
  • CP2 se interpreta de abajo hacia arriba y ayuda a distinguir diferencias en la configuración interna de las viviendas.
  • Variables que apuntan en direcciones parecidas tienen comportamientos semejantes dentro del ACP.
  • Una variable más alejada del origen tiene una participación más marcada en la construcción de estos dos componentes.

En la versión anterior algunas etiquetas quedaban sobrepuestas porque precio y parqueaderos, así como área y baños, tienen coordenadas cercanas. Para facilitar la lectura se amplía únicamente la zona donde realmente se encuentran las variables y se usan flechas con etiquetas desplazadas.

La gráfica permite observar con mayor claridad que precio, área construida, parqueaderos y baños se orientan hacia el lado positivo de CP1. Esto confirma que el primer componente recoge una idea general de viviendas más grandes, más costosas y con mayor dotación.

Habitaciones también aporta a CP1, pero se diferencia con mayor claridad en CP2. Por eso este segundo componente ayuda a separar viviendas que pueden tener un número relativamente alto de habitaciones de otras que, frente a ese número, presentan mayor precio o disponibilidad de parqueaderos.

Lo importante no es leer cada coordenada de forma aislada, sino observar el patrón conjunto: CP1 resume principalmente la escala general del inmueble y CP2 aporta una segunda forma de diferenciar su configuración interna.

6.7 Biplot simplificado

Para evitar un gráfico saturado con miles de etiquetas, se representan las viviendas como puntos y las variables como vectores.

El gráfico resume simultáneamente la posición de los inmuebles y la dirección de las variables que más contribuyen a diferenciarlos.

6.8 Interpretación del ACP

Los dos primeros componentes explican conjuntamente 82.59 % de la variabilidad, lo que permite resumir de manera eficiente las cinco variables originales en dos dimensiones.

En el primer componente, precio, área construida, parqueaderos, baños y habitaciones tienen cargas en la misma dirección. Por ello, CP1 puede interpretarse como una dimensión de tamaño, valor y dotación general del inmueble: las propiedades con puntuaciones altas tienden a ser más grandes, más costosas y mejor dotadas.

En el segundo componente, habitaciones presenta la carga de mayor magnitud y se contrapone principalmente a precio y parqueaderos. Este componente puede interpretarse como una dimensión de configuración interna, que diferencia inmuebles con más habitaciones de otros cuyo precio y disponibilidad de parqueaderos son relativamente mayores respecto a esa cantidad de habitaciones.

En términos prácticos, el ACP muestra que una parte importante de la diversidad del mercado puede entenderse mediante dos ideas sencillas: escala general del inmueble y forma de distribución de sus características internas.

6.9 Síntesis del ACP

La preparación de los datos, la matriz de correlaciones y el ACP muestran que las características físicas y económicas no actúan de forma aislada. El siguiente paso es utilizar esta estructura para identificar grupos de propiedades con perfiles similares.

7. Análisis de Conglomerados

7.1 Objetivo

El Análisis de Conglomerados busca segmentar las viviendas en grupos internamente similares y diferentes entre sí. Se utilizan las mismas cinco variables cuantitativas del ACP para mantener coherencia entre las técnicas.

7.2 Estandarización

K-means y las distancias son sensibles a la escala de las variables. Por ello se trabaja con la matriz estandarizada.

7.3 Exploración jerárquica

Como la base multivariada contiene miles de viviendas, construir y mostrar un dendrograma con todos los registros produciría un gráfico demasiado denso. Por esa razón se utiliza una muestra reproducible de hasta 1.500 viviendas para explorar la estructura general de los datos.

El procedimiento utiliza:

  • distancia euclidiana, para medir qué tan diferentes son dos viviendas a partir de las variables estandarizadas;
  • método de Ward, que va uniendo grupos procurando que cada nuevo grupo sea internamente lo más homogéneo posible.

En un dendrograma, cada vivienda comienza en la parte inferior. A medida que se sube en el gráfico, viviendas o grupos similares se van uniendo. Cuando una unión ocurre a una altura elevada, significa que los grupos que se están combinando eran relativamente diferentes.

Para que la figura sea legible en el HTML se usa una submuestra únicamente para la visualización del dendrograma. Esto no cambia la metodología posterior: el método del codo y Silhouette continúan utilizando la muestra de hasta 1.500 viviendas, y el K-means final se ejecuta sobre todos los registros disponibles.

Los rectángulos de colores muestran tres grupos únicamente como referencia visual. En este punto todavía no se está afirmando que tres sea el número definitivo de conglomerados.

El dendrograma permite ver que algunas ramas se unen a alturas bajas, lo que indica viviendas relativamente parecidas, mientras que otras ramas solo se integran a mayores distancias. Esa separación sugiere que la base contiene perfiles diferenciados y justifica continuar con una validación más objetiva.

Por esta razón, la decisión final sobre el número de segmentos no se toma solo con esta figura. En los siguientes apartados se complementa con el método del codo y con el coeficiente Silhouette.

7.4 Método del codo

Para mantener una ejecución rápida, el método del codo se calcula sobre la misma muestra utilizada en el análisis jerárquico. La segmentación final se realiza posteriormente sobre todos los registros disponibles.

El gráfico permite identificar a partir de qué número de grupos la reducción de la variabilidad interna empieza a ser menos pronunciada.

7.5 Validación mediante Silhouette

Se comparan soluciones de 3, 4 y 5 grupos. El coeficiente Silhouette combina cohesión interna y separación entre grupos; valores mayores indican una mejor estructura relativa.

Comparación del coeficiente promedio de Silhouette
Numero_clusters Silhouette_promedio
3 0.389
4 0.387
5 0.342

El mayor Silhouette se obtiene con 3 grupos. Por ello se utiliza esa solución para la segmentación final. La diferencia entre alternativas se interpreta junto con la claridad de los perfiles obtenidos, no únicamente con un indicador numérico.

7.6 Segmentación final mediante K-means

K-means se aplica sobre todas las viviendas disponibles en base_multi. Cada propiedad se asigna al centro más cercano y el algoritmo busca reducir la variabilidad dentro de los grupos.

7.7 Tamaño y perfil cuantitativo de los segmentos

Tamaño de los segmentos identificados
Cluster Segmento Numero_viviendas Porcentaje
1 Vivienda compacta / menor valor relativo 3736 55.86
2 Vivienda amplia / nivel intermedio-alto 2118 31.67
3 Vivienda de alto valor / gran dotación 834 12.47
Perfil promedio de los conglomerados inmobiliarios
Cluster Segmento Precio Área construida Parqueaderos Baños Habitaciones
1 Vivienda compacta / menor valor relativo 277.8 97.93 1.29 2.33 2.93
2 Vivienda amplia / nivel intermedio-alto 547.1 230.83 1.97 4.11 4.45
3 Vivienda de alto valor / gran dotación 1123.5 425.48 3.91 5.28 4.63

Los grupos muestran una progresión clara en precio, área y dotación. Esto permite pasar de números de cluster a perfiles que tienen una lectura directa dentro del mercado inmobiliario.

7.8 Centros estandarizados

Los centros de K-means muestran cuánto se encuentra cada grupo por encima o por debajo del promedio general en cada variable.

Centros estandarizados de los conglomerados
Cluster Precio Área construida Parqueaderos Baños Habitaciones
Cluster 1 -0.57 -0.58 -0.48 -0.68 -0.52
Cluster 2 0.23 0.35 0.12 0.62 0.62
Cluster 3 1.95 1.70 1.85 1.47 0.75

Los valores positivos representan características por encima del promedio y los negativos valores por debajo. El segmento de alto valor se distingue porque presenta valores positivos elevados en prácticamente todas las características.

7.9 Relación de los segmentos con variables del mercado

Se recuperan tipo, zona y estrato para describir los grupos desde una perspectiva más cercana al mercado.

7.9.1 Tipo de vivienda

Composición porcentual del tipo de vivienda por segmento
Segmento Apartamento Casa
C1 - Vivienda compacta / menor valor relativo 84.93 15.07
C2 - Vivienda amplia / nivel intermedio-alto 38.76 61.24
C3 - Vivienda de alto valor / gran dotación 26.74 73.26

7.9.2 Zona

Distribución porcentual de las zonas por segmento
Segmento Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
C1 - Vivienda compacta / menor valor relativo 0.78 22.27 11.64 1.93 63.38
C2 - Vivienda amplia / nivel intermedio-alto 1.56 16.76 20.59 4.06 57.03
C3 - Vivienda de alto valor / gran dotación 0.24 10.91 26.74 0.48 61.63

7.9.3 Estrato

Distribución porcentual del estrato por segmento
Segmento 3 4 5 6
C1 - Vivienda compacta / menor valor relativo 12.02 32.90 42.77 12.31
C2 - Vivienda amplia / nivel intermedio-alto 10.53 17.19 34.32 37.96
C3 - Vivienda de alto valor / gran dotación 1.20 4.80 21.94 72.06

El tipo y el estrato ayudan a explicar mejor los perfiles. El primer segmento está compuesto principalmente por apartamentos, mientras que los grupos de mayor valor tienen una participación más alta de casas y de estratos elevados.

7.10 Visualización de los conglomerados sobre el ACP

Los grupos se proyectan sobre los dos primeros componentes principales, que concentran gran parte de la variabilidad de los datos.

La separación no es perfecta, algo esperable en datos inmobiliarios reales, pero el gráfico permite observar perfiles diferenciados principalmente a lo largo de la dimensión general de tamaño, valor y dotación.

7.11 Interpretación del análisis de conglomerados

El análisis identificó 3 segmentos. En la solución obtenida, los perfiles son consistentes y tienen una lectura empresarial clara.

El Cluster 1 reúne la mayor parte de la muestra y presenta los valores medios más bajos de precio, área, parqueaderos y baños. Está compuesto principalmente por apartamentos, por lo que se interpreta como vivienda compacta de menor valor relativo.

El Cluster 2 presenta valores intermedios de precio y área, mayor número de baños y habitaciones y una participación más alta de casas. Se interpreta como vivienda amplia de nivel intermedio-alto.

El Cluster 3 presenta los promedios más altos de precio, área, parqueaderos y baños. Además, se concentra en mayor medida en casas y estrato 6. Se interpreta como vivienda de alto valor y gran dotación.

Esta segmentación muestra que la oferta no es homogénea. Para una inmobiliaria, los tres perfiles pueden apoyar estrategias diferenciadas de valoración, comercialización y priorización del portafolio.

8. Análisis de Correspondencias

8.1 Objetivo

El Análisis de Correspondencias estudia asociaciones entre categorías. En este caso se utiliza para explorar la relación entre tipo de vivienda, zona y barrio, variables que no entraron como variables activas en el ACP.

8.2 Función de cálculo

Para evitar dependencias adicionales se implementa el análisis mediante la descomposición en valores singulares de una tabla de contingencia normalizada. El código se mantiene oculto en el HTML.

8.3 Correspondencia entre tipo de vivienda y zona

La relación tipo × zona ya mostró asociación mediante Chi-cuadrado. El Análisis de Correspondencias permite representar la estructura de esa asociación.

Inercia del Análisis de Correspondencias entre tipo y zona
Dimension Inercia
Dimensión 1 100
Coordenadas de las categorías tipo y zona
Categoria Variable Dimension_1
Apartamento Tipo -0.229
Casa Tipo 0.363
Zona Centro Zona 0.861
Zona Norte Zona -0.022
Zona Oeste Zona -0.505
Zona Oriente Zona 0.896
Zona Sur Zona 0.048

Como tipo tiene dos categorías, existe una sola dimensión efectiva y esta explica el 100 % de la inercia. Las coordenadas complementan la lectura de los porcentajes del análisis bivariado y muestran qué zonas tienen perfiles más cercanos a casas o apartamentos.

8.4 Preparación de los barrios

El número de barrios es elevado. Para obtener una visualización legible se utilizan los 20 barrios estandarizados con mayor número de registros. Esta selección se utiliza únicamente para el análisis gráfico y no implica eliminar los demás barrios de la base.

8.5 Correspondencia entre tipo de vivienda y barrio

Barrios más próximos a los perfiles de casa y apartamento
Perfil Barrios
Más próximos al perfil Apartamento valle del lili, cristales, prados del norte, los cristales, brisas de los
Más próximos al perfil Casa ciudad jardin, el limonar, pance, acopi, el caney

Entre los barrios con mayor presencia en la base se observan perfiles diferenciados. Esta lectura no significa que un barrio contenga exclusivamente casas o apartamentos; indica que su estructura relativa de oferta se acerca más a uno de esos perfiles.

8.6 Correspondencia entre zona y barrio

Inercia explicada en la correspondencia entre zona y barrio
Dimension Inercia Inercia_acumulada
Dimensión 1 49.88 49.88
Dimensión 2 49.68 99.56
Dimensión 3 0.34 99.89
Dimensión 4 0.11 100.00

Los dos primeros ejes explican conjuntamente 99.56 % de la inercia total. Por tanto, el plano bidimensional representa casi toda la estructura de asociación entre las zonas y los barrios seleccionados.

8.7 Mapa de correspondencias zona - barrio

El mapa de correspondencias resume gráficamente la relación entre las zonas y los 20 barrios más frecuentes de la base.

Los dos primeros ejes explican conjuntamente 99.56 % de la inercia. Esto significa que el plano de dos dimensiones conserva prácticamente toda la estructura de asociación encontrada en la tabla zona × barrio.

Para leer el gráfico conviene tener presentes tres ideas:

  • El origen (0,0) representa un perfil cercano al promedio.
  • Las categorías que se alejan del origen son las que más ayudan a diferenciar la estructura territorial.
  • Categorías ubicadas en direcciones semejantes presentan patrones de asociación parecidos. El gráfico debe interpretarse como una representación exploratoria, no como una distancia geográfica real entre una zona y un barrio.

En la versión anterior los 20 identificadores se concentraban en pocos puntos y resultaban difíciles de leer. Para mejorar la visualización se mantienen todos los barrios como puntos, pero solo se etiquetan los 10 barrios más alejados del origen, ya que son los que mejor ayudan a diferenciar los patrones del mapa.

Barrios destacados en el mapa

La siguiente tabla permite identificar los números que aparecen en el gráfico. Se muestran únicamente los diez barrios más alejados del origen, porque son los que más ayudan a diferenciar la estructura territorial.

Barrios destacados en el mapa de correspondencias
ID Barrio Dimension_1 Dimension_2 Distancia_origen
14 los cristales -1.184 -1.905 2.243
15 normandia -1.172 -1.892 2.226
2 aguacatal -1.166 -1.886 2.218
7 cristales -1.165 -1.840 2.178
18 santa teresita -1.143 -1.834 2.161
19 urbanizacion la flora -1.532 1.478 2.129
3 brisas de los -1.532 1.478 2.129
12 la flora -1.526 1.474 2.122
1 acopi -1.518 1.469 2.112
17 prados del norte -1.530 1.451 2.109

En términos sencillos, el gráfico permite reconocer tres patrones territoriales principales. La Zona Oeste aparece claramente separada, mientras que Centro y Norte se ubican en una dirección semejante. Oriente y Sur se encuentran hacia el lado opuesto del primer eje y también presentan posiciones relativamente próximas entre sí.

Estas posiciones no significan que dos zonas sean iguales, sino que los barrios seleccionados se distribuyen de forma diferente entre ellas. La utilidad del mapa es mostrar esas diferencias de manera resumida y visual.

8.8 Síntesis del Análisis de Correspondencias

El análisis confirma que la oferta también presenta una dimensión territorial. La relación tipo × zona es coherente con la prueba Chi-cuadrado, mientras que los cruces con barrio permiten reconocer perfiles locales más asociados con casas o apartamentos y agrupaciones territoriales de oferta.

Esta técnica complementa el ACP y los conglomerados porque incorpora variables categóricas que no fueron utilizadas como variables activas en los modelos numéricos.

9. Visualización geográfica de los segmentos

Después de identificar los tres segmentos mediante K-means, se utiliza la información de longitud y latitud para observar dónde se localizan las viviendas de cada perfil.

Esta sección cumple una función diferente al mapa de correspondencias del punto anterior. El Análisis de Correspondencias representa relaciones estadísticas entre categorías; en cambio, esta figura utiliza las coordenadas reales registradas en la base para mostrar la distribución espacial de las propiedades.

El objetivo no es construir un mapa de calles ni reemplazar un sistema de información geográfica. Se busca responder una pregunta más sencilla:

¿Los segmentos inmobiliarios aparecen concentrados en ciertas partes de la ciudad o tienden a coexistir en el territorio?

9.1 Cómo leer la visualización

Cada punto representa una vivienda incluida en el análisis multivariado.

  • La posición horizontal corresponde a la longitud: hacia la izquierda se encuentran ubicaciones más occidentales y hacia la derecha más orientales.
  • La posición vertical corresponde a la latitud: los puntos más altos se encuentran más al norte y los más bajos más al sur.
  • El color y la forma identifican el segmento obtenido mediante K-means.
  • Cuando varios colores aparecen mezclados en una misma zona, significa que en ese sector conviven distintos perfiles de vivienda.
  • Cuando un color se concentra con mayor intensidad en un área, indica una mayor presencia relativa de ese segmento en esa parte de la ciudad.

9.2 Distribución espacial de los segmentos

Para mejorar la lectura se utiliza un símbolo diferente para cada segmento y se reduce la opacidad de los puntos. También se incorporan los nombres de las zonas en su posición media aproximada.

La figura muestra que los segmentos no están completamente separados por ubicación. En distintas partes de la ciudad aparecen puntos de varios colores, lo que indica que las características físicas y económicas utilizadas para construir los conglomerados no dependen únicamente de la zona.

Sin embargo, también se observan concentraciones locales. El segmento de vivienda compacta tiene una presencia amplia en diferentes sectores, mientras que los segmentos de mayor tamaño y valor presentan concentraciones más específicas.

9.3 Composición de los segmentos dentro de cada zona

El gráfico ayuda a reconocer patrones, pero una tabla permite cuantificar mejor lo que se observa visualmente. Los porcentajes siguientes se calculan dentro de cada zona, por lo que cada fila suma aproximadamente 100 %.

Composición porcentual de los segmentos dentro de cada zona
Zona Cluster 1 Cluster 2 Cluster 3
Zona Centro 45.31 51.56 3.12
Zona Norte 65.10 27.78 7.12
Zona Oeste 39.76 39.85 20.38
Zona Oriente 44.44 53.09 2.47
Zona Sur 57.90 29.54 12.57

Esta tabla debe leerse junto con los perfiles definidos en el punto 7:

  • Cluster 1: vivienda compacta y de menor valor relativo.
  • Cluster 2: vivienda amplia de nivel intermedio-alto.
  • Cluster 3: vivienda de alto valor y gran dotación.

De esta manera, no solo se observa dónde están los puntos, sino también qué peso tiene cada segmento dentro de las diferentes zonas.

9.4 Interpretación territorial

La principal conclusión de esta visualización es que la ubicación aporta información importante, pero no explica por sí sola la segmentación del mercado.

Dos viviendas ubicadas en una misma zona pueden pertenecer a segmentos distintos porque sus diferencias de precio, área, baños, habitaciones o parqueaderos son suficientemente grandes. De la misma forma, viviendas con características similares pueden aparecer en diferentes zonas.

Para la empresa inmobiliaria esto es relevante porque sugiere que una estrategia comercial no debería construirse únicamente con criterios geográficos. La zona debe combinarse con el perfil del inmueble. Por ejemplo, dentro de una misma zona pueden requerirse estrategias diferentes para una vivienda compacta y para una propiedad de alto valor.

Por tanto, la visualización geográfica complementa los análisis anteriores: ACP resume las características, K-means identifica los segmentos y las coordenadas permiten observar cómo esos segmentos se distribuyen en el territorio.

10. Integración de los principales resultados

Las técnicas aplicadas responden a preguntas diferentes, pero sus resultados son complementarios.

Síntesis de los principales resultados
Analisis Hallazgo_principal Lectura_para_la_empresa
Caracterización de la oferta Predominan los apartamentos y la oferta se concentra especialmente en la Zona Sur. El mercado analizado no tiene una composición uniforme entre tipos, zonas y estratos.
Relaciones cuantitativas El precio se relaciona principalmente con parqueaderos (0.69), área construida (0.684) y baños (0.681). Área, baños y parqueaderos son variables especialmente útiles para diferenciar la oferta por precio.
ACP Los dos primeros componentes explican 82.59 % de la variabilidad. La estructura cuantitativa puede resumirse de forma clara en pocas dimensiones.
Conglomerados Se identificaron 3 segmentos con perfiles diferenciados de tamaño, precio y dotación. El portafolio puede gestionarse mediante perfiles comerciales distintos.
Correspondencias Los dos primeros ejes de zona × barrio explican 99.56 % de la inercia. La localización y el barrio complementan las características físicas para entender la oferta.

En conjunto, los resultados muestran que la oferta inmobiliaria no constituye un mercado homogéneo. Las características físicas, el precio, el tipo de inmueble, el estrato y la localización se combinan para formar perfiles diferenciados.

11. Recomendaciones estratégicas

A partir de los resultados se plantean recomendaciones directamente relacionadas con el problema de la empresa inmobiliaria:

  1. Gestionar el portafolio por segmentos.
    Diferenciar la estrategia para viviendas compactas, propiedades amplias de nivel intermedio-alto y viviendas de alto valor.

  2. Dar especial atención al área, los baños y los parqueaderos en la valoración.
    Estas características presentan relaciones importantes con el precio y contribuyen a diferenciar los inmuebles.

  3. Aplicar estrategias comerciales según el territorio.
    La composición entre casas y apartamentos cambia entre zonas y algunos barrios presentan perfiles de oferta claramente diferenciados.

  4. Diseñar una estrategia específica para el segmento de alto valor.
    Aunque representa una proporción menor de la oferta, reúne propiedades con mayor precio, tamaño, parqueaderos y baños.

  5. Mejorar el registro de la información.
    Variables como piso, parqueaderos, baños, habitaciones y barrio requieren controles de calidad más consistentes para futuros análisis.

  6. Complementar en el futuro los datos de oferta con transacciones reales.
    Incorporar precios efectivos de venta y tiempos de permanencia permitiría evaluar con mayor precisión la dinámica del mercado.

12. Limitaciones del análisis

Los resultados deben interpretarse considerando las siguientes limitaciones:

  • Los datos provienen de publicaciones inmobiliarias y representan oferta, no necesariamente precios finales de transacción.
  • piso y parqueaderos presentan proporciones relevantes de información faltante.
  • Se encontraron valores cero potencialmente inconsistentes en baños y habitaciones.
  • La base no contiene inmuebles de estratos 1 y 2, por lo que no representa todos los segmentos socioeconómicos del mercado residencial.
  • Los análisis multivariados utilizan aproximadamente 80.37 % de la base, correspondiente a los registros completos en las cinco variables seleccionadas.
  • El Análisis de Correspondencias con barrio se concentra en los 20 barrios más frecuentes para mantener una visualización interpretable.
  • La limpieza de nombres corrige diferencias de escritura, pero algunas denominaciones similares pueden requerir validación territorial adicional.

13. Conclusiones

El análisis permitió caracterizar la oferta inmobiliaria mediante técnicas descriptivas, bivariadas y multivariadas.

El ACP mostró que los dos primeros componentes explican 82.59 % de la variabilidad de las cinco características cuantitativas. Esto permite resumir buena parte de la estructura de los inmuebles mediante una dimensión general de tamaño, valor y dotación y una segunda dimensión asociada con su configuración interna.

El Análisis de Conglomerados identificó 3 segmentos con características diferenciadas. La solución separa una oferta mayoritaria de viviendas compactas, un segmento de propiedades más amplias de nivel intermedio-alto y un grupo de inmuebles de alto valor y gran dotación.

El Análisis de Correspondencias mostró que la composición de la oferta también cambia territorialmente. Los primeros ejes de la relación entre zona y barrio resumen casi toda la inercia del cruce, lo que permite representar de forma clara la estructura de las categorías analizadas.

En conjunto, los resultados muestran que la valoración y comercialización de los inmuebles no deberían apoyarse únicamente en el precio. El tamaño, la dotación, el tipo de vivienda, el estrato y la localización aportan información complementaria para comprender los distintos perfiles del mercado.

14. Anexo técnico

El siguiente cuadro resume las técnicas utilizadas y las variables principales incluidas en cada etapa.

Resumen técnico de los análisis realizados
Tecnica Variables_principales Objetivo
Análisis descriptivo Precio, área, parqueaderos, baños, habitaciones, tipo, zona, estrato y barrio Caracterizar la oferta y revisar la calidad de los datos
Chi-cuadrado y V de Cramér Tipo de vivienda y zona; tipo y patrón de faltantes Evaluar asociación entre variables categóricas
Correlación de Pearson Precio, área, parqueaderos, baños y habitaciones Medir relaciones lineales entre variables cuantitativas
ACP Precio, área, parqueaderos, baños y habitaciones Reducir dimensionalidad
Conglomerados Precio, área, parqueaderos, baños y habitaciones Identificar segmentos homogéneos
Correspondencias Tipo, zona y barrio Explorar relaciones entre categorías
Visualización geográfica Longitud, latitud y cluster Observar la distribución espacial de los segmentos