El propósito de este trabajo es caracterizar la oferta inmobiliaria
urbana a partir de la base vivienda, que contiene
información de 8.322 propiedades residenciales
publicadas en OLX y recopiladas mediante webscraping.
El análisis busca responder tres preguntas generales: cómo está compuesta la oferta, qué características de los inmuebles se relacionan entre sí y qué segmentos o patrones territoriales pueden identificarse. Para ello se realiza una revisión de calidad de los datos, análisis descriptivo y bivariado, Análisis de Componentes Principales (ACP), Análisis de Conglomerados y Análisis de Correspondencias.
El código se mantiene dentro del archivo RMarkdown para garantizar la reproducibilidad, pero se oculta en el HTML final para facilitar la lectura de los resultados.
Se carga la base vivienda del paquete
paqueteMODELOS. En esta etapa se comprueba el número de
registros y las variables disponibles antes de realizar cualquier
transformación.
| Indicador | Valor |
|---|---|
| Número de viviendas | 8322 |
| Número de variables | 13 |
La base contiene 8.322 viviendas y 13 variables. Estas incluyen características físicas, económicas, socioeconómicas y geográficas de los inmuebles.
| Variable | Tipo | Ejemplo |
|---|---|---|
| id | numeric | 1147 |
| zona | character | Zona Oriente |
| piso | character | 02 |
| estrato | numeric | 3 |
| preciom | numeric | 250 |
| areaconst | numeric | 70 |
| parqueaderos | numeric | 1 |
| banios | numeric | 3 |
| habitaciones | numeric | 6 |
| tipo | character | Casa |
| barrio | character | 20 de julio |
| longitud | numeric | -76.51168 |
| latitud | numeric | 3.43382 |
La base combina variables cuantitativas como precio, área, parqueaderos, baños y habitaciones con variables categóricas como zona, tipo y barrio. Esta combinación permite aplicar técnicas multivariadas numéricas y categóricas.
Antes de aplicar los modelos se revisan los valores faltantes y algunos registros que pueden generar problemas de interpretación. El objetivo no es eliminar datos automáticamente, sino documentar su calidad y tomar decisiones justificadas.
| Variable | Datos_faltantes | Porcentaje |
|---|---|---|
| piso | 2638 | 31.70 |
| parqueaderos | 1605 | 19.29 |
| id | 3 | 0.04 |
| zona | 3 | 0.04 |
| estrato | 3 | 0.04 |
| areaconst | 3 | 0.04 |
| banios | 3 | 0.04 |
| habitaciones | 3 | 0.04 |
| tipo | 3 | 0.04 |
| barrio | 3 | 0.04 |
| longitud | 3 | 0.04 |
| latitud | 3 | 0.04 |
| preciom | 2 | 0.02 |
La mayoría de las variables presenta menos de 0,05 %
de datos faltantes. Las principales excepciones son piso
(31,70 %) y parqueaderos (19,29
%). Por esta razón, no se realiza una eliminación general de
registros ni una imputación automática.
Se revisa si la falta de información en piso y
parqueaderos se concentra de manera diferente entre casas y
apartamentos.
| Tipo | Con_dato | Faltante | Porcentaje_faltante |
|---|---|---|---|
| Apartamento | 3719 | 1381 | 27.08 |
| Casa | 1965 | 1254 | 38.96 |
| Tipo | Con_dato | Faltante | Porcentaje_faltante |
|---|---|---|---|
| Apartamento | 4231 | 869 | 17.04 |
| Casa | 2486 | 733 | 22.77 |
La proporción de faltantes es mayor en las casas. Sin embargo, el dato también falta en una cantidad importante de apartamentos, por lo que el tipo de vivienda por sí solo no es suficiente para definir un tratamiento automático.
Para verificar si la ausencia del dato está asociada con el tipo de vivienda se utiliza la prueba Chi-cuadrado de independencia.
Las hipótesis son:
La V de Cramér complementa la prueba e indica la magnitud de la asociación.
| Variable | Chi_cuadrado | Grados_libertad | P_valor | V_Cramer |
|---|---|---|---|---|
| Piso | 128.10 | 1 | < 0,001 | 0.12 |
| Parqueaderos | 41.33 | 1 | < 0,001 | 0.07 |
En ambos casos el p-valor es inferior a 0,05, por lo que se rechaza la independencia. No obstante, la V de Cramér es baja. Esto indica que el tipo de vivienda explica solo una parte limitada de la asociación con la ausencia del dato; con este análisis no es posible establecer qué otras variables podrían estar relacionadas.
A partir de la revisión anterior se adoptan decisiones conservadoras:
piso se conserva en la base original, pero no se
utiliza como variable activa en los análisis multivariados numéricos
debido a su alta proporción de faltantes.parqueaderos se conserva. Cuando una técnica requiere
una matriz completa, se utilizan únicamente los casos completos y se
informa cuántos registros permanecen.vivienda se mantiene disponible y las
transformaciones necesarias se realizan sobre copias de trabajo.El análisis descriptivo permite conocer la forma general de la base antes de aplicar técnicas multivariadas. Se revisan primero las variables cuantitativas y después las variables categóricas.
| Variable | N | Faltantes | Media | Mediana | Desv_Estandar | Minimo | Q1 | Q3 | Maximo |
|---|---|---|---|---|---|---|---|---|---|
| Precio | 8320 | 2 | 433.89 | 330 | 328.65 | 58 | 220 | 540 | 1999 |
| Área construida | 8319 | 3 | 174.93 | 123 | 142.96 | 30 | 80 | 229 | 1745 |
| Parqueaderos | 6717 | 1605 | 1.84 | 2 | 1.12 | 1 | 1 | 2 | 10 |
| Baños | 8319 | 3 | 3.11 | 3 | 1.43 | 0 | 2 | 4 | 10 |
| Habitaciones | 8319 | 3 | 3.61 | 3 | 1.46 | 0 | 3 | 4 | 10 |
En precio y área construida la media es mayor que la mediana. Esto muestra una asimetría hacia valores altos: la mayor parte de los inmuebles se concentra en rangos bajos y medios, mientras una proporción menor presenta precios o áreas considerablemente mayores.
Los histogramas permiten observar la forma de la distribución y los diagramas de caja facilitan la identificación visual de observaciones alejadas del centro de los datos.
La distribución del precio presenta una cola hacia la derecha. Por tanto, unos pocos inmuebles de precio elevado aumentan el promedio general.
El área construida presenta un comportamiento similar: existe una concentración en tamaños bajos y medios y una cola extendida hacia propiedades de mayor tamaño.
Los gráficos confirman la presencia de observaciones elevadas. Estas observaciones se consideran estadísticamente atípicas, pero no se interpretan de forma automática como errores.
Se utiliza el criterio Q3 + 1,5 × RIC para identificar valores atípicos superiores en precio y área.
| Variable | Limite_superior | Numero_atipicos | Porcentaje |
|---|---|---|---|
| Precio | 1020.0 | 552 | 6.63 |
| Área construida | 452.5 | 382 | 4.59 |
Se identifican 552 viviendas (6.63 %) con precio atípicamente alto y 382 (4.59 %) con áreas construidas elevadas. Debido a que representan una proporción relevante de la oferta y pueden corresponder a propiedades reales de mayor valor o tamaño, se mantienen en los análisis.
Los valores cero pueden ser reales en algunos casos, pero también pueden reflejar información no registrada. Por eso se revisa su frecuencia y coincidencia.
| Situacion | Registros |
|---|---|
| Baños = 0 | 45 |
| Habitaciones = 0 | 66 |
| Baños = 0 y habitaciones = 0 | 35 |
| Solo baños = 0 | 10 |
| Solo habitaciones = 0 | 31 |
| Al menos una variable = 0 | 76 |
Se encontraron casos poco plausibles, como viviendas grandes registradas con cero baños o cero habitaciones. En los análisis multivariados estos ceros se tratan como posibles faltantes, sin modificar los valores de la base original.
Se revisa la composición de la oferta por tipo de vivienda, zona y estrato.
| Variable | Categoria | Frecuencia | Porcentaje |
|---|---|---|---|
| Tipo de vivienda | Apartamento | 5100 | 61.28 |
| Tipo de vivienda | Casa | 3219 | 38.68 |
| Tipo de vivienda | NA | 3 | 0.04 |
| Zona | Zona Centro | 124 | 1.49 |
| Zona | Zona Norte | 1920 | 23.07 |
| Zona | Zona Oeste | 1198 | 14.40 |
| Zona | Zona Oriente | 351 | 4.22 |
| Zona | Zona Sur | 4726 | 56.79 |
| Zona | NA | 3 | 0.04 |
| Estrato | 3 | 1453 | 17.46 |
| Estrato | 4 | 2129 | 25.58 |
| Estrato | 5 | 2750 | 33.04 |
| Estrato | 6 | 1987 | 23.88 |
| Estrato | NA | 3 | 0.04 |
La oferta está compuesta principalmente por apartamentos (61,28 %). La Zona Sur (56,79 %) concentra más de la mitad de los registros y la mayor participación corresponde a los estratos 4, 5 y 6. La base no contiene oferta de estratos 1 y 2, aspecto que debe tenerse presente al generalizar los resultados.
La variable barrio presenta muchas categorías y algunas
diferencias de escritura. Para evitar que mayúsculas, tildes o espacios
generen categorías artificialmente distintas, se realiza una
estandarización básica.
| Barrio | Frecuencia | Porcentaje |
|---|---|---|
| valle del lili | 1009 | 12.13 |
| ciudad jardin | 540 | 6.49 |
| pance | 412 | 4.95 |
| la flora | 368 | 4.42 |
| santa teresita | 263 | 3.16 |
| el caney | 209 | 2.51 |
| el ingenio | 203 | 2.44 |
| la hacienda | 166 | 2.00 |
| normandia | 159 | 1.91 |
| acopi | 158 | 1.90 |
| los cristales | 154 | 1.85 |
| el limonar | 135 | 1.62 |
| prados del norte | 127 | 1.53 |
| el refugio | 120 | 1.44 |
| aguacatal | 109 | 1.31 |
| ciudad 2000 | 96 | 1.15 |
| caney | 88 | 1.06 |
| cristales | 83 | 1.00 |
| urbanizacion la flora | 83 | 1.00 |
| brisas de los | 82 | 0.99 |
Antes de la limpieza se identificaban 436 denominaciones y después quedaron 389 categorías estandarizadas. Los 20 barrios más frecuentes concentran 54.86 % de los registros con barrio informado.
La estandarización reduce diferencias de escritura, aunque no
garantiza que denominaciones semánticamente similares, como
cristales y los cristales, correspondan
necesariamente al mismo barrio. Por ello no se realizan fusiones
manuales adicionales sin una validación externa.
El análisis bivariado permite estudiar relaciones entre pares de
variables antes de pasar a técnicas multivariadas. Se inicia con
tipo × zona, porque ambas son variables categóricas y su
relación es relevante para comprender la distribución territorial de la
oferta.
Las hipótesis de la prueba Chi-cuadrado son:
| Tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| Apartamento | 24 | 1198 | 1029 | 62 | 2787 |
| Casa | 100 | 722 | 169 | 289 | 1939 |
Cada fila de la siguiente tabla suma aproximadamente 100 %. Esto responde a la pregunta: ¿en qué zonas se distribuyen las casas y los apartamentos?
| Tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| Apartamento | 0.47 | 23.49 | 20.18 | 1.22 | 54.65 |
| Casa | 3.11 | 22.43 | 5.25 | 8.98 | 60.24 |
La Zona Sur concentra la mayor proporción de casas y apartamentos. La Zona Oeste tiene una participación relativa mucho mayor dentro de los apartamentos que dentro de las casas, mientras que Zona Oriente presenta el comportamiento contrario.
Cada columna suma aproximadamente 100 %. Esto responde: ¿qué tipo de vivienda predomina dentro de cada zona?
| Tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| Apartamento | 19.35 | 62.4 | 85.89 | 17.66 | 58.97 |
| Casa | 80.65 | 37.6 | 14.11 | 82.34 | 41.03 |
La Zona Oeste está compuesta principalmente por apartamentos (85.89 %), mientras que en la Zona Oriente predominan las casas (82.34 %).
| Indicador | Resultado |
|---|---|
| Chi-cuadrado | 690.93 |
| Grados de libertad | 4 |
| p-valor | < 0,001 |
| V de Cramér | 0.288 |
| Frecuencia esperada mínima | 47.98 |
El p-valor es inferior a 0,05, por lo que se rechaza la hipótesis de independencia. Existe una asociación estadísticamente significativa entre el tipo de vivienda y la zona. La V de Cramér es 0.288, que bajo una lectura descriptiva corresponde a una asociación débil.
Desde el punto de vista inmobiliario, esto indica que la composición de la oferta cambia territorialmente y que algunas zonas presentan perfiles más orientados hacia casas o apartamentos.
Los análisis numéricos posteriores requieren una matriz completa. Se crea una copia de trabajo con precio, área construida, parqueaderos, baños y habitaciones.
Los ceros sospechosos de baños y habitaciones se tratan como datos no informados únicamente en esta copia. Posteriormente se conservan los casos completos para las cinco variables seleccionadas.
| Indicador | Valor |
|---|---|
| Registros originales | 8322.00 |
| Registros utilizados | 6688.00 |
| Porcentaje de la base utilizado | 80.37 |
Los análisis multivariados utilizan 6.688 viviendas,
equivalentes al 80.37 % de la base original. La
reducción se debe principalmente a la ausencia de información en
parqueaderos.
La correlación de Pearson permite observar si dos variables cuantitativas tienden a aumentar o disminuir conjuntamente. Valores próximos a 1 indican una relación positiva fuerte; valores próximos a 0 indican poca relación lineal.
| Variable | Precio | Área construida | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|
| Precio | 1.000 | 0.684 | 0.690 | 0.681 | 0.272 |
| Área construida | 0.684 | 1.000 | 0.588 | 0.677 | 0.544 |
| Parqueaderos | 0.690 | 0.588 | 1.000 | 0.582 | 0.293 |
| Baños | 0.681 | 0.677 | 0.582 | 1.000 | 0.601 |
| Habitaciones | 0.272 | 0.544 | 0.293 | 0.601 | 1.000 |
El precio presenta sus asociaciones lineales más altas con parqueaderos (0.69), área construida (0.684) y baños (0.681).
La relación entre precio y habitaciones es menor (0.272). En esta base, el número de habitaciones por sí solo diferencia menos el precio que el área, los baños o los parqueaderos. Estas relaciones justifican explorar si varias variables pueden resumirse mediante componentes comunes.
El Análisis de Componentes Principales (ACP) busca reducir la dimensionalidad. En lugar de analizar cinco variables por separado, construye componentes que resumen la mayor cantidad posible de variabilidad de los datos.
Las variables tienen escalas diferentes. Por esta razón se utiliza
scale. = TRUE, de forma que ninguna variable domine el ACP
únicamente por tener valores numéricos mayores.
| Componente | Valor_propio | Varianza_explicada | Varianza_acumulada |
|---|---|---|---|
| CP1 | 3.28 | 65.55 | 65.55 |
| CP2 | 0.85 | 17.04 | 82.59 |
| CP3 | 0.36 | 7.23 | 89.81 |
| CP4 | 0.32 | 6.40 | 96.22 |
| CP5 | 0.19 | 3.78 | 100.00 |
El primer componente explica 65.55 % de la variabilidad total. Los dos primeros componentes explican conjuntamente 82.59 %, por lo que una representación en dos dimensiones conserva una proporción alta de la información original.
El descenso marcado después de los primeros componentes confirma que gran parte de la información se concentra al inicio de la solución.
Las cargas muestran el peso de cada variable en la construcción de los componentes. Se interpretan principalmente por su magnitud absoluta y por su dirección.
| Variable | PC1 | PC2 | PC3 | PC4 | PC5 |
|---|---|---|---|---|---|
| Precio | 0.464 | 0.420 | -0.365 | -0.195 | -0.661 |
| Área construida | 0.481 | -0.059 | -0.434 | 0.679 | 0.339 |
| Parqueaderos | 0.435 | 0.426 | 0.768 | 0.169 | 0.103 |
| Baños | 0.487 | -0.151 | -0.111 | -0.684 | 0.510 |
| Habitaciones | 0.355 | -0.785 | 0.276 | 0.067 | -0.421 |
Este gráfico muestra cómo se ubican las cinco variables originales dentro de los dos primeros componentes principales.
La lectura es:
En la versión anterior algunas etiquetas quedaban sobrepuestas porque precio y parqueaderos, así como área y baños, tienen coordenadas cercanas. Para facilitar la lectura se amplía únicamente la zona donde realmente se encuentran las variables y se usan flechas con etiquetas desplazadas.
La gráfica permite observar con mayor claridad que precio, área construida, parqueaderos y baños se orientan hacia el lado positivo de CP1. Esto confirma que el primer componente recoge una idea general de viviendas más grandes, más costosas y con mayor dotación.
Habitaciones también aporta a CP1, pero se diferencia
con mayor claridad en CP2. Por eso este segundo componente ayuda a
separar viviendas que pueden tener un número relativamente alto de
habitaciones de otras que, frente a ese número, presentan mayor precio o
disponibilidad de parqueaderos.
Lo importante no es leer cada coordenada de forma aislada, sino observar el patrón conjunto: CP1 resume principalmente la escala general del inmueble y CP2 aporta una segunda forma de diferenciar su configuración interna.
Para evitar un gráfico saturado con miles de etiquetas, se representan las viviendas como puntos y las variables como vectores.
El gráfico resume simultáneamente la posición de los inmuebles y la dirección de las variables que más contribuyen a diferenciarlos.
Los dos primeros componentes explican conjuntamente 82.59 % de la variabilidad, lo que permite resumir de manera eficiente las cinco variables originales en dos dimensiones.
En el primer componente, precio, área construida, parqueaderos, baños y habitaciones tienen cargas en la misma dirección. Por ello, CP1 puede interpretarse como una dimensión de tamaño, valor y dotación general del inmueble: las propiedades con puntuaciones altas tienden a ser más grandes, más costosas y mejor dotadas.
En el segundo componente, habitaciones presenta la carga de mayor magnitud y se contrapone principalmente a precio y parqueaderos. Este componente puede interpretarse como una dimensión de configuración interna, que diferencia inmuebles con más habitaciones de otros cuyo precio y disponibilidad de parqueaderos son relativamente mayores respecto a esa cantidad de habitaciones.
En términos prácticos, el ACP muestra que una parte importante de la diversidad del mercado puede entenderse mediante dos ideas sencillas: escala general del inmueble y forma de distribución de sus características internas.
La preparación de los datos, la matriz de correlaciones y el ACP muestran que las características físicas y económicas no actúan de forma aislada. El siguiente paso es utilizar esta estructura para identificar grupos de propiedades con perfiles similares.
El Análisis de Conglomerados busca segmentar las viviendas en grupos internamente similares y diferentes entre sí. Se utilizan las mismas cinco variables cuantitativas del ACP para mantener coherencia entre las técnicas.
K-means y las distancias son sensibles a la escala de las variables. Por ello se trabaja con la matriz estandarizada.
Como la base multivariada contiene miles de viviendas, construir y mostrar un dendrograma con todos los registros produciría un gráfico demasiado denso. Por esa razón se utiliza una muestra reproducible de hasta 1.500 viviendas para explorar la estructura general de los datos.
El procedimiento utiliza:
En un dendrograma, cada vivienda comienza en la parte inferior. A medida que se sube en el gráfico, viviendas o grupos similares se van uniendo. Cuando una unión ocurre a una altura elevada, significa que los grupos que se están combinando eran relativamente diferentes.
Para que la figura sea legible en el HTML se usa una submuestra únicamente para la visualización del dendrograma. Esto no cambia la metodología posterior: el método del codo y Silhouette continúan utilizando la muestra de hasta 1.500 viviendas, y el K-means final se ejecuta sobre todos los registros disponibles.
Los rectángulos de colores muestran tres grupos únicamente como referencia visual. En este punto todavía no se está afirmando que tres sea el número definitivo de conglomerados.
El dendrograma permite ver que algunas ramas se unen a alturas bajas, lo que indica viviendas relativamente parecidas, mientras que otras ramas solo se integran a mayores distancias. Esa separación sugiere que la base contiene perfiles diferenciados y justifica continuar con una validación más objetiva.
Por esta razón, la decisión final sobre el número de segmentos no se toma solo con esta figura. En los siguientes apartados se complementa con el método del codo y con el coeficiente Silhouette.
Para mantener una ejecución rápida, el método del codo se calcula sobre la misma muestra utilizada en el análisis jerárquico. La segmentación final se realiza posteriormente sobre todos los registros disponibles.
El gráfico permite identificar a partir de qué número de grupos la reducción de la variabilidad interna empieza a ser menos pronunciada.
Se comparan soluciones de 3, 4 y 5 grupos. El coeficiente Silhouette combina cohesión interna y separación entre grupos; valores mayores indican una mejor estructura relativa.
| Numero_clusters | Silhouette_promedio |
|---|---|
| 3 | 0.389 |
| 4 | 0.387 |
| 5 | 0.342 |
El mayor Silhouette se obtiene con 3 grupos. Por ello se utiliza esa solución para la segmentación final. La diferencia entre alternativas se interpreta junto con la claridad de los perfiles obtenidos, no únicamente con un indicador numérico.
K-means se aplica sobre todas las viviendas disponibles en
base_multi. Cada propiedad se asigna al centro más cercano
y el algoritmo busca reducir la variabilidad dentro de los grupos.
| Cluster | Segmento | Numero_viviendas | Porcentaje |
|---|---|---|---|
| 1 | Vivienda compacta / menor valor relativo | 3736 | 55.86 |
| 2 | Vivienda amplia / nivel intermedio-alto | 2118 | 31.67 |
| 3 | Vivienda de alto valor / gran dotación | 834 | 12.47 |
| Cluster | Segmento | Precio | Área construida | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|---|
| 1 | Vivienda compacta / menor valor relativo | 277.8 | 97.93 | 1.29 | 2.33 | 2.93 |
| 2 | Vivienda amplia / nivel intermedio-alto | 547.1 | 230.83 | 1.97 | 4.11 | 4.45 |
| 3 | Vivienda de alto valor / gran dotación | 1123.5 | 425.48 | 3.91 | 5.28 | 4.63 |
Los grupos muestran una progresión clara en precio, área y dotación. Esto permite pasar de números de cluster a perfiles que tienen una lectura directa dentro del mercado inmobiliario.
Los centros de K-means muestran cuánto se encuentra cada grupo por encima o por debajo del promedio general en cada variable.
| Cluster | Precio | Área construida | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|
| Cluster 1 | -0.57 | -0.58 | -0.48 | -0.68 | -0.52 |
| Cluster 2 | 0.23 | 0.35 | 0.12 | 0.62 | 0.62 |
| Cluster 3 | 1.95 | 1.70 | 1.85 | 1.47 | 0.75 |
Los valores positivos representan características por encima del promedio y los negativos valores por debajo. El segmento de alto valor se distingue porque presenta valores positivos elevados en prácticamente todas las características.
Se recuperan tipo, zona y estrato para describir los grupos desde una perspectiva más cercana al mercado.
| Segmento | Apartamento | Casa |
|---|---|---|
| C1 - Vivienda compacta / menor valor relativo | 84.93 | 15.07 |
| C2 - Vivienda amplia / nivel intermedio-alto | 38.76 | 61.24 |
| C3 - Vivienda de alto valor / gran dotación | 26.74 | 73.26 |
| Segmento | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| C1 - Vivienda compacta / menor valor relativo | 0.78 | 22.27 | 11.64 | 1.93 | 63.38 |
| C2 - Vivienda amplia / nivel intermedio-alto | 1.56 | 16.76 | 20.59 | 4.06 | 57.03 |
| C3 - Vivienda de alto valor / gran dotación | 0.24 | 10.91 | 26.74 | 0.48 | 61.63 |
| Segmento | 3 | 4 | 5 | 6 |
|---|---|---|---|---|
| C1 - Vivienda compacta / menor valor relativo | 12.02 | 32.90 | 42.77 | 12.31 |
| C2 - Vivienda amplia / nivel intermedio-alto | 10.53 | 17.19 | 34.32 | 37.96 |
| C3 - Vivienda de alto valor / gran dotación | 1.20 | 4.80 | 21.94 | 72.06 |
El tipo y el estrato ayudan a explicar mejor los perfiles. El primer segmento está compuesto principalmente por apartamentos, mientras que los grupos de mayor valor tienen una participación más alta de casas y de estratos elevados.
Los grupos se proyectan sobre los dos primeros componentes principales, que concentran gran parte de la variabilidad de los datos.
La separación no es perfecta, algo esperable en datos inmobiliarios reales, pero el gráfico permite observar perfiles diferenciados principalmente a lo largo de la dimensión general de tamaño, valor y dotación.
El análisis identificó 3 segmentos. En la solución obtenida, los perfiles son consistentes y tienen una lectura empresarial clara.
El Cluster 1 reúne la mayor parte de la muestra y presenta los valores medios más bajos de precio, área, parqueaderos y baños. Está compuesto principalmente por apartamentos, por lo que se interpreta como vivienda compacta de menor valor relativo.
El Cluster 2 presenta valores intermedios de precio y área, mayor número de baños y habitaciones y una participación más alta de casas. Se interpreta como vivienda amplia de nivel intermedio-alto.
El Cluster 3 presenta los promedios más altos de precio, área, parqueaderos y baños. Además, se concentra en mayor medida en casas y estrato 6. Se interpreta como vivienda de alto valor y gran dotación.
Esta segmentación muestra que la oferta no es homogénea. Para una inmobiliaria, los tres perfiles pueden apoyar estrategias diferenciadas de valoración, comercialización y priorización del portafolio.
El Análisis de Correspondencias estudia asociaciones entre categorías. En este caso se utiliza para explorar la relación entre tipo de vivienda, zona y barrio, variables que no entraron como variables activas en el ACP.
Para evitar dependencias adicionales se implementa el análisis mediante la descomposición en valores singulares de una tabla de contingencia normalizada. El código se mantiene oculto en el HTML.
La relación tipo × zona ya mostró asociación mediante
Chi-cuadrado. El Análisis de Correspondencias permite representar la
estructura de esa asociación.
| Dimension | Inercia |
|---|---|
| Dimensión 1 | 100 |
| Categoria | Variable | Dimension_1 |
|---|---|---|
| Apartamento | Tipo | -0.229 |
| Casa | Tipo | 0.363 |
| Zona Centro | Zona | 0.861 |
| Zona Norte | Zona | -0.022 |
| Zona Oeste | Zona | -0.505 |
| Zona Oriente | Zona | 0.896 |
| Zona Sur | Zona | 0.048 |
Como tipo tiene dos categorías, existe una sola
dimensión efectiva y esta explica el 100 % de la
inercia. Las coordenadas complementan la lectura de los
porcentajes del análisis bivariado y muestran qué zonas tienen perfiles
más cercanos a casas o apartamentos.
El número de barrios es elevado. Para obtener una visualización legible se utilizan los 20 barrios estandarizados con mayor número de registros. Esta selección se utiliza únicamente para el análisis gráfico y no implica eliminar los demás barrios de la base.
| Perfil | Barrios |
|---|---|
| Más próximos al perfil Apartamento | valle del lili, cristales, prados del norte, los cristales, brisas de los |
| Más próximos al perfil Casa | ciudad jardin, el limonar, pance, acopi, el caney |
Entre los barrios con mayor presencia en la base se observan perfiles diferenciados. Esta lectura no significa que un barrio contenga exclusivamente casas o apartamentos; indica que su estructura relativa de oferta se acerca más a uno de esos perfiles.
| Dimension | Inercia | Inercia_acumulada |
|---|---|---|
| Dimensión 1 | 49.88 | 49.88 |
| Dimensión 2 | 49.68 | 99.56 |
| Dimensión 3 | 0.34 | 99.89 |
| Dimensión 4 | 0.11 | 100.00 |
Los dos primeros ejes explican conjuntamente 99.56 % de la inercia total. Por tanto, el plano bidimensional representa casi toda la estructura de asociación entre las zonas y los barrios seleccionados.
El mapa de correspondencias resume gráficamente la relación entre las zonas y los 20 barrios más frecuentes de la base.
Los dos primeros ejes explican conjuntamente 99.56 %
de la inercia. Esto significa que el plano de dos dimensiones conserva
prácticamente toda la estructura de asociación encontrada en la tabla
zona × barrio.
Para leer el gráfico conviene tener presentes tres ideas:
En la versión anterior los 20 identificadores se concentraban en pocos puntos y resultaban difíciles de leer. Para mejorar la visualización se mantienen todos los barrios como puntos, pero solo se etiquetan los 10 barrios más alejados del origen, ya que son los que mejor ayudan a diferenciar los patrones del mapa.
La siguiente tabla permite identificar los números que aparecen en el gráfico. Se muestran únicamente los diez barrios más alejados del origen, porque son los que más ayudan a diferenciar la estructura territorial.
| ID | Barrio | Dimension_1 | Dimension_2 | Distancia_origen |
|---|---|---|---|---|
| 14 | los cristales | -1.184 | -1.905 | 2.243 |
| 15 | normandia | -1.172 | -1.892 | 2.226 |
| 2 | aguacatal | -1.166 | -1.886 | 2.218 |
| 7 | cristales | -1.165 | -1.840 | 2.178 |
| 18 | santa teresita | -1.143 | -1.834 | 2.161 |
| 19 | urbanizacion la flora | -1.532 | 1.478 | 2.129 |
| 3 | brisas de los | -1.532 | 1.478 | 2.129 |
| 12 | la flora | -1.526 | 1.474 | 2.122 |
| 1 | acopi | -1.518 | 1.469 | 2.112 |
| 17 | prados del norte | -1.530 | 1.451 | 2.109 |
En términos sencillos, el gráfico permite reconocer tres patrones territoriales principales. La Zona Oeste aparece claramente separada, mientras que Centro y Norte se ubican en una dirección semejante. Oriente y Sur se encuentran hacia el lado opuesto del primer eje y también presentan posiciones relativamente próximas entre sí.
Estas posiciones no significan que dos zonas sean iguales, sino que los barrios seleccionados se distribuyen de forma diferente entre ellas. La utilidad del mapa es mostrar esas diferencias de manera resumida y visual.
El análisis confirma que la oferta también presenta una dimensión
territorial. La relación tipo × zona es coherente con la
prueba Chi-cuadrado, mientras que los cruces con barrio permiten
reconocer perfiles locales más asociados con casas o apartamentos y
agrupaciones territoriales de oferta.
Esta técnica complementa el ACP y los conglomerados porque incorpora variables categóricas que no fueron utilizadas como variables activas en los modelos numéricos.
Después de identificar los tres segmentos mediante K-means, se
utiliza la información de longitud y latitud
para observar dónde se localizan las viviendas de cada
perfil.
Esta sección cumple una función diferente al mapa de correspondencias del punto anterior. El Análisis de Correspondencias representa relaciones estadísticas entre categorías; en cambio, esta figura utiliza las coordenadas reales registradas en la base para mostrar la distribución espacial de las propiedades.
El objetivo no es construir un mapa de calles ni reemplazar un sistema de información geográfica. Se busca responder una pregunta más sencilla:
¿Los segmentos inmobiliarios aparecen concentrados en ciertas partes de la ciudad o tienden a coexistir en el territorio?
Cada punto representa una vivienda incluida en el análisis multivariado.
Para mejorar la lectura se utiliza un símbolo diferente para cada segmento y se reduce la opacidad de los puntos. También se incorporan los nombres de las zonas en su posición media aproximada.
La figura muestra que los segmentos no están completamente separados por ubicación. En distintas partes de la ciudad aparecen puntos de varios colores, lo que indica que las características físicas y económicas utilizadas para construir los conglomerados no dependen únicamente de la zona.
Sin embargo, también se observan concentraciones locales. El segmento de vivienda compacta tiene una presencia amplia en diferentes sectores, mientras que los segmentos de mayor tamaño y valor presentan concentraciones más específicas.
El gráfico ayuda a reconocer patrones, pero una tabla permite cuantificar mejor lo que se observa visualmente. Los porcentajes siguientes se calculan dentro de cada zona, por lo que cada fila suma aproximadamente 100 %.
| Zona | Cluster 1 | Cluster 2 | Cluster 3 |
|---|---|---|---|
| Zona Centro | 45.31 | 51.56 | 3.12 |
| Zona Norte | 65.10 | 27.78 | 7.12 |
| Zona Oeste | 39.76 | 39.85 | 20.38 |
| Zona Oriente | 44.44 | 53.09 | 2.47 |
| Zona Sur | 57.90 | 29.54 | 12.57 |
Esta tabla debe leerse junto con los perfiles definidos en el punto 7:
De esta manera, no solo se observa dónde están los puntos, sino también qué peso tiene cada segmento dentro de las diferentes zonas.
La principal conclusión de esta visualización es que la ubicación aporta información importante, pero no explica por sí sola la segmentación del mercado.
Dos viviendas ubicadas en una misma zona pueden pertenecer a segmentos distintos porque sus diferencias de precio, área, baños, habitaciones o parqueaderos son suficientemente grandes. De la misma forma, viviendas con características similares pueden aparecer en diferentes zonas.
Para la empresa inmobiliaria esto es relevante porque sugiere que una estrategia comercial no debería construirse únicamente con criterios geográficos. La zona debe combinarse con el perfil del inmueble. Por ejemplo, dentro de una misma zona pueden requerirse estrategias diferentes para una vivienda compacta y para una propiedad de alto valor.
Por tanto, la visualización geográfica complementa los análisis anteriores: ACP resume las características, K-means identifica los segmentos y las coordenadas permiten observar cómo esos segmentos se distribuyen en el territorio.
Las técnicas aplicadas responden a preguntas diferentes, pero sus resultados son complementarios.
| Analisis | Hallazgo_principal | Lectura_para_la_empresa |
|---|---|---|
| Caracterización de la oferta | Predominan los apartamentos y la oferta se concentra especialmente en la Zona Sur. | El mercado analizado no tiene una composición uniforme entre tipos, zonas y estratos. |
| Relaciones cuantitativas | El precio se relaciona principalmente con parqueaderos (0.69), área construida (0.684) y baños (0.681). | Área, baños y parqueaderos son variables especialmente útiles para diferenciar la oferta por precio. |
| ACP | Los dos primeros componentes explican 82.59 % de la variabilidad. | La estructura cuantitativa puede resumirse de forma clara en pocas dimensiones. |
| Conglomerados | Se identificaron 3 segmentos con perfiles diferenciados de tamaño, precio y dotación. | El portafolio puede gestionarse mediante perfiles comerciales distintos. |
| Correspondencias | Los dos primeros ejes de zona × barrio explican 99.56 % de la inercia. | La localización y el barrio complementan las características físicas para entender la oferta. |
En conjunto, los resultados muestran que la oferta inmobiliaria no constituye un mercado homogéneo. Las características físicas, el precio, el tipo de inmueble, el estrato y la localización se combinan para formar perfiles diferenciados.
A partir de los resultados se plantean recomendaciones directamente relacionadas con el problema de la empresa inmobiliaria:
Gestionar el portafolio por segmentos.
Diferenciar la estrategia para viviendas compactas, propiedades amplias
de nivel intermedio-alto y viviendas de alto valor.
Dar especial atención al área, los baños y los
parqueaderos en la valoración.
Estas características presentan relaciones importantes con el precio y
contribuyen a diferenciar los inmuebles.
Aplicar estrategias comerciales según el
territorio.
La composición entre casas y apartamentos cambia entre zonas y algunos
barrios presentan perfiles de oferta claramente diferenciados.
Diseñar una estrategia específica para el segmento de
alto valor.
Aunque representa una proporción menor de la oferta, reúne propiedades
con mayor precio, tamaño, parqueaderos y baños.
Mejorar el registro de la información.
Variables como piso, parqueaderos, baños, habitaciones y barrio
requieren controles de calidad más consistentes para futuros
análisis.
Complementar en el futuro los datos de oferta con
transacciones reales.
Incorporar precios efectivos de venta y tiempos de permanencia
permitiría evaluar con mayor precisión la dinámica del mercado.
Los resultados deben interpretarse considerando las siguientes limitaciones:
piso y parqueaderos presentan proporciones
relevantes de información faltante.El análisis permitió caracterizar la oferta inmobiliaria mediante técnicas descriptivas, bivariadas y multivariadas.
El ACP mostró que los dos primeros componentes explican 82.59 % de la variabilidad de las cinco características cuantitativas. Esto permite resumir buena parte de la estructura de los inmuebles mediante una dimensión general de tamaño, valor y dotación y una segunda dimensión asociada con su configuración interna.
El Análisis de Conglomerados identificó 3 segmentos con características diferenciadas. La solución separa una oferta mayoritaria de viviendas compactas, un segmento de propiedades más amplias de nivel intermedio-alto y un grupo de inmuebles de alto valor y gran dotación.
El Análisis de Correspondencias mostró que la composición de la oferta también cambia territorialmente. Los primeros ejes de la relación entre zona y barrio resumen casi toda la inercia del cruce, lo que permite representar de forma clara la estructura de las categorías analizadas.
En conjunto, los resultados muestran que la valoración y comercialización de los inmuebles no deberían apoyarse únicamente en el precio. El tamaño, la dotación, el tipo de vivienda, el estrato y la localización aportan información complementaria para comprender los distintos perfiles del mercado.
El siguiente cuadro resume las técnicas utilizadas y las variables principales incluidas en cada etapa.
| Tecnica | Variables_principales | Objetivo |
|---|---|---|
| Análisis descriptivo | Precio, área, parqueaderos, baños, habitaciones, tipo, zona, estrato y barrio | Caracterizar la oferta y revisar la calidad de los datos |
| Chi-cuadrado y V de Cramér | Tipo de vivienda y zona; tipo y patrón de faltantes | Evaluar asociación entre variables categóricas |
| Correlación de Pearson | Precio, área, parqueaderos, baños y habitaciones | Medir relaciones lineales entre variables cuantitativas |
| ACP | Precio, área, parqueaderos, baños y habitaciones | Reducir dimensionalidad |
| Conglomerados | Precio, área, parqueaderos, baños y habitaciones | Identificar segmentos homogéneos |
| Correspondencias | Tipo, zona y barrio | Explorar relaciones entre categorías |
| Visualización geográfica | Longitud, latitud y cluster | Observar la distribución espacial de los segmentos |