1 Procesamiento y preparación de los datos

1.1 Importación y auditoría de la base de datos

La base de datos vivienda, disponible en el paquete paqueteMODELOS, contiene 8.322 propiedades y 13 variables. La información tabular combina características económicas, físicas, territoriales y espaciales de la oferta inmobiliaria en una ciudad en Colombia.

Las variables cuantitativas describen el precio del inmueble en millones de pesos (preciom), el área construida en metros cuadrados (areaconst), el piso, el número de parqueaderos, baños y habitaciones, además de su posición (coordenadas geográficas). Las variables cualitativas identifican el tipo de vivienda, la zona, el barrio y el estrato socioeconómico. La variable id funciona como identificador de cada registro.

Resumen inicial del conjunto de datos
observaciones variables filas_completas porcentaje_completas
8322 13 4808 57.77

La auditoría inicial permitió comprobar el tipo de almacenamiento, la cantidad de valores faltantes y la cardinalidad de cada variable. Esta revisión es necesaria antes de aplicar técnicas multivariantes, ya que las variables numéricas y categóricas requieren tratamientos diferentes y algunas columnas presentan una proporción importante de información ausente.

Auditoría inicial de las variables
variable clase n_faltantes porcentaje_faltantes n_valores_unicos
id numeric 3 0.04 8319
zona character 3 0.04 5
piso character 2638 31.70 12
estrato numeric 3 0.04 4
preciom numeric 2 0.02 539
areaconst numeric 3 0.04 652
parqueaderos numeric 1605 19.29 10
banios numeric 3 0.04 11
habitaciones numeric 3 0.04 11
tipo character 3 0.04 2
barrio character 3 0.04 436
longitud numeric 3 0.04 2928
latitud numeric 3 0.04 3679

1.1.1 Registros con información insuficiente

Se identificaron 3 registros con uno o ningún dato informado. Estas filas carecen de información suficiente para caracterizar una propiedad, calcular indicadores o participar en los análisis multivariantes.

Registros con uno o ningún dato informado
id zona piso estrato preciom areaconst parqueaderos banios habitaciones tipo barrio longitud latitud fila_original n_datos_informados
8320 0
8321 0
330 8322 1

Por esta razón, los tres registros fueron eliminados. La base depurada quedó conformada por 8.319 viviendas. La eliminación representa únicamente el 0,036 % de las observaciones originales y no supone una pérdida sustancial de información.

Observaciones antes y después de la depuración inicial
base observaciones
Base original 8322
Base después de la depuración inicial 8319

1.1.2 Identificadores y posibles duplicados

Los identificadores informados son únicos. Después de retirar las filas sin información suficiente, la base conserva 8.319 identificadores diferentes, sin valores ausentes ni repeticiones de id.

Comprobación de identificadores
ids_informados ids_diferentes id_minimo id_maximo
8319 8319 1 8319

La auditoría inicial marcó 2 filas completamente idénticas. Estas corresponden a los dos registros totalmente vacíos ya identificados y fueron retiradas mediante el criterio de información insuficiente. Entre los registros válidos no existen duplicados completos que incluyan el identificador.

Adicionalmente, se detectaron 57 grupos con las mismas características inmobiliarias y distinto identificador, que comprenden 114 registros. La coincidencia puede deberse a duplicación de anuncios, pero también puede representar propiedades diferentes de un mismo edificio o proyecto inmobiliario. Ante la ausencia de una variable que permita distinguir estos casos, se conservaron y se marcaron mediante el indicador lógico posible_duplicado.

Auditoría inicial de posibles duplicados
duplicados_exactos grupos_iguales_sin_id registros_en_esos_grupos
2 57 114
Registros potencialmente duplicados
grupos_identificados registros_implicados porcentaje_registros posible_exceso
57 114 1.37 57

Esta decisión evita eliminar observaciones válidas de manera irreversible y permitirá realizar comprobaciones de sensibilidad si los posibles duplicados influyen posteriormente en los resultados.

1.2 Limpieza y preparación de los datos

1.2.1 Corrección de tipos y normalización textual

Las variables zona y tipo se transformaron en factores nominales, mientras que estrato se representó como factor ordinal con niveles del 3 al 6. Las variables de conteo se convirtieron a números enteros y el precio, el área y las coordenadas se almacenaron como variables numéricas.

Los nombres de los barrios se normalizaron mediante la eliminación de espacios innecesarios y la conversión a minúsculas. Como resultado, la cardinalidad pasó de 436 valores originales a 407 categorías normalizadas. Esta limpieza reduce la fragmentación artificial de una misma categoría por diferencias de escritura.

También se identificaron 45 registros con cero baños y 66 con cero habitaciones. Dado que estas cantidades no son plausibles para una vivienda residencial ofertada, se interpretaron como errores u omisiones de registro y se recodificaron temporalmente como valores faltantes.

1.2.2 Magnitud y patrones de los valores faltantes

Después de eliminar las tres filas sin información y recodificar los ceros no plausibles, los valores faltantes se concentran en cuatro variables. piso presenta 2.635 ausencias (31,67 %) y parqueaderos presenta 1.602 (19,26 %). Las proporciones de ausencia de baños y habitaciones son inferiores al 1 %.

Número y porcentaje de valores faltantes
variable n_faltantes pct_faltantes
piso 2635 31.674
parqueaderos 1602 19.257
habitaciones 66 0.793
banios 45 0.541
Número y porcentaje de valores faltantes por variable.

Número y porcentaje de valores faltantes por variable.

La eliminación de todas las observaciones incompletas conservaría solamente 4.787 viviendas, equivalentes al 57,54 % de la base depurada. La pérdida sería especialmente elevada por la ausencia simultánea o individual de piso y parqueaderos; por ello, se descartó el borrado completo como estrategia general.

El mapa de faltantes permite examinar la distribución de las ausencias entre registros y variables. La concentración visual en piso y parqueaderos confirma que el problema no se distribuye uniformemente en toda la base.

Mapa de los patrones de valores faltantes.

Mapa de los patrones de valores faltantes.

El gráfico de coocurrencia complementa el diagnóstico al mostrar qué combinaciones de variables faltan conjuntamente. Esto permite diferenciar los casos con una única ausencia de aquellos en los que faltan varias características estructurales.

Coocurrencia de valores faltantes entre variables.

Coocurrencia de valores faltantes entre variables.

La tabla de patrones confirma que existen diferentes configuraciones de ausencia, en lugar de un único patrón monotónico. Se contabilizaron 4.787 viviendas completas en estas cuatro variables. Entre los registros incompletos predominan tres situaciones: 1.901 viviendas sin información únicamente en piso, 863 sin información únicamente en parqueaderos y 692 con ausencia simultánea de ambas variables. Solamente 21 registros carecen de las cuatro características.

Patrones conjuntos de valores faltantes
n_registros banios habitaciones parqueaderos piso n_variables_faltantes
4787 Observado Observado Observado Observado 0
1901 Observado Observado Observado Faltante 1
863 Observado Observado Faltante Observado 1
692 Observado Observado Faltante Faltante 2
14 Observado Faltante Observado Observado 1
6 Observado Faltante Faltante Observado 2
11 Observado Faltante Faltante Faltante 3
4 Faltante Observado Observado Observado 1
2 Faltante Observado Observado Faltante 2
2 Faltante Observado Faltante Observado 2
2 Faltante Observado Faltante Faltante 3
3 Faltante Faltante Observado Observado 2
6 Faltante Faltante Observado Faltante 3
5 Faltante Faltante Faltante Observado 3
21 Faltante Faltante Faltante Faltante 4

1.2.3 Evaluación del mecanismo de ausencia

Para evaluar si los faltantes podían considerarse completamente aleatorios se aplicó el test MCAR propuesto por Little (1988a). La hipótesis nula establece que la probabilidad de ausencia es independiente tanto de los valores observados como de los no observados. El test se calculó con las transformaciones logarítmicas del precio y del área, además de piso, parqueaderos, banios y habitaciones.

Test MCAR de Little
estadistico grados_libertad p_valor patrones_faltantes decision
1377.67 54 <0.001 15 Se rechaza MCAR; los faltantes podrían ser MAR o MNAR

El resultado fue estadísticamente significativo (\(\chi^2 = 1.377,7\), \(gl = 54\), \(p\) < 0,001). En consecuencia, se rechaza la hipótesis MCAR. La información faltante presenta una estructura sistemática y el borrado indiscriminado de registros podría introducir sesgos. Este resultado no permite distinguir por sí solo entre los mecanismos MAR —ausencia explicable mediante variables observadas— y MNAR (ausencia relacionada con el propio valor no observado). Debido al gran tamaño muestral y a la presencia de variables de conteo, el test se interpreta como un diagnóstico global y se complementa con las pruebas de asociación de los indicadores de ausencia.

Como análisis complementario, se estudió la relación entre la ausencia de parqueaderos y el estrato socioeconómico. La proporción de valores no informados disminuye claramente a medida que aumenta el estrato.

Ausencia de parqueaderos según estrato
estrato parqueaderos_faltante n porcentaje
3 No 684 47.08
3 769 52.92
4 No 1641 77.08
4 488 22.92
5 No 2522 91.71
5 228 8.29
6 No 1870 94.11
6 117 5.89

También se evaluó la relación entre la ausencia de piso y el tipo de vivienda.

Ausencia de piso según tipo de vivienda
tipo piso_faltante n porcentaje
Casa No 1965 61.04
Casa 1254 38.96
Apartamento No 3719 72.92
Apartamento 1381 27.08
Pruebas de asociación de los mecanismos de ausencia
relacion chi_cuadrado grados_libertad p_valor
Ausencia de parqueaderos y estrato 1518.73 3 <0.001
Ausencia de piso y tipo de vivienda 128.10 1 <0.001

Las dos pruebas de independencia resultaron significativas (\(p < 0{,}001\)). Por tanto, la ausencia de parqueaderos está asociada con el estrato y la ausencia de piso está asociada con el tipo de vivienda. Estos resultados respaldan la utilización de variables observadas como predictores del proceso de imputación y confirman la decisión de no tratar todos los faltantes de la misma forma.

1.2.4 Estrategia de tratamiento de los valores faltantes

La estrategia se definió de manera diferenciada según la magnitud de la ausencia, la interpretación de cada variable y su función en los análisis posteriores.

1.2.4.1 Variable piso

piso conserva sus 2.635 valores faltantes. La variable presenta una proporción de ausencia elevada y su significado depende del tipo de inmueble, esto es, en apartamentos representa habitualmente la planta de ubicación, mientras que en casas puede describir el número de niveles. Una imputación conjunta podría introducir relaciones artificiales. Por ello, piso se utilizará únicamente en análisis descriptivos con datos observados y se excluirá como variable activa del análisis de componentes principales y de la construcción de conglomerados.

1.2.4.2 Parqueaderos, baños y habitaciones

Las ausencias de parqueaderos, banios y habitaciones se trataron mediante imputación múltiple por ecuaciones encadenadas con el paquete mice (Van Buuren & Groothuis-Oudshoorn, 2011). Se utilizó predictive mean matching (PMM; Little, 1988b), que selecciona valores observados procedentes de propiedades con predicciones similares. Esta característica conserva valores plausibles para variables de conteo y evita generar cantidades fraccionarias.

El modelo de imputación incorporó el logaritmo del precio, el logaritmo del área, la zona, el estrato, el tipo de vivienda y las restantes características estructurales. De este modo, se adopta como supuesto un mecanismo MAR condicionado a la información observada. Aunque este supuesto resulta razonable a partir de las asociaciones encontradas, no puede descartarse completamente un mecanismo MNAR.

Se generaron cinco conjuntos imputados, cada uno con diez iteraciones y semilla fija para garantizar la reproducibilidad. La primera base completada se utiliza como archivo fuente para el análisis exploratorio. Las cinco imputaciones se conservan en el objeto imputaciones_mice y se emplearán posteriormente para comprobar la estabilidad del análisis de ACP y de conglomerados.

Resumen de la imputación de valores faltantes
variable n_imputados porcentaje metodo
parqueaderos 1602 19.257 PMM mediante mice
banios 45 0.541 PMM mediante mice
habitaciones 66 0.793 PMM mediante mice

La imputación completó 1.602 valores de parqueaderos, 45 de baños y 66 de habitaciones. Las columnas lógicas parqueaderos_imputado, banios_imputado y habitaciones_imputada permiten distinguir en todo momento los datos observados de los estimados.

La comparación de los estadísticos descriptivos antes y después de la imputación permite comprobar si el procedimiento modifica sustancialmente la localización o la dispersión de las variables.

Comparación descriptiva antes y después de la imputación
variable momento n_disponibles media mediana desviacion
banios Antes de imputar 8274 3.13 3 1.41
banios Después de imputar 8319 3.13 3 1.42
habitaciones Antes de imputar 8253 3.63 3 1.43
habitaciones Después de imputar 8319 3.64 3 1.44
parqueaderos Antes de imputar 6717 1.84 2 1.12
parqueaderos Después de imputar 8319 1.76 1 1.09

1.2.5 Diagnóstico de la imputación

La convergencia de las cadenas se inspeccionó mediante la evolución de la media y la desviación estándar de los valores imputados a lo largo de las diez iteraciones. Las cinco cadenas se entremezclan en las tres variables y fluctúan alrededor de niveles relativamente estables, sin una tendencia ascendente o descendente persistente. Las oscilaciones son mayores en baños y habitaciones porque solamente se imputan 45 y 66 casos, respectivamente, pero no se observa una separación sistemática entre cadenas. El diagnóstico visual es compatible con una convergencia adecuada.

Trazas de convergencia de las cinco cadenas de imputación.

Trazas de convergencia de las cinco cadenas de imputación.

El segundo diagnóstico compara las distribuciones observadas (azul) e imputadas (rojo). Como se trata de variables discretas y el número de imputaciones de baños y habitaciones es pequeño frente al número de observaciones, las curvas imputadas aparecen más suavizadas. En ambas variables, los valores estimados se mantienen dentro del rango observado y se concentran en cantidades plausibles. Además, los estadísticos globales prácticamente no cambian: la media de baños permanece en 3,13 y la de habitaciones pasa de 3,63 a 3,64; sus medianas continúan en 3 y sus desviaciones estándar aumentan solamente 0,01 unidades.

Ahora bien, en parqueaderos, las imputaciones se concentran principalmente en uno y, en menor medida, en dos espacios. Como resultado, la media global disminuye de 1,84 a 1,76, la mediana pasa de 2 a 1 y la desviación estándar cambia de 1,12 a 1,09. Este desplazamiento es coherente con el diagnóstico previo: la falta de información se concentra en los estratos bajos, donde el modelo —condicionado por precio, área, zona, estrato y tipo— asigna valores menores que el promedio observado. Por tanto, la diferencia es compatible con la estructura MAR asumida y no constituye por sí misma un fallo de la imputación.

Comparación de las distribuciones observadas e imputadas.

Comparación de las distribuciones observadas e imputadas.

El algortimo de PMM solo selecciona valores existentes entre los donantes observados. Como la variable parqueaderos no contiene ceros observados, el procedimiento tampoco puede imputarlos. En consecuencia, los valores completados representan el número esperado de parqueaderos entre viviendas observadas con características semejantes, pero no permiten descartar que algunos anuncios omitieran el campo por carecer de parqueadero. Por esta razón se conserva el indicador parqueaderos_imputado y, en los análisis multivariantes, se comprobará la estabilidad de las componentes y de la segmentación al comparar las cinco imputaciones.

Considerados conjuntamente, las trazas, las distribuciones y los estadísticos descriptivos respaldan la utilización de vivienda_limpia como base operativa para el análisis exploratorio. La imputación conserva valores enteros plausibles, completa el 100 % de las variables cuantitativas nucleares y mantiene explícita la incertidumbre asociada a los datos originalmente ausentes.

1.2.6 Valores potencialmente atípicos

Los valores potencialmente atípicos se identificaron mediante el criterio del rango intercuartílico de Tukey. A continuación, se presentan los principales hallazgos:

Valores potencialmente atípicos según el criterio del rango intercuartílico
variable q1 q3 iqr limite_inferior limite_superior n_atipicos porcentaje decision
preciom 220 540 320 -260.0 1020.0 552 6.64 Conservar
areaconst 80 229 149 -143.5 452.5 382 4.59 Conservar
parqueaderos 1 2 1 -0.5 3.5 627 7.54 Conservar
banios 2 4 2 -1.0 7.0 73 0.88 Conservar
habitaciones 3 4 1 1.5 5.5 842 10.12 Conservar
Distribución de las variables cuantitativas y valores potencialmente atípicos.

Distribución de las variables cuantitativas y valores potencialmente atípicos.

El criterio identifica una mayor proporción de casos potencialmente atípicos en habitaciones (10,12 %), parqueaderos (7,54 %) y precio (6,64 %), seguida del área construida (4,59 %) y los baños (0,88 %). Estos porcentajes describen valores alejados de la zona central de cada distribución, pero no demuestran que sean errores.

En el contexto inmobiliario, los valores extremos pueden corresponder a viviendas de lujo, inmuebles de gran superficie o propiedades con características estructurales especiales. Por ello, se conservaron todas las observaciones plausibles. En las fases de ACP y conglomerados se evaluará el uso de transformaciones logarítmicas para las variables continuas con asimetría positiva, seguido de estandarización, con el fin de reducir la influencia desproporcionada de las escalas y las colas superiores.

1.2.7 Validación final de la limpieza

La siguiente tabla resume las decisiones adoptadas durante la depuración y preparación de la base.

Registro de decisiones de limpieza
decision resultado
Filas sin información suficiente eliminadas 3
Posibles duplicados conservados y marcados 114
Valores faltantes de piso conservados 2635
Valores faltantes de parqueaderos imputados mediante PMM 1602
Baños iguales a cero recodificados e imputados mediante PMM 45
Habitaciones iguales a cero recodificadas e imputadas mediante PMM 66
Valores potencialmente atípicos conservados Consultar tabla_atipicos
Validación final de la base limpia
observaciones variables ids_faltantes ids_repetidos pisos_faltantes parqueaderos_faltantes banios_faltantes habitaciones_faltantes posibles_duplicados casos_completos_nucleo porcentaje_completos_nucleo
8319 18 0 0 2635 0 0 0 114 8319 100

Después del tratamiento, vivienda_limpia conserva 8.319 propiedades y dispone de información completa en las variables cuantitativas claves: precio, área, parqueaderos, baños y habitaciones. Las 18 columnas finales incluyen las 13 variables originales y cinco indicadores de trazabilidad: un marcador de posible duplicado, tres indicadores de imputación y el indicador de disponibilidad de piso. La única variable estructural que mantiene faltantes es piso, cuya exclusión de los análisis multivariantes quedó justificada por su porcentaje de ausencia y su interpretación heterogénea.

La base resultante queda preparada para la fase de análisis exploratorio. Se mantienen las observaciones extremas plausibles, se preserva la trazabilidad de los valores imputados y se conservan las cinco imputaciones para evaluar la robustez de las técnicas multivariantes posteriores.

2 Análisis exploratorio de datos (EDA)

2.1 Objetivo y alcance

El análisis exploratorio busca describir la estructura de la oferta inmobiliaria antes de aplicar las tres técnicas multivariantes. Se examinan las distribuciones de las variables cuantitativas, la composición de la oferta, las diferencias entre segmentos y las asociaciones bivariantes. El análisis se realiza sobre las 8.319 viviendas de la base depurada.

Las variables parqueaderos, banios y habitaciones incluyen los valores completados mediante imputación múltiple y conservan sus indicadores de trazabilidad. La variable piso se analiza por separado y únicamente con los valores originalmente reportados.

2.2 Distribución de las variables cuantitativas

La tabla siguiente presenta medidas de posición, dispersión, rango, variación relativa y asimetría. Dado que el mercado inmobiliario suele presentar colas superiores extensas, la mediana y el rango intercuartílico se consideran medidas especialmente útiles para describir la vivienda típica sin otorgar un peso excesivo a las propiedades de mayor tamaño o precio.

Resumen descriptivo de las variables cuantitativas
Variable n Media Desv. estándar Mínimo Q1 Mediana Q3 Máximo RIC CV (%) Asimetría
Precio 8319 433.90 328.67 58 220 330 540 1999 320 75.75 1.85
Área construida 8319 174.93 142.96 30 80 123 229 1745 149 81.72 2.69
Parqueaderos 8319 1.76 1.09 1 1 1 2 10 1 62.05 2.47
Baños 8319 3.13 1.42 1 2 3 4 10 2 45.21 0.98
Habitaciones 8319 3.64 1.44 1 3 3 4 10 1 39.46 1.81

El precio medio es de 433,90 millones de COP, mientras que la mediana se sitúa en 330,00 millones. Su coeficiente de asimetría es 1,85, lo que corresponde a asimetría positiva marcada. El área construida presenta una media de 174,93 m², una mediana de 123,00 m² y un coeficiente de asimetría de 2,69, compatible con asimetría positiva marcada.

La transformación logarítmica reduce la asimetría del precio de 1,85 a 0,25 y la del área de 2,69 a 0,51. La mejora es sustancial en ambas variables y respalda el uso de sus logaritmos en el ACP y los conglomerados, técnicas sensibles a distribuciones muy asimétricas y a distancias dominadas por valores extremos.

Efecto de la transformación logarítmica
Variable Asimetría original Asimetría log10 Reducción (%)
Precio 1.85 0.25 86.73
Área construida 2.69 0.51 80.93

La comparación gráfica permite comprobar el cambio de forma y no solamente la reducción numérica de la asimetría. Cada panel utiliza una escala horizontal propia para representar correctamente los valores originales y sus logaritmos.

Distribución del precio y del área construida en escalas original y logarítmica.

Distribución del precio y del área construida en escalas original y logarítmica.

Las variables estructurales son conteos discretos; por ello, se representan mediante porcentajes por valor y no mediante densidades continuas. Esta visualización permite identificar las configuraciones habitacionales predominantes y comprobar que la imputación no generó valores fraccionarios o fuera del rango observado.

Distribución porcentual de parqueaderos, baños y habitaciones.

Distribución porcentual de parqueaderos, baños y habitaciones.

La configuración modal de la oferta es de 1 parqueadero (51,1 %), 2 baños (35,6 %) y 3 habitaciones (49,5 %). Las distribuciones mantienen colas derechas: existe un grupo reducido de inmuebles con una dotación muy superior a la vivienda habitual, coherente con la presencia de propiedades grandes y de alto valor.

piso requiere una lectura diferenciada. En los apartamentos se interpreta como la planta en la que se ubica la unidad; en las casas suele representar el número de niveles. La figura utiliza únicamente casos reportados y porcentajes calculados dentro de cada tipo de vivienda, por lo que describe la información disponible sin presentar los faltantes como valores observados.

Distribución del piso o número de niveles según el tipo de vivienda.

Distribución del piso o número de niveles según el tipo de vivienda.

Entre los registros observados, las casas se concentran en 2 niveles (47,7 %), mientras que en los apartamentos la planta más frecuente es la 3 (15,4 %). La distribución de los apartamentos se extiende hasta plantas superiores y es considerablemente más dispersa. Esta diferencia empírica confirma que mezclar ambos significados de piso en una sola variable activa produciría una interpretación ambigua.

2.3 Composición de la oferta inmobiliaria

La oferta está compuesta principalmente por Apartamento, que representa el 61,3 % de los registros. La zona con mayor participación es Zona Sur (56,8 %) y el estrato más frecuente es 5 (33,1 %). Estas proporciones describen la composición de la base y no deben interpretarse directamente como participación del parque total de viviendas de la ciudad, pues los datos corresponden a inmuebles ofertados.

Composición de la oferta por tipo, zona y estrato
Variable Categoría n Oferta (%)
estrato 3 1453 17.47
estrato 4 2129 25.59
estrato 5 2750 33.06
estrato 6 1987 23.89
tipo Apartamento 5100 61.31
tipo Casa 3219 38.69
zona Zona Centro 124 1.49
zona Zona Norte 1920 23.08
zona Zona Oeste 1198 14.40
zona Zona Oriente 351 4.22
zona Zona Sur 4726 56.81
Composición porcentual de la oferta por tipo, zona y estrato.

Composición porcentual de la oferta por tipo, zona y estrato.

La oferta presenta además una dimensión barrial de alta cardinalidad. El barrio con mayor número de registros es Valle Del Lili, con 1.009 viviendas (12,13 % de la base). Para evitar una figura ilegible, se muestran únicamente los quince barrios con más anuncios; la tabla añade sus medianas de precio y área para distinguir volumen de oferta y nivel de mercado.

Quince barrios con mayor volumen de oferta
Barrio n Oferta (%) Precio mediano Área mediana
Valle Del Lili 1009 12.13 235.0 76.0
Ciudad Jardín 518 6.23 670.0 200.0
Pance 412 4.95 780.0 199.0
La Flora 368 4.42 350.0 105.5
Santa Teresita 263 3.16 750.0 194.0
El Caney 209 2.51 220.0 85.0
El Ingenio 203 2.44 355.0 129.0
La Hacienda 166 2.00 327.5 98.0
Acopi 158 1.90 375.0 136.0
Los Cristales 154 1.85 490.0 125.0
Normandía 154 1.85 621.5 166.0
El Limonar 135 1.62 370.0 160.0
Prados Del Norte 127 1.53 229.0 75.0
El Refugio 120 1.44 240.0 94.0
Aguacatal 109 1.31 690.0 184.0
Quince barrios con mayor volumen de oferta inmobiliaria.

Quince barrios con mayor volumen de oferta inmobiliaria.

Los cinco barrios con mayor presencia reúnen el 30,9 % de todos los anuncios, por lo que la oferta muestra una concentración espacial apreciable. El volumen y el valor describen dimensiones distintas: Valle Del Lili lidera el número de propiedades con un precio mediano de 235,0 millones, mientras que Pance presenta el mayor precio mediano dentro de los quince barrios más ofertados, con 780,0 millones. Esta diferencia justifica analizar posteriormente tanto la cantidad de oferta como su nivel de precios y su localización.

2.4 Caracterización por tipo, zona y estrato

La comparación entre segmentos se basa principalmente en medianas y cuartiles, debido a la asimetría del precio. La tabla reúne el tamaño de cada grupo, su participación y las características económicas y estructurales de una vivienda representativa.

Características de la oferta por tipo, zona y estrato
Dimensión Oferta (%) Categoría n Precio medio Precio mediano Precio Q1 Precio Q3 Área mediana Parqueaderos Baños Habitaciones
tipo 61.31 Apartamento 5100 366.94 279 175.00 430.00 90.0 1 2 3.0
tipo 38.69 Casa 3219 539.99 430 300.00 670.00 240.0 2 4 4.0
zona 1.49 Zona Centro 124 309.69 297 188.75 361.25 160.0 1 3 4.5
zona 23.08 Zona Norte 1920 345.61 300 160.00 430.00 107.0 1 2 3.0
zona 14.40 Zona Oeste 1198 677.58 580 393.50 900.00 165.5 2 4 3.0
zona 4.22 Zona Oriente 351 228.53 210 145.00 290.00 160.0 1 2 4.0
zona 56.81 Zona Sur 4726 426.52 320 222.00 520.00 113.0 1 3 3.0
estrato 17.47 3 1453 210.32 160 120.00 270.00 91.0 1 2 3.0
estrato 25.59 4 2129 275.10 235 165.00 335.00 83.0 1 2 3.0
estrato 33.06 5 2750 410.25 350 270.00 470.00 115.0 2 3 3.0
estrato 23.89 6 1987 800.29 700 515.00 990.00 198.0 2 4 3.0

Dentro de cada criterio, el mayor precio mediano corresponde a Casa entre los tipos de vivienda, a Zona Oeste entre las zonas y al estrato 6 entre los niveles socioeconómicos. Sus medianas son, respectivamente, 430,00, 580,00 y 700,00 millones de COP.

Las casas presentan un precio mediano de 430 millones de COP y un área mediana de 240 m², frente a 279 millones y 90 m² en los apartamentos. La vivienda típica tipo casa también dispone de más parqueaderos, baños y habitaciones. Por tanto, su mayor precio absoluto coincide con un tamaño y una dotación mayores; todavía no puede concluirse que sea más costosa por unidad de superficie.

La Zona Sur concentra el 56,8 % de la oferta y presenta un precio mediano de 320 millones. En contraste, la Zona Oeste representa el 14,4 % de los anuncios, pero alcanza la mediana más alta, de 580 millones; la menor corresponde a Zona Oriente, con 210 millones. Se observa además un gradiente socioeconómico claro: la mediana pasa de 160 millones en el estrato 3 a 700 millones en el estrato 6.

Los diagramas de caja muestran simultáneamente la posición central, la dispersión y el solapamiento entre grupos. El eje vertical se representa en escala logarítmica para que las colas superiores no oculten las diferencias en la mayor parte de la oferta. Las diferencias descriptivas no implican por sí mismas causalidad: zona, estrato, tipo, área y dotación están relacionados entre sí.

Distribución del precio por tipo de vivienda, zona y estrato socioeconómico.

Distribución del precio por tipo de vivienda, zona y estrato socioeconómico.

2.5 Relaciones entre variables cuantitativas

Se utilizó la correlación de Spearman porque mide relaciones monotónicas, admite variables de conteo y es menos sensible que Pearson a la asimetría y a los valores extremos.

Matriz de correlaciones de Spearman
Variable Precio Área construida Parqueaderos Baños Habitaciones
Precio 1.000 0.822 0.739 0.780 0.440
Área construida 0.822 1.000 0.643 0.788 0.675
Parqueaderos 0.739 0.643 1.000 0.631 0.352
Baños 0.780 0.788 0.631 1.000 0.625
Habitaciones 0.440 0.675 0.352 0.625 1.000

La asociación cuantitativa de mayor magnitud se observa entre Precio y Área construida, con \(\rho_s = 0,822\). Se trata de una relación monotónica fuerte: las viviendas de mayor superficie tienden a presentar precios más altos.

El precio también muestra asociaciones elevadas con los baños (\(\rho_s = 0,780\)) y los parqueaderos (\(\rho_s = 0,739\)), mientras que su relación con el número de habitaciones es menor (\(\rho_s = 0,440\)). A su vez, el área se relaciona con los baños (\(\rho_s = 0,788\)) y las habitaciones (\(\rho_s = 0,675\)). Este entramado confirma que varias características contienen información compartida; dicha redundancia constituye precisamente una justificación para emplear ACP en una fase posterior.

Las correlaciones que incluyen parqueaderos, baños o habitaciones se consideran exploratorias porque incorporan valores imputados. Su estabilidad se contrastará posteriormente entre los cinco conjuntos completados antes de adoptar conclusiones multivariantes definitivas.

Matriz gráfica de correlaciones de Spearman entre las variables cuantitativas.

Matriz gráfica de correlaciones de Spearman entre las variables cuantitativas.

El diagrama precio-área permite comprobar la forma de esta relación y su comportamiento por tipo de vivienda. Ambos ejes se transforman a logaritmo base 10; así se conserva el orden de las observaciones y se reduce la compresión visual causada por los inmuebles más grandes y costosos. Como puede apreciarse, las rectas describen tendencias dentro de cada tipo.

Relación entre el área construida y el precio, diferenciada por tipo de vivienda.

Relación entre el área construida y el precio, diferenciada por tipo de vivienda.

2.6 Asociación entre variables categóricas

La independencia entre tipo, zona y estrato se evaluó mediante pruebas chi-cuadrado. Dado que el valor \(p\) está influido por el gran tamaño muestral, se informa también la \(V\) de Cramér, que cuantifica la intensidad de la asociación en una escala entre 0 y 1. La tabla incorpora además la frecuencia esperada mínima y el porcentaje de celdas con frecuencia esperada inferior a cinco para comprobar el supuesto de aproximación de la prueba.

Asociación entre las variables categóricas
Relación Chi-cuadrado gl p V de Cramér Esperada mínima % esperadas < 5
tipo vs. zona 690.930 4 <0.001 0.288 47.981 0
tipo vs. estrato 224.331 3 <0.001 0.164 562.232 0
zona vs. estrato 3830.435 12 <0.001 0.392 21.658 0

La menor frecuencia esperada entre todas las tablas es 21,66 y el máximo porcentaje de celdas con frecuencia esperada inferior a cinco es 0,0 %. Estos indicadores permiten comprobar si la aproximación chi-cuadrado resulta adecuada. La mayor intensidad entre las tres relaciones evaluadas corresponde a zona vs. estrato, con \(V = 0,392\) y \(p\) < 0,001. La significancia indica que la composición observada no es independiente, mientras que la \(V\) de Cramér permite juzgar si esa diferencia es también sustantivamente importante.

Las tres asociaciones son significativas, aunque su magnitud difiere. La relación entre zona y estrato es la más intensa (\(V = 0,392\)), seguida de tipo y zona (\(V = 0,288\)) y de tipo y estrato (\(V = 0,164\)). En términos de composición, Zona Oeste presenta la mayor proporción de apartamentos (85,9 %), mientras que Zona Oriente registra la mayor proporción de casas (82,3 %). La tipología de la oferta cambia, por tanto, según el sector urbano.

Composición porcentual del tipo de vivienda dentro de cada zona.

Composición porcentual del tipo de vivienda dentro de cada zona.

Composición porcentual del estrato dentro de cada tipo de vivienda.

Composición porcentual del estrato dentro de cada tipo de vivienda.

Estas composiciones anticipan que el posterior análisis de correspondencias puede revelar perfiles territoriales diferenciados. Sin embargo, el análisis formal de correspondencias y la interpretación de sus dimensiones se reservan para la fase correspondiente.

2.7 Sensibilidad frente a los posibles duplicados

Como comprobación, se compararon los estadísticos de la base completa con un escenario que excluye todos los registros marcados como posibles duplicados. Esta segunda opción elimina ambos miembros de cada coincidencia y, por tanto, representa una prueba más exigente que conservar una sola observación por grupo; no se adopta como base definitiva.

Sensibilidad descriptiva frente a los posibles duplicados
Escenario n Precio medio Precio mediano Área media Área mediana
Todos los registros 8319 433.90 330 174.93 123
Sin posibles duplicados 8205 435.46 330 175.35 124

La exclusión modifica la mediana del precio en 0,000 % y la mediana del área en 0,813 %. Esta comparación permite verificar de manera transparente si las coincidencias detectadas alteran la descripción central del mercado, sin asumir que todas sean anuncios duplicados.

Los cambios observados son inferiores al 1 % en ambas medianas. En consecuencia, conservar y marcar los 114 registros potencialmente repetidos no modifica de forma sustancial las conclusiones descriptivas centrales del EDA.

2.8 Conclusión del análisis exploratorio

El EDA permite establecer cinco conclusiones preliminares:

  1. El precio y el área presentan una marcada asimetría positiva; por ello, las transformaciones logarítmicas están justificadas para las técnicas basadas en varianzas y distancias.
  2. La oferta analizada se concentra en Apartamento, la Zona Sur y el estrato 5, aunque existe heterogeneidad territorial y a nivel de barrio.
  3. El mayor precio mediano se encuentra en la Zona Oeste y el estrato 6. El marcado gradiente socioeconómico debe examinarse conjuntamente con el área, el tipo y la dotación del inmueble.
  4. La asociación de Spearman entre precio y área es 0,822; en consecuencia, el tamaño construido es una dimensión relevante del valor ofertado, sin agotar la influencia de la localización y las características estructurales.
  5. La relación categórica más intensa de las evaluadas es zona vs. estrato, resultado que justifica profundizar posteriormente mediante análisis de correspondencias.

Estos hallazgos dejan la base preparada para iniciar el análisis de componentes principales. A continuación se reduce la información cuantitativa compartida a un número menor de dimensiones, procurando conservar la mayor proporción posible de la variabilidad original.

3 Análisis de Componentes Principales (ACP)

3.1 Selección y preparación de las variables

El ACP se aplicó a cinco variables cuantitativas activas: precio, área construida, parqueaderos, baños y habitaciones. Específicamente, el Precio y el área se transformaron mediante logaritmo base 10 para moderar la asimetría observada durante el EDA. Los tres conteos corresponden al primer conjunto completado mediante imputación múltiple; la estabilidad de esta decisión se contrasta posteriormente utilizando las cinco imputaciones. El procedimiento sigue el enfoque de reducción dimensional basado en combinaciones lineales de máxima varianza descrito por Jolliffe y Cadima (2016).

No se incluyeron el identificador ni las coordenadas porque no describen atributos estructurales comparables. Tampoco se utilizóel atributopiso, ya que además de presentar una elevada proporción de ausencias, representa la planta de ubicación en apartamentos y el número de niveles en casas. El atributoestrato` se incorporó como variable suplementaria ordinal, es decir, se proyecta sobre los componentes una vez construidos, facilitando su interpretación sin modificar cargas, autovalores ni varianza explicada.

Variables cuantitativas activas del ACP
Variable activa Tratamiento Interpretación
Precio (log10) Transformación log10 y estandarización Dimensión económica de la oferta
Área construida (log10) Transformación log10 y estandarización Tamaño físico del inmueble
Parqueaderos Imputación PMM y estandarización Dotación vehicular
Baños Imputación PMM y estandarización Dotación sanitaria
Habitaciones Imputación PMM y estandarización Capacidad habitacional

Como las variables están expresadas en unidades diferentes, el ACP se estimó sobre la matriz de correlaciones. Esta decisión impide que el precio o el área dominen los componentes únicamente por su escala de medida.

Comprobación de la estandarización
Variable Media Desviación estándar
Precio (log10) 0 1
Área construida (log10) 0 1
Parqueaderos 0 1
Baños 0 1
Habitaciones 0 1

La siguiente matriz de Pearson corresponde exactamente a las variables transformadas e imputadas que participan en el ACP. Se presenta de manera independiente de la matriz de Spearman utilizada anteriormente en el EDA, pues ambas responden a objetivos diferentes.

Matriz de correlaciones de Pearson utilizada en el ACP
Variable Precio (log10) Área construida (log10) Parqueaderos Baños Habitaciones
Precio (log10) 1.000 0.798 0.662 0.741 0.337
Área construida (log10) 0.798 1.000 0.605 0.758 0.608
Parqueaderos 0.662 0.605 1.000 0.580 0.285
Baños 0.741 0.758 0.580 1.000 0.596
Habitaciones 0.337 0.608 0.285 0.596 1.000

Las correlaciones positivas muestran que precio, área y dotación tienden a aumentar conjuntamente. La existencia de información compartida entre las variables permite plantear su representación mediante un número menor de componentes.

3.2 Pertinencia del ACP

Antes de extraer componentes se evaluó si las variables comparten suficiente información. El índice KMO global fue 0,761. Como referencia, valores superiores a 0,60 suelen considerarse aceptables para resumir una matriz mediante factores o componentes. La prueba de esfericidad de Bartlett produjo \(\chi^2(10) = 28.011,40\), con \(p\) < 0,001, por lo que se rechaza que la matriz de correlaciones sea una matriz identidad.

Pertinencia de la matriz para el ACP
Indicador Valor p-valor
KMO global 0.761
Bartlett (chi-cuadrado) 28011.399 < 0,001
Adecuación muestral individual
Variable MSA individual
Precio (log10) 0.704
Área construida (log10) 0.764
Parqueaderos 0.917
Baños 0.830
Habitaciones 0.611

El menor MSA individual fue 0,611 y correspondió a Habitaciones. En conjunto, estos diagnósticos respaldan la aplicación del ACP.

3.3 Elección del número de componentes

Autovalores y varianza explicada por el ACP
Componente Autovalor % de varianza % acumulado
CP1 3.43 68.60 68.60
CP2 0.80 16.07 84.67
CP3 0.39 7.77 92.44
CP4 0.25 4.98 97.42
CP5 0.13 2.58 100.00
Porcentaje de varianza explicado por cada componente y criterio de Kaiser.

Porcentaje de varianza explicado por cada componente y criterio de Kaiser.

En este sentido, el criterio de Kaiser retiene una componente, mientras que el análisis paralelo, basado en la comparación con datos aleatorios, sugiere una componente. Para el objetivo descriptivo de esta actividad se conservaron 2 componentes, el mínimo necesario para superar el 80 % de varianza acumulada: explican conjuntamente 84,7 %. Esta solución permite representar el mercado en un plano sin sacrificar una fracción sustancial de la información.

Criterios para elegir el número de componentes
Criterio Componentes sugeridos
Kaiser (autovalor > 1) 1
Análisis paralelo (percentil 95) 1
Varianza acumulada mínima del 80 % 2
Comparación de los autovalores observados con el percentil 95 de los autovalores aleatorios.

Comparación de los autovalores observados con el percentil 95 de los autovalores aleatorios.

Kaiser y el análisis paralelo favorecen una solución muy parsimoniosa. Sin embargo, conservar exclusivamente CP1 explicaría 68,6 % y dejaría sin representar 31,4 % de la variabilidad. CP2 aporta un 16,1 % adicional, eleva la representación acumulada al 84,7 % y presenta un contraste inmobiliario interpretable entre habitaciones y parqueaderos. Por ello se retienen dos componentes con finalidad descriptiva y para la posterior segmentación, dejando explícita la discrepancia entre los criterios.

3.4 Interpretación de los componentes

El signo de una componente es arbitrario, es decir, invertir simultáneamente todos sus coeficientes no cambia el resultado. Para mantener una lectura reproducible, se adoptó la convención de orientar CP1 hacia precios altos y CP2 hacia una mayor dotación de parqueaderos. La interpretación se centra en la magnitud, el sentido relativo y la contribución de las variables. Con cinco variables, la contribución media esperada es del 20 %; los valores superiores a ese umbral son los que más definen cada eje.

Cargas, correlaciones y contribuciones de las variables
Variable Carga CP1 Carga CP2 Correlación CP1 Correlación CP2 Contribución CP1 (%) Contribución CP2 (%)
Precio (log10) 0.472 0.343 0.874 0.308 22.281 11.774
Área construida (log10) 0.497 -0.063 0.921 -0.057 24.733 0.401
Parqueaderos 0.410 0.493 0.759 0.442 16.799 24.280
Baños 0.484 -0.104 0.897 -0.093 23.462 1.087
Habitaciones 0.357 -0.790 0.661 -0.708 12.726 62.458

En la primera componente, las variables con contribución superior al promedio son Precio (log10), Área construida (log10) y Baños; la mayor aportación corresponde a Área construida (log10) (24,7 %). Todas las variables se relacionan positivamente con el eje: área (0,921), baños (0,897), precio (0,874), parqueaderos (0,759) y habitaciones (0,661). CP1 se interpreta, por tanto, como una dimensión de escala, valor y dotación inmobiliaria: puntuaciones altas identifican viviendas grandes, costosas y mejor dotadas; puntuaciones bajas representan inmuebles más pequeños, económicos y con menor dotación.

La segunda componente está definida principalmente por Parqueaderos y Habitaciones y su mayor contribución procede de Habitaciones (62,5 %). Habitaciones presenta una correlación negativa de -0,708, mientras que parqueaderos alcanza 0,442 y precio 0,308. Área y baños tienen correlaciones próximas a cero. CP2 representa así una dimensión de configuración habitaciones–parqueaderos: las puntuaciones positivas corresponden a inmuebles con mayor dotación relativa de parqueaderos y precio, mientras que las negativas reflejan una configuración comparativamente más orientada hacia el número de habitaciones.

Círculo de correlaciones de las variables activas con las dos primeras componentes.

Círculo de correlaciones de las variables activas con las dos primeras componentes.

En el círculo, vectores próximos indican correlación positiva; vectores opuestos, asociación negativa; y ángulos cercanos a 90 grados, poca relación lineal. La longitud de cada flecha refleja qué tan bien queda representada la variable en el plano. En las variables activas, el color muestra el coseno cuadrado (\(\cos^2\)), definido como la suma de las correlaciones al cuadrado con CP1 y CP2: los tonos más oscuros identifican variables mejor representadas por las dos dimensiones retenidas. La flecha naranja discontinua corresponde al estrato suplementario y no intervino en la construcción de los ejes. Para proyectarlo se respetó su orden 3–6 y se calcularon correlaciones de Pearson con las puntuaciones; esta codificación se utiliza únicamente con una finalidad descriptiva.

Proyección suplementaria del estrato
Variable suplementaria Correlación CP1 Correlación CP2 cos² en el plano
Estrato 0.463 0.508 0.472

El estrato presenta una correlación de 0,463 con CP1 y de 0,508 con CP2. Su \(\cos^2\) en el plano es 0,472, de modo que debe interpretarse con cautela en este plano. Su orientación hacia valores positivos de CP1 confirma el gradiente observado en los centroides: los estratos superiores se asocian con viviendas de mayor escala, precio y dotación.

Contribución porcentual de cada variable a las dos primeras componentes.

Contribución porcentual de cada variable a las dos primeras componentes.

3.5 Representación de los inmuebles

El biplot integra en un mismo plano las puntuaciones de las viviendas y las direcciones de las variables. Las flechas azules continuas representan las cinco variables activas y la naranja discontinua corresponde al estrato suplementario. La proximidad entre puntos indica perfiles cuantitativos semejantes; la proyección aproximada de un inmueble sobre una flecha muestra su posición relativa respecto de ese atributo. Para hacer visibles ambas geometrías, las flechas se amplificaron mediante un factor común exclusivamente gráfico: su dirección y longitud relativa son interpretables, pero sus extremos no están expresados en la misma unidad que las puntuaciones de los inmuebles.

Biplot de las viviendas y las variables activas sobre las dos primeras componentes.

Biplot de las viviendas y las variables activas sobre las dos primeras componentes.

El biplot permite reconocer la dimensión general de escala y dotación hacia la derecha de CP1, el contraste entre habitaciones y parqueaderos a lo largo de CP2 y la asociación del estrato con estas dimensiones. Esta representación orienta la lectura del mercado, aunque todavía no crea conglomerados ni asigna segmentos.

Como análisis complementario, el plano siguiente diferencia las viviendas por tipología. El color y las elipses de concentración al 80 % permiten examinar si casas y apartamentos ocupan regiones diferentes del espacio principal.

Proyección de los inmuebles en las dos primeras componentes, diferenciada por tipología.

Proyección de los inmuebles en las dos primeras componentes, diferenciada por tipología.

Los centros de grupo resumen la posición media de cada tipo, zona y estrato. Un centro positivo o negativo solo adquiere significado al relacionarlo con las cargas del componente correspondiente; no representa por sí mismo una valoración favorable o desfavorable.

Centros de los grupos en el plano principal
Agrupación Categoría n Centro CP1 Centro CP2
Tipo Apartamento 5100 -0.79 0.23
Tipo Casa 3219 1.26 -0.36
Zona Zona Centro 124 0.09 -0.96
Zona Zona Norte 1920 -0.41 -0.10
Zona Zona Oeste 1198 0.69 0.54
Zona Zona Oriente 351 -0.23 -1.22
Zona Zona Sur 4726 0.01 0.02
Estrato 3 1453 -0.92 -0.74
Estrato 4 2129 -0.82 -0.19
Estrato 5 2750 0.06 0.04
Estrato 6 1987 1.47 0.68

La tipología presenta una diferenciación consistente. Las casas se sitúan, en promedio, en CP1 = 1,26 y CP2 = -0,36: tienen mayor escala y dotación general y una configuración relativamente más orientada hacia habitaciones. Los apartamentos alcanzan CP1 = -0,79 y CP2 = 0,23, lo que refleja menor escala media y una posición relativamente más vinculada con parqueaderos y precio.

También aparece un patrón territorial. La Zona Oeste ocupa una posición positiva en ambos componentes (CP1 = 0,69; CP2 = 0,54), mientras que la Zona Oriente se distingue por su puntuación negativa en CP2 (-1,22). La Zona Sur permanece próxima al origen, con CP1 = 0,01 y CP2 = 0,02, por lo que representa aproximadamente el perfil cuantitativo medio de la base.

El gradiente socioeconómico es especialmente claro: el centro de CP1 pasa de -0,92 en el estrato 3 a 1,47 en el estrato 6. Esto confirma que los estratos superiores concentran viviendas de mayor tamaño, precio y dotación, aunque el ACP describe asociaciones y no establece relaciones causales.

3.6 Comprobaciones de robustez

Debido a que parqueaderos, baños y habitaciones contienen valores imputados, se repitió el ACP en cada uno de los cinco conjuntos completados. La congruencia compara la dirección de las cargas con la solución principal en una escala de 0 a 1; valores próximos a 1 indican estructuras prácticamente iguales, independientemente del signo arbitrario de los ejes.

Estabilidad del ACP entre los cinco conjuntos imputados
Imputación % CP1 % CP2 % acumulado Congruencia CP1 Congruencia CP2
1 68.599 16.069 84.668 1 1.0000
2 68.535 16.106 84.640 1 1.0000
3 68.717 15.896 84.614 1 0.9999
4 68.583 16.073 84.656 1 1.0000
5 68.705 16.044 84.749 1 1.0000

La congruencia mínima observada entre ambas componentes y las cinco imputaciones fue 0,9999. La varianza acumulada de CP1 y CP2 osciló entre 84,61 % y 84,75 %. Estos resultados muestran una estabilidad muy alta frente a la incertidumbre de imputación.

El ACP también es sensible a observaciones extremas. En lugar de eliminarlas de la solución oficial, se efectuó un análisis secundario excluyendo los 113 inmuebles que cumplen un criterio conjunto de extremos univariantes: al menos una variable estandarizada con valor absoluto superior a cuatro. Esta comprobación evalúa su influencia sin confundir automáticamente los inmuebles de alta gama legítimos con errores.

Sensibilidad del ACP frente a observaciones extremas
Escenario n % CP1 % CP2 % acumulado Congruencia CP1 Congruencia CP2
Base analítica completa 8319 68.599 16.069 84.668 1.0000 1.0000
Sin casos con valor absoluto de z > 4 8206 68.963 16.413 85.375 0.9999 0.9993

La congruencia de las cargas fue 0,9999 para CP1 y 0,9993 para CP2. Por tanto, la estructura principal se conserva prácticamente intacta y se justifica mantener la diversidad real del mercado.

3.7 Conclusión del análisis ACP

El ACP transforma cinco indicadores activos correlacionados en 2 dimensiones que conservan 84,7 % de la variabilidad. CP1 sintetiza la escala, el valor y la dotación inmobiliaria; CP2 diferencia configuraciones relativamente orientadas hacia habitaciones o hacia parqueaderos y precio. La proyección suplementaria del estrato permite relacionar estas dimensiones con el gradiente socioeconómico sin alterar la solución. El ACP es adecuado según KMO y Bartlett y ha sido contrastado frente a las imputaciones y los casos extremos.

Estas componentes no sustituyen las variables originales en la descripción, pero proporcionan coordenadas ortogonales y de baja dimensionalidad para el análisis de conglomerados. En la siguiente fase sus puntuaciones se estandarizan, se comparan alternativas para elegir el número de segmentos y cada grupo se caracteriza nuevamente en las unidades inmobiliarias originales.

4 Análisis de conglomerados

4.1 Preparación de la segmentación

El análisis de conglomerados tiene como objetivo reunir viviendas con perfiles cuantitativos semejantes y separar aquellas que difieren en escala, valor y configuración. La clasificación es no supervisada: los segmentos no existían previamente en la base y se obtienen a partir de las distancias entre observaciones.

Se utilizaron las dos componentes retenidas en el ACP, que sintetizan 84,7 % de la variabilidad de las cinco variables activas. Esta elección reduce redundancias, evita agrupar simultáneamente variables muy correlacionadas y permite representar gráficamente toda la solución. La distancia utilizada fue la euclídea, coherente con los métodos de Ward y k-means.

Preparación del análisis de conglomerados
Elemento Decisión metodológica
Unidad de análisis 8.319 viviendas
Variables de entrada PC1 y PC2
Información conservada 84.67 % de la varianza del ACP
Preprocesamiento Estandarización de las puntuaciones retenidas
Distancia Euclídea
Método exploratorio Jerárquico de Ward.D2 sobre una muestra reproducible
Método definitivo k-means sobre la base analítica completa

Aunque CP1 y CP2 son ortogonales, sus varianzas no son iguales: CP1 concentra más información y, sin un ajuste adicional, dominaría la distancia. Para que la dimensión de configuración habitaciones–parqueaderos tenga la misma oportunidad de definir perfiles que la dimensión general de escala y dotación, las puntuaciones de ambas componentes se centraron y dividieron por su desviación estándar. Esta decisión es explícita: persigue una segmentación estratégica sobre las dos dimensiones interpretables, no una reproducción exacta de la ponderación por varianza del ACP.

Comprobación de la escala utilizada para agrupar
Componente Desviación antes Media después Desviación después
PC1 1.8520 0 1
PC2 0.8964 0 1

El estrato no se incorporó como tercera variable activa porque ya se relaciona intensamente con CP1 y añadirlo habría duplicado parcialmente el gradiente económico. Se utiliza, junto con el tipo y la zona, como variable externa de caracterización. De esta manera se puede comprobar si los grupos cuantitativos muestran diferencias socioeconómicas y territoriales sin imponerlas de antemano.

4.2 Elección del número de conglomerados

Se estimaron soluciones entre 2 y 8 grupos. La suma de cuadrados dentro de los grupos (WSS) mide compactación y debe disminuir al aumentar \(k\); el criterio del codo busca el punto a partir del cual esa reducción presenta rendimientos decrecientes. El índice de silueta combina cohesión interna y separación respecto del grupo vecino, mientras que Calinski–Harabasz compara la variación entre grupos con la variación interna. En estos dos últimos índices son preferibles los valores altos.

La WSS y Calinski–Harabasz se calcularon sobre las 8.319 viviendas. Para la silueta se utilizó una muestra aleatoria reproducible de 2.000 casos, evitando construir repetidamente una matriz completa de más de 34 millones de distancias.

Comparación de soluciones para elegir el número de grupos
k WSS Reducción WSS (%) Silueta media Calinski-Harabasz Elegida
2 10866.5 0.411 4415.9
3 6307.0 42.0 0.472 6809.5
4 4821.1 23.6 0.411 6792.4
5 3813.0 20.9 0.417 6989.9
6 3304.0 13.4 0.411 6708.9
7 2922.0 11.6 0.413 6501.9
8 2614.9 10.5 0.376 6366.3
Evolución de la suma de cuadrados intragrupo para las soluciones candidatas.

Evolución de la suma de cuadrados intragrupo para las soluciones candidatas.

Índices de validación interna según el número de conglomerados.

Índices de validación interna según el número de conglomerados.

Los criterios no obligan a seleccionar el mismo valor: el codo geométrico se sitúa en k = 4, la mayor silueta media se alcanza con k = 3 y el máximo Calinski–Harabasz con k = 5. Esta discrepancia es informativa. Una solución con menos grupos favorece separación y parsimonia, mientras que una con más grupos captura perfiles comerciales más específicos a costa de fragmentar la muestra.

Criterios utilizados para seleccionar k
Criterio k Función en la decisión
Codo geométrico del WSS 4 Busca el punto a partir del cual añadir grupos reduce menos el WSS
Máxima silueta media 3 Favorece grupos compactos y separados
Máximo Calinski-Harabasz 5 Compara separación entre grupos con compactación interna
Solución adoptada 4 Equilibra evidencia estadística e interpretación inmobiliaria

Se adopta k = 4. La silueta favorece la solución con 3 grupos (0,472), que prioriza la separación global, mientras que Calinski–Harabasz alcanza su máximo con 5 grupos (6.989,9). Frente a cuatro grupos, esta última alternativa solo mejora la silueta en 0,007 puntos y Calinski–Harabasz en 2,9 %. Su WSS disminuye 20,9 %, pero esta medida decrece necesariamente al aumentar el número de grupos y no constituye por sí sola un criterio de selección. Con cuatro grupos, la silueta se mantiene en 0,411 y aparece un perfil adicional con interpretación inmobiliaria clara frente a la solución más parsimoniosa: se distinguen viviendas familiares amplias de inmuebles premium con mayor precio y parqueaderos. Por tanto, la elección combina evidencia estadística, tamaño suficiente de cada grupo, parsimonia e interpretabilidad empresarial; no se basa exclusivamente en el máximo de un índice.

4.3 Contraste con agrupación jerárquica

Como comprobación independiente se aplicó el método jerárquico de Ward.D2 sobre una muestra reproducible de 1.000 viviendas. Ward fusiona en cada paso los grupos que producen el menor incremento de variación interna. La muestra permite obtener un dendrograma legible sin construir la matriz de distancias de las 8.319 observaciones; por ello, esta solución tiene una función exploratoria y no sustituye la clasificación final sobre la base completa.

Dendrograma de Ward.D2 y corte en cuatro conglomerados.

Dendrograma de Ward.D2 y corte en cuatro conglomerados.

Contraste entre Ward y k-means
Indicador Valor
Índice de Rand ajustado: Ward vs. k-means 0.648
Silueta media de Ward 0.357
Silueta media de k-means en la misma muestra 0.409

El índice de Rand ajustado entre Ward y k-means fue 0,648, lo que evidencia una concordancia apreciable entre dos algoritmos con reglas de construcción diferentes. La silueta de Ward fue 0,357 y la de k-means, calculada sobre exactamente la misma muestra, fue 0,409. El contraste respalda la existencia de estructura agrupable, pero también confirma que las fronteras no son absolutas.

4.4 Solución final mediante k-means

La solución definitiva se estimó sobre toda la base con 100 inicializaciones aleatorias y semilla fija. Las múltiples inicializaciones reducen el riesgo de conservar un mínimo local desfavorable. Como la numeración interna de k-means es arbitraria, los grupos se reordenaron según su centro en CP1, desde menor hasta mayor escala, valor y dotación; después se asignaron nombres empresariales descriptivos.

Centros de la solución final de conglomerados
Segmento n Centro CP1 Centro CP2 Centro CP1 est. Centro CP2 est.
S1 - Compacto de menor precio 3696 -1.63 -0.05 -0.88 -0.06
S2 - Intermedio equilibrado 2804 0.55 0.26 0.30 0.29
S3 - Familiar amplio 882 1.94 -1.82 1.05 -2.03
S4 - Premium dotado 937 2.95 1.13 1.59 1.26
Solución de cuatro conglomerados sobre las componentes estandarizadas.

Solución de cuatro conglomerados sobre las componentes estandarizadas.

El plano confirma que CP1 ordena los segmentos desde la oferta compacta hasta la premium, mientras que CP2 separa dos configuraciones de gran tamaño: las viviendas orientadas hacia muchas habitaciones se ubican en sentido opuesto a las que destacan por parqueaderos y precio. Esta segunda separación es la principal ganancia analítica frente a clasificar el mercado únicamente por nivel económico.

Calidad interna de la partición final
Indicador Valor Unidad
WSS 4821.132 Suma de cuadrados
Variación entre grupos / variación total 71.020 %
Silueta media 0.411 Índice de -1 a 1
Casos con silueta negativa 3.350 % de la muestra de validación

La silueta media estimada en la muestra de validación es 0,411, compatible con una estructura moderada, con solapamiento esperable en un mercado continuo. El 3,4 % de esa muestra presenta silueta negativa, es decir, casos fronterizos cuya semejanza con otro segmento es mayor que con el asignado. Esto no invalida la solución: la oferta inmobiliaria forma un continuo y no categorías naturales perfectamente aisladas. Sí aconseja utilizar los conglomerados como perfiles de decisión y no como etiquetas rígidas de valoración individual.

Calidad de asignación por segmento
Segmento n en muestra Silueta media Siluetas negativas (%)
S1 - Compacto de menor precio 920 0.519 0.00
S2 - Intermedio equilibrado 618 0.304 5.66
S3 - Familiar amplio 229 0.358 9.17
S4 - Premium dotado 233 0.316 4.72

4.5 Caracterización inmobiliaria de los segmentos

La interpretación vuelve a las unidades originales. Se utilizan medianas para precio, área y conteos porque son más resistentes a la cola derecha del mercado; el estrato se resume mediante su promedio únicamente para describir el gradiente ordinal. Los nombres asignados sintetizan el perfil central de cada grupo y no corresponden a categorías preexistentes en la base.

Perfil cuantitativo de los segmentos inmobiliarios
Segmento n % Precio mediano (millones) Área mediana (m²) Parqueaderos Baños Habitaciones Estrato medio CP1 CP2
S1 - Compacto de menor precio 3696 44.4 210 75 1 2 3 4.12 -1.63 -0.05
S2 - Intermedio equilibrado 2804 33.7 450 160 2 3 3 5.16 0.55 0.26
S3 - Familiar amplio 882 10.6 400 280 1 4 6 3.98 1.94 -1.82
S4 - Premium dotado 937 11.3 1077 320 4 5 4 5.71 2.95 1.13
Perfil relativo de los segmentos en las cinco variables activas.

Perfil relativo de los segmentos en las cinco variables activas.

S1 - Compacto de menor precio. Reúne 3.696 viviendas (44,4 %). Su propiedad representativa presenta un precio de 210 millones, un área de 75 m², 1 parqueadero, 2 baños y 3 habitaciones. Los apartamentos constituyen el 84,2 %, por lo que representa principalmente la franja compacta de menor precio.

S2 - Intermedio equilibrado. Comprende 2.804 propiedades (33,7 %) y ocupa una posición intermedia en ambas componentes. Su precio mediano es 450 millones y su área mediana 160 m². La mediana de 3 habitaciones y 2 parqueaderos refleja un producto de transición entre la vivienda compacta y los inmuebles grandes.

S3 - Familiar amplio. Contiene 882 viviendas (10,6 %) y es el perfil que CP2 permite descubrir con mayor claridad. Presenta un área mediana de 280 m² y 6 habitaciones, pero un precio mediano de 400 millones y un estrato promedio de 3,98. El 97,7 % son casas. Se trata, por tanto, de inmuebles grandes y orientados a familias numerosas, pero no necesariamente de alta gama; este contraste entre amplitud y precio constituye una oportunidad comercial distinta del segmento premium.

S4 - Premium dotado. Agrupa 937 propiedades (11,3 %) con el mayor centro en CP1 y una orientación positiva en CP2. La mediana alcanza 1.077 millones, 320 m², 4 parqueaderos y 5 baños. El estrato 6 representa el 78,1 % del grupo, lo que confirma un perfil de alta gama y elevada dotación.

Distribución del precio ofertado dentro de cada segmento.

Distribución del precio ofertado dentro de cada segmento.

La distribución de precios mantiene solapamiento entre grupos, especialmente entre S2 y S3. La diferencia entre ellos no depende exclusivamente del precio: S3 se distingue por área, habitaciones y predominio de casas, mientras que S2 presenta una configuración más equilibrada. Esto confirma que la segmentación es multidimensional y no una simple división por cuartiles de precio.

4.5.1 Composición por tipo, estrato y zona

Composición por tipo de vivienda dentro de cada segmento
Segmento Casas (%) Apartamentos (%)
S1 - Compacto de menor precio 15.8 84.2
S2 - Intermedio equilibrado 42.4 57.6
S3 - Familiar amplio 97.7 2.3
S4 - Premium dotado 62.2 37.8
Participación de casas y apartamentos dentro de los segmentos.

Participación de casas y apartamentos dentro de los segmentos.

La transición tipológica es clara: S1 está dominado por apartamentos, S3 casi íntegramente por casas y S2–S4 combinan ambas tipologías. Esto indica que los atributos físicos y económicos no reproducen mecánicamente la variable tipo, aunque sí generan perfiles fuertemente asociados con ella.

Composición porcentual por estrato dentro de cada segmento
Segmento Estrato 3 Estrato 4 Estrato 5 Estrato 6
S1 - Compacto de menor precio 25.8 39.7 31.4 3.1
S2 - Intermedio equilibrado 4.2 14.6 42.4 38.8
S3 - Familiar amplio 41.4 24.9 27.8 5.9
S4 - Premium dotado 1.7 3.7 16.4 78.1
Participación de los estratos socioeconómicos dentro de los segmentos.

Participación de los estratos socioeconómicos dentro de los segmentos.

La composición socioeconómica confirma la utilidad de mantener el estrato como variable de caracterización. S4 concentra la mayor presencia del estrato 6; S1 se distribuye principalmente entre estratos medios; y S3 combina gran tamaño físico con una participación apreciable de estratos bajos y medios. Si el estrato se hubiera incluido como variable activa, esta lectura habría sido parcialmente impuesta en lugar de observada después de la agrupación.

Composición porcentual por zona dentro de cada segmento
Segmento Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
S1 - Compacto de menor precio 1.4 27.9 5.2 4.4 61.1
S2 - Intermedio equilibrado 0.7 21.1 24.0 0.9 53.3
S3 - Familiar amplio 5.7 22.1 5.9 18.0 48.3
S4 - Premium dotado 0.2 11.1 29.9 0.3 58.5

Como la Zona Sur representa una parte elevada de toda la base, puede ser mayoritaria en varios segmentos sin ser necesariamente su rasgo territorial distintivo. Para evitar esa confusión se calculó un índice de localización: compara el peso de cada zona dentro de un segmento con su peso en el mercado completo. Un valor superior a 1 señala sobrerrepresentación relativa.

Especialización territorial relativa de los segmentos
Segmento Zona relativamente destacada % dentro del segmento Índice de localización
S1 - Compacto de menor precio Zona Norte 27.9 1.21
S2 - Intermedio equilibrado Zona Oeste 24.0 1.66
S3 - Familiar amplio Zona Oriente 18.0 4.27
S4 - Premium dotado Zona Oeste 29.9 2.08

Este indicador muestra que S1 se asocia relativamente con Zona Norte, S2 con Zona Oeste, S3 con Zona Oriente y S4 con Zona Oeste. La lectura es relativa al volumen total de cada zona y deberá complementarse más adelante con los mapas de conglomerados.

4.6 Estabilidad y sensibilidad

La estabilidad se evaluó mediante veinte submuestras aleatorias que contienen el 80 % de la base. En cada repetición se reestimó k-means, se asignaron todas las viviendas al centro más próximo y se comparó la partición con la solución principal mediante el índice de Rand ajustado (ARI). Este índice corrige el acuerdo esperado por azar y no depende de la numeración arbitraria de los grupos.

Estabilidad de los conglomerados frente a submuestras
Repeticiones Muestra (%) ARI mínimo ARI mediano ARI medio ARI máximo
20 80 0.969 0.987 0.985 0.995

El ARI mediano fue 0,987 y el mínimo 0,969. La estabilidad frente a cambios moderados de la muestra es, por tanto, alta. Esta prueba es más exigente que repetir k-means con distintas semillas, porque modifica también las observaciones utilizadas para estimar los centros.

La incertidumbre de los valores imputados se examinó reconstruyendo el ACP y los conglomerados en cada uno de los cinco conjuntos completados. Se informa el ARI frente a la partición principal y la silueta media de cada solución.

Estabilidad de los conglomerados entre imputaciones
Imputación ARI frente a la solución principal Silueta media
1 1.000 0.411
2 0.942 0.412
3 0.943 0.408
4 0.947 0.408
5 0.954 0.409

El menor ARI entre imputaciones fue 0,942. La partición es muy estable frente a la incertidumbre de imputación.

Finalmente, se reestimó la segmentación sin los casos que presentaban al menos un valor estandarizado con \(|z| > 4\) en las variables del ACP. Estos inmuebles se conservan en la solución oficial porque pueden corresponder a oferta real de lujo o propiedades de gran tamaño; la exclusión solo funciona como análisis de influencia.

Sensibilidad de la segmentación frente a casos extremos
Escenario n comparado Casos excluidos ARI
Reestimación sin casos con valor absoluto de z > 4 8206 113 0.882

El ARI de 0,882 indica que la estructura se conserva ampliamente y los extremos no determinan por sí solos la segmentación.

4.7 Conclusión del análisis de conglomerados

La oferta inmobiliaria no se organiza únicamente por precio. La solución de cuatro grupos distingue: una oferta compacta de menor precio, un producto intermedio equilibrado, viviendas familiares amplias con muchas habitaciones y un segmento premium caracterizado por precio, parqueaderos, baños y estrato altos. La diferencia entre S3 y S4 es especialmente útil: ambos reúnen propiedades grandes, pero responden a necesidades y capacidades de compra distintas.

Desde la perspectiva empresarial, S1 puede orientar estrategias de volumen para la franja de menor precio; S2 constituye una franja intermedia con elevada presencia dentro de la oferta analizada; S3 permite dirigir campañas hacia familias que priorizan espacio; y S4 requiere una comercialización selectiva centrada en exclusividad y dotación. Estas recomendaciones son preliminares: los conglomerados describen perfiles de oferta, no demanda, rentabilidad, velocidad de venta ni causalidad sobre el precio.

A continuación se examinan las relaciones entre zona, estrato, tipo y los barrios de mayor oferta mediante análisis de correspondencias.

5 Análisis de correspondencias

5.1 Enfoque y comprobaciones previas

El análisis de correspondencias representa las diferencias entre los perfiles de una tabla de contingencia utilizando distancias chi-cuadrado. Las categorías que se apartan de la independencia son las que generan la inercia del análisis y definen sus dimensiones. Esta técnica es exploratoria: identifica asociaciones entre categorías, pero no establece causalidad ni mide por sí sola demanda inmobiliaria.

El análisis se organiza en tres tablas sencillas. zona × estrato constituye la correspondencia principal porque ambas variables tienen más de dos categorías y permiten construir un plano factorial bidimensional. tipo × zona complementa la interpretación territorial de casas y apartamentos. Finalmente, barrio × tipo se limita de forma transparente a los quince barrios con mayor número de ofertas, evitando un gráfico con más de cuatrocientas categorías y manteniendo el procedimiento visto en la unidad.

Base utilizada en el análisis de correspondencias
Registros Tipos Zonas Estratos Barrios Registros incompletos
8319 2 5 4 407 0

Se analizaron 8.319 ofertas completas para tipo, zona, estrato y barrio. La ausencia conservada en piso y la imputación de las variables estructurales no intervienen en esta fase. Tampoco se transformó el precio en intervalos: preciom es cuantitativa y su relación con la zona ya se estudió en el EDA mediante medianas y diagramas de caja.

5.2 Asociación global entre las variables

La prueba chi-cuadrado contrasta si los perfiles observados son compatibles con la independencia. Como su significación aumenta con el tamaño muestral, se informa también la \(V\) de Cramér, comprendida entre 0 y 1. La frecuencia esperada mínima y el porcentaje de celdas por debajo de cinco permiten evaluar la aproximación asintótica.

Diagnóstico de asociación entre las variables categóricas
Relación Chi-cuadrado gl p V de Cramér Esperada mínima % esperadas < 5
Zona vs. estrato 3830.435 12 <0.001 0.392 21.658 0
Tipo de vivienda vs. zona 690.930 4 <0.001 0.288 47.981 0
15 barrios principales vs. tipo 607.166 14 <0.001 0.385 33.218 0

Las tres tablas presentan un 0 % de frecuencias esperadas inferiores a cinco, por lo que puede utilizarse directamente la aproximación chi-cuadrado explicada en la unidad. La relación más intensa es zona × estrato, con \(V = 0,392\); le siguen los quince barrios principales frente al tipo, con \(V = 0,385\), y tipo × zona, con \(V = 0,288\).

5.3 Correspondencia principal entre zona y estrato

La asociación entre zona y estrato es estadísticamente significativa (\(\chi^2 = 3.830,4\), \(p\) < 0,001). La tabla utilizada contiene las frecuencias absolutas de toda la base:

Frecuencias observadas de zona por estrato
Zona 3 4 5 6 Total
Zona Centro 105 14 4 1 124
Zona Norte 572 407 769 172 1920
Zona Oeste 54 84 290 770 1198
Zona Oriente 340 8 2 1 351
Zona Sur 382 1616 1685 1043 4726
Total 1453 2129 2750 1987 8319

Los residuos estandarizados muestran qué combinaciones aparecen con una frecuencia superior o inferior a la esperada bajo independencia. Valores positivos indican exceso relativo y valores negativos, déficit; como referencia práctica, los valores absolutos superiores a 2 señalan las diferencias más claras.

Residuos estandarizados de la tabla zona-estrato
Zona Estrato 3 Estrato 4 Estrato 5 Estrato 6
Zona Centro 19.86 -3.68 -7.11 -6.07
Zona Norte 16.22 -5.03 7.43 -17.49
Zona Oeste -12.77 -15.93 -7.04 35.44
Zona Oriente 40.03 -10.23 -13.22 -10.60
Zona Sur -25.85 20.62 5.77 -4.45
Residuos estandarizados de la asociación entre zona y estrato.

Residuos estandarizados de la asociación entre zona y estrato.

El estrato 3 presenta su mayor exceso relativo en Zona Oriente, con un residuo de 40,03. Para el estrato 6, la asociación positiva más marcada corresponde a Zona Oeste, con un residuo de 35,44.

Inercia del análisis de correspondencia zona-estrato
Dimensión Autovalor Inercia (%) Inercia acumulada (%)
Dimensión 1 0.322 69.966 69.966
Dimensión 2 0.127 27.680 97.646
Dimensión 3 0.011 2.354 100.000
Porcentaje de inercia explicado por las dimensiones de la correspondencia zona-estrato.

Porcentaje de inercia explicado por las dimensiones de la correspondencia zona-estrato.

Las dos primeras dimensiones reúnen el 97,6 % de la inercia, por lo que el plano factorial conserva la mayor parte de la asociación observada. La tercera dimensión aporta el porcentaje restante y se mantiene en la tabla para documentar la solución completa.

Coordenadas y calidad de las categorías zona-estrato
Conjunto Categoría Dim. 1 Dim. 2 Contrib. Dim. 1 (%) Contrib. Dim. 2 (%) cos² del plano
Zona Zona Centro 1.725 0.364 13.761 1.547 0.984
Zona Zona Norte 0.390 -0.147 10.887 3.920 0.857
Zona Zona Oeste -0.569 0.783 14.476 69.204 0.999
Zona Zona Oriente 2.015 0.537 53.171 9.563 0.994
Zona Zona Sur -0.209 -0.188 7.704 15.767 0.956
Estrato Estrato 3 1.187 0.207 76.333 5.851 1.000
Estrato Estrato 4 -0.154 -0.380 1.895 28.966 0.901
Estrato Estrato 5 -0.132 -0.204 1.796 10.824 0.769
Estrato Estrato 6 -0.519 0.539 19.976 54.359 0.999
Mapa factorial del análisis de correspondencia entre zona y estrato.

Mapa factorial del análisis de correspondencia entre zona y estrato.

Las categorías alejadas del origen son las que más diferencian la estructura territorial. Las distancias entre categorías del mismo conjunto —zonas entre sí o estratos entre sí— reflejan semejanza de perfiles. Para relacionar una zona con un estrato se consideran la dirección compartida en el plano, los residuos estandarizados y las contribuciones; la distancia directa entre un punto de zona y uno de estrato no se interpreta como una métrica exacta. El signo de cada dimensión es arbitrario: invertir simultáneamente sus coordenadas no modificaría las asociaciones.

5.4 Correspondencia entre tipo de vivienda y zona

La tabla de entrada conserva las frecuencias absolutas de las 8.319 propiedades:

Frecuencias observadas de tipo de vivienda por zona
Tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur Total
Casa 100 722 169 289 1939 3219
Apartamento 24 1198 1029 62 2787 5100
Total 124 1920 1198 351 4726 8319

Los residuos estandarizados comparan cada frecuencia observada con la esperada bajo independencia. Un residuo positivo indica exceso relativo de esa combinación y uno negativo, déficit. Como referencia práctica, valores absolutos superiores a 2 señalan las celdas que más se apartan de la independencia.

Residuos estandarizados de la tabla tipo-zona
Tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
Casa 9.66 -1.12 -18.89 17.15 5.01
Apartamento -9.66 1.12 18.89 -17.15 -5.01
Residuos estandarizados de la asociación entre tipo de vivienda y zona.

Residuos estandarizados de la asociación entre tipo de vivienda y zona.

El mayor exceso relativo de casas se observa en Zona Oriente, con un residuo de 17,15. En los apartamentos, la asociación positiva más marcada corresponde a Zona Oeste, con un residuo de 18,89. Estos resultados cuantifican el patrón que el EDA había anticipado mediante porcentajes.

Inercia del análisis de correspondencia tipo-zona
Dimensión Autovalor Inercia (%) Inercia acumulada (%)
Dimensión 1 0.083 100 100

La tabla tiene dos filas, una por tipo de vivienda, por lo que el número máximo de dimensiones es \(\min(2-1,5-1)=1\). En consecuencia, la primera dimensión concentra el 100,0 % de la inercia por construcción. Este porcentaje no significa que la tipología pueda predecirse perfectamente; indica que toda la desviación respecto de la independencia solo puede expresarse sobre un eje.

Coordenadas y calidad de las categorías tipo-zona
Conjunto Categoría Coordenada Dim. 1 Contribución (%) cos²
Zona Zona Oeste -0.505 44.189 1
Zona Zona Norte -0.022 0.139 1
Zona Zona Sur 0.048 1.570 1
Zona Zona Centro 0.861 13.314 1
Zona Zona Oriente 0.896 40.787 1
Tipo de vivienda Apartamento -0.229 38.695 1
Tipo de vivienda Casa 0.363 61.305 1
Mapa unidimensional del análisis de correspondencia entre tipo de vivienda y zona.

Mapa unidimensional del análisis de correspondencia entre tipo de vivienda y zona.

El signo del eje es arbitrario: invertir todos los signos produciría la misma solución. Las categorías alejadas de cero son las que más diferencian los perfiles. La afinidad entre un tipo y una zona se interpreta mediante su dirección compartida en el eje y se confirma con los residuos estandarizados; la distancia directa entre una categoría de fila y una de columna no constituye una métrica exacta de asociación.

5.5 Correspondencia simplificada entre barrio y tipo de vivienda

La base contiene 407 barrios, una cardinalidad excesiva para una tabla y un gráfico interpretables. Se seleccionaron los 15 barrios con mayor número de ofertas, el mismo criterio transparente utilizado en el EDA. Este subconjunto reúne 4.105 propiedades y permite estudiar los sectores con mayor presencia en la base sin agrupar categorías heterogéneas bajo una etiqueta residual.

La prueba chi-cuadrado cumple el supuesto de frecuencias esperadas y rechaza la independencia (\(\chi^2 = 607,2\), \(p\) < 0,001), con \(V = 0,385\). Debido a que tipo tiene dos categorías, la correspondencia genera una única dimensión, que concentra el 100,0 % de la inercia por construcción.

Inercia del análisis de correspondencia barrio-tipo
Dimensión Autovalor Inercia (%) Inercia acumulada (%)
Dimensión 1 0.148 100 100

Las coordenadas de los tipos permiten orientar el eje barrial:

Orientación de los tipos de vivienda en el eje barrial
Tipo Coordenada Dim. 1 Contribución (%) cos²
Casa -0.581 69.525 1
Apartamento 0.255 30.475 1

La tabla presenta los quince barrios ordenados por su contribución al eje, junto con su composición tipológica, zona principal y precio mediano:

Perfil de los quince barrios con mayor oferta
Barrio Zona n Casas (%) Apartamentos (%) Precio mediano (millones COP) Coordenada Dim. 1 Contribución (%)
Ciudad Jardín Zona Sur 518 57.34 42.66 670.0 -0.58 29.05
Valle Del Lili Zona Sur 1009 16.65 83.35 235.0 0.30 14.99
Santa Teresita Zona Oeste 263 4.56 95.44 750.0 0.56 13.73
Pance Zona Sur 412 50.00 50.00 780.0 -0.42 12.21
Normandía Zona Oeste 154 2.60 97.40 621.5 0.61 9.30
El Limonar Zona Sur 135 56.30 43.70 370.0 -0.56 7.00
Los Cristales Zona Oeste 154 11.04 88.96 490.0 0.42 4.52
Aguacatal Zona Oeste 109 10.09 89.91 690.0 0.44 3.52
Acopi Zona Norte 158 44.30 55.70 375.0 -0.30 2.35
El Caney Zona Sur 209 40.19 59.81 220.0 -0.21 1.53
El Ingenio Zona Sur 203 36.95 63.05 355.0 -0.14 0.66
Prados Del Norte Zona Norte 127 24.41 75.59 229.0 0.13 0.36
La Flora Zona Norte 368 27.17 72.83 350.0 0.07 0.31
El Refugio Zona Sur 120 35.83 64.17 240.0 -0.12 0.27
La Hacienda Zona Sur 166 34.34 65.66 327.5 -0.08 0.19
Barrios con mayor contribución a la correspondencia entre localización y tipo de vivienda.

Barrios con mayor contribución a la correspondencia entre localización y tipo de vivienda.

Entre los barrios seleccionados, Ciudad Jardín, Pance y El Limonar son los tres que más contribuyen desde el perfil con una proporción de casas superior al promedio del subconjunto. En el sentido asociado relativamente con apartamentos destacan Valle Del Lili, Santa Teresita y Normandía. La contribución combina el volumen de oferta y la diferencia de perfil respecto del promedio.

El precio mediano incluido en la tabla funciona únicamente como contexto empresarial y no interviene en las distancias chi-cuadrado. Las conclusiones barriales se refieren a los quince sectores con mayor oferta y no deben generalizarse automáticamente a los demás barrios de la ciudad.

5.6 Conclusión del análisis de correspondencias

Los resultados permiten establecer cuatro conclusiones:

  1. Zona × estrato constituye la asociación categórica más intensa (\(V = 0,392\)). El plano factorial resume el 97,6 % de su inercia y permite reconocer un gradiente socioeconómico territorial.
  2. La composición por tipo de vivienda también cambia significativamente entre zonas (\(V = 0,288\)). Zona Oriente presenta el exceso relativo más marcado de casas y Zona Oeste el de apartamentos.
  3. Entre los quince barrios con mayor oferta existe diferenciación tipológica (\(V = 0,385\)). Este análisis identifica los barrios que más contribuyen al contraste entre casas y apartamentos sin recurrir a una tabla de 407 categorías.
  4. Para la empresa, los perfiles obtenidos permiten organizar inventario y comunicación por zona, estrato y tipología predominante. Estas decisiones describen la oferta disponible; la base no contiene ventas, tiempo de permanencia ni consultas de clientes para inferir demanda o rentabilidad.

La siguiente fase incorporará precios, tipos y conglomerados a mapas para comprobar la distribución espacial de estos perfiles y traducir los resultados multivariantes en decisiones territoriales.

6 Referencias

Caliński, T., & Harabasz, J. (1974). A dendrite method for cluster analysis. Communications in Statistics, 3(1), 1–27.

Jolliffe, I. T., & Cadima, J. (2016). Principal component analysis: A review and recent developments. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences, 374(2065), 20150202. https://doi.org/10.1098/rsta.2015.0202

Little, R. J. A. (1988a). A test of missing completely at random for multivariate data with missing values. Journal of the American Statistical Association, 83(404), 1198–1202. https://doi.org/10.1080/01621459.1988.10478722

Little, R. J. A. (1988b). Missing-data adjustments in large surveys. Journal of Business & Economic Statistics, 6(3), 287–296. https://doi.org/10.1080/07350015.1988.10509663

Lê, S., Josse, J., & Husson, F. (2008). FactoMineR: An R package for multivariate analysis. Journal of Statistical Software, 25(1), 1–18. https://doi.org/10.18637/jss.v025.i01

Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65.

Van Buuren, S., & Groothuis-Oudshoorn, K. (2011). mice: Multivariate Imputation by Chained Equations in R. Journal of Statistical Software, 45(3), 1–67. https://doi.org/10.18637/jss.v045.i03

Ward, J. H. (1963). Hierarchical grouping to optimize an objective function. Journal of the American Statistical Association, 58(301), 236–244.