La base de datos vivienda, disponible en el paquete
paqueteMODELOS, contiene 8.322 propiedades
y 13 variables. La información tabular combina
características económicas, físicas, territoriales y espaciales de la
oferta inmobiliaria en una ciudad en Colombia.
Las variables cuantitativas describen el precio del inmueble en
millones de pesos (preciom), el área construida en metros
cuadrados (areaconst), el piso, el número de parqueaderos,
baños y habitaciones, además de su posición (coordenadas geográficas).
Las variables cualitativas identifican el tipo de vivienda, la zona, el
barrio y el estrato socioeconómico. La variable id funciona
como identificador de cada registro.
| observaciones | variables | filas_completas | porcentaje_completas |
|---|---|---|---|
| 8322 | 13 | 4808 | 57.77 |
La auditoría inicial permitió comprobar el tipo de almacenamiento, la cantidad de valores faltantes y la cardinalidad de cada variable. Esta revisión es necesaria antes de aplicar técnicas multivariantes, ya que las variables numéricas y categóricas requieren tratamientos diferentes y algunas columnas presentan una proporción importante de información ausente.
| variable | clase | n_faltantes | porcentaje_faltantes | n_valores_unicos |
|---|---|---|---|---|
| id | numeric | 3 | 0.04 | 8319 |
| zona | character | 3 | 0.04 | 5 |
| piso | character | 2638 | 31.70 | 12 |
| estrato | numeric | 3 | 0.04 | 4 |
| preciom | numeric | 2 | 0.02 | 539 |
| areaconst | numeric | 3 | 0.04 | 652 |
| parqueaderos | numeric | 1605 | 19.29 | 10 |
| banios | numeric | 3 | 0.04 | 11 |
| habitaciones | numeric | 3 | 0.04 | 11 |
| tipo | character | 3 | 0.04 | 2 |
| barrio | character | 3 | 0.04 | 436 |
| longitud | numeric | 3 | 0.04 | 2928 |
| latitud | numeric | 3 | 0.04 | 3679 |
Se identificaron 3 registros con uno o ningún dato informado. Estas filas carecen de información suficiente para caracterizar una propiedad, calcular indicadores o participar en los análisis multivariantes.
| id | zona | piso | estrato | preciom | areaconst | parqueaderos | banios | habitaciones | tipo | barrio | longitud | latitud | fila_original | n_datos_informados |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| — | — | — | — | — | — | — | — | — | — | — | — | — | 8320 | 0 |
| — | — | — | — | — | — | — | — | — | — | — | — | — | 8321 | 0 |
| — | — | — | — | 330 | — | — | — | — | — | — | — | — | 8322 | 1 |
Por esta razón, los tres registros fueron eliminados. La base depurada quedó conformada por 8.319 viviendas. La eliminación representa únicamente el 0,036 % de las observaciones originales y no supone una pérdida sustancial de información.
| base | observaciones |
|---|---|
| Base original | 8322 |
| Base después de la depuración inicial | 8319 |
Los identificadores informados son únicos. Después de retirar las
filas sin información suficiente, la base conserva 8.319
identificadores diferentes, sin valores ausentes ni
repeticiones de id.
| ids_informados | ids_diferentes | id_minimo | id_maximo |
|---|---|---|---|
| 8319 | 8319 | 1 | 8319 |
La auditoría inicial marcó 2 filas completamente idénticas. Estas corresponden a los dos registros totalmente vacíos ya identificados y fueron retiradas mediante el criterio de información insuficiente. Entre los registros válidos no existen duplicados completos que incluyan el identificador.
Adicionalmente, se detectaron 57 grupos con las
mismas características inmobiliarias y distinto identificador, que
comprenden 114 registros. La coincidencia puede deberse
a duplicación de anuncios, pero también puede representar propiedades
diferentes de un mismo edificio o proyecto inmobiliario. Ante la
ausencia de una variable que permita distinguir estos casos, se
conservaron y se marcaron mediante el indicador lógico
posible_duplicado.
| duplicados_exactos | grupos_iguales_sin_id | registros_en_esos_grupos |
|---|---|---|
| 2 | 57 | 114 |
| grupos_identificados | registros_implicados | porcentaje_registros | posible_exceso |
|---|---|---|---|
| 57 | 114 | 1.37 | 57 |
Esta decisión evita eliminar observaciones válidas de manera irreversible y permitirá realizar comprobaciones de sensibilidad si los posibles duplicados influyen posteriormente en los resultados.
Las variables zona y tipo se transformaron
en factores nominales, mientras que estrato se representó
como factor ordinal con niveles del 3 al 6. Las variables de conteo se
convirtieron a números enteros y el precio, el área y las coordenadas se
almacenaron como variables numéricas.
Los nombres de los barrios se normalizaron mediante la eliminación de espacios innecesarios y la conversión a minúsculas. Como resultado, la cardinalidad pasó de 436 valores originales a 407 categorías normalizadas. Esta limpieza reduce la fragmentación artificial de una misma categoría por diferencias de escritura.
También se identificaron 45 registros con cero baños y 66 con cero habitaciones. Dado que estas cantidades no son plausibles para una vivienda residencial ofertada, se interpretaron como errores u omisiones de registro y se recodificaron temporalmente como valores faltantes.
Después de eliminar las tres filas sin información y recodificar los
ceros no plausibles, los valores faltantes se concentran en cuatro
variables. piso presenta 2.635 ausencias
(31,67 %) y parqueaderos presenta
1.602 (19,26 %). Las proporciones de
ausencia de baños y habitaciones son inferiores al 1 %.
| variable | n_faltantes | pct_faltantes |
|---|---|---|
| piso | 2635 | 31.674 |
| parqueaderos | 1602 | 19.257 |
| habitaciones | 66 | 0.793 |
| banios | 45 | 0.541 |
Número y porcentaje de valores faltantes por variable.
La eliminación de todas las observaciones incompletas conservaría
solamente 4.787 viviendas, equivalentes al
57,54 % de la base depurada. La pérdida sería
especialmente elevada por la ausencia simultánea o individual de
piso y parqueaderos; por ello, se descartó el
borrado completo como estrategia general.
El mapa de faltantes permite examinar la distribución de las
ausencias entre registros y variables. La concentración visual en
piso y parqueaderos confirma que el problema
no se distribuye uniformemente en toda la base.
Mapa de los patrones de valores faltantes.
El gráfico de coocurrencia complementa el diagnóstico al mostrar qué combinaciones de variables faltan conjuntamente. Esto permite diferenciar los casos con una única ausencia de aquellos en los que faltan varias características estructurales.
Coocurrencia de valores faltantes entre variables.
La tabla de patrones confirma que existen diferentes configuraciones
de ausencia, en lugar de un único patrón monotónico. Se contabilizaron
4.787 viviendas completas en estas cuatro variables.
Entre los registros incompletos predominan tres situaciones: 1.901
viviendas sin información únicamente en piso, 863 sin
información únicamente en parqueaderos y 692 con ausencia
simultánea de ambas variables. Solamente 21 registros carecen de las
cuatro características.
| n_registros | banios | habitaciones | parqueaderos | piso | n_variables_faltantes |
|---|---|---|---|---|---|
| 4787 | Observado | Observado | Observado | Observado | 0 |
| 1901 | Observado | Observado | Observado | Faltante | 1 |
| 863 | Observado | Observado | Faltante | Observado | 1 |
| 692 | Observado | Observado | Faltante | Faltante | 2 |
| 14 | Observado | Faltante | Observado | Observado | 1 |
| 6 | Observado | Faltante | Faltante | Observado | 2 |
| 11 | Observado | Faltante | Faltante | Faltante | 3 |
| 4 | Faltante | Observado | Observado | Observado | 1 |
| 2 | Faltante | Observado | Observado | Faltante | 2 |
| 2 | Faltante | Observado | Faltante | Observado | 2 |
| 2 | Faltante | Observado | Faltante | Faltante | 3 |
| 3 | Faltante | Faltante | Observado | Observado | 2 |
| 6 | Faltante | Faltante | Observado | Faltante | 3 |
| 5 | Faltante | Faltante | Faltante | Observado | 3 |
| 21 | Faltante | Faltante | Faltante | Faltante | 4 |
Para evaluar si los faltantes podían considerarse completamente
aleatorios se aplicó el test MCAR propuesto por Little (1988a). La
hipótesis nula establece que la probabilidad de ausencia es
independiente tanto de los valores observados como de los no observados.
El test se calculó con las transformaciones logarítmicas del precio y
del área, además de piso, parqueaderos,
banios y habitaciones.
| estadistico | grados_libertad | p_valor | patrones_faltantes | decision |
|---|---|---|---|---|
| 1377.67 | 54 | <0.001 | 15 | Se rechaza MCAR; los faltantes podrían ser MAR o MNAR |
El resultado fue estadísticamente significativo (\(\chi^2 = 1.377,7\), \(gl = 54\), \(p\) < 0,001). En consecuencia, se rechaza la hipótesis MCAR. La información faltante presenta una estructura sistemática y el borrado indiscriminado de registros podría introducir sesgos. Este resultado no permite distinguir por sí solo entre los mecanismos MAR —ausencia explicable mediante variables observadas— y MNAR (ausencia relacionada con el propio valor no observado). Debido al gran tamaño muestral y a la presencia de variables de conteo, el test se interpreta como un diagnóstico global y se complementa con las pruebas de asociación de los indicadores de ausencia.
Como análisis complementario, se estudió la relación entre la
ausencia de parqueaderos y el estrato socioeconómico. La
proporción de valores no informados disminuye claramente a medida que
aumenta el estrato.
| estrato | parqueaderos_faltante | n | porcentaje |
|---|---|---|---|
| 3 | No | 684 | 47.08 |
| 3 | Sí | 769 | 52.92 |
| 4 | No | 1641 | 77.08 |
| 4 | Sí | 488 | 22.92 |
| 5 | No | 2522 | 91.71 |
| 5 | Sí | 228 | 8.29 |
| 6 | No | 1870 | 94.11 |
| 6 | Sí | 117 | 5.89 |
También se evaluó la relación entre la ausencia de piso
y el tipo de vivienda.
| tipo | piso_faltante | n | porcentaje |
|---|---|---|---|
| Casa | No | 1965 | 61.04 |
| Casa | Sí | 1254 | 38.96 |
| Apartamento | No | 3719 | 72.92 |
| Apartamento | Sí | 1381 | 27.08 |
| relacion | chi_cuadrado | grados_libertad | p_valor |
|---|---|---|---|
| Ausencia de parqueaderos y estrato | 1518.73 | 3 | <0.001 |
| Ausencia de piso y tipo de vivienda | 128.10 | 1 | <0.001 |
Las dos pruebas de independencia resultaron significativas (\(p < 0{,}001\)). Por tanto, la ausencia
de parqueaderos está asociada con el estrato y la ausencia
de piso está asociada con el tipo de vivienda. Estos
resultados respaldan la utilización de variables observadas como
predictores del proceso de imputación y confirman la decisión de no
tratar todos los faltantes de la misma forma.
La estrategia se definió de manera diferenciada según la magnitud de la ausencia, la interpretación de cada variable y su función en los análisis posteriores.
pisopiso conserva sus 2.635 valores
faltantes. La variable presenta una proporción de ausencia
elevada y su significado depende del tipo de inmueble, esto es, en
apartamentos representa habitualmente la planta de ubicación, mientras
que en casas puede describir el número de niveles. Una imputación
conjunta podría introducir relaciones artificiales. Por ello,
piso se utilizará únicamente en análisis descriptivos con
datos observados y se excluirá como variable activa del análisis de
componentes principales y de la construcción de conglomerados.
Las ausencias de parqueaderos, banios y
habitaciones se trataron mediante imputación múltiple por
ecuaciones encadenadas con el paquete mice (Van Buuren
& Groothuis-Oudshoorn, 2011). Se utilizó predictive mean
matching (PMM; Little, 1988b), que selecciona valores observados
procedentes de propiedades con predicciones similares. Esta
característica conserva valores plausibles para variables de conteo y
evita generar cantidades fraccionarias.
El modelo de imputación incorporó el logaritmo del precio, el logaritmo del área, la zona, el estrato, el tipo de vivienda y las restantes características estructurales. De este modo, se adopta como supuesto un mecanismo MAR condicionado a la información observada. Aunque este supuesto resulta razonable a partir de las asociaciones encontradas, no puede descartarse completamente un mecanismo MNAR.
Se generaron cinco conjuntos imputados, cada uno con diez iteraciones
y semilla fija para garantizar la reproducibilidad. La primera base
completada se utiliza como archivo fuente para el análisis exploratorio.
Las cinco imputaciones se conservan en el objeto
imputaciones_mice y se emplearán posteriormente para
comprobar la estabilidad del análisis de ACP y de conglomerados.
| variable | n_imputados | porcentaje | metodo |
|---|---|---|---|
| parqueaderos | 1602 | 19.257 | PMM mediante mice |
| banios | 45 | 0.541 | PMM mediante mice |
| habitaciones | 66 | 0.793 | PMM mediante mice |
La imputación completó 1.602 valores de
parqueaderos, 45 de baños y 66 de
habitaciones. Las columnas lógicas
parqueaderos_imputado, banios_imputado y
habitaciones_imputada permiten distinguir en todo momento
los datos observados de los estimados.
La comparación de los estadísticos descriptivos antes y después de la imputación permite comprobar si el procedimiento modifica sustancialmente la localización o la dispersión de las variables.
| variable | momento | n_disponibles | media | mediana | desviacion |
|---|---|---|---|---|---|
| banios | Antes de imputar | 8274 | 3.13 | 3 | 1.41 |
| banios | Después de imputar | 8319 | 3.13 | 3 | 1.42 |
| habitaciones | Antes de imputar | 8253 | 3.63 | 3 | 1.43 |
| habitaciones | Después de imputar | 8319 | 3.64 | 3 | 1.44 |
| parqueaderos | Antes de imputar | 6717 | 1.84 | 2 | 1.12 |
| parqueaderos | Después de imputar | 8319 | 1.76 | 1 | 1.09 |
La convergencia de las cadenas se inspeccionó mediante la evolución de la media y la desviación estándar de los valores imputados a lo largo de las diez iteraciones. Las cinco cadenas se entremezclan en las tres variables y fluctúan alrededor de niveles relativamente estables, sin una tendencia ascendente o descendente persistente. Las oscilaciones son mayores en baños y habitaciones porque solamente se imputan 45 y 66 casos, respectivamente, pero no se observa una separación sistemática entre cadenas. El diagnóstico visual es compatible con una convergencia adecuada.
Trazas de convergencia de las cinco cadenas de imputación.
El segundo diagnóstico compara las distribuciones observadas (azul) e imputadas (rojo). Como se trata de variables discretas y el número de imputaciones de baños y habitaciones es pequeño frente al número de observaciones, las curvas imputadas aparecen más suavizadas. En ambas variables, los valores estimados se mantienen dentro del rango observado y se concentran en cantidades plausibles. Además, los estadísticos globales prácticamente no cambian: la media de baños permanece en 3,13 y la de habitaciones pasa de 3,63 a 3,64; sus medianas continúan en 3 y sus desviaciones estándar aumentan solamente 0,01 unidades.
Ahora bien, en parqueaderos, las imputaciones se concentran principalmente en uno y, en menor medida, en dos espacios. Como resultado, la media global disminuye de 1,84 a 1,76, la mediana pasa de 2 a 1 y la desviación estándar cambia de 1,12 a 1,09. Este desplazamiento es coherente con el diagnóstico previo: la falta de información se concentra en los estratos bajos, donde el modelo —condicionado por precio, área, zona, estrato y tipo— asigna valores menores que el promedio observado. Por tanto, la diferencia es compatible con la estructura MAR asumida y no constituye por sí misma un fallo de la imputación.
Comparación de las distribuciones observadas e imputadas.
El algortimo de PMM solo selecciona valores existentes entre los
donantes observados. Como la variable parqueaderos no
contiene ceros observados, el procedimiento tampoco puede imputarlos. En
consecuencia, los valores completados representan el número esperado de
parqueaderos entre viviendas observadas con características semejantes,
pero no permiten descartar que algunos anuncios omitieran el campo por
carecer de parqueadero. Por esta razón se conserva el indicador
parqueaderos_imputado y, en los análisis multivariantes, se
comprobará la estabilidad de las componentes y de la segmentación al
comparar las cinco imputaciones.
Considerados conjuntamente, las trazas, las distribuciones y los
estadísticos descriptivos respaldan la utilización de
vivienda_limpia como base operativa para el análisis
exploratorio. La imputación conserva valores enteros plausibles,
completa el 100 % de las variables cuantitativas nucleares y mantiene
explícita la incertidumbre asociada a los datos originalmente
ausentes.
Los valores potencialmente atípicos se identificaron mediante el criterio del rango intercuartílico de Tukey. A continuación, se presentan los principales hallazgos:
| variable | q1 | q3 | iqr | limite_inferior | limite_superior | n_atipicos | porcentaje | decision |
|---|---|---|---|---|---|---|---|---|
| preciom | 220 | 540 | 320 | -260.0 | 1020.0 | 552 | 6.64 | Conservar |
| areaconst | 80 | 229 | 149 | -143.5 | 452.5 | 382 | 4.59 | Conservar |
| parqueaderos | 1 | 2 | 1 | -0.5 | 3.5 | 627 | 7.54 | Conservar |
| banios | 2 | 4 | 2 | -1.0 | 7.0 | 73 | 0.88 | Conservar |
| habitaciones | 3 | 4 | 1 | 1.5 | 5.5 | 842 | 10.12 | Conservar |
Distribución de las variables cuantitativas y valores potencialmente atípicos.
El criterio identifica una mayor proporción de casos potencialmente atípicos en habitaciones (10,12 %), parqueaderos (7,54 %) y precio (6,64 %), seguida del área construida (4,59 %) y los baños (0,88 %). Estos porcentajes describen valores alejados de la zona central de cada distribución, pero no demuestran que sean errores.
En el contexto inmobiliario, los valores extremos pueden corresponder a viviendas de lujo, inmuebles de gran superficie o propiedades con características estructurales especiales. Por ello, se conservaron todas las observaciones plausibles. En las fases de ACP y conglomerados se evaluará el uso de transformaciones logarítmicas para las variables continuas con asimetría positiva, seguido de estandarización, con el fin de reducir la influencia desproporcionada de las escalas y las colas superiores.
La siguiente tabla resume las decisiones adoptadas durante la depuración y preparación de la base.
| decision | resultado |
|---|---|
| Filas sin información suficiente eliminadas | 3 |
| Posibles duplicados conservados y marcados | 114 |
| Valores faltantes de piso conservados | 2635 |
| Valores faltantes de parqueaderos imputados mediante PMM | 1602 |
| Baños iguales a cero recodificados e imputados mediante PMM | 45 |
| Habitaciones iguales a cero recodificadas e imputadas mediante PMM | 66 |
| Valores potencialmente atípicos conservados | Consultar tabla_atipicos |
| observaciones | variables | ids_faltantes | ids_repetidos | pisos_faltantes | parqueaderos_faltantes | banios_faltantes | habitaciones_faltantes | posibles_duplicados | casos_completos_nucleo | porcentaje_completos_nucleo |
|---|---|---|---|---|---|---|---|---|---|---|
| 8319 | 18 | 0 | 0 | 2635 | 0 | 0 | 0 | 114 | 8319 | 100 |
Después del tratamiento, vivienda_limpia conserva
8.319 propiedades y dispone de información completa en
las variables cuantitativas claves: precio, área, parqueaderos, baños y
habitaciones. Las 18 columnas finales incluyen las 13 variables
originales y cinco indicadores de trazabilidad: un marcador de posible
duplicado, tres indicadores de imputación y el indicador de
disponibilidad de piso. La única variable estructural que
mantiene faltantes es piso, cuya exclusión de los análisis
multivariantes quedó justificada por su porcentaje de ausencia y su
interpretación heterogénea.
La base resultante queda preparada para la fase de análisis exploratorio. Se mantienen las observaciones extremas plausibles, se preserva la trazabilidad de los valores imputados y se conservan las cinco imputaciones para evaluar la robustez de las técnicas multivariantes posteriores.
El análisis exploratorio busca describir la estructura de la oferta inmobiliaria antes de aplicar las tres técnicas multivariantes. Se examinan las distribuciones de las variables cuantitativas, la composición de la oferta, las diferencias entre segmentos y las asociaciones bivariantes. El análisis se realiza sobre las 8.319 viviendas de la base depurada.
Las variables parqueaderos, banios y
habitaciones incluyen los valores completados mediante
imputación múltiple y conservan sus indicadores de trazabilidad. La
variable piso se analiza por separado y únicamente con los
valores originalmente reportados.
La tabla siguiente presenta medidas de posición, dispersión, rango, variación relativa y asimetría. Dado que el mercado inmobiliario suele presentar colas superiores extensas, la mediana y el rango intercuartílico se consideran medidas especialmente útiles para describir la vivienda típica sin otorgar un peso excesivo a las propiedades de mayor tamaño o precio.
| Variable | n | Media | Desv. estándar | Mínimo | Q1 | Mediana | Q3 | Máximo | RIC | CV (%) | Asimetría |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Precio | 8319 | 433.90 | 328.67 | 58 | 220 | 330 | 540 | 1999 | 320 | 75.75 | 1.85 |
| Área construida | 8319 | 174.93 | 142.96 | 30 | 80 | 123 | 229 | 1745 | 149 | 81.72 | 2.69 |
| Parqueaderos | 8319 | 1.76 | 1.09 | 1 | 1 | 1 | 2 | 10 | 1 | 62.05 | 2.47 |
| Baños | 8319 | 3.13 | 1.42 | 1 | 2 | 3 | 4 | 10 | 2 | 45.21 | 0.98 |
| Habitaciones | 8319 | 3.64 | 1.44 | 1 | 3 | 3 | 4 | 10 | 1 | 39.46 | 1.81 |
El precio medio es de 433,90 millones de COP, mientras que la mediana se sitúa en 330,00 millones. Su coeficiente de asimetría es 1,85, lo que corresponde a asimetría positiva marcada. El área construida presenta una media de 174,93 m², una mediana de 123,00 m² y un coeficiente de asimetría de 2,69, compatible con asimetría positiva marcada.
La transformación logarítmica reduce la asimetría del precio de 1,85 a 0,25 y la del área de 2,69 a 0,51. La mejora es sustancial en ambas variables y respalda el uso de sus logaritmos en el ACP y los conglomerados, técnicas sensibles a distribuciones muy asimétricas y a distancias dominadas por valores extremos.
| Variable | Asimetría original | Asimetría log10 | Reducción (%) |
|---|---|---|---|
| Precio | 1.85 | 0.25 | 86.73 |
| Área construida | 2.69 | 0.51 | 80.93 |
La comparación gráfica permite comprobar el cambio de forma y no solamente la reducción numérica de la asimetría. Cada panel utiliza una escala horizontal propia para representar correctamente los valores originales y sus logaritmos.
Distribución del precio y del área construida en escalas original y logarítmica.
Las variables estructurales son conteos discretos; por ello, se representan mediante porcentajes por valor y no mediante densidades continuas. Esta visualización permite identificar las configuraciones habitacionales predominantes y comprobar que la imputación no generó valores fraccionarios o fuera del rango observado.
Distribución porcentual de parqueaderos, baños y habitaciones.
La configuración modal de la oferta es de 1 parqueadero (51,1 %), 2 baños (35,6 %) y 3 habitaciones (49,5 %). Las distribuciones mantienen colas derechas: existe un grupo reducido de inmuebles con una dotación muy superior a la vivienda habitual, coherente con la presencia de propiedades grandes y de alto valor.
piso requiere una lectura diferenciada. En los
apartamentos se interpreta como la planta en la que se ubica la unidad;
en las casas suele representar el número de niveles. La figura utiliza
únicamente casos reportados y porcentajes calculados dentro de cada tipo
de vivienda, por lo que describe la información disponible sin presentar
los faltantes como valores observados.
Distribución del piso o número de niveles según el tipo de vivienda.
Entre los registros observados, las casas se concentran en 2
niveles (47,7 %), mientras que en los
apartamentos la planta más frecuente es la 3
(15,4 %). La distribución de los apartamentos se
extiende hasta plantas superiores y es considerablemente más dispersa.
Esta diferencia empírica confirma que mezclar ambos significados de
piso en una sola variable activa produciría una
interpretación ambigua.
La oferta está compuesta principalmente por Apartamento, que representa el 61,3 % de los registros. La zona con mayor participación es Zona Sur (56,8 %) y el estrato más frecuente es 5 (33,1 %). Estas proporciones describen la composición de la base y no deben interpretarse directamente como participación del parque total de viviendas de la ciudad, pues los datos corresponden a inmuebles ofertados.
| Variable | Categoría | n | Oferta (%) |
|---|---|---|---|
| estrato | 3 | 1453 | 17.47 |
| estrato | 4 | 2129 | 25.59 |
| estrato | 5 | 2750 | 33.06 |
| estrato | 6 | 1987 | 23.89 |
| tipo | Apartamento | 5100 | 61.31 |
| tipo | Casa | 3219 | 38.69 |
| zona | Zona Centro | 124 | 1.49 |
| zona | Zona Norte | 1920 | 23.08 |
| zona | Zona Oeste | 1198 | 14.40 |
| zona | Zona Oriente | 351 | 4.22 |
| zona | Zona Sur | 4726 | 56.81 |
Composición porcentual de la oferta por tipo, zona y estrato.
La oferta presenta además una dimensión barrial de alta cardinalidad. El barrio con mayor número de registros es Valle Del Lili, con 1.009 viviendas (12,13 % de la base). Para evitar una figura ilegible, se muestran únicamente los quince barrios con más anuncios; la tabla añade sus medianas de precio y área para distinguir volumen de oferta y nivel de mercado.
| Barrio | n | Oferta (%) | Precio mediano | Área mediana |
|---|---|---|---|---|
| Valle Del Lili | 1009 | 12.13 | 235.0 | 76.0 |
| Ciudad Jardín | 518 | 6.23 | 670.0 | 200.0 |
| Pance | 412 | 4.95 | 780.0 | 199.0 |
| La Flora | 368 | 4.42 | 350.0 | 105.5 |
| Santa Teresita | 263 | 3.16 | 750.0 | 194.0 |
| El Caney | 209 | 2.51 | 220.0 | 85.0 |
| El Ingenio | 203 | 2.44 | 355.0 | 129.0 |
| La Hacienda | 166 | 2.00 | 327.5 | 98.0 |
| Acopi | 158 | 1.90 | 375.0 | 136.0 |
| Los Cristales | 154 | 1.85 | 490.0 | 125.0 |
| Normandía | 154 | 1.85 | 621.5 | 166.0 |
| El Limonar | 135 | 1.62 | 370.0 | 160.0 |
| Prados Del Norte | 127 | 1.53 | 229.0 | 75.0 |
| El Refugio | 120 | 1.44 | 240.0 | 94.0 |
| Aguacatal | 109 | 1.31 | 690.0 | 184.0 |
Quince barrios con mayor volumen de oferta inmobiliaria.
Los cinco barrios con mayor presencia reúnen el 30,9 % de todos los anuncios, por lo que la oferta muestra una concentración espacial apreciable. El volumen y el valor describen dimensiones distintas: Valle Del Lili lidera el número de propiedades con un precio mediano de 235,0 millones, mientras que Pance presenta el mayor precio mediano dentro de los quince barrios más ofertados, con 780,0 millones. Esta diferencia justifica analizar posteriormente tanto la cantidad de oferta como su nivel de precios y su localización.
La comparación entre segmentos se basa principalmente en medianas y cuartiles, debido a la asimetría del precio. La tabla reúne el tamaño de cada grupo, su participación y las características económicas y estructurales de una vivienda representativa.
| Dimensión | Oferta (%) | Categoría | n | Precio medio | Precio mediano | Precio Q1 | Precio Q3 | Área mediana | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|---|---|---|---|---|---|
| tipo | 61.31 | Apartamento | 5100 | 366.94 | 279 | 175.00 | 430.00 | 90.0 | 1 | 2 | 3.0 |
| tipo | 38.69 | Casa | 3219 | 539.99 | 430 | 300.00 | 670.00 | 240.0 | 2 | 4 | 4.0 |
| zona | 1.49 | Zona Centro | 124 | 309.69 | 297 | 188.75 | 361.25 | 160.0 | 1 | 3 | 4.5 |
| zona | 23.08 | Zona Norte | 1920 | 345.61 | 300 | 160.00 | 430.00 | 107.0 | 1 | 2 | 3.0 |
| zona | 14.40 | Zona Oeste | 1198 | 677.58 | 580 | 393.50 | 900.00 | 165.5 | 2 | 4 | 3.0 |
| zona | 4.22 | Zona Oriente | 351 | 228.53 | 210 | 145.00 | 290.00 | 160.0 | 1 | 2 | 4.0 |
| zona | 56.81 | Zona Sur | 4726 | 426.52 | 320 | 222.00 | 520.00 | 113.0 | 1 | 3 | 3.0 |
| estrato | 17.47 | 3 | 1453 | 210.32 | 160 | 120.00 | 270.00 | 91.0 | 1 | 2 | 3.0 |
| estrato | 25.59 | 4 | 2129 | 275.10 | 235 | 165.00 | 335.00 | 83.0 | 1 | 2 | 3.0 |
| estrato | 33.06 | 5 | 2750 | 410.25 | 350 | 270.00 | 470.00 | 115.0 | 2 | 3 | 3.0 |
| estrato | 23.89 | 6 | 1987 | 800.29 | 700 | 515.00 | 990.00 | 198.0 | 2 | 4 | 3.0 |
Dentro de cada criterio, el mayor precio mediano corresponde a Casa entre los tipos de vivienda, a Zona Oeste entre las zonas y al estrato 6 entre los niveles socioeconómicos. Sus medianas son, respectivamente, 430,00, 580,00 y 700,00 millones de COP.
Las casas presentan un precio mediano de 430 millones de COP y un área mediana de 240 m², frente a 279 millones y 90 m² en los apartamentos. La vivienda típica tipo casa también dispone de más parqueaderos, baños y habitaciones. Por tanto, su mayor precio absoluto coincide con un tamaño y una dotación mayores; todavía no puede concluirse que sea más costosa por unidad de superficie.
La Zona Sur concentra el 56,8 % de la oferta y presenta un precio mediano de 320 millones. En contraste, la Zona Oeste representa el 14,4 % de los anuncios, pero alcanza la mediana más alta, de 580 millones; la menor corresponde a Zona Oriente, con 210 millones. Se observa además un gradiente socioeconómico claro: la mediana pasa de 160 millones en el estrato 3 a 700 millones en el estrato 6.
Los diagramas de caja muestran simultáneamente la posición central, la dispersión y el solapamiento entre grupos. El eje vertical se representa en escala logarítmica para que las colas superiores no oculten las diferencias en la mayor parte de la oferta. Las diferencias descriptivas no implican por sí mismas causalidad: zona, estrato, tipo, área y dotación están relacionados entre sí.
Distribución del precio por tipo de vivienda, zona y estrato socioeconómico.
Se utilizó la correlación de Spearman porque mide relaciones monotónicas, admite variables de conteo y es menos sensible que Pearson a la asimetría y a los valores extremos.
| Variable | Precio | Área construida | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|
| Precio | 1.000 | 0.822 | 0.739 | 0.780 | 0.440 |
| Área construida | 0.822 | 1.000 | 0.643 | 0.788 | 0.675 |
| Parqueaderos | 0.739 | 0.643 | 1.000 | 0.631 | 0.352 |
| Baños | 0.780 | 0.788 | 0.631 | 1.000 | 0.625 |
| Habitaciones | 0.440 | 0.675 | 0.352 | 0.625 | 1.000 |
La asociación cuantitativa de mayor magnitud se observa entre Precio y Área construida, con \(\rho_s = 0,822\). Se trata de una relación monotónica fuerte: las viviendas de mayor superficie tienden a presentar precios más altos.
El precio también muestra asociaciones elevadas con los baños (\(\rho_s = 0,780\)) y los parqueaderos (\(\rho_s = 0,739\)), mientras que su relación con el número de habitaciones es menor (\(\rho_s = 0,440\)). A su vez, el área se relaciona con los baños (\(\rho_s = 0,788\)) y las habitaciones (\(\rho_s = 0,675\)). Este entramado confirma que varias características contienen información compartida; dicha redundancia constituye precisamente una justificación para emplear ACP en una fase posterior.
Las correlaciones que incluyen parqueaderos, baños o habitaciones se consideran exploratorias porque incorporan valores imputados. Su estabilidad se contrastará posteriormente entre los cinco conjuntos completados antes de adoptar conclusiones multivariantes definitivas.
Matriz gráfica de correlaciones de Spearman entre las variables cuantitativas.
El diagrama precio-área permite comprobar la forma de esta relación y su comportamiento por tipo de vivienda. Ambos ejes se transforman a logaritmo base 10; así se conserva el orden de las observaciones y se reduce la compresión visual causada por los inmuebles más grandes y costosos. Como puede apreciarse, las rectas describen tendencias dentro de cada tipo.
Relación entre el área construida y el precio, diferenciada por tipo de vivienda.
La independencia entre tipo, zona y
estrato se evaluó mediante pruebas chi-cuadrado. Dado que
el valor \(p\) está influido por el
gran tamaño muestral, se informa también la \(V\) de Cramér, que cuantifica la intensidad
de la asociación en una escala entre 0 y 1. La tabla incorpora además la
frecuencia esperada mínima y el porcentaje de celdas con frecuencia
esperada inferior a cinco para comprobar el supuesto de aproximación de
la prueba.
| Relación | Chi-cuadrado | gl | p | V de Cramér | Esperada mínima | % esperadas < 5 |
|---|---|---|---|---|---|---|
| tipo vs. zona | 690.930 | 4 | <0.001 | 0.288 | 47.981 | 0 |
| tipo vs. estrato | 224.331 | 3 | <0.001 | 0.164 | 562.232 | 0 |
| zona vs. estrato | 3830.435 | 12 | <0.001 | 0.392 | 21.658 | 0 |
La menor frecuencia esperada entre todas las tablas es 21,66 y el máximo porcentaje de celdas con frecuencia esperada inferior a cinco es 0,0 %. Estos indicadores permiten comprobar si la aproximación chi-cuadrado resulta adecuada. La mayor intensidad entre las tres relaciones evaluadas corresponde a zona vs. estrato, con \(V = 0,392\) y \(p\) < 0,001. La significancia indica que la composición observada no es independiente, mientras que la \(V\) de Cramér permite juzgar si esa diferencia es también sustantivamente importante.
Las tres asociaciones son significativas, aunque su magnitud difiere. La relación entre zona y estrato es la más intensa (\(V = 0,392\)), seguida de tipo y zona (\(V = 0,288\)) y de tipo y estrato (\(V = 0,164\)). En términos de composición, Zona Oeste presenta la mayor proporción de apartamentos (85,9 %), mientras que Zona Oriente registra la mayor proporción de casas (82,3 %). La tipología de la oferta cambia, por tanto, según el sector urbano.
Composición porcentual del tipo de vivienda dentro de cada zona.
Composición porcentual del estrato dentro de cada tipo de vivienda.
Estas composiciones anticipan que el posterior análisis de correspondencias puede revelar perfiles territoriales diferenciados. Sin embargo, el análisis formal de correspondencias y la interpretación de sus dimensiones se reservan para la fase correspondiente.
Como comprobación, se compararon los estadísticos de la base completa con un escenario que excluye todos los registros marcados como posibles duplicados. Esta segunda opción elimina ambos miembros de cada coincidencia y, por tanto, representa una prueba más exigente que conservar una sola observación por grupo; no se adopta como base definitiva.
| Escenario | n | Precio medio | Precio mediano | Área media | Área mediana |
|---|---|---|---|---|---|
| Todos los registros | 8319 | 433.90 | 330 | 174.93 | 123 |
| Sin posibles duplicados | 8205 | 435.46 | 330 | 175.35 | 124 |
La exclusión modifica la mediana del precio en 0,000 % y la mediana del área en 0,813 %. Esta comparación permite verificar de manera transparente si las coincidencias detectadas alteran la descripción central del mercado, sin asumir que todas sean anuncios duplicados.
Los cambios observados son inferiores al 1 % en ambas medianas. En consecuencia, conservar y marcar los 114 registros potencialmente repetidos no modifica de forma sustancial las conclusiones descriptivas centrales del EDA.
El EDA permite establecer cinco conclusiones preliminares:
Estos hallazgos dejan la base preparada para iniciar el análisis de componentes principales. A continuación se reduce la información cuantitativa compartida a un número menor de dimensiones, procurando conservar la mayor proporción posible de la variabilidad original.
El ACP se aplicó a cinco variables cuantitativas activas: precio, área construida, parqueaderos, baños y habitaciones. Específicamente, el Precio y el área se transformaron mediante logaritmo base 10 para moderar la asimetría observada durante el EDA. Los tres conteos corresponden al primer conjunto completado mediante imputación múltiple; la estabilidad de esta decisión se contrasta posteriormente utilizando las cinco imputaciones. El procedimiento sigue el enfoque de reducción dimensional basado en combinaciones lineales de máxima varianza descrito por Jolliffe y Cadima (2016).
No se incluyeron el identificador ni las coordenadas porque no
describen atributos estructurales comparables. Tampoco se utilizóel
atributopiso, ya que además de presentar una elevada proporción de ausencias, representa la planta de ubicación en apartamentos y el número de niveles en casas. El atributoestrato`
se incorporó como variable suplementaria ordinal, es decir, se proyecta
sobre los componentes una vez construidos, facilitando su interpretación
sin modificar cargas, autovalores ni varianza explicada.
| Variable activa | Tratamiento | Interpretación |
|---|---|---|
| Precio (log10) | Transformación log10 y estandarización | Dimensión económica de la oferta |
| Área construida (log10) | Transformación log10 y estandarización | Tamaño físico del inmueble |
| Parqueaderos | Imputación PMM y estandarización | Dotación vehicular |
| Baños | Imputación PMM y estandarización | Dotación sanitaria |
| Habitaciones | Imputación PMM y estandarización | Capacidad habitacional |
Como las variables están expresadas en unidades diferentes, el ACP se estimó sobre la matriz de correlaciones. Esta decisión impide que el precio o el área dominen los componentes únicamente por su escala de medida.
| Variable | Media | Desviación estándar |
|---|---|---|
| Precio (log10) | 0 | 1 |
| Área construida (log10) | 0 | 1 |
| Parqueaderos | 0 | 1 |
| Baños | 0 | 1 |
| Habitaciones | 0 | 1 |
La siguiente matriz de Pearson corresponde exactamente a las variables transformadas e imputadas que participan en el ACP. Se presenta de manera independiente de la matriz de Spearman utilizada anteriormente en el EDA, pues ambas responden a objetivos diferentes.
| Variable | Precio (log10) | Área construida (log10) | Parqueaderos | Baños | Habitaciones |
|---|---|---|---|---|---|
| Precio (log10) | 1.000 | 0.798 | 0.662 | 0.741 | 0.337 |
| Área construida (log10) | 0.798 | 1.000 | 0.605 | 0.758 | 0.608 |
| Parqueaderos | 0.662 | 0.605 | 1.000 | 0.580 | 0.285 |
| Baños | 0.741 | 0.758 | 0.580 | 1.000 | 0.596 |
| Habitaciones | 0.337 | 0.608 | 0.285 | 0.596 | 1.000 |
Las correlaciones positivas muestran que precio, área y dotación tienden a aumentar conjuntamente. La existencia de información compartida entre las variables permite plantear su representación mediante un número menor de componentes.
Antes de extraer componentes se evaluó si las variables comparten suficiente información. El índice KMO global fue 0,761. Como referencia, valores superiores a 0,60 suelen considerarse aceptables para resumir una matriz mediante factores o componentes. La prueba de esfericidad de Bartlett produjo \(\chi^2(10) = 28.011,40\), con \(p\) < 0,001, por lo que se rechaza que la matriz de correlaciones sea una matriz identidad.
| Indicador | Valor | p-valor |
|---|---|---|
| KMO global | 0.761 | — |
| Bartlett (chi-cuadrado) | 28011.399 | < 0,001 |
| Variable | MSA individual |
|---|---|
| Precio (log10) | 0.704 |
| Área construida (log10) | 0.764 |
| Parqueaderos | 0.917 |
| Baños | 0.830 |
| Habitaciones | 0.611 |
El menor MSA individual fue 0,611 y correspondió a Habitaciones. En conjunto, estos diagnósticos respaldan la aplicación del ACP.
| Componente | Autovalor | % de varianza | % acumulado |
|---|---|---|---|
| CP1 | 3.43 | 68.60 | 68.60 |
| CP2 | 0.80 | 16.07 | 84.67 |
| CP3 | 0.39 | 7.77 | 92.44 |
| CP4 | 0.25 | 4.98 | 97.42 |
| CP5 | 0.13 | 2.58 | 100.00 |
Porcentaje de varianza explicado por cada componente y criterio de Kaiser.
En este sentido, el criterio de Kaiser retiene una componente, mientras que el análisis paralelo, basado en la comparación con datos aleatorios, sugiere una componente. Para el objetivo descriptivo de esta actividad se conservaron 2 componentes, el mínimo necesario para superar el 80 % de varianza acumulada: explican conjuntamente 84,7 %. Esta solución permite representar el mercado en un plano sin sacrificar una fracción sustancial de la información.
| Criterio | Componentes sugeridos |
|---|---|
| Kaiser (autovalor > 1) | 1 |
| Análisis paralelo (percentil 95) | 1 |
| Varianza acumulada mínima del 80 % | 2 |
Comparación de los autovalores observados con el percentil 95 de los autovalores aleatorios.
Kaiser y el análisis paralelo favorecen una solución muy parsimoniosa. Sin embargo, conservar exclusivamente CP1 explicaría 68,6 % y dejaría sin representar 31,4 % de la variabilidad. CP2 aporta un 16,1 % adicional, eleva la representación acumulada al 84,7 % y presenta un contraste inmobiliario interpretable entre habitaciones y parqueaderos. Por ello se retienen dos componentes con finalidad descriptiva y para la posterior segmentación, dejando explícita la discrepancia entre los criterios.
El signo de una componente es arbitrario, es decir, invertir simultáneamente todos sus coeficientes no cambia el resultado. Para mantener una lectura reproducible, se adoptó la convención de orientar CP1 hacia precios altos y CP2 hacia una mayor dotación de parqueaderos. La interpretación se centra en la magnitud, el sentido relativo y la contribución de las variables. Con cinco variables, la contribución media esperada es del 20 %; los valores superiores a ese umbral son los que más definen cada eje.
| Variable | Carga CP1 | Carga CP2 | Correlación CP1 | Correlación CP2 | Contribución CP1 (%) | Contribución CP2 (%) |
|---|---|---|---|---|---|---|
| Precio (log10) | 0.472 | 0.343 | 0.874 | 0.308 | 22.281 | 11.774 |
| Área construida (log10) | 0.497 | -0.063 | 0.921 | -0.057 | 24.733 | 0.401 |
| Parqueaderos | 0.410 | 0.493 | 0.759 | 0.442 | 16.799 | 24.280 |
| Baños | 0.484 | -0.104 | 0.897 | -0.093 | 23.462 | 1.087 |
| Habitaciones | 0.357 | -0.790 | 0.661 | -0.708 | 12.726 | 62.458 |
En la primera componente, las variables con contribución superior al promedio son Precio (log10), Área construida (log10) y Baños; la mayor aportación corresponde a Área construida (log10) (24,7 %). Todas las variables se relacionan positivamente con el eje: área (0,921), baños (0,897), precio (0,874), parqueaderos (0,759) y habitaciones (0,661). CP1 se interpreta, por tanto, como una dimensión de escala, valor y dotación inmobiliaria: puntuaciones altas identifican viviendas grandes, costosas y mejor dotadas; puntuaciones bajas representan inmuebles más pequeños, económicos y con menor dotación.
La segunda componente está definida principalmente por Parqueaderos y Habitaciones y su mayor contribución procede de Habitaciones (62,5 %). Habitaciones presenta una correlación negativa de -0,708, mientras que parqueaderos alcanza 0,442 y precio 0,308. Área y baños tienen correlaciones próximas a cero. CP2 representa así una dimensión de configuración habitaciones–parqueaderos: las puntuaciones positivas corresponden a inmuebles con mayor dotación relativa de parqueaderos y precio, mientras que las negativas reflejan una configuración comparativamente más orientada hacia el número de habitaciones.
Círculo de correlaciones de las variables activas con las dos primeras componentes.
En el círculo, vectores próximos indican correlación positiva; vectores opuestos, asociación negativa; y ángulos cercanos a 90 grados, poca relación lineal. La longitud de cada flecha refleja qué tan bien queda representada la variable en el plano. En las variables activas, el color muestra el coseno cuadrado (\(\cos^2\)), definido como la suma de las correlaciones al cuadrado con CP1 y CP2: los tonos más oscuros identifican variables mejor representadas por las dos dimensiones retenidas. La flecha naranja discontinua corresponde al estrato suplementario y no intervino en la construcción de los ejes. Para proyectarlo se respetó su orden 3–6 y se calcularon correlaciones de Pearson con las puntuaciones; esta codificación se utiliza únicamente con una finalidad descriptiva.
| Variable suplementaria | Correlación CP1 | Correlación CP2 | cos² en el plano |
|---|---|---|---|
| Estrato | 0.463 | 0.508 | 0.472 |
El estrato presenta una correlación de 0,463 con CP1 y de 0,508 con CP2. Su \(\cos^2\) en el plano es 0,472, de modo que debe interpretarse con cautela en este plano. Su orientación hacia valores positivos de CP1 confirma el gradiente observado en los centroides: los estratos superiores se asocian con viviendas de mayor escala, precio y dotación.
Contribución porcentual de cada variable a las dos primeras componentes.
El biplot integra en un mismo plano las puntuaciones de las viviendas y las direcciones de las variables. Las flechas azules continuas representan las cinco variables activas y la naranja discontinua corresponde al estrato suplementario. La proximidad entre puntos indica perfiles cuantitativos semejantes; la proyección aproximada de un inmueble sobre una flecha muestra su posición relativa respecto de ese atributo. Para hacer visibles ambas geometrías, las flechas se amplificaron mediante un factor común exclusivamente gráfico: su dirección y longitud relativa son interpretables, pero sus extremos no están expresados en la misma unidad que las puntuaciones de los inmuebles.
Biplot de las viviendas y las variables activas sobre las dos primeras componentes.
El biplot permite reconocer la dimensión general de escala y dotación hacia la derecha de CP1, el contraste entre habitaciones y parqueaderos a lo largo de CP2 y la asociación del estrato con estas dimensiones. Esta representación orienta la lectura del mercado, aunque todavía no crea conglomerados ni asigna segmentos.
Como análisis complementario, el plano siguiente diferencia las viviendas por tipología. El color y las elipses de concentración al 80 % permiten examinar si casas y apartamentos ocupan regiones diferentes del espacio principal.
Proyección de los inmuebles en las dos primeras componentes, diferenciada por tipología.
Los centros de grupo resumen la posición media de cada tipo, zona y estrato. Un centro positivo o negativo solo adquiere significado al relacionarlo con las cargas del componente correspondiente; no representa por sí mismo una valoración favorable o desfavorable.
| Agrupación | Categoría | n | Centro CP1 | Centro CP2 |
|---|---|---|---|---|
| Tipo | Apartamento | 5100 | -0.79 | 0.23 |
| Tipo | Casa | 3219 | 1.26 | -0.36 |
| Zona | Zona Centro | 124 | 0.09 | -0.96 |
| Zona | Zona Norte | 1920 | -0.41 | -0.10 |
| Zona | Zona Oeste | 1198 | 0.69 | 0.54 |
| Zona | Zona Oriente | 351 | -0.23 | -1.22 |
| Zona | Zona Sur | 4726 | 0.01 | 0.02 |
| Estrato | 3 | 1453 | -0.92 | -0.74 |
| Estrato | 4 | 2129 | -0.82 | -0.19 |
| Estrato | 5 | 2750 | 0.06 | 0.04 |
| Estrato | 6 | 1987 | 1.47 | 0.68 |
La tipología presenta una diferenciación consistente. Las casas se sitúan, en promedio, en CP1 = 1,26 y CP2 = -0,36: tienen mayor escala y dotación general y una configuración relativamente más orientada hacia habitaciones. Los apartamentos alcanzan CP1 = -0,79 y CP2 = 0,23, lo que refleja menor escala media y una posición relativamente más vinculada con parqueaderos y precio.
También aparece un patrón territorial. La Zona Oeste ocupa una posición positiva en ambos componentes (CP1 = 0,69; CP2 = 0,54), mientras que la Zona Oriente se distingue por su puntuación negativa en CP2 (-1,22). La Zona Sur permanece próxima al origen, con CP1 = 0,01 y CP2 = 0,02, por lo que representa aproximadamente el perfil cuantitativo medio de la base.
El gradiente socioeconómico es especialmente claro: el centro de CP1 pasa de -0,92 en el estrato 3 a 1,47 en el estrato 6. Esto confirma que los estratos superiores concentran viviendas de mayor tamaño, precio y dotación, aunque el ACP describe asociaciones y no establece relaciones causales.
Debido a que parqueaderos, baños y habitaciones contienen valores imputados, se repitió el ACP en cada uno de los cinco conjuntos completados. La congruencia compara la dirección de las cargas con la solución principal en una escala de 0 a 1; valores próximos a 1 indican estructuras prácticamente iguales, independientemente del signo arbitrario de los ejes.
| Imputación | % CP1 | % CP2 | % acumulado | Congruencia CP1 | Congruencia CP2 |
|---|---|---|---|---|---|
| 1 | 68.599 | 16.069 | 84.668 | 1 | 1.0000 |
| 2 | 68.535 | 16.106 | 84.640 | 1 | 1.0000 |
| 3 | 68.717 | 15.896 | 84.614 | 1 | 0.9999 |
| 4 | 68.583 | 16.073 | 84.656 | 1 | 1.0000 |
| 5 | 68.705 | 16.044 | 84.749 | 1 | 1.0000 |
La congruencia mínima observada entre ambas componentes y las cinco imputaciones fue 0,9999. La varianza acumulada de CP1 y CP2 osciló entre 84,61 % y 84,75 %. Estos resultados muestran una estabilidad muy alta frente a la incertidumbre de imputación.
El ACP también es sensible a observaciones extremas. En lugar de eliminarlas de la solución oficial, se efectuó un análisis secundario excluyendo los 113 inmuebles que cumplen un criterio conjunto de extremos univariantes: al menos una variable estandarizada con valor absoluto superior a cuatro. Esta comprobación evalúa su influencia sin confundir automáticamente los inmuebles de alta gama legítimos con errores.
| Escenario | n | % CP1 | % CP2 | % acumulado | Congruencia CP1 | Congruencia CP2 |
|---|---|---|---|---|---|---|
| Base analítica completa | 8319 | 68.599 | 16.069 | 84.668 | 1.0000 | 1.0000 |
| Sin casos con valor absoluto de z > 4 | 8206 | 68.963 | 16.413 | 85.375 | 0.9999 | 0.9993 |
La congruencia de las cargas fue 0,9999 para CP1 y 0,9993 para CP2. Por tanto, la estructura principal se conserva prácticamente intacta y se justifica mantener la diversidad real del mercado.
El ACP transforma cinco indicadores activos correlacionados en 2 dimensiones que conservan 84,7 % de la variabilidad. CP1 sintetiza la escala, el valor y la dotación inmobiliaria; CP2 diferencia configuraciones relativamente orientadas hacia habitaciones o hacia parqueaderos y precio. La proyección suplementaria del estrato permite relacionar estas dimensiones con el gradiente socioeconómico sin alterar la solución. El ACP es adecuado según KMO y Bartlett y ha sido contrastado frente a las imputaciones y los casos extremos.
Estas componentes no sustituyen las variables originales en la descripción, pero proporcionan coordenadas ortogonales y de baja dimensionalidad para el análisis de conglomerados. En la siguiente fase sus puntuaciones se estandarizan, se comparan alternativas para elegir el número de segmentos y cada grupo se caracteriza nuevamente en las unidades inmobiliarias originales.
El análisis de conglomerados tiene como objetivo reunir viviendas con perfiles cuantitativos semejantes y separar aquellas que difieren en escala, valor y configuración. La clasificación es no supervisada: los segmentos no existían previamente en la base y se obtienen a partir de las distancias entre observaciones.
Se utilizaron las dos componentes retenidas en el ACP, que sintetizan
84,7 % de la variabilidad de las cinco variables
activas. Esta elección reduce redundancias, evita agrupar
simultáneamente variables muy correlacionadas y permite representar
gráficamente toda la solución. La distancia utilizada fue la euclídea,
coherente con los métodos de Ward y k-means.
| Elemento | Decisión metodológica |
|---|---|
| Unidad de análisis | 8.319 viviendas |
| Variables de entrada | PC1 y PC2 |
| Información conservada | 84.67 % de la varianza del ACP |
| Preprocesamiento | Estandarización de las puntuaciones retenidas |
| Distancia | Euclídea |
| Método exploratorio | Jerárquico de Ward.D2 sobre una muestra reproducible |
| Método definitivo | k-means sobre la base analítica completa |
Aunque CP1 y CP2 son ortogonales, sus varianzas no son iguales: CP1 concentra más información y, sin un ajuste adicional, dominaría la distancia. Para que la dimensión de configuración habitaciones–parqueaderos tenga la misma oportunidad de definir perfiles que la dimensión general de escala y dotación, las puntuaciones de ambas componentes se centraron y dividieron por su desviación estándar. Esta decisión es explícita: persigue una segmentación estratégica sobre las dos dimensiones interpretables, no una reproducción exacta de la ponderación por varianza del ACP.
| Componente | Desviación antes | Media después | Desviación después |
|---|---|---|---|
| PC1 | 1.8520 | 0 | 1 |
| PC2 | 0.8964 | 0 | 1 |
El estrato no se incorporó como tercera variable activa porque ya se relaciona intensamente con CP1 y añadirlo habría duplicado parcialmente el gradiente económico. Se utiliza, junto con el tipo y la zona, como variable externa de caracterización. De esta manera se puede comprobar si los grupos cuantitativos muestran diferencias socioeconómicas y territoriales sin imponerlas de antemano.
Se estimaron soluciones entre 2 y 8 grupos. La suma de cuadrados dentro de los grupos (WSS) mide compactación y debe disminuir al aumentar \(k\); el criterio del codo busca el punto a partir del cual esa reducción presenta rendimientos decrecientes. El índice de silueta combina cohesión interna y separación respecto del grupo vecino, mientras que Calinski–Harabasz compara la variación entre grupos con la variación interna. En estos dos últimos índices son preferibles los valores altos.
La WSS y Calinski–Harabasz se calcularon sobre las 8.319 viviendas. Para la silueta se utilizó una muestra aleatoria reproducible de 2.000 casos, evitando construir repetidamente una matriz completa de más de 34 millones de distancias.
| k | WSS | Reducción WSS (%) | Silueta media | Calinski-Harabasz | Elegida |
|---|---|---|---|---|---|
| 2 | 10866.5 | — | 0.411 | 4415.9 | |
| 3 | 6307.0 | 42.0 | 0.472 | 6809.5 | |
| 4 | 4821.1 | 23.6 | 0.411 | 6792.4 | Sí |
| 5 | 3813.0 | 20.9 | 0.417 | 6989.9 | |
| 6 | 3304.0 | 13.4 | 0.411 | 6708.9 | |
| 7 | 2922.0 | 11.6 | 0.413 | 6501.9 | |
| 8 | 2614.9 | 10.5 | 0.376 | 6366.3 |
Evolución de la suma de cuadrados intragrupo para las soluciones candidatas.
Índices de validación interna según el número de conglomerados.
Los criterios no obligan a seleccionar el mismo valor: el codo geométrico se sitúa en k = 4, la mayor silueta media se alcanza con k = 3 y el máximo Calinski–Harabasz con k = 5. Esta discrepancia es informativa. Una solución con menos grupos favorece separación y parsimonia, mientras que una con más grupos captura perfiles comerciales más específicos a costa de fragmentar la muestra.
| Criterio | k | Función en la decisión |
|---|---|---|
| Codo geométrico del WSS | 4 | Busca el punto a partir del cual añadir grupos reduce menos el WSS |
| Máxima silueta media | 3 | Favorece grupos compactos y separados |
| Máximo Calinski-Harabasz | 5 | Compara separación entre grupos con compactación interna |
| Solución adoptada | 4 | Equilibra evidencia estadística e interpretación inmobiliaria |
Se adopta k = 4. La silueta favorece la solución con 3 grupos (0,472), que prioriza la separación global, mientras que Calinski–Harabasz alcanza su máximo con 5 grupos (6.989,9). Frente a cuatro grupos, esta última alternativa solo mejora la silueta en 0,007 puntos y Calinski–Harabasz en 2,9 %. Su WSS disminuye 20,9 %, pero esta medida decrece necesariamente al aumentar el número de grupos y no constituye por sí sola un criterio de selección. Con cuatro grupos, la silueta se mantiene en 0,411 y aparece un perfil adicional con interpretación inmobiliaria clara frente a la solución más parsimoniosa: se distinguen viviendas familiares amplias de inmuebles premium con mayor precio y parqueaderos. Por tanto, la elección combina evidencia estadística, tamaño suficiente de cada grupo, parsimonia e interpretabilidad empresarial; no se basa exclusivamente en el máximo de un índice.
Como comprobación independiente se aplicó el método jerárquico de Ward.D2 sobre una muestra reproducible de 1.000 viviendas. Ward fusiona en cada paso los grupos que producen el menor incremento de variación interna. La muestra permite obtener un dendrograma legible sin construir la matriz de distancias de las 8.319 observaciones; por ello, esta solución tiene una función exploratoria y no sustituye la clasificación final sobre la base completa.
Dendrograma de Ward.D2 y corte en cuatro conglomerados.
| Indicador | Valor |
|---|---|
| Índice de Rand ajustado: Ward vs. k-means | 0.648 |
| Silueta media de Ward | 0.357 |
| Silueta media de k-means en la misma muestra | 0.409 |
El índice de Rand ajustado entre Ward y k-means fue
0,648, lo que evidencia una concordancia apreciable
entre dos algoritmos con reglas de construcción diferentes. La silueta
de Ward fue 0,357 y la de k-means,
calculada sobre exactamente la misma muestra, fue
0,409. El contraste respalda la existencia de
estructura agrupable, pero también confirma que las fronteras no son
absolutas.
k-meansLa solución definitiva se estimó sobre toda la base con 100
inicializaciones aleatorias y semilla fija. Las múltiples
inicializaciones reducen el riesgo de conservar un mínimo local
desfavorable. Como la numeración interna de k-means es
arbitraria, los grupos se reordenaron según su centro en CP1, desde
menor hasta mayor escala, valor y dotación; después se asignaron nombres
empresariales descriptivos.
| Segmento | n | Centro CP1 | Centro CP2 | Centro CP1 est. | Centro CP2 est. |
|---|---|---|---|---|---|
| S1 - Compacto de menor precio | 3696 | -1.63 | -0.05 | -0.88 | -0.06 |
| S2 - Intermedio equilibrado | 2804 | 0.55 | 0.26 | 0.30 | 0.29 |
| S3 - Familiar amplio | 882 | 1.94 | -1.82 | 1.05 | -2.03 |
| S4 - Premium dotado | 937 | 2.95 | 1.13 | 1.59 | 1.26 |
Solución de cuatro conglomerados sobre las componentes estandarizadas.
El plano confirma que CP1 ordena los segmentos desde la oferta compacta hasta la premium, mientras que CP2 separa dos configuraciones de gran tamaño: las viviendas orientadas hacia muchas habitaciones se ubican en sentido opuesto a las que destacan por parqueaderos y precio. Esta segunda separación es la principal ganancia analítica frente a clasificar el mercado únicamente por nivel económico.
| Indicador | Valor | Unidad |
|---|---|---|
| WSS | 4821.132 | Suma de cuadrados |
| Variación entre grupos / variación total | 71.020 | % |
| Silueta media | 0.411 | Índice de -1 a 1 |
| Casos con silueta negativa | 3.350 | % de la muestra de validación |
La silueta media estimada en la muestra de validación es 0,411, compatible con una estructura moderada, con solapamiento esperable en un mercado continuo. El 3,4 % de esa muestra presenta silueta negativa, es decir, casos fronterizos cuya semejanza con otro segmento es mayor que con el asignado. Esto no invalida la solución: la oferta inmobiliaria forma un continuo y no categorías naturales perfectamente aisladas. Sí aconseja utilizar los conglomerados como perfiles de decisión y no como etiquetas rígidas de valoración individual.
| Segmento | n en muestra | Silueta media | Siluetas negativas (%) |
|---|---|---|---|
| S1 - Compacto de menor precio | 920 | 0.519 | 0.00 |
| S2 - Intermedio equilibrado | 618 | 0.304 | 5.66 |
| S3 - Familiar amplio | 229 | 0.358 | 9.17 |
| S4 - Premium dotado | 233 | 0.316 | 4.72 |
La interpretación vuelve a las unidades originales. Se utilizan medianas para precio, área y conteos porque son más resistentes a la cola derecha del mercado; el estrato se resume mediante su promedio únicamente para describir el gradiente ordinal. Los nombres asignados sintetizan el perfil central de cada grupo y no corresponden a categorías preexistentes en la base.
| Segmento | n | % | Precio mediano (millones) | Área mediana (m²) | Parqueaderos | Baños | Habitaciones | Estrato medio | CP1 | CP2 |
|---|---|---|---|---|---|---|---|---|---|---|
| S1 - Compacto de menor precio | 3696 | 44.4 | 210 | 75 | 1 | 2 | 3 | 4.12 | -1.63 | -0.05 |
| S2 - Intermedio equilibrado | 2804 | 33.7 | 450 | 160 | 2 | 3 | 3 | 5.16 | 0.55 | 0.26 |
| S3 - Familiar amplio | 882 | 10.6 | 400 | 280 | 1 | 4 | 6 | 3.98 | 1.94 | -1.82 |
| S4 - Premium dotado | 937 | 11.3 | 1077 | 320 | 4 | 5 | 4 | 5.71 | 2.95 | 1.13 |
Perfil relativo de los segmentos en las cinco variables activas.
S1 - Compacto de menor precio. Reúne 3.696 viviendas (44,4 %). Su propiedad representativa presenta un precio de 210 millones, un área de 75 m², 1 parqueadero, 2 baños y 3 habitaciones. Los apartamentos constituyen el 84,2 %, por lo que representa principalmente la franja compacta de menor precio.
S2 - Intermedio equilibrado. Comprende 2.804 propiedades (33,7 %) y ocupa una posición intermedia en ambas componentes. Su precio mediano es 450 millones y su área mediana 160 m². La mediana de 3 habitaciones y 2 parqueaderos refleja un producto de transición entre la vivienda compacta y los inmuebles grandes.
S3 - Familiar amplio. Contiene 882 viviendas (10,6 %) y es el perfil que CP2 permite descubrir con mayor claridad. Presenta un área mediana de 280 m² y 6 habitaciones, pero un precio mediano de 400 millones y un estrato promedio de 3,98. El 97,7 % son casas. Se trata, por tanto, de inmuebles grandes y orientados a familias numerosas, pero no necesariamente de alta gama; este contraste entre amplitud y precio constituye una oportunidad comercial distinta del segmento premium.
S4 - Premium dotado. Agrupa 937 propiedades (11,3 %) con el mayor centro en CP1 y una orientación positiva en CP2. La mediana alcanza 1.077 millones, 320 m², 4 parqueaderos y 5 baños. El estrato 6 representa el 78,1 % del grupo, lo que confirma un perfil de alta gama y elevada dotación.
Distribución del precio ofertado dentro de cada segmento.
La distribución de precios mantiene solapamiento entre grupos, especialmente entre S2 y S3. La diferencia entre ellos no depende exclusivamente del precio: S3 se distingue por área, habitaciones y predominio de casas, mientras que S2 presenta una configuración más equilibrada. Esto confirma que la segmentación es multidimensional y no una simple división por cuartiles de precio.
| Segmento | Casas (%) | Apartamentos (%) |
|---|---|---|
| S1 - Compacto de menor precio | 15.8 | 84.2 |
| S2 - Intermedio equilibrado | 42.4 | 57.6 |
| S3 - Familiar amplio | 97.7 | 2.3 |
| S4 - Premium dotado | 62.2 | 37.8 |
Participación de casas y apartamentos dentro de los segmentos.
La transición tipológica es clara: S1 está dominado por apartamentos,
S3 casi íntegramente por casas y S2–S4 combinan ambas tipologías. Esto
indica que los atributos físicos y económicos no reproducen
mecánicamente la variable tipo, aunque sí generan perfiles
fuertemente asociados con ella.
| Segmento | Estrato 3 | Estrato 4 | Estrato 5 | Estrato 6 |
|---|---|---|---|---|
| S1 - Compacto de menor precio | 25.8 | 39.7 | 31.4 | 3.1 |
| S2 - Intermedio equilibrado | 4.2 | 14.6 | 42.4 | 38.8 |
| S3 - Familiar amplio | 41.4 | 24.9 | 27.8 | 5.9 |
| S4 - Premium dotado | 1.7 | 3.7 | 16.4 | 78.1 |
Participación de los estratos socioeconómicos dentro de los segmentos.
La composición socioeconómica confirma la utilidad de mantener el estrato como variable de caracterización. S4 concentra la mayor presencia del estrato 6; S1 se distribuye principalmente entre estratos medios; y S3 combina gran tamaño físico con una participación apreciable de estratos bajos y medios. Si el estrato se hubiera incluido como variable activa, esta lectura habría sido parcialmente impuesta en lugar de observada después de la agrupación.
| Segmento | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| S1 - Compacto de menor precio | 1.4 | 27.9 | 5.2 | 4.4 | 61.1 |
| S2 - Intermedio equilibrado | 0.7 | 21.1 | 24.0 | 0.9 | 53.3 |
| S3 - Familiar amplio | 5.7 | 22.1 | 5.9 | 18.0 | 48.3 |
| S4 - Premium dotado | 0.2 | 11.1 | 29.9 | 0.3 | 58.5 |
Como la Zona Sur representa una parte elevada de toda la base, puede ser mayoritaria en varios segmentos sin ser necesariamente su rasgo territorial distintivo. Para evitar esa confusión se calculó un índice de localización: compara el peso de cada zona dentro de un segmento con su peso en el mercado completo. Un valor superior a 1 señala sobrerrepresentación relativa.
| Segmento | Zona relativamente destacada | % dentro del segmento | Índice de localización |
|---|---|---|---|
| S1 - Compacto de menor precio | Zona Norte | 27.9 | 1.21 |
| S2 - Intermedio equilibrado | Zona Oeste | 24.0 | 1.66 |
| S3 - Familiar amplio | Zona Oriente | 18.0 | 4.27 |
| S4 - Premium dotado | Zona Oeste | 29.9 | 2.08 |
Este indicador muestra que S1 se asocia relativamente con Zona Norte, S2 con Zona Oeste, S3 con Zona Oriente y S4 con Zona Oeste. La lectura es relativa al volumen total de cada zona y deberá complementarse más adelante con los mapas de conglomerados.
La estabilidad se evaluó mediante veinte submuestras aleatorias que
contienen el 80 % de la base. En cada repetición se reestimó
k-means, se asignaron todas las viviendas al centro más
próximo y se comparó la partición con la solución principal mediante el
índice de Rand ajustado (ARI). Este índice corrige el acuerdo esperado
por azar y no depende de la numeración arbitraria de los grupos.
| Repeticiones | Muestra (%) | ARI mínimo | ARI mediano | ARI medio | ARI máximo |
|---|---|---|---|---|---|
| 20 | 80 | 0.969 | 0.987 | 0.985 | 0.995 |
El ARI mediano fue 0,987 y el mínimo
0,969. La estabilidad frente a cambios moderados de la
muestra es, por tanto, alta. Esta prueba es más
exigente que repetir k-means con distintas semillas, porque
modifica también las observaciones utilizadas para estimar los
centros.
La incertidumbre de los valores imputados se examinó reconstruyendo el ACP y los conglomerados en cada uno de los cinco conjuntos completados. Se informa el ARI frente a la partición principal y la silueta media de cada solución.
| Imputación | ARI frente a la solución principal | Silueta media |
|---|---|---|
| 1 | 1.000 | 0.411 |
| 2 | 0.942 | 0.412 |
| 3 | 0.943 | 0.408 |
| 4 | 0.947 | 0.408 |
| 5 | 0.954 | 0.409 |
El menor ARI entre imputaciones fue 0,942. La partición es muy estable frente a la incertidumbre de imputación.
Finalmente, se reestimó la segmentación sin los casos que presentaban al menos un valor estandarizado con \(|z| > 4\) en las variables del ACP. Estos inmuebles se conservan en la solución oficial porque pueden corresponder a oferta real de lujo o propiedades de gran tamaño; la exclusión solo funciona como análisis de influencia.
| Escenario | n comparado | Casos excluidos | ARI |
|---|---|---|---|
| Reestimación sin casos con valor absoluto de z > 4 | 8206 | 113 | 0.882 |
El ARI de 0,882 indica que la estructura se conserva ampliamente y los extremos no determinan por sí solos la segmentación.
La oferta inmobiliaria no se organiza únicamente por precio. La solución de cuatro grupos distingue: una oferta compacta de menor precio, un producto intermedio equilibrado, viviendas familiares amplias con muchas habitaciones y un segmento premium caracterizado por precio, parqueaderos, baños y estrato altos. La diferencia entre S3 y S4 es especialmente útil: ambos reúnen propiedades grandes, pero responden a necesidades y capacidades de compra distintas.
Desde la perspectiva empresarial, S1 puede orientar estrategias de volumen para la franja de menor precio; S2 constituye una franja intermedia con elevada presencia dentro de la oferta analizada; S3 permite dirigir campañas hacia familias que priorizan espacio; y S4 requiere una comercialización selectiva centrada en exclusividad y dotación. Estas recomendaciones son preliminares: los conglomerados describen perfiles de oferta, no demanda, rentabilidad, velocidad de venta ni causalidad sobre el precio.
A continuación se examinan las relaciones entre zona,
estrato, tipo y los barrios de mayor oferta
mediante análisis de correspondencias.
El análisis de correspondencias representa las diferencias entre los perfiles de una tabla de contingencia utilizando distancias chi-cuadrado. Las categorías que se apartan de la independencia son las que generan la inercia del análisis y definen sus dimensiones. Esta técnica es exploratoria: identifica asociaciones entre categorías, pero no establece causalidad ni mide por sí sola demanda inmobiliaria.
El análisis se organiza en tres tablas sencillas.
zona × estrato constituye la correspondencia principal
porque ambas variables tienen más de dos categorías y permiten construir
un plano factorial bidimensional. tipo × zona complementa
la interpretación territorial de casas y apartamentos. Finalmente,
barrio × tipo se limita de forma transparente a los quince
barrios con mayor número de ofertas, evitando un gráfico con más de
cuatrocientas categorías y manteniendo el procedimiento visto en la
unidad.
| Registros | Tipos | Zonas | Estratos | Barrios | Registros incompletos |
|---|---|---|---|---|---|
| 8319 | 2 | 5 | 4 | 407 | 0 |
Se analizaron 8.319 ofertas completas para
tipo, zona, estrato y
barrio. La ausencia conservada en piso y la
imputación de las variables estructurales no intervienen en esta fase.
Tampoco se transformó el precio en intervalos: preciom es
cuantitativa y su relación con la zona ya se estudió en el EDA mediante
medianas y diagramas de caja.
La prueba chi-cuadrado contrasta si los perfiles observados son compatibles con la independencia. Como su significación aumenta con el tamaño muestral, se informa también la \(V\) de Cramér, comprendida entre 0 y 1. La frecuencia esperada mínima y el porcentaje de celdas por debajo de cinco permiten evaluar la aproximación asintótica.
| Relación | Chi-cuadrado | gl | p | V de Cramér | Esperada mínima | % esperadas < 5 |
|---|---|---|---|---|---|---|
| Zona vs. estrato | 3830.435 | 12 | <0.001 | 0.392 | 21.658 | 0 |
| Tipo de vivienda vs. zona | 690.930 | 4 | <0.001 | 0.288 | 47.981 | 0 |
| 15 barrios principales vs. tipo | 607.166 | 14 | <0.001 | 0.385 | 33.218 | 0 |
Las tres tablas presentan un 0 % de frecuencias esperadas
inferiores a cinco, por lo que puede utilizarse directamente la
aproximación chi-cuadrado explicada en la unidad. La relación más
intensa es zona × estrato, con \(V = 0,392\); le siguen los quince barrios
principales frente al tipo, con \(V =
0,385\), y tipo × zona, con \(V = 0,288\).
La asociación entre zona y estrato es estadísticamente significativa (\(\chi^2 = 3.830,4\), \(p\) < 0,001). La tabla utilizada contiene las frecuencias absolutas de toda la base:
| Zona | 3 | 4 | 5 | 6 | Total |
|---|---|---|---|---|---|
| Zona Centro | 105 | 14 | 4 | 1 | 124 |
| Zona Norte | 572 | 407 | 769 | 172 | 1920 |
| Zona Oeste | 54 | 84 | 290 | 770 | 1198 |
| Zona Oriente | 340 | 8 | 2 | 1 | 351 |
| Zona Sur | 382 | 1616 | 1685 | 1043 | 4726 |
| Total | 1453 | 2129 | 2750 | 1987 | 8319 |
Los residuos estandarizados muestran qué combinaciones aparecen con una frecuencia superior o inferior a la esperada bajo independencia. Valores positivos indican exceso relativo y valores negativos, déficit; como referencia práctica, los valores absolutos superiores a 2 señalan las diferencias más claras.
| Zona | Estrato 3 | Estrato 4 | Estrato 5 | Estrato 6 |
|---|---|---|---|---|
| Zona Centro | 19.86 | -3.68 | -7.11 | -6.07 |
| Zona Norte | 16.22 | -5.03 | 7.43 | -17.49 |
| Zona Oeste | -12.77 | -15.93 | -7.04 | 35.44 |
| Zona Oriente | 40.03 | -10.23 | -13.22 | -10.60 |
| Zona Sur | -25.85 | 20.62 | 5.77 | -4.45 |
Residuos estandarizados de la asociación entre zona y estrato.
El estrato 3 presenta su mayor exceso relativo en Zona Oriente, con un residuo de 40,03. Para el estrato 6, la asociación positiva más marcada corresponde a Zona Oeste, con un residuo de 35,44.
| Dimensión | Autovalor | Inercia (%) | Inercia acumulada (%) |
|---|---|---|---|
| Dimensión 1 | 0.322 | 69.966 | 69.966 |
| Dimensión 2 | 0.127 | 27.680 | 97.646 |
| Dimensión 3 | 0.011 | 2.354 | 100.000 |
Porcentaje de inercia explicado por las dimensiones de la correspondencia zona-estrato.
Las dos primeras dimensiones reúnen el 97,6 % de la inercia, por lo que el plano factorial conserva la mayor parte de la asociación observada. La tercera dimensión aporta el porcentaje restante y se mantiene en la tabla para documentar la solución completa.
| Conjunto | Categoría | Dim. 1 | Dim. 2 | Contrib. Dim. 1 (%) | Contrib. Dim. 2 (%) | cos² del plano |
|---|---|---|---|---|---|---|
| Zona | Zona Centro | 1.725 | 0.364 | 13.761 | 1.547 | 0.984 |
| Zona | Zona Norte | 0.390 | -0.147 | 10.887 | 3.920 | 0.857 |
| Zona | Zona Oeste | -0.569 | 0.783 | 14.476 | 69.204 | 0.999 |
| Zona | Zona Oriente | 2.015 | 0.537 | 53.171 | 9.563 | 0.994 |
| Zona | Zona Sur | -0.209 | -0.188 | 7.704 | 15.767 | 0.956 |
| Estrato | Estrato 3 | 1.187 | 0.207 | 76.333 | 5.851 | 1.000 |
| Estrato | Estrato 4 | -0.154 | -0.380 | 1.895 | 28.966 | 0.901 |
| Estrato | Estrato 5 | -0.132 | -0.204 | 1.796 | 10.824 | 0.769 |
| Estrato | Estrato 6 | -0.519 | 0.539 | 19.976 | 54.359 | 0.999 |
Mapa factorial del análisis de correspondencia entre zona y estrato.
Las categorías alejadas del origen son las que más diferencian la estructura territorial. Las distancias entre categorías del mismo conjunto —zonas entre sí o estratos entre sí— reflejan semejanza de perfiles. Para relacionar una zona con un estrato se consideran la dirección compartida en el plano, los residuos estandarizados y las contribuciones; la distancia directa entre un punto de zona y uno de estrato no se interpreta como una métrica exacta. El signo de cada dimensión es arbitrario: invertir simultáneamente sus coordenadas no modificaría las asociaciones.
La tabla de entrada conserva las frecuencias absolutas de las 8.319 propiedades:
| Tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur | Total |
|---|---|---|---|---|---|---|
| Casa | 100 | 722 | 169 | 289 | 1939 | 3219 |
| Apartamento | 24 | 1198 | 1029 | 62 | 2787 | 5100 |
| Total | 124 | 1920 | 1198 | 351 | 4726 | 8319 |
Los residuos estandarizados comparan cada frecuencia observada con la esperada bajo independencia. Un residuo positivo indica exceso relativo de esa combinación y uno negativo, déficit. Como referencia práctica, valores absolutos superiores a 2 señalan las celdas que más se apartan de la independencia.
| Tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| Casa | 9.66 | -1.12 | -18.89 | 17.15 | 5.01 |
| Apartamento | -9.66 | 1.12 | 18.89 | -17.15 | -5.01 |
Residuos estandarizados de la asociación entre tipo de vivienda y zona.
El mayor exceso relativo de casas se observa en Zona Oriente, con un residuo de 17,15. En los apartamentos, la asociación positiva más marcada corresponde a Zona Oeste, con un residuo de 18,89. Estos resultados cuantifican el patrón que el EDA había anticipado mediante porcentajes.
| Dimensión | Autovalor | Inercia (%) | Inercia acumulada (%) |
|---|---|---|---|
| Dimensión 1 | 0.083 | 100 | 100 |
La tabla tiene dos filas, una por tipo de vivienda, por lo que el número máximo de dimensiones es \(\min(2-1,5-1)=1\). En consecuencia, la primera dimensión concentra el 100,0 % de la inercia por construcción. Este porcentaje no significa que la tipología pueda predecirse perfectamente; indica que toda la desviación respecto de la independencia solo puede expresarse sobre un eje.
| Conjunto | Categoría | Coordenada Dim. 1 | Contribución (%) | cos² |
|---|---|---|---|---|
| Zona | Zona Oeste | -0.505 | 44.189 | 1 |
| Zona | Zona Norte | -0.022 | 0.139 | 1 |
| Zona | Zona Sur | 0.048 | 1.570 | 1 |
| Zona | Zona Centro | 0.861 | 13.314 | 1 |
| Zona | Zona Oriente | 0.896 | 40.787 | 1 |
| Tipo de vivienda | Apartamento | -0.229 | 38.695 | 1 |
| Tipo de vivienda | Casa | 0.363 | 61.305 | 1 |
Mapa unidimensional del análisis de correspondencia entre tipo de vivienda y zona.
El signo del eje es arbitrario: invertir todos los signos produciría la misma solución. Las categorías alejadas de cero son las que más diferencian los perfiles. La afinidad entre un tipo y una zona se interpreta mediante su dirección compartida en el eje y se confirma con los residuos estandarizados; la distancia directa entre una categoría de fila y una de columna no constituye una métrica exacta de asociación.
La base contiene 407 barrios, una cardinalidad excesiva para una tabla y un gráfico interpretables. Se seleccionaron los 15 barrios con mayor número de ofertas, el mismo criterio transparente utilizado en el EDA. Este subconjunto reúne 4.105 propiedades y permite estudiar los sectores con mayor presencia en la base sin agrupar categorías heterogéneas bajo una etiqueta residual.
La prueba chi-cuadrado cumple el supuesto de frecuencias esperadas y
rechaza la independencia (\(\chi^2 =
607,2\), \(p\) < 0,001), con
\(V = 0,385\). Debido a que
tipo tiene dos categorías, la correspondencia genera una
única dimensión, que concentra el 100,0 % de la inercia por
construcción.
| Dimensión | Autovalor | Inercia (%) | Inercia acumulada (%) |
|---|---|---|---|
| Dimensión 1 | 0.148 | 100 | 100 |
Las coordenadas de los tipos permiten orientar el eje barrial:
| Tipo | Coordenada Dim. 1 | Contribución (%) | cos² |
|---|---|---|---|
| Casa | -0.581 | 69.525 | 1 |
| Apartamento | 0.255 | 30.475 | 1 |
La tabla presenta los quince barrios ordenados por su contribución al eje, junto con su composición tipológica, zona principal y precio mediano:
| Barrio | Zona | n | Casas (%) | Apartamentos (%) | Precio mediano (millones COP) | Coordenada Dim. 1 | Contribución (%) |
|---|---|---|---|---|---|---|---|
| Ciudad Jardín | Zona Sur | 518 | 57.34 | 42.66 | 670.0 | -0.58 | 29.05 |
| Valle Del Lili | Zona Sur | 1009 | 16.65 | 83.35 | 235.0 | 0.30 | 14.99 |
| Santa Teresita | Zona Oeste | 263 | 4.56 | 95.44 | 750.0 | 0.56 | 13.73 |
| Pance | Zona Sur | 412 | 50.00 | 50.00 | 780.0 | -0.42 | 12.21 |
| Normandía | Zona Oeste | 154 | 2.60 | 97.40 | 621.5 | 0.61 | 9.30 |
| El Limonar | Zona Sur | 135 | 56.30 | 43.70 | 370.0 | -0.56 | 7.00 |
| Los Cristales | Zona Oeste | 154 | 11.04 | 88.96 | 490.0 | 0.42 | 4.52 |
| Aguacatal | Zona Oeste | 109 | 10.09 | 89.91 | 690.0 | 0.44 | 3.52 |
| Acopi | Zona Norte | 158 | 44.30 | 55.70 | 375.0 | -0.30 | 2.35 |
| El Caney | Zona Sur | 209 | 40.19 | 59.81 | 220.0 | -0.21 | 1.53 |
| El Ingenio | Zona Sur | 203 | 36.95 | 63.05 | 355.0 | -0.14 | 0.66 |
| Prados Del Norte | Zona Norte | 127 | 24.41 | 75.59 | 229.0 | 0.13 | 0.36 |
| La Flora | Zona Norte | 368 | 27.17 | 72.83 | 350.0 | 0.07 | 0.31 |
| El Refugio | Zona Sur | 120 | 35.83 | 64.17 | 240.0 | -0.12 | 0.27 |
| La Hacienda | Zona Sur | 166 | 34.34 | 65.66 | 327.5 | -0.08 | 0.19 |
Barrios con mayor contribución a la correspondencia entre localización y tipo de vivienda.
Entre los barrios seleccionados, Ciudad Jardín, Pance y El Limonar son los tres que más contribuyen desde el perfil con una proporción de casas superior al promedio del subconjunto. En el sentido asociado relativamente con apartamentos destacan Valle Del Lili, Santa Teresita y Normandía. La contribución combina el volumen de oferta y la diferencia de perfil respecto del promedio.
El precio mediano incluido en la tabla funciona únicamente como contexto empresarial y no interviene en las distancias chi-cuadrado. Las conclusiones barriales se refieren a los quince sectores con mayor oferta y no deben generalizarse automáticamente a los demás barrios de la ciudad.
Los resultados permiten establecer cuatro conclusiones:
Zona × estrato constituye la asociación categórica más
intensa (\(V = 0,392\)). El plano
factorial resume el 97,6 % de su inercia y permite
reconocer un gradiente socioeconómico territorial.La siguiente fase incorporará precios, tipos y conglomerados a mapas para comprobar la distribución espacial de estos perfiles y traducir los resultados multivariantes en decisiones territoriales.
Caliński, T., & Harabasz, J. (1974). A dendrite method for cluster analysis. Communications in Statistics, 3(1), 1–27.
Jolliffe, I. T., & Cadima, J. (2016). Principal component analysis: A review and recent developments. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences, 374(2065), 20150202. https://doi.org/10.1098/rsta.2015.0202
Little, R. J. A. (1988a). A test of missing completely at random for multivariate data with missing values. Journal of the American Statistical Association, 83(404), 1198–1202. https://doi.org/10.1080/01621459.1988.10478722
Little, R. J. A. (1988b). Missing-data adjustments in large surveys. Journal of Business & Economic Statistics, 6(3), 287–296. https://doi.org/10.1080/07350015.1988.10509663
Lê, S., Josse, J., & Husson, F. (2008). FactoMineR:
An R package for multivariate analysis. Journal of Statistical
Software, 25(1), 1–18. https://doi.org/10.18637/jss.v025.i01
Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65.
Van Buuren, S., & Groothuis-Oudshoorn, K. (2011).
mice: Multivariate Imputation by Chained Equations in R.
Journal of Statistical Software, 45(3), 1–67. https://doi.org/10.18637/jss.v045.i03
Ward, J. H. (1963). Hierarchical grouping to optimize an objective function. Journal of the American Statistical Association, 58(301), 236–244.