El objetivo de este informe es analizar el mercado inmobiliario urbano utilizando métodos estadísticos multivariados para apoyar la toma de decisiones estratégicas. Comenzamos realizando una limpieza de la base de datos para omitir valores nulos que puedan afectar el rendimiento de los modelos.
# Filtrar datos sin NAs en las variables clave y eliminar valores ilógicos
vivienda_clean <- vivienda %>%
drop_na(preciom, areaconst, parqueaderos, banios, habitaciones, zona, tipo) %>%
filter(preciom > 0, areaconst > 10)
# Seleccionamos las variables numéricas que se usarán para el PCA y los Clusters
df_num <- vivienda_clean %>%
select(preciom, areaconst, parqueaderos, banios, habitaciones)Este análisis nos permite reducir la dimensionalidad y entender cómo se relacionan las características de tamaño y el precio de las viviendas.
# Ejecutar PCA estandarizando los datos para igualar las escalas
res.pca <- PCA(df_num, scale.unit = TRUE, graph = FALSE)
# Gráfico 1: Varianza Explicada (Ejes en español)
fviz_eig(res.pca, addlabels = TRUE, ylim = c(0, 70),
title = "Porcentaje de Varianza Explicada por Dimensión",
xlab = "Dimensiones (Componentes Principales)",
ylab = "Porcentaje de Varianza Explicada")# Gráfico 2: Círculo de Correlación (CAMBIAMOS main POR title)
fviz_pca_var(res.pca, col.var = "contrib",
gradient.cols = c("#00AFBB", "#E7B800", "#FC4E07"),
repel = TRUE,
title = "Correlación de Variables (Biplot)")Los resultados del Análisis de Componentes Principales muestran que la reducción de dimensionalidad es altamente efectiva, ya que las dos primeras dimensiones logran retener el 82.3% de la información total (65.1% en la Dimensión 1 y 17.2% en la Dimensión 2).
Al observar el círculo de correlación (Biplot), identificamos dos comportamientos estructurales en el mercado:
Dimensión 1 (Tamaño y Valor): Las variables areaconst, banios, parqueaderos y preciom apuntan estrechamente hacia la misma dirección sobre el eje horizontal. Esto demuestra una fuerte correlación positiva entre ellas; es decir, el mercado tasa el precio de las viviendas en función de su amplitud general y comodidades anexas.
Dimensión 2 (Diseño Interior): La variable habitaciones es la de mayor contribución para la formación del eje vertical. Al formar un ángulo cercano a los 90 grados con respecto al vector de precio y área, se evidencia una independencia estadística. Esto indica que el número de habitaciones no determina el valor comercial de la propiedad, demostrando que el mercado paga por los metros cuadrados totales, no por la cantidad de subdivisiones interiores.
Utilizamos el algoritmo de K-Means para agrupar las propiedades en nichos de mercado con características similares, lo que facilita estrategias focalizadas de comercialización
# Estandarizar los datos numéricos antes de agrupar
df_scaled <- scale(df_num)
# Aplicar algoritmo K-means solicitando 4 grupos (clusters)
set.seed(123)
km.res <- kmeans(df_scaled, centers = 4, nstart = 25)
# Visualización de los segmentos
fviz_cluster(km.res, data = df_scaled,
geom = "point",
ellipse.type = "convex",
ggtheme = theme_minimal(),
main = "Segmentación de Propiedades Inmobiliarias")# Guardar a qué grupo pertenece cada vivienda para análisis posteriores
vivienda_clean$Segmento <- as.factor(km.res$cluster)A partir de la ejecución del algoritmo K-Means, logramos agrupar las propiedades en 4 segmentos distintos. Al proyectar estos clústeres sobre nuestras dos dimensiones principales del PCA, podemos observar claramente cómo se divide la oferta inmobiliaria en la ciudad y definir los siguientes perfiles:
Cluster 1 (Rojo - Vivienda Básica): Se posiciona en el extremo izquierdo del plano (valores bajos en la Dimensión 1). Esto nos indica que aquí se concentran las propiedades con menor área, menos comodidades y, por ende, los precios más bajos. Es el segmento de entrada para primeros compradores.
Cluster 3 (Azul - Mercado Estándar): Se agrupa justo en el centro de las coordenadas. Podemos interpretar que este es el mercado “promedio” (clase media). Representa propiedades con equilibrio estándar entre precio, área y habitaciones.
Cluster 2 (Verde - Lujo de Espacios Abiertos): Se ubica a la derecha (alta Dimensión 1 = costosas y grandes) pero fuertemente hacia abajo (baja Dimensión 2 = pocas habitaciones). Este hallazgo es de gran interés, ya que revela un nicho de propiedades muy caras y amplias que no están subdivididas. Podrían ser lofts, penthouses o apartamentos modernos de lujo donde prima el espacio abierto sobre el número de cuartos.
Cluster 4 (Morado - Lujo Tradicional): También está a la derecha (alto valor y gran tamaño), pero en la parte superior (muchas habitaciones). Este segmento representa la vivienda de lujo tradicional, probablemente casas grandes, clásicas o fincas urbanas diseñadas para familias numerosas.
Aquí evaluamos la relación entre dos variables categóricas importantes: la Zona de ubicación de la vivienda y el Tipo de propiedad (Casa vs. Apartamento).
# 1. Preparamos las variables categóricas (las convertimos a factor)
df_cat <- data.frame(
Zona = as.factor(vivienda_clean$zona),
Tipo = as.factor(vivienda_clean$tipo)
)
# 2. Ejecutamos Análisis de Correspondencia Múltiple (MCA)
res.mca <- MCA(df_cat, graph = FALSE)
# 3. Visualizamos las asociaciones usando factoextra
fviz_mca_var(res.mca,
repel = TRUE,
col.var = "#FC4E07",
title = "Análisis de Correspondencia: Zona vs Tipo de Vivienda")En este Análisis de Correspondencia evaluamos la asociación cualitativa entre la Zona de la ciudad y el Tipo de Vivienda. Al interpretar la cercanía geométrica de los puntos en el plano bidimensional, identificamos patrones muy claros sobre la vocación arquitectónica de cada sector:
El Eje Separador (Dimensión 1): Podemos observar que el eje horizontal (eje X) actúa como un divisor perfecto del mercado. Hacia el lado negativo (izquierda) se posiciona la categoría “Apartamento”, mientras que hacia el lado positivo (derecha) se ubica “Casa”.
Zona de Alta Verticalización (Oeste): El punto “Zona Oeste” se encuentra en el extremo izquierdo, fuertemente asociado y muy cercano al punto “Apartamento”. Esto nos indica que el desarrollo inmobiliario en esta zona está dominado casi en su totalidad por edificaciones verticales.
Zonas de Vivienda Tradicional (Oriente y Centro): Por el contrario, las zonas “Centro” y “Oriente” se ubican a la derecha del plano, mostrando una vocación altamente orientada hacia las “Casas”.
Zonas de Oferta Mixta (Norte y Sur): Las zonas “Norte” y “Sur” están posicionadas mucho más cerca del origen (el centro del cruce de los ejes, el punto 0,0). Esto significa que en estos sectores la oferta es más heterogénea y equilibrada, aunque el Norte presenta una ligera inclinación estadística hacia los apartamentos y el Sur hacia las casas
Ubicamos geográficamente la oferta de la ciudad para identificar polos de desarrollo y concentración de precios. Se toma una muestra representativa para facilitar la interactividad del mapa.
# Tomar muestra de 1000 datos para que el mapa corra fluido en el navegador
set.seed(123)
muestra_mapa <- vivienda_clean %>%
sample_n(min(1000, nrow(vivienda_clean))) %>%
drop_na(longitud, latitud)
# Paleta de colores basada en el precio
paleta <- colorNumeric(palette = "viridis", domain = muestra_mapa$preciom)
# Generación del mapa interactivo
leaflet(muestra_mapa) %>%
addProviderTiles(providers$CartoDB.Positron) %>%
addCircleMarkers(
~longitud, ~latitud,
radius = 4,
color = ~paleta(preciom),
stroke = FALSE, fillOpacity = 0.7,
popup = ~paste("<b>Precio:</b> $", preciom, "M<br>",
"<b>Área:</b>", areaconst, "m2<br>",
"<b>Habitaciones:</b>", habitaciones, "<br>",
"<b>Tipo:</b>", tipo)
) %>%
addLegend("bottomright", pal = paleta, values = ~preciom,
title = "Precio (Millones)", opacity = 1)La proyección geoespacial corrobora y complementa de manera visual los hallazgos de los modelos estadísticos previos. Al observar la distribución de la muestra en el mapa de la ciudad, es evidente una fuerte segregación espacial en los precios de la vivienda:
Corredores de Alto Valor (Occidente y Sur): Los puntos con colores más claros (verde y amarillo), que representan propiedades con precios superiores a los 1,200 millones de pesos, se aglomeran casi de forma exclusiva en dos sectores: la franja occidental (apegada a los cerros) y el cono sur de la ciudad. Estas zonas son los epicentros territoriales de la vivienda premium y de lujo (lo cual se relaciona directamente con nuestros Clusters 2 y 4).
Zonas de Mercado Accesible y de Volumen (Oriente y Centro): Por el contrario, el oriente y gran parte del centro/norte de la ciudad están dominados por una densa concentración de puntos morados y azules oscuros, los cuales indican propiedades de menor valor comercial (generalmente por debajo de los 400 millones). Esta área representa el mercado de alto volumen o estándar (relacionado con nuestro Cluster 1 y 3).
El presente análisis multidimensional proporciona a la empresa inmobiliaria una hoja de ruta basada en datos empíricos. Al comprender la estructura profunda del mercado urbano, la compañía adquiere una ventaja competitiva crucial para optimizar la inversión y maximizar los beneficios.
A continuación, se presentan las directrices estratégicas derivadas de los hallazgos:
La integración de estas técnicas estadísticas confirma que el mercado inmobiliario urbano es predecible si se analiza con las herramientas correctas. Al alinear la captación de propiedades con la demanda espacial (PCA), focalizar el esfuerzo de ventas por nicho (Clustering) y respetar la vocación territorial (Mapa y ACM), la inmobiliaria logrará reducir sus tiempos de venta, disminuir el riesgo en nuevos proyectos y maximizar su rentabilidad en este entorno altamente competitivo.