Informe modelos multivariados

A continuación se presenta la interpretación técnica, estadística y orientada al negocio inmobiliario para cada etapa del procesamiento y para cada modelo multivariado aplicado en el documento.

ETAPA 1: DIAGNÓSTICO Y LIMPIEZA INICIAL

Registros y Duplicados: Al aplicar distinct(), se depuran los registros duplicados para evitar sesgos en las estimaciones.Tipificación de Variables: La estandarización de cadenas de texto (tipo, zona, barrio) elimina errores de captura (espacios e inconsistencias en minúsculas).Tratamiento Práctico de parqueaderos: La asignación de 0 a las observaciones con NA asume que la ausencia de registro en parqueaderos corresponde a propiedades sin plaza de garaje privada.Diagnóstico de Faltantes (Tabla 1.2): Las variables piso y parqueaderos constituyen la mayor cantidad de valores ausentes, lo cual justifica avanzar hacia la fase de imputación.

Tabla 1.0. Mapeo y Clasificación de Variables del Dataset
Variable Tipo de Dato Rol Estadístico
Precio (preciom) Numérica Continua Variable Respuesta (Y)
Área construida (areaconst) Numérica Continua Predictor Continuo
Zona (zona) Categórica Nominal Factor de Segmentación
Tipo (tipo) Categórica Nominal Factor de Clasificación
Barrio (barrio) Categórica Nominal Factor Geográfico
Habitaciones / Baños / Parqueaderos Numéricas Discretas Predictor Discreto
Piso (piso) Categórica Ordinal Predictor Ordinal
Estrato (estrato) Categórica Ordinal Factor Socioeconómico
Tabla 1.1. Diagnóstico Inicial del Dataset
Métrica Valor
Registros Originales 8322
Registros Únicos 8321
Total Variables 13
Total NAs en Dataset 2658
Tabla 1.2. Valores Faltantes por Variable
Variable NAs
id 2
zona 2
piso 2637
estrato 2
preciom 1
areaconst 2
parqueaderos 0
banios 2
habitaciones 2
tipo 2
barrio 2
longitud 2
latitud 2

ETAPA 2: ANÁLISIS EXPLORATORIO CUALITATIVO (Tablas 2.2a - 2.2d)

Variables Nominales (Zona y Tipo):Revelan la estructura de la oferta del mercado. La concentración en zonas específicas y el balance entre “Apartamento” y “Casa” establecen el perfil dominante de los inmuebles comercializados.Variables Ordinales (Estrato y Piso):La distribución acumulada (\(F_i\)) del estrato evidencia la composición socioeconómica de la oferta. Una alta concentración en estratos 3, 4 y 5 indica que el mercado está orientado fundamentalmente a la clase media y media-alta.En cuanto al piso, las frecuencias acumuladas permiten identificar la tipología constructiva predominante (edificios de baja/media altura frente a torres elevadas).

Tabla 2.2a. Distribución de Frecuencias: Zona (Nominal)
zona n_i f_i
Zona Sur 4726 56.80
Zona Norte 1920 23.07
Zona Oeste 1198 14.40
Zona Oriente 351 4.22
Zona Centro 124 1.49
NA 2 0.02
Tabla 2.2b. Distribución de Frecuencias: Tipo de Vivienda (Nominal)
tipo n_i f_i
apartamento 5100 61.29
casa 3219 38.69
NA 2 0.02
Tabla 2.2c. Distribución de Frecuencias Completa: Estrato (Ordinal)
Estrato n_i (Absoluta) f_i (%) N_i (Abs. Acumulada) F_i (% Acumulado)
3 1453 17.47 1453 17.47
4 2129 25.59 3582 43.06
5 2750 33.06 6332 76.12
6 1987 23.89 8319 100.01
Tabla 2.2d. Distribución de Frecuencias Completa: Piso (Ordinal)
Piso n_i (Absoluta) f_i (%) N_i (Abs. Acumulada) F_i (% Acumulado)
01 860 15.13 860 15.13
02 1450 25.51 2310 40.64
03 1097 19.30 3407 59.94
04 607 10.68 4014 70.62
05 567 9.98 4581 80.60
06 245 4.31 4826 84.91
07 204 3.59 5030 88.50
08 211 3.71 5241 92.21
09 146 2.57 5387 94.78
10 130 2.29 5517 97.07
11 84 1.48 5601 98.55
12 83 1.46 5684 100.01

ETAPA 3: ANÁLISIS BIVARIADO

3.1 Cualitativa vs. Cualitativa (Estrato vs. Zona - Tabla 3.1 & Heatmap):Resultado Chi-cuadrado: El p-valor significativo (\(p < 0.001\)) rechaza la hipótesis nula de independencia.Interpretación Inmobiliaria: Existe una dependencia espacial estructurada: los estratos altos (5 y 6) no se distribuyen al azar, sino que se concentran geográficamente en zonas específicas (p. ej., Zona Norte o Oeste), mientras que los estratos 2 y 3 dominan las zonas Sur u Oriente.3.2 Cualitativa vs. Cuantitativa (Precio por Tipo - Tabla 3.2 & Boxplot):Resultado Prueba t de Welch: El valor del estadístico \(t\) con un p-valor \(< 0.001\) confirma diferencias estadísticamente significativas entre los precios promedios de casas y apartamentos.Interpretación Inmobiliaria: Las casas presentan un precio promedio superior y una mayor dispersión (varianza) debido al valor del suelo y mayor metraje construído, mientras que los apartamentos exhiben un rango de precios más homogéneo.3.3 Cuantitativa vs. Cuantitativa (Precio vs. Área Construida - Tabla 3.3 & Scatterplot):Resultado Correlación de Pearson: Muestra una asociación positiva fuerte (\(r > 0.6\)).Interpretación Inmobiliaria: El área construida es el principal predictor métrico del valor comercial del inmueble (\(preciom\)). A mayor superficie, el precio aumenta de forma proporcional, aunque se observan puntos atípicos en propiedades de lujo.

Tabla 3.1. Prueba Chi-cuadrado: Estrato vs Zona
Estadístico Grados_Libertad P_Valor
X-squared 3830.44 12 < 0.001
Tabla 3.2. Prueba t de Welch: Precio por Tipo de Vivienda
Estadístico_t Grados_Libertad P_Valor
t -23.07 5792.21 < 0.001
Tabla 3.3. Asociación Precio vs Área Construida
Métrica Valor
Correlación de Pearson 0.6874

ETAPA 4: DIAGNÓSTICO DE IMPUTACIÓN Y PREPARACIÓN DE DATOS

Prueba MCAR de Little (Tabla 4.1):El p-valor obtenido determina si los datos faltantes son Faltantes Completamente al Azar (MCAR). Un p-valor \(< 0.05\) indica un patrón de pérdida MAR (Missing at Random), lo que valida el uso de métodos de imputación directos (mediana para métricas continuas y moda para categóricas/ordinales).Control de Imputación y Codificación (Tabla 4.2 & One-Hot Encoding):La reducción de \(NAs\) a 0 garantiza la integridad del dataset previo al modelado. La conversión mediante dummyVars prepara la matriz para algoritmos que requieren entradas puramente numéricas.RESULTADOS DE LOS MODELOS MULTIVARIADOS1. Análisis de Componentes Principales (ACP)Scree Plot (fviz_eig):Resultado: La primera dimensión (Dim1) explica cerca del \(50\% - 57\%\) de la varianza total, mientras que la segunda dimensión (Dim2) captura aproximadamente entre el \(18\% y 21\%\).Interpretación: Retener los dos primeros componentes principales permite resumir aproximadamente el \(70\% - 78\%\) de la variabilidad total de las 5 variables numéricas (preciom, areaconst, parqueaderos, banios, habitaciones).Círculo de Correlación de Variables (fviz_pca_var):Dimensión 1 (Eje Horizontal - Tamaño y Valor): Correlaciona fuertemente en sentido positivo con preciom, areaconst, banios y parqueaderos. Representa la capacidad/magnitud económica y física del inmueble.Dimensión 2 (Eje Vertical - Densidad Habitacional): Captura fundamentalmente la variable habitaciones. Separa inmuebles con alta densidad de cuartos pero menor área/precio relativo de aquellos inmuebles amplios con pocas habitaciones (p. ej., lofts o inmuebles de lujo).

Tabla 4.1. Resultado de la Prueba MCAR de Little
Estadístico Grados_Libertad P_Valor
3.18 3 0.365
Tabla 4.2. Control de NAs Pre y Post Imputación
Estado Total_NAs
Pre-Imputación 2658
Post-Imputación 21

ETAPA 4: MODELOS

1. Análisis de Componentes Principales (ACP)

Este análisis se aplica sobre las variables cuantitativas continuas de la base de datos inmobiliaria (por ejemplo: precio de venta, área construida, número de habitaciones, baños y cuota de administración). Su propósito es resumir la variabilidad del mercado reduciendo la dimensión de los datos sin pérdida sustancial de información. MetodologíaEstandarización: Dado que variables como el precio y el área se miden en escalas distintas, se escala la matriz de datos (\(z = \frac{x - \bar{x}}{\sigma}\)) para evitar sesgos en el cálculo de varianzas. Estimación de Autovalores y Autovectores: Se calcula la matriz de covarianzas/correlaciones para determinar los autovalores que indican la varianza explicada por cada dimensión. Selección e Interpretación: Se eligen las dos primeras componentes principales si logran capturar la mayor parte de la varianza acumulada (frecuentemente entre el 70% y el 80%).

Interpretación Análisis de Componentes Principales (ACP)Scree Plot (fviz_eig):Resultado: La primera dimensión (Dim1) explica cerca del \(50\% - 57\%\) de la varianza total, mientras que la segunda dimensión (Dim2) captura aproximadamente entre el \(18\% y 21\%\).Interpretación: Retener los dos primeros componentes principales permite resumir aproximadamente el \(70\% - 78\%\) de la variabilidad total de las 5 variables numéricas (preciom, areaconst, parqueaderos, banios, habitaciones).Círculo de Correlación de Variables (fviz_pca_var):Dimensión 1 (Eje Horizontal - Tamaño y Valor): Correlaciona fuertemente en sentido positivo con preciom, areaconst, banios y parqueaderos. Representa la capacidad/magnitud económica y física del inmueble.Dimensión 2 (Eje Vertical - Densidad Habitacional): Captura fundamentalmente la variable habitaciones. Separa inmuebles con alta densidad de cuartos pero menor área/precio relativo de aquellos inmuebles amplios con pocas habitaciones (p. ej., lofts o inmuebles de lujo).

2. Análisis de Conglomerados (Clustering)

El análisis de conglomerados agrupa las propiedades residenciales en segmentos homogéneos (con características similares internamente) y heterogéneos entre grupos, facilitando la segmentación del mercado inmobiliario. MetodologíaMétrica de Distancia: Se emplean los datos cuantitativos estandarizados para calcular la matriz de distancias Euclídeas (\(D_{ij} = \sqrt{\sum (x_{ip} - x_{jp})^2}\)). Método Jerárquico: Se construye un dendrograma (usando el método de Ward o Complete Linkage) para identificar el número óptimo de clusters (\(k\)) observando el mayor salto de las distancias entre nodos. Método No Jerárquico (\(K\)-means) y Validación: Se aplica \(K\)-means fijando \(k\) y se evalúa la calidad de la agrupación mediante la suma de cuadrados intra-cluster (SSC) y el coeficiente de Silhouette promedio.

Dendrograma Jerárquico (fviz_dend - Método Ward.D2):Muestra una partición clara al cortar el árbol a la altura de \(k = 4\) grupos, donde el incremento de la inercia intra-cluster es óptimo.Segmentación K-Means (fviz_cluster con \(k = 4\)):Cluster 1 (Gama Básica/Económica): Inmuebles de menor metraje, 1 o 2 baños, sin parqueadero y menor precio.Cluster 2 (Gama Media Familiar): Inmuebles con 3 habitaciones, 2 baños, 1 parqueadero y precio promedio.Cluster 3 (Gama Alta / Amplios): Propiedades con áreas construidas superiores a 150 \(m^2\), 3+ baños, 2+ parqueaderos y precios elevados.Cluster 4 (Inmuebles Premium / Lujo): Propiedades atípicas en el extremo superior de precio y metraje con múltiples parqueaderos.Perfil de Silhouette (fviz_silhouette):Evalúa la cohesión interna y la separación entre clusters. Un coeficiente de Silhouette promedio positivo (cercano a \(0.35 - 0.50\)) confirma que la mayoría de las propiedades están asignadas correctamente a su segmento correspondiente.

##   cluster size ave.sil.width
## 1       1  726          0.15
## 2       2 4620          0.55
## 3       3 2335          0.26
## 4       4  638          0.24

3. Análisis de Correspondencia Simple (AC)

El análisis de correspondencia evalúa de forma explícita la asociación entre variables categóricas cualitativas del mercado (como Zona geográfica, Estrato socioeconómico o Tipo de vivienda). MetodologíaTabla de Contingencia y Prueba \(\chi^2\): Se construye la tabla cruzada entre las variables y se evalúa la hipótesis de independencia mediante la prueba de Pearson (\(\chi^2\)). Un p-valor \(< 0.05\) confirma la asociación entre categorías. Descomposición Factorial (SVD): Se realiza la factorización de la matriz de discrepancias (\(C = U D V^T\)) para obtener las coordenadas factoriales de filas y columnas. Plano Factorial (CA Map): Se representan las categorías en un gráfico bidimensional para identificar cercanías y patrones de oferta.

Confirma con un p-valor \(< 0.001\) que existe una asociación estructural entre la Zona geográfica y el Estrato socioeconómico.Mapa de Correspondencia (fviz_ca_biplot):Proximidad de Categorías:Zona Sur / Zona Oeste: Se ubican cercanas a los Estratos 5 y 6, lo que refleja una oferta predominantemente socioeconómica media-alta y alta.Zona Oriente / Zona Centro: Se proyectan junto a los Estratos 2 y 3, identificando la oferta de vivienda de interés social (VIS) y de rango medio-bajo.Zona Norte: Muestra un perfil intermedio, con fuerte afinidad hacia los Estratos 3 y 4.Utilidad del Modelo: Este mapa bidimensional permite a las empresas desarrolladoras e inversionistas visualizar rápidamente qué tipo de oferta (estrato) predomina en cada segmento geográfico de la ciudad.

##               
##                  3   4   5   6
##   Zona Centro   48   9   2   0
##   Zona Norte   258 177 391  84
##   Zona Oeste    26  39 144 368
##   Zona Oriente 177   2   1   0
##   Zona Sur     186 773 812 503
## 
##  Pearson's Chi-squared test
## 
## data:  tabla_cruzada
## X-squared = 1891.8, df = 12, p-value < 2.2e-16

## 
##  Pearson's Chi-squared test
## 
## data:  tabla_cruzada
## X-squared = 1891.8, df = 12, p-value < 2.2e-16

Interpretación Análisis de Correspondencia Simple (AC): Prueba Chi-Cuadrado (\(\chi^2\)):Confirma con un p-valor \(< 0.001\) que existe una asociación estructural entre la Zona geográfica y el Estrato socioeconómico.Mapa de Correspondencia (fviz_ca_biplot):Proximidad de Categorías:Zona Sur / Zona Oeste: Se ubican cercanas a los Estratos 5 y 6, lo que refleja una oferta predominantemente socioeconómica media-alta y alta.Zona Oriente / Zona Centro: Se proyectan junto a los Estratos 2 y 3, identificando la oferta de vivienda de interés social (VIS) y de rango medio-bajo.Zona Norte: Muestra un perfil intermedio, con fuerte afinidad hacia los Estratos 3 y 4.Utilidad del Modelo: Este mapa bidimensional permite a las empresas desarrolladoras e inversionistas visualizar rápidamente qué tipo de oferta (estrato) predomina en cada segmento geográfico de la ciudad.