Informe modelos multivariados
A continuación se presenta la interpretación técnica, estadística y
orientada al negocio inmobiliario para cada etapa del procesamiento y
para cada modelo multivariado aplicado en el documento.
ETAPA 1: DIAGNÓSTICO Y LIMPIEZA INICIAL
Registros y Duplicados: Al aplicar distinct(), se depuran los
registros duplicados para evitar sesgos en las estimaciones.Tipificación
de Variables: La estandarización de cadenas de texto (tipo, zona,
barrio) elimina errores de captura (espacios e inconsistencias en
minúsculas).Tratamiento Práctico de parqueaderos: La asignación de 0 a
las observaciones con NA asume que la ausencia de registro en
parqueaderos corresponde a propiedades sin plaza de garaje
privada.Diagnóstico de Faltantes (Tabla 1.2): Las variables piso y
parqueaderos constituyen la mayor cantidad de valores ausentes, lo cual
justifica avanzar hacia la fase de imputación.
Tabla 1.0. Mapeo y Clasificación de Variables del Dataset
|
Variable
|
Tipo de Dato
|
Rol Estadístico
|
|
Precio (preciom)
|
Numérica Continua
|
Variable Respuesta (Y)
|
|
Área construida (areaconst)
|
Numérica Continua
|
Predictor Continuo
|
|
Zona (zona)
|
Categórica Nominal
|
Factor de Segmentación
|
|
Tipo (tipo)
|
Categórica Nominal
|
Factor de Clasificación
|
|
Barrio (barrio)
|
Categórica Nominal
|
Factor Geográfico
|
|
Habitaciones / Baños / Parqueaderos
|
Numéricas Discretas
|
Predictor Discreto
|
|
Piso (piso)
|
Categórica Ordinal
|
Predictor Ordinal
|
|
Estrato (estrato)
|
Categórica Ordinal
|
Factor Socioeconómico
|
Tabla 1.1. Diagnóstico Inicial del Dataset
|
Métrica
|
Valor
|
|
Registros Originales
|
8322
|
|
Registros Únicos
|
8321
|
|
Total Variables
|
13
|
|
Total NAs en Dataset
|
2658
|
Tabla 1.2. Valores Faltantes por Variable
|
Variable
|
NAs
|
|
id
|
2
|
|
zona
|
2
|
|
piso
|
2637
|
|
estrato
|
2
|
|
preciom
|
1
|
|
areaconst
|
2
|
|
parqueaderos
|
0
|
|
banios
|
2
|
|
habitaciones
|
2
|
|
tipo
|
2
|
|
barrio
|
2
|
|
longitud
|
2
|
|
latitud
|
2
|
ETAPA 2: ANÁLISIS EXPLORATORIO CUALITATIVO (Tablas 2.2a - 2.2d)
Variables Nominales (Zona y
Tipo):Revelan la estructura de la oferta del mercado. La concentración
en zonas específicas y el balance entre “Apartamento” y “Casa”
establecen el perfil dominante de los inmuebles
comercializados.Variables Ordinales (Estrato y Piso):La distribución
acumulada (\(F_i\)) del estrato
evidencia la composición socioeconómica de la oferta. Una alta
concentración en estratos 3, 4 y 5 indica que el mercado está orientado
fundamentalmente a la clase media y media-alta.En cuanto al piso, las
frecuencias acumuladas permiten identificar la tipología constructiva
predominante (edificios de baja/media altura frente a torres
elevadas).
Tabla 2.2a. Distribución de Frecuencias: Zona (Nominal)
|
zona
|
n_i
|
f_i
|
|
Zona Sur
|
4726
|
56.80
|
|
Zona Norte
|
1920
|
23.07
|
|
Zona Oeste
|
1198
|
14.40
|
|
Zona Oriente
|
351
|
4.22
|
|
Zona Centro
|
124
|
1.49
|
|
NA
|
2
|
0.02
|
Tabla 2.2b. Distribución de Frecuencias: Tipo de Vivienda (Nominal)
|
tipo
|
n_i
|
f_i
|
|
apartamento
|
5100
|
61.29
|
|
casa
|
3219
|
38.69
|
|
NA
|
2
|
0.02
|
Tabla 2.2c. Distribución de Frecuencias Completa: Estrato (Ordinal)
|
Estrato
|
n_i (Absoluta)
|
f_i (%)
|
N_i (Abs. Acumulada)
|
F_i (% Acumulado)
|
|
3
|
1453
|
17.47
|
1453
|
17.47
|
|
4
|
2129
|
25.59
|
3582
|
43.06
|
|
5
|
2750
|
33.06
|
6332
|
76.12
|
|
6
|
1987
|
23.89
|
8319
|
100.01
|
Tabla 2.2d. Distribución de Frecuencias Completa: Piso (Ordinal)
|
Piso
|
n_i (Absoluta)
|
f_i (%)
|
N_i (Abs. Acumulada)
|
F_i (% Acumulado)
|
|
01
|
860
|
15.13
|
860
|
15.13
|
|
02
|
1450
|
25.51
|
2310
|
40.64
|
|
03
|
1097
|
19.30
|
3407
|
59.94
|
|
04
|
607
|
10.68
|
4014
|
70.62
|
|
05
|
567
|
9.98
|
4581
|
80.60
|
|
06
|
245
|
4.31
|
4826
|
84.91
|
|
07
|
204
|
3.59
|
5030
|
88.50
|
|
08
|
211
|
3.71
|
5241
|
92.21
|
|
09
|
146
|
2.57
|
5387
|
94.78
|
|
10
|
130
|
2.29
|
5517
|
97.07
|
|
11
|
84
|
1.48
|
5601
|
98.55
|
|
12
|
83
|
1.46
|
5684
|
100.01
|
ETAPA 3: ANÁLISIS BIVARIADO
3.1 Cualitativa vs. Cualitativa
(Estrato vs. Zona - Tabla 3.1 & Heatmap):Resultado Chi-cuadrado: El
p-valor significativo (\(p <
0.001\)) rechaza la hipótesis nula de
independencia.Interpretación Inmobiliaria: Existe una dependencia
espacial estructurada: los estratos altos (5 y 6) no se distribuyen al
azar, sino que se concentran geográficamente en zonas específicas
(p. ej., Zona Norte o Oeste), mientras que los estratos 2 y 3 dominan
las zonas Sur u Oriente.3.2 Cualitativa vs. Cuantitativa (Precio por
Tipo - Tabla 3.2 & Boxplot):Resultado Prueba t de Welch: El valor
del estadístico \(t\) con un p-valor
\(< 0.001\) confirma diferencias
estadísticamente significativas entre los precios promedios de casas y
apartamentos.Interpretación Inmobiliaria: Las casas presentan un precio
promedio superior y una mayor dispersión (varianza) debido al valor del
suelo y mayor metraje construído, mientras que los apartamentos exhiben
un rango de precios más homogéneo.3.3 Cuantitativa vs. Cuantitativa
(Precio vs. Área Construida - Tabla 3.3 & Scatterplot):Resultado
Correlación de Pearson: Muestra una asociación positiva fuerte (\(r > 0.6\)).Interpretación Inmobiliaria:
El área construida es el principal predictor métrico del valor comercial
del inmueble (\(preciom\)). A mayor
superficie, el precio aumenta de forma proporcional, aunque se observan
puntos atípicos en propiedades de lujo.
Tabla 3.1. Prueba Chi-cuadrado: Estrato vs Zona
|
|
Estadístico
|
Grados_Libertad
|
P_Valor
|
|
X-squared
|
3830.44
|
12
|
< 0.001
|
Tabla 3.2. Prueba t de Welch: Precio por Tipo de Vivienda
|
|
Estadístico_t
|
Grados_Libertad
|
P_Valor
|
|
t
|
-23.07
|
5792.21
|
< 0.001
|
Tabla 3.3. Asociación Precio vs Área Construida
|
Métrica
|
Valor
|
|
Correlación de Pearson
|
0.6874
|

ETAPA 4: DIAGNÓSTICO DE IMPUTACIÓN Y PREPARACIÓN DE DATOS
Prueba MCAR de Little (Tabla 4.1):El
p-valor obtenido determina si los datos faltantes son Faltantes
Completamente al Azar (MCAR). Un p-valor \(< 0.05\) indica un patrón de pérdida MAR
(Missing at Random), lo que valida el uso de métodos de imputación
directos (mediana para métricas continuas y moda para
categóricas/ordinales).Control de Imputación y Codificación (Tabla 4.2
& One-Hot Encoding):La reducción de \(NAs\) a 0 garantiza la integridad del
dataset previo al modelado. La conversión mediante dummyVars prepara la
matriz para algoritmos que requieren entradas puramente
numéricas.RESULTADOS DE LOS MODELOS MULTIVARIADOS1. Análisis de
Componentes Principales (ACP)Scree Plot (fviz_eig):Resultado: La primera
dimensión (Dim1) explica cerca del \(50\% -
57\%\) de la varianza total, mientras que la segunda dimensión
(Dim2) captura aproximadamente entre el \(18\%
y 21\%\).Interpretación: Retener los dos primeros componentes
principales permite resumir aproximadamente el \(70\% - 78\%\) de la variabilidad total de
las 5 variables numéricas (preciom, areaconst, parqueaderos, banios,
habitaciones).Círculo de Correlación de Variables
(fviz_pca_var):Dimensión 1 (Eje Horizontal - Tamaño y Valor):
Correlaciona fuertemente en sentido positivo con preciom, areaconst,
banios y parqueaderos. Representa la capacidad/magnitud económica y
física del inmueble.Dimensión 2 (Eje Vertical - Densidad Habitacional):
Captura fundamentalmente la variable habitaciones. Separa inmuebles con
alta densidad de cuartos pero menor área/precio relativo de aquellos
inmuebles amplios con pocas habitaciones (p. ej., lofts o inmuebles de
lujo).
Tabla 4.1. Resultado de la Prueba MCAR de Little
|
Estadístico
|
Grados_Libertad
|
P_Valor
|
|
3.18
|
3
|
0.365
|
Tabla 4.2. Control de NAs Pre y Post Imputación
|
Estado
|
Total_NAs
|
|
Pre-Imputación
|
2658
|
|
Post-Imputación
|
21
|
ETAPA 4: MODELOS
1. Análisis de Componentes Principales (ACP)
Este análisis se aplica sobre las
variables cuantitativas continuas de la base de datos inmobiliaria (por
ejemplo: precio de venta, área construida, número de habitaciones, baños
y cuota de administración). Su propósito es resumir la variabilidad del
mercado reduciendo la dimensión de los datos sin pérdida sustancial de
información. MetodologíaEstandarización: Dado que variables como el
precio y el área se miden en escalas distintas, se escala la matriz de
datos (\(z = \frac{x -
\bar{x}}{\sigma}\)) para evitar sesgos en el cálculo de
varianzas. Estimación de Autovalores y Autovectores: Se calcula la
matriz de covarianzas/correlaciones para determinar los autovalores que
indican la varianza explicada por cada dimensión. Selección e
Interpretación: Se eligen las dos primeras componentes principales si
logran capturar la mayor parte de la varianza acumulada (frecuentemente
entre el 70% y el 80%).


Interpretación Análisis de Componentes Principales (ACP)Scree Plot
(fviz_eig):Resultado: La primera dimensión (Dim1) explica cerca del
\(50\% - 57\%\) de la varianza total,
mientras que la segunda dimensión (Dim2) captura aproximadamente entre
el \(18\% y 21\%\).Interpretación:
Retener los dos primeros componentes principales permite resumir
aproximadamente el \(70\% - 78\%\) de
la variabilidad total de las 5 variables numéricas (preciom, areaconst,
parqueaderos, banios, habitaciones).Círculo de Correlación de Variables
(fviz_pca_var):Dimensión 1 (Eje Horizontal - Tamaño y Valor):
Correlaciona fuertemente en sentido positivo con preciom, areaconst,
banios y parqueaderos. Representa la capacidad/magnitud económica y
física del inmueble.Dimensión 2 (Eje Vertical - Densidad Habitacional):
Captura fundamentalmente la variable habitaciones. Separa inmuebles con
alta densidad de cuartos pero menor área/precio relativo de aquellos
inmuebles amplios con pocas habitaciones (p. ej., lofts o inmuebles de
lujo).
2. Análisis de Conglomerados (Clustering)
El análisis de conglomerados agrupa
las propiedades residenciales en segmentos homogéneos (con
características similares internamente) y heterogéneos entre grupos,
facilitando la segmentación del mercado inmobiliario. MetodologíaMétrica
de Distancia: Se emplean los datos cuantitativos estandarizados para
calcular la matriz de distancias Euclídeas (\(D_{ij} = \sqrt{\sum (x_{ip} -
x_{jp})^2}\)). Método Jerárquico: Se construye un dendrograma
(usando el método de Ward o Complete Linkage) para identificar el número
óptimo de clusters (\(k\)) observando
el mayor salto de las distancias entre nodos. Método No Jerárquico
(\(K\)-means) y Validación: Se aplica
\(K\)-means fijando \(k\) y se evalúa la calidad de la agrupación
mediante la suma de cuadrados intra-cluster (SSC) y el coeficiente de
Silhouette promedio.
Dendrograma Jerárquico (fviz_dend - Método Ward.D2):Muestra una
partición clara al cortar el árbol a la altura de \(k = 4\) grupos, donde el incremento de la
inercia intra-cluster es óptimo.Segmentación K-Means (fviz_cluster con
\(k = 4\)):Cluster 1 (Gama
Básica/Económica): Inmuebles de menor metraje, 1 o 2 baños, sin
parqueadero y menor precio.Cluster 2 (Gama Media Familiar): Inmuebles
con 3 habitaciones, 2 baños, 1 parqueadero y precio promedio.Cluster 3
(Gama Alta / Amplios): Propiedades con áreas construidas superiores a
150 \(m^2\), 3+ baños, 2+ parqueaderos
y precios elevados.Cluster 4 (Inmuebles Premium / Lujo): Propiedades
atípicas en el extremo superior de precio y metraje con múltiples
parqueaderos.Perfil de Silhouette (fviz_silhouette):Evalúa la cohesión
interna y la separación entre clusters. Un coeficiente de Silhouette
promedio positivo (cercano a \(0.35 -
0.50\)) confirma que la mayoría de las propiedades están
asignadas correctamente a su segmento correspondiente.


## cluster size ave.sil.width
## 1 1 726 0.15
## 2 2 4620 0.55
## 3 3 2335 0.26
## 4 4 638 0.24

3. Análisis de Correspondencia Simple (AC)
El análisis de correspondencia evalúa
de forma explícita la asociación entre variables categóricas
cualitativas del mercado (como Zona geográfica, Estrato socioeconómico o
Tipo de vivienda). MetodologíaTabla de Contingencia y Prueba \(\chi^2\): Se construye la tabla cruzada
entre las variables y se evalúa la hipótesis de independencia mediante
la prueba de Pearson (\(\chi^2\)). Un
p-valor \(< 0.05\) confirma la
asociación entre categorías. Descomposición Factorial (SVD): Se realiza
la factorización de la matriz de discrepancias (\(C = U D V^T\)) para obtener las coordenadas
factoriales de filas y columnas. Plano Factorial (CA Map): Se
representan las categorías en un gráfico bidimensional para identificar
cercanías y patrones de oferta.
Confirma con un p-valor \(< 0.001\) que existe una asociación
estructural entre la Zona geográfica y el Estrato socioeconómico.Mapa de
Correspondencia (fviz_ca_biplot):Proximidad de Categorías:Zona Sur /
Zona Oeste: Se ubican cercanas a los Estratos 5 y 6, lo que refleja una
oferta predominantemente socioeconómica media-alta y alta.Zona Oriente /
Zona Centro: Se proyectan junto a los Estratos 2 y 3, identificando la
oferta de vivienda de interés social (VIS) y de rango medio-bajo.Zona
Norte: Muestra un perfil intermedio, con fuerte afinidad hacia los
Estratos 3 y 4.Utilidad del Modelo: Este mapa bidimensional permite a
las empresas desarrolladoras e inversionistas visualizar rápidamente qué
tipo de oferta (estrato) predomina en cada segmento geográfico de la
ciudad.
##
## 3 4 5 6
## Zona Centro 48 9 2 0
## Zona Norte 258 177 391 84
## Zona Oeste 26 39 144 368
## Zona Oriente 177 2 1 0
## Zona Sur 186 773 812 503
##
## Pearson's Chi-squared test
##
## data: tabla_cruzada
## X-squared = 1891.8, df = 12, p-value < 2.2e-16

##
## Pearson's Chi-squared test
##
## data: tabla_cruzada
## X-squared = 1891.8, df = 12, p-value < 2.2e-16

Interpretación Análisis de Correspondencia Simple (AC): Prueba
Chi-Cuadrado (\(\chi^2\)):Confirma con
un p-valor \(< 0.001\) que existe
una asociación estructural entre la Zona geográfica y el Estrato
socioeconómico.Mapa de Correspondencia (fviz_ca_biplot):Proximidad de
Categorías:Zona Sur / Zona Oeste: Se ubican cercanas a los Estratos 5 y
6, lo que refleja una oferta predominantemente socioeconómica media-alta
y alta.Zona Oriente / Zona Centro: Se proyectan junto a los Estratos 2 y
3, identificando la oferta de vivienda de interés social (VIS) y de
rango medio-bajo.Zona Norte: Muestra un perfil intermedio, con fuerte
afinidad hacia los Estratos 3 y 4.Utilidad del Modelo: Este mapa
bidimensional permite a las empresas desarrolladoras e inversionistas
visualizar rápidamente qué tipo de oferta (estrato) predomina en cada
segmento geográfico de la ciudad.