Decisión inmobiliaria basada en evidencia

El análisis combina exploración interactiva, regresión lineal múltiple, diagnóstico de supuestos, validación predictiva y un ranking multicriterio de ofertas reales.

1 Resumen ejecutivo

La compañía internacional solicita la búsqueda de dos inmuebles con características y presupuestos diferentes. Para evaluar cada solicitud se analizaron las ofertas inmobiliarias registradas durante los últimos tres meses, identificando 722 casas en la Zona Norte y 2.787 apartamentos en la Zona Sur, mercados de referencia para la Vivienda 1 y la Vivienda 2, respectivamente.

El análisis se desarrolló en dos etapas complementarias. Primero, se estimó mediante regresión lineal múltiple el precio esperado de cada vivienda a partir del área construida, estrato, número de habitaciones, parqueaderos y baños. Posteriormente, las estimaciones se contrastaron con la oferta inmobiliaria efectivamente observada, aplicando las condiciones de ubicación, tipo de inmueble, características requeridas y presupuesto máximo disponible.

Casas · Zona Norte
664
Apartamentos · Zona Sur
2848
Presupuesto vivienda 1
$350 M
Presupuesto vivienda 2
$850 M
Síntesis ejecutiva de las dos solicitudes
Solicitud Perfil Presupuesto Ofertas priorizadas Predicción central mínima Predicción central máxima
Vivienda 1 Casa · Norte · 200 m² · estrato 4/5 · 1 parqueadero · 2 baños · 4 habitaciones $350 millones 5 $315,2 M $391 M
Vivienda 2 Apartamento · Sur · 300 m² · estrato 5/6 · 3 parqueaderos · 3 baños · 5 habitaciones $850 millones 5 $693,3 M $753,3 M

Lectura de la tabla. Las ofertas priorizadas corresponden a las 5 alternativas de mercado más cercanas a cada solicitud, considerando características y presupuesto. La predicción central mínima y máxima representan el menor y mayor precio estimado por el modelo según los estratos permitidos: 4–5 para la Vivienda 1 y 5–6 para la Vivienda 2.

Nota: Estos valores no corresponden a intervalos de predicción, sino a predicciones puntuales para los diferentes estratos considerados.

2 Datos, trazabilidad y calidad

2.1 Limpieza previa y control de calidad

Antes de segmentar y modelar la información se aplicó una limpieza conservadora. Primero se estandarizaron los tipos de las variables y los campos de texto; después se eliminaron únicamente los registros completamente duplicados y se revisaron valores físicamente imposibles. Los valores extremos plausibles se conservaron, ya que en el mercado inmobiliario un precio o un área elevada no constituye por sí sola un error.

Trazabilidad de la limpieza inicial
Control Resultado
Registros originales 8322
Duplicados exactos eliminados 1
Precio <= 0 0
Área construida <= 0 0
Estrato fuera de 1–6 0
Parqueaderos negativos 0
Baños negativos 0
Habitaciones negativas 0
Registros después de limpieza estructural 8321

Criterio estadístico. No se aplica complete.cases() a toda la base porque ello eliminaría automáticamente todos los registros con parqueaderos faltantes. Tampoco se reemplazan los NA por constantes arbitrarias como 0, 2 o 3. Cada tipo de faltante se trata según su magnitud y función dentro del análisis.

2.2 Estructura de la base

La base presenta una alta completitud de la información, con porcentajes de datos faltantes muy bajos en la mayoría de las variables, entre 0,02 % y 0,04 %. La principal excepción corresponde a parqueaderos, con 19,29 % de valores faltantes, lo cual debe considerarse porque puede reducir el número efectivo de observaciones utilizadas en los modelos.

2.2.1 Tratamiento de datos faltantes

La variable parqueaderos concentra la mayor proporción de datos faltantes (19,29 %). Eliminar todos estos registros reduciría de forma importante la muestra disponible y podría introducir sesgo si la ausencia no es completamente aleatoria. Por esta razón, se emplea imputación múltiple mediante Predictive Mean Matching (PMM). La imputación utiliza área construida, estrato, habitaciones y baños como variables auxiliares para identificar inmuebles comparables. El precio no se utiliza para completar parqueaderos, evitando que la variable respuesta intervenga directamente en la construcción del predictor faltante.

PMM asigna a cada valor faltante un número de parqueaderos realmente observado en inmuebles con perfiles estadísticamente similares, evitando generar valores imposibles o fraccionarios. Se generan 5 bases imputadas para representar la incertidumbre asociada al proceso. Para preciom, areaconst, estrato, habitaciones y banios, cuyos faltantes son mínimos, se utilizan casos completos. En particular, el precio no se imputa, porque corresponde a la variable respuesta del modelo.

Tratamiento de datos faltantes para la modelación
Solicitud Base segmentada NA originales en parqueaderos Parqueaderos imputados Casos usados en modelación
Vivienda 1 664 233 233 664
Vivienda 2 2848 464 464 2848

Criterio aplicado. La imputación se utiliza únicamente para la modelación estadística. La base original se conserva sin modificaciones para el análisis exploratorio, los mapas y la selección comercial de ofertas. De esta forma se mantiene la trazabilidad entre datos observados e imputados.

2.2.1.1 Verificación posterior al tratamiento

Una vez imputados los valores faltantes de parqueaderos y excluidos los pocos registros incompletos de las demás variables del modelo, se verifica que las bases utilizadas para la modelación no contengan datos faltantes.

Verificación de datos faltantes después del tratamiento
Solicitud Registros finales Valores faltantes
Vivienda 1 664 0
Vivienda 2 2848 0
## Después del tratamiento, las bases destinadas a la modelación presentan **0 valores faltantes** en las variables incluidas en la regresión. En la Vivienda 1 se excluyeron **0** registro(s) por faltantes en variables diferentes a parqueaderos y en la Vivienda 2 se excluyeron **0** registro(s). Los faltantes de `parqueaderos` no fueron eliminados, sino imputados mediante PMM.

La oferta inmobiliaria presenta una marcada concentración en las zonas Sur y Norte, siendo la Zona Sur la de mayor número de inmuebles disponibles. En ambas zonas predominan los apartamentos sobre las casas. En contraste, las zonas Centro, Oeste y Oriente registran una oferta considerablemente menor. Para el análisis de las solicitudes, se observa una disponibilidad relevante de casas en la Zona Norte y una oferta especialmente amplia de apartamentos en la Zona Sur, lo que proporciona una base suficiente de alternativas para evaluar ambos requerimientos.

2.3 Reclasificación espacial de la zona mediante KNN

La revisión de la georreferenciación muestra que la variable zona puede contener registros que no siguen el patrón espacial predominante de su categoría. Dado que el objetivo es identificar hacia qué zona tiende geográficamente cada inmueble, se utiliza un K-Nearest Neighbors (KNN) espacial sobre longitud y latitud.

Se prefiere KNN frente a un método de conglomerados como K-means porque aquí ya existe una clasificación de referencia (zona) y el problema es, por tanto, supervisado. Un algoritmo de clustering encontraría grupos geométricos, pero no garantiza que esos conglomerados correspondan directamente con Norte, Sur, Oeste, Oriente o Centro. KNN, en cambio, permite estimar la zona de un inmueble a partir de la clasificación predominante entre sus vecinos geográficos más cercanos.

Criterio estadístico. Las coordenadas se estandarizan antes de calcular distancias. El número de vecinos no se fija arbitrariamente: se evalúan varios valores de k y se selecciona el que maximiza el accuracy balanceado, de manera que las zonas menos frecuentes también participen en la decisión. Para reducir reclasificaciones dudosas, una zona solo se modifica cuando el KNN discrepa de la etiqueta original y al menos el 70 % de los vecinos respaldan la nueva clasificación.

2.3.1 Comparación espacial antes y después de la reclasificación

Para evaluar el efecto de la depuración espacial se presentan dos mapas con la misma escala cromática por zona. El primero muestra la clasificación reportada originalmente en la base y el segundo la clasificación utilizada para el análisis después de aplicar KNN. De esta forma es posible identificar visualmente qué tan concentradas quedan las zonas y dónde se producen cambios de clasificación.

Mapa antes. Representa la clasificación de zona tal como aparece en la fuente original. Los puntos aislados dentro de conglomerados dominados por otra zona son candidatos a revisión espacial.

Impacto de la reclasificación espacial
Registros con coordenadas válidas Registros reclasificados % reclasificado
8319 473 5.69

Interpretación. El mapa posterior permite evaluar si la clasificación espacial queda más coherente con los conglomerados geográficos observados. Los cambios no se realizan por inspección visual: se aplican únicamente cuando el KNN identifica una zona alternativa con el nivel mínimo de consenso definido. La comparación antes–después permite documentar el impacto de la reclasificación sin perder la trazabilidad de la zona reportada originalmente.

Selección del número de vecinos para la reclasificación espacial
k Accuracy Accuracy balanceado Seleccionado
5 85.9% 72.0%
7 86.0% 72.9%
9 86.1% 73.0%
11 86.4% 72.7%
15 86.4% 72.8%
21 86.3% 72.6%
31 86.3% 70.8%
Resultado de la depuración espacial de la variable zona
Indicador Resultado
k seleccionado 9
Registros con coordenadas y zona original 8.319
Registros reclasificados con alta confianza 473
Porcentaje reclasificado 5.7%
Confianza mínima exigida 70 %
Cambios de zona sugeridos por consenso espacial KNN
Zona original Zona reclasificada Registros
Zona Norte Zona Sur 170
Zona Sur Zona Norte 56
Zona Oeste Zona Norte 44
Zona Oeste Zona Sur 40
Zona Sur Zona Oeste 37
Zona Norte Zona Oeste 29
Zona Oriente Zona Sur 24
Zona Norte Zona Oriente 22
Zona Sur Zona Oriente 16
Zona Oriente Zona Norte 9
Zona Centro Zona Sur 8
Zona Centro Zona Norte 5
Zona Sur Zona Centro 5
Zona Oeste Zona Oriente 3
Zona Centro Zona Oriente 2
Zona Centro Zona Oeste 1
Zona Oriente Zona Centro 1
Zona Oriente Zona Oeste 1

Interpretación. El procedimiento no reemplaza indiscriminadamente la clasificación original. La zona se modifica únicamente cuando existe un patrón local suficientemente consistente entre los vecinos más próximos. Esto permite corregir observaciones espacialmente discordantes y, al mismo tiempo, conservar los casos cercanos a fronteras entre zonas cuando la evidencia geográfica no es concluyente. La variable utilizada en los análisis posteriores es zona_analisis, mientras zona_original se conserva para garantizar trazabilidad.

La base disponible contiene longitud y latitud, pero no una variable de altitud geográfica. Por esta razón, la reclasificación utiliza las dos coordenadas espaciales disponibles. Variables como piso, precio, estrato o área no se incorporan al KNN de zona, porque describen el inmueble y podrían introducir una clasificación circular o comercial en una variable que debe representar ubicación geográfica.

2.3.2 Mapa de zonas después de la reclasificación

2.3.3 Efecto de la reclasificación sobre las bases del ejercicio

Efecto de la reclasificación espacial sobre las submuestras
Solicitud Registros antes Registros después Diferencia
Vivienda 1 722 664 -58
Vivienda 2 2787 2848 61

Interpretación. Después de la reclasificación espacial, la base de la Vivienda 1 pasa de 722 a 664 casas en Zona Norte (-58 registros), mientras que la base de la Vivienda 2 pasa de 2787 a 2848 apartamentos en Zona Sur (+61 registros). A partir de este punto, todo el análisis utiliza la zona depurada mediante KNN, conservando zona_original para trazabilidad.

3 Solicitud 1 · Casa en Zona Norte

3.1 Conformación de Base 1

Para la Solicitud 1 se identificaron 722 casas en la Zona Norte. El mapa muestra una alta concentración de inmuebles al norte de Cali, aunque se observan algunos registros dispersos en otras áreas. Estos casos se mantienen con su clasificación original y se consideran posibles inconsistencias de ubicación para revisión.

Trazabilidad del filtro para la Vivienda 1
Etapa Registros
Base limpia 8321
Tipo = Casa 3219
Casa en Zona Norte 664
Primeros tres registros de Base 1
id zona barrio tipo preciom areaconst estrato parqueaderos banios habitaciones
1209 Zona Norte acopi Casa 320 150 5 2 4 6
1592 Zona Norte acopi Casa 780 380 5 2 3 3
504 Zona Norte acopi Casa 180 120 3 NA 3 3

3.2 EDA interactivo

El Análisis Exploratorio de Datos (EDA) permite identificar, antes de la modelación, el comportamiento de las variables y su relación con el precio, así como posibles patrones, dispersiones y valores atípicos. Los gráficos interactivos facilitan la exploración individual de los inmuebles y sus características.

En la Solicitud 1, el área construida presenta la mayor asociación con el precio (Pearson = 0,685; Spearman = 0,777), seguida por el estrato (0,528), los baños (0,509), los parqueaderos (0,412) y las habitaciones (0,365). En general, se observa que el precio tiende a aumentar con mejores características del inmueble, aunque existe dispersión y presencia de valores atípicos, lo que indica que su comportamiento responde a la combinación de múltiples factores.

Nota: La variable zona no se analiza dentro de esta submuestra, dado que la Base 1 fue previamente segmentada y todos los registros corresponden a la Zona Norte.

Dentro de la Base 1 la variable zona no presenta variabilidad, ya que todos los registros corresponden a Zona Norte. Por tanto, su efecto se controla previamente mediante la segmentación y no se incluye como predictor dentro de esta submuestra.

3.2.1 Precio y área

La pendiente visual permite evaluar si el mayor metraje se traduce en mayores precios. La dispersión vertical alrededor de la tendencia muestra cuánto valor adicional depende de atributos no recogidos por el área —por ejemplo, microlocalización, estado del inmueble, antigüedad, acabados o amenidades—.

3.2.2 Precio y estrato

3.2.3 Baños, habitaciones y parqueaderos

3.2.4 Correlaciones

Asociación bivariada con el precio · Base 1
Variable Pearson Spearman
areaconst 0.732 0.837
estrato 0.604 0.704
banios 0.564 0.638
parqueaderos 0.449 0.498
habitaciones 0.390 0.441

3.3 Modelo de regresión lineal múltiple

El modelo exigido por el enunciado es:

\[ Precio_i=\beta_0+\beta_1 Área_i+\beta_2 Estrato_i+\beta_3 Habitaciones_i+ \beta_4 Parqueaderos_i+\beta_5 Baños_i+\varepsilon_i \]

Inferencia principal. Debido a la imputación múltiple de parqueaderos, los coeficientes, errores estándar, intervalos de confianza y pruebas de significancia que se presentan a continuación se combinan sobre las cinco imputaciones mediante las reglas de Rubin. Para diagnósticos gráficos, ajuste global y predicciones se utiliza una de las bases completas generadas por PMM como base representativa, manteniendo la misma especificación exigida por el ejercicio.

Estimación combinada del modelo · Vivienda 1
Variable Coeficiente Error estándar t p-valor IC 95% inferior IC 95% superior Significativo
(Intercept) -227.243 31.477 -7.219 < 0,001 -289.102 -165.384
areaconst 0.759 0.048 15.973 < 0,001 0.665 0.852
estrato 76.508 7.873 9.718 < 0,001 61.019 91.997
habitaciones 4.395 4.447 0.988 0,323 -4.338 13.128 No
parqueaderos 19.887 6.146 3.236 0,003 7.270 32.504
banios 23.573 5.995 3.932 < 0,001 11.795 35.352
  • área construida: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $0,76 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • estrato: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $76,51 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • número de habitaciones: el coeficiente estimado es $4,4 M, pero no existe evidencia suficiente para afirmar un efecto lineal independiente al 5% (p = 0,323). Su signo no debe interpretarse causalmente.
  • número de parqueaderos: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $19,89 M en el precio. El efecto es estadísticamente significativo (p 0,003).
  • número de baños: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $23,57 M en el precio. El efecto es estadísticamente significativo (p < 0,001).

Interpretación correcta. Los coeficientes describen asociaciones condicionadas a las demás variables del modelo. No prueban causalidad y tampoco representan automáticamente “el valor real” de una característica aislada.

3.4 Ajuste global

Indicadores de ajuste · Modelo Vivienda 1
Métrica Valor
0.6529
R² ajustado 0.6502
RMSE residual 156.11
Estadístico F 247.49
p-valor global < 0,001

Interpretación. El modelo presenta una capacidad explicativa moderada-alta: las variables incluidas explican aproximadamente el 65,87 % de la variabilidad observada en el precio de las casas de la Zona Norte. El \(R^2\) ajustado (65,63 %) es muy cercano al \(R^2\), lo que indica que el poder explicativo se mantiene aun considerando el número de predictores incluidos.

Adicionalmente, el modelo es globalmente significativo (\(F = 276,4\); \(p < 0,001\)), por lo que existe evidencia estadística de que las variables consideradas, en conjunto, aportan a la explicación del precio.

El RMSE residual de $157,32 millones evidencia, sin embargo, una variabilidad importante entre los precios observados y los estimados. Por esta razón, las predicciones individuales deben interpretarse junto con sus intervalos de predicción. Parte de esta variación puede estar asociada a características no disponibles en la base, como microlocalización, antigüedad, estado del inmueble, acabados o amenidades.

3.5 Validación de supuestos

Interpretación. La evaluación de supuestos muestra que el modelo presenta heterocedasticidad (Breusch-Pagan, \(p < 0,001\)), lo cual también se evidencia en el gráfico de residuos, donde la dispersión aumenta para valores ajustados más altos. Asimismo, se rechaza la normalidad de los residuos (Shapiro-Wilk, \(p < 0,001\)); el gráfico Q-Q confirma desviaciones principalmente en las colas, asociadas a observaciones con errores extremos.

En contraste, no se identifican problemas importantes de multicolinealidad, dado que el VIF máximo es de 1,91, lo que indica que los predictores aportan información suficientemente diferenciada. El análisis de la distancia de Cook muestra además algunas observaciones potencialmente influyentes, por lo que estos casos deben ser revisados, pero no eliminados automáticamente sin evidencia de que correspondan a errores de registro.

En conjunto, los resultados indican que el modelo conserva utilidad para explicar y estimar el precio de los inmuebles, pero la heterocedasticidad, la falta de normalidad en las colas y la presencia de observaciones influyentes requieren cautela en la inferencia. Por esta razón, se complementa el análisis con errores estándar robustos HC3 y las predicciones se interpretan mediante intervalos de predicción, evitando depender únicamente de la estimación puntual.

3.5.1 Pruebas formales

Diagnóstico de supuestos · Vivienda 1
Supuesto Evidencia Lectura
Homoscedasticidad Breusch-Pagan: p < 0,001 Hay evidencia de heterocedasticidad.
Normalidad de residuos Shapiro-Wilk: p < 0,001 La normalidad estricta se rechaza; revisar Q-Q y tamaño muestral.
Multicolinealidad VIF máximo = 2.08 No se observa colinealidad severa.

3.5.2 Residuos vs. ajustados

3.5.3 Q-Q plot

3.5.4 Observaciones influyentes

Si aparecen problemas de heterocedasticidad o normalidad, el enunciado no exige corregirlos. Las alternativas metodológicas recomendables son: errores estándar robustos HC3, transformación logarítmica del precio, modelación no lineal o incorporación de variables omitidas relevantes.

3.6 Comparación de especificaciones

Interpretación. La validación cruzada muestra un desempeño similar entre los modelos M1 y M2, aunque M2, que trata el estrato como variable categórica, presenta el mejor desempeño predictivo, con menor RMSE (157,884), menor MAE (98,009) y mayor \(R^2\) predictivo (0,653). Frente al modelo oficial M1, la mejora es moderada, lo que sugiere que permitir un efecto no lineal entre los niveles de estrato aporta cierta capacidad predictiva, pero no modifica sustancialmente los resultados.

Por su parte, M3 presenta el desempeño más bajo (\(R^2\) predictivo = 0,530), por lo que la transformación logarítmica del precio no mejora la predicción en este caso, aun cuando podría contribuir al tratamiento de algunos problemas de los residuos.

En consecuencia, se mantiene M1 como modelo principal, dado que corresponde a la especificación requerida en la actividad y conserva un desempeño competitivo. No obstante, M2 se identifica como una alternativa de especificación ligeramente superior si el objetivo fuera priorizar exclusivamente la capacidad predictiva.

Validación cruzada de 10 particiones · Base 1
Modelo RMSE CV MAE CV R² predictivo CV
M2 · RLM con estrato categórico 158.903 95.368 0.637
M1 · RLM exigido 160.229 97.309 0.631
M3 · Log-precio + estrato categórico 186.935 103.710 0.498

M1 es el modelo requerido por la actividad. M2 evalúa si tratar el estrato como categoría mejora el desempeño. M3 explora una transformación logarítmica del precio, especialmente útil cuando hay asimetría y heterocedasticidad. Esta comparación es un análisis de sensibilidad; no reemplaza la interpretación solicitada del RLM oficial.

3.7 Predicción para la Vivienda 1

Interpretación. Para una vivienda con las características solicitadas, el modelo estima un precio de $319,4 M en estrato 4 y de $399,9 M en estrato 5. Por tanto, el crédito disponible de $350 M sería suficiente para el escenario de estrato 4, con una holgura aproximada de $30,6 M, mientras que para estrato 5 se requerirían cerca de $49,9 M adicionales.

Los intervalos de predicción son amplios, lo que refleja una alta variabilidad en los precios individuales del mercado. En consecuencia, estas estimaciones deben utilizarse como referencia para orientar la búsqueda y no como precios exactos.

Predicción del precio · Vivienda 1
Escenario Área Parq. Baños Hab. Precio estimado PI 95% inf. PI 95% sup. Crédito Brecha
Estrato 4 200 1 2 4 $315,2 M $ 8,1 M $622,3 M $350 M $ 34,8 M
Estrato 5 200 1 2 4 $391,0 M $83,2 M $698,7 M $350 M $-41,0 M

Se reporta intervalo de predicción y no solo intervalo de confianza, porque la decisión se refiere al precio de una vivienda individual futura. El intervalo de predicción incorpora tanto la incertidumbre del promedio estimado como la variabilidad individual del mercado.

3.8 Ofertas potenciales y ranking comercial

Top de ofertas priorizadas · Vivienda 1
ID Barrio Precio Área Estrato Parqueaderos Baños Habitaciones Precio/m² Holgura crédito Cumplimiento Observación
1163 la merced $350 M 216 5 2 2 4 1.620 $ 0 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
1887 vipasa $340 M 203 5 2 3 4 1.675 $10 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
94 zona norte $265 M 162 4 1 3 4 1.636 $85 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
1376 la flora $320 M 160 5 1 3 4 2.000 $30 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
1270 el bosque $350 M 203 5 2 2 5 1.724 $ 0 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
Recomendación Vivienda 1. Se identificaron 5 oferta(s) dentro del ranking que cumplen totalmente las condiciones mínimas. La primera opción es el inmueble ID 1163, con 216 m², estrato 5, 2 parqueadero(s), 2 baño(s), 4 habitación(es) y un precio de $350 M. Las ofertas marcadas como “Alternativa cercana” deben entenderse como opciones de respaldo y no como cumplimiento exacto de la solicitud.

4 Solicitud 2 · Apartamento en Zona Sur

4.1 Conformación de Base 2

Para la Solicitud 2 se identificaron 2848 apartamentos en la Zona Sur. El mapa permite verificar su distribución espacial y detectar posibles registros alejados del patrón esperado. Estos casos se conservan con la clasificación original y se consideran observaciones de calidad de datos, ya que no se dispone de polígonos oficiales que permitan reclasificarlos de forma automática.

Trazabilidad del filtro para la Vivienda 2
Etapa Registros
Base limpia 8321
Tipo = Apartamento 5100
Apartamento en Zona Sur 2848
Primeros tres registros de Base 2
id zona barrio tipo preciom areaconst estrato parqueaderos banios habitaciones
4386 Zona Sur acopi Apartamento 310 137 5 2 3 4
5424 Zona Sur acopi Apartamento 320 108 4 2 3 3
6271 Zona Sur acopi Apartamento 385 103 5 2 2 3

4.2 EDA interactivo

El Análisis Exploratorio de Datos (EDA) permite identificar, antes de la modelación, el comportamiento de las variables y su relación con el precio, así como patrones, dispersión y valores atípicos. En la Solicitud 2, la variable con mayor asociación lineal con el precio es areaconst (Pearson = 0.756; Spearman = 0.868). En conjunto, el EDA permite reconocer qué atributos presentan mayor relación con el precio y sustenta el uso posterior de una regresión múltiple.

Nota: La variable zona no se analiza dentro de esta submuestra, dado que la Base 2 fue previamente segmentada y todos los registros corresponden a la Zona Sur.

Dentro de la Base 2 la variable zona no presenta variabilidad, ya que todos los registros corresponden a Zona Sur. Por tanto, su efecto se controla previamente mediante la segmentación y no se incluye como predictor dentro de esta submuestra.

4.2.1 Precio y área

4.2.2 Precio y estrato

4.2.3 Baños, habitaciones y parqueaderos

4.2.4 Correlaciones

Asociación bivariada con el precio · Base 2
Variable Pearson Spearman
areaconst 0.756 0.868
banios 0.713 0.705
parqueaderos 0.690 0.687
estrato 0.670 0.754
habitaciones 0.309 0.379

Interpretación. Las correlaciones permiten ordenar la fuerza de asociación bivariada con el precio. La variable con mayor relación lineal es areaconst (Pearson = 0.756). Las diferencias entre Pearson y Spearman permiten además identificar si la relación es estrictamente lineal o principalmente monotónica. Estas asociaciones son descriptivas y no sustituyen el análisis conjunto del modelo múltiple.

4.3 Modelo de regresión lineal múltiple

Inferencia principal. Los coeficientes y su significancia se reportan combinando las cinco imputaciones mediante las reglas de Rubin. Los diagnósticos y predicciones posteriores utilizan una base imputada representativa.

Estimación combinada del modelo · Vivienda 2
Variable Coeficiente Error estándar t p-valor IC 95% inferior IC 95% superior Significativo
(Intercept) -266.765 13.284 -20.082 < 0,001 -292.815 -240.714
areaconst 1.361 0.055 24.897 < 0,001 1.252 1.469
estrato 60.534 2.930 20.662 < 0,001 54.759 66.310
habitaciones -19.259 3.422 -5.628 < 0,001 -25.974 -12.544
parqueaderos 67.955 7.053 9.635 < 0,001 51.486 84.424
banios 46.484 3.178 14.628 < 0,001 40.237 52.731
  • área construida: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $1,36 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • estrato: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $60,53 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • número de habitaciones: manteniendo constantes las demás variables, una unidad adicional se asocia con un disminución promedio de $19,26 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • número de parqueaderos: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $67,96 M en el precio. El efecto es estadísticamente significativo (p < 0,001).
  • número de baños: manteniendo constantes las demás variables, una unidad adicional se asocia con un incremento promedio de $46,48 M en el precio. El efecto es estadísticamente significativo (p < 0,001).

4.4 Ajuste global

Indicadores de ajuste · Modelo Vivienda 2
Métrica Valor
0.7555
R² ajustado 0.7551
RMSE residual 96.81
Estadístico F 1756.46
p-valor global < 0,001

Interpretación. El modelo explica aproximadamente el 75.55 % de la variabilidad observada en el precio de los apartamentos de la Zona Sur. El \(R^2\) ajustado es 75.51 %, por lo que el poder explicativo se mantiene aun considerando el número de predictores incluidos.

El modelo es globalmente significativo (\(F = 1756.5\); \(p < 0,001\)), lo que indica que las variables consideradas aportan conjuntamente a la explicación del precio. El RMSE residual es de $96,81 M, por lo que las predicciones individuales deben interpretarse junto con sus intervalos de predicción.

4.5 Validación de supuestos

4.5.1 Pruebas formales

Diagnóstico de supuestos · Vivienda 2
Supuesto Evidencia Lectura
Homoscedasticidad Breusch-Pagan: p < 0,001 Hay evidencia de heterocedasticidad.
Normalidad de residuos Shapiro-Wilk: p < 0,001 La normalidad estricta se rechaza; revisar Q-Q y tamaño muestral.
Multicolinealidad VIF máximo = 2.47 No se observa colinealidad severa.

Interpretación. Se evidencia heterocedasticidad en los residuos (Breusch-Pagan, \(p < 0,001\)). También se rechaza la normalidad estricta de los residuos (Shapiro-Wilk, \(p < 0,001\)). En contraste, el VIF máximo de 2.47 no evidencia multicolinealidad severa.

En conjunto, estos resultados indican que el modelo puede utilizarse como herramienta explicativa y predictiva, pero la inferencia debe interpretarse con cautela cuando se presenten desviaciones de los supuestos clásicos. Por ello, el análisis se complementa con errores estándar robustos HC3 e intervalos de predicción.

4.5.2 Residuos vs. ajustados

4.5.3 Q-Q plot

4.5.4 Observaciones influyentes

Las observaciones que superan el umbral de referencia deben revisarse como potencialmente influyentes, pero no eliminarse automáticamente. En el mercado inmobiliario pueden corresponder a propiedades legítimamente atípicas y no necesariamente a errores de registro.

4.6 Comparación de especificaciones

Interpretación. La validación cruzada identifica a M2 · RLM con estrato categórico como la especificación con mejor desempeño predictivo, con RMSE de 92.683, MAE de 54.568 y un \(R^2\) predictivo de 0.775. Tratar el estrato como variable categórica mejora ligeramente el desempeño frente al modelo oficial M1. La transformación logarítmica M3 presenta un RMSE de 123.467 y un \(R^2\) predictivo de 0.601. Se mantiene M1 como modelo principal por corresponder a la especificación solicitada y se utiliza la comparación como análisis de sensibilidad.

Validación cruzada de 10 particiones · Base 2
Modelo RMSE CV MAE CV R² predictivo CV
M2 · RLM con estrato categórico 92.683 54.568 0.775
M1 · RLM exigido 98.237 58.327 0.748
M3 · Log-precio + estrato categórico 123.467 56.372 0.601

M1 es el modelo requerido por la actividad. M2 evalúa si tratar el estrato como categoría mejora el desempeño. M3 explora una transformación logarítmica del precio. Esta comparación funciona como análisis de sensibilidad y no reemplaza la interpretación del RLM oficial.

4.7 Predicción para la Vivienda 2

Interpretación. Para el perfil solicitado, el modelo estima un precio de $693,3 M en estrato 5 y de $753,3 M en estrato 6. Frente al crédito disponible de $850 M, las holguras estimadas son de $156,7 M y $96,7 M, respectivamente.

Los intervalos de predicción incorporan la variabilidad individual del mercado y, por tanto, deben interpretarse como un rango plausible para una vivienda específica y no como un precio exacto.

Predicción del precio · Vivienda 2
Escenario Área Parq. Baños Hab. Precio estimado PI 95% inf. PI 95% sup. Crédito Brecha
Estrato 5 300 3 3 5 $693,3 M $502,5 M $884,2 M $850 M $156,7 M
Estrato 6 300 3 3 5 $753,3 M $562,4 M $944,2 M $850 M $ 96,7 M

Se reporta intervalo de predicción porque la decisión se refiere al precio de una vivienda individual. Este intervalo incorpora tanto la incertidumbre del promedio estimado como la variabilidad propia del mercado.

4.8 Ofertas potenciales y ranking comercial

Top de ofertas priorizadas · Vivienda 2
ID Barrio Precio Área Estrato Parqueaderos Baños Habitaciones Precio/m² Holgura crédito Cumplimiento Observación
8036 seminario $530 M 256 5 3 5 5 2.070 $320 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
7512 seminario $670 M 300 5 3 5 6 2.233 $180 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
7182 guadalupe $730 M 573 5 3 8 5 1.274 $120 M Cumple totalmente Cumple estrato, dotación mínima y presupuesto
5306 ciudadela pasoancho $650 M 275 5 2 5 5 2.364 $200 M Alternativa cercana No cumple el mínimo de parqueaderos
6175 capri $350 M 270 5 3 3 4 1.296 $500 M Alternativa cercana No cumple el mínimo de habitaciones
Recomendación Vivienda 2. Se identificaron 3 oferta(s) dentro del ranking que cumplen totalmente las condiciones mínimas. La primera opción es el inmueble ID 8036, con 256 m², estrato 5, 3 parqueadero(s), 5 baño(s), 5 habitación(es) y un precio de $530 M. Las ofertas marcadas como “Alternativa cercana” se presentan únicamente como respaldo comercial.

5 Comparación final de los dos casos

Comparación ejecutiva de las dos solicitudes
Dimensión Vivienda 1 Vivienda 2
Segmento analizado Casa · Zona Norte Apartamento · Zona Sur
Tamaño de muestra 664 2848
R² modelo oficial 0.653 0.756
R² ajustado 0.65 0.755
Mejor RMSE en validación cruzada 158.9 92.68
Número de ofertas priorizadas 5 5
Presupuesto $350 M $850 M

5.0.1 Lectura comparativa

La comparación evidencia dos escenarios comerciales distintos. La Vivienda 1 opera con un presupuesto más restringido frente a su rango de predicción central ($315,2 M – $391 M), mientras que la Vivienda 2 dispone de una mayor holgura frente a su rango estimado ($693,3 M – $753,3 M). En ambos casos, la decisión final se sustenta en la combinación entre capacidad explicativa del modelo, desempeño predictivo en validación cruzada y existencia de ofertas observadas compatibles con las restricciones del cliente.

5.1 Recomendación ejecutiva

5.1.1 Vivienda 1

El modelo estima un precio central entre $315,2 M y $391 M para los estratos permitidos, frente a un crédito máximo de $350 M. Esto configura una búsqueda con restricción presupuestal relevante: el escenario de menor precio esperado puede ser viable, mientras que el de mayor valor supera el presupuesto. Dentro de las ofertas priorizadas se identificaron 5 alternativas que cumplen totalmente las condiciones mínimas. Se recomienda iniciar la validación comercial por el inmueble ID 1163, con precio de $350 M, y posteriormente verificar estado físico, documentación, costos de cierre y condiciones de negociación. La recomendación no debe interpretarse como una tasación definitiva: el intervalo de predicción muestra una dispersión considerable del mercado, por lo que la visita y la debida diligencia siguen siendo indispensables.

5.1.2 Vivienda 2

El modelo estima un precio central entre $693,3 M y $753,3 M para los estratos 5 y 6, frente a un presupuesto de $850 M. En comparación con la primera solicitud, esta búsqueda presenta mayor holgura presupuestal, por lo que la decisión puede priorizar el ajuste al perfil requerido y no únicamente el precio. Se identificaron 3 alternativas que cumplen totalmente las condiciones mínimas dentro del ranking. La primera visita sugerida corresponde al inmueble ID 8036, con precio de $530 M. La holgura disponible permite comparar además ubicación fina, estado del inmueble, administración y amenidades antes de tomar una decisión. Se recomienda utilizar la predicción como referencia de mercado y complementar la selección con visita, revisión documental y comparación de costos recurrentes antes de cerrar la compra.

6 Conclusiones metodológicas

  1. La calidad de los datos se trató de forma diferenciada. Se estandarizaron tipos, se eliminaron únicamente duplicados exactos y se revisaron valores físicamente imposibles. Los faltantes mínimos se manejaron mediante casos completos, mientras que parqueaderos, por su proporción sustancial de ausencia, se imputó mediante PMM. La inferencia de coeficientes incorpora la incertidumbre de esa imputación mediante las reglas de Rubin.

  2. La zona fue sometida a depuración espacial antes de construir las submuestras. La clasificación original se conservó para trazabilidad, pero el análisis utilizó una zona depurada mediante KNN basada en latitud y longitud. Esto permite corregir observaciones espacialmente discordantes sin redefinir indiscriminadamente la estructura geográfica del mercado.

  3. El modelo principal responde al enunciado, pero no se evaluó de forma aislada. La regresión lineal múltiple exigida se comparó con especificaciones alternativas mediante validación cruzada de 10 particiones. De esta manera, el ajuste dentro de muestra \(R^2\) se complementó con RMSE, MAE y \(R^2\) predictivo para evaluar capacidad de generalización.

  4. La inferencia requiere cautela cuando los supuestos clásicos no se cumplen. La heterocedasticidad y las desviaciones de normalidad observadas en los residuos no invalidan automáticamente el modelo, pero sí justifican complementar la lectura con errores estándar robustos HC3, gráficos diagnósticos y revisión de observaciones influyentes.

  5. La significancia estadística no equivale a causalidad ni a importancia económica. Los coeficientes se interpretan como asociaciones condicionadas a las demás variables incluidas. Un efecto estadísticamente significativo puede ser comercialmente pequeño y, de igual forma, variables relevantes para el mercado pueden no aparecer en la base.

  6. Las predicciones individuales deben leerse con intervalos de predicción. El precio puntual es una referencia central y no una tasación exacta. Los intervalos amplios reflejan heterogeneidad del mercado y la ausencia de atributos como microlocalización, antigüedad, estado, acabados, vista, administración y amenidades.

  7. La recomendación comercial combina evidencia estadística y oferta real. La selección de inmuebles no se basa exclusivamente en el precio predicho. Se integran presupuesto, estrato, área, dotación mínima, cercanía al perfil, desempeño del modelo y existencia de alternativas observadas.

  8. La Vivienda 1 y la Vivienda 2 requieren estrategias distintas. La primera presenta una restricción presupuestal más exigente, por lo que la negociación y priorización de atributos es crítica. La segunda cuenta con mayor holgura financiera, permitiendo priorizar cumplimiento del perfil y calidad del inmueble sobre el precio mínimo.

  9. El análisis constituye apoyo para la decisión, no sustitución del criterio inmobiliario. Antes de una compra se requiere complementar la evidencia cuantitativa con visita, validación jurídica, revisión del estado físico, costos de administración, impuestos y condiciones de negociación.

7 Anexo A. Trazabilidad de la imputación múltiple

La inferencia combinada mediante las reglas de Rubin se presenta ahora en la sección principal de cada modelo, en lugar de dejarse únicamente como análisis complementario. Esto permite que la significancia estadística refleje explícitamente la incertidumbre introducida por la imputación de parqueaderos.

Trazabilidad de la imputación múltiple
Solicitud Imputaciones generadas Parqueaderos imputados por base
Vivienda 1 5 233
Vivienda 2 5 464

8 Anexo B. Errores estándar robustos

Cuando Breusch-Pagan detecta heterocedasticidad, los coeficientes MCO se mantienen como estimaciones del modelo exigido, pero puede revisarse la inferencia con errores estándar robustos HC3.

Los errores estándar robustos HC3 permiten corregir la inferencia cuando la varianza de los residuos no es constante. Mantienen los mismos coeficientes estimados por MCO, pero recalculan su incertidumbre, obteniendo p-valores e intervalos de confianza más confiables ante heterocedasticidad y observaciones influyentes.

Para la Vivienda 1, el área construida, el estrato, los parqueaderos y los baños continúan siendo estadísticamente significativos (\(p<0,05\)). Manteniendo las demás variables constantes, cada m² adicional se asocia con un aumento promedio de $0,75 millones, un nivel adicional de estrato con $75,73 millones, un parqueadero adicional con $18,67 millones y un baño adicional con $25,15 millones. Las habitaciones no presentan un efecto estadísticamente significativo (\(p=0,454\)).

Para la Vivienda 2, todas las variables resultan significativas (\(p<0,05\)). El área, estrato, parqueaderos y baños presentan efectos positivos sobre el precio. Las habitaciones muestran un coeficiente negativo de -$18,66 millones; este resultado debe interpretarse manteniendo constante el área y las demás características: entre apartamentos comparables en tamaño, un mayor número de habitaciones se asocia con un menor precio, posiblemente por una mayor división del espacio disponible.

En conjunto, el análisis HC3 refuerza la robustez de la inferencia de los modelos frente a la heterocedasticidad. Sin embargo, esta corrección no elimina la heterocedasticidad ni corrige otros posibles problemas del modelo; únicamente permite obtener una evaluación más confiable de la significancia estadística de los coeficientes.

Coeficientes con errores estándar robustos HC3 · Vivienda 1
Variable Coeficiente Error estándar robusto HC3 Estadístico t p-valor Significativo al 5%
(Intercept) -224.2903 34.6015 -6.4821 < 0,001
areaconst 0.7543 0.1338 5.6359 < 0,001
estrato 75.7278 10.4949 7.2157 < 0,001
habitaciones 4.1930 5.5967 0.7492 0,4540 No
parqueaderos 18.6686 6.7670 2.7588 0,0060
banios 25.1511 8.9599 2.8071 0,0051
Coeficientes con errores estándar robustos HC3 · Vivienda 2
Variable Coeficiente Error estándar robusto HC3 Estadístico t p-valor Significativo al 5%
(Intercept) -266.6746 20.9193 -12.7478 < 0,001
areaconst 1.3388 0.3481 3.8463 < 0,001
estrato 59.9422 3.6222 16.5484 < 0,001
habitaciones -18.6576 6.1324 -3.0425 0,0024
parqueaderos 71.4780 14.3702 4.9740 < 0,001
banios 45.8375 7.3424 6.2429 < 0,001

9 Anexo C. Reproducibilidad

## R version 4.5.1 (2025-06-13 ucrt)
## Platform: x86_64-w64-mingw32/x64
## Running under: Windows 11 x64 (build 26100)
## 
## Matrix products: default
##   LAPACK version 3.12.1
## 
## locale:
## [1] LC_COLLATE=Spanish_Colombia.utf8  LC_CTYPE=Spanish_Colombia.utf8   
## [3] LC_MONETARY=Spanish_Colombia.utf8 LC_NUMERIC=C                     
## [5] LC_TIME=Spanish_Colombia.utf8    
## 
## time zone: America/Bogota
## tzcode source: internal
## 
## attached base packages:
## [1] stats     graphics  grDevices utils     datasets  methods   base     
## 
## other attached packages:
##  [1] mice_3.19.0          scales_1.4.0         sandwich_3.1-3      
##  [4] lmtest_0.9-40        zoo_1.9-0            car_3.1-5           
##  [7] carData_3.0-6        kableExtra_1.4.0     DT_0.34.0           
## [10] leaflet_2.2.3        plotly_4.12.0        purrr_1.2.1         
## [13] tidyr_1.3.2          dplyr_1.1.4          paqueteMODELOS_0.1.0
## [16] summarytools_1.1.5   knitr_1.51           gridExtra_2.3.1     
## [19] GGally_2.4.0         ggplot2_4.0.1        broom_1.0.13        
## [22] boot_1.3-31         
## 
## loaded via a namespace (and not attached):
##  [1] Rdpack_2.6.6            tcltk_4.5.1             rlang_1.1.7            
##  [4] magrittr_2.0.4          otel_0.2.0              matrixStats_1.5.0      
##  [7] compiler_4.5.1          mgcv_1.9-3              reshape2_1.4.5         
## [10] systemfonts_1.3.1       vctrs_0.6.5             stringr_1.6.0          
## [13] pkgconfig_2.0.3         shape_1.4.6.1           fastmap_1.2.0          
## [16] backports_1.5.1         magick_2.9.1            labeling_0.4.3         
## [19] pander_0.6.6            rmarkdown_2.31          nloptr_2.2.1           
## [22] xfun_0.55               glmnet_4.1-10           jomo_2.7-6             
## [25] cachem_1.1.0            jsonlite_2.0.0          pan_1.9                
## [28] R6_2.6.1                bslib_0.12.0            stringi_1.8.7          
## [31] RColorBrewer_1.1-3      rpart_4.1.24            lubridate_1.9.5        
## [34] jquerylib_0.1.4         Rcpp_1.1.1              iterators_1.0.14       
## [37] base64enc_0.1-6         leaflet.providers_3.0.0 FNN_1.1.4.1            
## [40] Matrix_1.7-3            splines_4.5.1           nnet_7.3-20            
## [43] timechange_0.4.0        tidyselect_1.2.1        rstudioapi_0.18.0      
## [46] abind_1.4-8             yaml_2.3.12             codetools_0.2-20       
## [49] lattice_0.22-7          tibble_3.3.1            plyr_1.8.9             
## [52] withr_3.0.3             S7_0.2.1                evaluate_1.0.5         
## [55] survival_3.8-3          ggstats_0.13.0          xml2_1.5.1             
## [58] pillar_1.11.1           checkmate_2.3.4         foreach_1.5.2          
## [61] reformulas_0.4.4        generics_0.1.4          minqa_1.2.8            
## [64] glue_1.8.0              lazyeval_0.2.2          tools_4.5.1            
## [67] data.table_1.18.0       lme4_1.1-38             rapportools_1.2        
## [70] grid_4.5.1              rbibutils_2.4.1         crosstalk_1.2.2        
## [73] nlme_3.1-168            Formula_1.2-5           cli_3.6.5              
## [76] textshaping_1.0.4       viridisLite_0.4.3       svglite_2.2.2          
## [79] gtable_0.3.6            sass_0.4.10             digest_0.6.39          
## [82] htmlwidgets_1.6.4       farver_2.1.2            htmltools_0.5.9        
## [85] lifecycle_1.0.5         httr_1.4.7              mitml_0.4-5            
## [88] MASS_7.3-65