El análisis combina exploración interactiva, regresión lineal múltiple, diagnóstico de supuestos, validación predictiva y un ranking multicriterio de ofertas reales.
La compañía internacional solicita la búsqueda de dos inmuebles con características y presupuestos diferentes. Para evaluar cada solicitud se analizaron las ofertas inmobiliarias registradas durante los últimos tres meses, identificando 722 casas en la Zona Norte y 2.787 apartamentos en la Zona Sur, mercados de referencia para la Vivienda 1 y la Vivienda 2, respectivamente.
El análisis se desarrolló en dos etapas complementarias. Primero, se estimó mediante regresión lineal múltiple el precio esperado de cada vivienda a partir del área construida, estrato, número de habitaciones, parqueaderos y baños. Posteriormente, las estimaciones se contrastaron con la oferta inmobiliaria efectivamente observada, aplicando las condiciones de ubicación, tipo de inmueble, características requeridas y presupuesto máximo disponible.
| Solicitud | Perfil | Presupuesto | Ofertas priorizadas | Predicción central mínima | Predicción central máxima |
|---|---|---|---|---|---|
| Vivienda 1 | Casa · Norte · 200 m² · estrato 4/5 · 1 parqueadero · 2 baños · 4 habitaciones | $350 millones | 5 | $315,2 M | $391 M |
| Vivienda 2 | Apartamento · Sur · 300 m² · estrato 5/6 · 3 parqueaderos · 3 baños · 5 habitaciones | $850 millones | 5 | $693,3 M | $753,3 M |
Lectura de la tabla. Las ofertas priorizadas corresponden a las 5 alternativas de mercado más cercanas a cada solicitud, considerando características y presupuesto. La predicción central mínima y máxima representan el menor y mayor precio estimado por el modelo según los estratos permitidos: 4–5 para la Vivienda 1 y 5–6 para la Vivienda 2.
Nota: Estos valores no corresponden a intervalos de predicción, sino a predicciones puntuales para los diferentes estratos considerados.
Antes de segmentar y modelar la información se aplicó una limpieza conservadora. Primero se estandarizaron los tipos de las variables y los campos de texto; después se eliminaron únicamente los registros completamente duplicados y se revisaron valores físicamente imposibles. Los valores extremos plausibles se conservaron, ya que en el mercado inmobiliario un precio o un área elevada no constituye por sí sola un error.
| Control | Resultado |
|---|---|
| Registros originales | 8322 |
| Duplicados exactos eliminados | 1 |
| Precio <= 0 | 0 |
| Área construida <= 0 | 0 |
| Estrato fuera de 1–6 | 0 |
| Parqueaderos negativos | 0 |
| Baños negativos | 0 |
| Habitaciones negativas | 0 |
| Registros después de limpieza estructural | 8321 |
Criterio estadístico. No se aplica
complete.cases() a toda la base porque ello eliminaría
automáticamente todos los registros con parqueaderos faltantes. Tampoco
se reemplazan los NA por constantes arbitrarias como 0, 2 o 3. Cada tipo
de faltante se trata según su magnitud y función dentro del
análisis.
La base presenta una alta completitud de la información, con porcentajes de datos faltantes muy bajos en la mayoría de las variables, entre 0,02 % y 0,04 %. La principal excepción corresponde a parqueaderos, con 19,29 % de valores faltantes, lo cual debe considerarse porque puede reducir el número efectivo de observaciones utilizadas en los modelos.
La variable parqueaderos concentra la mayor proporción
de datos faltantes (19,29 %). Eliminar todos estos
registros reduciría de forma importante la muestra disponible y podría
introducir sesgo si la ausencia no es completamente aleatoria. Por esta
razón, se emplea imputación múltiple mediante Predictive Mean
Matching (PMM). La imputación utiliza área construida, estrato,
habitaciones y baños como variables auxiliares para identificar
inmuebles comparables. El precio no se utiliza para completar
parqueaderos, evitando que la variable respuesta intervenga
directamente en la construcción del predictor faltante.
PMM asigna a cada valor faltante un número de parqueaderos realmente
observado en inmuebles con perfiles estadísticamente similares, evitando
generar valores imposibles o fraccionarios. Se generan 5 bases
imputadas para representar la incertidumbre asociada al
proceso. Para preciom, areaconst,
estrato, habitaciones y banios,
cuyos faltantes son mínimos, se utilizan casos completos. En particular,
el precio no se imputa, porque corresponde a la
variable respuesta del modelo.
| Solicitud | Base segmentada | NA originales en parqueaderos | Parqueaderos imputados | Casos usados en modelación |
|---|---|---|---|---|
| Vivienda 1 | 664 | 233 | 233 | 664 |
| Vivienda 2 | 2848 | 464 | 464 | 2848 |
Criterio aplicado. La imputación se utiliza únicamente para la modelación estadística. La base original se conserva sin modificaciones para el análisis exploratorio, los mapas y la selección comercial de ofertas. De esta forma se mantiene la trazabilidad entre datos observados e imputados.
Una vez imputados los valores faltantes de parqueaderos
y excluidos los pocos registros incompletos de las demás variables del
modelo, se verifica que las bases utilizadas para la modelación no
contengan datos faltantes.
| Solicitud | Registros finales | Valores faltantes |
|---|---|---|
| Vivienda 1 | 664 | 0 |
| Vivienda 2 | 2848 | 0 |
## Después del tratamiento, las bases destinadas a la modelación presentan **0 valores faltantes** en las variables incluidas en la regresión. En la Vivienda 1 se excluyeron **0** registro(s) por faltantes en variables diferentes a parqueaderos y en la Vivienda 2 se excluyeron **0** registro(s). Los faltantes de `parqueaderos` no fueron eliminados, sino imputados mediante PMM.
La oferta inmobiliaria presenta una marcada concentración en las zonas Sur y Norte, siendo la Zona Sur la de mayor número de inmuebles disponibles. En ambas zonas predominan los apartamentos sobre las casas. En contraste, las zonas Centro, Oeste y Oriente registran una oferta considerablemente menor. Para el análisis de las solicitudes, se observa una disponibilidad relevante de casas en la Zona Norte y una oferta especialmente amplia de apartamentos en la Zona Sur, lo que proporciona una base suficiente de alternativas para evaluar ambos requerimientos.
La revisión de la georreferenciación muestra que la variable
zona puede contener registros que no siguen el patrón
espacial predominante de su categoría. Dado que el objetivo es
identificar hacia qué zona tiende geográficamente cada
inmueble, se utiliza un K-Nearest Neighbors (KNN)
espacial sobre longitud y
latitud.
Se prefiere KNN frente a un método de conglomerados como K-means
porque aquí ya existe una clasificación de referencia
(zona) y el problema es, por tanto,
supervisado. Un algoritmo de clustering encontraría
grupos geométricos, pero no garantiza que esos conglomerados
correspondan directamente con Norte, Sur, Oeste, Oriente o Centro. KNN,
en cambio, permite estimar la zona de un inmueble a partir de la
clasificación predominante entre sus vecinos geográficos más
cercanos.
Criterio estadístico. Las coordenadas se estandarizan antes de calcular distancias. El número de vecinos no se fija arbitrariamente: se evalúan varios valores de
ky se selecciona el que maximiza el accuracy balanceado, de manera que las zonas menos frecuentes también participen en la decisión. Para reducir reclasificaciones dudosas, una zona solo se modifica cuando el KNN discrepa de la etiqueta original y al menos el 70 % de los vecinos respaldan la nueva clasificación.
Para evaluar el efecto de la depuración espacial se presentan dos mapas con la misma escala cromática por zona. El primero muestra la clasificación reportada originalmente en la base y el segundo la clasificación utilizada para el análisis después de aplicar KNN. De esta forma es posible identificar visualmente qué tan concentradas quedan las zonas y dónde se producen cambios de clasificación.
Mapa antes. Representa la clasificación de zona tal como aparece en la fuente original. Los puntos aislados dentro de conglomerados dominados por otra zona son candidatos a revisión espacial.
| Registros con coordenadas válidas | Registros reclasificados | % reclasificado |
|---|---|---|
| 8319 | 473 | 5.69 |
Interpretación. El mapa posterior permite evaluar si la clasificación espacial queda más coherente con los conglomerados geográficos observados. Los cambios no se realizan por inspección visual: se aplican únicamente cuando el KNN identifica una zona alternativa con el nivel mínimo de consenso definido. La comparación antes–después permite documentar el impacto de la reclasificación sin perder la trazabilidad de la zona reportada originalmente.
| k | Accuracy | Accuracy balanceado | Seleccionado |
|---|---|---|---|
| 5 | 85.9% | 72.0% | |
| 7 | 86.0% | 72.9% | |
| 9 | 86.1% | 73.0% | Sí |
| 11 | 86.4% | 72.7% | |
| 15 | 86.4% | 72.8% | |
| 21 | 86.3% | 72.6% | |
| 31 | 86.3% | 70.8% |
| Indicador | Resultado |
|---|---|
| k seleccionado | 9 |
| Registros con coordenadas y zona original | 8.319 |
| Registros reclasificados con alta confianza | 473 |
| Porcentaje reclasificado | 5.7% |
| Confianza mínima exigida | 70 % |
| Zona original | Zona reclasificada | Registros |
|---|---|---|
| Zona Norte | Zona Sur | 170 |
| Zona Sur | Zona Norte | 56 |
| Zona Oeste | Zona Norte | 44 |
| Zona Oeste | Zona Sur | 40 |
| Zona Sur | Zona Oeste | 37 |
| Zona Norte | Zona Oeste | 29 |
| Zona Oriente | Zona Sur | 24 |
| Zona Norte | Zona Oriente | 22 |
| Zona Sur | Zona Oriente | 16 |
| Zona Oriente | Zona Norte | 9 |
| Zona Centro | Zona Sur | 8 |
| Zona Centro | Zona Norte | 5 |
| Zona Sur | Zona Centro | 5 |
| Zona Oeste | Zona Oriente | 3 |
| Zona Centro | Zona Oriente | 2 |
| Zona Centro | Zona Oeste | 1 |
| Zona Oriente | Zona Centro | 1 |
| Zona Oriente | Zona Oeste | 1 |
Interpretación. El procedimiento no reemplaza
indiscriminadamente la clasificación original. La zona se modifica
únicamente cuando existe un patrón local suficientemente consistente
entre los vecinos más próximos. Esto permite corregir observaciones
espacialmente discordantes y, al mismo tiempo, conservar los casos
cercanos a fronteras entre zonas cuando la evidencia geográfica no es
concluyente. La variable utilizada en los análisis posteriores es
zona_analisis, mientras zona_original se
conserva para garantizar trazabilidad.
La base disponible contiene longitud y latitud, pero no una variable de altitud geográfica. Por esta razón, la reclasificación utiliza las dos coordenadas espaciales disponibles. Variables como piso, precio, estrato o área no se incorporan al KNN de zona, porque describen el inmueble y podrían introducir una clasificación circular o comercial en una variable que debe representar ubicación geográfica.
| Solicitud | Registros antes | Registros después | Diferencia |
|---|---|---|---|
| Vivienda 1 | 722 | 664 | -58 |
| Vivienda 2 | 2787 | 2848 | 61 |
Interpretación. Después de la reclasificación
espacial, la base de la Vivienda 1 pasa de
722 a 664 casas en Zona Norte (-58
registros), mientras que la base de la Vivienda 2 pasa
de 2787 a 2848 apartamentos en Zona
Sur (+61 registros). A partir de este punto, todo el análisis utiliza la
zona depurada mediante KNN, conservando zona_original para
trazabilidad.
Para la Solicitud 1 se identificaron 722 casas en la Zona Norte. El mapa muestra una alta concentración de inmuebles al norte de Cali, aunque se observan algunos registros dispersos en otras áreas. Estos casos se mantienen con su clasificación original y se consideran posibles inconsistencias de ubicación para revisión.
| Etapa | Registros |
|---|---|
| Base limpia | 8321 |
| Tipo = Casa | 3219 |
| Casa en Zona Norte | 664 |
| id | zona | barrio | tipo | preciom | areaconst | estrato | parqueaderos | banios | habitaciones |
|---|---|---|---|---|---|---|---|---|---|
| 1209 | Zona Norte | acopi | Casa | 320 | 150 | 5 | 2 | 4 | 6 |
| 1592 | Zona Norte | acopi | Casa | 780 | 380 | 5 | 2 | 3 | 3 |
| 504 | Zona Norte | acopi | Casa | 180 | 120 | 3 | NA | 3 | 3 |
El Análisis Exploratorio de Datos (EDA) permite identificar, antes de la modelación, el comportamiento de las variables y su relación con el precio, así como posibles patrones, dispersiones y valores atípicos. Los gráficos interactivos facilitan la exploración individual de los inmuebles y sus características.
En la Solicitud 1, el área construida presenta la mayor asociación con el precio (Pearson = 0,685; Spearman = 0,777), seguida por el estrato (0,528), los baños (0,509), los parqueaderos (0,412) y las habitaciones (0,365). En general, se observa que el precio tiende a aumentar con mejores características del inmueble, aunque existe dispersión y presencia de valores atípicos, lo que indica que su comportamiento responde a la combinación de múltiples factores.
Nota: La variable zona no se analiza dentro de esta submuestra, dado que la Base 1 fue previamente segmentada y todos los registros corresponden a la Zona Norte.
Dentro de la Base 1 la variable zona no presenta
variabilidad, ya que todos los registros corresponden a Zona Norte. Por
tanto, su efecto se controla previamente mediante la segmentación y no
se incluye como predictor dentro de esta submuestra.
La pendiente visual permite evaluar si el mayor metraje se traduce en mayores precios. La dispersión vertical alrededor de la tendencia muestra cuánto valor adicional depende de atributos no recogidos por el área —por ejemplo, microlocalización, estado del inmueble, antigüedad, acabados o amenidades—.
| Variable | Pearson | Spearman |
|---|---|---|
| areaconst | 0.732 | 0.837 |
| estrato | 0.604 | 0.704 |
| banios | 0.564 | 0.638 |
| parqueaderos | 0.449 | 0.498 |
| habitaciones | 0.390 | 0.441 |
El modelo exigido por el enunciado es:
\[ Precio_i=\beta_0+\beta_1 Área_i+\beta_2 Estrato_i+\beta_3 Habitaciones_i+ \beta_4 Parqueaderos_i+\beta_5 Baños_i+\varepsilon_i \]
Inferencia principal. Debido a la imputación
múltiple de parqueaderos, los coeficientes, errores
estándar, intervalos de confianza y pruebas de significancia que se
presentan a continuación se combinan sobre las cinco imputaciones
mediante las reglas de Rubin. Para diagnósticos gráficos, ajuste global
y predicciones se utiliza una de las bases completas generadas por PMM
como base representativa, manteniendo la misma especificación exigida
por el ejercicio.
| Variable | Coeficiente | Error estándar | t | p-valor | IC 95% inferior | IC 95% superior | Significativo |
|---|---|---|---|---|---|---|---|
| (Intercept) | -227.243 | 31.477 | -7.219 | < 0,001 | -289.102 | -165.384 | Sí |
| areaconst | 0.759 | 0.048 | 15.973 | < 0,001 | 0.665 | 0.852 | Sí |
| estrato | 76.508 | 7.873 | 9.718 | < 0,001 | 61.019 | 91.997 | Sí |
| habitaciones | 4.395 | 4.447 | 0.988 | 0,323 | -4.338 | 13.128 | No |
| parqueaderos | 19.887 | 6.146 | 3.236 | 0,003 | 7.270 | 32.504 | Sí |
| banios | 23.573 | 5.995 | 3.932 | < 0,001 | 11.795 | 35.352 | Sí |
Interpretación correcta. Los coeficientes describen asociaciones condicionadas a las demás variables del modelo. No prueban causalidad y tampoco representan automáticamente “el valor real” de una característica aislada.
| Métrica | Valor |
|---|---|
| R² | 0.6529 |
| R² ajustado | 0.6502 |
| RMSE residual | 156.11 |
| Estadístico F | 247.49 |
| p-valor global | < 0,001 |
Interpretación. El modelo presenta una capacidad explicativa moderada-alta: las variables incluidas explican aproximadamente el 65,87 % de la variabilidad observada en el precio de las casas de la Zona Norte. El \(R^2\) ajustado (65,63 %) es muy cercano al \(R^2\), lo que indica que el poder explicativo se mantiene aun considerando el número de predictores incluidos.
Adicionalmente, el modelo es globalmente significativo (\(F = 276,4\); \(p < 0,001\)), por lo que existe evidencia estadística de que las variables consideradas, en conjunto, aportan a la explicación del precio.
El RMSE residual de $157,32 millones evidencia, sin embargo, una variabilidad importante entre los precios observados y los estimados. Por esta razón, las predicciones individuales deben interpretarse junto con sus intervalos de predicción. Parte de esta variación puede estar asociada a características no disponibles en la base, como microlocalización, antigüedad, estado del inmueble, acabados o amenidades.
Interpretación. La evaluación de supuestos muestra que el modelo presenta heterocedasticidad (Breusch-Pagan, \(p < 0,001\)), lo cual también se evidencia en el gráfico de residuos, donde la dispersión aumenta para valores ajustados más altos. Asimismo, se rechaza la normalidad de los residuos (Shapiro-Wilk, \(p < 0,001\)); el gráfico Q-Q confirma desviaciones principalmente en las colas, asociadas a observaciones con errores extremos.
En contraste, no se identifican problemas importantes de multicolinealidad, dado que el VIF máximo es de 1,91, lo que indica que los predictores aportan información suficientemente diferenciada. El análisis de la distancia de Cook muestra además algunas observaciones potencialmente influyentes, por lo que estos casos deben ser revisados, pero no eliminados automáticamente sin evidencia de que correspondan a errores de registro.
En conjunto, los resultados indican que el modelo conserva utilidad para explicar y estimar el precio de los inmuebles, pero la heterocedasticidad, la falta de normalidad en las colas y la presencia de observaciones influyentes requieren cautela en la inferencia. Por esta razón, se complementa el análisis con errores estándar robustos HC3 y las predicciones se interpretan mediante intervalos de predicción, evitando depender únicamente de la estimación puntual.
| Supuesto | Evidencia | Lectura |
|---|---|---|
| Homoscedasticidad | Breusch-Pagan: p < 0,001 | Hay evidencia de heterocedasticidad. |
| Normalidad de residuos | Shapiro-Wilk: p < 0,001 | La normalidad estricta se rechaza; revisar Q-Q y tamaño muestral. |
| Multicolinealidad | VIF máximo = 2.08 | No se observa colinealidad severa. |
Si aparecen problemas de heterocedasticidad o normalidad, el enunciado no exige corregirlos. Las alternativas metodológicas recomendables son: errores estándar robustos HC3, transformación logarítmica del precio, modelación no lineal o incorporación de variables omitidas relevantes.
Interpretación. La validación cruzada muestra un desempeño similar entre los modelos M1 y M2, aunque M2, que trata el estrato como variable categórica, presenta el mejor desempeño predictivo, con menor RMSE (157,884), menor MAE (98,009) y mayor \(R^2\) predictivo (0,653). Frente al modelo oficial M1, la mejora es moderada, lo que sugiere que permitir un efecto no lineal entre los niveles de estrato aporta cierta capacidad predictiva, pero no modifica sustancialmente los resultados.
Por su parte, M3 presenta el desempeño más bajo (\(R^2\) predictivo = 0,530), por lo que la transformación logarítmica del precio no mejora la predicción en este caso, aun cuando podría contribuir al tratamiento de algunos problemas de los residuos.
En consecuencia, se mantiene M1 como modelo principal, dado que corresponde a la especificación requerida en la actividad y conserva un desempeño competitivo. No obstante, M2 se identifica como una alternativa de especificación ligeramente superior si el objetivo fuera priorizar exclusivamente la capacidad predictiva.
| Modelo | RMSE CV | MAE CV | R² predictivo CV |
|---|---|---|---|
| M2 · RLM con estrato categórico | 158.903 | 95.368 | 0.637 |
| M1 · RLM exigido | 160.229 | 97.309 | 0.631 |
| M3 · Log-precio + estrato categórico | 186.935 | 103.710 | 0.498 |
M1 es el modelo requerido por la actividad. M2 evalúa si tratar el estrato como categoría mejora el desempeño. M3 explora una transformación logarítmica del precio, especialmente útil cuando hay asimetría y heterocedasticidad. Esta comparación es un análisis de sensibilidad; no reemplaza la interpretación solicitada del RLM oficial.
Interpretación. Para una vivienda con las características solicitadas, el modelo estima un precio de $319,4 M en estrato 4 y de $399,9 M en estrato 5. Por tanto, el crédito disponible de $350 M sería suficiente para el escenario de estrato 4, con una holgura aproximada de $30,6 M, mientras que para estrato 5 se requerirían cerca de $49,9 M adicionales.
Los intervalos de predicción son amplios, lo que refleja una alta variabilidad en los precios individuales del mercado. En consecuencia, estas estimaciones deben utilizarse como referencia para orientar la búsqueda y no como precios exactos.
| Escenario | Área | Parq. | Baños | Hab. | Precio estimado | PI 95% inf. | PI 95% sup. | Crédito | Brecha |
|---|---|---|---|---|---|---|---|---|---|
| Estrato 4 | 200 | 1 | 2 | 4 | $315,2 M | $ 8,1 M | $622,3 M | $350 M | $ 34,8 M |
| Estrato 5 | 200 | 1 | 2 | 4 | $391,0 M | $83,2 M | $698,7 M | $350 M | $-41,0 M |
Se reporta intervalo de predicción y no solo intervalo de confianza, porque la decisión se refiere al precio de una vivienda individual futura. El intervalo de predicción incorpora tanto la incertidumbre del promedio estimado como la variabilidad individual del mercado.
| ID | Barrio | Precio | Área | Estrato | Parqueaderos | Baños | Habitaciones | Precio/m² | Holgura crédito | Cumplimiento | Observación |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1163 | la merced | $350 M | 216 | 5 | 2 | 2 | 4 | 1.620 | $ 0 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 1887 | vipasa | $340 M | 203 | 5 | 2 | 3 | 4 | 1.675 | $10 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 94 | zona norte | $265 M | 162 | 4 | 1 | 3 | 4 | 1.636 | $85 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 1376 | la flora | $320 M | 160 | 5 | 1 | 3 | 4 | 2.000 | $30 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 1270 | el bosque | $350 M | 203 | 5 | 2 | 2 | 5 | 1.724 | $ 0 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
Para la Solicitud 2 se identificaron 2848 apartamentos en la Zona Sur. El mapa permite verificar su distribución espacial y detectar posibles registros alejados del patrón esperado. Estos casos se conservan con la clasificación original y se consideran observaciones de calidad de datos, ya que no se dispone de polígonos oficiales que permitan reclasificarlos de forma automática.
| Etapa | Registros |
|---|---|
| Base limpia | 8321 |
| Tipo = Apartamento | 5100 |
| Apartamento en Zona Sur | 2848 |
| id | zona | barrio | tipo | preciom | areaconst | estrato | parqueaderos | banios | habitaciones |
|---|---|---|---|---|---|---|---|---|---|
| 4386 | Zona Sur | acopi | Apartamento | 310 | 137 | 5 | 2 | 3 | 4 |
| 5424 | Zona Sur | acopi | Apartamento | 320 | 108 | 4 | 2 | 3 | 3 |
| 6271 | Zona Sur | acopi | Apartamento | 385 | 103 | 5 | 2 | 2 | 3 |
El Análisis Exploratorio de Datos (EDA) permite identificar, antes de la modelación, el comportamiento de las variables y su relación con el precio, así como patrones, dispersión y valores atípicos. En la Solicitud 2, la variable con mayor asociación lineal con el precio es areaconst (Pearson = 0.756; Spearman = 0.868). En conjunto, el EDA permite reconocer qué atributos presentan mayor relación con el precio y sustenta el uso posterior de una regresión múltiple.
Nota: La variable zona no se analiza dentro de esta submuestra, dado que la Base 2 fue previamente segmentada y todos los registros corresponden a la Zona Sur.
Dentro de la Base 2 la variable zona no presenta
variabilidad, ya que todos los registros corresponden a Zona Sur. Por
tanto, su efecto se controla previamente mediante la segmentación y no
se incluye como predictor dentro de esta submuestra.
| Variable | Pearson | Spearman |
|---|---|---|
| areaconst | 0.756 | 0.868 |
| banios | 0.713 | 0.705 |
| parqueaderos | 0.690 | 0.687 |
| estrato | 0.670 | 0.754 |
| habitaciones | 0.309 | 0.379 |
Interpretación. Las correlaciones permiten ordenar la fuerza de asociación bivariada con el precio. La variable con mayor relación lineal es areaconst (Pearson = 0.756). Las diferencias entre Pearson y Spearman permiten además identificar si la relación es estrictamente lineal o principalmente monotónica. Estas asociaciones son descriptivas y no sustituyen el análisis conjunto del modelo múltiple.
Inferencia principal. Los coeficientes y su significancia se reportan combinando las cinco imputaciones mediante las reglas de Rubin. Los diagnósticos y predicciones posteriores utilizan una base imputada representativa.
| Variable | Coeficiente | Error estándar | t | p-valor | IC 95% inferior | IC 95% superior | Significativo |
|---|---|---|---|---|---|---|---|
| (Intercept) | -266.765 | 13.284 | -20.082 | < 0,001 | -292.815 | -240.714 | Sí |
| areaconst | 1.361 | 0.055 | 24.897 | < 0,001 | 1.252 | 1.469 | Sí |
| estrato | 60.534 | 2.930 | 20.662 | < 0,001 | 54.759 | 66.310 | Sí |
| habitaciones | -19.259 | 3.422 | -5.628 | < 0,001 | -25.974 | -12.544 | Sí |
| parqueaderos | 67.955 | 7.053 | 9.635 | < 0,001 | 51.486 | 84.424 | Sí |
| banios | 46.484 | 3.178 | 14.628 | < 0,001 | 40.237 | 52.731 | Sí |
| Métrica | Valor |
|---|---|
| R² | 0.7555 |
| R² ajustado | 0.7551 |
| RMSE residual | 96.81 |
| Estadístico F | 1756.46 |
| p-valor global | < 0,001 |
Interpretación. El modelo explica aproximadamente el 75.55 % de la variabilidad observada en el precio de los apartamentos de la Zona Sur. El \(R^2\) ajustado es 75.51 %, por lo que el poder explicativo se mantiene aun considerando el número de predictores incluidos.
El modelo es globalmente significativo (\(F = 1756.5\); \(p < 0,001\)), lo que indica que las variables consideradas aportan conjuntamente a la explicación del precio. El RMSE residual es de $96,81 M, por lo que las predicciones individuales deben interpretarse junto con sus intervalos de predicción.
| Supuesto | Evidencia | Lectura |
|---|---|---|
| Homoscedasticidad | Breusch-Pagan: p < 0,001 | Hay evidencia de heterocedasticidad. |
| Normalidad de residuos | Shapiro-Wilk: p < 0,001 | La normalidad estricta se rechaza; revisar Q-Q y tamaño muestral. |
| Multicolinealidad | VIF máximo = 2.47 | No se observa colinealidad severa. |
Interpretación. Se evidencia heterocedasticidad en los residuos (Breusch-Pagan, \(p < 0,001\)). También se rechaza la normalidad estricta de los residuos (Shapiro-Wilk, \(p < 0,001\)). En contraste, el VIF máximo de 2.47 no evidencia multicolinealidad severa.
En conjunto, estos resultados indican que el modelo puede utilizarse como herramienta explicativa y predictiva, pero la inferencia debe interpretarse con cautela cuando se presenten desviaciones de los supuestos clásicos. Por ello, el análisis se complementa con errores estándar robustos HC3 e intervalos de predicción.
Las observaciones que superan el umbral de referencia deben revisarse como potencialmente influyentes, pero no eliminarse automáticamente. En el mercado inmobiliario pueden corresponder a propiedades legítimamente atípicas y no necesariamente a errores de registro.
Interpretación. La validación cruzada identifica a M2 · RLM con estrato categórico como la especificación con mejor desempeño predictivo, con RMSE de 92.683, MAE de 54.568 y un \(R^2\) predictivo de 0.775. Tratar el estrato como variable categórica mejora ligeramente el desempeño frente al modelo oficial M1. La transformación logarítmica M3 presenta un RMSE de 123.467 y un \(R^2\) predictivo de 0.601. Se mantiene M1 como modelo principal por corresponder a la especificación solicitada y se utiliza la comparación como análisis de sensibilidad.
| Modelo | RMSE CV | MAE CV | R² predictivo CV |
|---|---|---|---|
| M2 · RLM con estrato categórico | 92.683 | 54.568 | 0.775 |
| M1 · RLM exigido | 98.237 | 58.327 | 0.748 |
| M3 · Log-precio + estrato categórico | 123.467 | 56.372 | 0.601 |
M1 es el modelo requerido por la actividad. M2 evalúa si tratar el estrato como categoría mejora el desempeño. M3 explora una transformación logarítmica del precio. Esta comparación funciona como análisis de sensibilidad y no reemplaza la interpretación del RLM oficial.
Interpretación. Para el perfil solicitado, el modelo estima un precio de $693,3 M en estrato 5 y de $753,3 M en estrato 6. Frente al crédito disponible de $850 M, las holguras estimadas son de $156,7 M y $96,7 M, respectivamente.
Los intervalos de predicción incorporan la variabilidad individual del mercado y, por tanto, deben interpretarse como un rango plausible para una vivienda específica y no como un precio exacto.
| Escenario | Área | Parq. | Baños | Hab. | Precio estimado | PI 95% inf. | PI 95% sup. | Crédito | Brecha |
|---|---|---|---|---|---|---|---|---|---|
| Estrato 5 | 300 | 3 | 3 | 5 | $693,3 M | $502,5 M | $884,2 M | $850 M | $156,7 M |
| Estrato 6 | 300 | 3 | 3 | 5 | $753,3 M | $562,4 M | $944,2 M | $850 M | $ 96,7 M |
Se reporta intervalo de predicción porque la decisión se refiere al precio de una vivienda individual. Este intervalo incorpora tanto la incertidumbre del promedio estimado como la variabilidad propia del mercado.
| ID | Barrio | Precio | Área | Estrato | Parqueaderos | Baños | Habitaciones | Precio/m² | Holgura crédito | Cumplimiento | Observación |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 8036 | seminario | $530 M | 256 | 5 | 3 | 5 | 5 | 2.070 | $320 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 7512 | seminario | $670 M | 300 | 5 | 3 | 5 | 6 | 2.233 | $180 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 7182 | guadalupe | $730 M | 573 | 5 | 3 | 8 | 5 | 1.274 | $120 M | Cumple totalmente | Cumple estrato, dotación mínima y presupuesto |
| 5306 | ciudadela pasoancho | $650 M | 275 | 5 | 2 | 5 | 5 | 2.364 | $200 M | Alternativa cercana | No cumple el mínimo de parqueaderos |
| 6175 | capri | $350 M | 270 | 5 | 3 | 3 | 4 | 1.296 | $500 M | Alternativa cercana | No cumple el mínimo de habitaciones |
| Dimensión | Vivienda 1 | Vivienda 2 |
|---|---|---|
| Segmento analizado | Casa · Zona Norte | Apartamento · Zona Sur |
| Tamaño de muestra | 664 | 2848 |
| R² modelo oficial | 0.653 | 0.756 |
| R² ajustado | 0.65 | 0.755 |
| Mejor RMSE en validación cruzada | 158.9 | 92.68 |
| Número de ofertas priorizadas | 5 | 5 |
| Presupuesto | $350 M | $850 M |
La comparación evidencia dos escenarios comerciales distintos. La Vivienda 1 opera con un presupuesto más restringido frente a su rango de predicción central ($315,2 M – $391 M), mientras que la Vivienda 2 dispone de una mayor holgura frente a su rango estimado ($693,3 M – $753,3 M). En ambos casos, la decisión final se sustenta en la combinación entre capacidad explicativa del modelo, desempeño predictivo en validación cruzada y existencia de ofertas observadas compatibles con las restricciones del cliente.
El modelo estima un precio central entre $315,2 M y $391 M para los estratos permitidos, frente a un crédito máximo de $350 M. Esto configura una búsqueda con restricción presupuestal relevante: el escenario de menor precio esperado puede ser viable, mientras que el de mayor valor supera el presupuesto. Dentro de las ofertas priorizadas se identificaron 5 alternativas que cumplen totalmente las condiciones mínimas. Se recomienda iniciar la validación comercial por el inmueble ID 1163, con precio de $350 M, y posteriormente verificar estado físico, documentación, costos de cierre y condiciones de negociación. La recomendación no debe interpretarse como una tasación definitiva: el intervalo de predicción muestra una dispersión considerable del mercado, por lo que la visita y la debida diligencia siguen siendo indispensables.
El modelo estima un precio central entre $693,3 M y $753,3 M para los estratos 5 y 6, frente a un presupuesto de $850 M. En comparación con la primera solicitud, esta búsqueda presenta mayor holgura presupuestal, por lo que la decisión puede priorizar el ajuste al perfil requerido y no únicamente el precio. Se identificaron 3 alternativas que cumplen totalmente las condiciones mínimas dentro del ranking. La primera visita sugerida corresponde al inmueble ID 8036, con precio de $530 M. La holgura disponible permite comparar además ubicación fina, estado del inmueble, administración y amenidades antes de tomar una decisión. Se recomienda utilizar la predicción como referencia de mercado y complementar la selección con visita, revisión documental y comparación de costos recurrentes antes de cerrar la compra.
La calidad de los datos se trató de forma
diferenciada. Se estandarizaron tipos, se eliminaron únicamente
duplicados exactos y se revisaron valores físicamente imposibles. Los
faltantes mínimos se manejaron mediante casos completos, mientras que
parqueaderos, por su proporción sustancial de ausencia, se
imputó mediante PMM. La inferencia de coeficientes incorpora la
incertidumbre de esa imputación mediante las reglas de Rubin.
La zona fue sometida a depuración espacial antes de construir las submuestras. La clasificación original se conservó para trazabilidad, pero el análisis utilizó una zona depurada mediante KNN basada en latitud y longitud. Esto permite corregir observaciones espacialmente discordantes sin redefinir indiscriminadamente la estructura geográfica del mercado.
El modelo principal responde al enunciado, pero no se evaluó de forma aislada. La regresión lineal múltiple exigida se comparó con especificaciones alternativas mediante validación cruzada de 10 particiones. De esta manera, el ajuste dentro de muestra \(R^2\) se complementó con RMSE, MAE y \(R^2\) predictivo para evaluar capacidad de generalización.
La inferencia requiere cautela cuando los supuestos clásicos no se cumplen. La heterocedasticidad y las desviaciones de normalidad observadas en los residuos no invalidan automáticamente el modelo, pero sí justifican complementar la lectura con errores estándar robustos HC3, gráficos diagnósticos y revisión de observaciones influyentes.
La significancia estadística no equivale a causalidad ni a importancia económica. Los coeficientes se interpretan como asociaciones condicionadas a las demás variables incluidas. Un efecto estadísticamente significativo puede ser comercialmente pequeño y, de igual forma, variables relevantes para el mercado pueden no aparecer en la base.
Las predicciones individuales deben leerse con intervalos de predicción. El precio puntual es una referencia central y no una tasación exacta. Los intervalos amplios reflejan heterogeneidad del mercado y la ausencia de atributos como microlocalización, antigüedad, estado, acabados, vista, administración y amenidades.
La recomendación comercial combina evidencia estadística y oferta real. La selección de inmuebles no se basa exclusivamente en el precio predicho. Se integran presupuesto, estrato, área, dotación mínima, cercanía al perfil, desempeño del modelo y existencia de alternativas observadas.
La Vivienda 1 y la Vivienda 2 requieren estrategias distintas. La primera presenta una restricción presupuestal más exigente, por lo que la negociación y priorización de atributos es crítica. La segunda cuenta con mayor holgura financiera, permitiendo priorizar cumplimiento del perfil y calidad del inmueble sobre el precio mínimo.
El análisis constituye apoyo para la decisión, no sustitución del criterio inmobiliario. Antes de una compra se requiere complementar la evidencia cuantitativa con visita, validación jurídica, revisión del estado físico, costos de administración, impuestos y condiciones de negociación.
La inferencia combinada mediante las reglas de Rubin se presenta
ahora en la sección principal de cada modelo, en lugar de dejarse
únicamente como análisis complementario. Esto permite que la
significancia estadística refleje explícitamente la incertidumbre
introducida por la imputación de parqueaderos.
| Solicitud | Imputaciones generadas | Parqueaderos imputados por base |
|---|---|---|
| Vivienda 1 | 5 | 233 |
| Vivienda 2 | 5 | 464 |
Cuando Breusch-Pagan detecta heterocedasticidad, los coeficientes MCO se mantienen como estimaciones del modelo exigido, pero puede revisarse la inferencia con errores estándar robustos HC3.
Los errores estándar robustos HC3 permiten corregir la inferencia cuando la varianza de los residuos no es constante. Mantienen los mismos coeficientes estimados por MCO, pero recalculan su incertidumbre, obteniendo p-valores e intervalos de confianza más confiables ante heterocedasticidad y observaciones influyentes.
Para la Vivienda 1, el área construida, el estrato, los parqueaderos y los baños continúan siendo estadísticamente significativos (\(p<0,05\)). Manteniendo las demás variables constantes, cada m² adicional se asocia con un aumento promedio de $0,75 millones, un nivel adicional de estrato con $75,73 millones, un parqueadero adicional con $18,67 millones y un baño adicional con $25,15 millones. Las habitaciones no presentan un efecto estadísticamente significativo (\(p=0,454\)).
Para la Vivienda 2, todas las variables resultan significativas (\(p<0,05\)). El área, estrato, parqueaderos y baños presentan efectos positivos sobre el precio. Las habitaciones muestran un coeficiente negativo de -$18,66 millones; este resultado debe interpretarse manteniendo constante el área y las demás características: entre apartamentos comparables en tamaño, un mayor número de habitaciones se asocia con un menor precio, posiblemente por una mayor división del espacio disponible.
En conjunto, el análisis HC3 refuerza la robustez de la inferencia de los modelos frente a la heterocedasticidad. Sin embargo, esta corrección no elimina la heterocedasticidad ni corrige otros posibles problemas del modelo; únicamente permite obtener una evaluación más confiable de la significancia estadística de los coeficientes.
| Variable | Coeficiente | Error estándar robusto HC3 | Estadístico t | p-valor | Significativo al 5% |
|---|---|---|---|---|---|
| (Intercept) | -224.2903 | 34.6015 | -6.4821 | < 0,001 | Sí |
| areaconst | 0.7543 | 0.1338 | 5.6359 | < 0,001 | Sí |
| estrato | 75.7278 | 10.4949 | 7.2157 | < 0,001 | Sí |
| habitaciones | 4.1930 | 5.5967 | 0.7492 | 0,4540 | No |
| parqueaderos | 18.6686 | 6.7670 | 2.7588 | 0,0060 | Sí |
| banios | 25.1511 | 8.9599 | 2.8071 | 0,0051 | Sí |
| Variable | Coeficiente | Error estándar robusto HC3 | Estadístico t | p-valor | Significativo al 5% |
|---|---|---|---|---|---|
| (Intercept) | -266.6746 | 20.9193 | -12.7478 | < 0,001 | Sí |
| areaconst | 1.3388 | 0.3481 | 3.8463 | < 0,001 | Sí |
| estrato | 59.9422 | 3.6222 | 16.5484 | < 0,001 | Sí |
| habitaciones | -18.6576 | 6.1324 | -3.0425 | 0,0024 | Sí |
| parqueaderos | 71.4780 | 14.3702 | 4.9740 | < 0,001 | Sí |
| banios | 45.8375 | 7.3424 | 6.2429 | < 0,001 | Sí |
## R version 4.5.1 (2025-06-13 ucrt)
## Platform: x86_64-w64-mingw32/x64
## Running under: Windows 11 x64 (build 26100)
##
## Matrix products: default
## LAPACK version 3.12.1
##
## locale:
## [1] LC_COLLATE=Spanish_Colombia.utf8 LC_CTYPE=Spanish_Colombia.utf8
## [3] LC_MONETARY=Spanish_Colombia.utf8 LC_NUMERIC=C
## [5] LC_TIME=Spanish_Colombia.utf8
##
## time zone: America/Bogota
## tzcode source: internal
##
## attached base packages:
## [1] stats graphics grDevices utils datasets methods base
##
## other attached packages:
## [1] mice_3.19.0 scales_1.4.0 sandwich_3.1-3
## [4] lmtest_0.9-40 zoo_1.9-0 car_3.1-5
## [7] carData_3.0-6 kableExtra_1.4.0 DT_0.34.0
## [10] leaflet_2.2.3 plotly_4.12.0 purrr_1.2.1
## [13] tidyr_1.3.2 dplyr_1.1.4 paqueteMODELOS_0.1.0
## [16] summarytools_1.1.5 knitr_1.51 gridExtra_2.3.1
## [19] GGally_2.4.0 ggplot2_4.0.1 broom_1.0.13
## [22] boot_1.3-31
##
## loaded via a namespace (and not attached):
## [1] Rdpack_2.6.6 tcltk_4.5.1 rlang_1.1.7
## [4] magrittr_2.0.4 otel_0.2.0 matrixStats_1.5.0
## [7] compiler_4.5.1 mgcv_1.9-3 reshape2_1.4.5
## [10] systemfonts_1.3.1 vctrs_0.6.5 stringr_1.6.0
## [13] pkgconfig_2.0.3 shape_1.4.6.1 fastmap_1.2.0
## [16] backports_1.5.1 magick_2.9.1 labeling_0.4.3
## [19] pander_0.6.6 rmarkdown_2.31 nloptr_2.2.1
## [22] xfun_0.55 glmnet_4.1-10 jomo_2.7-6
## [25] cachem_1.1.0 jsonlite_2.0.0 pan_1.9
## [28] R6_2.6.1 bslib_0.12.0 stringi_1.8.7
## [31] RColorBrewer_1.1-3 rpart_4.1.24 lubridate_1.9.5
## [34] jquerylib_0.1.4 Rcpp_1.1.1 iterators_1.0.14
## [37] base64enc_0.1-6 leaflet.providers_3.0.0 FNN_1.1.4.1
## [40] Matrix_1.7-3 splines_4.5.1 nnet_7.3-20
## [43] timechange_0.4.0 tidyselect_1.2.1 rstudioapi_0.18.0
## [46] abind_1.4-8 yaml_2.3.12 codetools_0.2-20
## [49] lattice_0.22-7 tibble_3.3.1 plyr_1.8.9
## [52] withr_3.0.3 S7_0.2.1 evaluate_1.0.5
## [55] survival_3.8-3 ggstats_0.13.0 xml2_1.5.1
## [58] pillar_1.11.1 checkmate_2.3.4 foreach_1.5.2
## [61] reformulas_0.4.4 generics_0.1.4 minqa_1.2.8
## [64] glue_1.8.0 lazyeval_0.2.2 tools_4.5.1
## [67] data.table_1.18.0 lme4_1.1-38 rapportools_1.2
## [70] grid_4.5.1 rbibutils_2.4.1 crosstalk_1.2.2
## [73] nlme_3.1-168 Formula_1.2-5 cli_3.6.5
## [76] textshaping_1.0.4 viridisLite_0.4.3 svglite_2.2.2
## [79] gtable_0.3.6 sass_0.4.10 digest_0.6.39
## [82] htmlwidgets_1.6.4 farver_2.1.2 htmltools_0.5.9
## [85] lifecycle_1.0.5 httr_1.4.7 mitml_0.4-5
## [88] MASS_7.3-65