Informe ejecutivo

El análisis evaluó dos solicitudes inmobiliarias de C&A a partir de una base maestra depurada, estandarizada y completada mediante MICE. Para cada caso se realizó exploración de datos, regresión lineal múltiple por MCO, selección stepwise, validación cruzada, diagnóstico de supuestos, predicción del precio y selección de ofertas reales compatibles con el presupuesto. A continuación se presentanlos principales hallazgos:

Resultados principales

Resumen ejecutivo de los dos casos
Caso Base analizada Modelo identificado Desempeño Predicción y presupuesto
Vivienda 1: casa, Zona Norte 717 ofertas Stepwise AIC: preciom ~ areaconst + estrato_f + parqueaderos + banios R²=0,679; R² CV=0,662 Estrato 4: 309,3 M; estrato 5: 364,7 M; crédito: 350 M
Vivienda 2: apartamento, Zona Sur 2.760 ofertas Modelo completo retenido por stepwise: preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios R²=0,787; R² CV=0,770 Estrato 5: 636,2 M; estrato 6: 792,3 M; crédito: 850 M

Caso 1 — Casa en Zona Norte. Sobre 717 casas, el modelo seleccionado por stepwise conserva área, estrato, parqueaderos y baños. Explica cerca del 68 % de la variación observada y alcanza un R² predictivo cercano a 0,66. Para una casa de 200 m², un parqueadero y dos baños, el precio de oferta estimado es 309,3 millones en estrato 4 y 364,7 millones en estrato 5. El escenario de estrato 4 se ajusta mejor al crédito de 350 millones; el de estrato 5 supera el presupuesto en la estimación puntual, aunque existen anuncios reales de ese estrato por debajo del límite. Las opciones ID 1144 (La Merced) e ID 1343 (La Flora) constituyen el primer grupo de visitas, en donde ambas se ofrecen en 320 millones, coinciden con 200 m² y cuatro habitaciones y dejan 30 millones de holgura.

Caso 2 — Apartamento en Zona Sur. Se analizaron 2.760 apartamentos. El procedimiento stepwise no eliminó ninguna variable, por lo que el modelo identificado es el modelo completo con área, estrato, habitaciones, parqueaderos y baños. Su R² es aproximadamente 0,787 y el R² predictivo de validación cruzada es cercano a 0,770. Para 300 m², tres parqueaderos, tres baños y cinco habitaciones, el precio estimado es 636,2 millones en estrato 5 y 792,3 millones en estrato 6. Ambos valores puntuales están dentro del crédito de 850 millones. Sin embargo, la solicitud es atípica en este mercado, ya que 300 m² está en el percentil 99 del área y solo 29 apartamentos de la base tienen al menos 270 m² y tres parqueaderos. El estrato 5 ofrece la mayor seguridad presupuestal, esto es, la probabilidad de que un apartamento comparable se anuncie por no más de 850 millones ronda el 92 %, frente a cerca del 46 % en estrato 6, donde un apartamento comparable puede superar el crédito con facilidad.

Evidentemente, los dos mercados no se comportan igual. El metro cuadrado se paga casi el doble en los apartamentos del sur (1,34 frente a 0,74 millones por m²), los parqueaderos y baños valen más en apartamentos, y el estrato pesa más en las casas. Estas diferencias son estadísticamente claras y justifican haber estimado un modelo separado para cada solicitud.

Recomendación al cliente

Para la casa, se recomienda iniciar visitas con las opciones 1144 y 1343 y utilizar el resto de la lista corta como alternativas de negociación. Para el apartamento, no existe una oferta que cumpla simultáneamente todos los criterios estrictos; por ello, se ampliaron de forma explícita los rangos de búsqueda para identificar alternativas cercanas a la solicitud original. La opción 7512 en Seminario es la más cercana estructuralmente: 300 m², tres parqueaderos y precio de 670 millones, aunque tiene seis habitaciones. La opción 8036, también en Seminario, conserva tres parqueaderos y cinco habitaciones, cuesta 530 millones y sacrifica 44 m² de área. Las cinco alternativas del caso 2 permanecen dentro del crédito y se presentan en el mapa del anexo técnico.

Anexo técnico

Este documento presenta el desarrollo completa para las dos solicitudes: primero analiza las casas de la Zona Norte y después repite el procedimiento para los apartamentos de la Zona Sur. Ambas aplicaciones parten de una única base maestra estandarizada, sin duplicados originales y completada mediante MICE.

El procedimiento aplicado es el siguiente:

  • Preparación de datos
  • Filtro de viviendas: casas (base1) y apartamentos (base2)
  • Análisis Exploratorio EDA
  • Construcción del modelo de regresión lineal
  • stepwise y validación cruzada
  • validación de los supuestos del modelo
  • inferencia y predicciones

Etapa 1. Preparación de datos y construcción de base1

Carga y verificación inicial

La base original contiene 8.322 registros y 13 variables originales. Se agregó id_fila_original para mantener la trazabilidad durante la limpieza.

Los registros sin la información mínima para identificar una oferta se excluyeron antes de la imputación. Esta decisión evita que MICE tenga que reconstruir artificialmente casi toda una vivienda.

Tabla 1. Trazabilidad de la construcción de la base corregida
Etapa Registros Eliminados en la etapa
Base original 8.322 0
Base con registros estructuralmente válidos 8.319 3
Base estandarizada y sin duplicados originales 8.262 57
Base corregida y completada mediante MICE 8.262 0

Estandarización de categorías

Los textos se normalizaron eliminando espacios duplicados, diferencias de mayúsculas y minúsculas, acentos inconsistentes y errores de codificación. Las categorías de zona y tipo se reconstruyeron mediante un diccionario cerrado, de modo que cualquier valor no reconocido detenga el proceso.

Tabla 2. Categorías estandarizadas de zona antes de eliminar duplicados
Zona Número de ofertas
Zona Centro 124
Zona Norte 1.920
Zona Oeste 1.198
Zona Oriente 351
Zona Sur 4.726
Tabla 3. Categorías estandarizadas de tipo antes de eliminar duplicados
Tipo Número de ofertas
Apartamento 5.100
Casa 3.219

Los valores iguales a cero en baños y habitaciones se trataron como datos no informados, porque no son coherentes con ofertas residenciales clasificadas como casas o apartamentos. En total se identificaron 76 registros afectados por al menos una de estas dos condiciones.

Eliminación de duplicados

Acto seguido, los duplicados se buscaron después de estandarizar las categorías. Dos filas se consideraron duplicadas cuando coincidían en todas las características de la oferta, excluyendo id e id_fila_original. Se conservó la primera aparición y se guardó el detalle de las filas retiradas para auditoría.

Se eliminaron 57 duplicados adicionales antes del procedimiento de imputación por MICE. Después de completar los faltantes se identificaron 7 coincidencias adicionales de perfil. Estas coincidencias se conservaron y se marcaron, porque fueron creadas por los valores imputados y no demuestran que dos registros correspondan al mismo inmueble.

Tabla 4. Controles de calidad de la base corregida
Indicador Valor
Registros estructuralmente excluidos 3
Duplicados originales eliminados antes de MICE 57
Duplicados originales pendientes 0
Coincidencias adicionales detectadas después de MICE (conservadas) 7
Registros pertenecientes a grupos coincidentes post-MICE 14
Faltantes en la base corregida 0
Categorías de tipo 2
Categorías de zona 5

Imputación de datos faltantes con MICE

Después de eliminar las filas estructuralmente inválidas y los duplicados, los faltantes restantes corresponden a piso, parqueaderos, banios y habitaciones. Estas variables se completaron mediante ecuaciones encadenadas y predictive mean matching (PMM).

El modelo de imputación utiliza precio, área, estrato, tipo, zona, coordenadas y las demás características estructurales. Se generaron 5 imputaciones, con 10 iteraciones y semilla fija 2026. Para obtener una única base operativa reproducible se empleó la primera completación; el objeto con las cinco versiones se conserva en salidas_actividad2_puntos_1_a_7/imputaciones_mice.rds.

Tabla 5. Valores completados mediante MICE
Variable Valores completados Porcentaje
Piso 2.625 31,8 %
Parqueaderos 1.592 19,3 %
Baños 45 0,5 %
Habitaciones 65 0,8 %

La siguiente figura (Fig 1) permite revisar la estabilidad de las medias y desviaciones estándar de las cadenas de imputación. Lo que se busca en este tipo de gráficos es que las líneas no sean idénticas, sino trayectorias mezcladas y sin una tendencia sistemática persistente.

Figura 1. Convergencia de las cadenas de MICE para las variables imputadas.

Figura 1. Convergencia de las cadenas de MICE para las variables imputadas.

Al respecto se puede afirmar que:

La base vivienda_corregida contiene 8.262 ofertas, sin valores faltantes y no conserva duplicados detectados en los datos originales estandarizados. Las coincidencias de perfil generadas después de MICE permanecen identificadas mediante una bandera de auditoría. Esta es la única base de datos maestra utilizada para generar los filtros posteriores, según lo solicita el enunciado del caso.

Filtro y comprobación de base1

Filtro solicitado: Casas ubicadas en la zona Norte

El filtro se aplicó únicamente después de finalizar la limpieza de la base completa:

base1 <- vivienda_corregida %>%
  filter(
    tipo == "Casa",
    zona == "Zona Norte"
  )

La consulta recupera 717 ofertas. La siguiente tabla ubica este resultado dentro de la distribución completa por tipo y zona.

Tabla 6. Número de ofertas por tipo de vivienda y zona
tipo Zona Centro Zona Norte Zona Oeste Zona Oriente Zona Sur
Apartamento 24 1191 1026 61 2760
Casa 100 717 169 289 1925
Tabla 7. Comprobación del filtro de base1
Indicador Resultado
Número de registros 717
Identificadores originales únicos 717
Tipos diferentes 1
Zonas diferentes 1
Todas las ofertas son casas
Todas pertenecen a Zona Norte
Valores faltantes 0
Coordenadas faltantes 0
Tabla 8. Primeros tres registros de base1
ID Zona Piso Estrato Precio (millones) Área construida (m²) Parqueaderos Baños Habitaciones Tipo Barrio Longitud Latitud
1209 Zona Norte 2 5 320 150 2 4 6 Casa Acopi -76.51341 3.47968
1592 Zona Norte 2 5 780 380 2 3 3 Casa Acopi -76.51674 3.48721
4057 Zona Norte 2 6 750 445 2 7 6 Casa Acopi -76.52950 3.38527

Auditoría espacial de las coordenadas

El enunciado pregunta si todos los puntos de base1 caen en la Zona Norte o si aparecen valores en otras zonas. Como no se dispone de los polígonos oficiales de zonificación y no es alcance del ejercicio, se aplican dos controles complementarios:

  1. Control de coordenadas compartidas: puntos rojos, coordenadas que también aparecen en ofertas clasificadas en otra zona de la base completa.
  2. Control latitudinal: puntos salmón, casas registradas como Zona Norte cuya latitud no supera el tercer cuartil de la Zona Sur (\(3,408\)). La línea discontinua del mapa marca ese umbral. Las zonas de Cali se distribuyen de norte a sur en bandas de latitud bastante nítidas, como muestra la Tabla 9b; una casa del norte situada por debajo de ese umbral está, geográficamente, en la mitad sur de la ciudad.
Tabla 9b. Distribución de la latitud por zona en la base corregida
Zona Ofertas Latitud Q1 Latitud mediana Latitud Q3 Longitud mediana
Zona Norte 1.908 3,457 3,472 3,485 -76,520
Zona Oeste 1.195 3,438 3,449 3,452 -76,549
Zona Centro 124 3,436 3,440 3,446 -76,529
Zona Oriente 350 3,423 3,438 3,450 -76,507
Zona Sur 4.685 3,370 3,385 3,408 -76,531

Figura 2. Localización de las ofertas de base1 con los dos controles espaciales.

Se identifican 82 ofertas con coordenadas asociadas a más de una zona y 68 ofertas (9,5 % de base1) con una latitud propia de la Zona Sur. El mapa lo muestra con claridad, existe un conglomerado de casas “de la Zona Norte” en el extremo sur de la ciudad.

Tabla 9c. Barrios con más casas de base1 situadas en latitudes del sur y consistencia del resto del barrio
Barrio Casas de base1 con latitud del sur Ofertas del barrio registradas en Zona Norte De ellas, con latitud del norte
Acopi 42 156 30
Cali 10 33 0
La Flora 2 362 324
Urbanizacion La Flora 2 83 72
El Gran Limonar 1 1 0
Juanambu 1 45 11
La Floresta 1 2 0
Las Granjas 1 1 0

Qué explica estas anomalías? Al respecto, se plantean dos hipótesis compatibles con la evidencia:

  • Coordenada mal capturada con zona correcta. Es el caso dominante. El barrio Acopi concentra 42 de los 68 casos; se trata de un sector industrial y residencial del norte de la ciudad (límite con Yumbo) y, sin embargo, la mayoría de sus ofertas están geocodificadas en el sur. Cuando un barrio del norte aparece con latitudes del sur, lo que falla es el geocodificador (uso de un centroide por defecto, confusión con un homónimo o error de captura), no la clasificación de zona. Otros barrios de la tabla (La Flora, San Vicente, Vipasa, Villa del Prado) sí están mayoritariamente en latitudes del norte y presentan uno o dos puntos aislados, lo que apunta al mismo tipo de error puntual.
  • Zona mal etiquetada con coordenada correcta. Es plausible en barrios genéricos o ambiguos (“Cali”, “Zona Oriente”, “Valle del Lili”, “El Gran Limonar”), donde la etiqueta de zona no coincide ni con la coordenada ni con el nombre del barrio.

Implicaciones para el análisis. La zona registrada es la variable que define la población del modelo (casas del norte), y para el filtro se conserva tal como viene en la base, porque la evidencia indica que en la mayoría de los casos es la coordenada la que está mal, no la zona. Sin embargo, las coordenadas afectan a dos productos del informe: el mapa de base1 y el mapa de ofertas recomendadas. Por ello: (i) en la Etapa 4 se reestima el modelo sin las 68 casas de latitud más meridional para comprobar que los coeficientes no dependen de ellas, y (ii) en la Etapa 6, la selección de ofertas exige coordenadas coherentes con la Zona Norte, de modo que el agente inmobiliario no reciba una dirección que no corresponde al inmueble anunciado.

Este control no demuestra por sí solo que un punto esté dentro o fuera de la Zona Norte. Para una validación cartográfica definitiva se necesitaría el polígono oficial de la zonificación y una unión espacial. En este análisis se conserva la clasificación de zona declarada en la base.

Etapa 2. Análisis exploratorio de base1

Descripción general

El análisis utiliza las mismas 717 ofertas que se emplearán en la regresión. El precio está expresado en millones de pesos.

Adicionalmente, en el EDA, el estrato se usa como variable ordinal para resumir su asociación con el precio; en la regresión se incorpora como factor para no imponer que los saltos entre estratos consecutivos sean iguales.

Tabla 9. Resumen descriptivo de las variables del modelo
Variable N Media Desviación estándar Q1 Mediana Q3 Mínimo Máximo
Precio (millones) 717 445,7 269,1 260,0 390,0 550,0 89,0 1.940,0
Área construida (m²) 717 264,6 167,6 140,0 240,0 337,0 30,0 1.440,0
Estrato 717 4,2 1,0 3,0 4,0 5,0 3,0 6,0
Parqueaderos 717 2,0 1,3 1,0 2,0 2,0 1,0 10,0
Baños 717 3,6 1,5 2,0 3,0 4,0 1,0 10,0
Habitaciones 717 4,6 1,7 3,0 4,0 5,0 1,0 10,0

En términos de precio, las viviendas analizadas presentan un valor promedio de 445,7 millones de pesos, mientras que la mediana se sitúa en 390,0 millones. Esto indica que aproximadamente la mitad de las ofertas registra precios iguales o inferiores a este último valor. El hecho de que el promedio sea superior a la mediana sugiere una distribución asimétrica hacia valores altos, influenciada por algunas propiedades con precios considerablemente elevados, que alcanzan hasta 1.940,0 millones. Asimismo, el 50 % central de las ofertas se concentra entre 260,0 y 550,0 millones, intervalo que permite caracterizar mejor el rango de precios en el que se ubica la parte central del mercado analizado.

En relación con el tamaño de las viviendas, el área construida promedio es de 264,6 m², mientras que la mediana alcanza 240,0 m², lo que significa que aproximadamente la mitad de las propiedades tiene un área igual o inferior a este valor. El 50 % central de las viviendas presenta áreas comprendidas entre 140,0 y 337,0 m². No obstante, el rango total se extiende desde 30,0 hasta 1.440,0 m², evidenciando una marcada heterogeneidad en el tamaño de las propiedades ofrecidas.

Respecto a las características físicas, el 50 % central de las viviendas se ubica entre los estratos 3 y 5, con una mediana de 4. En términos de dotación, una vivienda típica dispone de 2 parqueaderos, 3 baños y 4 habitaciones. Por su parte, los valores promedio se sitúan en 2,0 parqueaderos, 3,6 baños y 4,6 habitaciones, respectivamente.

En conjunto, estos resultados muestran que la oferta de casas de la Zona Norte de Cali presenta una considerable heterogeneidad en precio, tamaño y dotaciones. La diferencia entre las medidas centrales y los valores máximos evidencia la presencia de algunas propiedades de gran superficie y alto valor que se alejan de las características más frecuentes de la muestra.

Correlaciones con el precio

Figura 3. Matriz interactiva de correlaciones de Pearson.

Figura 4. Correlaciones de Pearson y Spearman entre el precio y cada predictor.

En conjunto, los dos gráficos muestran que todas las características analizadas presentan una relación positiva con el precio de los inmuebles en Cali, es decir, en términos generales, las propiedades tienden a tener precios más altos a medida que aumentan estas características.

La asociación más fuerte corresponde al área construida, con correlaciones aproximadas de \(r=0,732\), lo que indica que el tamaño del inmueble es la variable más estrechamente relacionada con su precio, seguida del estrato (\(r=0,612\)), los baños (\(r=0,577\)), los parqueaderos (\(r=0,503\)) que también muestran relaciones positivas de magnitud moderada a relativamente alta; por su parte, el número de habitaciones (\(r=0,380\)) presenta la asociación más débil con el precio.

Las correlaciones de Spearman son mayores para el área (\(r_s=0,815\)) y el estrato (\(r_s=0,711\)). El hecho de que las correlaciones de Spearman sean sistemáticamente superiores a las de Pearson sugiere que estas relaciones presentan un comportamiento monotónico creciente, pero no necesariamente perfectamente lineales y que pueden existir valores extremos que afecten en mayor medida la correlación de Pearson, algo razonable en un mercado inmobiliario con propiedades de tamaños y precios muy diversos.

Correlaciones entre los predictores

La regresión múltiple reparte la variación del precio entre predictores que también se relacionan entre sí. La Tabla 10b anticipa esa redundancia.

Tabla 10b. Correlaciones de Pearson entre los predictores de base1
Variable 1 Variable 2 r de Pearson
Baños Habitaciones 0,599
Área construida (m²) Baños 0,526
Área construida (m²) Estrato 0,459
Área construida (m²) Habitaciones 0,454
Parqueaderos Baños 0,443
Estrato Baños 0,423
Área construida (m²) Parqueaderos 0,416
Estrato Parqueaderos 0,373
Parqueaderos Habitaciones 0,258
Estrato Habitaciones 0,093

La correlación más alta entre predictores es la de Baños y Habitaciones (\(r=0,599\)), y el área se correlaciona de forma moderada con baños, habitaciones y estrato. Como puede apreciarse en los gráficos y la tabla anterior, no se evidencian correlaciones extremadamente altas entre ellas, lo que constituye una señal preliminar favorable para su utilización conjunta en un modelo de regresión; no obstante, esta condición será confirmada posteriormente mediante medidas específicas de multicolinealidad, como el factor de inflación de la varianza (VIF) en la etapa 4.

Precio, área y estrato

Figura 5. Precio frente al área construida, diferenciado por estrato.

Al observar el gráfico anterior, es posible apreciar que existe una relación positiva entre el área construida y el precio. En general, a medida que aumenta el tamaño del inmueble, también aumenta su valor de oferta, coherente con la tendencia lineal creciente y con la alta correlación observada previamente. Sin embargo, el gráfico también muestra que el área por sí sola no determina el precio. Para superficies similares existen diferencias importantes de valor y parte de ellas parece estar asociada con el estrato socioeconómico. Los inmuebles de estratos más altos tienden a ubicarse en niveles de precio superiores, aunque existe un considerable solapamiento entre estratos, lo que indica que otras características también intervienen en la valoración.

Otro hallazgo importante es que la mayor parte de la oferta se concentra aproximadamente en inmuebles de menos de 500 m² y precios inferiores a $800 millones, mientras que las propiedades de gran tamaño y alto precio son mucho menos frecuentes. Además, conforme aumenta el área se observa una mayor dispersión de los precios: dos propiedades grandes con superficies semejantes pueden presentar valores muy diferentes, lo que constituye una señal visual de posible heterocedasticidad que deberá revisarse posteriormente al validar los supuestos del modelo de regresión.

Finalmente, se identifican algunas observaciones atípicas, como propiedades de gran superficie con precios relativamente bajos y otras con precios cercanos a los $2.000 millones, que podrían anticipar una influencia importante sobre la recta de regresión.

Precio y características discretas

Figura 6. Distribución del precio según estrato, parqueaderos, baños y habitaciones.

La figura anterior permite comparar simultáneamente el nivel típico del precio (representado por la mediana), su dispersión y la presencia de valores atípicos para distintas características de los inmuebles. El patrón más claro se observa en el estrato. Nótese que al pasar de los estratos 3 a 6, la mediana del precio se desplaza sistemáticamente hacia arriba, lo que confirma una marcada segmentación del mercado; los inmuebles de estratos superiores no solo tienden a ser más costosos, sino que también presentan una mayor variabilidad de precios, particularmente en los estratos 5 y 6. En los parqueaderos también se aprecia una tendencia general ascendente, los inmuebles con uno o dos parqueaderos concentran precios más bajos, mientras que aquellos con tres o más tienden a ubicarse en segmentos de mayor valor; sin embargo, a partir de seis parqueaderos la dispersión aumenta considerablemente y las categorías de 9 y 10 presentan muy pocas observaciones.

Por otro lado, el número de baños muestra una relación particularmente consistente con el precio. A medida que aumenta su cantidad, las cajas y sus medianas se desplazan hacia niveles superiores, sugiriendo que esta variable funciona además como indicador del tamaño, nivel de equipamiento y segmento del inmueble; nuevamente, las categorías con ocho, nueve o diez baños corresponden a propiedades menos frecuentes y de características especiales.

Tabla 10. Precio anunciado por estrato, en millones de pesos
Estrato Ofertas Precio medio Precio mediano Q1 del precio Q3 del precio
3 234 244,0 212,5 160,5 300,0
4 160 437,9 380,0 320,0 526,2
5 268 550,0 480,0 390,0 650,0
6 55 818,3 800,0 595,0 940,0

Dispersión del precio según el nivel

Tabla 10c. Dispersión del precio por tercil de área y por estrato en base1
Grupo Ofertas Área media (m²) Precio medio Desviación estándar del precio Rango intercuartil Coeficiente de variación
Area tercil 1 239 113,1 234,4 99,3 135,0 0,42
Area tercil 2 239 238,7 438,8 173,2 151,5 0,39
Area tercil 3 239 442,0 663,9 292,2 284,0 0,44
Estrato 3 234 165,4 244,0 120,7 139,5 0,49
Estrato 4 160 261,6 437,9 219,7 206,2 0,50
Estrato 5 268 325,7 550,0 247,2 260,0 0,45
Estrato 6 55 397,6 818,3 285,3 345,0 0,35

Nótese en la tabla anterior que la desviación estándar del precio pasa de 99,3 millones en el tercil de casas pequeñas a 292,2 millones en el de casas grandes, y crece también con el estrato. La dispersión no es constante: es proporcional al nivel del precio. Esto tiene dos consecuencias que se verifican más adelante: (i) el modelo lineal en millones tendrá residuos heterocedásticos, por lo que los errores estándar clásicos serán poco fiables y los intervalos de predicción, demasiado anchos para las casas baratas y demasiado estrechos para las caras; (ii) una especificación en logaritmo del precio, que modela variaciones porcentuales, es la alternativa natural y se evalúa en la Etapa 4.

El EDA indica que el área y el estrato son los factores con asociaciones más claras con el precio. Baños y parqueaderos también acompañan diferencias de valor, mientras que el patrón de habitaciones debe evaluarse conjuntamente con el área, porque una casa puede tener más cuartos debido a una subdivisión de la misma superficie. El EDA anticipa además tres rasgos del modelado: correlaciones moderadas entre predictores (sin colinealidad severa), varianza del precio que crece con el nivel (heterocedasticidad) y relaciones más monótonas que lineales (Spearman > Pearson), que justifican evaluar una especificación logarítmica.

Etapa 3. Construcción y selección del modelo de regresión múltiple

Modelo completo solicitado

El modelo completo responde directamente al enunciado:

\[ Precio=f(Área, Estrato, Habitaciones, Parqueaderos, Baños). \]

El estrato se incorpora como factor. Por tanto, sus coeficientes comparan cada nivel con el estrato de referencia, que es el menor estrato presente en base1.

modelo_completo <- lm(
  preciom ~ areaconst + estrato_f + habitaciones +
    parqueaderos + banios,
  data = base_modelado
)
Tabla 11. Estimación MCO del modelo completo
Término Estimación Error estándar Estadístico t Valor p IC 95 % inferior IC 95 % superior Significativo al 5 %
Intercepto -2,904 18,589 -0,156 0,876 -39,400 33,593 No
Área construida (por m²) 0,739 0,045 16,480 < 0,001 0,651 0,827
Estrato 4 frente a 3 72,480 16,993 4,265 < 0,001 39,117 105,843
Estrato 5 frente a 3 129,190 16,111 8,019 < 0,001 97,558 160,821
Estrato 6 frente a 3 305,902 26,536 11,528 < 0,001 253,805 358,000
Habitaciones 5,054 4,598 1,099 0,272 -3,975 14,082 No
Parqueaderos 27,578 5,168 5,336 < 0,001 17,432 37,725
Baños 23,774 5,719 4,157 < 0,001 12,546 35,002

En cuanto a la bondad del ajuste, el modelo completo obtiene un \(R^2\) de 0,680 y un \(R^2\) ajustado de 0,677. Esto significa que, en la muestra analizada, el conjunto de predictores explica aproximadamente el 68,0 % de la variabilidad observada en los precios de los inmubles. El porcentaje restante corresponde a variabilidad no explicada por las variables incluidas en el modelo y puede estar relacionada con otros atributos de las viviendas o del mercado que no fueron considerados.

La prueba global del modelo es estadísticamente significativa, \(F(7, 709) = 215,12\), con valor p < 0,001. Por tanto, se rechaza la hipótesis nula conjunta de que todos los coeficientes sean iguales a cero, lo que permite concluir que al menos uno de los predictores considerados está asociado significativamente con el precio.

Interpretación de los coeficientes

Área construida. Manteniendo constantes el estrato, el número de habitaciones, baños y parqueaderos, un incremento de 100 m² en el área construida se asocia, en promedio, con un precio estimado 73,9 millones mayor. El coeficiente es estadísticamente significativo ya que el valor p es < 0,001, por lo que el área aporta información relevante para explicar las diferencias de precio entre los inmuebles.

Baños. Manteniendo constantes las demás características, un baño adicional se asocia con con un incremento promedio de aproximadamente 23,8 millones más en el precio estimado. El valor p es < 0,001; por tanto, el coeficiente es estadísticamente significativo al 5 %.

Parqueaderos. A igualdad de las demás características incluidas en el modelo, un parqueadero adicional se asocia con un precio promedio estimado aproximadamente 27,6 millones más. El valor p es < 0,001.

Habitaciones. Manteniendo constantes el área construida, el estrato, los baños y los parqueaderos, una habitación adicional presenta un coeficiente de 5,1 millones; sin embargo, este efecto no es estadísticamente significativo con un valor p = 0,272. Por tanto, no existe evidencia estadística suficiente para afirmar que el número de habitaciones aporte información adicional sobre el precio una vez se controlan las demás características del inmueble.

Estrato. Frente al estrato de referencia, las diferencias estimadas son:

  • Estrato 4: 72,5 millones mayor, con valor p < 0,001.
  • Estrato 5: 129,2 millones mayor, con valor p < 0,001.
  • Estrato 6: 305,9 millones mayor, con valor p < 0,001.

Estas diferencias comparan segmentos del mercado manteniendo constantes las demás características; no representan el efecto causal de cambiar administrativamente una vivienda de estrato.

Intercepto. Representa matemáticamente el precio esperado de un inmueble perteneciente al estrato de referencia con área construida, habitaciones, baños y parqueaderos iguales a cero. Dado que esta combinación carece de sentido práctico dentro del mercado inmobiliario analizado, el intercepto no tiene una interpretación económica relevante, aunque es necesario para definir matemáticamente el plano de regresión.

Inferencia robusta a heterocedasticidad

El EDA anticipó que la varianza del precio crece con su nivel. Cuando eso ocurre, las estimaciones de MCO siguen siendo insesgadas, pero los errores estándar clásicos están mal calculados y los valores p pueden ser demasiado optimistas. La Tabla 12b recalcula los errores estándar del modelo completo con la corrección HC3 de MacKinnon y White (1985), que no exige conocer la forma de la heterocedasticidad.

Tabla 12b. Modelo completo: errores estándar clásicos y robustos (HC3)
Variable Estimación EE clásico EE robusto HC3 Razón HC3 / clásico Valor p clásico Valor p HC3 Significativo al 5 % con HC3
Intercepto -2,904 18,589 24,820 1,34 0,876 0,907 No
Área construida 0,739 0,045 0,121 2,70 < 0,001 < 0,001
Estrato 4 frente a 3 72,480 16,993 17,648 1,04 < 0,001 < 0,001
Estrato 5 frente a 3 129,190 16,111 19,021 1,18 < 0,001 < 0,001
Estrato 6 frente a 3 305,902 26,536 39,292 1,48 < 0,001 < 0,001
Habitaciones 5,054 4,598 6,336 1,38 0,272 0,425 No
Parqueaderos 27,578 5,168 7,055 1,37 < 0,001 < 0,001
Baños 23,774 5,719 9,256 1,62 < 0,001 0,010

Los errores estándar robustos son mayores que los clásicos para el área (razón de 2,70), los parqueaderos y los baños, por lo que la precisión aparente del modelo clásico estaba sobrestimada. Aun así, las conclusiones sobre qué variables son significativas al 5 % no cambian. El área, estrato, parqueaderos y baños siguen siéndolo. En las secciones siguientes de este documento, cuando se habla de significancia, se ha comprobado que se mantiene con HC3.

Selección stepwise por AIC

El procedimiento stepwise parte del modelo completo y evalúa eliminaciones y reincorporaciones de términos. La selección se basa en el AIC, por lo que un valor menor representa un mejor compromiso entre ajuste y complejidad.

Tabla 12. Trayectoria del procedimiento stepwise
Paso Df Deviance Resid. Df Resid. Dev AIC
Modelo completo 709 16602766 7221.853
Eliminar: habitaciones 1 28281.43 710 16631047 7221.073

La fórmula seleccionada con toda la muestra es:

## preciom ~ areaconst + estrato_f + parqueaderos + banios
Tabla 13. Comparación del ajuste de los modelos candidatos
Modelo Fórmula Parámetros R² ajustado AIC ΔAIC BIC RMSE entrenamiento MAE entrenamiento
Completo preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 8 0,6799 0,6767 9.258,6 0,78 9.299,8 152,2 95,2
Stepwise AIC preciom ~ areaconst + estrato_f + parqueaderos + banios 7 0,6793 0,6766 9.257,8 0,00 9.294,4 152,3 95,2

Nota sobre el AIC: la trayectoria de step() utiliza la escala interna de extractAIC(), mientras que la Tabla 13 presenta el AIC basado en la log-verosimilitud mediante AIC(). Los valores absolutos difieren por una constante, pero la diferencia entre modelos y su ordenación son equivalentes. El \(\Delta AIC\) facilita la comparación, por tanto el mejor modelo toma el valor cero.

Validación cruzada de 10 pliegues

Para comparar la capacidad predictiva se utilizaron diez pliegues estratificados por estrato. Los dos modelos se evaluaron sobre las mismas particiones. En cada pliegue, el modelo stepwise volvió a ejecutar la selección utilizando únicamente los datos de entrenamiento. La partición se realiza sobre la base ya completada mediante MICE, por lo que la validación compara las fórmulas de los modelos manteniendo fija la etapa previa de preparación de datos.

Las métricas empleadas son:

  • RMSE: penaliza con mayor intensidad los errores grandes; menor es mejor.
  • MAE: error absoluto medio en millones de pesos; menor es mejor.
  • \(R^2\) predictivo: proporción de variabilidad preservada en las predicciones fuera del entrenamiento; mayor es mejor.
Tabla 14. Validación cruzada de 10 pliegues
Modelo RMSE MAE R² predictivo
Completo 156,49 96,75 0,6614
Stepwise AIC 156,47 96,81 0,6615

El RMSE del modelo completo es de 156,49 millones y el del stepwise es de 156,47 millones. La diferencia absoluta es de apenas 0,03 millones.

Los desempeños se consideran prácticamente equivalentes; por ello se prefiere el modelo más parsimonioso (modelo más simple). Se definió equivalencia práctica cuando la diferencia de RMSE no supera el 1 % del menor RMSE.

La selección stepwise no necesariamente produce la misma fórmula en todos los pliegues. La tabla siguiente permite comprobar su estabilidad.

Tabla 15. Frecuencia de las fórmulas stepwise en la validación cruzada
Fórmula Número de pliegues
preciom ~ areaconst + estrato_f + parqueaderos + banios 9
preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 1

Modelo candidato para la fase siguiente

El modelo candidato se selecciona considerando conjuntamente el desempeño en validación cruzada y la parsimonia. Su resultado es:

Tabla 16. Resumen del modelo candidato
Modelo Fórmula N Parámetros R² ajustado AIC BIC RMSE CV MAE CV R² predictivo CV
Stepwise AIC preciom ~ areaconst + estrato_f + parqueaderos + banios 717 7 0,6793 0,6766 9.257,8 9.294,4 156,47 96,81 0,6615

El modelo completo se conserva para interpretar todas las variables solicitadas en el enunciado. El modelo completo y el stepwise presentan un desempeño predictivo prácticamente equivalente. Se selecciona Stepwise AIC como candidato por parsimonia, con la fórmula preciom ~ areaconst + estrato_f + parqueaderos + banios. La variable habitaciones se excluye porque no es significativa en el modelo completo y su retirada no deteriora de forma apreciable el desempeño fuera de muestra. La fórmula reducida fue seleccionada en 9 de 10 pliegues.

Como este es el modelo con el que se calculan las predicciones de la Etapa 5, se reportan sus coeficientes para que el cálculo sea reproducible a mano:

Tabla 16b. Coeficientes del modelo candidato usado en la predicción
Término Estimación Error estándar Valor p IC 95 % inferior IC 95 % superior
Intercepto 8,051 15,693 0,608 -22,759 38,861
Área construida 0,753 0,043 < 0,001 0,669 0,837
Estrato 4 frente a 3 68,949 16,689 < 0,001 36,183 101,715
Estrato 5 frente a 3 124,424 15,519 < 0,001 93,955 154,893
Estrato 6 frente a 3 298,299 25,622 < 0,001 247,996 348,603
Parqueaderos 27,521 5,169 < 0,001 17,374 37,669
Baños 27,073 4,868 < 0,001 17,514 36,631
Tabla 16c. Modelo candidato: errores estándar clásicos y robustos (HC3)
Variable Estimación EE clásico EE robusto HC3 Razón HC3 / clásico Valor p clásico Valor p HC3 Significativo al 5 % con HC3
Intercepto 8,051 15,693 18,495 1,18 0,608 0,663 No
Área construida 0,753 0,043 0,123 2,88 < 0,001 < 0,001
Estrato 4 frente a 3 68,949 16,689 16,473 0,99 < 0,001 < 0,001
Estrato 5 frente a 3 124,424 15,519 18,958 1,22 < 0,001 < 0,001
Estrato 6 frente a 3 298,299 25,622 39,422 1,54 < 0,001 < 0,001
Parqueaderos 27,521 5,169 7,038 1,36 < 0,001 < 0,001
Baños 27,073 4,868 8,149 1,67 < 0,001 < 0,001

Ajuste, alcance y posibilidades de mejora

El modelo completo explica aproximadamente el 68,0 % de la variación observada. En validación cruzada alcanza un RMSE de 156,49 millones, un MAE de 96,75 millones y un \(R^2\) predictivo de 0,6614. El modelo stepwise conserva prácticamente el mismo desempeño con una variable menos. Aun así, el margen de error es relevante para valorar una vivienda individual.

El ajuste podría mejorarse evaluando transformaciones logarítmicas del precio y del área, relaciones no lineales, una interacción entre área y estrato y variables inmobiliarias no disponibles, como antigüedad, estado de conservación, remodelaciones y calidad de acabados. Cualquier especificación alternativa debe compararse con la misma validación cruzada antes de adoptarse. La primera de esas alternativas, el logaritmo del precio, se estima y se compara en la Etapa 4, una vez conocido el diagnóstico de supuestos que la motiva.

Sensibilidad a la imputación de faltantes

El modelo se estimó sobre la primera completación de MICE, y el modelo de imputación de parqueaderos usó el precio como predictor. Ambas decisiones son correctas en la teoría de la imputación múltiple (Rubin, 1987; Van Buuren, 2018), pero conviene comprobar que no condicionan los resultados. La Tabla 17b compara tres estimaciones del modelo completo: la base imputada (principal), solo las casas con parqueaderos, baños y habitaciones observados en la base original (430 casos) y la imputación múltiple agrupada con las reglas de Rubin sobre las cinco completaciones.

Tabla 17b. Coeficientes del modelo completo según tratamiento de los faltantes: estimación (error estándar)
Variable Base imputada (principal) Casos completos observados Imputación múltiple agrupada (5 completaciones)
Intercepto -2,904 (18,589) 8,427 (27,862) -0,990 (18,621)
Área construida 0,739 (0,045) 0,665 (0,054) 0,742 (0,046)
Estrato 4 frente a 3 72,5 (17,0) 76,9 (24,7) 71,3 (17,7)
Estrato 5 frente a 3 129,2 (16,1) 146,3 (22,9) 126,2 (16,6)
Estrato 6 frente a 3 305,9 (26,5) 268,1 (38,4) 303,3 (27,8)
Habitaciones 5,054 (4,598) 6,487 (5,971) 4,327 (4,918)
Parqueaderos 27,6 (5,2) 24,8 (5,9) 31,1 (7,3)
Baños 23,8 (5,7) 21,3 (8,0) 22,4 (6,2)

El coeficiente de parqueaderos, la variable con más valores imputados, es 27,6 en la base imputada, 24,8 en casos completos y 31,1 en la imputación agrupada; las tres estimaciones quedan dentro de un error estándar entre sí. Los demás coeficientes conservan signo, orden de magnitud y significancia. La imputación agrupada produce errores estándar ligeramente mayores porque incorpora la incertidumbre entre completaciones; esa es la magnitud de precisión que la base operativa única deja de reflejar y es pequeña. Se concluye que los resultados no dependen de la imputación. El R² del ajuste con casos completos (0,605) es menor que el de la base imputada, pero la diferencia se debe a la composición de la submuestra (las casas sin dato de parqueaderos son, en promedio, mejor explicadas por el resto de variables) y no a la imputación.

El modelo candidato se somete a continuación a la validación de linealidad, homocedasticidad, normalidad, multicolinealidad, independencia e influencia. Los resultados de esa revisión determinan las precauciones que deben acompañar las predicciones.

Etapa 4. Validación de los supuestos del modelo MCO

Modelo sometido a diagnóstico

La validación se realiza sobre el modelo seleccionado en la etapa anterior: Stepwise AIC, estimado con 717 observaciones y la fórmula preciom ~ areaconst + estrato_f + parqueaderos + banios.

El objetivo de esta etapa es identificar posibles incumplimientos de los supuestos de MCO y formular recomendaciones. De acuerdo con el enunciado, no se eliminan observaciones ni se sustituye automáticamente el modelo.

Tabla 17. Resumen de la validación de los supuestos del modelo candidato
Supuesto Procedimiento Valor diagnóstico Valor p Resultado Recomendación
Linealidad y forma funcional Prueba RESET de Ramsey 10,937 < 0,001 Alerta: posible no linealidad o especificación incompleta Evaluar logaritmos, términos no lineales e interacciones.
Homoscedasticidad Prueba de Breusch-Pagan 121,694 < 0,001 Alerta: la varianza de los errores no es constante Evaluar una transformación logarítmica del precio y revisar la especificación.
Normalidad aproximada de los residuos Prueba de Shapiro-Wilk y gráfico Q-Q 0,832 < 0,001 Alerta: los residuos se apartan de la normalidad Apoyarse en el gráfico Q-Q, revisar los casos extremos y considerar transformaciones.
Multicolinealidad VIF/GVIF ajustado 1,265 Sin multicolinealidad preocupante Mantener los predictores si los índices permanecen bajo el umbral.
Independencia de los errores Evaluación del diseño transversal No existe un orden temporal; 156 ofertas comparten coordenada con al menos otra oferta No aplicar Durbin-Watson a un orden arbitrario; considerar agrupación por barrio o dependencia espacial.
Observaciones influyentes Residuos studentizados, apalancamiento y Cook 43,000 Se identifican 43 observaciones por encima del criterio 4/n Revisar los casos, validar su calidad y realizar sensibilidad sin eliminarlos automáticamente.

Linealidad y forma funcional

La relación lineal se revisa mediante el gráfico de residuos frente a valores ajustados y la prueba RESET de Ramsey. En un modelo adecuadamente especificado, los residuos deberían distribuirse sin una curvatura sistemática alrededor de cero.

Figura 7. Residuos frente a valores ajustados del modelo candidato.

Figura 7. Residuos frente a valores ajustados del modelo candidato.

La prueba RESET obtiene un estadístico de 10,937 y un valor p < 0,001.

La prueba RESET permite rechazar al 5 % la hipótesis de que la forma funcional esté correctamente especificada. El resultado puede reflejar una relación no lineal y/o la omisión de variables relevantes; la prueba no permite identificar por sí sola cuál de estas causas origina la alerta. Se recomienda evaluar el logaritmo del precio y del área, un término cuadrático del área o una interacción entre área y estrato.

Homocedasticidad

La homocedasticidad exige que la dispersión de los errores sea aproximadamente constante para los distintos niveles del precio ajustado. Se revisa mediante el gráfico de escala-localización y la prueba de Breusch–Pagan.

Figura 8. Gráfico de escala-localización del modelo candidato.

Figura 8. Gráfico de escala-localización del modelo candidato.

La prueba de Breusch–Pagan produce un estadístico de 121,694 y un valor p < 0,001.

Se rechaza la hipótesis de varianza constante al 5 %. La variabilidad de los residuos no permanece constante para todos los niveles del precio estimado. Este resultado no modifica los coeficientes calculados por MCO, pero exige interpretar con cautela su precisión. De acuerdo con el enunciado, el problema no se corrige en esta etapa; se sugiere evaluar posteriormente una transformación logarítmica del precio y revisar la forma funcional del modelo.

Dos precisiones sobre las consecuencias. Primero, la corrección HC3 de la Etapa 3 (Tabla 16c) ya muestra el efecto práctico: el error estándar del área es 2,88 veces mayor que el clásico. Ninguna variable significativa deja de serlo con HC3, así que la interpretación de la Etapa 3 se sostiene en lo esencial con la inferencia robusta. Segundo, la heterocedasticidad afecta más a los intervalos de predicción que a los coeficientes: como el error estándar residual es único, el intervalo tiene la misma anchura para una casa de 150 millones que para una de 1.500, cuando la Tabla 10c mostró que la dispersión real es tres veces mayor en el tercil alto. La sección “Especificación logarítmica” de esta etapa cuantifica esa distorsión.

Normalidad de los errores

La normalidad se evalúa con el gráfico Q–Q de los residuos studentizados y la prueba de Shapiro–Wilk. La prueba se utiliza como apoyo y no reemplaza la lectura del gráfico, porque con muestras grandes puede detectar desviaciones pequeñas.

Figura 9. Gráfico Q-Q de los residuos studentizados.

Figura 9. Gráfico Q-Q de los residuos studentizados.

La prueba de Shapiro–Wilk obtiene \(W=0,8319\) y un valor p < 0,001.

Se rechaza la normalidad de los residuos al 5 %. Aunque Shapiro-Wilk es sensible en muestras grandes, el gráfico Q-Q confirma desviaciones relevantes en las colas, asociadas principalmente con viviendas de precio o superficie extremos. La falta de normalidad no invalida por sí sola los coeficientes estimados por MCO, pero aconseja interpretar con cautela la inferencia y los intervalos de predicción. Como alternativas se sugiere revisar los registros extremos y evaluar una transformación logarítmica del precio.

Multicolinealidad

La multicolinealidad se estudia con el VIF. Debido a que el estrato es un factor con varios grados de libertad, para ese término se utiliza el GVIF ajustado \(GVIF^{1/(2\,gl)}\). El umbral equivalente a un VIF de 5 es \(\sqrt{5}\) para los términos con más de un grado de libertad.

Tabla 18. Diagnóstico de multicolinealidad del modelo candidato
Variable GVIF Grados de libertad Índice comparable Umbral de referencia Alerta
Área construida 1,582 1 1,258 2,236 No
Estrato (factor) 1,429 3 1,061 2,236 No
Parqueaderos 1,363 1 1,168 2,236 No
Baños 1,599 1 1,265 2,236 No

El mayor índice comparable corresponde a Baños, con un valor de 1,265.

Todos los índices permanecen por debajo de su umbral de referencia. No se identifica multicolinealidad preocupante y los coeficientes pueden interpretarse sin una señal de inestabilidad grave por redundancia entre predictores.

Independencia de los errores

La base es de corte transversal: cada fila representa una oferta y no existe un orden temporal natural. Por esta razón, no se aplica Durbin–Watson sobre el orden arbitrario del archivo, ya que su interpretación sería engañosa. La eliminación previa de duplicados ayuda a evitar repeticiones exactas, pero no garantiza independencia espacial.

En base1, 47 grupos de coordenadas contienen más de una oferta y reúnen 156 registros. Esto no demuestra dependencia de los errores, pero advierte que algunas viviendas pueden compartir barrio, edificio, proyecto o punto de geocodificación. Para un análisis posterior más exigente podría evaluarse autocorrelación espacial o utilizar errores agrupados por barrio. Con la información actual, la independencia se mantiene como una suposición del diseño y una limitación del modelo.

Observaciones atípicas e influyentes

Las observaciones se examinan con tres criterios de detección:

  • residuo studentizado con valor absoluto mayor que 3;
  • apalancamiento superior a \(2p/n\);
  • distancia de Cook superior a \(4/n\).

Estos umbrales sirven para seleccionar casos que requieren revisión; no son una regla automática de eliminación.

Tabla 19. Resumen de observaciones que requieren revisión
Indicador Umbral Número de observaciones Porcentaje
Residuos studentizados con valor absoluto mayor que 3 3,0000 17 2,4 %
Observaciones con apalancamiento superior a 2p/n 0,0195 77 10,7 %
Observaciones con distancia de Cook superior a 4/n 0,0056 43 6,0 %
Observaciones marcadas por al menos un criterio 93 13,0 %
Figura 10. Distancia de Cook de las observaciones del modelo.

Figura 10. Distancia de Cook de las observaciones del modelo.

Figura 11. Apalancamiento frente a residuos studentizados; el tamaño representa la distancia de Cook.

Figura 11. Apalancamiento frente a residuos studentizados; el tamaño representa la distancia de Cook.

Se identifican 17 residuos studentizados extremos, 77 casos de alto apalancamiento y 43 casos por encima del umbral de Cook. En total, 93 ofertas cumplen al menos uno de los criterios.

Tabla 20. Diez observaciones con mayor prioridad de revisión
ID Barrio Estrato Precio observado Área (m²) Precio ajustado Residuo studentizado Apalancamiento Cook Residuo extremo Alto apalancamiento Cook elevado
534 Villa Del Prado 3 370,0 1.440,0 1.228,1 -6,150 0,1257 0,7382
4542 Vipasa 5 1.400,0 265,0 657,8 5,044 0,0439 0,1613
4349 El Bosque 5 650,0 1.188,0 1.299,5 -4,415 0,0519 0,1487
4564 San Vicente 5 1.940,0 734,0 984,3 6,492 0,0211 0,1229
4793 Granada 4 1.800,0 607,0 752,4 7,143 0,0170 0,1180 No
3858 San Vicente 4 1.650,0 734,0 847,6 5,402 0,0207 0,0848
4056 Versalles 5 1.600,0 942,0 1.060,2 3,618 0,0331 0,0630
6068 Cali 6 1.600,0 730,0 1.100,6 3,338 0,0308 0,0499
5263 Santa Monica 6 1.500,0 470,0 905,2 3,965 0,0196 0,0439
1065 Manzanares 3 350,0 350,0 601,0 -1,722 0,0904 0,0420 No

Las observaciones señaladas deben contrastarse con la fuente original para verificar que el precio, el área y las dotaciones sean correctos. Si son ofertas reales, deben conservarse. Como análisis de sensibilidad podría reestimarse el modelo sin los casos más influyentes y comparar los signos y magnitudes de los coeficientes, sin presentar esa eliminación como la especificación principal.

El registro con mayor distancia de Cook es el ID 534, con un valor de 0,7382. Debe contrastarse prioritariamente con la fuente original. Su identificación como influyente no constituye, por sí sola, una justificación para eliminarlo.

Especificación logarítmica como alternativa

El EDA (Tabla 10c) y las pruebas anteriores apuntan en la misma dirección: la dispersión del precio crece con su nivel y los residuos tienen colas pesadas. Modelar \(\log(\text{precio})\) convierte efectos aditivos en porcentuales y suele estabilizar la varianza. Se estimó el modelo candidato con la misma fórmula y el precio en logaritmo, y se comparó con el lineal usando los mismos diez pliegues; las predicciones del modelo logarítmico se retransformaron a millones con el factor de Duan (1983), \(\hat{s}=\overline{\exp(\hat{e}_i)}\) = 1,040, que corrige el sesgo de \(\exp(\hat{y})\) como estimador de la media.

Tabla 21b. Modelo candidato lineal frente a su versión logarítmica (misma fórmula, mismos pliegues)
Especificación R² ajustado (escala propia) RMSE CV (millones) MAE CV (millones) R² predictivo CV p RESET p Breusch-Pagan W Shapiro-Wilk
Lineal (precio en millones) 0,677 156,5 96,8 0,662 < 0,001 < 0,001 0,832
Logarítmica (log del precio) 0,761 176,4 104,5 0,570 < 0,001 < 0,001 0,987

El resultado es matizado y por eso se reporta completo:

  • Supuestos. La especificación logarítmica mejora de forma clara la normalidad de los residuos (\(W\) pasa de 0,832 a 0,987), pero no elimina la heterocedasticidad ni la señal de RESET: ambas pruebas siguen rechazando al 5 %. Es decir, el logaritmo corrige la escala, no la especificación; la curvatura residual o las variables omitidas (barrio, antigüedad, calidad) persisten.
  • Capacidad predictiva en millones. El RMSE de validación cruzada del modelo logarítmico (176,4 millones) es peor que el del lineal (156,5). La razón es conocida: el modelo log minimiza errores porcentuales y, al retransformar, los errores de las casas más caras, que dominan el RMSE, se amplifican. Para predecir el precio esperado en millones, que es lo que pide el enunciado, el modelo lineal es preferible.
  • Intervalos. Donde el logaritmo sí aporta es en los intervalos de predicción, que resultan asimétricos y proporcionales al nivel del precio. Por eso en la Etapa 5 se reportan los dos intervalos: el lineal, que es el del modelo oficial, y el logarítmico, como lectura más realista del rango de precios de mercado.

En consecuencia, y de acuerdo con el enunciado, se conserva el modelo lineal como especificación principal, y la versión logarítmica se utiliza como análisis complementario para los intervalos y como evidencia de que el problema de forma funcional no se resuelve solo con una transformación.

Sensibilidad espacial y frente a observaciones influyentes

Para medir cuánto dependen los coeficientes de los registros problemáticos detectados en la Etapa 1 (casas con latitud del sur) y en esta etapa (casos con distancia de Cook superior a \(4/n\)), se reestimó el modelo candidato sin cada grupo. En efecto, no se trata de sustituir el modelo principal, sino de acotar la incertidumbre debida a esos registros.

Tabla 21c. Coeficientes del modelo candidato bajo tres muestras: estimación (error estándar)
Variable Principal (base1 completa) Sin casas con latitud del sur Sin Cook > 4/n
Intercepto 8,051 (15,693) 9,113 (16,023) 25,0 (10,3)
Área construida 0,753 (0,043) 0,763 (0,045) 0,767 (0,034)
Estrato 4 frente a 3 68,9 (16,7) 68,2 (17,2) 57,8 (10,7)
Estrato 5 frente a 3 124,4 (15,5) 117,6 (15,7) 108,5 (10,0)
Estrato 6 frente a 3 298,3 (25,6) 260,4 (28,9) 276,7 (18,6)
Parqueaderos 27,5 (5,2) 25,9 (5,4) 23,2 (3,6)
Baños 27,1 (4,9) 27,1 (5,1) 23,2 (3,4)
Tabla 21d. Ajuste global del modelo candidato bajo las tres muestras
Ajuste N Error estándar residual (millones)
Principal (base1 completa) 717 0,679 153,0
Sin casas con latitud propia del sur 649 0,663 150,4
Sin observaciones con Cook > 4/n 674 0,794 95,4

Excluir las 68 casas con latitud sur apenas mueve los coeficientes: el del área pasa de 0,753 a 0,763 millones por m² y el del estrato 6 de 298,3 a 260,4, cambios menores que un error estándar. Esto respalda la decisión de conservar la zona declarada, es decir, las anomalías de coordenadas no distorsionan el modelo. Excluir los casos influyentes tiene un efecto mayor sobre el ajuste (el error estándar residual baja de 153,0 a 95,4 millones) pero no altera los signos ni el orden de los coeficientes; confirma que la incertidumbre del modelo está concentrada en un puñado de anuncios de precio o área extremos, que deben verificarse en la fuente y no eliminarse.

Conclusión de la validación de supuestos

El modelo candidato no presenta problemas preocupantes de multicolinealidad. La prueba RESET evidencia una posible deficiencia de forma funcional, la prueba de Breusch–Pagan permite rechazar la homocedasticidad y la prueba de Shapiro–Wilk, junto con el gráfico Q–Q, muestra que los residuos se apartan de la normalidad. También se identificaron observaciones atípicas e influyentes que deben contrastarse con la fuente original, sin eliminarlas automáticamente.

La independencia de los errores no pudo verificarse formalmente debido al carácter transversal de la base y se mantiene como una suposición del diseño, reconociendo la posible agrupación espacial de algunas ofertas. De acuerdo con el enunciado, estos hallazgos no obligan a corregir ni descartar el modelo en esta etapa. Por tanto, se conserva el modelo Stepwise AIC, con la fórmula preciom ~ areaconst + estrato_f + parqueaderos + banios, para realizar las predicciones, advirtiendo que sus resultados deben interpretarse con cautela. Como mejoras futuras se recomienda evaluar transformaciones logarítmicas, términos no lineales entre otros, revisar los casos influyentes e incorporar variables inmobiliarias adicionales, como antigüedad del inmueble, estado de conservación y calidad de los acabados.

Etapa 5. Predicción del precio de la vivienda 1

Características de la solicitud

La primera solicitud corresponde a una casa ubicada en la Zona Norte, con 200 m² de área construida, un parqueadero, dos baños, cuatro habitaciones y estrato 4 o 5. La empresa dispone de un crédito preaprobado máximo de 350 millones de pesos.

Tabla 21. Características de la primera solicitud
Característica Vivienda 1
Tipo Casa
Área construida 200 m²
Parqueaderos 1
Baños 2
Habitaciones 4
Estrato 4 o 5
Zona Zona Norte
Crédito preaprobado $350 millones

Modelo utilizado y construcción de los escenarios

La predicción se realiza con el modelo conservado después de la selección y de la validación de supuestos: Stepwise AIC, cuya fórmula es preciom ~ areaconst + estrato_f + parqueaderos + banios.

El requisito indica estrato 4 o 5. Como el estrato se incorporó como factor, no sería correcto reemplazarlo por 4,5 ni promediar ambas categorías. Por esta razón se calculan dos escenarios independientes, manteniendo iguales el área, los parqueaderos y los baños:

\[ \widehat{P}_{E4}=\widehat{\beta}_0+200\widehat{\beta}_{A} +\widehat{\beta}_{E4}+1\widehat{\beta}_{G}+2\widehat{\beta}_{B}, \]

\[ \widehat{P}_{E5}=\widehat{\beta}_0+200\widehat{\beta}_{A} +\widehat{\beta}_{E5}+1\widehat{\beta}_{G}+2\widehat{\beta}_{B}. \]

En estas expresiones, \(A\) representa el área construida, \(G\) los parqueaderos y \(B\) los baños.

La solicitud registra cuatro habitaciones, pero esta característica no modifica la predicción del modelo candidato porque habitaciones fue excluida por el procedimiento stepwise. En el modelo completo su aporte no fue estadísticamente significativo y retirarla no deterioró de manera apreciable el desempeño predictivo.

El crédito preaprobado tampoco interviene en el cálculo del precio; se utiliza después para comparar la predicción con el límite financiero de la empresa.

escenarios_vivienda_1 <- tibble::tibble(
  areaconst = 200,
  habitaciones = 4,
  parqueaderos = 1,
  banios = 2,
  estrato_f = factor(
    c(4, 5),
    levels = levels(base_modelado$estrato_f)
  )
)

predict(
  modelo_diagnostico,
  newdata = escenarios_vivienda_1,
  interval = "confidence",
  level = 0.95
)

predict(
  modelo_diagnostico,
  newdata = escenarios_vivienda_1,
  interval = "prediction",
  level = 0.95
)

Resultados de la predicción

Se presenta la predicción puntual, el intervalo de confianza del 95 % para el precio medio esperado de viviendas con esas características y el intervalo de predicción del 95 % para una vivienda individual. El segundo intervalo es más amplio porque incorpora tanto la incertidumbre de la media como la variabilidad entre ofertas individuales.

Tabla 22. Predicción del precio de la vivienda 1, en millones de pesos
Escenario Precio de oferta estimado IC 95 % del precio medio IP 95 % para una vivienda Crédito máximo Margen: crédito - estimación Evaluación puntual
Estrato 4 309,3 millones [279,9; 338,6] [7,3; 611,2] 350,0 millones +40,7 Dentro del crédito
Estrato 5 364,7 millones [338,7; 390,8] [63,1; 666,3] 350,0 millones -14,7 Supera el crédito

Interpretación en el contexto de la solicitud

Para una vivienda de estrato 4, el modelo estima un precio de oferta de 309,3 millones de pesos. Esta estimación se ubica 40,7 millones por debajo del crédito máximo. El intervalo de confianza del 95 % para el precio medio de viviendas semejantes es [279,9; 338,6] millones.

Para una vivienda de estrato 5, el precio de oferta estimado es de 364,7 millones de pesos, valor que queda 14,7 millones por encima del crédito máximo. Su intervalo de confianza del 95 % para el precio medio es [338,7; 390,8] millones.

Al comparar una vivienda de estrato 5 con una de estrato 4, manteniendo constantes el área, el número de parqueaderos y los baños, el precio de oferta estimado del escenario de estrato 5 es 55,5 millones de pesos mayor. Esta diferencia corresponde a la resta entre los coeficientes estimados de los estratos 5 y 4 y representa una diferencia entre segmentos del mercado, no el efecto causal de cambiar administrativamente una vivienda de estrato.

Los intervalos de predicción para una vivienda individual son considerablemente más amplios que los intervalos del precio medio. Vale la pena mencionar que esto no constituye un error de cálculo, ya que refleja la dispersión residual del mercado y el margen de error ya observado en la validación cruzada. Además, el punto 4 identificó alertas de forma funcional, heterocedasticidad y normalidad de los residuos.

Con base en la predicción puntual, una casa de estrato 4 con las características solicitadas tendría un precio de oferta estimado de 309,3 millones de pesos, aproximadamente 40,7 millones por debajo del crédito. Además, el límite superior del intervalo del precio medio permanece por debajo de 350 millones, por lo que este escenario presenta la mayor compatibilidad financiera.

Para estrato 5, la predicción puntual supera el crédito en 14,7 millones. Sin embargo, 350 millones se encuentra dentro del intervalo de confianza del precio medio; por ello, en el punto 6 se consideran ambos estratos y se mantiene el estrato 4 como referencia financiera cuando las demás características sean comparables. No se descartan las ofertas reales de estrato 5 cuyo precio anunciado sea igual o inferior al presupuesto.

Posición de la solicitud en la muestra y apalancamiento

Una predicción es fiable en la medida en que la combinación de características solicitada esté bien representada en la base. La Tabla 22b sitúa la solicitud dentro de base1 y la Tabla 22c calcula el apalancamiento \(h_0 = \mathbf{x}_0'(\mathbf{X}'\mathbf{X})^{-1}\mathbf{x}_0\) de cada escenario, que mide la distancia de la solicitud al centro de la nube de predictores; se compara con el umbral \(2p/n\) usado para la muestra.

Tabla 22b. Posición de la solicitud de la vivienda 1 en base1
Indicador Valor
Percentil del área solicitada en la base 41,3 %
Área máxima observada (m²) 1.440
Ofertas con área en ±10 % de la solicitada 65
Ofertas con área en ±10 % y estrato solicitado 48
Ofertas con al menos los parqueaderos solicitados 717
Ofertas con área ≥ 90 % de la solicitada y parqueaderos solicitados 462
Ofertas con área, parqueaderos, baños y habitaciones iguales o superiores 399
Tabla 22c. Apalancamiento de los escenarios de la vivienda 1
Escenario h de la solicitud h medio de la muestra (p/n) Umbral 2p/n h máximo observado Razón h / (2p/n) Dentro del rango habitual
Estrato 4 0,0096 0,0098 0,0195 0,1257 0,49
Estrato 5 0,0075 0,0098 0,0195 0,1257 0,38

La solicitud está en el interior de la muestra: 200 m² corresponde al percentil 41,3 del área, existen 48 casas de estrato 4 o 5 con área entre 180 y 220 m², y el apalancamiento de ambos escenarios es inferior al umbral \(2p/n\) e incluso al apalancamiento medio. No hay extrapolación: la predicción de la vivienda 1 es una interpolación bien respaldada.

Lectura del intervalo de predicción

El intervalo de predicción lineal para estrato 4, [7,3; 611,2] millones, tiene un límite inferior sin sentido económico: ninguna casa de 200 m² de estrato 4 se anuncia por unos pocos millones. Ese límite no es un error de cálculo sino una consecuencia directa de la heterocedasticidad detectada en la Etapa 4: el intervalo usa el error estándar residual global (153,0 millones), inflado por las casas caras, y lo aplica simétricamente a una casa de precio medio. La Tabla 22d contrasta ese intervalo con el que produce la especificación logarítmica, cuyo error es proporcional al nivel del precio.

Tabla 22d. Predicción de la vivienda 1: modelo lineal frente a modelo logarítmico (millones)
Escenario Lineal: estimación Lineal: IP 95 % Log: mediana Log: media (Duan) Log: IP 95 % Amplitud IP lineal Amplitud IP log P(precio ≤ crédito) según log
Estrato 4 309,3 [7,3; 611,2] 301,0 313,0 [173,9; 521,1] 603,8 347,2 70,6 %
Estrato 5 364,7 [63,1; 666,3] 346,2 359,9 [200,1; 598,9] 603,2 398,8 51,6 %

Las estimaciones puntuales de ambos modelos son muy parecidas (la media retransformada del modelo log es 313,0 millones en estrato 4 frente a 309,3 del lineal), lo que da robustez a la cifra central. La diferencia está en el rango: el intervalo logarítmico para estrato 4, [173,9; 521,1] millones, es 43 % más estrecho y describe mejor los precios que María encontrará en el mercado. Bajo esa especificación, la probabilidad de que una casa con las características solicitadas se anuncie por no más de 350 millones es de aproximadamente 71 % en estrato 4 y 52 % en estrato 5. Traducido a la decisión: en estrato 4 el presupuesto cubre holgadamente la mayoría de las ofertas comparables; en estrato 5 cubre menos de la mitad, por lo que la búsqueda debe apoyarse en anuncios concretos por debajo del límite y no en el precio típico del segmento.

Etapa 6. Selección de ofertas potenciales para la vivienda 1

Criterios de búsqueda y depuración de candidatos

La recomendación parte de las ofertas reales de base1. Se aplicaron como restricciones obligatorias el crédito máximo de 350 millones, los estratos 4 o 5, al menos un parqueadero, al menos dos baños y exactamente cuatro habitaciones. Para conservar viviendas comparables con la solicitud, el área se limitó al intervalo de 180 a 220 m², equivalente a una tolerancia de ±10 % alrededor de 200 m².

Las dotaciones superiores al mínimo no se consideran incumplimientos, o dicho de otro modo, una oferta con dos parqueaderos o más de dos baños continúa siendo compatible. Dentro del conjunto resultante se priorizaron los valores observados (no imputados) en parqueaderos, baños y habitaciones, así como las coordenadas que en la base completa aparecen asociadas solamente con Zona Norte. Finalmente, se favoreció la cercanía a 200 m² y se procuró representar barrios distintos.

Tabla 23. Depuración de ofertas para la primera solicitud
Etapa Número de ofertas
Ofertas disponibles en base1 717
Dentro del crédito y en estrato 4 o 5 112
Ajuste alto a las características solicitadas 9
Con dotaciones observadas y coordenada consistente 6
Ofertas recomendadas 5

El filtro presupuestal y de estrato conserva 112 ofertas. Al incorporar el área y las dotaciones solicitadas quedan 9 candidatos de ajuste alto. De ellos, 6 tienen las dotaciones clave observadas y una coordenada sin asociación interna con otras zonas. Se priorizaron dotaciones observadas y coordenadas asociadas solo a Zona Norte.

Ofertas recomendadas

Tabla 24. Cinco ofertas potenciales para la vivienda 1, ordenadas por cercanía a la solicitud
Opción ID Barrio Estrato Precio de oferta Margen del crédito Área (m²) Diferencia frente a 200 m² Parqueaderos Baños Habitaciones Valor ajustado de referencia Oferta - referencia Control de calidad Alerta de dato
1 1144 La Merced 4 320,0 millones 30,0 millones 200,0 0,0 m² 2 4 4 390,9 millones -70,9 millones Dotaciones observadas; Coordenada asociada solo a Zona Norte Sin alerta
2 1343 La Flora 5 320,0 millones 30,0 millones 200,0 0,0 m² 2 4 4 446,4 millones -126,4 millones Dotaciones observadas; Coordenada asociada solo a Zona Norte Sin alerta
3 4210 El Bosque 5 350,0 millones 0,0 millones 200,0 0,0 m² 3 3 4 446,9 millones -96,9 millones Dotaciones observadas; Coordenada asociada solo a Zona Norte Sin alerta
4 1887 Vipasa 5 340,0 millones 10,0 millones 203,0 3,0 m² 2 3 4 421,6 millones -81,6 millones Dotaciones observadas; Coordenada asociada solo a Zona Norte Sin alerta
5 1163 La Merced 5 350,0 millones 0,0 millones 216,0 16,0 m² 2 2 4 404,3 millones -54,3 millones Dotaciones observadas; Coordenada asociada solo a Zona Norte Sin alerta

La lista corta contiene 1 registros de estrato 4 y 4 de estrato 5. Sus precios se ubican entre 320,0 y 350,0 millones, con una media de 336,0 millones. Todas respetan el presupuesto máximo.

La columna Oferta - referencia compara el precio anunciado con el valor ajustado de referencia que produce el modelo para las características reales de cada oferta. Un valor negativo significa que el anuncio se encuentra por debajo de esa estimación. Esto no demuestra por sí solo que exista una ganga: la diferencia puede reflejar estado de conservación, ubicación específica, calidad de acabados o atributos no contenidos en la base, por lo que debe verificarse antes de una recomendación definitiva. Como estas ofertas pertenecen a la muestra utilizada para estimar el modelo, el valor ajustado funciona únicamente como referencia interna y no como una predicción independiente.

Regla de verificación de datos. Una oferta anunciada muy por debajo de su valor de referencia puede ser una oportunidad, pero con mayor probabilidad es un dato mal capturado (área, precio o estrato) o un inmueble con una condición no registrada. Se marca para verificación toda oferta cuya desviación frente al valor de referencia supere dos veces el RMSE de validación cruzada del modelo (312,9 millones). En esta lista, 0 ofertas activan la alerta; las desviaciones observadas, de entre 54,3 y 126,4 millones, están dentro de lo que el modelo no explica de forma habitual.

Mapa de las ofertas potenciales

Figura 12. Localización de las cinco ofertas recomendadas para la vivienda 1. Los puntos azules corresponden al estrato 4 y los naranjas al estrato 5.

Cada marcador permite consultar el ID, el barrio, el precio, el margen frente al crédito, las características de la vivienda, el valor ajustado de referencia y los controles de calidad. En la lista seleccionada, 0 ofertas tienen una coordenada compartida con otra zona y 0 dependen de una dotación imputada.

Discusión individual de las alternativas

Opción 1 — ID 1144 (La Merced). Casa de estrato 4 ofrecida en 320,0 millones. Tiene 200,0 m², 2 parqueaderos, 4 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta deja una holgura de 30,0 millones frente al crédito; además, se anuncia 70,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.

Opción 2 — ID 1343 (La Flora). Casa de estrato 5 ofrecida en 320,0 millones. Tiene 200,0 m², 2 parqueaderos, 4 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta deja una holgura de 30,0 millones frente al crédito; además, se anuncia 126,4 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.

Opción 3 — ID 4210 (El Bosque). Casa de estrato 5 ofrecida en 350,0 millones. Tiene 200,0 m², 3 parqueaderos, 3 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta utiliza el límite completo de 350 millones y no deja holgura presupuestal; además, se anuncia 96,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.

Opción 4 — ID 1887 (Vipasa). Casa de estrato 5 ofrecida en 340,0 millones. Tiene 203,0 m², 2 parqueaderos, 3 baños y 4 habitaciones; se aparta en 3,0 m² del área objetivo. La oferta deja una holgura de 10,0 millones frente al crédito; además, se anuncia 81,6 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.

Opción 5 — ID 1163 (La Merced). Casa de estrato 5 ofrecida en 350,0 millones. Tiene 216,0 m², 2 parqueaderos, 2 baños y 4 habitaciones; se aparta en 16,0 m² del área objetivo. La oferta utiliza el límite completo de 350 millones y no deja holgura presupuestal; además, se anuncia 54,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.

Recomendación para María

Las opciones 1 y 2 conforman el primer grupo de visitas porque ambas coinciden con los 200 m² y las cuatro habitaciones, se ofrecen dentro del crédito y dejan una holgura presupuestal. La opción 1 mantiene la ventaja de pertenecer al estrato 4, mientras que la opción 2 permite evaluar una alternativa de estrato 5 con características estructurales comparables.

Las demás alternativas también satisfacen el presupuesto y mantienen una alta proximidad a los requisitos de la solicitud. En particular, las ofertas de estrato 5 muestran que, aunque el punto 5 estimó un precio medio superior a 350 millones para ese escenario, sí existen anuncios concretos dentro del límite financiero. En total, 5 de las cinco ofertas se anuncian por debajo del valor ajustado de referencia del modelo para sus propias características.

Etapa 7. Segunda solicitud: apartamentos en la Zona Sur

El punto 7 repite el procedimiento de los puntos 1 a 6 para la segunda solicitud. La limpieza, la estandarización de categorías, la eliminación de duplicados y la imputación con MICE ya se realizaron sobre la base maestra vivienda_corregida; por tanto, esta etapa comienza con el filtro de apartamentos de la Zona Sur y continúa con EDA, modelación, validación de supuestos, predicción y selección de ofertas.

La solicitud corresponde a un apartamento de 300 m², tres parqueaderos, tres baños, cinco habitaciones, estrato 5 o 6 y crédito preaprobado máximo de 850 millones de pesos.

7.1 Construcción y comprobación de base2

Filtro solicitado

base2 <- vivienda_corregida %>%
  filter(
    tipo == "Apartamento",
    zona == "Zona Sur"
  )

La consulta produce 2.760 ofertas. Todas proceden de la misma base corregida utilizada para la primera solicitud.

Tabla 25. Comprobación del filtro de base2
Indicador Resultado
Número de registros 2.760
Identificadores originales únicos 2.760
Tipos diferentes 1
Zonas diferentes 1
Todas las ofertas son apartamentos
Todas pertenecen a Zona Sur
Valores faltantes 0
Coordenadas faltantes 0

Primeros tres registros

Tabla 26. Primeros tres registros de base2
ID Zona Piso Estrato Precio (millones) Área construida (m²) Parqueaderos Baños Habitaciones Tipo Barrio Longitud Latitud
5098 Zona Sur 5 4 290 96 1 2 3 Apartamento Acopi -76.53464 3.44987
698 Zona Sur 2 3 78 40 1 1 2 Apartamento Aguablanca -76.50100 3.40000
8199 Zona Sur 8 6 875 194 2 5 3 Apartamento Aguacatal -76.55700 3.45900

Auditoría interna de las coordenadas

Figura 13. Localización de los apartamentos de base2 con los dos controles espaciales: coordenadas compartidas con otra zona y latitud propia de la Zona Norte.

Se identifican 172 ofertas cuya coordenada también aparece asociada con otra zona y 66 ofertas (2,4 % de base2) cuya latitud no es inferior al primer cuartil de la Zona Norte (\(3,457\)), es decir, apartamentos “del sur” geocodificados en el norte de la ciudad. La proporción es claramente menor que la observada en base1.

Tabla 30b. Barrios con más apartamentos de base2 situados en latitudes del norte
Barrio Apartamentos de base2 con latitud del norte Ofertas del barrio registradas en Zona Sur De ellas, con latitud del sur
Valle Del Lili 34 991 856
El Caney 3 205 192
El Limonar 3 133 115
El Refugio 3 119 108
Bochalema 2 33 12
Ciudad Bochalema 2 47 22
El Ingenio 2 203 183
La Hacienda 2 165 154

El patrón se repite: el barrio más frecuente, Valle Del Lili, es un sector del sur cuyas demás ofertas sí tienen latitud meridional, lo que apunta a errores puntuales de geocodificación y no a zonas mal etiquetadas. Se conserva la zona declarada, se reestima el modelo sin estos registros en la sección 7.4 y la selección de ofertas exige coordenadas coherentes con la Zona Sur.

7.2 Análisis exploratorio de base2

Para la correlación exploratoria, el estrato se interpreta como una variable ordinal; en la regresión se incorpora como factor para no imponer diferencias iguales entre estratos consecutivos.

Resumen descriptivo

Tabla 27. Resumen descriptivo de base2
Variable N Media Desviación estándar Q1 Mediana Q3 Mínimo Máximo
Precio (millones) 2.760 297,7 192,2 175,0 245,0 335,0 75,0 1.750,0
Área construida (m²) 2.760 97,6 52,7 65,0 85,0 110,0 40,0 932,0
Estrato 2.760 4,6 0,8 4,0 5,0 5,0 3,0 6,0
Parqueaderos 2.760 1,4 0,7 1,0 1,0 2,0 1,0 10,0
Baños 2.760 2,5 0,9 2,0 2,0 3,0 1,0 8,0
Habitaciones 2.760 3,0 0,6 3,0 3,0 3,0 1,0 6,0

El precio promedio es de 297,7 millones, aunque la mediana de 245,0 millones representa mejor el valor típico: aproximadamente la mitad de los apartamentos se ofrece por debajo de este valor y la otra mitad por encima. En tamaño, el área promedio es de 97,6 m²** con la mitad central de las áreas construidas entre 65,0 y 110,0 m². El apartamento típico se ubica en estrato 5 y cuenta con 1 parqueadero, 2 baños y 3 habitaciones.

Correlaciones con el precio

Figura 14. Matriz interactiva de correlaciones de Pearson para base2.

Figura 15. Correlaciones de Pearson y Spearman entre el precio y cada predictor en base2.

Las asociaciones de Pearson con el precio son: área construida \(r=0,758\), estrato \(r=0,672\), parqueaderos \(r=0,669\), baños \(r=0,734\) y habitaciones \(r=0,347\). La relación lineal de mayor magnitud corresponde a Área construida (m²).

Precio, área y estrato

Figura 16. Precio frente al área construida de los apartamentos, diferenciado por estrato.

Frente al mismo gráfico obtenido para las casas de la zona norte, el mercado de apartamentos presenta una concentración mucho mayor en superficies pequeñas y medias, principalmente por debajo de 200 m², mientras que las casas muestran una dispersión considerablemente más amplia en tamaño. En ambos segmentos existe una relación positiva entre área construida y precio, pero en los apartamentos la pendiente visual es más pronunciada, sugiriendo que el incremento del precio asociado al área podría ser mayor en este segmento.

También se aprecia una segmentación más marcada por estrato: para áreas similares, los apartamentos de estratos 5 y 6 tienden a ubicarse en niveles de precio superiores a los de estratos 3 y 4, lo que indica que el valor no depende únicamente del tamaño, sino también del segmento socioeconómico al que pertenece el inmueble. Al igual que en las casas, la dispersión del precio aumenta a medida que crece el área y aparecen algunas propiedades extremas (apartamentos de gran superficie con precios inusualmente bajos y otros de tamaño medio con precios muy elevados), que podrían influir en la estimación de la tendencia lineal. En síntesis, las casas conforman un mercado más heterogéneo en tamaño, mientras que los apartamentos están más concentrados dimensionalmente pero muestran una diferenciación más clara de precios según el estrato.

Precio y características discretas

Figura 17. Distribución del precio según estrato, parqueaderos, baños y habitaciones en base2.

Tabla 28. Precio anunciado por estrato en base2, en millones
Estrato Ofertas Precio medio Precio mediano Q1 del precio Q3 del precio
3 200 141,2 128,0 110,0 148,2
4 1.075 203,5 185,0 153,0 240,0
5 1.024 293,6 280,0 230,0 330,0
6 461 594,6 580,0 410,0 700,0

Correlaciones entre predictores y dispersión del precio

Tabla 33b. Correlaciones de Pearson entre los predictores de base2
Variable 1 Variable 2 r de Pearson
Área construida (m²) Baños 0,685
Estrato Baños 0,574
Área construida (m²) Parqueaderos 0,561
Parqueaderos Baños 0,556
Baños Habitaciones 0,524
Área construida (m²) Estrato 0,481
Estrato Parqueaderos 0,474
Área construida (m²) Habitaciones 0,454
Parqueaderos Habitaciones 0,268
Estrato Habitaciones 0,212
Tabla 33c. Dispersión del precio por tercil de área y por estrato en base2
Grupo Ofertas Área media (m²) Precio medio Desviación estándar del precio Rango intercuartil Coeficiente de variación
Area tercil 1 920 61,0 166,4 44,3 53,0 0,27
Area tercil 2 920 84,4 254,1 54,2 70,0 0,21
Area tercil 3 920 147,4 472,7 237,0 281,8 0,50
Estrato 3 200 68,8 141,2 62,7 38,2 0,44
Estrato 4 1.075 75,9 203,5 67,7 87,0 0,33
Estrato 5 1.024 102,2 293,6 102,8 100,0 0,35
Estrato 6 461 150,2 594,6 256,7 290,0 0,43

En los apartamentos del sur los predictores están más correlacionados entre sí que en las casas del norte: la pareja Área construida (m²) y Baños alcanza \(r=0,685\). Esto anticipa un VIF mayor, aunque todavía moderado. La heterocedasticidad es aquí más marcada: la desviación estándar del precio se multiplica por 5,4 entre el tercil de apartamentos pequeños y el de grandes, con un salto abrupto en el tercil superior, que concentra los apartamentos de estrato 6 y las áreas atípicas. Las dos observaciones se confirman en el diagnóstico de la sección 7.4.

El EDA de la segunda solicitud identifica las variables con mayor asociación con el precio y muestra la heterogeneidad existente incluso dentro de una misma zona y un mismo tipo de inmueble. Anticipa, además, una correlación más alta entre predictores que en base1 y una varianza del precio fuertemente creciente con el área y el estrato.

7.3 Modelo MCO, stepwise y validación cruzada

Modelo completo

modelo_completo_base2 <- lm(
  preciom ~ areaconst + estrato_f + habitaciones +
    parqueaderos + banios,
  data = base_modelado_base2
)
Tabla 29. Estimación MCO del modelo completo para base2
Variable Estimación Error estándar Estadístico t Valor p IC 95 % inferior IC 95 % superior Significativo al 5 %
Intercepto -39,259 10,498 -3,740 < 0,001 -59,843 -18,674
Área construida 1,336 0,047 28,302 < 0,001 1,243 1,428
Estrato 4 frente a 3 29,063 6,982 4,163 < 0,001 15,373 42,753
Estrato 5 frente a 3 56,663 7,204 7,865 < 0,001 42,537 70,788
Estrato 6 frente a 3 212,762 9,027 23,569 < 0,001 195,062 230,463
Habitaciones -12,221 3,352 -3,645 < 0,001 -18,794 -5,647
Parqueaderos 51,117 3,308 15,451 < 0,001 44,630 57,604
Baños 41,929 2,996 13,996 < 0,001 36,055 47,803

El modelo completo obtiene un \(R^2\) de 0,7872 y un \(R^2\) ajustado de 0,7866. La prueba global es \(F(7, 2.752) = 1.454,09\), con valor \(p\) < 0,001. Por tanto, el conjunto de predictores aporta información estadísticamente significativa sobre el precio.

Interpretación de los coeficientes

Área construida. Manteniendo constantes las demás características, una diferencia de 100 m² se asocia con un precio medio estimado 133,6 millones mayor. El valor \(p\) es < 0,001.

Parqueaderos. Un parqueadero adicional se asocia con 51,1 millones más en el precio medio, manteniendo constantes las demás variables. El coeficiente es significativo al 5 %.

Baños. Un baño adicional se asocia con 41,9 millones más, a igualdad de las demás características. El valor \(p\) es < 0,001.

Habitaciones. A igual área, estrato, parqueaderos y baños, una habitación adicional presenta un coeficiente de -12,2 millones, con valor \(p\) < 0,001. El resultado permite distinguir su aporte de cero al 5 %. El signo debe interpretarse junto con el área: a superficie constante, aumentar el número de habitaciones también puede significar subdividir el espacio.

Estrato. Frente al estrato 3, las diferencias estimadas son:

  • Estrato 4: 29,1 millones mayor, con valor p < 0,001.
  • Estrato 5: 56,7 millones mayor, con valor p < 0,001.
  • Estrato 6: 212,8 millones mayor, con valor p < 0,001.

Estas diferencias comparan segmentos del mercado y no representan el efecto causal de cambiar administrativamente un apartamento de estrato.

Intercepto. Representa un apartamento del estrato de referencia con área y dotaciones iguales a cero. Esa combinación queda fuera del contexto observado, por lo que el intercepto no tiene una interpretación inmobiliaria directa.

Inferencia robusta y sensibilidad a la imputación

Tabla 36b. Modelo de base2: errores estándar clásicos y robustos (HC3)
Variable Estimación EE clásico EE robusto HC3 Razón HC3 / clásico Valor p clásico Valor p HC3 Significativo al 5 % con HC3
Intercepto -39,259 10,498 16,555 1,58 < 0,001 0,018
Área construida 1,336 0,047 0,364 7,72 < 0,001 < 0,001
Estrato 4 frente a 3 29,063 6,982 4,756 0,68 < 0,001 < 0,001
Estrato 5 frente a 3 56,663 7,204 5,511 0,77 < 0,001 < 0,001
Estrato 6 frente a 3 212,762 9,027 12,290 1,36 < 0,001 < 0,001
Habitaciones -12,221 3,352 6,765 2,02 < 0,001 0,071 No
Parqueaderos 51,117 3,308 12,209 3,69 < 0,001 < 0,001
Baños 41,929 2,996 8,435 2,82 < 0,001 < 0,001

La corrección HC3 cambia aquí una conclusión. El error estándar robusto del área es 7,7 veces el clásico, y el de habitaciones se duplica: con inferencia robusta, el coeficiente negativo de habitaciones (-12,2 millones) tiene un valor p de 0,071 y deja de ser significativo al 5 %. La lectura correcta es, por tanto, más prudente que la del modelo clásico: la evidencia de que subdividir un apartamento en más habitaciones reduce su precio es sugerente pero no concluyente. Área, estrato, parqueaderos y baños conservan su significancia con holgura.

Tabla 36c. Coeficientes del modelo completo de base2 según tratamiento de los faltantes: estimación (error estándar)
Variable Base imputada (principal) Casos completos observados Imputación múltiple agrupada (5 completaciones)
Intercepto -39,3 (10,5) -26,5 (13,2) -39,0 (10,5)
Área construida 1,336 (0,047) 1,289 (0,052) 1,323 (0,049)
Estrato 4 frente a 3 29,1 (7,0) 30,5 (9,7) 29,2 (7,1)
Estrato 5 frente a 3 56,7 (7,2) 50,8 (9,7) 56,1 (7,3)
Estrato 6 frente a 3 212,8 (9,0) 203,3 (11,3) 212,0 (9,2)
Habitaciones -12,2 (3,4) -18,4 (3,9) -12,8 (3,4)
Parqueaderos 51,1 (3,3) 63,2 (4,1) 54,8 (5,1)
Baños 41,9 (3,0) 42,2 (3,3) 41,2 (3,2)

Con 2.349 casos completos y con la imputación múltiple agrupada, los coeficientes se mantienen dentro de un error estándar de los principales. La mayor diferencia aparece en parqueaderos (51,1 en la base imputada frente a 63,2 en casos completos), que es la variable con más faltantes; la estimación agrupada (54,8) queda entre ambas. Los resultados no dependen de la imputación.

Selección stepwise

Tabla 30. Trayectoria stepwise para base2
Step Df Deviance Resid. Df Resid. Dev AIC
Modelo completo 2752 21691618 24771.68

La fórmula seleccionada con toda la muestra es:

## preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + 
##     banios
Tabla 31. Comparación del ajuste de los modelos de base2
Modelo Fórmula Parámetros R² ajustado AIC Delta AIC BIC RMSE entrenamiento MAE entrenamiento
Completo preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 8 0,7872 0,7866 32.606,2 0,00 32.659,5 88,7 53,0
Stepwise AIC preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 8 0,7872 0,7866 32.606,2 0,00 32.659,5 88,7 53,0

La trayectoria interna de step() y la tabla comparativa pueden mostrar AIC en escalas absolutas distintas, porque step() utiliza extractAIC() y la tabla utiliza AIC(). La ordenación y las diferencias entre modelos son las que deben interpretarse.

Validación cruzada de diez pliegues

Tabla 32. Validación cruzada de diez pliegues para base2
Modelo RMSE MAE R² predictivo
Completo 92,07 53,35 0,7704
Stepwise AIC 92,07 53,35 0,7704

El RMSE del modelo completo es 92,07 millones y el del stepwise es 92,07 millones. La diferencia absoluta es de 0,00 millones. El procedimiento stepwise no eliminó ninguna variable: la fórmula seleccionada coincide exactamente con el modelo completo. La misma fórmula fue estable en validación cruzada; por tanto, se conserva el modelo completo como modelo identificado para la segunda solicitud.

Tabla 33. Estabilidad de la fórmula stepwise en base2
Fórmula Número de pliegues
preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 10
Tabla 34. Modelo candidato para la segunda solicitud
Modelo Fórmula N Parámetros R² ajustado AIC BIC RMSE CV MAE CV R² predictivo CV
Modelo completo retenido por stepwise preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios 2.760 8 0,7872 0,7866 32.606,2 32.659,5 92,07 53,35 0,7704

El procedimiento stepwise basado en AIC no eliminó ninguna variable. Por tanto, el modelo identificado para la segunda solicitud es el Modelo completo retenido por stepwise, con la fórmula preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios. La misma fórmula fue seleccionada en 10 de 10 pliegues, lo que confirma su estabilidad. En este caso no existe una ganancia de parsimonia respecto del modelo completo: el modelo completo fue simplemente retenido por step().

7.4 Validación de supuestos de base2

La validación se realiza sobre el modelo candidato anterior. El objetivo es diagnosticar posibles incumplimientos y formular sugerencias; no se eliminan observaciones ni se sustituye automáticamente el modelo.

Tabla 35. Resumen de la validación de supuestos para base2
Supuesto Procedimiento Valor diagnóstico Valor p Resultado Recomendación
Linealidad y forma funcional Prueba RESET de Ramsey 168,990 < 0,001 Alerta: posible no linealidad o especificación incompleta Evaluar logaritmos, términos no lineales e interacciones.
Homoscedasticidad Prueba de Breusch-Pagan 817,524 < 0,001 Alerta: la varianza de los errores no es constante Evaluar una transformación logarítmica del precio y revisar la especificación.
Normalidad aproximada de los residuos Prueba de Shapiro-Wilk y gráfico Q-Q 0,772 < 0,001 Alerta: los residuos se apartan de la normalidad Apoyarse en el gráfico Q-Q, revisar los casos extremos y considerar transformaciones.
Multicolinealidad VIF/GVIF ajustado 1,650 Sin multicolinealidad preocupante Mantener los predictores si los índices permanecen bajo el umbral.
Independencia de los errores Evaluación del diseño transversal No existe un orden temporal; 1165 ofertas comparten coordenada con al menos otra oferta No aplicar Durbin-Watson a un orden arbitrario; considerar agrupación por barrio o dependencia espacial.
Observaciones influyentes Residuos studentizados, apalancamiento y Cook 147,000 Se identifican 147 observaciones por encima del criterio 4/n Revisar los casos, validar su calidad y realizar sensibilidad sin eliminarlos automáticamente.

Linealidad y forma funcional

Figura 18. Residuos frente a valores ajustados del modelo de base2.

Figura 18. Residuos frente a valores ajustados del modelo de base2.

La prueba RESET obtiene un estadístico de 168,990 y un valor \(p\) < 0,001. Se rechaza la hipótesis de que la forma funcional esté correctamente especificada; el resultado puede reflejar curvatura o variables omitidas. La prueba no identifica por sí sola la causa concreta.

Homoscedasticidad

Figura 19. Gráfico de escala-localización del modelo de base2.

Figura 19. Gráfico de escala-localización del modelo de base2.

La prueba de Breusch–Pagan obtiene \(\chi^2=817,524\), con valor \(p\) < 0,001. Se rechaza la homoscedasticidad: la variabilidad de los residuos no permanece constante para todos los niveles del precio ajustado. Como sugerencia, puede evaluarse una transformación logarítmica del precio y revisarse la especificación funcional.

Normalidad de los residuos

Figura 20. Gráfico Q-Q de los residuos studentizados de base2.

Figura 20. Gráfico Q-Q de los residuos studentizados de base2.

Shapiro–Wilk obtiene \(W=0,7716\) y valor \(p\) < 0,001. Se rechaza la normalidad de los residuos. El gráfico Q-Q permite valorar si las desviaciones se concentran principalmente en las colas. Este resultado no invalida por sí solo los coeficientes MCO, pero aconseja cautela al interpretar intervalos y predicciones.

Multicolinealidad

Tabla 36. Diagnóstico de multicolinealidad para base2
Variable GVIF Grados de libertad Índice comparable Umbral de referencia Alerta
Área construida 2,169 1 1,473 2,236 No
Estrato (factor) 1,816 3 1,105 2,236 No
Habitaciones 1,479 1 1,216 2,236 No
Parqueaderos 1,721 1 1,312 2,236 No
Baños 2,721 1 1,650 2,236 No

El mayor índice comparable corresponde a Baños, con 1,650. No se identifica multicolinealidad preocupante.

Independencia de los errores

La base es transversal y no posee un orden temporal natural; por eso no se aplica Durbin–Watson al orden arbitrario de las filas. En base2, 327 grupos de coordenadas reúnen 1.165 ofertas. La independencia se mantiene como supuesto del diseño, reconociendo una posible agrupación espacial por edificio, proyecto o punto de geocodificación.

Observaciones influyentes

Figura 21. Distancia de Cook para el modelo de base2.

Figura 21. Distancia de Cook para el modelo de base2.

Figura 22. Apalancamiento frente a residuos studentizados en base2.

Figura 22. Apalancamiento frente a residuos studentizados en base2.

Tabla 37. Resumen de observaciones que requieren revisión en base2
Indicador Umbral Número de observaciones Porcentaje
Residuos studentizados con valor absoluto mayor que 3 3,0000 30 1,1 %
Observaciones con apalancamiento superior a 2p/n 0,0058 168 6,1 %
Observaciones con distancia de Cook superior a 4/n 0,0014 147 5,3 %
Observaciones marcadas por al menos un criterio 247 8,9 %
Tabla 38. Diez casos con mayor prioridad de revisión en base2
ID Barrio Estrato Precio observado Área Precio ajustado Residuo studentizado Apalancamiento Cook Residuo extremo Alto apalancamiento Influencia Cook
6121 Valle Del Lili 5 299,0 932,0 1.402,7 -14,360 0,1946 5,7961
6472 El Limonar 5 170,0 605,0 936,2 -9,148 0,0833 0,9234
1400 El Caney 4 140,0 58,0 637,9 -5,991 0,1126 0,5620
324 Valle Del Lili 4 190,0 50,0 602,7 -4,968 0,1168 0,4045
7182 Guadalupe 5 730,0 573,0 1.210,6 -5,565 0,0436 0,1745
4952 El Ingenio 5 650,0 600,0 1.027,8 -4,396 0,0565 0,1438
6475 Ciudad Jardin 6 1.561,0 399,0 990,9 6,527 0,0176 0,0938
6512 Pance 6 1.750,0 290,0 845,3 10,424 0,0070 0,0926
5952 Ciudad Jardin 6 1.750,0 342,0 944,5 9,252 0,0088 0,0917
6086 Ciudad Jardin 6 1.500,0 240,0 783,8 8,207 0,0106 0,0880

Se identifican 30 residuos studentizados extremos, 168 casos de alto apalancamiento y 147 casos por encima del umbral de Cook. El registro con mayor Cook es el ID 6.121, con valor 5,7961. Estos casos deben contrastarse con la fuente original, pero no eliminarse automáticamente.

Especificación logarítmica y sensibilidad del modelo

Tabla 40b. Modelo de base2 lineal frente a su versión logarítmica (misma fórmula, mismos pliegues)
Especificación R² ajustado (escala propia) RMSE CV (millones) MAE CV (millones) R² predictivo CV p RESET p Breusch-Pagan W Shapiro-Wilk
Lineal (precio en millones) 0,787 92,1 53,4 0,770 < 0,001 < 0,001 0,772
Logarítmica (log del precio) 0,802 149,6 56,4 0,394 < 0,001 < 0,001 0,973

Como en base1, el logaritmo mejora la normalidad de los residuos (\(W\) de 0,772 a 0,973) pero no resuelve la heterocedasticidad ni la forma funcional, y su RMSE de validación cruzada en millones (149,6) es sensiblemente peor que el del lineal (92,1), porque los apartamentos de estrato 6 y área grande dominan el error en millones. Se conserva el modelo lineal para la predicción puntual y se usa el logarítmico como lectura complementaria de los intervalos en la sección 7.5.

Tabla 40c. Coeficientes del modelo de base2 bajo tres muestras: estimación (error estándar)
Variable Principal (base2 completa) Sin apartamentos con latitud del norte Sin Cook > 4/n
Intercepto -39,3 (10,5) -45,0 (10,7) -39,6 (6,5)
Área construida 1,336 (0,047) 1,308 (0,048) 1,751 (0,048)
Estrato 4 frente a 3 29,1 (7,0) 30,1 (7,0) 35,5 (4,2)
Estrato 5 frente a 3 56,7 (7,2) 56,7 (7,3) 64,3 (4,3)
Estrato 6 frente a 3 212,8 (9,0) 210,4 (9,1) 196,2 (5,7)
Habitaciones -12,2 (3,4) -11,2 (3,4) -10,3 (2,1)
Parqueaderos 51,1 (3,3) 57,2 (3,5) 44,3 (2,7)
Baños 41,9 (3,0) 40,7 (3,0) 26,0 (2,0)
Tabla 40d. Ajuste global del modelo de base2 bajo las tres muestras
Ajuste N Error estándar residual (millones)
Principal (base2 completa) 2.760 0,787 88,8
Sin apartamentos con latitud propia del norte 2.694 0,788 89,0
Sin observaciones con Cook > 4/n 2.613 0,884 51,8

Excluir los apartamentos con latitud del norte no altera los coeficientes. Excluir los 147 casos con Cook \(> 4/n\) sí los mueve más que en base1: el coeficiente del área sube de 1,34 a 1,75 millones por m² y el de baños baja de 41,9 a 26,0. Esto indica que unos pocos anuncios con área desproporcionada para su precio (por ejemplo, ID 6121: 932 m² anunciados a 299 millones) tiran del coeficiente del área hacia abajo. La consecuencia práctica para la vivienda 2, cuya solicitud está precisamente en la cola de áreas grandes, es que el precio estimado podría estar ligeramente subestimado; se retoma en la sección 7.5.

El modelo de base2 no presenta multicolinealidad preocupante. La prueba RESET señala una posible deficiencia de forma funcional; Breusch–Pagan detecta heterocedasticidad; y Shapiro–Wilk rechaza la normalidad de los residuos. De acuerdo con el enunciado, se conserva el modelo candidato para predecir, pero sus intervalos deben interpretarse con cautela y se recomienda revisar transformaciones, forma funcional y casos influyentes.

7.5 Predicción del precio de la vivienda 2

Características de la solicitud

Tabla 39. Características de la segunda solicitud
Característica Vivienda 2
Tipo Apartamento
Área construida 300 m²
Parqueaderos 3
Baños 3
Habitaciones 5
Estrato 5 o 6
Zona Zona Sur
Crédito preaprobado $850 millones

La predicción se calcula con el Modelo completo retenido por stepwise y la fórmula preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios. Como el estrato es un factor, se construyen dos escenarios independientes, uno para estrato 5 y otro para estrato 6. El crédito no forma parte del modelo; se utiliza después para valorar la viabilidad financiera.

La solicitud contiene cinco habitaciones. Esta variable permanece en el modelo candidato y participa directamente en la predicción.

escenarios_vivienda_2 <- tibble::tibble(
  areaconst = 300,
  habitaciones = 5,
  parqueaderos = 3,
  banios = 3,
  estrato_f = factor(
    c(5, 6),
    levels = levels(base_modelado_base2$estrato_f)
  )
)

predict(
  modelo_prediccion_vivienda_2,
  newdata = escenarios_vivienda_2,
  interval = "confidence",
  level = 0.95
)

predict(
  modelo_prediccion_vivienda_2,
  newdata = escenarios_vivienda_2,
  interval = "prediction",
  level = 0.95
)

Resultados

Tabla 40. Predicción del precio de la vivienda 2, en millones
Escenario Precio de oferta estimado IC 95 % del precio medio IP 95 % para un apartamento Crédito máximo Margen: crédito - estimación Evaluación puntual
Estrato 5 636,2 millones [616,2; 656,3] [461,0; 811,5] 850,0 millones 213,8 Dentro del crédito
Estrato 6 792,3 millones [771,8; 812,9] [617,0; 967,6] 850,0 millones 57,7 Dentro del crédito

Para el estrato 5, el precio de oferta estimado es 636,2 millones, con un margen frente al crédito de 213,8 millones. La predicción puntual se encuentra dentro del crédito disponible.

Para el estrato 6, el precio de oferta estimado es 792,3 millones, con un margen de 57,7 millones. La predicción puntual se encuentra dentro del crédito disponible.

Al comparar ambos escenarios, el precio estimado del estrato 6 es 156,1 millones mayor que el del estrato 5, manteniendo constantes las demás características. Esta diferencia describe segmentos del mercado y no un efecto causal de cambiar el estrato.

Ambos escenarios son compatibles con el crédito de 850 millones según la predicción puntual. No obstante, el estrato 5 ofrece una mayor holgura y menor riesgo presupuestal: el límite superior de su intervalo de predicción para un apartamento individual es 811,5 millones, todavía por debajo del crédito. En estrato 6, el límite superior alcanza 967,6 millones y supera el presupuesto. Por ello, cuando las demás características sean comparables, el estrato 5 constituye la alternativa financieramente más holgada, mientras que el estrato 6 requiere mayor cautela en la negociación.

Los intervalos de predicción para un apartamento individual incorporan la dispersión residual del mercado y son más amplios que los intervalos del precio medio. Como el diagnóstico de supuestos puede mostrar desviaciones de la forma funcional, homoscedasticidad o normalidad, deben entenderse como aproximaciones y no como garantías de negociación.

Posición de la solicitud, apalancamiento y extrapolación

Tabla 41b. Posición de la solicitud de la vivienda 2 en base2
Indicador Valor
Percentil del área solicitada en la base 99,0 %
Área máxima observada (m²) 932
Ofertas con área en ±10 % de la solicitada 24
Ofertas con área en ±10 % y estrato solicitado 21
Ofertas con al menos los parqueaderos solicitados 119
Ofertas con área ≥ 90 % de la solicitada y parqueaderos solicitados 29
Ofertas con área, parqueaderos, baños y habitaciones iguales o superiores 6
Tabla 41c. Apalancamiento de los escenarios de la vivienda 2
Escenario h de la solicitud h medio de la muestra (p/n) Umbral 2p/n h máximo observado Razón h / (2p/n) Dentro del rango habitual
Estrato 5 0,0133 0,0029 0,0058 0,1946 2,29 No
Estrato 6 0,0139 0,0029 0,0058 0,1946 2,41 No

La predicción de la vivienda 2 es una extrapolación. Un apartamento de 300 m² se sitúa en el percentil 99,0 del área de base2, cuya mediana es 85 m². Solo 29 apartamentos tienen al menos 270 m² y tres parqueaderos, y apenas 6 igualan o superan simultáneamente las cuatro dotaciones solicitadas. El apalancamiento de la solicitud (\(h_0 \approx 0,0133\)) es 2,3 veces el umbral \(2p/n\): la solicitud está fuera de la nube habitual de predictores. Dos consecuencias: (i) la predicción descansa en que la relación lineal estimada sobre apartamentos medianos se mantenga en los grandes, algo que la prueba RESET pone en duda; (ii) el intervalo de confianza del precio medio es más ancho de lo que sería para una solicitud típica, y la sección anterior mostró que los casos influyentes de área grande tiran el coeficiente del área hacia abajo, por lo que el riesgo es de subestimación. La cifra de 636,2 millones debe leerse como un orden de magnitud, no como un precio de referencia preciso.

Lectura del intervalo de predicción

Tabla 41d. Predicción de la vivienda 2: modelo lineal frente a modelo logarítmico (millones)
Escenario Lineal: estimación Lineal: IP 95 % Log: mediana Log: media (Duan) Log: IP 95 % Amplitud IP lineal Amplitud IP log P(precio ≤ crédito) según log
Estrato 5 636,2 [461,0; 811,5] 620,7 636,7 [395,3; 974,5] 350,5 579,2 91,6 %
Estrato 6 792,3 [617,0; 967,6] 868,4 890,8 [553,0; 1.363,7] 350,6 810,7 46,3 %

Para estrato 5 los dos modelos coinciden en la estimación central (636,2 frente a 636,7 millones). Para estrato 6 el modelo logarítmico estima un precio medio mayor (890,8 millones), lo que refuerza la advertencia de subestimación en la cola alta. A diferencia de la vivienda 1, aquí el intervalo logarítmico es más ancho que el lineal, porque la dispersión relativa de los apartamentos grandes es alta: el rango [553; 1.364] millones para estrato 6 muestra que un apartamento de esas características puede superar ampliamente el crédito. La probabilidad de que un apartamento comparable se anuncie por no más de 850 millones es de aproximadamente 92 % en estrato 5 y 46 % en estrato 6. La recomendación de priorizar el estrato 5 se mantiene y se refuerza.

7.6 Ofertas potenciales para la vivienda 2

Primero se buscó una coincidencia estricta: precio no superior a 850 millones, estrato 5 o 6, área entre 270 y 330 m², tres o más parqueaderos, tres o más baños y exactamente cinco habitaciones. Este filtro produjo 0 ofertas.

Como el propósito es presentar al menos cinco alternativas reales, cuando el filtro estricto no alcanza cinco registros se aplica una relajación explícita: área entre 240 y 360 m², entre cuatro y seis habitaciones, al menos dos parqueaderos y al menos tres baños.

Las diferencias frente a la solicitud se muestran en la tabla:

Tabla 41. Depuración de ofertas para la segunda solicitud
Etapa Número de ofertas
Ofertas disponibles en base2 2.760
Dentro del crédito y en estrato 5 o 6 1.429
Coincidencia estricta con la solicitud 0
Alternativas dentro de la relajación controlada 11
Con dotaciones observadas y coordenada consistente 9
Ofertas recomendadas 5

La lista final utiliza dotaciones observadas y coordenadas asociadas solo a Zona Sur dentro del control interno. El puntaje de ajuste asigna un punto por cada 30 m² de diferencia, un punto por cada habitación de diferencia y dos puntos por cada parqueadero faltante respecto de los tres solicitados. Un valor menor representa una mayor cercanía estructural. Para reflejar las dos categorías aceptadas por la solicitud, se reserva la alternativa mejor puntuada de cada estrato disponible y se completan los lugares restantes con los candidatos de menor puntaje global.

Cinco ofertas recomendadas

Tabla 42. Cinco ofertas potenciales para la vivienda 2
Opción ID Barrio Estrato Precio de oferta Margen del crédito Área (m²) Diferencia frente a 300 m² Parqueaderos Faltante de parqueaderos Baños Habitaciones Diferencia de habitaciones Tipo de ajuste Valor ajustado de referencia Oferta - referencia Control de calidad Alerta de dato
1 7512 Seminario 5 670,0 millones 180,0 millones 300,0 0,0 m² 3 0 5 6 1 Alternativa cercana 707,9 millones -37,9 millones Dotaciones observadas; Coordenada asociada solo a Zona Sur Sin alerta
2 8036 Seminario 5 530,0 millones 320,0 millones 256,0 44,0 m² 3 0 5 5 0 Alternativa cercana 661,3 millones -131,3 millones Dotaciones observadas; Coordenada asociada solo a Zona Sur Sin alerta
3 6175 Capri 5 350,0 millones 500,0 millones 270,0 30,0 m² 3 0 3 4 1 Alternativa cercana 608,4 millones -258,4 millones Dotaciones observadas; Coordenada asociada solo a Zona Sur Verificar dato: desviación mayor que 2 × RMSE
4 5306 Ciudadela Pasoancho 5 650,0 millones 200,0 millones 275,0 25,0 m² 2 1 5 5 0 Alternativa cercana 635,6 millones 14,4 millones Dotaciones observadas; Coordenada asociada solo a Zona Sur Sin alerta
5 4266 El Ingenio 6 700,0 millones 150,0 millones 250,0 50,0 m² 2 1 4 5 0 Alternativa cercana 716,3 millones -16,3 millones Dotaciones observadas; Coordenada asociada solo a Zona Sur Sin alerta

La lista contiene 4 ofertas de estrato 5 y 1 de estrato 6, distribuidas en 4 barrios. Sus precios se ubican entre 350,0 y 700,0 millones, con una media de 580,0 millones.

El valor ajustado de referencia se calcula con el mismo modelo sobre las características de cada anuncio. Como estas ofertas pertenecen a la muestra con la que se estimó el modelo, se utiliza únicamente como referencia interna de comparación; no constituye una predicción independiente ni demuestra una subvaloración respectivamente.

Regla de verificación de datos. Se marca toda oferta cuya desviación frente al valor de referencia supere dos veces el RMSE de validación cruzada del modelo (184,1 millones). En esta lista la activa 1 oferta: ID 6175 (Capri), anunciada en 350 millones, es decir, 258 millones por debajo de su valor de referencia. Un apartamento de 270 m² y estrato 5 al precio de uno de 130 m² no es una ganga típica, lo más probable es un error en el área o en el precio publicado, o un inmueble con una condición particular. Se conserva en la lista porque cumple los criterios declarados, pero se presenta como caso a verificar y no como oportunidad para ser adquirido.

Mapa de ofertas

Figura 23. Localización de las cinco ofertas recomendadas para la vivienda 2. Los puntos azules corresponden al estrato 5 y los morados al estrato 6.

En la lista seleccionada, 0 ofertas dependen de alguna dotación imputada y 0 tienen una coordenada compartida con otra zona dentro del control interno.

Discusión individual

Opción 1 — ID 7512 (Seminario). Apartamento de estrato 5 ofrecido en 670,0 millones. Coincide exactamente con los 300 m² solicitados; coincide con los tres parqueaderos solicitados; tiene 5 baños y ofrece 6 habitaciones, una más que lo solicitado. La oferta deja una holgura de 180,0 millones frente a 850 millones; se anuncia 37,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.

Opción 2 — ID 8036 (Seminario). Apartamento de estrato 5 ofrecido en 530,0 millones. Tiene 44,0 m² menos que el área objetivo; coincide con los tres parqueaderos solicitados; tiene 5 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 320,0 millones frente a 850 millones; se anuncia 131,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.

Opción 3 — ID 6175 (Capri). Apartamento de estrato 5 ofrecido en 350,0 millones. Tiene 30,0 m² menos que el área objetivo; coincide con los tres parqueaderos solicitados; tiene 3 baños y ofrece 4 habitaciones, una menos que lo solicitado. La oferta deja una holgura de 500,0 millones frente a 850 millones; se anuncia 258,4 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.

Opción 4 — ID 5306 (Ciudadela Pasoancho). Apartamento de estrato 5 ofrecido en 650,0 millones. Tiene 25,0 m² menos que el área objetivo; ofrece 2 parqueaderos, uno menos que lo solicitado; tiene 5 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 200,0 millones frente a 850 millones; se anuncia 14,4 millones por encima del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.

Opción 5 — ID 4266 (El Ingenio). Apartamento de estrato 6 ofrecido en 700,0 millones. Tiene 50,0 m² menos que el área objetivo; ofrece 2 parqueaderos, uno menos que lo solicitado; tiene 4 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 150,0 millones frente a 850 millones; se anuncia 16,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.

Recomendación para María

La opción 1, ID 7512 en Seminario, ocupa el primer lugar según el puntaje de cercanía definido. Se ofrece en 670,0 millones, deja una holgura de 180,0 millones y debe evaluarse junto con las diferencias explícitas de área, parqueaderos y habitaciones mostradas en la Tabla 42.

La opción 3 (ID 6175, Capri) queda marcada como dato a verificar por su desviación extrema frente al valor de referencia y no debe encabezar las visitas hasta confirmar área y precio. La lista final no oculta la ausencia de coincidencias suficientes bajo todos los criterios estrictos. Por ello, las cinco opciones deben entenderse como una lista corta de visitas y verificación, no como sustitutos exactos de la solicitud. Antes de recomendar una compra deben confirmarse la vigencia del anuncio, el estado del inmueble, la documentación, la ubicación precisa, la cuota de administración y el precio efectivo de negociación.

7.7 Comparación entre los modelos de las dos solicitudes

Los dos modelos comparten la especificación del enunciado, lo que permite compararlos término a término. La Tabla 43 contrasta los coeficientes de los modelos completos y añade una prueba \(z\) de igualdad entre muestras independientes, \(z=(\hat\beta_2-\hat\beta_1)/\sqrt{ee_1^2+ee_2^2}\); la Tabla 44 compara el ajuste, el error y los diagnósticos.

Tabla 43. Coeficientes de los modelos completos de base1 y base2 y prueba de igualdad
Variable Casas Zona Norte: estimación (EE) Apartamentos Zona Sur: estimación (EE) Diferencia (sur - norte) z Valor p de la diferencia
Intercepto -2,904 (18,589) -39,26 (10,50) -36,35 -1,70 0,089
Área construida (por m²) 0,739 (0,045) 1,336 (0,047) 0,60 9,17 < 0,001
Estrato 4 frente a 3 72,48 (16,99) 29,06 (6,98) -43,42 -2,36 0,018
Estrato 5 frente a 3 129,19 (16,11) 56,66 (7,20) -72,53 -4,11 < 0,001
Estrato 6 frente a 3 305,90 (26,54) 212,76 (9,03) -93,14 -3,32 < 0,001
Habitaciones 5,054 (4,598) -12,22 (3,35) -17,27 -3,04 0,002
Parqueaderos 27,58 (5,17) 51,12 (3,31) 23,54 3,84 < 0,001
Baños 23,77 (5,72) 41,93 (3,00) 18,16 2,81 0,005
Tabla 44. Ajuste, error y diagnósticos de los dos modelos
Indicador Casas Zona Norte (base1) Apartamentos Zona Sur (base2)
Número de ofertas 717 2.760
Modelo candidato Stepwise AIC Modelo completo retenido por stepwise
R² del modelo completo 0,680 0,787
R² ajustado del modelo completo 0,677 0,787
RMSE de validación cruzada (millones) 156,5 92,1
MAE de validación cruzada (millones) 96,8 53,4
R² predictivo de validación cruzada 0,662 0,770
Error estándar residual (millones) 153,0 88,8
Precio mediano (millones) 390,0 245,0
Precio mediano por m² (millones) 1,66 2,90
Área mediana (m²) 240,0 85,0
Valor p de RESET < 0,001 < 0,001
Valor p de Breusch-Pagan < 0,001 < 0,001
W de Shapiro-Wilk 0,832 0,772
Mayor GVIF ajustado 1,265 1,650
Observaciones con Cook > 4/n (%) 6,0 5,3
RMSE CV de la especificación logarítmica (millones) 176,4 149,6

El metro cuadrado vale distinto. En los apartamentos del sur cada m² adicional se asocia con 1,34 millones, frente a 0,74 en las casas del norte; la diferencia es estadísticamente clara (\(p\) < 0,001). Es coherente con el precio mediano por m² de cada mercado (2,90 frente a 1,66 millones): el apartamento del sur es un producto más denso en valor, en el que el área construida es el atributo dominante, mientras que en la casa del norte parte del valor está en el lote, el estrato y el barrio, que el área no captura.

El estrato pesa más en las casas. Las primas de estrato frente al 3 son mayores en las casas del norte para los tres niveles, y la del estrato 6 (306 frente a 213 millones, \(p\) < 0,001) es la más diferenciada. Una lectura plausible es que en las casas el estrato resume atributos de localización y tamaño de lote que no están en el modelo, mientras que en los apartamentos ese contenido se reparte con el área y los parqueaderos.

Habitaciones cambia de signo. En las casas el coeficiente es positivo y no significativo; en los apartamentos es negativo (-12,2 millones) y significativo con errores clásicos, aunque marginal con HC3. La interpretación es la misma en ambos casos y por eso los resultados no se contradicen: a igual área, más habitaciones significan habitaciones más pequeñas. En un apartamento, donde el área es limitada, esa subdivisión resta valor; en una casa de 240 m² de mediana, la misma subdivisión es neutra.

Parqueaderos y baños valen más en apartamentos. Un parqueadero adicional se asocia con 51,1 millones en el sur frente a 27,6 en las casas del norte. En un conjunto residencial el parqueadero es un bien escaso y con precio de mercado propio; en una casa suele formar parte del lote.

Ajuste y supuestos. El modelo de apartamentos explica más varianza (R² 0,787 frente a 0,680), pero su RMSE relativo a la mediana es similar (38 % frente a 40 %): el mayor R² refleja sobre todo que en el sur los estratos separan más los precios, no que el error típico de una predicción individual sea menor en términos relativos. Ambos comparten los mismos incumplimientos (RESET, Breusch–Pagan y normalidad rechazadas; sin multicolinealidad) y en ambos la especificación logarítmica mejora la normalidad sin mejorar la predicción en millones. La diferencia práctica relevante es que la vivienda 1 se predice por interpolación y la vivienda 2 por extrapolación, lo que hace que la segunda cifra sea intrínsecamente menos precisa aunque provenga del modelo con mejor ajuste.

Archivos generados

Al ejecutar el script o compilar este R Markdown se crea la carpeta salidas_actividad2_puntos_1_a_7, que contiene:

  • la base maestra corregida y las bases filtradas base1 y base2;
  • los controles de calidad, faltantes, duplicados y coherencia espacial;
  • el objeto de imputaciones MICE;
  • los resúmenes descriptivos y correlaciones de ambas solicitudes;
  • los modelos completos, stepwise y sus validaciones cruzadas;
  • los diagnósticos de supuestos, VIF y casos influyentes de ambos modelos;
  • las predicciones de las viviendas 1 y 2;
  • los candidatos, las listas de cinco ofertas y los mapas de ambas solicitudes;
  • los controles latitudinales por zona y por barrio de ambas bases;
  • las correlaciones entre predictores y la dispersión del precio por nivel;
  • los coeficientes con errores estándar robustos (HC3) de ambos modelos;
  • la comparación lineal frente a logarítmica y las predicciones del modelo log;
  • los análisis de sensibilidad (imputación, latitud, influyentes);
  • la posición y el apalancamiento de cada solicitud;
  • la comparación de coeficientes y ajuste entre los dos modelos;
  • los objetos RDS con modelos, diagnósticos y selecciones;
  • la información de la sesión de R.

Referencias

Breusch, T. S., & Pagan, A. R. (1979). A simple test for heteroscedasticity and random coefficient variation. Econometrica, 47(5), 1287–1294.

Duan, N. (1983). Smearing estimate: A nonparametric retransformation method. Journal of the American Statistical Association, 78(383), 605–610.

Fox, J., & Weisberg, S. (2019). An R Companion to Applied Regression (3rd ed.). Sage.

Long, J. S., & Ervin, L. H. (2000). Using heteroscedasticity consistent standard errors in the linear regression model. The American Statistician, 54(3), 217–224.

MacKinnon, J. G., & White, H. (1985). Some heteroskedasticity-consistent covariance matrix estimators with improved finite sample properties. Journal of Econometrics, 29(3), 305–325.

Ramsey, J. B. (1969). Tests for specification errors in classical linear least-squares regression analysis. Journal of the Royal Statistical Society, Series B, 31(2), 350–371.

Rubin, D. B. (1987). Multiple Imputation for Nonresponse in Surveys. Wiley.

Sievert, C. (2020). Interactive Web-Based Data Visualization with R, Plotly, and Shiny. CRC Press.

Van Buuren, S., & Groothuis-Oudshoorn, K. (2011). mice: Multivariate imputation by chained equations in R. Journal of Statistical Software, 45(3), 1–67.

Van Buuren, S. (2018). Flexible Imputation of Missing Data (2nd ed.). Chapman & Hall/CRC.

Zeileis, A. (2004). Econometric computing with HC and HAC covariance matrix estimators. Journal of Statistical Software, 11(10), 1–17.