El análisis evaluó dos solicitudes inmobiliarias de C&A a partir de una base maestra depurada, estandarizada y completada mediante MICE. Para cada caso se realizó exploración de datos, regresión lineal múltiple por MCO, selección stepwise, validación cruzada, diagnóstico de supuestos, predicción del precio y selección de ofertas reales compatibles con el presupuesto. A continuación se presentanlos principales hallazgos:
| Caso | Base analizada | Modelo identificado | Desempeño | Predicción y presupuesto |
|---|---|---|---|---|
| Vivienda 1: casa, Zona Norte | 717 ofertas | Stepwise AIC: preciom ~ areaconst + estrato_f + parqueaderos + banios | R²=0,679; R² CV=0,662 | Estrato 4: 309,3 M; estrato 5: 364,7 M; crédito: 350 M |
| Vivienda 2: apartamento, Zona Sur | 2.760 ofertas | Modelo completo retenido por stepwise: preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | R²=0,787; R² CV=0,770 | Estrato 5: 636,2 M; estrato 6: 792,3 M; crédito: 850 M |
Caso 1 — Casa en Zona Norte. Sobre 717 casas, el modelo seleccionado por stepwise conserva área, estrato, parqueaderos y baños. Explica cerca del 68 % de la variación observada y alcanza un R² predictivo cercano a 0,66. Para una casa de 200 m², un parqueadero y dos baños, el precio de oferta estimado es 309,3 millones en estrato 4 y 364,7 millones en estrato 5. El escenario de estrato 4 se ajusta mejor al crédito de 350 millones; el de estrato 5 supera el presupuesto en la estimación puntual, aunque existen anuncios reales de ese estrato por debajo del límite. Las opciones ID 1144 (La Merced) e ID 1343 (La Flora) constituyen el primer grupo de visitas, en donde ambas se ofrecen en 320 millones, coinciden con 200 m² y cuatro habitaciones y dejan 30 millones de holgura.
Caso 2 — Apartamento en Zona Sur. Se analizaron 2.760 apartamentos. El procedimiento stepwise no eliminó ninguna variable, por lo que el modelo identificado es el modelo completo con área, estrato, habitaciones, parqueaderos y baños. Su R² es aproximadamente 0,787 y el R² predictivo de validación cruzada es cercano a 0,770. Para 300 m², tres parqueaderos, tres baños y cinco habitaciones, el precio estimado es 636,2 millones en estrato 5 y 792,3 millones en estrato 6. Ambos valores puntuales están dentro del crédito de 850 millones. Sin embargo, la solicitud es atípica en este mercado, ya que 300 m² está en el percentil 99 del área y solo 29 apartamentos de la base tienen al menos 270 m² y tres parqueaderos. El estrato 5 ofrece la mayor seguridad presupuestal, esto es, la probabilidad de que un apartamento comparable se anuncie por no más de 850 millones ronda el 92 %, frente a cerca del 46 % en estrato 6, donde un apartamento comparable puede superar el crédito con facilidad.
Evidentemente, los dos mercados no se comportan igual. El metro cuadrado se paga casi el doble en los apartamentos del sur (1,34 frente a 0,74 millones por m²), los parqueaderos y baños valen más en apartamentos, y el estrato pesa más en las casas. Estas diferencias son estadísticamente claras y justifican haber estimado un modelo separado para cada solicitud.
Para la casa, se recomienda iniciar visitas con las opciones 1144 y 1343 y utilizar el resto de la lista corta como alternativas de negociación. Para el apartamento, no existe una oferta que cumpla simultáneamente todos los criterios estrictos; por ello, se ampliaron de forma explícita los rangos de búsqueda para identificar alternativas cercanas a la solicitud original. La opción 7512 en Seminario es la más cercana estructuralmente: 300 m², tres parqueaderos y precio de 670 millones, aunque tiene seis habitaciones. La opción 8036, también en Seminario, conserva tres parqueaderos y cinco habitaciones, cuesta 530 millones y sacrifica 44 m² de área. Las cinco alternativas del caso 2 permanecen dentro del crédito y se presentan en el mapa del anexo técnico.
Este documento presenta el desarrollo completa para las dos solicitudes: primero analiza las casas de la Zona Norte y después repite el procedimiento para los apartamentos de la Zona Sur. Ambas aplicaciones parten de una única base maestra estandarizada, sin duplicados originales y completada mediante MICE.
El procedimiento aplicado es el siguiente:
base1La base original contiene 8.322 registros y
13 variables originales. Se agregó
id_fila_original para mantener la trazabilidad durante la
limpieza.
Los registros sin la información mínima para identificar una oferta se excluyeron antes de la imputación. Esta decisión evita que MICE tenga que reconstruir artificialmente casi toda una vivienda.
| Etapa | Registros | Eliminados en la etapa |
|---|---|---|
| Base original | 8.322 | 0 |
| Base con registros estructuralmente válidos | 8.319 | 3 |
| Base estandarizada y sin duplicados originales | 8.262 | 57 |
| Base corregida y completada mediante MICE | 8.262 | 0 |
Los textos se normalizaron eliminando espacios duplicados,
diferencias de mayúsculas y minúsculas, acentos inconsistentes y errores
de codificación. Las categorías de zona y tipo
se reconstruyeron mediante un diccionario cerrado, de modo que cualquier
valor no reconocido detenga el proceso.
| Zona | Número de ofertas |
|---|---|
| Zona Centro | 124 |
| Zona Norte | 1.920 |
| Zona Oeste | 1.198 |
| Zona Oriente | 351 |
| Zona Sur | 4.726 |
| Tipo | Número de ofertas |
|---|---|
| Apartamento | 5.100 |
| Casa | 3.219 |
Los valores iguales a cero en baños y habitaciones se trataron como datos no informados, porque no son coherentes con ofertas residenciales clasificadas como casas o apartamentos. En total se identificaron 76 registros afectados por al menos una de estas dos condiciones.
Acto seguido, los duplicados se buscaron después de estandarizar las
categorías. Dos filas se consideraron duplicadas cuando coincidían en
todas las características de la oferta, excluyendo id e
id_fila_original. Se conservó la primera aparición y se
guardó el detalle de las filas retiradas para auditoría.
Se eliminaron 57 duplicados adicionales antes del procedimiento de imputación por MICE. Después de completar los faltantes se identificaron 7 coincidencias adicionales de perfil. Estas coincidencias se conservaron y se marcaron, porque fueron creadas por los valores imputados y no demuestran que dos registros correspondan al mismo inmueble.
| Indicador | Valor |
|---|---|
| Registros estructuralmente excluidos | 3 |
| Duplicados originales eliminados antes de MICE | 57 |
| Duplicados originales pendientes | 0 |
| Coincidencias adicionales detectadas después de MICE (conservadas) | 7 |
| Registros pertenecientes a grupos coincidentes post-MICE | 14 |
| Faltantes en la base corregida | 0 |
| Categorías de tipo | 2 |
| Categorías de zona | 5 |
Después de eliminar las filas estructuralmente inválidas y los
duplicados, los faltantes restantes corresponden a piso,
parqueaderos, banios y
habitaciones. Estas variables se completaron mediante
ecuaciones encadenadas y predictive mean matching (PMM).
El modelo de imputación utiliza precio, área, estrato, tipo, zona,
coordenadas y las demás características estructurales. Se generaron
5 imputaciones, con 10 iteraciones y
semilla fija 2026. Para obtener una única base
operativa reproducible se empleó la primera completación; el objeto con
las cinco versiones se conserva en
salidas_actividad2_puntos_1_a_7/imputaciones_mice.rds.
| Variable | Valores completados | Porcentaje |
|---|---|---|
| Piso | 2.625 | 31,8 % |
| Parqueaderos | 1.592 | 19,3 % |
| Baños | 45 | 0,5 % |
| Habitaciones | 65 | 0,8 % |
La siguiente figura (Fig 1) permite revisar la estabilidad de las medias y desviaciones estándar de las cadenas de imputación. Lo que se busca en este tipo de gráficos es que las líneas no sean idénticas, sino trayectorias mezcladas y sin una tendencia sistemática persistente.
Figura 1. Convergencia de las cadenas de MICE para las variables imputadas.
Al respecto se puede afirmar que:
La base vivienda_corregida contiene 8.262
ofertas, sin valores faltantes y no conserva duplicados
detectados en los datos originales estandarizados. Las coincidencias de
perfil generadas después de MICE permanecen identificadas mediante una
bandera de auditoría. Esta es la única base de datos maestra utilizada
para generar los filtros posteriores, según lo solicita el enunciado del
caso.
base1El filtro se aplicó únicamente después de finalizar la limpieza de la base completa:
base1 <- vivienda_corregida %>%
filter(
tipo == "Casa",
zona == "Zona Norte"
)
La consulta recupera 717 ofertas. La siguiente tabla ubica este resultado dentro de la distribución completa por tipo y zona.
| tipo | Zona Centro | Zona Norte | Zona Oeste | Zona Oriente | Zona Sur |
|---|---|---|---|---|---|
| Apartamento | 24 | 1191 | 1026 | 61 | 2760 |
| Casa | 100 | 717 | 169 | 289 | 1925 |
| Indicador | Resultado |
|---|---|
| Número de registros | 717 |
| Identificadores originales únicos | 717 |
| Tipos diferentes | 1 |
| Zonas diferentes | 1 |
| Todas las ofertas son casas | Sí |
| Todas pertenecen a Zona Norte | Sí |
| Valores faltantes | 0 |
| Coordenadas faltantes | 0 |
| ID | Zona | Piso | Estrato | Precio (millones) | Área construida (m²) | Parqueaderos | Baños | Habitaciones | Tipo | Barrio | Longitud | Latitud |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1209 | Zona Norte | 2 | 5 | 320 | 150 | 2 | 4 | 6 | Casa | Acopi | -76.51341 | 3.47968 |
| 1592 | Zona Norte | 2 | 5 | 780 | 380 | 2 | 3 | 3 | Casa | Acopi | -76.51674 | 3.48721 |
| 4057 | Zona Norte | 2 | 6 | 750 | 445 | 2 | 7 | 6 | Casa | Acopi | -76.52950 | 3.38527 |
El enunciado pregunta si todos los puntos de base1 caen
en la Zona Norte o si aparecen valores en otras zonas. Como no se
dispone de los polígonos oficiales de zonificación y no es alcance del
ejercicio, se aplican dos controles complementarios:
| Zona | Ofertas | Latitud Q1 | Latitud mediana | Latitud Q3 | Longitud mediana |
|---|---|---|---|---|---|
| Zona Norte | 1.908 | 3,457 | 3,472 | 3,485 | -76,520 |
| Zona Oeste | 1.195 | 3,438 | 3,449 | 3,452 | -76,549 |
| Zona Centro | 124 | 3,436 | 3,440 | 3,446 | -76,529 |
| Zona Oriente | 350 | 3,423 | 3,438 | 3,450 | -76,507 |
| Zona Sur | 4.685 | 3,370 | 3,385 | 3,408 | -76,531 |
Figura 2. Localización de las ofertas de base1 con los dos controles espaciales.
Se identifican 82 ofertas con coordenadas asociadas
a más de una zona y 68 ofertas (9,5 % de
base1) con una latitud propia de la Zona Sur. El
mapa lo muestra con claridad, existe un conglomerado de casas “de la
Zona Norte” en el extremo sur de la ciudad.
| Barrio | Casas de base1 con latitud del sur | Ofertas del barrio registradas en Zona Norte | De ellas, con latitud del norte |
|---|---|---|---|
| Acopi | 42 | 156 | 30 |
| Cali | 10 | 33 | 0 |
| La Flora | 2 | 362 | 324 |
| Urbanizacion La Flora | 2 | 83 | 72 |
| El Gran Limonar | 1 | 1 | 0 |
| Juanambu | 1 | 45 | 11 |
| La Floresta | 1 | 2 | 0 |
| Las Granjas | 1 | 1 | 0 |
Qué explica estas anomalías? Al respecto, se plantean dos hipótesis compatibles con la evidencia:
Implicaciones para el análisis. La zona registrada
es la variable que define la población del modelo (casas del norte), y
para el filtro se conserva tal como viene en la base, porque la
evidencia indica que en la mayoría de los casos es la coordenada la que
está mal, no la zona. Sin embargo, las coordenadas afectan a dos
productos del informe: el mapa de base1 y el mapa de
ofertas recomendadas. Por ello: (i) en la Etapa 4 se reestima el modelo
sin las 68 casas de latitud más meridional para comprobar que los
coeficientes no dependen de ellas, y (ii) en la Etapa 6, la selección de
ofertas exige coordenadas coherentes con la Zona Norte, de modo que el
agente inmobiliario no reciba una dirección que no corresponde al
inmueble anunciado.
Este control no demuestra por sí solo que un punto esté dentro o fuera de la Zona Norte. Para una validación cartográfica definitiva se necesitaría el polígono oficial de la zonificación y una unión espacial. En este análisis se conserva la clasificación de zona declarada en la base.
base1El análisis utiliza las mismas 717 ofertas que se emplearán en la regresión. El precio está expresado en millones de pesos.
Adicionalmente, en el EDA, el estrato se usa como variable ordinal para resumir su asociación con el precio; en la regresión se incorpora como factor para no imponer que los saltos entre estratos consecutivos sean iguales.
| Variable | N | Media | Desviación estándar | Q1 | Mediana | Q3 | Mínimo | Máximo |
|---|---|---|---|---|---|---|---|---|
| Precio (millones) | 717 | 445,7 | 269,1 | 260,0 | 390,0 | 550,0 | 89,0 | 1.940,0 |
| Área construida (m²) | 717 | 264,6 | 167,6 | 140,0 | 240,0 | 337,0 | 30,0 | 1.440,0 |
| Estrato | 717 | 4,2 | 1,0 | 3,0 | 4,0 | 5,0 | 3,0 | 6,0 |
| Parqueaderos | 717 | 2,0 | 1,3 | 1,0 | 2,0 | 2,0 | 1,0 | 10,0 |
| Baños | 717 | 3,6 | 1,5 | 2,0 | 3,0 | 4,0 | 1,0 | 10,0 |
| Habitaciones | 717 | 4,6 | 1,7 | 3,0 | 4,0 | 5,0 | 1,0 | 10,0 |
En términos de precio, las viviendas analizadas presentan un valor promedio de 445,7 millones de pesos, mientras que la mediana se sitúa en 390,0 millones. Esto indica que aproximadamente la mitad de las ofertas registra precios iguales o inferiores a este último valor. El hecho de que el promedio sea superior a la mediana sugiere una distribución asimétrica hacia valores altos, influenciada por algunas propiedades con precios considerablemente elevados, que alcanzan hasta 1.940,0 millones. Asimismo, el 50 % central de las ofertas se concentra entre 260,0 y 550,0 millones, intervalo que permite caracterizar mejor el rango de precios en el que se ubica la parte central del mercado analizado.
En relación con el tamaño de las viviendas, el área construida promedio es de 264,6 m², mientras que la mediana alcanza 240,0 m², lo que significa que aproximadamente la mitad de las propiedades tiene un área igual o inferior a este valor. El 50 % central de las viviendas presenta áreas comprendidas entre 140,0 y 337,0 m². No obstante, el rango total se extiende desde 30,0 hasta 1.440,0 m², evidenciando una marcada heterogeneidad en el tamaño de las propiedades ofrecidas.
Respecto a las características físicas, el 50 % central de las viviendas se ubica entre los estratos 3 y 5, con una mediana de 4. En términos de dotación, una vivienda típica dispone de 2 parqueaderos, 3 baños y 4 habitaciones. Por su parte, los valores promedio se sitúan en 2,0 parqueaderos, 3,6 baños y 4,6 habitaciones, respectivamente.
En conjunto, estos resultados muestran que la oferta de casas de la Zona Norte de Cali presenta una considerable heterogeneidad en precio, tamaño y dotaciones. La diferencia entre las medidas centrales y los valores máximos evidencia la presencia de algunas propiedades de gran superficie y alto valor que se alejan de las características más frecuentes de la muestra.
Figura 3. Matriz interactiva de correlaciones de Pearson.
Figura 4. Correlaciones de Pearson y Spearman entre el precio y cada predictor.
En conjunto, los dos gráficos muestran que todas las características analizadas presentan una relación positiva con el precio de los inmuebles en Cali, es decir, en términos generales, las propiedades tienden a tener precios más altos a medida que aumentan estas características.
La asociación más fuerte corresponde al área construida, con correlaciones aproximadas de \(r=0,732\), lo que indica que el tamaño del inmueble es la variable más estrechamente relacionada con su precio, seguida del estrato (\(r=0,612\)), los baños (\(r=0,577\)), los parqueaderos (\(r=0,503\)) que también muestran relaciones positivas de magnitud moderada a relativamente alta; por su parte, el número de habitaciones (\(r=0,380\)) presenta la asociación más débil con el precio.
Las correlaciones de Spearman son mayores para el área (\(r_s=0,815\)) y el estrato (\(r_s=0,711\)). El hecho de que las correlaciones de Spearman sean sistemáticamente superiores a las de Pearson sugiere que estas relaciones presentan un comportamiento monotónico creciente, pero no necesariamente perfectamente lineales y que pueden existir valores extremos que afecten en mayor medida la correlación de Pearson, algo razonable en un mercado inmobiliario con propiedades de tamaños y precios muy diversos.
La regresión múltiple reparte la variación del precio entre predictores que también se relacionan entre sí. La Tabla 10b anticipa esa redundancia.
| Variable 1 | Variable 2 | r de Pearson |
|---|---|---|
| Baños | Habitaciones | 0,599 |
| Área construida (m²) | Baños | 0,526 |
| Área construida (m²) | Estrato | 0,459 |
| Área construida (m²) | Habitaciones | 0,454 |
| Parqueaderos | Baños | 0,443 |
| Estrato | Baños | 0,423 |
| Área construida (m²) | Parqueaderos | 0,416 |
| Estrato | Parqueaderos | 0,373 |
| Parqueaderos | Habitaciones | 0,258 |
| Estrato | Habitaciones | 0,093 |
La correlación más alta entre predictores es la de Baños y Habitaciones (\(r=0,599\)), y el área se correlaciona de forma moderada con baños, habitaciones y estrato. Como puede apreciarse en los gráficos y la tabla anterior, no se evidencian correlaciones extremadamente altas entre ellas, lo que constituye una señal preliminar favorable para su utilización conjunta en un modelo de regresión; no obstante, esta condición será confirmada posteriormente mediante medidas específicas de multicolinealidad, como el factor de inflación de la varianza (VIF) en la etapa 4.
Figura 5. Precio frente al área construida, diferenciado por estrato.
Al observar el gráfico anterior, es posible apreciar que existe una relación positiva entre el área construida y el precio. En general, a medida que aumenta el tamaño del inmueble, también aumenta su valor de oferta, coherente con la tendencia lineal creciente y con la alta correlación observada previamente. Sin embargo, el gráfico también muestra que el área por sí sola no determina el precio. Para superficies similares existen diferencias importantes de valor y parte de ellas parece estar asociada con el estrato socioeconómico. Los inmuebles de estratos más altos tienden a ubicarse en niveles de precio superiores, aunque existe un considerable solapamiento entre estratos, lo que indica que otras características también intervienen en la valoración.
Otro hallazgo importante es que la mayor parte de la oferta se concentra aproximadamente en inmuebles de menos de 500 m² y precios inferiores a $800 millones, mientras que las propiedades de gran tamaño y alto precio son mucho menos frecuentes. Además, conforme aumenta el área se observa una mayor dispersión de los precios: dos propiedades grandes con superficies semejantes pueden presentar valores muy diferentes, lo que constituye una señal visual de posible heterocedasticidad que deberá revisarse posteriormente al validar los supuestos del modelo de regresión.
Finalmente, se identifican algunas observaciones atípicas, como propiedades de gran superficie con precios relativamente bajos y otras con precios cercanos a los $2.000 millones, que podrían anticipar una influencia importante sobre la recta de regresión.
Figura 6. Distribución del precio según estrato, parqueaderos, baños y habitaciones.
La figura anterior permite comparar simultáneamente el nivel típico del precio (representado por la mediana), su dispersión y la presencia de valores atípicos para distintas características de los inmuebles. El patrón más claro se observa en el estrato. Nótese que al pasar de los estratos 3 a 6, la mediana del precio se desplaza sistemáticamente hacia arriba, lo que confirma una marcada segmentación del mercado; los inmuebles de estratos superiores no solo tienden a ser más costosos, sino que también presentan una mayor variabilidad de precios, particularmente en los estratos 5 y 6. En los parqueaderos también se aprecia una tendencia general ascendente, los inmuebles con uno o dos parqueaderos concentran precios más bajos, mientras que aquellos con tres o más tienden a ubicarse en segmentos de mayor valor; sin embargo, a partir de seis parqueaderos la dispersión aumenta considerablemente y las categorías de 9 y 10 presentan muy pocas observaciones.
Por otro lado, el número de baños muestra una relación particularmente consistente con el precio. A medida que aumenta su cantidad, las cajas y sus medianas se desplazan hacia niveles superiores, sugiriendo que esta variable funciona además como indicador del tamaño, nivel de equipamiento y segmento del inmueble; nuevamente, las categorías con ocho, nueve o diez baños corresponden a propiedades menos frecuentes y de características especiales.
| Estrato | Ofertas | Precio medio | Precio mediano | Q1 del precio | Q3 del precio |
|---|---|---|---|---|---|
| 3 | 234 | 244,0 | 212,5 | 160,5 | 300,0 |
| 4 | 160 | 437,9 | 380,0 | 320,0 | 526,2 |
| 5 | 268 | 550,0 | 480,0 | 390,0 | 650,0 |
| 6 | 55 | 818,3 | 800,0 | 595,0 | 940,0 |
| Grupo | Ofertas | Área media (m²) | Precio medio | Desviación estándar del precio | Rango intercuartil | Coeficiente de variación |
|---|---|---|---|---|---|---|
| Area tercil 1 | 239 | 113,1 | 234,4 | 99,3 | 135,0 | 0,42 |
| Area tercil 2 | 239 | 238,7 | 438,8 | 173,2 | 151,5 | 0,39 |
| Area tercil 3 | 239 | 442,0 | 663,9 | 292,2 | 284,0 | 0,44 |
| Estrato 3 | 234 | 165,4 | 244,0 | 120,7 | 139,5 | 0,49 |
| Estrato 4 | 160 | 261,6 | 437,9 | 219,7 | 206,2 | 0,50 |
| Estrato 5 | 268 | 325,7 | 550,0 | 247,2 | 260,0 | 0,45 |
| Estrato 6 | 55 | 397,6 | 818,3 | 285,3 | 345,0 | 0,35 |
Nótese en la tabla anterior que la desviación estándar del precio pasa de 99,3 millones en el tercil de casas pequeñas a 292,2 millones en el de casas grandes, y crece también con el estrato. La dispersión no es constante: es proporcional al nivel del precio. Esto tiene dos consecuencias que se verifican más adelante: (i) el modelo lineal en millones tendrá residuos heterocedásticos, por lo que los errores estándar clásicos serán poco fiables y los intervalos de predicción, demasiado anchos para las casas baratas y demasiado estrechos para las caras; (ii) una especificación en logaritmo del precio, que modela variaciones porcentuales, es la alternativa natural y se evalúa en la Etapa 4.
El EDA indica que el área y el estrato son los factores con asociaciones más claras con el precio. Baños y parqueaderos también acompañan diferencias de valor, mientras que el patrón de habitaciones debe evaluarse conjuntamente con el área, porque una casa puede tener más cuartos debido a una subdivisión de la misma superficie. El EDA anticipa además tres rasgos del modelado: correlaciones moderadas entre predictores (sin colinealidad severa), varianza del precio que crece con el nivel (heterocedasticidad) y relaciones más monótonas que lineales (Spearman > Pearson), que justifican evaluar una especificación logarítmica.
El modelo completo responde directamente al enunciado:
\[ Precio=f(Área, Estrato, Habitaciones, Parqueaderos, Baños). \]
El estrato se incorpora como factor. Por tanto, sus coeficientes
comparan cada nivel con el estrato de referencia, que es el menor
estrato presente en base1.
modelo_completo <- lm(
preciom ~ areaconst + estrato_f + habitaciones +
parqueaderos + banios,
data = base_modelado
)
| Término | Estimación | Error estándar | Estadístico t | Valor p | IC 95 % inferior | IC 95 % superior | Significativo al 5 % |
|---|---|---|---|---|---|---|---|
| Intercepto | -2,904 | 18,589 | -0,156 | 0,876 | -39,400 | 33,593 | No |
| Área construida (por m²) | 0,739 | 0,045 | 16,480 | < 0,001 | 0,651 | 0,827 | Sí |
| Estrato 4 frente a 3 | 72,480 | 16,993 | 4,265 | < 0,001 | 39,117 | 105,843 | Sí |
| Estrato 5 frente a 3 | 129,190 | 16,111 | 8,019 | < 0,001 | 97,558 | 160,821 | Sí |
| Estrato 6 frente a 3 | 305,902 | 26,536 | 11,528 | < 0,001 | 253,805 | 358,000 | Sí |
| Habitaciones | 5,054 | 4,598 | 1,099 | 0,272 | -3,975 | 14,082 | No |
| Parqueaderos | 27,578 | 5,168 | 5,336 | < 0,001 | 17,432 | 37,725 | Sí |
| Baños | 23,774 | 5,719 | 4,157 | < 0,001 | 12,546 | 35,002 | Sí |
En cuanto a la bondad del ajuste, el modelo completo obtiene un \(R^2\) de 0,680 y un \(R^2\) ajustado de 0,677. Esto significa que, en la muestra analizada, el conjunto de predictores explica aproximadamente el 68,0 % de la variabilidad observada en los precios de los inmubles. El porcentaje restante corresponde a variabilidad no explicada por las variables incluidas en el modelo y puede estar relacionada con otros atributos de las viviendas o del mercado que no fueron considerados.
La prueba global del modelo es estadísticamente significativa, \(F(7, 709) = 215,12\), con valor p < 0,001. Por tanto, se rechaza la hipótesis nula conjunta de que todos los coeficientes sean iguales a cero, lo que permite concluir que al menos uno de los predictores considerados está asociado significativamente con el precio.
Área construida. Manteniendo constantes el estrato, el número de habitaciones, baños y parqueaderos, un incremento de 100 m² en el área construida se asocia, en promedio, con un precio estimado 73,9 millones mayor. El coeficiente es estadísticamente significativo ya que el valor p es < 0,001, por lo que el área aporta información relevante para explicar las diferencias de precio entre los inmuebles.
Baños. Manteniendo constantes las demás características, un baño adicional se asocia con con un incremento promedio de aproximadamente 23,8 millones más en el precio estimado. El valor p es < 0,001; por tanto, el coeficiente es estadísticamente significativo al 5 %.
Parqueaderos. A igualdad de las demás características incluidas en el modelo, un parqueadero adicional se asocia con un precio promedio estimado aproximadamente 27,6 millones más. El valor p es < 0,001.
Habitaciones. Manteniendo constantes el área construida, el estrato, los baños y los parqueaderos, una habitación adicional presenta un coeficiente de 5,1 millones; sin embargo, este efecto no es estadísticamente significativo con un valor p = 0,272. Por tanto, no existe evidencia estadística suficiente para afirmar que el número de habitaciones aporte información adicional sobre el precio una vez se controlan las demás características del inmueble.
Estrato. Frente al estrato de referencia, las diferencias estimadas son:
Estas diferencias comparan segmentos del mercado manteniendo constantes las demás características; no representan el efecto causal de cambiar administrativamente una vivienda de estrato.
Intercepto. Representa matemáticamente el precio esperado de un inmueble perteneciente al estrato de referencia con área construida, habitaciones, baños y parqueaderos iguales a cero. Dado que esta combinación carece de sentido práctico dentro del mercado inmobiliario analizado, el intercepto no tiene una interpretación económica relevante, aunque es necesario para definir matemáticamente el plano de regresión.
El EDA anticipó que la varianza del precio crece con su nivel. Cuando eso ocurre, las estimaciones de MCO siguen siendo insesgadas, pero los errores estándar clásicos están mal calculados y los valores p pueden ser demasiado optimistas. La Tabla 12b recalcula los errores estándar del modelo completo con la corrección HC3 de MacKinnon y White (1985), que no exige conocer la forma de la heterocedasticidad.
| Variable | Estimación | EE clásico | EE robusto HC3 | Razón HC3 / clásico | Valor p clásico | Valor p HC3 | Significativo al 5 % con HC3 |
|---|---|---|---|---|---|---|---|
| Intercepto | -2,904 | 18,589 | 24,820 | 1,34 | 0,876 | 0,907 | No |
| Área construida | 0,739 | 0,045 | 0,121 | 2,70 | < 0,001 | < 0,001 | Sí |
| Estrato 4 frente a 3 | 72,480 | 16,993 | 17,648 | 1,04 | < 0,001 | < 0,001 | Sí |
| Estrato 5 frente a 3 | 129,190 | 16,111 | 19,021 | 1,18 | < 0,001 | < 0,001 | Sí |
| Estrato 6 frente a 3 | 305,902 | 26,536 | 39,292 | 1,48 | < 0,001 | < 0,001 | Sí |
| Habitaciones | 5,054 | 4,598 | 6,336 | 1,38 | 0,272 | 0,425 | No |
| Parqueaderos | 27,578 | 5,168 | 7,055 | 1,37 | < 0,001 | < 0,001 | Sí |
| Baños | 23,774 | 5,719 | 9,256 | 1,62 | < 0,001 | 0,010 | Sí |
Los errores estándar robustos son mayores que los clásicos para el área (razón de 2,70), los parqueaderos y los baños, por lo que la precisión aparente del modelo clásico estaba sobrestimada. Aun así, las conclusiones sobre qué variables son significativas al 5 % no cambian. El área, estrato, parqueaderos y baños siguen siéndolo. En las secciones siguientes de este documento, cuando se habla de significancia, se ha comprobado que se mantiene con HC3.
El procedimiento stepwise parte del modelo completo y evalúa eliminaciones y reincorporaciones de términos. La selección se basa en el AIC, por lo que un valor menor representa un mejor compromiso entre ajuste y complejidad.
| Paso | Df | Deviance | Resid. Df | Resid. Dev | AIC |
|---|---|---|---|---|---|
| Modelo completo | — | — | 709 | 16602766 | 7221.853 |
| Eliminar: habitaciones | 1 | 28281.43 | 710 | 16631047 | 7221.073 |
La fórmula seleccionada con toda la muestra es:
## preciom ~ areaconst + estrato_f + parqueaderos + banios
| Modelo | Fórmula | Parámetros | R² | R² ajustado | AIC | ΔAIC | BIC | RMSE entrenamiento | MAE entrenamiento |
|---|---|---|---|---|---|---|---|---|---|
| Completo | preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 8 | 0,6799 | 0,6767 | 9.258,6 | 0,78 | 9.299,8 | 152,2 | 95,2 |
| Stepwise AIC | preciom ~ areaconst + estrato_f + parqueaderos + banios | 7 | 0,6793 | 0,6766 | 9.257,8 | 0,00 | 9.294,4 | 152,3 | 95,2 |
Nota sobre el AIC: la trayectoria de step()
utiliza la escala interna de extractAIC(), mientras que la
Tabla 13 presenta el AIC basado en la log-verosimilitud mediante
AIC(). Los valores absolutos difieren por una constante,
pero la diferencia entre modelos y su ordenación son equivalentes. El
\(\Delta AIC\) facilita la comparación,
por tanto el mejor modelo toma el valor cero.
Para comparar la capacidad predictiva se utilizaron diez pliegues estratificados por estrato. Los dos modelos se evaluaron sobre las mismas particiones. En cada pliegue, el modelo stepwise volvió a ejecutar la selección utilizando únicamente los datos de entrenamiento. La partición se realiza sobre la base ya completada mediante MICE, por lo que la validación compara las fórmulas de los modelos manteniendo fija la etapa previa de preparación de datos.
Las métricas empleadas son:
| Modelo | RMSE | MAE | R² predictivo |
|---|---|---|---|
| Completo | 156,49 | 96,75 | 0,6614 |
| Stepwise AIC | 156,47 | 96,81 | 0,6615 |
El RMSE del modelo completo es de 156,49 millones y el del stepwise es de 156,47 millones. La diferencia absoluta es de apenas 0,03 millones.
Los desempeños se consideran prácticamente equivalentes; por ello se prefiere el modelo más parsimonioso (modelo más simple). Se definió equivalencia práctica cuando la diferencia de RMSE no supera el 1 % del menor RMSE.
La selección stepwise no necesariamente produce la misma fórmula en todos los pliegues. La tabla siguiente permite comprobar su estabilidad.
| Fórmula | Número de pliegues |
|---|---|
| preciom ~ areaconst + estrato_f + parqueaderos + banios | 9 |
| preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 1 |
El modelo candidato se selecciona considerando conjuntamente el desempeño en validación cruzada y la parsimonia. Su resultado es:
| Modelo | Fórmula | N | Parámetros | R² | R² ajustado | AIC | BIC | RMSE CV | MAE CV | R² predictivo CV |
|---|---|---|---|---|---|---|---|---|---|---|
| Stepwise AIC | preciom ~ areaconst + estrato_f + parqueaderos + banios | 717 | 7 | 0,6793 | 0,6766 | 9.257,8 | 9.294,4 | 156,47 | 96,81 | 0,6615 |
El modelo completo se conserva para interpretar todas las variables
solicitadas en el enunciado. El modelo completo y el stepwise presentan
un desempeño predictivo prácticamente equivalente. Se selecciona
Stepwise AIC como candidato por parsimonia, con la
fórmula preciom ~ areaconst + estrato_f + parqueaderos +
banios. La variable habitaciones se excluye porque no es
significativa en el modelo completo y su retirada no deteriora de forma
apreciable el desempeño fuera de muestra. La fórmula reducida fue
seleccionada en 9 de 10 pliegues.
Como este es el modelo con el que se calculan las predicciones de la Etapa 5, se reportan sus coeficientes para que el cálculo sea reproducible a mano:
| Término | Estimación | Error estándar | Valor p | IC 95 % inferior | IC 95 % superior |
|---|---|---|---|---|---|
| Intercepto | 8,051 | 15,693 | 0,608 | -22,759 | 38,861 |
| Área construida | 0,753 | 0,043 | < 0,001 | 0,669 | 0,837 |
| Estrato 4 frente a 3 | 68,949 | 16,689 | < 0,001 | 36,183 | 101,715 |
| Estrato 5 frente a 3 | 124,424 | 15,519 | < 0,001 | 93,955 | 154,893 |
| Estrato 6 frente a 3 | 298,299 | 25,622 | < 0,001 | 247,996 | 348,603 |
| Parqueaderos | 27,521 | 5,169 | < 0,001 | 17,374 | 37,669 |
| Baños | 27,073 | 4,868 | < 0,001 | 17,514 | 36,631 |
| Variable | Estimación | EE clásico | EE robusto HC3 | Razón HC3 / clásico | Valor p clásico | Valor p HC3 | Significativo al 5 % con HC3 |
|---|---|---|---|---|---|---|---|
| Intercepto | 8,051 | 15,693 | 18,495 | 1,18 | 0,608 | 0,663 | No |
| Área construida | 0,753 | 0,043 | 0,123 | 2,88 | < 0,001 | < 0,001 | Sí |
| Estrato 4 frente a 3 | 68,949 | 16,689 | 16,473 | 0,99 | < 0,001 | < 0,001 | Sí |
| Estrato 5 frente a 3 | 124,424 | 15,519 | 18,958 | 1,22 | < 0,001 | < 0,001 | Sí |
| Estrato 6 frente a 3 | 298,299 | 25,622 | 39,422 | 1,54 | < 0,001 | < 0,001 | Sí |
| Parqueaderos | 27,521 | 5,169 | 7,038 | 1,36 | < 0,001 | < 0,001 | Sí |
| Baños | 27,073 | 4,868 | 8,149 | 1,67 | < 0,001 | < 0,001 | Sí |
El modelo completo explica aproximadamente el 68,0 % de la variación observada. En validación cruzada alcanza un RMSE de 156,49 millones, un MAE de 96,75 millones y un \(R^2\) predictivo de 0,6614. El modelo stepwise conserva prácticamente el mismo desempeño con una variable menos. Aun así, el margen de error es relevante para valorar una vivienda individual.
El ajuste podría mejorarse evaluando transformaciones logarítmicas del precio y del área, relaciones no lineales, una interacción entre área y estrato y variables inmobiliarias no disponibles, como antigüedad, estado de conservación, remodelaciones y calidad de acabados. Cualquier especificación alternativa debe compararse con la misma validación cruzada antes de adoptarse. La primera de esas alternativas, el logaritmo del precio, se estima y se compara en la Etapa 4, una vez conocido el diagnóstico de supuestos que la motiva.
El modelo se estimó sobre la primera completación de MICE, y el
modelo de imputación de parqueaderos usó el precio como
predictor. Ambas decisiones son correctas en la teoría de la imputación
múltiple (Rubin, 1987; Van Buuren, 2018), pero conviene comprobar que no
condicionan los resultados. La Tabla 17b compara tres estimaciones del
modelo completo: la base imputada (principal), solo las casas con
parqueaderos, baños y habitaciones observados en la base original (430
casos) y la imputación múltiple agrupada con las reglas de Rubin sobre
las cinco completaciones.
| Variable | Base imputada (principal) | Casos completos observados | Imputación múltiple agrupada (5 completaciones) |
|---|---|---|---|
| Intercepto | -2,904 (18,589) | 8,427 (27,862) | -0,990 (18,621) |
| Área construida | 0,739 (0,045) | 0,665 (0,054) | 0,742 (0,046) |
| Estrato 4 frente a 3 | 72,5 (17,0) | 76,9 (24,7) | 71,3 (17,7) |
| Estrato 5 frente a 3 | 129,2 (16,1) | 146,3 (22,9) | 126,2 (16,6) |
| Estrato 6 frente a 3 | 305,9 (26,5) | 268,1 (38,4) | 303,3 (27,8) |
| Habitaciones | 5,054 (4,598) | 6,487 (5,971) | 4,327 (4,918) |
| Parqueaderos | 27,6 (5,2) | 24,8 (5,9) | 31,1 (7,3) |
| Baños | 23,8 (5,7) | 21,3 (8,0) | 22,4 (6,2) |
El coeficiente de parqueaderos, la variable con más valores imputados, es 27,6 en la base imputada, 24,8 en casos completos y 31,1 en la imputación agrupada; las tres estimaciones quedan dentro de un error estándar entre sí. Los demás coeficientes conservan signo, orden de magnitud y significancia. La imputación agrupada produce errores estándar ligeramente mayores porque incorpora la incertidumbre entre completaciones; esa es la magnitud de precisión que la base operativa única deja de reflejar y es pequeña. Se concluye que los resultados no dependen de la imputación. El R² del ajuste con casos completos (0,605) es menor que el de la base imputada, pero la diferencia se debe a la composición de la submuestra (las casas sin dato de parqueaderos son, en promedio, mejor explicadas por el resto de variables) y no a la imputación.
El modelo candidato se somete a continuación a la validación de linealidad, homocedasticidad, normalidad, multicolinealidad, independencia e influencia. Los resultados de esa revisión determinan las precauciones que deben acompañar las predicciones.
La validación se realiza sobre el modelo seleccionado en la etapa
anterior: Stepwise AIC, estimado con 717
observaciones y la fórmula preciom ~ areaconst +
estrato_f + parqueaderos + banios.
El objetivo de esta etapa es identificar posibles incumplimientos de los supuestos de MCO y formular recomendaciones. De acuerdo con el enunciado, no se eliminan observaciones ni se sustituye automáticamente el modelo.
| Supuesto | Procedimiento | Valor diagnóstico | Valor p | Resultado | Recomendación |
|---|---|---|---|---|---|
| Linealidad y forma funcional | Prueba RESET de Ramsey | 10,937 | < 0,001 | Alerta: posible no linealidad o especificación incompleta | Evaluar logaritmos, términos no lineales e interacciones. |
| Homoscedasticidad | Prueba de Breusch-Pagan | 121,694 | < 0,001 | Alerta: la varianza de los errores no es constante | Evaluar una transformación logarítmica del precio y revisar la especificación. |
| Normalidad aproximada de los residuos | Prueba de Shapiro-Wilk y gráfico Q-Q | 0,832 | < 0,001 | Alerta: los residuos se apartan de la normalidad | Apoyarse en el gráfico Q-Q, revisar los casos extremos y considerar transformaciones. |
| Multicolinealidad | VIF/GVIF ajustado | 1,265 | — | Sin multicolinealidad preocupante | Mantener los predictores si los índices permanecen bajo el umbral. |
| Independencia de los errores | Evaluación del diseño transversal | — | — | No existe un orden temporal; 156 ofertas comparten coordenada con al menos otra oferta | No aplicar Durbin-Watson a un orden arbitrario; considerar agrupación por barrio o dependencia espacial. |
| Observaciones influyentes | Residuos studentizados, apalancamiento y Cook | 43,000 | — | Se identifican 43 observaciones por encima del criterio 4/n | Revisar los casos, validar su calidad y realizar sensibilidad sin eliminarlos automáticamente. |
La relación lineal se revisa mediante el gráfico de residuos frente a valores ajustados y la prueba RESET de Ramsey. En un modelo adecuadamente especificado, los residuos deberían distribuirse sin una curvatura sistemática alrededor de cero.
Figura 7. Residuos frente a valores ajustados del modelo candidato.
La prueba RESET obtiene un estadístico de 10,937 y un valor p < 0,001.
La prueba RESET permite rechazar al 5 % la hipótesis de que la forma funcional esté correctamente especificada. El resultado puede reflejar una relación no lineal y/o la omisión de variables relevantes; la prueba no permite identificar por sí sola cuál de estas causas origina la alerta. Se recomienda evaluar el logaritmo del precio y del área, un término cuadrático del área o una interacción entre área y estrato.
La homocedasticidad exige que la dispersión de los errores sea aproximadamente constante para los distintos niveles del precio ajustado. Se revisa mediante el gráfico de escala-localización y la prueba de Breusch–Pagan.
Figura 8. Gráfico de escala-localización del modelo candidato.
La prueba de Breusch–Pagan produce un estadístico de 121,694 y un valor p < 0,001.
Se rechaza la hipótesis de varianza constante al 5 %. La variabilidad de los residuos no permanece constante para todos los niveles del precio estimado. Este resultado no modifica los coeficientes calculados por MCO, pero exige interpretar con cautela su precisión. De acuerdo con el enunciado, el problema no se corrige en esta etapa; se sugiere evaluar posteriormente una transformación logarítmica del precio y revisar la forma funcional del modelo.
Dos precisiones sobre las consecuencias. Primero, la corrección HC3 de la Etapa 3 (Tabla 16c) ya muestra el efecto práctico: el error estándar del área es 2,88 veces mayor que el clásico. Ninguna variable significativa deja de serlo con HC3, así que la interpretación de la Etapa 3 se sostiene en lo esencial con la inferencia robusta. Segundo, la heterocedasticidad afecta más a los intervalos de predicción que a los coeficientes: como el error estándar residual es único, el intervalo tiene la misma anchura para una casa de 150 millones que para una de 1.500, cuando la Tabla 10c mostró que la dispersión real es tres veces mayor en el tercil alto. La sección “Especificación logarítmica” de esta etapa cuantifica esa distorsión.
La normalidad se evalúa con el gráfico Q–Q de los residuos studentizados y la prueba de Shapiro–Wilk. La prueba se utiliza como apoyo y no reemplaza la lectura del gráfico, porque con muestras grandes puede detectar desviaciones pequeñas.
Figura 9. Gráfico Q-Q de los residuos studentizados.
La prueba de Shapiro–Wilk obtiene \(W=0,8319\) y un valor p < 0,001.
Se rechaza la normalidad de los residuos al 5 %. Aunque Shapiro-Wilk es sensible en muestras grandes, el gráfico Q-Q confirma desviaciones relevantes en las colas, asociadas principalmente con viviendas de precio o superficie extremos. La falta de normalidad no invalida por sí sola los coeficientes estimados por MCO, pero aconseja interpretar con cautela la inferencia y los intervalos de predicción. Como alternativas se sugiere revisar los registros extremos y evaluar una transformación logarítmica del precio.
La multicolinealidad se estudia con el VIF. Debido a que el estrato es un factor con varios grados de libertad, para ese término se utiliza el GVIF ajustado \(GVIF^{1/(2\,gl)}\). El umbral equivalente a un VIF de 5 es \(\sqrt{5}\) para los términos con más de un grado de libertad.
| Variable | GVIF | Grados de libertad | Índice comparable | Umbral de referencia | Alerta |
|---|---|---|---|---|---|
| Área construida | 1,582 | 1 | 1,258 | 2,236 | No |
| Estrato (factor) | 1,429 | 3 | 1,061 | 2,236 | No |
| Parqueaderos | 1,363 | 1 | 1,168 | 2,236 | No |
| Baños | 1,599 | 1 | 1,265 | 2,236 | No |
El mayor índice comparable corresponde a Baños, con un valor de 1,265.
Todos los índices permanecen por debajo de su umbral de referencia. No se identifica multicolinealidad preocupante y los coeficientes pueden interpretarse sin una señal de inestabilidad grave por redundancia entre predictores.
La base es de corte transversal: cada fila representa una oferta y no existe un orden temporal natural. Por esta razón, no se aplica Durbin–Watson sobre el orden arbitrario del archivo, ya que su interpretación sería engañosa. La eliminación previa de duplicados ayuda a evitar repeticiones exactas, pero no garantiza independencia espacial.
En base1, 47 grupos de coordenadas
contienen más de una oferta y reúnen 156 registros.
Esto no demuestra dependencia de los errores, pero advierte que algunas
viviendas pueden compartir barrio, edificio, proyecto o punto de
geocodificación. Para un análisis posterior más exigente podría
evaluarse autocorrelación espacial o utilizar errores agrupados por
barrio. Con la información actual, la independencia se mantiene como una
suposición del diseño y una limitación del modelo.
Las observaciones se examinan con tres criterios de detección:
Estos umbrales sirven para seleccionar casos que requieren revisión; no son una regla automática de eliminación.
| Indicador | Umbral | Número de observaciones | Porcentaje |
|---|---|---|---|
| Residuos studentizados con valor absoluto mayor que 3 | 3,0000 | 17 | 2,4 % |
| Observaciones con apalancamiento superior a 2p/n | 0,0195 | 77 | 10,7 % |
| Observaciones con distancia de Cook superior a 4/n | 0,0056 | 43 | 6,0 % |
| Observaciones marcadas por al menos un criterio | — | 93 | 13,0 % |
Figura 10. Distancia de Cook de las observaciones del modelo.
Figura 11. Apalancamiento frente a residuos studentizados; el tamaño representa la distancia de Cook.
Se identifican 17 residuos studentizados extremos, 77 casos de alto apalancamiento y 43 casos por encima del umbral de Cook. En total, 93 ofertas cumplen al menos uno de los criterios.
| ID | Barrio | Estrato | Precio observado | Área (m²) | Precio ajustado | Residuo studentizado | Apalancamiento | Cook | Residuo extremo | Alto apalancamiento | Cook elevado |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 534 | Villa Del Prado | 3 | 370,0 | 1.440,0 | 1.228,1 | -6,150 | 0,1257 | 0,7382 | Sí | Sí | Sí |
| 4542 | Vipasa | 5 | 1.400,0 | 265,0 | 657,8 | 5,044 | 0,0439 | 0,1613 | Sí | Sí | Sí |
| 4349 | El Bosque | 5 | 650,0 | 1.188,0 | 1.299,5 | -4,415 | 0,0519 | 0,1487 | Sí | Sí | Sí |
| 4564 | San Vicente | 5 | 1.940,0 | 734,0 | 984,3 | 6,492 | 0,0211 | 0,1229 | Sí | Sí | Sí |
| 4793 | Granada | 4 | 1.800,0 | 607,0 | 752,4 | 7,143 | 0,0170 | 0,1180 | Sí | No | Sí |
| 3858 | San Vicente | 4 | 1.650,0 | 734,0 | 847,6 | 5,402 | 0,0207 | 0,0848 | Sí | Sí | Sí |
| 4056 | Versalles | 5 | 1.600,0 | 942,0 | 1.060,2 | 3,618 | 0,0331 | 0,0630 | Sí | Sí | Sí |
| 6068 | Cali | 6 | 1.600,0 | 730,0 | 1.100,6 | 3,338 | 0,0308 | 0,0499 | Sí | Sí | Sí |
| 5263 | Santa Monica | 6 | 1.500,0 | 470,0 | 905,2 | 3,965 | 0,0196 | 0,0439 | Sí | Sí | Sí |
| 1065 | Manzanares | 3 | 350,0 | 350,0 | 601,0 | -1,722 | 0,0904 | 0,0420 | No | Sí | Sí |
Las observaciones señaladas deben contrastarse con la fuente original para verificar que el precio, el área y las dotaciones sean correctos. Si son ofertas reales, deben conservarse. Como análisis de sensibilidad podría reestimarse el modelo sin los casos más influyentes y comparar los signos y magnitudes de los coeficientes, sin presentar esa eliminación como la especificación principal.
El registro con mayor distancia de Cook es el ID 534, con un valor de 0,7382. Debe contrastarse prioritariamente con la fuente original. Su identificación como influyente no constituye, por sí sola, una justificación para eliminarlo.
El EDA (Tabla 10c) y las pruebas anteriores apuntan en la misma dirección: la dispersión del precio crece con su nivel y los residuos tienen colas pesadas. Modelar \(\log(\text{precio})\) convierte efectos aditivos en porcentuales y suele estabilizar la varianza. Se estimó el modelo candidato con la misma fórmula y el precio en logaritmo, y se comparó con el lineal usando los mismos diez pliegues; las predicciones del modelo logarítmico se retransformaron a millones con el factor de Duan (1983), \(\hat{s}=\overline{\exp(\hat{e}_i)}\) = 1,040, que corrige el sesgo de \(\exp(\hat{y})\) como estimador de la media.
| Especificación | R² ajustado (escala propia) | RMSE CV (millones) | MAE CV (millones) | R² predictivo CV | p RESET | p Breusch-Pagan | W Shapiro-Wilk |
|---|---|---|---|---|---|---|---|
| Lineal (precio en millones) | 0,677 | 156,5 | 96,8 | 0,662 | < 0,001 | < 0,001 | 0,832 |
| Logarítmica (log del precio) | 0,761 | 176,4 | 104,5 | 0,570 | < 0,001 | < 0,001 | 0,987 |
El resultado es matizado y por eso se reporta completo:
En consecuencia, y de acuerdo con el enunciado, se conserva el modelo lineal como especificación principal, y la versión logarítmica se utiliza como análisis complementario para los intervalos y como evidencia de que el problema de forma funcional no se resuelve solo con una transformación.
Para medir cuánto dependen los coeficientes de los registros problemáticos detectados en la Etapa 1 (casas con latitud del sur) y en esta etapa (casos con distancia de Cook superior a \(4/n\)), se reestimó el modelo candidato sin cada grupo. En efecto, no se trata de sustituir el modelo principal, sino de acotar la incertidumbre debida a esos registros.
| Variable | Principal (base1 completa) | Sin casas con latitud del sur | Sin Cook > 4/n |
|---|---|---|---|
| Intercepto | 8,051 (15,693) | 9,113 (16,023) | 25,0 (10,3) |
| Área construida | 0,753 (0,043) | 0,763 (0,045) | 0,767 (0,034) |
| Estrato 4 frente a 3 | 68,9 (16,7) | 68,2 (17,2) | 57,8 (10,7) |
| Estrato 5 frente a 3 | 124,4 (15,5) | 117,6 (15,7) | 108,5 (10,0) |
| Estrato 6 frente a 3 | 298,3 (25,6) | 260,4 (28,9) | 276,7 (18,6) |
| Parqueaderos | 27,5 (5,2) | 25,9 (5,4) | 23,2 (3,6) |
| Baños | 27,1 (4,9) | 27,1 (5,1) | 23,2 (3,4) |
| Ajuste | N | R² | Error estándar residual (millones) |
|---|---|---|---|
| Principal (base1 completa) | 717 | 0,679 | 153,0 |
| Sin casas con latitud propia del sur | 649 | 0,663 | 150,4 |
| Sin observaciones con Cook > 4/n | 674 | 0,794 | 95,4 |
Excluir las 68 casas con latitud sur apenas mueve los coeficientes: el del área pasa de 0,753 a 0,763 millones por m² y el del estrato 6 de 298,3 a 260,4, cambios menores que un error estándar. Esto respalda la decisión de conservar la zona declarada, es decir, las anomalías de coordenadas no distorsionan el modelo. Excluir los casos influyentes tiene un efecto mayor sobre el ajuste (el error estándar residual baja de 153,0 a 95,4 millones) pero no altera los signos ni el orden de los coeficientes; confirma que la incertidumbre del modelo está concentrada en un puñado de anuncios de precio o área extremos, que deben verificarse en la fuente y no eliminarse.
El modelo candidato no presenta problemas preocupantes de multicolinealidad. La prueba RESET evidencia una posible deficiencia de forma funcional, la prueba de Breusch–Pagan permite rechazar la homocedasticidad y la prueba de Shapiro–Wilk, junto con el gráfico Q–Q, muestra que los residuos se apartan de la normalidad. También se identificaron observaciones atípicas e influyentes que deben contrastarse con la fuente original, sin eliminarlas automáticamente.
La independencia de los errores no pudo verificarse formalmente
debido al carácter transversal de la base y se mantiene como una
suposición del diseño, reconociendo la posible agrupación espacial de
algunas ofertas. De acuerdo con el enunciado, estos hallazgos no obligan
a corregir ni descartar el modelo en esta etapa. Por tanto, se conserva
el modelo Stepwise AIC, con la fórmula preciom ~
areaconst + estrato_f + parqueaderos + banios, para realizar las
predicciones, advirtiendo que sus resultados deben interpretarse con
cautela. Como mejoras futuras se recomienda evaluar transformaciones
logarítmicas, términos no lineales entre otros, revisar los casos
influyentes e incorporar variables inmobiliarias adicionales, como
antigüedad del inmueble, estado de conservación y calidad de los
acabados.
La primera solicitud corresponde a una casa ubicada en la Zona Norte, con 200 m² de área construida, un parqueadero, dos baños, cuatro habitaciones y estrato 4 o 5. La empresa dispone de un crédito preaprobado máximo de 350 millones de pesos.
| Característica | Vivienda 1 |
|---|---|
| Tipo | Casa |
| Área construida | 200 m² |
| Parqueaderos | 1 |
| Baños | 2 |
| Habitaciones | 4 |
| Estrato | 4 o 5 |
| Zona | Zona Norte |
| Crédito preaprobado | $350 millones |
La predicción se realiza con el modelo conservado después de la
selección y de la validación de supuestos: Stepwise
AIC, cuya fórmula es preciom ~ areaconst + estrato_f +
parqueaderos + banios.
El requisito indica estrato 4 o 5. Como el estrato se incorporó como factor, no sería correcto reemplazarlo por 4,5 ni promediar ambas categorías. Por esta razón se calculan dos escenarios independientes, manteniendo iguales el área, los parqueaderos y los baños:
\[ \widehat{P}_{E4}=\widehat{\beta}_0+200\widehat{\beta}_{A} +\widehat{\beta}_{E4}+1\widehat{\beta}_{G}+2\widehat{\beta}_{B}, \]
\[ \widehat{P}_{E5}=\widehat{\beta}_0+200\widehat{\beta}_{A} +\widehat{\beta}_{E5}+1\widehat{\beta}_{G}+2\widehat{\beta}_{B}. \]
En estas expresiones, \(A\) representa el área construida, \(G\) los parqueaderos y \(B\) los baños.
La solicitud registra cuatro habitaciones, pero esta
característica no modifica la predicción del modelo candidato porque
habitaciones fue excluida por el procedimiento stepwise. En
el modelo completo su aporte no fue estadísticamente significativo y
retirarla no deterioró de manera apreciable el desempeño predictivo.
El crédito preaprobado tampoco interviene en el cálculo del precio; se utiliza después para comparar la predicción con el límite financiero de la empresa.
escenarios_vivienda_1 <- tibble::tibble(
areaconst = 200,
habitaciones = 4,
parqueaderos = 1,
banios = 2,
estrato_f = factor(
c(4, 5),
levels = levels(base_modelado$estrato_f)
)
)
predict(
modelo_diagnostico,
newdata = escenarios_vivienda_1,
interval = "confidence",
level = 0.95
)
predict(
modelo_diagnostico,
newdata = escenarios_vivienda_1,
interval = "prediction",
level = 0.95
)
Se presenta la predicción puntual, el intervalo de confianza del 95 % para el precio medio esperado de viviendas con esas características y el intervalo de predicción del 95 % para una vivienda individual. El segundo intervalo es más amplio porque incorpora tanto la incertidumbre de la media como la variabilidad entre ofertas individuales.
| Escenario | Precio de oferta estimado | IC 95 % del precio medio | IP 95 % para una vivienda | Crédito máximo | Margen: crédito - estimación | Evaluación puntual |
|---|---|---|---|---|---|---|
| Estrato 4 | 309,3 millones | [279,9; 338,6] | [7,3; 611,2] | 350,0 millones | +40,7 | Dentro del crédito |
| Estrato 5 | 364,7 millones | [338,7; 390,8] | [63,1; 666,3] | 350,0 millones | -14,7 | Supera el crédito |
Para una vivienda de estrato 4, el modelo estima un precio de oferta de 309,3 millones de pesos. Esta estimación se ubica 40,7 millones por debajo del crédito máximo. El intervalo de confianza del 95 % para el precio medio de viviendas semejantes es [279,9; 338,6] millones.
Para una vivienda de estrato 5, el precio de oferta estimado es de 364,7 millones de pesos, valor que queda 14,7 millones por encima del crédito máximo. Su intervalo de confianza del 95 % para el precio medio es [338,7; 390,8] millones.
Al comparar una vivienda de estrato 5 con una de estrato 4, manteniendo constantes el área, el número de parqueaderos y los baños, el precio de oferta estimado del escenario de estrato 5 es 55,5 millones de pesos mayor. Esta diferencia corresponde a la resta entre los coeficientes estimados de los estratos 5 y 4 y representa una diferencia entre segmentos del mercado, no el efecto causal de cambiar administrativamente una vivienda de estrato.
Los intervalos de predicción para una vivienda individual son considerablemente más amplios que los intervalos del precio medio. Vale la pena mencionar que esto no constituye un error de cálculo, ya que refleja la dispersión residual del mercado y el margen de error ya observado en la validación cruzada. Además, el punto 4 identificó alertas de forma funcional, heterocedasticidad y normalidad de los residuos.
Con base en la predicción puntual, una casa de estrato 4 con las características solicitadas tendría un precio de oferta estimado de 309,3 millones de pesos, aproximadamente 40,7 millones por debajo del crédito. Además, el límite superior del intervalo del precio medio permanece por debajo de 350 millones, por lo que este escenario presenta la mayor compatibilidad financiera.
Para estrato 5, la predicción puntual supera el crédito en 14,7 millones. Sin embargo, 350 millones se encuentra dentro del intervalo de confianza del precio medio; por ello, en el punto 6 se consideran ambos estratos y se mantiene el estrato 4 como referencia financiera cuando las demás características sean comparables. No se descartan las ofertas reales de estrato 5 cuyo precio anunciado sea igual o inferior al presupuesto.
Una predicción es fiable en la medida en que la combinación de
características solicitada esté bien representada en la base. La Tabla
22b sitúa la solicitud dentro de base1 y la Tabla 22c
calcula el apalancamiento \(h_0 =
\mathbf{x}_0'(\mathbf{X}'\mathbf{X})^{-1}\mathbf{x}_0\)
de cada escenario, que mide la distancia de la solicitud al centro de la
nube de predictores; se compara con el umbral \(2p/n\) usado para la muestra.
| Indicador | Valor |
|---|---|
| Percentil del área solicitada en la base | 41,3 % |
| Área máxima observada (m²) | 1.440 |
| Ofertas con área en ±10 % de la solicitada | 65 |
| Ofertas con área en ±10 % y estrato solicitado | 48 |
| Ofertas con al menos los parqueaderos solicitados | 717 |
| Ofertas con área ≥ 90 % de la solicitada y parqueaderos solicitados | 462 |
| Ofertas con área, parqueaderos, baños y habitaciones iguales o superiores | 399 |
| Escenario | h de la solicitud | h medio de la muestra (p/n) | Umbral 2p/n | h máximo observado | Razón h / (2p/n) | Dentro del rango habitual |
|---|---|---|---|---|---|---|
| Estrato 4 | 0,0096 | 0,0098 | 0,0195 | 0,1257 | 0,49 | Sí |
| Estrato 5 | 0,0075 | 0,0098 | 0,0195 | 0,1257 | 0,38 | Sí |
La solicitud está en el interior de la muestra: 200 m² corresponde al percentil 41,3 del área, existen 48 casas de estrato 4 o 5 con área entre 180 y 220 m², y el apalancamiento de ambos escenarios es inferior al umbral \(2p/n\) e incluso al apalancamiento medio. No hay extrapolación: la predicción de la vivienda 1 es una interpolación bien respaldada.
El intervalo de predicción lineal para estrato 4, [7,3; 611,2] millones, tiene un límite inferior sin sentido económico: ninguna casa de 200 m² de estrato 4 se anuncia por unos pocos millones. Ese límite no es un error de cálculo sino una consecuencia directa de la heterocedasticidad detectada en la Etapa 4: el intervalo usa el error estándar residual global (153,0 millones), inflado por las casas caras, y lo aplica simétricamente a una casa de precio medio. La Tabla 22d contrasta ese intervalo con el que produce la especificación logarítmica, cuyo error es proporcional al nivel del precio.
| Escenario | Lineal: estimación | Lineal: IP 95 % | Log: mediana | Log: media (Duan) | Log: IP 95 % | Amplitud IP lineal | Amplitud IP log | P(precio ≤ crédito) según log |
|---|---|---|---|---|---|---|---|---|
| Estrato 4 | 309,3 | [7,3; 611,2] | 301,0 | 313,0 | [173,9; 521,1] | 603,8 | 347,2 | 70,6 % |
| Estrato 5 | 364,7 | [63,1; 666,3] | 346,2 | 359,9 | [200,1; 598,9] | 603,2 | 398,8 | 51,6 % |
Las estimaciones puntuales de ambos modelos son muy parecidas (la media retransformada del modelo log es 313,0 millones en estrato 4 frente a 309,3 del lineal), lo que da robustez a la cifra central. La diferencia está en el rango: el intervalo logarítmico para estrato 4, [173,9; 521,1] millones, es 43 % más estrecho y describe mejor los precios que María encontrará en el mercado. Bajo esa especificación, la probabilidad de que una casa con las características solicitadas se anuncie por no más de 350 millones es de aproximadamente 71 % en estrato 4 y 52 % en estrato 5. Traducido a la decisión: en estrato 4 el presupuesto cubre holgadamente la mayoría de las ofertas comparables; en estrato 5 cubre menos de la mitad, por lo que la búsqueda debe apoyarse en anuncios concretos por debajo del límite y no en el precio típico del segmento.
La recomendación parte de las ofertas reales de base1.
Se aplicaron como restricciones obligatorias el crédito máximo de
350 millones, los estratos 4 o 5, al
menos un parqueadero, al menos dos
baños y exactamente cuatro habitaciones. Para
conservar viviendas comparables con la solicitud, el área se limitó al
intervalo de 180 a 220 m², equivalente a una tolerancia
de ±10 % alrededor de 200 m².
Las dotaciones superiores al mínimo no se consideran incumplimientos, o dicho de otro modo, una oferta con dos parqueaderos o más de dos baños continúa siendo compatible. Dentro del conjunto resultante se priorizaron los valores observados (no imputados) en parqueaderos, baños y habitaciones, así como las coordenadas que en la base completa aparecen asociadas solamente con Zona Norte. Finalmente, se favoreció la cercanía a 200 m² y se procuró representar barrios distintos.
| Etapa | Número de ofertas |
|---|---|
| Ofertas disponibles en base1 | 717 |
| Dentro del crédito y en estrato 4 o 5 | 112 |
| Ajuste alto a las características solicitadas | 9 |
| Con dotaciones observadas y coordenada consistente | 6 |
| Ofertas recomendadas | 5 |
El filtro presupuestal y de estrato conserva 112 ofertas. Al incorporar el área y las dotaciones solicitadas quedan 9 candidatos de ajuste alto. De ellos, 6 tienen las dotaciones clave observadas y una coordenada sin asociación interna con otras zonas. Se priorizaron dotaciones observadas y coordenadas asociadas solo a Zona Norte.
| Opción | ID | Barrio | Estrato | Precio de oferta | Margen del crédito | Área (m²) | Diferencia frente a 200 m² | Parqueaderos | Baños | Habitaciones | Valor ajustado de referencia | Oferta - referencia | Control de calidad | Alerta de dato |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 1144 | La Merced | 4 | 320,0 millones | 30,0 millones | 200,0 | 0,0 m² | 2 | 4 | 4 | 390,9 millones | -70,9 millones | Dotaciones observadas; Coordenada asociada solo a Zona Norte | Sin alerta |
| 2 | 1343 | La Flora | 5 | 320,0 millones | 30,0 millones | 200,0 | 0,0 m² | 2 | 4 | 4 | 446,4 millones | -126,4 millones | Dotaciones observadas; Coordenada asociada solo a Zona Norte | Sin alerta |
| 3 | 4210 | El Bosque | 5 | 350,0 millones | 0,0 millones | 200,0 | 0,0 m² | 3 | 3 | 4 | 446,9 millones | -96,9 millones | Dotaciones observadas; Coordenada asociada solo a Zona Norte | Sin alerta |
| 4 | 1887 | Vipasa | 5 | 340,0 millones | 10,0 millones | 203,0 | 3,0 m² | 2 | 3 | 4 | 421,6 millones | -81,6 millones | Dotaciones observadas; Coordenada asociada solo a Zona Norte | Sin alerta |
| 5 | 1163 | La Merced | 5 | 350,0 millones | 0,0 millones | 216,0 | 16,0 m² | 2 | 2 | 4 | 404,3 millones | -54,3 millones | Dotaciones observadas; Coordenada asociada solo a Zona Norte | Sin alerta |
La lista corta contiene 1 registros de estrato 4 y 4 de estrato 5. Sus precios se ubican entre 320,0 y 350,0 millones, con una media de 336,0 millones. Todas respetan el presupuesto máximo.
La columna Oferta - referencia compara el precio anunciado con el valor ajustado de referencia que produce el modelo para las características reales de cada oferta. Un valor negativo significa que el anuncio se encuentra por debajo de esa estimación. Esto no demuestra por sí solo que exista una ganga: la diferencia puede reflejar estado de conservación, ubicación específica, calidad de acabados o atributos no contenidos en la base, por lo que debe verificarse antes de una recomendación definitiva. Como estas ofertas pertenecen a la muestra utilizada para estimar el modelo, el valor ajustado funciona únicamente como referencia interna y no como una predicción independiente.
Regla de verificación de datos. Una oferta anunciada muy por debajo de su valor de referencia puede ser una oportunidad, pero con mayor probabilidad es un dato mal capturado (área, precio o estrato) o un inmueble con una condición no registrada. Se marca para verificación toda oferta cuya desviación frente al valor de referencia supere dos veces el RMSE de validación cruzada del modelo (312,9 millones). En esta lista, 0 ofertas activan la alerta; las desviaciones observadas, de entre 54,3 y 126,4 millones, están dentro de lo que el modelo no explica de forma habitual.
Figura 12. Localización de las cinco ofertas recomendadas para la vivienda 1. Los puntos azules corresponden al estrato 4 y los naranjas al estrato 5.
Cada marcador permite consultar el ID, el barrio, el precio, el margen frente al crédito, las características de la vivienda, el valor ajustado de referencia y los controles de calidad. En la lista seleccionada, 0 ofertas tienen una coordenada compartida con otra zona y 0 dependen de una dotación imputada.
Opción 1 — ID 1144 (La Merced). Casa de estrato 4 ofrecida en 320,0 millones. Tiene 200,0 m², 2 parqueaderos, 4 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta deja una holgura de 30,0 millones frente al crédito; además, se anuncia 70,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.
Opción 2 — ID 1343 (La Flora). Casa de estrato 5 ofrecida en 320,0 millones. Tiene 200,0 m², 2 parqueaderos, 4 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta deja una holgura de 30,0 millones frente al crédito; además, se anuncia 126,4 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.
Opción 3 — ID 4210 (El Bosque). Casa de estrato 5 ofrecida en 350,0 millones. Tiene 200,0 m², 3 parqueaderos, 3 baños y 4 habitaciones; coincide exactamente con los 200 m² solicitados. La oferta utiliza el límite completo de 350 millones y no deja holgura presupuestal; además, se anuncia 96,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.
Opción 4 — ID 1887 (Vipasa). Casa de estrato 5 ofrecida en 340,0 millones. Tiene 203,0 m², 2 parqueaderos, 3 baños y 4 habitaciones; se aparta en 3,0 m² del área objetivo. La oferta deja una holgura de 10,0 millones frente al crédito; además, se anuncia 81,6 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.
Opción 5 — ID 1163 (La Merced). Casa de estrato 5 ofrecida en 350,0 millones. Tiene 216,0 m², 2 parqueaderos, 2 baños y 4 habitaciones; se aparta en 16,0 m² del área objetivo. La oferta utiliza el límite completo de 350 millones y no deja holgura presupuestal; además, se anuncia 54,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona norte.
Las opciones 1 y 2 conforman el primer grupo de visitas porque ambas coinciden con los 200 m² y las cuatro habitaciones, se ofrecen dentro del crédito y dejan una holgura presupuestal. La opción 1 mantiene la ventaja de pertenecer al estrato 4, mientras que la opción 2 permite evaluar una alternativa de estrato 5 con características estructurales comparables.
Las demás alternativas también satisfacen el presupuesto y mantienen una alta proximidad a los requisitos de la solicitud. En particular, las ofertas de estrato 5 muestran que, aunque el punto 5 estimó un precio medio superior a 350 millones para ese escenario, sí existen anuncios concretos dentro del límite financiero. En total, 5 de las cinco ofertas se anuncian por debajo del valor ajustado de referencia del modelo para sus propias características.
El punto 7 repite el procedimiento de los puntos 1 a 6 para la
segunda solicitud. La limpieza, la estandarización de categorías, la
eliminación de duplicados y la imputación con MICE ya se realizaron
sobre la base maestra vivienda_corregida; por tanto, esta
etapa comienza con el filtro de apartamentos de la Zona Sur y continúa
con EDA, modelación, validación de supuestos, predicción y selección de
ofertas.
La solicitud corresponde a un apartamento de 300 m², tres parqueaderos, tres baños, cinco habitaciones, estrato 5 o 6 y crédito preaprobado máximo de 850 millones de pesos.
base2base2 <- vivienda_corregida %>%
filter(
tipo == "Apartamento",
zona == "Zona Sur"
)
La consulta produce 2.760 ofertas. Todas proceden de la misma base corregida utilizada para la primera solicitud.
| Indicador | Resultado |
|---|---|
| Número de registros | 2.760 |
| Identificadores originales únicos | 2.760 |
| Tipos diferentes | 1 |
| Zonas diferentes | 1 |
| Todas las ofertas son apartamentos | Sí |
| Todas pertenecen a Zona Sur | Sí |
| Valores faltantes | 0 |
| Coordenadas faltantes | 0 |
| ID | Zona | Piso | Estrato | Precio (millones) | Área construida (m²) | Parqueaderos | Baños | Habitaciones | Tipo | Barrio | Longitud | Latitud |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 5098 | Zona Sur | 5 | 4 | 290 | 96 | 1 | 2 | 3 | Apartamento | Acopi | -76.53464 | 3.44987 |
| 698 | Zona Sur | 2 | 3 | 78 | 40 | 1 | 1 | 2 | Apartamento | Aguablanca | -76.50100 | 3.40000 |
| 8199 | Zona Sur | 8 | 6 | 875 | 194 | 2 | 5 | 3 | Apartamento | Aguacatal | -76.55700 | 3.45900 |
Figura 13. Localización de los apartamentos de base2 con los dos controles espaciales: coordenadas compartidas con otra zona y latitud propia de la Zona Norte.
Se identifican 172 ofertas cuya coordenada también
aparece asociada con otra zona y 66 ofertas
(2,4 % de base2) cuya latitud no es
inferior al primer cuartil de la Zona Norte (\(3,457\)), es decir, apartamentos “del sur”
geocodificados en el norte de la ciudad. La proporción es claramente
menor que la observada en base1.
| Barrio | Apartamentos de base2 con latitud del norte | Ofertas del barrio registradas en Zona Sur | De ellas, con latitud del sur |
|---|---|---|---|
| Valle Del Lili | 34 | 991 | 856 |
| El Caney | 3 | 205 | 192 |
| El Limonar | 3 | 133 | 115 |
| El Refugio | 3 | 119 | 108 |
| Bochalema | 2 | 33 | 12 |
| Ciudad Bochalema | 2 | 47 | 22 |
| El Ingenio | 2 | 203 | 183 |
| La Hacienda | 2 | 165 | 154 |
El patrón se repite: el barrio más frecuente, Valle Del Lili, es un sector del sur cuyas demás ofertas sí tienen latitud meridional, lo que apunta a errores puntuales de geocodificación y no a zonas mal etiquetadas. Se conserva la zona declarada, se reestima el modelo sin estos registros en la sección 7.4 y la selección de ofertas exige coordenadas coherentes con la Zona Sur.
base2Para la correlación exploratoria, el estrato se interpreta como una variable ordinal; en la regresión se incorpora como factor para no imponer diferencias iguales entre estratos consecutivos.
| Variable | N | Media | Desviación estándar | Q1 | Mediana | Q3 | Mínimo | Máximo |
|---|---|---|---|---|---|---|---|---|
| Precio (millones) | 2.760 | 297,7 | 192,2 | 175,0 | 245,0 | 335,0 | 75,0 | 1.750,0 |
| Área construida (m²) | 2.760 | 97,6 | 52,7 | 65,0 | 85,0 | 110,0 | 40,0 | 932,0 |
| Estrato | 2.760 | 4,6 | 0,8 | 4,0 | 5,0 | 5,0 | 3,0 | 6,0 |
| Parqueaderos | 2.760 | 1,4 | 0,7 | 1,0 | 1,0 | 2,0 | 1,0 | 10,0 |
| Baños | 2.760 | 2,5 | 0,9 | 2,0 | 2,0 | 3,0 | 1,0 | 8,0 |
| Habitaciones | 2.760 | 3,0 | 0,6 | 3,0 | 3,0 | 3,0 | 1,0 | 6,0 |
El precio promedio es de 297,7 millones, aunque la mediana de 245,0 millones representa mejor el valor típico: aproximadamente la mitad de los apartamentos se ofrece por debajo de este valor y la otra mitad por encima. En tamaño, el área promedio es de 97,6 m²** con la mitad central de las áreas construidas entre 65,0 y 110,0 m². El apartamento típico se ubica en estrato 5 y cuenta con 1 parqueadero, 2 baños y 3 habitaciones.
Figura 14. Matriz interactiva de correlaciones de Pearson para base2.
Figura 15. Correlaciones de Pearson y Spearman entre el precio y cada predictor en base2.
Las asociaciones de Pearson con el precio son: área construida \(r=0,758\), estrato \(r=0,672\), parqueaderos \(r=0,669\), baños \(r=0,734\) y habitaciones \(r=0,347\). La relación lineal de mayor magnitud corresponde a Área construida (m²).
Figura 16. Precio frente al área construida de los apartamentos, diferenciado por estrato.
Frente al mismo gráfico obtenido para las casas de la zona norte, el mercado de apartamentos presenta una concentración mucho mayor en superficies pequeñas y medias, principalmente por debajo de 200 m², mientras que las casas muestran una dispersión considerablemente más amplia en tamaño. En ambos segmentos existe una relación positiva entre área construida y precio, pero en los apartamentos la pendiente visual es más pronunciada, sugiriendo que el incremento del precio asociado al área podría ser mayor en este segmento.
También se aprecia una segmentación más marcada por estrato: para áreas similares, los apartamentos de estratos 5 y 6 tienden a ubicarse en niveles de precio superiores a los de estratos 3 y 4, lo que indica que el valor no depende únicamente del tamaño, sino también del segmento socioeconómico al que pertenece el inmueble. Al igual que en las casas, la dispersión del precio aumenta a medida que crece el área y aparecen algunas propiedades extremas (apartamentos de gran superficie con precios inusualmente bajos y otros de tamaño medio con precios muy elevados), que podrían influir en la estimación de la tendencia lineal. En síntesis, las casas conforman un mercado más heterogéneo en tamaño, mientras que los apartamentos están más concentrados dimensionalmente pero muestran una diferenciación más clara de precios según el estrato.
Figura 17. Distribución del precio según estrato, parqueaderos, baños y habitaciones en base2.
| Estrato | Ofertas | Precio medio | Precio mediano | Q1 del precio | Q3 del precio |
|---|---|---|---|---|---|
| 3 | 200 | 141,2 | 128,0 | 110,0 | 148,2 |
| 4 | 1.075 | 203,5 | 185,0 | 153,0 | 240,0 |
| 5 | 1.024 | 293,6 | 280,0 | 230,0 | 330,0 |
| 6 | 461 | 594,6 | 580,0 | 410,0 | 700,0 |
| Variable 1 | Variable 2 | r de Pearson |
|---|---|---|
| Área construida (m²) | Baños | 0,685 |
| Estrato | Baños | 0,574 |
| Área construida (m²) | Parqueaderos | 0,561 |
| Parqueaderos | Baños | 0,556 |
| Baños | Habitaciones | 0,524 |
| Área construida (m²) | Estrato | 0,481 |
| Estrato | Parqueaderos | 0,474 |
| Área construida (m²) | Habitaciones | 0,454 |
| Parqueaderos | Habitaciones | 0,268 |
| Estrato | Habitaciones | 0,212 |
| Grupo | Ofertas | Área media (m²) | Precio medio | Desviación estándar del precio | Rango intercuartil | Coeficiente de variación |
|---|---|---|---|---|---|---|
| Area tercil 1 | 920 | 61,0 | 166,4 | 44,3 | 53,0 | 0,27 |
| Area tercil 2 | 920 | 84,4 | 254,1 | 54,2 | 70,0 | 0,21 |
| Area tercil 3 | 920 | 147,4 | 472,7 | 237,0 | 281,8 | 0,50 |
| Estrato 3 | 200 | 68,8 | 141,2 | 62,7 | 38,2 | 0,44 |
| Estrato 4 | 1.075 | 75,9 | 203,5 | 67,7 | 87,0 | 0,33 |
| Estrato 5 | 1.024 | 102,2 | 293,6 | 102,8 | 100,0 | 0,35 |
| Estrato 6 | 461 | 150,2 | 594,6 | 256,7 | 290,0 | 0,43 |
En los apartamentos del sur los predictores están más correlacionados entre sí que en las casas del norte: la pareja Área construida (m²) y Baños alcanza \(r=0,685\). Esto anticipa un VIF mayor, aunque todavía moderado. La heterocedasticidad es aquí más marcada: la desviación estándar del precio se multiplica por 5,4 entre el tercil de apartamentos pequeños y el de grandes, con un salto abrupto en el tercil superior, que concentra los apartamentos de estrato 6 y las áreas atípicas. Las dos observaciones se confirman en el diagnóstico de la sección 7.4.
El EDA de la segunda solicitud identifica las variables con mayor
asociación con el precio y muestra la heterogeneidad existente incluso
dentro de una misma zona y un mismo tipo de inmueble. Anticipa, además,
una correlación más alta entre predictores que en base1 y
una varianza del precio fuertemente creciente con el área y el
estrato.
modelo_completo_base2 <- lm(
preciom ~ areaconst + estrato_f + habitaciones +
parqueaderos + banios,
data = base_modelado_base2
)
| Variable | Estimación | Error estándar | Estadístico t | Valor p | IC 95 % inferior | IC 95 % superior | Significativo al 5 % |
|---|---|---|---|---|---|---|---|
| Intercepto | -39,259 | 10,498 | -3,740 | < 0,001 | -59,843 | -18,674 | Sí |
| Área construida | 1,336 | 0,047 | 28,302 | < 0,001 | 1,243 | 1,428 | Sí |
| Estrato 4 frente a 3 | 29,063 | 6,982 | 4,163 | < 0,001 | 15,373 | 42,753 | Sí |
| Estrato 5 frente a 3 | 56,663 | 7,204 | 7,865 | < 0,001 | 42,537 | 70,788 | Sí |
| Estrato 6 frente a 3 | 212,762 | 9,027 | 23,569 | < 0,001 | 195,062 | 230,463 | Sí |
| Habitaciones | -12,221 | 3,352 | -3,645 | < 0,001 | -18,794 | -5,647 | Sí |
| Parqueaderos | 51,117 | 3,308 | 15,451 | < 0,001 | 44,630 | 57,604 | Sí |
| Baños | 41,929 | 2,996 | 13,996 | < 0,001 | 36,055 | 47,803 | Sí |
El modelo completo obtiene un \(R^2\) de 0,7872 y un \(R^2\) ajustado de 0,7866. La prueba global es \(F(7, 2.752) = 1.454,09\), con valor \(p\) < 0,001. Por tanto, el conjunto de predictores aporta información estadísticamente significativa sobre el precio.
Área construida. Manteniendo constantes las demás características, una diferencia de 100 m² se asocia con un precio medio estimado 133,6 millones mayor. El valor \(p\) es < 0,001.
Parqueaderos. Un parqueadero adicional se asocia con 51,1 millones más en el precio medio, manteniendo constantes las demás variables. El coeficiente es significativo al 5 %.
Baños. Un baño adicional se asocia con 41,9 millones más, a igualdad de las demás características. El valor \(p\) es < 0,001.
Habitaciones. A igual área, estrato, parqueaderos y baños, una habitación adicional presenta un coeficiente de -12,2 millones, con valor \(p\) < 0,001. El resultado permite distinguir su aporte de cero al 5 %. El signo debe interpretarse junto con el área: a superficie constante, aumentar el número de habitaciones también puede significar subdividir el espacio.
Estrato. Frente al estrato 3, las diferencias estimadas son:
Estas diferencias comparan segmentos del mercado y no representan el efecto causal de cambiar administrativamente un apartamento de estrato.
Intercepto. Representa un apartamento del estrato de referencia con área y dotaciones iguales a cero. Esa combinación queda fuera del contexto observado, por lo que el intercepto no tiene una interpretación inmobiliaria directa.
| Variable | Estimación | EE clásico | EE robusto HC3 | Razón HC3 / clásico | Valor p clásico | Valor p HC3 | Significativo al 5 % con HC3 |
|---|---|---|---|---|---|---|---|
| Intercepto | -39,259 | 10,498 | 16,555 | 1,58 | < 0,001 | 0,018 | Sí |
| Área construida | 1,336 | 0,047 | 0,364 | 7,72 | < 0,001 | < 0,001 | Sí |
| Estrato 4 frente a 3 | 29,063 | 6,982 | 4,756 | 0,68 | < 0,001 | < 0,001 | Sí |
| Estrato 5 frente a 3 | 56,663 | 7,204 | 5,511 | 0,77 | < 0,001 | < 0,001 | Sí |
| Estrato 6 frente a 3 | 212,762 | 9,027 | 12,290 | 1,36 | < 0,001 | < 0,001 | Sí |
| Habitaciones | -12,221 | 3,352 | 6,765 | 2,02 | < 0,001 | 0,071 | No |
| Parqueaderos | 51,117 | 3,308 | 12,209 | 3,69 | < 0,001 | < 0,001 | Sí |
| Baños | 41,929 | 2,996 | 8,435 | 2,82 | < 0,001 | < 0,001 | Sí |
La corrección HC3 cambia aquí una conclusión. El error estándar robusto del área es 7,7 veces el clásico, y el de habitaciones se duplica: con inferencia robusta, el coeficiente negativo de habitaciones (-12,2 millones) tiene un valor p de 0,071 y deja de ser significativo al 5 %. La lectura correcta es, por tanto, más prudente que la del modelo clásico: la evidencia de que subdividir un apartamento en más habitaciones reduce su precio es sugerente pero no concluyente. Área, estrato, parqueaderos y baños conservan su significancia con holgura.
| Variable | Base imputada (principal) | Casos completos observados | Imputación múltiple agrupada (5 completaciones) |
|---|---|---|---|
| Intercepto | -39,3 (10,5) | -26,5 (13,2) | -39,0 (10,5) |
| Área construida | 1,336 (0,047) | 1,289 (0,052) | 1,323 (0,049) |
| Estrato 4 frente a 3 | 29,1 (7,0) | 30,5 (9,7) | 29,2 (7,1) |
| Estrato 5 frente a 3 | 56,7 (7,2) | 50,8 (9,7) | 56,1 (7,3) |
| Estrato 6 frente a 3 | 212,8 (9,0) | 203,3 (11,3) | 212,0 (9,2) |
| Habitaciones | -12,2 (3,4) | -18,4 (3,9) | -12,8 (3,4) |
| Parqueaderos | 51,1 (3,3) | 63,2 (4,1) | 54,8 (5,1) |
| Baños | 41,9 (3,0) | 42,2 (3,3) | 41,2 (3,2) |
Con 2.349 casos completos y con la imputación múltiple agrupada, los coeficientes se mantienen dentro de un error estándar de los principales. La mayor diferencia aparece en parqueaderos (51,1 en la base imputada frente a 63,2 en casos completos), que es la variable con más faltantes; la estimación agrupada (54,8) queda entre ambas. Los resultados no dependen de la imputación.
| Step | Df | Deviance | Resid. Df | Resid. Dev | AIC |
|---|---|---|---|---|---|
| Modelo completo | — | — | 2752 | 21691618 | 24771.68 |
La fórmula seleccionada con toda la muestra es:
## preciom ~ areaconst + estrato_f + habitaciones + parqueaderos +
## banios
| Modelo | Fórmula | Parámetros | R² | R² ajustado | AIC | Delta AIC | BIC | RMSE entrenamiento | MAE entrenamiento |
|---|---|---|---|---|---|---|---|---|---|
| Completo | preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 8 | 0,7872 | 0,7866 | 32.606,2 | 0,00 | 32.659,5 | 88,7 | 53,0 |
| Stepwise AIC | preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 8 | 0,7872 | 0,7866 | 32.606,2 | 0,00 | 32.659,5 | 88,7 | 53,0 |
La trayectoria interna de step() y la tabla comparativa
pueden mostrar AIC en escalas absolutas distintas, porque
step() utiliza extractAIC() y la tabla utiliza
AIC(). La ordenación y las diferencias entre modelos son
las que deben interpretarse.
| Modelo | RMSE | MAE | R² predictivo |
|---|---|---|---|
| Completo | 92,07 | 53,35 | 0,7704 |
| Stepwise AIC | 92,07 | 53,35 | 0,7704 |
El RMSE del modelo completo es 92,07 millones y el del stepwise es 92,07 millones. La diferencia absoluta es de 0,00 millones. El procedimiento stepwise no eliminó ninguna variable: la fórmula seleccionada coincide exactamente con el modelo completo. La misma fórmula fue estable en validación cruzada; por tanto, se conserva el modelo completo como modelo identificado para la segunda solicitud.
| Fórmula | Número de pliegues |
|---|---|
| preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 10 |
| Modelo | Fórmula | N | Parámetros | R² | R² ajustado | AIC | BIC | RMSE CV | MAE CV | R² predictivo CV |
|---|---|---|---|---|---|---|---|---|---|---|
| Modelo completo retenido por stepwise | preciom ~ areaconst + estrato_f + habitaciones + parqueaderos + banios | 2.760 | 8 | 0,7872 | 0,7866 | 32.606,2 | 32.659,5 | 92,07 | 53,35 | 0,7704 |
El procedimiento stepwise basado en AIC no eliminó ninguna
variable. Por tanto, el modelo identificado para la segunda
solicitud es el Modelo completo retenido por stepwise,
con la fórmula preciom ~ areaconst + estrato_f + habitaciones +
parqueaderos + banios. La misma fórmula fue seleccionada en
10 de 10 pliegues, lo que confirma su estabilidad. En
este caso no existe una ganancia de parsimonia respecto del modelo
completo: el modelo completo fue simplemente retenido por
step().
base2La validación se realiza sobre el modelo candidato anterior. El objetivo es diagnosticar posibles incumplimientos y formular sugerencias; no se eliminan observaciones ni se sustituye automáticamente el modelo.
| Supuesto | Procedimiento | Valor diagnóstico | Valor p | Resultado | Recomendación |
|---|---|---|---|---|---|
| Linealidad y forma funcional | Prueba RESET de Ramsey | 168,990 | < 0,001 | Alerta: posible no linealidad o especificación incompleta | Evaluar logaritmos, términos no lineales e interacciones. |
| Homoscedasticidad | Prueba de Breusch-Pagan | 817,524 | < 0,001 | Alerta: la varianza de los errores no es constante | Evaluar una transformación logarítmica del precio y revisar la especificación. |
| Normalidad aproximada de los residuos | Prueba de Shapiro-Wilk y gráfico Q-Q | 0,772 | < 0,001 | Alerta: los residuos se apartan de la normalidad | Apoyarse en el gráfico Q-Q, revisar los casos extremos y considerar transformaciones. |
| Multicolinealidad | VIF/GVIF ajustado | 1,650 | — | Sin multicolinealidad preocupante | Mantener los predictores si los índices permanecen bajo el umbral. |
| Independencia de los errores | Evaluación del diseño transversal | — | — | No existe un orden temporal; 1165 ofertas comparten coordenada con al menos otra oferta | No aplicar Durbin-Watson a un orden arbitrario; considerar agrupación por barrio o dependencia espacial. |
| Observaciones influyentes | Residuos studentizados, apalancamiento y Cook | 147,000 | — | Se identifican 147 observaciones por encima del criterio 4/n | Revisar los casos, validar su calidad y realizar sensibilidad sin eliminarlos automáticamente. |
Figura 18. Residuos frente a valores ajustados del modelo de base2.
La prueba RESET obtiene un estadístico de 168,990 y un valor \(p\) < 0,001. Se rechaza la hipótesis de que la forma funcional esté correctamente especificada; el resultado puede reflejar curvatura o variables omitidas. La prueba no identifica por sí sola la causa concreta.
Figura 19. Gráfico de escala-localización del modelo de base2.
La prueba de Breusch–Pagan obtiene \(\chi^2=817,524\), con valor \(p\) < 0,001. Se rechaza la homoscedasticidad: la variabilidad de los residuos no permanece constante para todos los niveles del precio ajustado. Como sugerencia, puede evaluarse una transformación logarítmica del precio y revisarse la especificación funcional.
Figura 20. Gráfico Q-Q de los residuos studentizados de base2.
Shapiro–Wilk obtiene \(W=0,7716\) y valor \(p\) < 0,001. Se rechaza la normalidad de los residuos. El gráfico Q-Q permite valorar si las desviaciones se concentran principalmente en las colas. Este resultado no invalida por sí solo los coeficientes MCO, pero aconseja cautela al interpretar intervalos y predicciones.
| Variable | GVIF | Grados de libertad | Índice comparable | Umbral de referencia | Alerta |
|---|---|---|---|---|---|
| Área construida | 2,169 | 1 | 1,473 | 2,236 | No |
| Estrato (factor) | 1,816 | 3 | 1,105 | 2,236 | No |
| Habitaciones | 1,479 | 1 | 1,216 | 2,236 | No |
| Parqueaderos | 1,721 | 1 | 1,312 | 2,236 | No |
| Baños | 2,721 | 1 | 1,650 | 2,236 | No |
El mayor índice comparable corresponde a Baños, con 1,650. No se identifica multicolinealidad preocupante.
La base es transversal y no posee un orden temporal natural; por eso
no se aplica Durbin–Watson al orden arbitrario de las filas. En
base2, 327 grupos de coordenadas reúnen
1.165 ofertas. La independencia se mantiene como
supuesto del diseño, reconociendo una posible agrupación espacial por
edificio, proyecto o punto de geocodificación.
Figura 21. Distancia de Cook para el modelo de base2.
Figura 22. Apalancamiento frente a residuos studentizados en base2.
| Indicador | Umbral | Número de observaciones | Porcentaje |
|---|---|---|---|
| Residuos studentizados con valor absoluto mayor que 3 | 3,0000 | 30 | 1,1 % |
| Observaciones con apalancamiento superior a 2p/n | 0,0058 | 168 | 6,1 % |
| Observaciones con distancia de Cook superior a 4/n | 0,0014 | 147 | 5,3 % |
| Observaciones marcadas por al menos un criterio | — | 247 | 8,9 % |
| ID | Barrio | Estrato | Precio observado | Área | Precio ajustado | Residuo studentizado | Apalancamiento | Cook | Residuo extremo | Alto apalancamiento | Influencia Cook |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 6121 | Valle Del Lili | 5 | 299,0 | 932,0 | 1.402,7 | -14,360 | 0,1946 | 5,7961 | Sí | Sí | Sí |
| 6472 | El Limonar | 5 | 170,0 | 605,0 | 936,2 | -9,148 | 0,0833 | 0,9234 | Sí | Sí | Sí |
| 1400 | El Caney | 4 | 140,0 | 58,0 | 637,9 | -5,991 | 0,1126 | 0,5620 | Sí | Sí | Sí |
| 324 | Valle Del Lili | 4 | 190,0 | 50,0 | 602,7 | -4,968 | 0,1168 | 0,4045 | Sí | Sí | Sí |
| 7182 | Guadalupe | 5 | 730,0 | 573,0 | 1.210,6 | -5,565 | 0,0436 | 0,1745 | Sí | Sí | Sí |
| 4952 | El Ingenio | 5 | 650,0 | 600,0 | 1.027,8 | -4,396 | 0,0565 | 0,1438 | Sí | Sí | Sí |
| 6475 | Ciudad Jardin | 6 | 1.561,0 | 399,0 | 990,9 | 6,527 | 0,0176 | 0,0938 | Sí | Sí | Sí |
| 6512 | Pance | 6 | 1.750,0 | 290,0 | 845,3 | 10,424 | 0,0070 | 0,0926 | Sí | Sí | Sí |
| 5952 | Ciudad Jardin | 6 | 1.750,0 | 342,0 | 944,5 | 9,252 | 0,0088 | 0,0917 | Sí | Sí | Sí |
| 6086 | Ciudad Jardin | 6 | 1.500,0 | 240,0 | 783,8 | 8,207 | 0,0106 | 0,0880 | Sí | Sí | Sí |
Se identifican 30 residuos studentizados extremos, 168 casos de alto apalancamiento y 147 casos por encima del umbral de Cook. El registro con mayor Cook es el ID 6.121, con valor 5,7961. Estos casos deben contrastarse con la fuente original, pero no eliminarse automáticamente.
| Especificación | R² ajustado (escala propia) | RMSE CV (millones) | MAE CV (millones) | R² predictivo CV | p RESET | p Breusch-Pagan | W Shapiro-Wilk |
|---|---|---|---|---|---|---|---|
| Lineal (precio en millones) | 0,787 | 92,1 | 53,4 | 0,770 | < 0,001 | < 0,001 | 0,772 |
| Logarítmica (log del precio) | 0,802 | 149,6 | 56,4 | 0,394 | < 0,001 | < 0,001 | 0,973 |
Como en base1, el logaritmo mejora la normalidad de los
residuos (\(W\) de 0,772 a 0,973) pero
no resuelve la heterocedasticidad ni la forma funcional, y su RMSE de
validación cruzada en millones (149,6) es sensiblemente peor que el del
lineal (92,1), porque los apartamentos de estrato 6 y área grande
dominan el error en millones. Se conserva el modelo lineal para la
predicción puntual y se usa el logarítmico como lectura complementaria
de los intervalos en la sección 7.5.
| Variable | Principal (base2 completa) | Sin apartamentos con latitud del norte | Sin Cook > 4/n |
|---|---|---|---|
| Intercepto | -39,3 (10,5) | -45,0 (10,7) | -39,6 (6,5) |
| Área construida | 1,336 (0,047) | 1,308 (0,048) | 1,751 (0,048) |
| Estrato 4 frente a 3 | 29,1 (7,0) | 30,1 (7,0) | 35,5 (4,2) |
| Estrato 5 frente a 3 | 56,7 (7,2) | 56,7 (7,3) | 64,3 (4,3) |
| Estrato 6 frente a 3 | 212,8 (9,0) | 210,4 (9,1) | 196,2 (5,7) |
| Habitaciones | -12,2 (3,4) | -11,2 (3,4) | -10,3 (2,1) |
| Parqueaderos | 51,1 (3,3) | 57,2 (3,5) | 44,3 (2,7) |
| Baños | 41,9 (3,0) | 40,7 (3,0) | 26,0 (2,0) |
| Ajuste | N | R² | Error estándar residual (millones) |
|---|---|---|---|
| Principal (base2 completa) | 2.760 | 0,787 | 88,8 |
| Sin apartamentos con latitud propia del norte | 2.694 | 0,788 | 89,0 |
| Sin observaciones con Cook > 4/n | 2.613 | 0,884 | 51,8 |
Excluir los apartamentos con latitud del norte no altera los
coeficientes. Excluir los 147 casos con Cook \(> 4/n\) sí los mueve más que en
base1: el coeficiente del área sube de 1,34 a 1,75 millones
por m² y el de baños baja de 41,9 a 26,0. Esto indica que unos pocos
anuncios con área desproporcionada para su precio (por ejemplo, ID 6121:
932 m² anunciados a 299 millones) tiran del coeficiente del área hacia
abajo. La consecuencia práctica para la vivienda 2, cuya solicitud está
precisamente en la cola de áreas grandes, es que el precio estimado
podría estar ligeramente subestimado; se retoma en la sección 7.5.
El modelo de base2 no presenta multicolinealidad
preocupante. La prueba RESET señala una posible deficiencia de forma
funcional; Breusch–Pagan detecta heterocedasticidad; y Shapiro–Wilk
rechaza la normalidad de los residuos. De acuerdo con el enunciado, se
conserva el modelo candidato para predecir, pero sus intervalos deben
interpretarse con cautela y se recomienda revisar transformaciones,
forma funcional y casos influyentes.
| Característica | Vivienda 2 |
|---|---|
| Tipo | Apartamento |
| Área construida | 300 m² |
| Parqueaderos | 3 |
| Baños | 3 |
| Habitaciones | 5 |
| Estrato | 5 o 6 |
| Zona | Zona Sur |
| Crédito preaprobado | $850 millones |
La predicción se calcula con el Modelo completo retenido por
stepwise y la fórmula preciom ~ areaconst + estrato_f +
habitaciones + parqueaderos + banios. Como el estrato es un
factor, se construyen dos escenarios independientes, uno para estrato 5
y otro para estrato 6. El crédito no forma parte del modelo; se utiliza
después para valorar la viabilidad financiera.
La solicitud contiene cinco habitaciones. Esta variable permanece en el modelo candidato y participa directamente en la predicción.
escenarios_vivienda_2 <- tibble::tibble(
areaconst = 300,
habitaciones = 5,
parqueaderos = 3,
banios = 3,
estrato_f = factor(
c(5, 6),
levels = levels(base_modelado_base2$estrato_f)
)
)
predict(
modelo_prediccion_vivienda_2,
newdata = escenarios_vivienda_2,
interval = "confidence",
level = 0.95
)
predict(
modelo_prediccion_vivienda_2,
newdata = escenarios_vivienda_2,
interval = "prediction",
level = 0.95
)
| Escenario | Precio de oferta estimado | IC 95 % del precio medio | IP 95 % para un apartamento | Crédito máximo | Margen: crédito - estimación | Evaluación puntual |
|---|---|---|---|---|---|---|
| Estrato 5 | 636,2 millones | [616,2; 656,3] | [461,0; 811,5] | 850,0 millones | 213,8 | Dentro del crédito |
| Estrato 6 | 792,3 millones | [771,8; 812,9] | [617,0; 967,6] | 850,0 millones | 57,7 | Dentro del crédito |
Para el estrato 5, el precio de oferta estimado es 636,2 millones, con un margen frente al crédito de 213,8 millones. La predicción puntual se encuentra dentro del crédito disponible.
Para el estrato 6, el precio de oferta estimado es 792,3 millones, con un margen de 57,7 millones. La predicción puntual se encuentra dentro del crédito disponible.
Al comparar ambos escenarios, el precio estimado del estrato 6 es 156,1 millones mayor que el del estrato 5, manteniendo constantes las demás características. Esta diferencia describe segmentos del mercado y no un efecto causal de cambiar el estrato.
Ambos escenarios son compatibles con el crédito de 850 millones según la predicción puntual. No obstante, el estrato 5 ofrece una mayor holgura y menor riesgo presupuestal: el límite superior de su intervalo de predicción para un apartamento individual es 811,5 millones, todavía por debajo del crédito. En estrato 6, el límite superior alcanza 967,6 millones y supera el presupuesto. Por ello, cuando las demás características sean comparables, el estrato 5 constituye la alternativa financieramente más holgada, mientras que el estrato 6 requiere mayor cautela en la negociación.
Los intervalos de predicción para un apartamento individual incorporan la dispersión residual del mercado y son más amplios que los intervalos del precio medio. Como el diagnóstico de supuestos puede mostrar desviaciones de la forma funcional, homoscedasticidad o normalidad, deben entenderse como aproximaciones y no como garantías de negociación.
| Indicador | Valor |
|---|---|
| Percentil del área solicitada en la base | 99,0 % |
| Área máxima observada (m²) | 932 |
| Ofertas con área en ±10 % de la solicitada | 24 |
| Ofertas con área en ±10 % y estrato solicitado | 21 |
| Ofertas con al menos los parqueaderos solicitados | 119 |
| Ofertas con área ≥ 90 % de la solicitada y parqueaderos solicitados | 29 |
| Ofertas con área, parqueaderos, baños y habitaciones iguales o superiores | 6 |
| Escenario | h de la solicitud | h medio de la muestra (p/n) | Umbral 2p/n | h máximo observado | Razón h / (2p/n) | Dentro del rango habitual |
|---|---|---|---|---|---|---|
| Estrato 5 | 0,0133 | 0,0029 | 0,0058 | 0,1946 | 2,29 | No |
| Estrato 6 | 0,0139 | 0,0029 | 0,0058 | 0,1946 | 2,41 | No |
La predicción de la vivienda 2 es una extrapolación.
Un apartamento de 300 m² se sitúa en el percentil 99,0 del área de
base2, cuya mediana es 85 m². Solo 29 apartamentos tienen
al menos 270 m² y tres parqueaderos, y apenas 6 igualan o superan
simultáneamente las cuatro dotaciones solicitadas. El apalancamiento de
la solicitud (\(h_0 \approx 0,0133\))
es 2,3 veces el umbral \(2p/n\): la
solicitud está fuera de la nube habitual de predictores. Dos
consecuencias: (i) la predicción descansa en que la relación lineal
estimada sobre apartamentos medianos se mantenga en los grandes, algo
que la prueba RESET pone en duda; (ii) el intervalo de confianza del
precio medio es más ancho de lo que sería para una solicitud típica, y
la sección anterior mostró que los casos influyentes de área grande
tiran el coeficiente del área hacia abajo, por lo que el riesgo es de
subestimación. La cifra de 636,2 millones debe leerse como un orden de
magnitud, no como un precio de referencia preciso.
| Escenario | Lineal: estimación | Lineal: IP 95 % | Log: mediana | Log: media (Duan) | Log: IP 95 % | Amplitud IP lineal | Amplitud IP log | P(precio ≤ crédito) según log |
|---|---|---|---|---|---|---|---|---|
| Estrato 5 | 636,2 | [461,0; 811,5] | 620,7 | 636,7 | [395,3; 974,5] | 350,5 | 579,2 | 91,6 % |
| Estrato 6 | 792,3 | [617,0; 967,6] | 868,4 | 890,8 | [553,0; 1.363,7] | 350,6 | 810,7 | 46,3 % |
Para estrato 5 los dos modelos coinciden en la estimación central (636,2 frente a 636,7 millones). Para estrato 6 el modelo logarítmico estima un precio medio mayor (890,8 millones), lo que refuerza la advertencia de subestimación en la cola alta. A diferencia de la vivienda 1, aquí el intervalo logarítmico es más ancho que el lineal, porque la dispersión relativa de los apartamentos grandes es alta: el rango [553; 1.364] millones para estrato 6 muestra que un apartamento de esas características puede superar ampliamente el crédito. La probabilidad de que un apartamento comparable se anuncie por no más de 850 millones es de aproximadamente 92 % en estrato 5 y 46 % en estrato 6. La recomendación de priorizar el estrato 5 se mantiene y se refuerza.
Primero se buscó una coincidencia estricta: precio no superior a 850 millones, estrato 5 o 6, área entre 270 y 330 m², tres o más parqueaderos, tres o más baños y exactamente cinco habitaciones. Este filtro produjo 0 ofertas.
Como el propósito es presentar al menos cinco alternativas reales, cuando el filtro estricto no alcanza cinco registros se aplica una relajación explícita: área entre 240 y 360 m², entre cuatro y seis habitaciones, al menos dos parqueaderos y al menos tres baños.
Las diferencias frente a la solicitud se muestran en la tabla:
| Etapa | Número de ofertas |
|---|---|
| Ofertas disponibles en base2 | 2.760 |
| Dentro del crédito y en estrato 5 o 6 | 1.429 |
| Coincidencia estricta con la solicitud | 0 |
| Alternativas dentro de la relajación controlada | 11 |
| Con dotaciones observadas y coordenada consistente | 9 |
| Ofertas recomendadas | 5 |
La lista final utiliza dotaciones observadas y coordenadas asociadas solo a Zona Sur dentro del control interno. El puntaje de ajuste asigna un punto por cada 30 m² de diferencia, un punto por cada habitación de diferencia y dos puntos por cada parqueadero faltante respecto de los tres solicitados. Un valor menor representa una mayor cercanía estructural. Para reflejar las dos categorías aceptadas por la solicitud, se reserva la alternativa mejor puntuada de cada estrato disponible y se completan los lugares restantes con los candidatos de menor puntaje global.
| Opción | ID | Barrio | Estrato | Precio de oferta | Margen del crédito | Área (m²) | Diferencia frente a 300 m² | Parqueaderos | Faltante de parqueaderos | Baños | Habitaciones | Diferencia de habitaciones | Tipo de ajuste | Valor ajustado de referencia | Oferta - referencia | Control de calidad | Alerta de dato |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 7512 | Seminario | 5 | 670,0 millones | 180,0 millones | 300,0 | 0,0 m² | 3 | 0 | 5 | 6 | 1 | Alternativa cercana | 707,9 millones | -37,9 millones | Dotaciones observadas; Coordenada asociada solo a Zona Sur | Sin alerta |
| 2 | 8036 | Seminario | 5 | 530,0 millones | 320,0 millones | 256,0 | 44,0 m² | 3 | 0 | 5 | 5 | 0 | Alternativa cercana | 661,3 millones | -131,3 millones | Dotaciones observadas; Coordenada asociada solo a Zona Sur | Sin alerta |
| 3 | 6175 | Capri | 5 | 350,0 millones | 500,0 millones | 270,0 | 30,0 m² | 3 | 0 | 3 | 4 | 1 | Alternativa cercana | 608,4 millones | -258,4 millones | Dotaciones observadas; Coordenada asociada solo a Zona Sur | Verificar dato: desviación mayor que 2 × RMSE |
| 4 | 5306 | Ciudadela Pasoancho | 5 | 650,0 millones | 200,0 millones | 275,0 | 25,0 m² | 2 | 1 | 5 | 5 | 0 | Alternativa cercana | 635,6 millones | 14,4 millones | Dotaciones observadas; Coordenada asociada solo a Zona Sur | Sin alerta |
| 5 | 4266 | El Ingenio | 6 | 700,0 millones | 150,0 millones | 250,0 | 50,0 m² | 2 | 1 | 4 | 5 | 0 | Alternativa cercana | 716,3 millones | -16,3 millones | Dotaciones observadas; Coordenada asociada solo a Zona Sur | Sin alerta |
La lista contiene 4 ofertas de estrato 5 y 1 de estrato 6, distribuidas en 4 barrios. Sus precios se ubican entre 350,0 y 700,0 millones, con una media de 580,0 millones.
El valor ajustado de referencia se calcula con el mismo modelo sobre las características de cada anuncio. Como estas ofertas pertenecen a la muestra con la que se estimó el modelo, se utiliza únicamente como referencia interna de comparación; no constituye una predicción independiente ni demuestra una subvaloración respectivamente.
Regla de verificación de datos. Se marca toda oferta cuya desviación frente al valor de referencia supere dos veces el RMSE de validación cruzada del modelo (184,1 millones). En esta lista la activa 1 oferta: ID 6175 (Capri), anunciada en 350 millones, es decir, 258 millones por debajo de su valor de referencia. Un apartamento de 270 m² y estrato 5 al precio de uno de 130 m² no es una ganga típica, lo más probable es un error en el área o en el precio publicado, o un inmueble con una condición particular. Se conserva en la lista porque cumple los criterios declarados, pero se presenta como caso a verificar y no como oportunidad para ser adquirido.
Figura 23. Localización de las cinco ofertas recomendadas para la vivienda 2. Los puntos azules corresponden al estrato 5 y los morados al estrato 6.
En la lista seleccionada, 0 ofertas dependen de alguna dotación imputada y 0 tienen una coordenada compartida con otra zona dentro del control interno.
Opción 1 — ID 7512 (Seminario). Apartamento de estrato 5 ofrecido en 670,0 millones. Coincide exactamente con los 300 m² solicitados; coincide con los tres parqueaderos solicitados; tiene 5 baños y ofrece 6 habitaciones, una más que lo solicitado. La oferta deja una holgura de 180,0 millones frente a 850 millones; se anuncia 37,9 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.
Opción 2 — ID 8036 (Seminario). Apartamento de estrato 5 ofrecido en 530,0 millones. Tiene 44,0 m² menos que el área objetivo; coincide con los tres parqueaderos solicitados; tiene 5 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 320,0 millones frente a 850 millones; se anuncia 131,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.
Opción 3 — ID 6175 (Capri). Apartamento de estrato 5 ofrecido en 350,0 millones. Tiene 30,0 m² menos que el área objetivo; coincide con los tres parqueaderos solicitados; tiene 3 baños y ofrece 4 habitaciones, una menos que lo solicitado. La oferta deja una holgura de 500,0 millones frente a 850 millones; se anuncia 258,4 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.
Opción 4 — ID 5306 (Ciudadela Pasoancho). Apartamento de estrato 5 ofrecido en 650,0 millones. Tiene 25,0 m² menos que el área objetivo; ofrece 2 parqueaderos, uno menos que lo solicitado; tiene 5 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 200,0 millones frente a 850 millones; se anuncia 14,4 millones por encima del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.
Opción 5 — ID 4266 (El Ingenio). Apartamento de estrato 6 ofrecido en 700,0 millones. Tiene 50,0 m² menos que el área objetivo; ofrece 2 parqueaderos, uno menos que lo solicitado; tiene 4 baños y coincide con las cinco habitaciones. La oferta deja una holgura de 150,0 millones frente a 850 millones; se anuncia 16,3 millones por debajo del valor ajustado de referencia. Dotaciones observadas; coordenada asociada solo a zona sur.
La opción 1, ID 7512 en Seminario, ocupa el primer lugar según el puntaje de cercanía definido. Se ofrece en 670,0 millones, deja una holgura de 180,0 millones y debe evaluarse junto con las diferencias explícitas de área, parqueaderos y habitaciones mostradas en la Tabla 42.
La opción 3 (ID 6175, Capri) queda marcada como dato a verificar por su desviación extrema frente al valor de referencia y no debe encabezar las visitas hasta confirmar área y precio. La lista final no oculta la ausencia de coincidencias suficientes bajo todos los criterios estrictos. Por ello, las cinco opciones deben entenderse como una lista corta de visitas y verificación, no como sustitutos exactos de la solicitud. Antes de recomendar una compra deben confirmarse la vigencia del anuncio, el estado del inmueble, la documentación, la ubicación precisa, la cuota de administración y el precio efectivo de negociación.
Los dos modelos comparten la especificación del enunciado, lo que permite compararlos término a término. La Tabla 43 contrasta los coeficientes de los modelos completos y añade una prueba \(z\) de igualdad entre muestras independientes, \(z=(\hat\beta_2-\hat\beta_1)/\sqrt{ee_1^2+ee_2^2}\); la Tabla 44 compara el ajuste, el error y los diagnósticos.
| Variable | Casas Zona Norte: estimación (EE) | Apartamentos Zona Sur: estimación (EE) | Diferencia (sur - norte) | z | Valor p de la diferencia |
|---|---|---|---|---|---|
| Intercepto | -2,904 (18,589) | -39,26 (10,50) | -36,35 | -1,70 | 0,089 |
| Área construida (por m²) | 0,739 (0,045) | 1,336 (0,047) | 0,60 | 9,17 | < 0,001 |
| Estrato 4 frente a 3 | 72,48 (16,99) | 29,06 (6,98) | -43,42 | -2,36 | 0,018 |
| Estrato 5 frente a 3 | 129,19 (16,11) | 56,66 (7,20) | -72,53 | -4,11 | < 0,001 |
| Estrato 6 frente a 3 | 305,90 (26,54) | 212,76 (9,03) | -93,14 | -3,32 | < 0,001 |
| Habitaciones | 5,054 (4,598) | -12,22 (3,35) | -17,27 | -3,04 | 0,002 |
| Parqueaderos | 27,58 (5,17) | 51,12 (3,31) | 23,54 | 3,84 | < 0,001 |
| Baños | 23,77 (5,72) | 41,93 (3,00) | 18,16 | 2,81 | 0,005 |
| Indicador | Casas Zona Norte (base1) | Apartamentos Zona Sur (base2) |
|---|---|---|
| Número de ofertas | 717 | 2.760 |
| Modelo candidato | Stepwise AIC | Modelo completo retenido por stepwise |
| R² del modelo completo | 0,680 | 0,787 |
| R² ajustado del modelo completo | 0,677 | 0,787 |
| RMSE de validación cruzada (millones) | 156,5 | 92,1 |
| MAE de validación cruzada (millones) | 96,8 | 53,4 |
| R² predictivo de validación cruzada | 0,662 | 0,770 |
| Error estándar residual (millones) | 153,0 | 88,8 |
| Precio mediano (millones) | 390,0 | 245,0 |
| Precio mediano por m² (millones) | 1,66 | 2,90 |
| Área mediana (m²) | 240,0 | 85,0 |
| Valor p de RESET | < 0,001 | < 0,001 |
| Valor p de Breusch-Pagan | < 0,001 | < 0,001 |
| W de Shapiro-Wilk | 0,832 | 0,772 |
| Mayor GVIF ajustado | 1,265 | 1,650 |
| Observaciones con Cook > 4/n (%) | 6,0 | 5,3 |
| RMSE CV de la especificación logarítmica (millones) | 176,4 | 149,6 |
El metro cuadrado vale distinto. En los apartamentos del sur cada m² adicional se asocia con 1,34 millones, frente a 0,74 en las casas del norte; la diferencia es estadísticamente clara (\(p\) < 0,001). Es coherente con el precio mediano por m² de cada mercado (2,90 frente a 1,66 millones): el apartamento del sur es un producto más denso en valor, en el que el área construida es el atributo dominante, mientras que en la casa del norte parte del valor está en el lote, el estrato y el barrio, que el área no captura.
El estrato pesa más en las casas. Las primas de estrato frente al 3 son mayores en las casas del norte para los tres niveles, y la del estrato 6 (306 frente a 213 millones, \(p\) < 0,001) es la más diferenciada. Una lectura plausible es que en las casas el estrato resume atributos de localización y tamaño de lote que no están en el modelo, mientras que en los apartamentos ese contenido se reparte con el área y los parqueaderos.
Habitaciones cambia de signo. En las casas el coeficiente es positivo y no significativo; en los apartamentos es negativo (-12,2 millones) y significativo con errores clásicos, aunque marginal con HC3. La interpretación es la misma en ambos casos y por eso los resultados no se contradicen: a igual área, más habitaciones significan habitaciones más pequeñas. En un apartamento, donde el área es limitada, esa subdivisión resta valor; en una casa de 240 m² de mediana, la misma subdivisión es neutra.
Parqueaderos y baños valen más en apartamentos. Un parqueadero adicional se asocia con 51,1 millones en el sur frente a 27,6 en las casas del norte. En un conjunto residencial el parqueadero es un bien escaso y con precio de mercado propio; en una casa suele formar parte del lote.
Ajuste y supuestos. El modelo de apartamentos explica más varianza (R² 0,787 frente a 0,680), pero su RMSE relativo a la mediana es similar (38 % frente a 40 %): el mayor R² refleja sobre todo que en el sur los estratos separan más los precios, no que el error típico de una predicción individual sea menor en términos relativos. Ambos comparten los mismos incumplimientos (RESET, Breusch–Pagan y normalidad rechazadas; sin multicolinealidad) y en ambos la especificación logarítmica mejora la normalidad sin mejorar la predicción en millones. La diferencia práctica relevante es que la vivienda 1 se predice por interpolación y la vivienda 2 por extrapolación, lo que hace que la segunda cifra sea intrínsecamente menos precisa aunque provenga del modelo con mejor ajuste.
Al ejecutar el script o compilar este R Markdown se crea la carpeta
salidas_actividad2_puntos_1_a_7, que contiene:
base1 y
base2;Breusch, T. S., & Pagan, A. R. (1979). A simple test for heteroscedasticity and random coefficient variation. Econometrica, 47(5), 1287–1294.
Duan, N. (1983). Smearing estimate: A nonparametric retransformation method. Journal of the American Statistical Association, 78(383), 605–610.
Fox, J., & Weisberg, S. (2019). An R Companion to Applied Regression (3rd ed.). Sage.
Long, J. S., & Ervin, L. H. (2000). Using heteroscedasticity consistent standard errors in the linear regression model. The American Statistician, 54(3), 217–224.
MacKinnon, J. G., & White, H. (1985). Some heteroskedasticity-consistent covariance matrix estimators with improved finite sample properties. Journal of Econometrics, 29(3), 305–325.
Ramsey, J. B. (1969). Tests for specification errors in classical linear least-squares regression analysis. Journal of the Royal Statistical Society, Series B, 31(2), 350–371.
Rubin, D. B. (1987). Multiple Imputation for Nonresponse in Surveys. Wiley.
Sievert, C. (2020). Interactive Web-Based Data Visualization with R, Plotly, and Shiny. CRC Press.
Van Buuren, S., & Groothuis-Oudshoorn, K. (2011).
mice: Multivariate imputation by chained equations in R.
Journal of Statistical Software, 45(3), 1–67.
Van Buuren, S. (2018). Flexible Imputation of Missing Data (2nd ed.). Chapman & Hall/CRC.
Zeileis, A. (2004). Econometric computing with HC and HAC covariance matrix estimators. Journal of Statistical Software, 11(10), 1–17.