Resumen ejecutivo

Este informe responde a las dos solicitudes de vivienda planteadas a la inmobiliaria C&A a partir de la base vivienda del paquete paqueteMODELOS, que recoge 8.322 registros de oferta inmobiliaria de Santiago de Cali. Tras una auditoría de calidad y una depuración documentada, se conservan 8.262 registros válidos, de los cuales se derivan las dos bases de trabajo: base1 (Casas de la Zona Norte, 717 registros) y base2 (Apartamentos de la Zona Sur, 2.760 registros).

Sobre cada base se estimó el modelo de regresión lineal múltiple

\[\text{preciom} = \beta_0 + \beta_1\,\text{areaconst} + \beta_2\,\text{estrato} + \beta_3\,\text{habitaciones} + \beta_4\,\text{parqueaderos} + \beta_5\,\text{baños} + \varepsilon\]

Los resultados centrales, todos obtenidos de la ejecución real del código, son:

Síntesis de resultados de los dos casos.
Aspecto Vivienda 1 — Casa, Zona Norte Vivienda 2 — Apartamento, Zona Sur
Tamaño de muestra efectivo del modelo 430 2.349
R² / R² ajustado 0,6027 / 0,5980 0,7478 / 0,7473
RMSE (millones COP) 154,0 98,2
Predicción — escenario de estrato bajo Estrato 4: 307,9 Estrato 5: 676,8
Predicción — escenario de estrato alto Estrato 5: 386,7 Estrato 6: 737,1
Crédito preaprobado (millones COP) 350 850
Ofertas reales que cumplen los criterios 82 (de 717) 1374 (de 2760)
Veredicto E4: Viable con cautela | E5: No viable E5: Viable con cautela | E6: Viable con cautela

Lectura ejecutiva. Para la Vivienda 1, el modelo estima que una casa de 200 m² en la Zona Norte con 4 habitaciones, 2 baños y 1 parqueadero costaría alrededor de 307,9 millones en estrato 4 y 386,7 millones en estrato 5. El crédito de 350 millones alcanza en el escenario de estrato 4 pero no en el de estrato 5: el salto de estrato añade cerca de 79 millones, lo que basta para desbordar el presupuesto. Aun así, existen 82 casas reales en la Zona Norte de estratos 4–5 dentro del presupuesto, de las cuales se presentan las cinco mejor puntuadas.

Para la Vivienda 2, el modelo estima 676,8 millones en estrato 5 y 737,1 millones en estrato 6, ambos por debajo del crédito de 850 millones, aunque el intervalo de predicción del 95% roza o supera ese techo. El hallazgo más relevante para la gestión comercial es que un apartamento de 300 m² en la Zona Sur es un producto excepcional: solo 32 de los 2.760 registros alcanzan esa área (percentil 99,0), por lo que la estimación se apoya en muy pocas observaciones comparables.

1 Datos, depuración y metodología

1.1 Origen de los datos

Los datos provienen del objeto vivienda del paquete paqueteMODELOS (centromagis/paqueteMODELOS), que contiene registros de oferta inmobiliaria de Santiago de Cali con 13 variables. La variable objetivo preciom está expresada en millones de pesos colombianos (COP).

Dimensiones de la base original.
Elemento Valor
Observaciones (filas) 8.322
Variables (columnas) 13

1.2 Auditoría de calidad de datos

1.2.1 Tipos de dato, valores faltantes y cardinalidad

Tipos de dato, valores faltantes y valores únicos por variable en la base original.
Variable Clase Faltantes % Faltantes Valores únicos
id numeric 3 0,04 8.320
zona character 3 0,04 6
piso character 2.638 31,70 13
estrato numeric 3 0,04 5
preciom numeric 2 0,02 540
areaconst numeric 3 0,04 653
parqueaderos numeric 1.605 19,29 11
baños numeric 3 0,04 12
habitaciones numeric 3 0,04 12
tipo character 3 0,04 3
barrio character 3 0,04 437
longitud numeric 3 0,04 2.929
latitud numeric 3 0,04 3.680

El diagnóstico revela tres bloques de problemas. Primero, un puñado de filas prácticamente vacías (id, zona, tipo, coordenadas y atributos faltantes de forma simultánea), compatibles con errores de carga. Segundo, y mucho más relevante, parqueaderos concentra 1605 valores faltantes (19,3% de la base); como el mínimo observado en esa variable es 1 y nunca aparece un 0, es plausible —aunque no verificable— que el faltante codifique “sin parqueadero”. Tercero, piso presenta 2638 faltantes, coherente con el hecho de que las casas no tienen número de piso; esa variable no forma parte del modelo solicitado y no se usa.

1.2.2 Duplicados

Chequeos de duplicidad sobre la base original.
Chequeo Conteo
Filas idénticas (todas las columnas) 1
Filas idénticas ignorando `id` 58
Valores de `id` repetidos 2
Filas completamente vacías (todo NA) 2

Se detectan 58 filas idénticas cuando se ignora el identificador id. Se trata de la misma vivienda publicada con dos identificadores distintos: mantenerlas duplicaría el peso de esos inmuebles en la estimación, por lo que se conserva una sola ocurrencia de cada combinación de atributos.

1.2.3 Valores imposibles o incoherentes

Las reglas de coherencia se declararon antes de mirar los resultados del modelo, para evitar depurar en función del ajuste deseado.

Reglas de coherencia aplicadas y número de casos detectados en la base original.
Regla Casos
preciom <= 0 (precio nulo o negativo) 0
areaconst <= 0 (área nula o negativa) 0
estrato fuera de 1-6 0
baños = 0 (vivienda sin baño) 45
habitaciones = 0 (vivienda sin habitaciones) 66
parqueaderos < 0 0
longitud fuera de [-76,70 ; -76,30] 0
latitud fuera de [3,20 ; 3,60] 0
tipo no reconocido (distinto de Casa/Apartamento) 0
zona no reconocida 0

Se detectaron 45 registros con banios = 0 y 66 con habitaciones = 0. Una vivienda habitable no puede carecer de baño ni de habitaciones: se interpreta como dato no reportado, no como un cero real, y se marca como NA en lugar de imputarlo. Los precios, las áreas y las coordenadas resultaron todos dentro de rangos plausibles: ninguna observación cae fuera de la ventana geográfica de Cali definida en [-76,70 ; -76,30] de longitud y [3,20 ; 3,60] de latitud.

1.2.4 Normalización de texto

Las variables tipo y zona se procesaron sin asumir mayúsculas, minúsculas ni espacios: se recortan espacios iniciales, finales y repetidos, se unifica la caja a minúsculas, se eliminan diacríticos por transliteración a ASCII y se clasifica mediante expresiones regulares sobre la raíz de la palabra (^casa, ^apartamento|^apto|^apart; norte, sur, oeste, oriente, centro). Esto neutraliza variantes como " CASA ", "casa" o "Apto." sin depender de la forma exacta con la que fueron digitadas. El prefijo genérico "Zona " que traen todos los valores de zona se elimina antes de clasificar. Los nombres de barrio se normalizan a formato de título para su presentación en tablas y mapas.

1.2.5 Flujo de depuración

Trazabilidad del proceso de depuración: filas antes y después de cada regla.
Paso Filas restantes Eliminadas
Base original 8.322
(a) Eliminación de filas completamente vacías 8.320 2
(b-d) Normalización de texto y eliminación de filas sin `tipo` o `zona` válidos 8.319 1
(e) Eliminación de duplicados exactos (ignorando `id`) 8.262 57
(f) Eliminación de filas sin `preciom` o sin `areaconst` 8.262 0

El proceso conserva 8.262 de las 8.322 filas originales (99,28%). La pérdida es marginal porque las reglas eliminan filas solo cuando el registro es inutilizable (vacío, duplicado o sin tipo/zona/preciom/areaconst); los valores imposibles puntuales se convierten en NA y la fila se conserva para el análisis descriptivo.

1.3 Construcción de las bases de trabajo

Tamaño de las bases filtradas y su peso relativo.
Base Descripción n filtrado % de la base depurada % de la base original n casos completos (modelo)
base1 Casas - Zona Norte 717 8,68 8,62 430
base2 Apartamentos - Zona Sur 2.760 33,41 33,17 2.349
Tabla de frecuencias de `tipo` y `zona` en cada base filtrada: verificación de que el filtro es correcto.
Base Tipo Zona Freq
base1 Casa Norte 717
base2 Apartamento Sur 2.760

Las tablas de frecuencia confirman el filtro: en base1 el 100% de los 717 registros son Casa de la Zona Norte, y en base2 el 100% de los 2.760 registros son Apartamento de la Zona Sur. No hay categorías residuales.

1.3.1 Aclaración metodológica sobre la variable zona

Después de filtrar, zona es constante dentro de cada base: toma un único valor (Norte en base1, Sur en base2). Una variable sin variabilidad tiene varianza cero y, por construcción, no puede incluirse como predictor en la regresión —la matriz de diseño sería singular y el coeficiente no estaría identificado— ni admite el cálculo de una correlación de Pearson, cuyo denominador es el producto de las desviaciones estándar y se anularía. Lo mismo ocurre con tipo. Por eso ambas variables quedan fuera de la matriz de correlaciones y del modelo: su efecto ya está absorbido en la definición misma de cada submuestra, y por eso se estiman dos modelos separados en lugar de uno solo con indicadoras de zona y tipo.

1.3.2 Valores faltantes dentro de las bases filtradas

Valores faltantes en las variables del modelo, dentro de cada base filtrada.
Base Variable Faltantes % faltante
base1 (Casas Norte) preciom 0 0,00
base1 (Casas Norte) areaconst 0 0,00
base1 (Casas Norte) estrato 0 0,00
base1 (Casas Norte) habitaciones 19 2,65
base1 (Casas Norte) parqueaderos 283 39,47
base1 (Casas Norte) baños 10 1,39
base2 (Aptos Sur) preciom 0 0,00
base2 (Aptos Sur) areaconst 0 0,00
base2 (Aptos Sur) estrato 0 0,00
base2 (Aptos Sur) habitaciones 8 0,29
base2 (Aptos Sur) parqueaderos 405 14,67
base2 (Aptos Sur) baños 6 0,22

Este es el principal condicionante del estudio. En base1, parqueaderos falta en 283 de los 717 registros (39,5%). Como lm() aplica eliminación por lista, el modelo 1 se estima con 430 observaciones en lugar de 717. En base2 el efecto es menor: 2.349 de 2.760. En el Anexo D se presenta un análisis de sensibilidad que reinterpreta el faltante como cero para medir cuánto dependen las conclusiones de ese supuesto; el modelo principal no imputa nada.

1.4 Metodología

  1. Depuración declarativa: reglas de coherencia fijadas a priori, sin imputación.
  2. Análisis exploratorio: estadísticos descriptivos, correlaciones de Pearson y gráficos de dispersión y distribución para cada base.
  3. Modelo: regresión lineal múltiple por mínimos cuadrados ordinarios (MCO) con la especificación obligatoria del enunciado, idéntica en ambos casos.
  4. Inferencia: errores estándar, estadísticos \(t\), valores \(p\) e intervalos de confianza del 95% para cada coeficiente; \(R^2\), \(R^2\) ajustado, RMSE, MAE y VIF.
  5. Predicción: estimación puntual e intervalo de predicción al 95% para cada escenario de estrato, contrastado con el crédito preaprobado.
  6. Validación: diagnóstico completo de los supuestos del modelo lineal, sin modificar ni eliminar datos para “corregir” los problemas detectados.
  7. Selección de ofertas: filtrado por criterios duros y ordenamiento por una puntuación multicriterio documentada, con cartografía de apoyo.

2 Caso 1 — Casa en Zona Norte

Solicitud. Casa, Zona Norte, 200 m² construidos, 1 parqueadero, 2 baños, 4 habitaciones, estrato 4 o 5, crédito preaprobado máximo de 350 millones de COP.

2.1 Filtro y verificación

Primeros tres registros de base1 (Casas — Zona Norte).
fila_original id barrio tipo_norm zona_norm estrato preciom areaconst parqueaderos baños habitaciones
9 1209 Acopi Casa Norte 5 320 150 2 4 6
10 1592 Acopi Casa Norte 5 780 380 2 3 3
11 4057 Acopi Casa Norte 6 750 445 7 6

base1 contiene 717 casas de la Zona Norte, equivalentes al 8,68% de la base depurada y al 8,62% de la base original. La verificación del filtro se presentó en la tabla de frecuencias de la sección anterior. Recuérdese la aclaración metodológica sobre la variable zona: dentro de base1, zona y tipo son constantes y quedan fuera del análisis de correlación y del modelo.

2.2 Análisis exploratorio

Estadísticos descriptivos de base1 (Casas — Zona Norte).
Variable n Faltantes Media Mediana Desv. est. Mínimo Máximo
Precio (millones COP) 717 0 445,71 390 269,14 89 1.940
Área construida (m²) 717 0 264,61 240 167,64 30 1.440
Estrato 717 0 4,20 4 0,98 3 6
Parqueaderos 434 283 2,18 2 1,40 1 10
Baños 707 10 3,60 3 1,48 1 10
Habitaciones 698 19 4,63 4 1,68 1 10

El precio de las casas del norte tiene media 445,7 y mediana 390,0 millones: la media supera a la mediana en 55,7 millones, señal de una distribución asimétrica a la derecha con una cola de inmuebles de precio muy alto (máximo 1.940 millones). El área construida repite el patrón (media 264,6 m², mediana 240 m², máximo 1.440 m²). Esta asimetría anticipa dos de los problemas que confirmará el diagnóstico: residuos no normales y varianza creciente con el precio.

Matriz de correlación de Pearson entre variables numéricas de base1.
Variable Precio (millones COP) Área construida (m²) Estrato Parqueaderos Baños Habitaciones
Precio (millones COP) 1,000 0,732 0,612 0,414 0,569 0,380
Área construida (m²) 0,732 1,000 0,459 0,312 0,516 0,456
Estrato 0,612 0,459 1,000 0,260 0,427 0,097
Parqueaderos 0,414 0,312 0,260 1,000 0,403 0,241
Baños 0,569 0,516 0,427 0,403 1,000 0,606
Habitaciones 0,380 0,456 0,097 0,241 0,606 1,000

Las correlaciones con el precio son todas positivas y de magnitud moderada a alta. La más fuerte es la del área construida (r = 0,732), seguida del estrato (r = 0,612) y del número de baños (r = 0,569). parqueaderos (r = 0,414) y habitaciones (r = 0,380) muestran asociaciones más débiles. Entre predictores destaca la correlación entre baños y habitaciones (r = 0,606), esperable porque ambas escalan con el tamaño de la vivienda; habrá que vigilarla vía VIF.

Advertencia interpretativa. Estas correlaciones son medidas de asociación lineal, no de causalidad. Que el estrato correlacione con el precio no significa que subir de estrato “cause” el aumento: el estrato es un indicador administrativo que resume ubicación, dotación urbana y calidad constructiva del sector, todos ellos determinantes reales del precio que aquí no se observan directamente.

Precio frente al área construida — Casas Zona Norte.

La relación precio–área es claramente positiva, pero la nube se abre en abanico: para áreas pequeñas los precios se concentran en un rango estrecho, mientras que por encima de los 400 m² la dispersión es enorme. Es el patrón típico de heterocedasticidad, y sugiere además que la relación podría ser no lineal (por ejemplo, log-log) más que estrictamente proporcional.

Precio por estrato — Casas Zona Norte.

Precio por número de baños — Casas Zona Norte.

Precio por número de habitaciones — Casas Zona Norte.

Precio por número de parqueaderos — Casas Zona Norte.

El precio mediano crece de forma monótona con el estrato y con el número de baños. Con las habitaciones el escalonamiento es mucho más débil e irregular —hay casas de muchas habitaciones y precio bajo, típicamente viviendas antiguas subdivididas—, lo que explica la correlación modesta observada. En parqueaderos, las categorías altas descansan sobre muy pocas observaciones y sus cajas son poco confiables.

Distribución del precio — Casas Zona Norte.

La distribución del precio es unimodal y fuertemente sesgada a la derecha, con la media desplazada por encima de la mediana y observaciones extremas que superan los 1.500 millones. Modelar el nivel del precio (y no su logaritmo) es lo que exige el enunciado, pero conviene tener presente que esta asimetría es la fuente de las violaciones de supuestos que se documentan más adelante.

2.3 Modelo de regresión lineal múltiple

2.3.1 Ecuación estimada

El modelo se estima sobre las 430 observaciones completas de base1:

\[\widehat{\text{preciom}} = -235.38 + 0.659\,\text{areaconst} + 78.771\,\text{estrato} + 6.785\,\text{habitaciones} + 24.645\,\text{parqueaderos} + 22.286\,\text{baños}\]

2.3.2 Tabla de coeficientes

Coeficientes del Modelo 1 (Casas — Zona Norte): estimación, error estándar, estadístico t, valor p e intervalo de confianza del 95%. Códigos: *** p<0,001; ** p<0,01; * p<0,05.
Término Estimación Error estándar t p-valor IC 95% inf IC 95% sup Signif
(Intercept) -235,382 45,424 -5,182 < 0,001 -324,667 -146,098 ***
areaconst 0,659 0,054 12,263 < 0,001 0,554 0,765 ***
estrato 78,771 9,973 7,898 < 0,001 59,167 98,374 ***
habitaciones 6,785 5,941 1,142 0,2540 -4,892 18,462
parqueaderos 24,645 5,928 4,158 < 0,001 12,994 36,297 ***
baños 22,286 7,836 2,844 0,0047 6,883 37,689 **

2.3.3 Interpretación de los coeficientes

Todas las lecturas siguientes son en millones de pesos colombianos y manteniendo constantes las demás variables del modelo:

  • Intercepto (-235,38). Corresponde a una vivienda con todas las variables en cero, un perfil inexistente en el mercado. Carece de interpretación sustantiva y funciona solo como anclaje de la recta; su signo negativo no debe leerse como un “precio negativo”.
  • areaconst (0,659). Cada metro cuadrado adicional de área construida se asocia con un incremento de 0,659 millones —cerca de 659 mil pesos por m²—. Es el efecto mejor determinado del modelo (t = 12,26), con IC 95% de [0,554; 0,765].
  • estrato (78,771). Subir un estrato se asocia con 78,8 millones más, con IC 95% de [59,2; 98,4]. Es el efecto de mayor magnitud absoluta y resulta decisivo para el caso: el salto de estrato 4 a 5 explica por sí solo que el presupuesto de 350 millones deje de alcanzar.
  • parqueaderos (24,645). Cada parqueadero adicional se asocia con 24,6 millones más (p < 0,001).
  • banios (22,286). Cada baño adicional se asocia con 22,3 millones más (p 0,0047).
  • habitaciones (6,785). El coeficiente es positivo pero pequeño y su intervalo de confianza [-4,9; 18,5] incluye el cero (p = 0,254).

Sobre habitaciones. Que su valor \(p\) supere 0,05 no permite afirmar que el número de habitaciones no influya en el precio. La conclusión correcta es que, con estos datos, esta muestra y este modelo, no hay evidencia estadística suficiente para distinguir su efecto de cero una vez controlados el área, el estrato, los baños y los parqueaderos. Lo más probable es que su información ya esté contenida en el área construida y en el número de baños, con los que correlaciona (r = 0,456 y r = 0,606 respectivamente).

2.3.4 Coherencia de los signos con el mercado inmobiliario

Los cinco coeficientes de pendiente son positivos, lo que es económicamente coherente: más área, mejor estrato, más baños, más habitaciones y más parqueaderos deberían encarecer una vivienda, nunca abaratarla. Ningún signo contradice la lógica del mercado, lo que da respaldo cualitativo a la especificación.

2.3.5 Bondad de ajuste

Métricas de ajuste del Modelo 1.
Modelo n Predictores R² ajustado Error residual (sigma) RMSE MAE F p-valor (F)
Modelo 1 - Casas Zona Norte 430 5 0,6027 0,598 155,098 154,012 99,202 128,66 < 0,001
  • \(R^2\) = 0,6027: el modelo explica el 60,3% de la varianza del precio de las casas del norte. El 39,7% restante corresponde a factores no observados.
  • \(R^2\) ajustado = 0,5980: penaliza por el número de predictores; su cercanía al \(R^2\) (diferencia de solo 0,0047) indica que los cinco predictores aportan información real y que no hay sobreajuste por variables superfluas. Es la métrica adecuada para comparar modelos con distinto número de variables.
  • RMSE = 154,0 millones y MAE = 99,2 millones. El error típico equivale al 32,1% del precio medio de la muestra: la precisión para una vivienda individual es limitada. Que el RMSE casi duplique al MAE confirma que unos pocos inmuebles con errores muy grandes dominan el error cuadrático.
  • El estadístico F = 128,66 (p < 0,001) rechaza la hipótesis de que los cinco coeficientes sean conjuntamente nulos.

2.3.6 Multicolinealidad

Factores de inflación de la varianza (VIF) — Modelo 1.
Variable VIF Tolerancia (1/VIF) Lectura
areaconst 1,497 0,668 Sin problema (VIF < 5)
estrato 1,333 0,750 Sin problema (VIF < 5)
habitaciones 1,749 0,572 Sin problema (VIF < 5)
parqueaderos 1,233 0,811 Sin problema (VIF < 5)
baños 2,053 0,487 Sin problema (VIF < 5)

Todos los VIF están por debajo de 2,05, muy lejos del umbral de alerta de 5 y del umbral crítico de 10. No hay multicolinealidad problemática: los errores estándar no están inflados por redundancia entre predictores, y los coeficientes son interpretables por separado.

2.3.7 Limitaciones del modelo

  • Variables omitidas. El modelo no incorpora antigüedad de la construcción, estado y calidad de acabados, seguridad del sector, cercanía a vías principales, colegios o comercio, ni la existencia de administración o zonas comunes. Todas ellas influyen en el precio y su ausencia infla el término de error y puede sesgar los coeficientes incluidos si están correlacionadas con ellos.
  • barrio no se utiliza. base1 abarca 99 barrios distintos con niveles de precio muy diferentes. Incluirlos exigiría un modelo con efectos de barrio, lo cual excede la especificación pedida, pero explica buena parte de la varianza no capturada.
  • Ubicación exacta. Las coordenadas son referencias aproximadas de barrio o sector, no la dirección del inmueble, de modo que no permiten medir con precisión efectos de microlocalización.
  • Calidad de los datos. Son precios de oferta publicados, no de transacción cerrada; suelen situarse por encima del precio efectivamente pagado. Además, no hay fecha de publicación, por lo que no puede controlarse la evolución temporal del mercado.
  • Tamaño de muestra. El modelo se estima con 430 observaciones tras la eliminación por lista de los 287 registros con datos incompletos —principalmente parqueaderos—. Si esos faltantes no son aleatorios, la muestra efectiva puede no ser representativa del conjunto de casas del norte.
  • Rango de validez. Las conclusiones aplican al rango observado (30–1.440 m², estratos 3–6). Fuera de él el modelo extrapola.

2.4 Validación de supuestos

Pruebas formales de los supuestos — Modelo 1 (Casas Zona Norte).
Supuesto Prueba Estadístico Grados de libertad p-valor Conclusión
Normalidad de residuos Shapiro-Wilk 0,8507 < 0,001 Se rechaza normalidad
Homocedasticidad Breusch-Pagan (studentized) 77,6666 5 < 0,001 Se rechaza homocedasticidad
Homocedasticidad Score test de varianza no constante 340,4629 1 < 0,001 Se rechaza varianza constante
Independencia (orden de registro) Durbin-Watson 1,7465 0,0036 Autocorrelación detectada en el orden del archivo

2.4.1 Linealidad

Residuos frente a valores ajustados — Modelo 1.

Residuos frente a valores ajustados — Modelo 1.

La curva suavizada no se mantiene plana sobre el cero: los residuos son sistemáticamente positivos en los extremos y negativos en la zona central de los valores ajustados. Esto indica una desviación de la linealidad: la relación entre los atributos y el precio no es estrictamente aditiva y lineal en el nivel del precio, sino que se acelera en el segmento alto del mercado.

2.4.2 Normalidad de los residuos

Histograma de residuos estandarizados — Modelo 1.

Histograma de residuos estandarizados — Modelo 1.

Gráfico Q-Q normal de los residuos — Modelo 1.

Gráfico Q-Q normal de los residuos — Modelo 1.

El histograma muestra un pico central más agudo que la normal y colas más pesadas; el gráfico Q-Q se separa claramente de la recta en ambos extremos, sobre todo en el superior. La prueba de Shapiro-Wilk entrega W = 0,8507 con p < 0,001, de modo que se rechaza la normalidad de los residuos. Con 430 observaciones, el teorema central del límite protege razonablemente la inferencia sobre los coeficientes, pero los intervalos de predicción individuales sí dependen del supuesto de normalidad y deben leerse con cautela.

2.4.3 Homocedasticidad

Gráfico escala-localización — Modelo 1.

Gráfico escala-localización — Modelo 1.

La curva asciende con el valor ajustado: la dispersión de los residuos crece con el precio estimado. La prueba de Breusch-Pagan studentizada arroja BP = 77,67 con 5 grados de libertad y p < 0,001; el score test de varianza no constante lo confirma (p < 0,001). Se rechaza la homocedasticidad. La consecuencia práctica: los errores estándar MCO están sesgados y los intervalos son demasiado estrechos para viviendas caras y demasiado anchos para las baratas.

2.4.4 Independencia

El estadístico de Durbin-Watson es 1,7465 (p 0,0036).

Interpretación limitada. Durbin-Watson fue diseñado para series temporales y prueba autocorrelación entre observaciones consecutivas en el orden del archivo. Estos son datos transversales: no existe un orden temporal natural y el resultado depende de cómo estén ordenadas las filas. Dado que la base viene agrupada por barrio, un DW inferior a 2 refleja sobre todo que viviendas del mismo barrio tienen residuos parecidos —autocorrelación espacial— y no autocorrelación serial. La lectura correcta es que existe dependencia espacial no modelada, lo que refuerza la recomendación de incorporar efectos de barrio o modelos espaciales.

2.4.5 Observaciones influyentes

Detección de observaciones atípicas e influyentes — Modelo 1.
Criterio Umbral Casos % del n
Leverage alto (h > 2p/n) 0,0279 40 9,30
Distancia de Cook > 4/n 0,0093 24 5,58
Distancia de Cook > 1 1,0000 1 0,23
Residuo estudentizado |t| > 3 3,0000 11 2,56
Distancia de Cook por observación — Modelo 1.

Distancia de Cook por observación — Modelo 1.

Leverage frente a residuo estudentizado — Modelo 1.

Leverage frente a residuo estudentizado — Modelo 1.

Se identifican 1 observación con distancia de Cook superior a 1 —el umbral clásico de influencia severa—, 24 que superan el criterio más exigente de \(4/n\) y 11 con residuo estudentizado en valor absoluto mayor que 3. No se eliminó ninguna observación. Son inmuebles reales del mercado; excluirlos para mejorar el ajuste equivaldría a describir un mercado que no existe. Se documentan para que la inmobiliaria sepa que unas pocas propiedades excepcionales tienen un peso desproporcionado en las estimaciones.

2.4.6 Multicolinealidad

Ya verificada: todos los VIF < 3 (tabla de la sección de modelo). Este supuesto se cumple.

2.4.7 Síntesis del diagnóstico y acciones recomendadas

Supuesto Resultado Implicación
Linealidad Desviación apreciable El nivel del precio no es lineal en los atributos
Normalidad Rechazada Intervalos de predicción individuales poco confiables
Homocedasticidad Rechazada Errores estándar MCO sesgados
Independencia Dependencia espacial Efectos de barrio no modelados
Multicolinealidad Sin problema Coeficientes interpretables por separado

Acciones recomendadas para trabajo futuro, sin alterar los datos actuales: (i) incorporar variables omitidas —antigüedad, acabados, estado, seguridad, efectos de barrio—; (ii) transformar la variable respuesta, típicamente \(\log(\text{preciom})\), que suele corregir simultáneamente la asimetría y la heterocedasticidad; (iii) modelar relaciones no lineales mediante términos cuadráticos, splines o especificación log-log; (iv) emplear errores estándar robustos (HC3) o regresión robusta (M-estimadores) para inferencia válida bajo heterocedasticidad; (v) revisar caso por caso las observaciones influyentes identificadas para confirmar que no son errores de digitación; y (vi) ampliar la recolección de datos, con especial prioridad en completar parqueaderos.

2.5 Estimación puntual e interpretación

Predicciones del Modelo 1 para la Vivienda 1, por escenario de estrato (millones de COP).
Escenario Estrato Predicción puntual IP 95% inferior IP 95% superior IC 95% media inf IC 95% media sup Crédito (COP mm) Holgura vs crédito Recomendación Área dentro del rango observado
Estrato 4 4 307,9 2,0 613,8 282,5 333,3 350 42,1 Viable con cautela Si
Estrato 5 5 386,7 80,1 693,3 353,9 419,5 350 -36,7 No viable Si
Contexto de mercado del perfil solicitado dentro de base1.
Indicador Valor
Área solicitada (m²) 200
Percentil que ocupa el área solicitada en la base 41,3 %
Viviendas con área >= la solicitada 435 de 717 (60,7 %)
Área mediana de la base (m²) 240
Área máxima observada (m²) 1.440
Precio mediano observado (millones COP) 390
Viviendas dentro del crédito preaprobado 313 de 717
Viviendas dentro del crédito y en el estrato solicitado 112

2.5.1 Escenario A — Estrato 4

El modelo estima un precio de 307,9 millones de COP, con intervalo de predicción del 95% entre 2,0 y 613,8 millones. Frente al crédito de 350 millones, la estimación puntual deja una holgura de 42,1 millones, pero el límite superior del intervalo lo supera ampliamente.

Recomendación: Viable con cautela. El presupuesto alcanza para la vivienda “promedio” con esas características, pero no garantiza que cualquier casa concreta que cumpla el perfil quepa en el crédito.

2.5.2 Escenario B — Estrato 5

El modelo estima 386,7 millones de COP (IP 95%: 80,1 a 693,3). La estimación puntual excede el crédito en 36,7 millones.

Recomendación: No viable. El mismo inmueble en estrato 5 cuesta, según el modelo, unos 78,8 millones más, y ese diferencial es justamente lo que rompe el presupuesto.

2.5.3 Qué significa el intervalo de predicción

El intervalo de predicción al 95% cuantifica la incertidumbre sobre el precio de una vivienda individual con esas características. Es sustancialmente más ancho que el intervalo de confianza de la media —que en el escenario A va de 282,5 a 333,3 millones— porque suma dos fuentes de error: la incertidumbre en la estimación de los coeficientes y la variabilidad intrínseca entre viviendas que comparten los mismos atributos observados pero difieren en acabados, estado, orientación o microlocalización. En términos prácticos: el modelo predice el valor esperado del mercado para ese perfil, no el precio de una casa concreta. Dada la violación del supuesto de normalidad documentada arriba, la cobertura real de estos intervalos puede diferir del 95% nominal y deben tomarse como una guía de orden de magnitud, no como una garantía.

2.6 Cinco ofertas recomendadas

2.6.1 Criterios y puntuación

De las 717 casas de la Zona Norte, 112 cumplen los criterios duros (estrato 4 o 5 y precio \(\le\) 350 millones). De ellas, 30 se descartan por tener incompleta alguna característica necesaria para evaluarlas o ubicarlas, quedando 82 ofertas puntuables.

El ordenamiento no se basa solo en el precio. Se emplea una puntuación de recomendación en escala 0–100 construida como promedio ponderado de cinco subíndices, cada uno en \([0,1]\) donde 1 es el ajuste perfecto al requerimiento:

\[s_{\text{área}} = \max\!\left(0,\, 1 - \frac{|A_i - A_0|}{A_0}\right); \quad s_{k} = \max\!\left(0,\, 1 - \frac{|k_i - k_0|}{2}\right)\ \text{para baños, habitaciones y parqueaderos}\]

\[s_{\text{precio}} = \frac{\text{Crédito} - P_i}{\text{Crédito}}; \qquad \text{Puntuación} = 100 \times \big(0{,}35\,s_{\text{área}} + 0{,}15\,s_{\text{baños}} + 0{,}15\,s_{\text{hab}} + 0{,}15\,s_{\text{parq}} + 0{,}20\,s_{\text{precio}}\big)\]

El área recibe el mayor peso (0,35) por ser el atributo con la asociación más fuerte con el precio y el más difícil de modificar tras la compra. Los atributos discretos usan una tolerancia de 2 unidades. El subíndice de precio premia la holgura presupuestal: a igualdad de características, gana la oferta más barata. Los empates se resuelven por menor precio.

2.6.2 Tabla de ofertas — Vivienda 1

Cinco ofertas recomendadas para la Vivienda 1 (Casa, Zona Norte). Diferencias: A = área en m², B = baños, H = habitaciones, P = parqueaderos.
# Fila original ID Barrio Precio (mm) Área (m²) Estrato Parq. Baños Hab. Latitud Longitud Diferencia vs requerimiento Puntuación
1 8172 94 Zona Norte 265 162 4 1 3 4 3,46786 -76,48238 A -38 m2 | B +1 | H +0 | P +0 70,71
2 295 1666 Alamos 275 120 4 1 2 4 3,47500 -76,51700 A -80 m2 | B +0 | H +0 | P +0 70,29
3 4021 1163 La Merced 350 216 5 2 2 4 3,48181 -76,51218 A +16 m2 | B +0 | H +0 | P +1 69,70
4 4018 1055 La Merced 280 147 4 1 3 4 3,48699 -76,50880 A -53 m2 | B +1 | H +0 | P +0 67,22
5 3493 1376 La Flora 320 160 5 1 3 4 3,48876 -76,51568 A -40 m2 | B +1 | H +0 | P +0 67,21

Ninguna de las cinco alcanza los 200 m² solicitados salvo la oferta #3 (216 m²), que además es la única que iguala o supera el área pedida dentro del presupuesto en estrato 5. Las opciones #1 y #2 destacan por su holgura presupuestal: cuestan 265 y 275 millones, dejando margen para adecuaciones. Todas cumplen exactamente las 4 habitaciones requeridas.

2.6.3 Mapa de ofertas — Vivienda 1

Ofertas recomendadas para la Vivienda 1: casas en la Zona Norte de Cali.

Tabla complementaria del mapa: identificación de los marcadores numerados de la Vivienda 1.
# Barrio Precio (mm) Área (m²) Estrato Latitud Longitud
1 Zona Norte 265 162 4 3,46786 -76,48238
2 Alamos 275 120 4 3,47500 -76,51700
3 La Merced 350 216 5 3,48181 -76,51218
4 La Merced 280 147 4 3,48699 -76,50880
5 La Flora 320 160 5 3,48876 -76,51568

Nota metodológica del mapa. Fuente de los datos: base vivienda del paqueteMODELOS. Cartografía base: OpenStreetMap (© contribuidores de OSM, licencia ODbL). Limitación de las coordenadas: los pares latitud–longitud del registro corresponden a una referencia aproximada del barrio o sector, no a la dirección exacta del inmueble. Varias ofertas del mismo barrio pueden compartir prácticamente el mismo punto. El mapa debe usarse como guía de localización y verificarse en campo antes de cualquier decisión de compra.

2.7 Recomendación ejecutiva — Vivienda 1

  1. El presupuesto es realista en estrato 4, no en estrato 5. La estimación para estrato 4 (307,9 millones) cabe en el crédito de 350 millones; la de estrato 5 (386,7 millones) no. Se recomienda concentrar la búsqueda en estrato 4.
  2. Hay oferta suficiente. 82 casas reales cumplen los criterios; el cliente no está ante un producto escaso.
  3. Habrá que ceder en área. El perfil de 200 m² dentro del presupuesto es poco frecuente: la mediana de las opciones recomendadas es 160 m². La alternativa es aceptar un área menor o ampliar el crédito.
  4. Prioridad de visita: ofertas #1, #2 y #3 de la tabla, en ese orden.
  5. Advertencia obligada al cliente. La incertidumbre individual es alta (RMSE 154 millones) y los supuestos de normalidad y homocedasticidad no se cumplen: la cifra del modelo es una referencia de negociación, no un avalúo. Toda decisión debe respaldarse con avalúo profesional.

3 Caso 2 — Apartamento en Zona Sur

Solicitud. Apartamento, Zona Sur, 300 m² construidos, 3 parqueaderos, 3 baños, 5 habitaciones, estrato 5 o 6, crédito preaprobado máximo de 850 millones de COP.

3.1 Filtro y verificación

Primeros tres registros de base2 (Apartamentos — Zona Sur).
fila_original id barrio tipo_norm zona_norm estrato preciom areaconst parqueaderos baños habitaciones
24 5098 Acopi Apartamento Sur 4 290 96 1 2 3
164 698 Aguablanca Apartamento Sur 3 78 40 1 1 2
264 8199 Aguacatal Apartamento Sur 6 875 194 2 5 3

base2 contiene 2.760 apartamentos de la Zona Sur, equivalentes al 33,41% de la base depurada y al 33,17% de la base original. Es la submuestra más grande de todo el conjunto de datos: la Zona Sur concentra la mayor parte de la oferta de apartamentos de la ciudad. Igual que en el Caso 1, zona y tipo son constantes dentro de base2 y quedan excluidas del análisis de correlación y del modelo (véase la aclaración metodológica sobre la variable zona).

3.2 Análisis exploratorio

Estadísticos descriptivos de base2 (Apartamentos — Zona Sur).
Variable n Faltantes Media Mediana Desv. est. Mínimo Máximo
Precio (millones COP) 2.760 0 297,74 245 192,20 75 1.750
Área construida (m²) 2.760 0 97,57 85 52,74 40 932
Estrato 2.760 0 4,63 5 0,84 3 6
Parqueaderos 2.355 405 1,42 1 0,67 1 10
Baños 2.754 6 2,49 2 0,93 1 8
Habitaciones 2.752 8 2,97 3 0,61 1 6

El contraste con el Caso 1 es marcado. El precio mediano de los apartamentos del sur (245 millones) es sensiblemente inferior al de las casas del norte (390 millones), y el área mediana es casi tres veces menor (85 m² frente a 240 m²). La asimetría a la derecha vuelve a estar presente y es incluso más pronunciada: la media del área (97,6 m²) supera a la mediana en 12,6 m², arrastrada por un puñado de penthouses de hasta 932 m².

Este dato es crítico para la solicitud: los 300 m² pedidos están en el percentil 99,0 de la distribución. Solo 32 apartamentos de los 2.760 alcanzan esa superficie.

Matriz de correlación de Pearson entre variables numéricas de base2.
Variable Precio (millones COP) Área construida (m²) Estrato Parqueaderos Baños Habitaciones
Precio (millones COP) 1,000 0,758 0,672 0,693 0,734 0,346
Área construida (m²) 0,758 1,000 0,481 0,578 0,687 0,453
Estrato 0,672 0,481 1,000 0,485 0,573 0,212
Parqueaderos 0,693 0,578 0,485 1,000 0,594 0,280
Baños 0,734 0,687 0,573 0,594 1,000 0,523
Habitaciones 0,346 0,453 0,212 0,280 0,523 1,000

El patrón de correlaciones difiere del Caso 1 en un punto revelador. El área sigue siendo la variable más asociada al precio (r = 0,758), pero aquí los baños (r = 0,734) y los parqueaderos (r = 0,693) alcanzan asociaciones mucho más altas que en las casas del norte (0,569 y 0,414). En propiedad horizontal, el parqueadero es un bien escaso que se transa junto al inmueble, y el número de baños diferencia con nitidez los segmentos de mercado. Las habitaciones, en cambio, mantienen la correlación más baja (r = 0,346): en apartamentos, muchas habitaciones pequeñas no equivalen a un inmueble caro. La correlación entre predictores es en general más alta que en el Caso 1, lo que hace obligatorio revisar el VIF.

Precio frente al área construida — Apartamentos Zona Sur.

Precio por estrato — Apartamentos Zona Sur.

Precio por número de baños — Apartamentos Zona Sur.

Precio por número de habitaciones — Apartamentos Zona Sur.

Precio por número de parqueaderos — Apartamentos Zona Sur.

Distribución del precio — Apartamentos Zona Sur.

La nube precio–área es más compacta que en las casas —los apartamentos son un producto más estandarizado— pero se abre igualmente en el extremo superior, donde unas pocas observaciones de gran superficie determinan la pendiente. El precio mediano crece de forma clara y monótona con el estrato, con los baños y con los parqueaderos. Con las habitaciones el escalonamiento es plano e incluso decreciente en las categorías altas: un apartamento de 5 o 6 habitaciones suele ser una unidad antigua y económica, no una de lujo. Este hecho descriptivo anticipa el signo negativo que tomará el coeficiente de habitaciones en el modelo. La distribución del precio es fuertemente asimétrica a la derecha, con la mayoría de la oferta concentrada por debajo de los 500 millones.

3.3 Modelo de regresión lineal múltiple

3.3.1 Ecuación estimada

Estimado sobre las 2.349 observaciones completas de base2:

\[\widehat{\text{preciom}} = -256.32 + 1.290\,\text{areaconst} + 60.249\,\text{estrato} - 26.671\,\text{habitaciones} + 75.820\,\text{parqueaderos} + 50.255\,\text{baños}\]

3.3.2 Tabla de coeficientes

Coeficientes del Modelo 2 (Apartamentos — Zona Sur): estimación, error estándar, estadístico t, valor p e intervalo de confianza del 95%.
Término Estimación Error estándar t p-valor IC 95% inf IC 95% sup Signif
(Intercept) -256,323 16,120 -15,900 < 0,001 -287,935 -224,711 ***
areaconst 1,290 0,054 23,701 < 0,001 1,183 1,397 ***
estrato 60,249 3,120 19,308 < 0,001 54,130 66,369 ***
habitaciones -26,671 4,075 -6,546 < 0,001 -34,661 -18,681 ***
parqueaderos 75,820 4,218 17,977 < 0,001 67,549 84,091 ***
baños 50,255 3,495 14,380 < 0,001 43,402 57,108 ***

3.3.3 Interpretación de los coeficientes

En millones de COP, manteniendo constantes las demás variables:

  • Intercepto (-256,32). Sin interpretación sustantiva, igual que en el Caso 1.
  • areaconst (1,290). Cada m² adicional se asocia con 1,290 millones. El metro cuadrado del apartamento del sur vale casi el doble que el de la casa del norte (0,659), diferencia coherente con el mayor valor del suelo y de la construcción en propiedad horizontal del sur de Cali.
  • estrato (60,249). Un estrato adicional se asocia con 60,2 millones más [IC 95%: 54,1; 66,4].
  • parqueaderos (75,820). Cada parqueadero adicional se asocia con 75,8 millones más: el triple del efecto estimado en las casas del norte (24,6). Confirma que en propiedad horizontal el parqueadero es un activo escaso y valioso.
  • banios (50,255). Cada baño adicional se asocia con 50,3 millones más, más del doble que en el Caso 1.
  • habitaciones (-26,671). Coeficiente negativo y estadísticamente significativo (p < 0,001): a igualdad de área, estrato, baños y parqueaderos, cada habitación adicional se asocia con 26,7 millones menos.

Sobre el signo negativo de habitaciones. No significa que añadir un cuarto destruya valor. El coeficiente es condicional al área: comparar dos apartamentos de la misma superficie, uno con 3 y otro con 4 habitaciones, es comparar espacios amplios frente a espacios subdivididos. El mercado premia la amplitud por habitación, no el conteo. Es un resultado bien documentado en la literatura de precios hedónicos y no un error de especificación; se corresponde además con lo que muestran los diagramas de caja del análisis exploratorio.

3.3.4 Coherencia de los signos con el mercado inmobiliario

Cuatro de los cinco coeficientes son positivos y coherentes. El único negativo, habitaciones, tiene la lectura condicional recién explicada y es igualmente coherente con el funcionamiento del mercado de propiedad horizontal. No hay signos anómalos.

3.3.5 Bondad de ajuste

Métricas de ajuste del Modelo 2.
Modelo n Predictores R² ajustado Error residual (sigma) RMSE MAE F p-valor (F)
Modelo 2 - Apartamentos Zona Sur 2.349 5 0,7478 0,7473 98,349 98,224 60,013 1.389,72 < 0,001
  • \(R^2\) = 0,7478 y \(R^2\) ajustado = 0,7473: el modelo explica el 74,8% de la varianza del precio, 14,5 puntos porcentuales más que el Modelo 1. La mayor homogeneidad del producto “apartamento” y el tamaño de muestra mucho mayor (2.349 frente a 430) explican esta mejora.
  • RMSE = 98,2 y MAE = 60,0 millones: el error típico equivale al 30,8% del precio medio, notablemente mejor que el 32,1% del Modelo 1.
  • F = 1389,72 con p < 0,001: el modelo es globalmente significativo.

3.3.6 Multicolinealidad

Factores de inflación de la varianza (VIF) — Modelo 2.
Variable VIF Tolerancia (1/VIF) Lectura
areaconst 2,065 0,484 Sin problema (VIF < 5)
estrato 1,554 0,644 Sin problema (VIF < 5)
habitaciones 1,448 0,691 Sin problema (VIF < 5)
parqueaderos 1,812 0,552 Sin problema (VIF < 5)
baños 2,620 0,382 Sin problema (VIF < 5)

El VIF más alto es 2,620 (banios), por debajo del umbral de 5. Aunque las correlaciones entre predictores son mayores que en el Caso 1, no alcanzan a comprometer la estimación.

3.3.7 Limitaciones del modelo

Aplican las mismas seis limitaciones del Caso 1 —variables omitidas, exclusión de barrio (base2 abarca 133 barrios), coordenadas aproximadas, precios de oferta y no de transacción, eliminación por lista de 411 registros incompletos y validez restringida al rango observado— con dos agravantes específicos de este caso:

  • Variables propias de la propiedad horizontal no observadas. El piso, la existencia de ascensor, la cuota de administración, las zonas comunes y la antigüedad del edificio son determinantes centrales del precio de un apartamento y ninguna está en el modelo. La variable piso existe en la base original pero tiene 2638 faltantes y no forma parte de la especificación exigida.
  • Extrapolación en el borde del rango. El perfil solicitado (300 m²) está en el percentil 99,0. Aunque formalmente cae dentro del rango observado (40–932 m²), la predicción se apoya en muy pocas observaciones comparables y hereda toda la incertidumbre de esa zona escasamente poblada de la muestra.

3.4 Validación de supuestos

Pruebas formales de los supuestos — Modelo 2 (Apartamentos Zona Sur).
Supuesto Prueba Estadístico Grados de libertad p-valor Conclusión
Normalidad de residuos Shapiro-Wilk 0,7908 < 0,001 Se rechaza normalidad
Homocedasticidad Breusch-Pagan (studentized) 757,4658 5 < 0,001 Se rechaza homocedasticidad
Homocedasticidad Score test de varianza no constante 4.496,6571 1 < 0,001 Se rechaza varianza constante
Independencia (orden de registro) Durbin-Watson 1,5449 < 0,001 Autocorrelación detectada en el orden del archivo

3.4.1 Linealidad

Residuos frente a valores ajustados — Modelo 2.

Residuos frente a valores ajustados — Modelo 2.

La curva suavizada se desvía del cero, con residuos positivos crecientes en el tramo alto de los valores ajustados. La linealidad no se sostiene en el segmento de apartamentos caros, precisamente el segmento en el que se ubica la solicitud del cliente.

3.4.2 Normalidad de los residuos

Histograma de residuos estandarizados — Modelo 2.

Histograma de residuos estandarizados — Modelo 2.

Gráfico Q-Q normal de los residuos — Modelo 2.

Gráfico Q-Q normal de los residuos — Modelo 2.

Shapiro-Wilk entrega W = 0,7908 con p < 0,001: se rechaza la normalidad. El Q-Q evidencia colas pesadas en ambos extremos, más severas que en el Modelo 1. Con 2.349 observaciones la inferencia sobre coeficientes es robusta por el teorema central del límite, pero los intervalos de predicción individuales quedan comprometidos.

3.4.3 Homocedasticidad

Gráfico escala-localización — Modelo 2.

Gráfico escala-localización — Modelo 2.

Breusch-Pagan arroja BP = 757,47 con p < 0,001, y el score test de varianza no constante alcanza 4496,7 (p < 0,001). Se rechaza la homocedasticidad de forma contundente, con una violación más pronunciada que en el Modelo 1. La varianza del error crece con el precio estimado, de modo que el intervalo de predicción para un apartamento de gama alta —como el solicitado— es probablemente más estrecho de lo que debería ser.

3.4.4 Independencia

Durbin-Watson = 1,5449 (p < 0,001). Aplica íntegramente la advertencia del Caso 1: en datos transversales ordenados por barrio, este estadístico capta agrupamiento espacial de los residuos, no autocorrelación temporal. El valor, más alejado de 2 que en el Modelo 1, indica una dependencia espacial más acusada, consistente con la fuerte segmentación por barrios del sur de Cali.

3.4.5 Observaciones influyentes

Detección de observaciones atípicas e influyentes — Modelo 2.
Criterio Umbral Casos % del n
Leverage alto (h > 2p/n) 0,0051 148 6,30
Distancia de Cook > 4/n 0,0017 119 5,07
Distancia de Cook > 1 1,0000 3 0,13
Residuo estudentizado |t| > 3 3,0000 30 1,28
Distancia de Cook por observación — Modelo 2.

Distancia de Cook por observación — Modelo 2.

Leverage frente a residuo estudentizado — Modelo 2.

Leverage frente a residuo estudentizado — Modelo 2.

3 observaciones superan la distancia de Cook de 1 y 30 tienen residuo estudentizado mayor que 3 en valor absoluto. Son, con alta probabilidad, los apartamentos de gran superficie del extremo de la distribución. No se eliminó ninguna: son justamente las observaciones que informan la predicción para el perfil de 300 m² solicitado, lo que constituye una razón adicional para tratar esa predicción con cautela.

3.4.6 Multicolinealidad

Verificada arriba: VIF máximo 2,62 < 5. Supuesto cumplido.

3.4.7 Síntesis del diagnóstico y acciones recomendadas

Supuesto Resultado Implicación
Linealidad Desviación en el tramo alto Afecta justamente al perfil solicitado
Normalidad Rechazada (colas pesadas) Intervalos de predicción poco confiables
Homocedasticidad Rechazada con fuerza Intervalos demasiado estrechos en gama alta
Independencia Dependencia espacial marcada Efectos de barrio no modelados
Multicolinealidad Sin problema Coeficientes interpretables por separado

Las acciones recomendadas coinciden con las del Caso 1 —transformación logarítmica del precio, términos no lineales, errores estándar robustos o regresión robusta, efectos de barrio, revisión de observaciones influyentes y ampliación de la recolección— y se añade una prioridad específica: incorporar las variables propias de la propiedad horizontal (piso, ascensor, administración, antigüedad, zonas comunes), hoy ausentes por completo.

3.5 Estimación puntual e interpretación

Predicciones del Modelo 2 para la Vivienda 2, por escenario de estrato (millones de COP).
Escenario Estrato Predicción puntual IP 95% inferior IP 95% superior IC 95% media inf IC 95% media sup Crédito (COP mm) Holgura vs crédito Recomendación Área dentro del rango observado
Estrato 5 5 676,8 482,6 871,1 653,3 700,4 850 173,2 Viable con cautela Si
Estrato 6 6 737,1 542,8 931,4 713,3 760,9 850 112,9 Viable con cautela Si
Contexto de mercado del perfil solicitado dentro de base2.
Indicador Valor
Área solicitada (m²) 300
Percentil que ocupa el área solicitada en la base 99,0 %
Viviendas con área >= la solicitada 32 de 2760 (1,2 %)
Área mediana de la base (m²) 85
Área máxima observada (m²) 932
Precio mediano observado (millones COP) 245
Viviendas dentro del crédito preaprobado 2704 de 2760
Viviendas dentro del crédito y en el estrato solicitado 1429

3.5.1 Escenario A — Estrato 5

Precio estimado: 676,8 millones de COP (IP 95%: 482,6 a 871,1). Frente al crédito de 850 millones, la holgura de la estimación puntual es de 173,2 millones, pero el límite superior del intervalo (871,1) supera el techo del crédito.

Recomendación: Viable con cautela.

3.5.2 Escenario B — Estrato 6

Precio estimado: 737,1 millones de COP (IP 95%: 542,8 a 931,4). La holgura puntual se reduce a 112,9 millones y el límite superior del intervalo (931,4) excede el crédito en 81,4 millones.

Recomendación: Viable con cautela. El margen existe pero es delgado; una unidad concreta en la parte alta del rango de precios dejaría el crédito corto.

3.5.3 Qué significa el intervalo de predicción

Al igual que en el Caso 1, el intervalo de predicción se refiere a una vivienda individual y es mucho más ancho que el intervalo de confianza de la media (que en el escenario A va de 653,3 a 700,4 millones). En este caso hay un motivo adicional de prudencia: los 300 m² solicitados corresponden al percentil 99,0 de la muestra, con apenas 32 apartamentos comparables. La predicción es una extrapolación de facto hacia el borde de los datos: el intervalo nominal del 95% subestima la incertidumbre real, y esa subestimación se agrava por la heterocedasticidad documentada.

3.6 Cinco ofertas recomendadas

3.6.1 Criterios y puntuación

De los 2.760 apartamentos de la Zona Sur, 1.429 cumplen los criterios duros (estrato 5 o 6 y precio \(\le\) 850 millones); 55 se descartan por información incompleta, quedando 1.374 ofertas puntuables. Se aplica exactamente la misma función de puntuación documentada en el Caso 1, con los parámetros de esta solicitud (\(A_0 = 300\) m², 3 baños, 5 habitaciones, 3 parqueaderos, crédito 850 millones).

3.6.2 Tabla de ofertas — Vivienda 2

Cinco ofertas recomendadas para la Vivienda 2 (Apartamento, Zona Sur). Diferencias: A = área en m², B = baños, H = habitaciones, P = parqueaderos.
# Fila original ID Barrio Precio (mm) Área (m²) Estrato Parq. Baños Hab. Latitud Longitud Diferencia vs requerimiento Puntuación
1 963 6175 Capri 350 270 5 3 3 4 3,39200 -76,54100 A -30 m2 | B +0 | H -1 | P +0 80,76
2 964 6205 Capri 350 260 5 3 3 3 3,38954 -76,54134 A -40 m2 | B +0 | H -2 | P +0 72,10
3 5933 2308 San Fernando 350 258 5 2 4 5 3,44000 -76,51972 A -42 m2 | B +1 | H +0 | P -1 71,86
4 4974 7680 Pampa Linda 450 267 5 3 3 3 3,40481 -76,55117 A -33 m2 | B +0 | H -2 | P +0 70,56
5 6670 8036 Seminario 530 256 5 3 5 5 3,40748 -76,55408 A -44 m2 | B +2 | H +0 | P +0 67,40

Las puntuaciones son más altas que en el Caso 1 —la mejor alcanza 80,76 puntos frente a 70,71— gracias a la amplia holgura presupuestal: las cinco opciones cuestan entre 350 y 530 millones, muy por debajo del techo de 850 millones. Ninguna alcanza los 300 m² solicitados —la mayor tiene 270 m²—, lo que confirma cuantitativamente la escasez de ese producto en la zona. En habitaciones, varias opciones quedan por debajo de las 5 pedidas.

3.6.3 Mapa de ofertas — Vivienda 2

Ofertas recomendadas para la Vivienda 2: apartamentos en la Zona Sur de Cali.

Tabla complementaria del mapa: identificación de los marcadores numerados de la Vivienda 2.
# Barrio Precio (mm) Área (m²) Estrato Latitud Longitud
1 Capri 350 270 5 3,39200 -76,54100
2 Capri 350 260 5 3,38954 -76,54134
3 San Fernando 350 258 5 3,44000 -76,51972
4 Pampa Linda 450 267 5 3,40481 -76,55117
5 Seminario 530 256 5 3,40748 -76,55408

Nota metodológica del mapa. Fuente de los datos: base vivienda del paqueteMODELOS. Cartografía base: OpenStreetMap (© contribuidores de OSM, licencia ODbL). Limitación de las coordenadas: corresponden a una referencia aproximada del barrio o sector y no a la dirección exacta del inmueble, lo que es especialmente relevante en propiedad horizontal, donde un mismo punto puede representar un edificio completo con unidades de precio muy distinto. Verifíquese en campo antes de decidir.

3.7 Recomendación ejecutiva — Vivienda 2

  1. El crédito alcanza en ambos escenarios de estrato, según la estimación puntual: 676,8 millones en estrato 5 y 737,1 en estrato 6, frente a 850 millones disponibles. La cautela viene del intervalo, no del punto central.
  2. El producto solicitado es excepcional. Con 32 apartamentos de 300 m² o más entre 2.760, el cliente busca en el 1,2% superior de la oferta. Debe advertírsele que la búsqueda será larga y que el precio real puede desviarse considerablemente de la estimación.
  3. Hay abundante oferta si se flexibiliza el área. 1.374 apartamentos cumplen estrato y presupuesto; el cuello de botella es exclusivamente el área.
  4. Priorizar parqueaderos y baños en la negociación. Son los atributos con mayor retorno estimado en este submercado (75,8 y 50,3 millones por unidad respectivamente) y por tanto los que más justifican un sobreprecio.
  5. No pagar por habitaciones adicionales. A igualdad de área, el modelo estima un efecto negativo (-26,7 millones por habitación): conviene priorizar amplitud sobre número de cuartos.
  6. Prioridad de visita: ofertas #1 y #2 (Capri), las de mejor relación área/precio/atributos dentro del presupuesto.

4 Conclusiones generales para María

4.1 Respuesta directa a las dos solicitudes

Veredicto por escenario. Cifras en millones de pesos colombianos.
Solicitud Precio estimado IP 95% Crédito Veredicto
Vivienda 1 — Casa, Zona Norte, estrato 4 307,9 2 – 614 350 Viable con cautela
Vivienda 1 — Casa, Zona Norte, estrato 5 386,7 80 – 693 350 No viable
Vivienda 2 — Apartamento, Zona Sur, estrato 5 676,8 483 – 871 850 Viable con cautela
Vivienda 2 — Apartamento, Zona Sur, estrato 6 737,1 543 – 931 850 Viable con cautela

Vivienda 1. El crédito de 350 millones es suficiente en estrato 4 e insuficiente en estrato 5. Recomendación operativa: enfocar la búsqueda en estrato 4, o bien aceptar un área menor a los 200 m² si el cliente insiste en estrato 5. Existen 82 casas reales que cumplen los criterios.

Vivienda 2. El crédito de 850 millones es suficiente en ambos estratos según la estimación central, con la advertencia de que el intervalo de predicción supera el techo en los dos escenarios. La restricción real no es presupuestaria sino de disponibilidad: apenas 32 de 2.760 apartamentos de la Zona Sur alcanzan los 300 m².

4.2 Lecciones transversales del análisis

  1. Los dos submercados se comportan de forma distinta. El metro cuadrado del apartamento del sur (1,290 millones) casi duplica el de la casa del norte (0,659), y el parqueadero vale allí 3,1 veces más. Estimar dos modelos separados en lugar de uno agregado no es un formalismo: los parámetros del mercado son genuinamente diferentes.
  2. El estrato es la palanca de precio más poderosa en ambos casos (79 millones por estrato en casas del norte, 60 en apartamentos del sur). Es también la variable que decide la viabilidad de la Vivienda 1.
  3. El área manda, pero el número de habitaciones no. En el Caso 1 su efecto no es distinguible de cero; en el Caso 2 es negativo condicional al área. El mensaje comercial es el mismo: se compran metros cuadrados bien distribuidos, no cuartos.
  4. La capacidad predictiva es buena en agregado y limitada en el caso individual. Con \(R^2\) de 0,603 y 0,748, los modelos son útiles para fijar rangos de negociación y detectar sobreprecios, pero el RMSE (154 y 98 millones) impide usarlos como avalúo.
  5. Ningún modelo cumple los supuestos de normalidad, homocedasticidad e independencia. Esto no invalida el análisis —los coeficientes MCO siguen siendo insesgados y consistentes—, pero sí obliga a tratar los intervalos como orientativos y a acompañar toda decisión con avalúo profesional.

4.3 Advertencias que deben trasladarse al cliente

  • Las cifras son precios de oferta publicados, no de transacción cerrada; el precio finalmente pagado suele ser menor.
  • La base no tiene marca temporal, por lo que no refleja necesariamente el estado actual del mercado.
  • El modelo ignora antigüedad, acabados, estado de conservación, seguridad, ascensor y administración, factores que pueden mover el precio de un inmueble concreto muy por encima o por debajo de la estimación.
  • Las coordenadas son aproximadas a nivel de barrio o sector; los mapas orientan, no localizan.
  • El modelo de casas del norte se estima con 430 de 717 registros por falta de datos de parqueaderos; si esa ausencia no es aleatoria, las estimaciones pueden estar sesgadas.

5 Anexos técnicos

5.1 Anexo A — Tablas completas de coeficientes

Anexo A.1 — Coeficientes completos del Modelo 1.
Modelo Término Estimación Error estándar t p-valor IC 95% inf IC 95% sup Signif
Modelo 1 — Casas Norte (Intercept) -235,382 45,424 -5,182 < 0,001 -324,667 -146,098 ***
Modelo 1 — Casas Norte areaconst 0,659 0,054 12,263 < 0,001 0,554 0,765 ***
Modelo 1 — Casas Norte estrato 78,771 9,973 7,898 < 0,001 59,167 98,374 ***
Modelo 1 — Casas Norte habitaciones 6,785 5,941 1,142 0,2540 -4,892 18,462
Modelo 1 — Casas Norte parqueaderos 24,645 5,928 4,158 < 0,001 12,994 36,297 ***
Modelo 1 — Casas Norte baños 22,286 7,836 2,844 0,0047 6,883 37,689 **
Anexo A.2 — Coeficientes completos del Modelo 2.
Modelo Término Estimación Error estándar t p-valor IC 95% inf IC 95% sup Signif
Modelo 2 — Aptos Sur (Intercept) -256,323 16,120 -15,900 < 0,001 -287,935 -224,711 ***
Modelo 2 — Aptos Sur areaconst 1,290 0,054 23,701 < 0,001 1,183 1,397 ***
Modelo 2 — Aptos Sur estrato 60,249 3,120 19,308 < 0,001 54,130 66,369 ***
Modelo 2 — Aptos Sur habitaciones -26,671 4,075 -6,546 < 0,001 -34,661 -18,681 ***
Modelo 2 — Aptos Sur parqueaderos 75,820 4,218 17,977 < 0,001 67,549 84,091 ***
Modelo 2 — Aptos Sur baños 50,255 3,495 14,380 < 0,001 43,402 57,108 ***

5.2 Anexo B — Métricas comparadas de los dos modelos

Anexo B.1 — Métricas de ajuste de ambos modelos exportadas al archivo CSV de resumen.
Modelo n Predictores R² ajustado Error residual (sigma) RMSE MAE F p-valor (F)
Modelo 1 - Casas Zona Norte 430 5 0,6027 0,5980 155,098 154,012 99,202 128,66 < 0,001
Modelo 2 - Apartamentos Zona Sur 2.349 5 0,7478 0,7473 98,349 98,224 60,013 1.389,72 < 0,001
Anexo B.2 — VIF de ambos modelos.
Modelo Variable VIF Tolerancia (1/VIF)
Modelo 1 areaconst 1,497 0,668
Modelo 1 estrato 1,333 0,750
Modelo 1 habitaciones 1,749 0,572
Modelo 1 parqueaderos 1,233 0,811
Modelo 1 baños 2,053 0,487
Modelo 2 areaconst 2,065 0,484
Modelo 2 estrato 1,554 0,644
Modelo 2 habitaciones 1,448 0,691
Modelo 2 parqueaderos 1,812 0,552
Modelo 2 baños 2,620 0,382

5.3 Anexo C — Diagnósticos completos

Anexo C.1 — Pruebas de supuestos de ambos modelos.
Modelo Supuesto Prueba Estadístico Grados de libertad p-valor Conclusión
Modelo 1 - Casas Norte Normalidad de residuos Shapiro-Wilk 0,8507 < 0,001 Se rechaza normalidad
Modelo 1 - Casas Norte Homocedasticidad Breusch-Pagan (studentized) 77,6666 5 < 0,001 Se rechaza homocedasticidad
Modelo 1 - Casas Norte Homocedasticidad Score test de varianza no constante 340,4629 1 < 0,001 Se rechaza varianza constante
Modelo 1 - Casas Norte Independencia (orden de registro) Durbin-Watson 1,7465 0,0036 Autocorrelación detectada en el orden del archivo
Modelo 2 - Aptos Sur Normalidad de residuos Shapiro-Wilk 0,7908 < 0,001 Se rechaza normalidad
Modelo 2 - Aptos Sur Homocedasticidad Breusch-Pagan (studentized) 757,4658 5 < 0,001 Se rechaza homocedasticidad
Modelo 2 - Aptos Sur Homocedasticidad Score test de varianza no constante 4.496,6571 1 < 0,001 Se rechaza varianza constante
Modelo 2 - Aptos Sur Independencia (orden de registro) Durbin-Watson 1,5449 < 0,001 Autocorrelación detectada en el orden del archivo
Anexo C.2 — Observaciones atípicas e influyentes en ambos modelos.
Modelo Criterio Umbral Casos % del n
Modelo 1 - Casas Norte Leverage alto (h > 2p/n) 0,0279 40 9,30
Modelo 1 - Casas Norte Distancia de Cook > 4/n 0,0093 24 5,58
Modelo 1 - Casas Norte Distancia de Cook > 1 1,0000 1 0,23
Modelo 1 - Casas Norte Residuo estudentizado |t| > 3 3,0000 11 2,56
Modelo 2 - Aptos Sur Leverage alto (h > 2p/n) 0,0051 148 6,30
Modelo 2 - Aptos Sur Distancia de Cook > 4/n 0,0017 119 5,07
Modelo 2 - Aptos Sur Distancia de Cook > 1 1,0000 3 0,13
Modelo 2 - Aptos Sur Residuo estudentizado |t| > 3 3,0000 30 1,28

5.4 Anexo D — Análisis de sensibilidad al tratamiento de parqueaderos

El modelo principal aplica eliminación por lista: descarta los registros sin dato de parqueaderos. Como alternativa se estimó un modelo que reinterpreta el faltante como 0 —hipótesis plausible dado que la variable nunca toma el valor cero en los datos observados—. Este modelo alternativo no reemplaza al principal; sirve únicamente para medir la fragilidad de las conclusiones.

Anexo D.1 — Modelo principal frente a modelo de sensibilidad (faltantes de parqueaderos tratados como 0).
Caso Versión n Predictores R² ajustado Error residual (sigma) RMSE MAE F p-valor (F)
Casas Norte Principal (casos completos) 430 5 0,6027 0,5980 155,098 154,012 99,202 128,66 < 0,001
Casas Norte Sensibilidad (NA parq. = 0) 696 5 0,6541 0,6516 158,461 157,777 100,182 260,92 < 0,001
Aptos Sur Principal (casos completos) 2.349 5 0,7478 0,7473 98,349 98,224 60,013 1.389,72 < 0,001
Aptos Sur Sensibilidad (NA parq. = 0) 2.750 5 0,7523 0,7519 95,403 95,299 57,895 1.666,98 < 0,001
Anexo D.2 — Predicciones bajo ambos tratamientos del dato faltante.
Caso Versión Escenario Predicción puntual IP 95% inferior IP 95% superior Recomendación
Vivienda 1 — Casa Norte Principal Estrato 4 307,9 2,0 613,8 Viable con cautela
Vivienda 1 — Casa Norte Principal Estrato 5 386,7 80,1 693,3 No viable
Vivienda 1 — Casa Norte Sensibilidad Estrato 4 326,3 14,6 637,9 Viable con cautela
Vivienda 1 — Casa Norte Sensibilidad Estrato 5 412,8 100,5 725,0 No viable
Vivienda 2 — Apto Sur Principal Estrato 5 676,8 482,6 871,1 Viable con cautela
Vivienda 2 — Apto Sur Principal Estrato 6 737,1 542,8 931,4 Viable con cautela
Vivienda 2 — Apto Sur Sensibilidad Estrato 5 671,8 483,6 860,1 Viable con cautela
Vivienda 2 — Apto Sur Sensibilidad Estrato 6 727,8 539,5 916,1 Viable con cautela

Conclusión del anexo. El \(R^2\) ajustado y las predicciones se mueven poco, y los veredictos de viabilidad no cambian en ninguno de los cuatro escenarios. Las recomendaciones del informe son, por tanto, robustas al tratamiento del dato faltante de parqueaderos.

5.5 Anexo E — Tabla completa de ofertas elegibles

Se listan las mejores 20 y 20 ofertas de cada caso. Los rankings completos (82 y 1.374 registros) están en output/ofertas_vivienda_1.csv y output/ofertas_vivienda_2.csv.

Anexo E.1 — Top 20 de ofertas elegibles para la Vivienda 1 (Casa, Zona Norte).
# Fila original Barrio Precio (mm) Área (m²) Estrato Parq. Baños Hab. Diferencia vs requerimiento Puntuación
1 8172 Zona Norte 265 162 4 1 3 4 A -38 m2 | B +1 | H +0 | P +0 70,71
2 295 Alamos 275 120 4 1 2 4 A -80 m2 | B +0 | H +0 | P +0 70,29
3 4021 La Merced 350 216 5 2 2 4 A +16 m2 | B +0 | H +0 | P +1 69,70
4 4018 La Merced 280 147 4 1 3 4 A -53 m2 | B +1 | H +0 | P +0 67,22
5 3493 La Flora 320 160 5 1 3 4 A -40 m2 | B +1 | H +0 | P +0 67,21
6 4003 La Merced 330 240 4 1 2 3 A +40 m2 | B +0 | H -1 | P +0 66,64
7 5676 Prados del Norte 280 140 5 1 2 3 A -60 m2 | B +0 | H -1 | P +0 66,00
8 5669 Prados del Norte 300 146 5 1 3 4 A -54 m2 | B +1 | H +0 | P +0 65,91
9 8139 Vipasa 340 203 5 2 3 4 A +3 m2 | B +1 | H +0 | P +1 65,05
10 2164 El Bosque 245 165 5 2 2 3 A -35 m2 | B +0 | H -1 | P +1 64,88
11 2204 El Bosque 350 203 5 2 2 5 A +3 m2 | B +0 | H +1 | P +1 64,47
12 3784 La Flora 320 140 5 1 3 4 A -60 m2 | B +1 | H +0 | P +0 63,71
13 3727 La Flora 350 190 5 1 3 3 A -10 m2 | B +1 | H -1 | P +0 63,25
14 4007 La Merced 330 260 4 1 3 4 A +60 m2 | B +1 | H +0 | P +0 63,14
15 4019 La Merced 330 140 4 1 3 4 A -60 m2 | B +1 | H +0 | P +0 63,14
16 8141 Vipasa 320 264 4 1 2 3 A +64 m2 | B +0 | H -1 | P +0 63,01
17 2169 El Bosque 335 220 5 1 3 3 A +20 m2 | B +1 | H -1 | P +0 62,36
18 3732 La Flora 320 170 5 1 3 3 A -30 m2 | B +1 | H -1 | P +0 61,46
19 4012 La Merced 253 140 4 2 3 4 A -60 m2 | B +1 | H +0 | P +1 60,04
20 2175 El Bosque 330 165 4 1 4 4 A -35 m2 | B +2 | H +0 | P +0 60,02
Anexo E.2 — Top 20 de ofertas elegibles para la Vivienda 2 (Apartamento, Zona Sur).
# Fila original Barrio Precio (mm) Área (m²) Estrato Parq. Baños Hab. Diferencia vs requerimiento Puntuación
1 963 Capri 350 270,00 5 3 3 4 A -30 m2 | B +0 | H -1 | P +0 80,76
2 964 Capri 350 260,00 5 3 3 3 A -40 m2 | B +0 | H -2 | P +0 72,10
3 5933 San Fernando 350 258,00 5 2 4 5 A -42 m2 | B +1 | H +0 | P -1 71,86
4 4974 Pampa Linda 450 267,00 5 3 3 3 A -33 m2 | B +0 | H -2 | P +0 70,56
5 6670 Seminario 530 256,00 5 3 5 5 A -44 m2 | B +2 | H +0 | P +0 67,40
6 2101 Cuarto de Legua 410 295,55 5 2 4 4 A -4 m2 | B +1 | H -1 | P -1 67,33
7 2122 Cuarto de Legua 320 185,00 5 2 3 4 A -115 m2 | B +0 | H -1 | P -1 64,05
8 2576 El Ingenio 320 181,00 5 2 3 4 A -119 m2 | B +0 | H -1 | P -1 63,59
9 2115 Cuarto de Legua 520 320,00 5 2 4 4 A +20 m2 | B +1 | H -1 | P -1 62,93
10 2599 El Ingenio 700 250,00 6 2 4 5 A -50 m2 | B +1 | H +0 | P -1 62,70
11 5957 San Fernando 500 330,00 5 2 4 4 A +30 m2 | B +1 | H -1 | P -1 62,24
12 8283 Zona Sur 350 174,00 5 4 3 4 A -126 m2 | B +0 | H -1 | P +1 62,06
13 6669 Seminario 670 300,00 5 3 5 6 A +0 m2 | B +2 | H +1 | P +0 61,74
14 5932 San Fernando 350 168,00 5 2 3 4 A -132 m2 | B +0 | H -1 | P -1 61,36
15 5986 San Fernando Viejo 485 259,00 5 2 4 4 A -41 m2 | B +1 | H -1 | P -1 61,30
16 6663 Seminario 475 184,00 5 3 3 3 A -116 m2 | B +0 | H -2 | P +0 60,29
17 2090 Cuarto de Legua 321 217,04 5 1 4 5 A -83 m2 | B +1 | H +0 | P -2 60,27
18 4633 Multicentro 410 170,00 5 2 3 4 A -130 m2 | B +0 | H -1 | P -1 60,19
19 1410 Ciudad Jardín 695 227,00 6 3 3 3 A -73 m2 | B +0 | H -2 | P +0 60,13
20 3196 Gran Limonar 300 209,00 5 1 4 5 A -91 m2 | B +1 | H +0 | P -2 59,82

5.6 Anexo F — Reproducibilidad

Anexo F.1 — Entorno de ejecución.
Componente Valor
Versión de R R version 4.4.2 (2024-10-31 ucrt)
Plataforma x86_64-w64-mingw32/x64
Semilla aleatoria 2024
paqueteMODELOS 0.1.0
dplyr 1.2.1
ggplot2 4.0.3
car 3.1.3
lmtest 0.9.40
sf 1.0.23
ggspatial 1.1.10
knitr 1.51
kableExtra 1.4.0

El proyecto se reproduce ejecutando, desde la raíz de actividad2_ca/:

Rscript scripts/00_paquetes.R
Rscript scripts/01_cargar_y_depurar.R
Rscript scripts/02_analisis_y_modelos.R
Rscript scripts/03_generar_informe.R

El último script regenera output/mapa.pdf (informe completo en PDF) y output/informe_ca.html (versión interactiva con gráficos Plotly y mapas Leaflet). Todas las cifras, tablas, gráficos y conclusiones de este documento provienen de esa ejecución; ninguna fue redactada a mano.