Pesos de las series y criterios para su permanencia en los modelos agregados

1. Alcance

Esta nota resume la importancia de las series en los dos modelos agregados seleccionados para el nowcasting del crecimiento anual del PIB de Bogotá:

  1. Random Forest sin luminosidad.
  2. Elastic Net con distribución espacial de luminosidad.

Los pesos corresponden al ajuste final utilizado para producir el nowcast de 2026T1, con información del PIB de Bogotá disponible hasta 2025T4. No deben interpretarse como efectos causales ni como parámetros permanentes.

2. Random Forest sin luminosidad

El Random Forest obtuvo un MAE de validación de 0,694 puntos porcentuales. Su nowcast congelado para 2026T1 es 2,145%.

En este modelo no existen coeficientes positivos o negativos. Los pesos indican cuánto utilizó el bosque cada variable para separar las observaciones y generar sus pronósticos. Para cada serie se sumaron las importancias de sus tres meses del trimestre: m1, m2 y m3.

Serie Peso relativo
ISE Colombia 27,72%
Manufactura: producción real 18,71%
Manufactura: ventas reales 16,06%
Salidas de buses 12,69%
Demanda de energía 9,20%
Empleo: ocupados 6,19%
Transacciones: facturación real 5,81%
Comercio minorista: ventas reales 3,29%
Transacciones: ticket promedio real 0,32%
Total 100,00%

Lectura

  • El ISE nacional y las dos variables manufactureras concentran 62,49% de la importancia.
  • Las salidas de buses y la demanda de energía aportan conjuntamente 21,89%.
  • Empleo, facturación real y comercio minorista conservan aportes no despreciables.
  • El ticket promedio es la primera candidata para una prueba de exclusión, pero su peso bajo no demuestra por sí solo que sea redundante.

3. Elastic Net con distribución espacial de luminosidad

El Elastic Net obtuvo un MAE de validación de 0,599 puntos porcentuales. Su nowcast congelado para 2026T1 es 3,505%.

El modelo estandariza cada predictor dentro de la muestra de entrenamiento. El peso porcentual se calcula como la suma absoluta de los coeficientes de m1, m2 y m3 de cada serie, dividida por la suma absoluta de todos los coeficientes:

\[ w_j=100\frac{\sum_{m=1}^{3}|\widehat{\beta}_{j,m}|} {\sum_{k}\sum_{m=1}^{3}|\widehat{\beta}_{k,m}|}. \]

Serie Peso absoluto Coeficiente estandarizado acumulado
ISE Colombia 49,39% +3,554
Manufactura: producción real 22,05% +1,587
Manufactura: ventas reales 21,10% +1,518
Salidas de buses 3,69% +0,266
Comercio minorista: ventas reales 2,94% +0,211
Luminosidad: proporción iluminada 0,83% +0,060
Demanda de energía 0,00% 0,000
Empleo: ocupados 0,00% 0,000
Luminosidad: mediana espacial 0,00% 0,000
Luminosidad: percentil 90 0,00% 0,000
Luminosidad: proporción imputada 0,00% 0,000
Transacciones: facturación real 0,00% 0,000
Transacciones: ticket promedio real 0,00% 0,000
Total 100,00%

Los únicos predictores mensuales con coeficiente diferente de cero en el ajuste final fueron:

Predictor Coeficiente estandarizado
ISE Colombia, m2 +2,310
Manufactura: producción real, m2 +1,587
Manufactura: ventas reales, m3 +1,518
ISE Colombia, m1 +1,245
Salidas de buses, m3 +0,266
Comercio minorista, m3 +0,211
Proporción iluminada, m2 +0,060

La configuración seleccionada (l1_ratio = 1) permite que el modelo descarte variables que no añaden suficiente información frente a las demás. Por eso algunos coeficientes quedan exactamente en cero. Esto no significa que la serie carezca de información en todos los periodos o en otros modelos.

4. Por qué un peso bajo o cero no justifica eliminar una serie

4.1 Los pesos corresponden a una sola estimación final

Los valores anteriores se estimaron con 24 observaciones trimestrales, hasta 2025T4. Cuando se incorpore un nuevo trimestre, cambiarán los datos disponibles, los valores usados para completar faltantes, la escala de las variables, la configuración elegida para el modelo y, posiblemente, los pesos finales.

Una variable con coeficiente cero hoy puede entrar nuevamente después de una actualización.

4.2 Los pesos no son comparables entre algoritmos

Random Forest y Elastic Net representan la información de manera distinta:

  • Random Forest puede captar relaciones curvas y combinaciones entre variables, y reparte la importancia entre ellas.
  • Elastic Net decide qué variables conservar teniendo en cuenta todas las demás y puede asignar exactamente cero a algunas de ellas.

Por ejemplo, la facturación real tiene un peso de 5,81% en Random Forest y cero en Elastic Net. Esto no es una contradicción: puede ayudar cuando la relación no es una línea recta o puede estar aportando información muy parecida a la de otra variable que Elastic Net decidió conservar.

4.3 Las variables que se mueven de manera parecida pueden sustituirse

ISE, manufactura, comercio, energía, empleo y transacciones suelen subir o bajar al mismo tiempo durante buena parte del ciclo económico. Elastic Net puede conservar una de esas señales y asignar cero a otras que cuentan una historia parecida. Random Forest puede repartir la importancia entre ellas.

Eliminar una de esas señales puede hacer que otra parezca más importante sin mejorar los pronósticos.

4.4 Una variable puede ser útil en periodos excepcionales

La energía, el empleo, las transacciones y la movilidad pueden aportar poco durante una expansión estable, pero ser informativas ante huelgas, restricciones de movilidad, apagones, cambios de consumo o desaceleraciones sectoriales.

La muestra de validación contiene solamente 12 trimestres. No representa todos los estados posibles de la economía.

4.5 La luminosidad muestra valor incremental aunque su peso final sea pequeño

Al comparar el mismo algoritmo con y sin el bloque de distribución espacial:

Algoritmo MAE sin luminosidad MAE con luminosidad Mejora
Elastic Net 0,783 0,599 0,184 pp, 23,5%
Random Forest 0,694 0,628 0,066 pp, 9,4%

En el Elastic Net final, únicamente la proporción iluminada del segundo mes del trimestre (m2) conserva un coeficiente distinto de cero. Sin embargo, el grupo de variables de luminosidad mejoró el desempeño histórico del mismo método. Esto indica que la relevancia debe evaluarse durante todos los ejercicios de validación, no solamente en la estimación más reciente.

4.6 La evidencia estadística todavía es limitada

La comparación entre los dos mejores modelos utiliza apenas 12 trimestres de prueba. La mejora media del Elastic Net con luminosidad frente al Random Forest sin luminosidad es 0,095 puntos porcentuales. Sin embargo, la prueba estadística (p HAC(1) = 0,418) indica que todavía no hay suficiente evidencia para afirmar que esa diferencia se mantendrá de manera sistemática.

La falta de significancia no demuestra que los modelos sean iguales. Indica que la muestra todavía es demasiado pequeña para estimar con precisión la diferencia de desempeño.

4.7 La disponibilidad también tiene valor operativo

Una serie puede servir como respaldo cuando otra se publica tarde, presenta una revisión o llega incompleta. Eliminarla del sistema de información reduciría la capacidad de construir modelos alternativos para distintos cortes de nowcast.

Por esta razón debe distinguirse entre:

  • excluir temporalmente una variable de una especificación;
  • dejar de recopilar, limpiar o documentar la serie.

La primera decisión es reversible. La segunda puede destruir información histórica que posteriormente sería difícil recuperar.

5. Recomendación por grupo de series

Grupo Recomendación actual Justificación
ISE Colombia Mantener en ambos modelos Principal señal macroeconómica y mayor peso en ambos modelos
Producción y ventas manufactureras Mantener Concentran aproximadamente 35% del Random Forest y 43% del Elastic Net
Salidas de buses Mantener Aporta en ambos modelos y captura movilidad local
Comercio minorista Mantener Coeficiente activo en Elastic Net y aporte positivo en Random Forest
Demanda de energía Mantener en el panel; seguir probando Peso de 9,20% en Random Forest aunque sea cero en el Elastic Net final
Empleo Mantener en el panel; seguir probando Peso de 6,19% en Random Forest y posible utilidad en otros regímenes
Facturación real de tarjetas Mantener y auditar Peso de 5,81% en Random Forest; sensible a cobertura y revisiones del proveedor
Ticket promedio Primera candidata para una prueba de exclusión Peso de 0,32% en Random Forest y cero en Elastic Net, pero debe probarse formalmente
Proporción iluminada Mantener en el modelo con luces Es la única variable de luminosidad seleccionada en el ajuste final
Mediana, p90 y proporción imputada de luminosidad Mantener en el panel; probar versión reducida Cero en el ajuste final, pero el bloque completo mejoró la validación histórica

6. Pruebas requeridas antes de retirar una serie

Una serie debería considerarse prescindible solo después de superar las siguientes pruebas:

  1. Frecuencia de selección: medir en cuántas etapas de la validación temporal Elastic Net conserva un coeficiente diferente de cero.
  2. Importancia en periodos no usados para estimar: comprobar cuánto empeoran los pronósticos cuando se altera una variable, repitiendo el ejercicio en cada etapa de validación. Esto es más informativo que mirar solamente el peso del modelo final.
  3. Prueba de exclusión: volver a ejecutar toda la validación quitando una serie a la vez. La decisión de retirar una variable debe tomarse usando únicamente la información que habría estado disponible antes del trimestre evaluado.
  4. Desempeño integral: comparar el error absoluto promedio (MAE), el indicador que castiga con mayor fuerza los errores grandes (RMSE), la tendencia a pronosticar por encima o por debajo (sesgo), la capacidad de seguir la dirección de la serie (correlación) y el peor error observado.
  5. Estabilidad del nowcast: verificar que el retiro no produzca saltos grandes en 2026T1, 2026T2 o actualizaciones posteriores.
  6. Cortes de información: comprobar el desempeño cuando solo está disponible el primer mes, los dos primeros meses o los tres meses del trimestre.
  7. Nuevos datos: repetir la evaluación después de incorporar varios trimestres oficiales adicionales.

Como regla operativa inicial, una versión reducida solo debería reemplazar la actual si:

  • no aumenta el error absoluto promedio de los pronósticos de prueba (MAE) en más de 5%;
  • no empeora materialmente el sesgo o el error máximo;
  • mantiene resultados estables en diferentes ventanas;
  • conserva la ventaja cuando se publiquen nuevos datos oficiales que no se usaron para escoger el modelo;
  • reduce de forma real el costo, retraso o riesgo operativo del modelo.

7. Decisión actual

Por ahora no se recomienda dejar de recopilar ninguna de las series. Sí se recomienda estimar versiones reducidas como pruebas de sensibilidad.

El orden sugerido es:

  1. retirar solamente el ticket promedio;
  2. probar el Elastic Net sin las variables que fueron cero en el ajuste final, repitiendo correctamente la selección en cada etapa de la validación temporal;
  3. probar por separado la exclusión de los tres controles de luminosidad no seleccionados;
  4. comparar las versiones reducidas con los modelos actuales bajo el mismo esquema temporal;
  5. esperar nuevas observaciones oficiales antes de adoptar una especificación permanentemente más pequeña.

La decisión correcta en esta etapa es conservar las series, documentar sus costos y calidad, y utilizar periodos que el modelo no vio durante su estimación para determinar cuáles pueden excluirse de la versión de producción.