Análisis dinámico de agenda mediática mediante NLP y Econometría1
Autor/a
Felipe Ignacio Salinas Pereda
1. Resumen Ejecutivo
Este proyecto evalúa la dinámica de 148.540 titulares mediáticos utilizando un pipeline automatizado de Web Scraping, Procesamiento de Lenguaje Natural (NLP) y Econometría de Series de Tiempo. El objetivo analítico central es explorar la estructura semántica y temporal de la agenda de seguridad, modelando las diferencias de tono entre actores y el co-movimiento con datos delictuales reales.
Para lograrlo, se implementó una arquitectura de datos, aislando la señal del ruido y evaluando el comportamiento de la agenda frente a shocks exógenos:
Mostrar código de R
library(tidyverse)library(lubridate)library(knitr)library(patchwork)# Carga y limpieza inicialdf <-read_csv("dataset_emol_limpio.csv", show_col_types =FALSE) %>%mutate(Fecha =ymd(Fecha), Fecha_dia =ymd(Fecha_dia)) %>%filter(!Es_boletin)ultimo_mes_completo <-floor_date(max(df$Fecha_dia), "month") -months(1)df <- df %>%filter(Fecha <= ultimo_mes_completo)cols_dim <-c("Educación"="#E74C3C", "Fiscal"="#27AE60","Salud"="#2980B9", "Seguridad"="#8E44AD")tema <-theme_minimal(base_size =12) +theme(legend.position ="none",strip.text =element_text(size =12, face ="bold", color ="#333333"),plot.title =element_text(size =16, face ="bold", margin =margin(b =8)),plot.subtitle =element_text(size =11, color ="#666666", margin =margin(b =14)),panel.grid.minor =element_blank(), panel.spacing =unit(1.5, "lines"))tot <- df %>%count(Fecha, name ="Total")vol <- df %>%filter(!is.na(Dimensión)) %>%count(Fecha, Dimensión, name ="Volumen") %>%complete(Fecha =seq(min(Fecha), max(Fecha), by ="month"), Dimensión) %>%left_join(tot, by ="Fecha") %>%mutate(Volumen =if_else(is.na(Volumen) &!is.na(Total), 0L, Volumen),Prop = Volumen / Total *100)hitos <-data.frame(Fecha =ymd(c("2019-10-18", "2020-03-03", "2022-03-11")),Etiqueta =c("Estallido", "Pandemia", "Asume Boric"))ggplot(vol, aes(Fecha, Prop, color = Dimensión)) +geom_line(alpha =0.35, linewidth =0.5) +geom_smooth(method ="loess", span =0.25, se =FALSE, linewidth =1.3) +geom_vline(data = hitos, aes(xintercept =as.numeric(Fecha)), linetype ="dashed", color ="#7F8C8D", linewidth =0.6, alpha =0.8) +geom_text(data = hitos, aes(x = Fecha, y =Inf, label = Etiqueta), vjust =1.2, hjust =1.1, angle =90, size =3.5, color ="#7F8C8D", inherit.aes =FALSE) +facet_wrap(~ Dimensión, scales ="free_y") +scale_color_manual(values = cols_dim) +labs(title ="Evolución de los Shocks en la agenda pública (2018-2026)",subtitle ="% de los titulares mensuales de Emol por dimensión",x =NULL, y ="% de titulares del mes") + tema +scale_y_continuous(expand =expansion(mult =c(0.05, 0.15)))
Figura 1: Dinámica temporal de las dimensiones analizadas frente a shocks sistémicos.
2. Auditoría Metodológica: Cobertura del Instrumento (OOV)
Aproximadamente el 40% de los titulares no contiene vocabulario reconocido por el modelo de sentimiento (OOV) y se excluye del análisis de tono. Esta exclusión no es aleatoria: una regresión logística muestra que la probabilidad de tener señal varía por actor (p. ej., mayor en titulares con Piñera y Chadwick, menor en los de Boric, Tohá y Quiroz).
Esto indica que el instrumento de NLP no mide con igual cobertura a todos los actores, por lo que las comparaciones de tono deben interpretarse estrictamente como condicionales a tener señal.
3. Minería Semántica y Modelamiento Estructural
El análisis de Log-Odds Ratio evidencia una rotación en el léxico asociado a la agenda de “Seguridad”. Entre 2018-2020 los gatilladores estuvieron fuertemente influenciados por probidad institucional (posiblemente asociado a casos de fraude en Carabineros), mientras que el periodo 2023-2026 está dominado por conceptos de crimen organizado (homicidio, secuestro, encerronas).
Mutación del Léxico en la Agenda de Seguridad mediante Log-Odds Ratio.
Controlando por mes y dimensión y corrigiendo por comparaciones múltiples (Holm), las diferencias de tono entre actores equivalentes de distintos gobiernos son moderadas y de evidencia limitada: Quiroz y Steinert presentan un tono más negativo que Marcel y Tohá respectivamente (≈ −0.07 y −0.06; \(p<0.05\) sin corregir, \(p_{holm}\approx0.09\)). En la Vocería no se detecta diferencia estadística, aunque los intervalos de confianza son amplios.
Contrastes de tono (OLS, efectos fijos de mes y dimensión, errores agrupados por mes).
Contraste
Diferencia
IC95
p
p_holm
Quiroz vs Marcel
-0.071
[-0.132, -0.010]
0.022
0.092
Steinert vs Tohá
-0.056
[-0.102, -0.009]
0.018
0.092
Arrau vs Tohá
-0.021
[-0.078, 0.036]
0.472
0.754
Sedini vs Vallejo
-0.033
[-0.105, 0.040]
0.377
0.754
Alvarado vs Vallejo
0.027
[-0.019, 0.073]
0.247
0.740
4. Dinámica Temporal: Prensa vs. Realidad (CEAD)
¿Existe co-movimiento entre la agenda mediática y los datos delictuales? A nivel descriptivo anual se observa una asociación alta, aunque influenciada por la tendencia de ambas series.
Asociación descriptiva anual entre la pauta de Emol y los casos policiales graves reales.
Para mitigar regresiones espurias, la serie se modeló mediante una ecuación OLS en primeras diferencias logarítmicas, utilizando errores estándar HAC (Newey-West). Los hallazgos principales son:
Co-movimiento contemporáneo: En primeras diferencias, un aumento de 1 punto porcentual en la tasa de crecimiento mensual de delitos se asocia con ≈ 0.60% de crecimiento en la proporción de titulares de Seguridad (\(p=0.003\)).
Sin evidencia de efectos rezagados: Los rezagos no son significativos, y el efecto acumulado a 3 meses es estadísticamente indistinguible de cero. El coeficiente negativo de la variable rezagada (\(\phi=-0.39\)) es consistente con el ruido de medición de proporciones mensuales al diferenciar, y no debe interpretarse necesariamente como un mecanismo de corrección editorial.
Limitación: Tras diferenciar, la serie de casos no es claramente estacionaria (ADF \(p=0.19\)), por lo que estos resultados de co-movimiento se consideran de carácter exploratorio.
Figura 2: Variación mensual del tono para actores seleccionados.
5. Conclusión Analítica
A partir de 148.540 titulares de Emol (2018-2026), este trabajo construye un pipeline reproducible de captura, etiquetado temático y medición de tono, y lo somete a un escrutinio estadístico explícito. Tres resultados sobreviven a ese escrutinio, y uno no.
1. La cobertura de seguridad co-varía con la actividad delictual registrada. En primeras diferencias logarítmicas, la elasticidad contemporánea entre el crecimiento de los casos del CEAD y el de la proporción de titulares de Seguridad es ≈ 0,60 (\(p = 0{,}003\); errores HAC). No se detectan efectos rezagados: el efecto acumulado a tres meses (0,09; IC95 \([-0{,}93;\ 1{,}11]\)) es indistinguible de cero, aunque el intervalo es demasiado amplio para descartar efectos relevantes. Dado que el léxico de la dimensión comparte vocabulario con las categorías del CEAD (homicidio, secuestro), parte de este co-movimiento es esperable por construcción; si la prensa amplifica o atenúa la criminalidad es una pregunta que este diseño no resuelve.
2. El instrumento de medición no cubre por igual a todos los actores. La probabilidad de que un titular contenga señal emocional detectable varía fuertemente según el actor (alta en titulares con Piñera y Chadwick; baja en los de Boric, Tohá y Quiroz). Toda comparación de tono es, por tanto, condicional a esa señal.
3. Las diferencias de tono entre actores son una tendencia, no una demostración. Los titulares con Quiroz y Steinert resultan más negativos que los de Marcel y Tohá (≈ −0,07 y −0.06; \(p \approx 0{,}02\) sin corregir), pero tras la corrección de Holm (\(p_{holm} \approx 0{,}09\)) no se supera el umbral convencional. En las vocerías no se detecta brecha, con intervalos amplios. Con la evidencia disponible no es posible afirmar un trato mediático asimétrico; la hipótesis queda planteada para una muestra mayor, a medida que los actores del gobierno actual acumulen meses de cobertura.
4. Un patrón que no debe sobreinterpretarse. El coeficiente negativo del rezago (\(\phi = -0{,}39\)) es el resultado esperable al diferenciar una proporción medida con error de muestreo, y no se interpreta como corrección editorial.
Límites. Los titulares son slugs de URL, no textos completos; el modelo de sentimiento es genérico, no entrenado en prensa; la serie de casos no es claramente estacionaria tras diferenciar (ADF \(p = 0{,}19\)); y el CEAD refleja en parte actividad policial, no sólo delito ocurrido. Los resultados de co-movimiento son, por ello, exploratorios.
Siguientes pasos. (i) Validar el sentimiento contra una anotación manual de una muestra de titulares; (ii) trabajar con titulares completos en lugar de slugs; (iii) contrastar con una fuente de victimización (p. ej., ENUSC) para reducir el sesgo de actividad policial; y (iv) ampliar la ventana de los actores del gobierno actual antes de contrastar hipótesis sobre trato diferenciado.
Notas
El diseño metodológico se desarrolló con asistencia de IA generativa (depuración de código y estructuración) y fue revisado y validado por el autor.↩︎