Clasificación y estructuración semiautomática de literatura científica sobre estadística cívica mediante modelos de lenguaje

Presentación Final

Juan Carlos Roa Anderson
Enver Gerald Tarazona Vargas

Contextualización y presentación del problema

Estadística cívica y recuperación de literatura científica

Contexto

La estadística cívica es un campo emergente de la educación estadística orientado a comprender y utilizar información basada en datos sobre asuntos públicos (Engel, 2019).

En el contexto universitario, busca desarrollar capacidades para interpretar datos, fuentes, representaciones, comparaciones y evidencia vinculadas con problemas sociales (Engel & Weber-Stein, 2024; Gal & Geiger, 2022).

Problema documental

La identificación de literatura pertinente se dificulta por:

  • terminología inestable y fronteras conceptuales difusas;
  • ausencia de un vocabulario estandarizado;
  • documentos relevantes que no utilizan necesariamente el término “estadística cívica”;
  • limitaciones de las búsquedas basadas únicamente en coincidencias literales (Huang et al., 2015; Salvador-Oliván et al., 2019; Vries et al., 2020).

Esto puede producir omisiones de documentos pertinentes, resultados ambiguos y mayor esfuerzo de revisión manual.

Formulación del problema

Dada la dificultad para reconocer y organizar literatura pertinente en un campo emergente con terminología inestable y fronteras conceptuales difusas, el presente estudio se centra en desarrollar y evaluar modelos de clasificación documental y modelos de estructuración temática de textos científicos, basados en modelos de lenguaje, que permitan identificar artículos de educación estadística relacionados con la estadística cívica, con énfasis en el contexto universitario, y organizarlos según sus temas, enfoques y tipos de estudio.

La unidad de análisis estará constituida por cada artículo académico o registro bibliográfico recuperado en corpus documentales especializados disponibles y de referencia, representado principalmente por datos textuales no estructurados y metadatos bibliográficos.

El desempeño de los modelos se contrastará con corpus de referencia y decisiones humanas previamente registradas, mediante métricas de clasificación documental y criterios de coherencia temática.

Idea central

  • Campo emergente
  • Terminología inestable
  • Fronteras conceptuales difusas

Tareas del proyecto

  • Clasificación documental
  • Estructuración temática

Unidad de análisis

  • Artículo académico
  • Registro bibliográfico

Objetivos del Proyecto

Objetivo general

Diseñar, desarrollar y evaluar modelos de clasificación documental y de estructuración temática, basados en modelos de lenguaje, orientados a apoyar la identificación y organización de literatura científica sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, a partir de corpus documentales especializados disponibles y de referencia.

Objetivos específicos

  1. Organizar, depurar y preparar los corpus documentales disponibles y de referencia, considerando sus textos disponibles, metadatos bibliográficos y criterios previos de clasificación o selección.

  2. Generar representaciones semánticas de los documentos, a partir de su información textual y metadatos bibliográficos, para su uso en modelos de clasificación documental y estructuración temática.

  1. Implementar y comparar modelos de clasificación documental para identificar artículos relacionados con la estadística cívica, contrastando sus resultados con corpus de referencia y decisiones humanas previamente registradas.

  2. Aplicar modelos de estructuración temática para organizar los documentos según sus temas, enfoques y tipos de estudio, y evaluar la coherencia e interpretabilidad de los resultados.

Trabajos Relacionados

Clasificación y recuperación documental

Estructuración temática de literatura científica

Metodología

Ruta metodológica del proyecto

1. Problema y métricas
↓
2. Auditoría de datos
↓
3. Diseño analítico
↓
4. Baselines
↓
5. Modelado
↓
6. Validación
↓
7. Análisis de errores y explicabilidad
↓
8. Criterios de éxito y operación

Principios transversales: reproducibilidad y trazabilidad · ética y cumplimiento · viabilidad operativa

Paso 1. Problema y métricas

Tarea analítica

Identificar documentos potencialmente pertinentes sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, para apoyar el cribado previo a la revisión a texto completo.

Unidad de análisis

Cada artículo o registro bibliográfico, representado inicialmente por:

  • título;
  • resumen;
  • palabras clave;
  • metadatos disponibles.

Alcance

  • El modelo apoya el cribado; no decide la inclusión final.
  • La unidad es documental; no existe un horizonte temporal predictivo.
  • Se asume inicialmente que título, resumen y palabras clave contienen información suficiente para el cribado.

Clasificación documental

  • Recall: proporción de documentos pertinentes recuperados.
  • Es la métrica principal porque el error más costoso es omitir un documento pertinente.

Métrica de uso

  • Work Saved over Sampling (WSS): ahorro de revisión al alcanzar un recall fijado.

\[ WSS@R = R-\frac{n_{\text{revisados}}}{N} \]

donde \(n_{\text{revisados}}\) es el número de documentos revisados, siguiendo el orden del modelo, hasta alcanzar \(R\).

Estructuración temática

  • Coh: coherencia de los documentos dentro del tema.
  • CDT: calidad de la descripción del tema.

Paso 2. Datos disponibles y consecuencia metodológica

Corpus positivo de referencia

Se utilizarán los 15 estudios incluidos en la revisión sistemática de Becerra Martín, Pinto Sosa y Vásquez Ortiz (Becerra Martín et al., 2025).

  • Periodo: 2015–2023
  • Contexto: educación superior
  • Dominio: estadística cívica
  • Selección mediante revisión sistemática con criterios explícitos.

¿Por qué este corpus?

  • revisión publicada;
  • selección documentada;
  • realizada por investigadores del campo;
  • externa al presente proyecto.

Funciona como referencia positiva del dominio.

Etiquetas disponibles

Tenemos:
15 documentos conocidos como pertinentes.

No tenemos:
una clase negativa documentada y reutilizable.

Los documentos excluidos de la revisión original no están disponibles con sus decisiones individuales.

¿Por qué no reconstruirlos?

Repetir hoy la búsqueda no reproduciría necesariamente la misma colección, porque cambian:

  • bases bibliográficas;
  • registros e indexación;
  • publicaciones disponibles.

Consecuencia

Positivos conocidos + documentos no etiquetados

No corresponde construir directamente un clasificador binario supervisado sin un nuevo proceso de etiquetado.

Paso 2. Estructura, auditoría y riesgos de los datos

Representación inicial

Cada documento se organizará en una estructura tabular con:

  • título;
  • resumen;
  • palabras clave;
  • autores, año, DOI, fuente e idioma;
  • otros metadatos disponibles.

Representación inicial: título + resumen + palabras clave

La misma representación se utilizará inicialmente para clasificación y estructuración temática.

El texto completo se evaluará posteriormente si aporta una mejora suficiente.

Saneamiento

Se documentarán reglas reproducibles para:

  • normalización;
  • faltantes;
  • duplicados;
  • consistencia de metadatos.

Auditoría

Se verificará:

  • disponibilidad de campos textuales;
  • cobertura de resúmenes en inglés;
  • faltantes;
  • DOI y metadatos;
  • duplicados;
  • acceso al texto completo;
  • solapamientos entre desarrollo y validación.

Riesgos

  • solo 15 positivos;
  • sesgos de cobertura e idioma;
  • data leakage;
  • heterogeneidad documental.

Ética y cumplimiento

  • no se prevén datos personales sensibles;
  • respeto de licencias y derechos de uso;
  • trazabilidad de fuentes y decisiones.

Si la cobertura de resúmenes en inglés es suficiente, se utilizará una representación lingüística común.

Paso 3. Diseño analítico

Clasificación documental

La estructura de los datos conduce a Positive-Unlabeled Learning (PU Learning):

  • P: 15 positivos conocidos.
  • U: colección candidata no etiquetada.
  • U puede contener documentos pertinentes y no pertinentes.
  • U no se considera una clase negativa.

PU Learning permite aprender con positivos conocidos sin disponer de negativos etiquetados (Bekker & Davis, 2020).

Representación

Se evaluarán:

  • representaciones semánticas;
  • atributos derivados del texto y metadatos;
  • longitud y presencia o frecuencia de términos relevantes.

Su construcción deberá evitar data leakage.

Construcción de U

Mediante recuperación bibliográfica reproducible a partir de:

  • búsquedas del dominio;
  • registros de revisiones sistemáticas;
  • artículos o proceedings de educación estadística.

Las etiquetas humanas disponibles se reservarán para validación o contraste externo.

Justificación

El problema es cercano a la expansión de conjuntos documentales: partir de pocos documentos conocidos para localizar nuevos documentos relacionados (Jacovi et al., 2021).

Flujo

P + U
↓
representaciones + atributos
↓
modelo PU
↓
puntuación de pertinencia
↓
cribado y revisión humana

Los documentos pertinentes pasarán posteriormente a la estructuración temática.

Paso 4. Baselines y criterios cuantitativos

Clasificación documental

Baseline: BM25 (Jacovi et al., 2021)

Métrica Referencia
Recall mínimo \(\geq 0.90\)
deseable \(\geq 0.95\)
WSS@95 \(\geq 0.10\)

Estructuración temática

Baseline: LDA (Eklund & Forsman, 2022)

Métrica Referencia
Coherencia temática (Coh) \(\geq 0.80\)
Calidad de descripción temática (CDT) \(\geq 3\) en escala 1–4
  • Coh ≥ 0.80: al menos 80 % de los documentos evaluados corresponden al tema central.
  • CDT ≥ 3: la descripción temática alcanza como mínimo una valoración buena.

Pasos 5 y 6. Modelado y validación

Paso 5. Modelado

Clasificación documental

Se evaluarán modelos compatibles con PU Learning, considerando:

  • pocos positivos;
  • ausencia de negativos etiquetados;
  • similitud semántica;
  • reproducibilidad y mantenibilidad;
  • desempeño frente al baseline.

Estructuración temática

Se compararán:

  • LDA como referencia;
  • embeddings;
  • agrupamiento semántico;
  • topic modeling;
  • Gibbs-BERTopic como alternativa híbrida.

El muestreo de Gibbs podría refinar las asignaciones temáticas y mejorar coherencia y estabilidad, especialmente en corpus pequeños, aunque con mayor costo computacional (Zhu & Liu, 2025).

Paso 6. Validación

Se utilizará un corpus independiente del empleado para desarrollar los modelos.

Alternativas

  1. Nueva búsqueda bibliográfica reproducible, con evaluación humana.

  2. Corpus externo previamente clasificado, con categorías o decisiones documentadas.

  3. Revisión sistemática previa del grupo, mantenida completamente fuera del entrenamiento.

Condiciones

  • sin solapamiento con desarrollo;
  • etiquetas humanas usadas solo para evaluación;
  • documentos pertinentes y no pertinentes;
  • selección final según cobertura, independencia y calidad de las etiquetas.

Pasos 7 y 8. Análisis de errores, producto y uso

Paso 7. Análisis de errores

Clasificación

Se analizarán:

  • falsos negativos, como error prioritario;
  • falsos positivos;
  • desacuerdos entre modelo y decisiones humanas;
  • patrones de error según características documentales.

Cuando sea posible, se examinará la contribución de los atributos o la similitud con documentos positivos.

Estructuración temática

Se revisarán:

  • temas con baja coherencia;
  • asignaciones poco consistentes;
  • temas difíciles de interpretar.

Paso 8. Éxito y operación

El método será satisfactorio si:

  • alcanza las referencias de los baselines;
  • reduce el esfuerzo de revisión humana.

Producto mínimo

Pipeline reproducible en R o Python para:

  • cargar nuevas colecciones;
  • procesarlas;
  • priorizar documentos;
  • estructurar temáticamente los pertinentes;
  • exportar resultados.

Monitoreo

Se registrarán versiones del corpus y del modelo y se reevaluará el desempeño ante cambios relevantes en fuentes, idioma o vocabulario.

Uso previsto: nueva colección → clasificación / priorización → revisión humana → elegibilidad a texto completo → estructuración temática

La decisión final de inclusión permanecerá a cargo del revisor humano.

Alcances éticos

Principios éticos y riesgos metodológicos

Transparencia

El corpus positivo fue definido previamente con participación de un integrante experto del equipo.

Para evitar sesgo en la validación:

  • será definida por un equipo humano suficientemente amplio;
  • permanecerá fuera del entrenamiento;
  • incluirá documentos positivos y negativos.

Los supuestos requeridos por el modelo PU seleccionado deberán explicitarse y fundamentarse.

Justicia y equidad

La equidad no se limitará a la ausencia de datos personales sensibles.

Se evaluará si existen diferencias sistemáticas de desempeño entre subgrupos documentales relevantes.

Un factor particular a auditar será el idioma, para verificar si la representación lingüística utilizada perjudica sistemáticamente a determinados documentos.

El análisis se sustentará en evidencia sobre el comportamiento del modelo entre estos grupos.

Responsabilidad

Clasificación documental

Se priorizará el desempeño del modelo, especialmente evitar que un artículo pertinente quede sin revisar.

Por ello, Recall será la métrica principal, Precision será complementaria y WSS permitirá comprobar el ahorro efectivo de revisión.

La interpretabilidad será útil para auditoría, pero no constituirá el criterio principal de selección del modelo.

Estructuración temática

La interpretabilidad sí será parte del resultado esperado: los temas obtenidos deberán ser coherentes y comprensibles para el investigador.

Stakeholders y medidas de mitigación

Stakeholders

Investigadores y revisores

Utilizarán el modelo para priorizar documentos y esperan ahorrar tiempo sin omitir artículos pertinentes.

Equipo de desarrollo y validación

Define los datos, modelos, métricas y procedimientos de evaluación.

Expertos de validación

Aportarán decisiones humanas independientes para evaluar el modelo.

Autores de los artículos

Pueden verse afectados indirectamente si un artículo pertinente queda fuera del proceso de revisión.

Medidas de mitigación

Validación independiente

Separar desarrollo y validación, mantener sus etiquetas fuera del entrenamiento e incluir positivos y negativos.

Trazabilidad

Documentar fuentes, transformaciones, decisiones, supuestos y versiones.

Evaluación

Analizar falsos positivos, falsos negativos, Recall, WSS y diferencias entre subgrupos relevantes.

Supervisión humana

El modelo apoyará la priorización del cribado, pero la decisión final de inclusión permanecerá a cargo del revisor humano.

Referencias

Becerra Martín, D. I., Pinto Sosa, J. E., & Vásquez Ortiz, C. (2025). La estadística cívica, la ciudadanía y el pensamiento críticos en educación superior: Una revisión sistemática. Investigación e Innovación En Matemática Educativa, 10. https://doi.org/10.46618/iime.258
Bekker, J., & Davis, J. (2020). Learning from positive and unlabeled data: A survey. Machine Learning, 109, 719–760. https://doi.org/10.1007/s10994-020-05877-5
Carnevali, J. C., Rossi, R. G., Milios, E., & Lopes, A. de A. (2021). A graph-based approach for positive and unlabeled learning. Information Sciences, 580, 655–672. https://doi.org/10.1016/j.ins.2021.08.099
Cohen, A. M., Hersh, W. R., Peterson, K., & Yen, P.-Y. (2006). Reducing workload in systematic review preparation using automated citation classification. Journal of the American Medical Informatics Association, 13(2), 206–219. https://doi.org/10.1197/jamia.M1929
Eklund, A., & Forsman, M. (2022). Topic modeling by clustering language model embeddings: Human validation on an industry dataset. Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing: Industry Track, 635–643. https://doi.org/10.18653/v1/2022.emnlp-industry.65
Engel, J. (2019). Cultura estadística y sociedad. In J. M. Contreras, M. M. Gea, M. M. López-Martín, & E. Molina-Portillo (Eds.), Actas del tercer congreso internacional virtual de educación estadística. http://www.ugr.es/local/fqm126/civeest.html
Engel, J., & Weber-Stein, F. (2024). Teaching social science students to think with data. Proceedings of the IASE 2023 Satellite Conference: Fostering Learning of Statistics and Data Science. https://doi.org/10.52041/iase2023.114
Feng, Y., Liang, S., Zhang, Y., Chen, S., Wang, Q., Huang, T., Sun, F., Liu, X., Zhu, H., & Pan, H. (2022). Automated medical literature screening using artificial intelligence: A systematic review and meta-analysis. Journal of the American Medical Informatics Association, 29(8), 1425–1432. https://doi.org/10.1093/jamia/ocac066
Ferdinands, G., Schram, R., Bruin, J. de, Bagheri, A., Oberski, D. L., Tummers, L., Teijema, J. J., & Schoot, R. van de. (2023). Performance of active learning models for screening prioritization in systematic reviews: A simulation study into the average time to discover relevant records. Systematic Reviews, 12, 100. https://doi.org/10.1186/s13643-023-02257-7
Gal, I., & Geiger, V. (2022). Welcome to the era of vague news: A study of the demands of statistical and mathematical products in the COVID-19 pandemic media. Educational Studies in Mathematics, 111(1), 5–28. https://doi.org/10.1007/s10649-022-10151-7
Harmsen, W., Groot, J. de, Harkema, A., Dusseldorp, I. van, Bruin, J. de, Brand, S. van den, & Schoot, R. van de. (2024). Machine learning to optimize literature screening in medical guideline development. Systematic Reviews, 13, 177. https://doi.org/10.1186/s13643-024-02590-5
Howard, B. E., Phillips, J., Miller, K., Tandon, A., Mav, D., Shah, M. R., Holmgren, S., Pelch, K. E., Walker, V., Rooney, A. A., Macleod, M., Shah, R. R., & Thayer, K. (2016). SWIFT-review: A text-mining workbench for systematic review. Systematic Reviews, 5, 87. https://doi.org/10.1186/s13643-016-0263-z
Huang, Y., Schuehle, J., Porter, A. L., & Youtie, J. (2015). A systematic method to create search strategies for emerging technologies based on the web of science: Illustrated for “Big Data”. Scientometrics, 105(3), 2005–2022. https://doi.org/10.1007/s11192-015-1638-y
Jacovi, A., Niu, G., Goldberg, Y., & Sugiyama, M. (2021). Scalable evaluation and improvement of document set expansion via neural positive-unlabeled learning. Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume, 581–592. https://doi.org/10.18653/v1/2021.eacl-main.47
Kebede, M. M., Le Cornet, C., & Fortner, R. T. (2023). In-depth evaluation of machine learning methods for semi-automating article screening in a systematic review of mechanistic literature. Research Synthesis Methods, 14(2), 156–172. https://doi.org/10.1002/jrsm.1589
Kim, S., Lee, S., & Yoon, B. (2022). Development of an embedding framework for clustering scientific papers. IEEE Access, 10, 32608–32621. https://doi.org/10.1109/ACCESS.2022.3160826
Misuraca, M. (2026). Text mining in bibliometrics and science mapping: A methodological review. Wiley Interdisciplinary Reviews: Computational Statistics, 18(2), e70066. https://doi.org/10.1002/wics.70066
Pratama, F. A. A., Arief, M. E. N., & Nastiti, V. R. S. (2026). A comparative analysis of transformer-based topic modeling pipelines for scientific literature. JUITA: Jurnal Informatika, 14(1), 101–109. https://doi.org/10.30595/juita.v14i1.28346
Rahimi, H., Mimno, D., Hoover, J., Naacke, H., Constantin, C., & Amann, B. (2024). Contextualized topic coherence metrics. Findings of the Association for Computational Linguistics: EACL 2024, 1760–1773. https://doi.org/10.18653/v1/2024.findings-eacl.123
Repke, T., Tinsdeall, F., Danilenko, D., Graziosi, S., Müller-Hansen, F., Schmidt, L., Thomas, J., & Valkenhoef, G. van. (2026). Don’t stop me now, ‘cause i’m having a good time screening: Evaluation of stopping methods for safe use of priority screening in systematic reviews. Cochrane Evidence Synthesis and Methods, 4(1), e70068. https://doi.org/10.1002/cesm.70068
Rumadi, R., Yoganingrum, A., Wicaksono, B. K. P., Adkara, E., Yulianti, Y. A., Okutra, M. D. D., Putri, L. A., & Nadira, C. A. (2025). A comparative analysis of topic coherence across textual inputs and modelling algorithms in scientific literature. 2025 International Conference on Computer, Control, Informatics and Its Applications (IC3INA). https://doi.org/10.1109/IC3INA68387.2025.11325494
Salvador-Oliván, J. A., Marco-Cuenca, G., & Arquero-Avilés, R. (2019). Errors in search strategies used in systematic reviews and their effects on information retrieval. Journal of the Medical Library Association, 107(2), 210–221. https://doi.org/10.5195/jmla.2019.567
Stein, V., Merino-Benitez, T., Weiser, A., & Lang, D. J. (2026). Reading between the lines: A systematic approach to identifying underlying concepts in scientific literature – the case of interfaces between disciplinary lenses and real-world laboratory research. Scientometrics, 131(9), 6519–6544. https://doi.org/10.1007/s11192-026-05757-0
Šubelj, L., Eck, N. J. van, & Waltman, L. (2016). Clustering scientific publications based on citation relations: A systematic comparison of different methods. PLOS ONE, 11(4), e0154404. https://doi.org/10.1371/journal.pone.0154404
Vries, B. P. P. de, Smeden, M. van, Rosendaal, F. R., & Groenwold, R. H. H. (2020). Title, abstract, and keyword searching resulted in poor recovery of articles in systematic reviews of epidemiologic practice. Journal of Clinical Epidemiology, 121, 55–61. https://doi.org/10.1016/j.jclinepi.2020.01.009
Zhu, Y., & Liu, Y. (2025). Gibbs-BERTopic: A hybrid approach for short text topic modeling. IEEE Access, 13, 49162–49173. https://doi.org/10.1109/ACCESS.2025.3552221
Zupic, I., Vinayavekhin, S., & Caputo, A. (2024). Topic modeling in literature reviews. Academy of Management Proceedings, 1, 16144. https://doi.org/10.5465/AMPROC.2024.16144abstract