Clasificación y estructuración semiautomática de literatura científica sobre estadística cívica mediante modelos de lenguaje

Video de avance #3 – Propuesta metodológica + descripción inicial de datos disponibles

Juan Carlos Roa Anderson
Enver Gerald Tarazona Vargas

Objetivos de la semana

  • Definir la propuesta metodológica del proyecto, organizando las principales etapas que se seguirán para abordar el problema planteado.

  • Describir inicialmente los datos disponibles, considerando su origen, tipo, formato, cantidad aproximada y calidad.

  • Justificar la pertinencia de la metodología y de los datos disponibles para el desarrollo posterior del proyecto.

  • Analizar los principales alcances éticos asociados al desarrollo y uso de la propuesta.

Recordatorio del proyecto

Objetivo general

Diseñar, desarrollar y evaluar modelos de clasificación documental y de estructuración temática, basados en modelos de lenguaje, orientados a apoyar la identificación y organización de literatura científica sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, a partir de corpus documentales especializados disponibles y de referencia.

Objetivos específicos

  1. Organizar, depurar y preparar los corpus documentales disponibles y de referencia, considerando sus textos disponibles, metadatos bibliográficos y criterios previos de clasificación o selección.

  2. Generar representaciones semánticas de los documentos, a partir de su información textual y metadatos bibliográficos, para su uso en modelos de clasificación documental y estructuración temática.

  1. Implementar y comparar modelos de clasificación documental para identificar artículos relacionados con la estadística cívica, contrastando sus resultados con corpus de referencia y decisiones humanas previamente registradas.

  2. Aplicar modelos de estructuración temática para organizar los documentos según sus temas, enfoques y tipos de estudio, y evaluar la coherencia e interpretabilidad de los resultados.

Metodología

Ruta metodológica del proyecto

1. Problema y métricas

2. Auditoría de datos

3. Diseño analítico

4. Baselines

5. Modelado

6. Validación

7. Análisis de errores y explicabilidad

8. Criterios de éxito y operación

Principios transversales: reproducibilidad y trazabilidad · ética y cumplimiento · viabilidad operativa

Paso 1. Problema y métricas

Problema

Identificar, dentro de una colección de literatura científica, los documentos potencialmente pertinentes sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, para apoyar su cribado previo a la revisión a texto completo y organizar posteriormente la literatura identificada según su estructura temática.

Unidad de análisis

Cada artículo académico o registro bibliográfico, representado principalmente mediante:

  • título;
  • resumen;
  • palabras clave;
  • metadatos bibliográficos disponibles.

Alcance y supuesto inicial

  • El modelo apoyará el cribado, no la decisión final de inclusión.
  • No existe un horizonte temporal predictivo: la unidad es documental.
  • Se asume inicialmente que título, resumen y palabras clave contienen información suficiente para apoyar el cribado.

Clasificación documental

  • Recall: proporción de documentos pertinentes que son recuperados por el método.
  • Se considera la métrica principal, porque el error más costoso durante el cribado es omitir un documento que realmente era pertinente.

Métrica de uso

  • Work Saved over Sampling (WSS): cuantifica cuánto trabajo de revisión manual puede evitarse manteniendo un determinado nivel de recall.

Estructuración temática

  • Coherencia temática (Coh): evalúa en qué medida los documentos agrupados corresponden al tema identificado.
  • Calidad de descripción temática (CDT): evalúa qué tan adecuadamente las palabras o etiquetas representan el contenido del tema.

Prioridad

La clasificación priorizará la recuperación de documentos pertinentes y, condicionada a ella, la reducción del trabajo de revisión humana.

Paso 2. Datos disponibles: corpus de referencia

Origen

Se propone utilizar como corpus positivo de referencia los estudios incluidos en la revisión sistemática de Becerra Martín, Pinto Sosa y Vásquez Ortiz (Becerra Martín et al., 2025).

  • Estudios incluidos: 15
  • Periodo: 2015–2023
  • Contexto: educación superior
  • Dominio: estadística cívica
  • Selección: revisión sistemática basada en PRISMA y criterios de inclusión explícitos

¿Por qué utilizar este corpus?

  • Corresponde a una revisión sistemática publicada.
  • Los documentos fueron seleccionados mediante criterios explícitos y documentados.
  • La selección fue realizada por investigadores del campo.
  • Constituye una referencia externa al presente proyecto.
  • Proporciona un conjunto de documentos previamente reconocidos como pertinentes para el dominio de interés.

Estudios incluidos

Estudio Año Estudio Año
Biehler et al. 2018 Engel 2019
Engel y Martignon 2022 Engel et al. 2022
François y Monteiro 2022 Frischemeier et al. 2018
Giordano et al. 2022 González-Lozano y Aravena-Domich 2023
Guglielmone 2021 Kovacs et al. 2022
Podworny et al. 2018 Ridgway 2022
Ridgway et al. 2018 Schiller y Engel 2016
Tauber 2021

Fuente: elaboración propia a partir de Becerra et al. (2025).

Función prevista

Corpus positivo de referencia

caracterización semántica del dominio

aplicación sobre nuevas colecciones documentales

identificación de documentos potencialmente pertinentes

Paso 2. Etiquetas disponibles y consecuencia metodológica

Lo que tenemos

15 documentos positivos

  • Identificados como pertinentes en una revisión sistemática publicada.
  • Con criterios de inclusión previamente definidos.
  • Disponibles como referencia positiva para el dominio.

Lo que no tenemos

Una clase negativa documentada

  • La publicación no proporciona un corpus reutilizable con los documentos excluidos y sus respectivas decisiones de clasificación.
  • Por tanto, los documentos no incluidos no pueden asumirse automáticamente como negativos.

¿Por qué no reconstruir los negativos?

Repetir actualmente la estrategia de búsqueda no garantiza recuperar exactamente la misma colección documental:

  • las bases bibliográficas se actualizan;
  • aparecen nuevas publicaciones;
  • pueden variar registros e indexación;
  • no sería posible atribuir a los autores originales una decisión sobre esos nuevos resultados.

Consecuencia

Positivos conocidos + ausencia de negativos etiquetados

Con los datos actualmente disponibles no puede construirse directamente un conjunto de entrenamiento binario supervisado sin realizar un nuevo proceso de etiquetado.

El diseño analítico deberá ser compatible con esta estructura de datos.

Paso 2. Estructura y formato de los datos

Unidad documental

Cada observación corresponderá a un artículo científico, asociado a información textual y metadatos bibliográficos.

Información textual

  • Título
  • Resumen (abstract)
  • Palabras clave
  • Texto completo, cuando esté disponible y resulte necesario

Metadatos

  • Autores
  • Año de publicación
  • DOI
  • Revista o fuente
  • Idioma
  • Otros metadatos disponibles

Representación para clasificación

La representación inicial estará constituida principalmente por:

Título + resumen + palabras clave

Esta información corresponde a la disponible durante la fase de cribado, antes de la evaluación de elegibilidad a texto completo.

Formato analítico

La información será estandarizada en una estructura tabular:

  • una fila por documento;
  • metadatos en campos estructurados;
  • campos textuales para generar representaciones semánticas.

Estructuración temática

Se utilizará inicialmente la misma representación textual. La utilidad adicional del texto completo podrá evaluarse posteriormente.

Paso 2. Auditoría de calidad, riesgos y cumplimiento

Auditoría de los datos

Antes del modelado se verificará:

  • disponibilidad de título, resumen y palabras clave;
  • cobertura de resúmenes en inglés;
  • presencia y patrón de datos faltantes;
  • consistencia de DOI y metadatos;
  • documentos duplicados;
  • acceso y condiciones de uso del texto completo, cuando sea requerido;
  • posibles solapamientos entre desarrollo y validación.

Plan de saneamiento

Se documentarán reglas reproducibles para:

  • normalización de campos y metadatos;
  • tratamiento de faltantes;
  • identificación y eliminación de duplicados;
  • registro de las decisiones aplicadas al corpus.

Riesgos

Tamaño y cobertura

  • Solo se dispone inicialmente de 15 positivos.
  • El método deberá ser adecuado para pocos positivos.

Sesgos

  • El corpus refleja los criterios de búsqueda e inclusión de una revisión específica.
  • Se evaluarán posibles sesgos de cobertura e idioma.

Leakage

  • Los documentos utilizados para desarrollo y validación deberán permanecer separados.

Ética y cumplimiento

  • No se prevé utilizar datos personales sensibles.
  • Se respetarán las licencias y derechos de uso de los documentos.
  • Se mantendrá la trazabilidad de las fuentes y de las decisiones de procesamiento.

Decisión sobre idioma

Si existe cobertura suficiente de resúmenes en inglés, se utilizará una representación lingüística común.

Paso 3. Diseño analítico

Clasificación documental

La estructura de los datos conduce a un esquema de Positive-Unlabeled Learning (PU Learning):

  • P — Positivos conocidos: los 15 documentos del corpus de referencia.
  • U — Documentos no etiquetados: una colección candidata que puede contener documentos pertinentes y no pertinentes.
  • Los documentos de U no se consideran negativos.

El aprendizaje PU permite trabajar con positivos conocidos sin disponer de una clase negativa etiquetada (Bekker & Davis, 2020).

Flujo previsto

P + U

representación semántica

modelo PU

puntuación o clasificación de pertinencia

cribado y revisión humana

Construcción de U

La colección candidata se obtendrá mediante una estrategia de recuperación bibliográfica reproducible.

Posibles fuentes:

  • búsquedas bibliográficas basadas en términos del dominio;
  • registros de una revisión sistemática;
  • artículos o proceedings de eventos de educación estadística.

Las etiquetas humanas o categorías temáticas disponibles se reservarán, cuando corresponda, para validación o contraste externo.

Justificación

El diseño es cercano a la expansión de conjuntos documentales: partir de pocos documentos conocidos para identificar nuevos documentos relacionados en otra colección (Jacovi et al., 2021).

Estructuración temática

Los documentos finalmente pertinentes se organizarán mediante representaciones semánticas, agrupamiento y topic modeling.

Paso 4. Baselines

Clasificación documental

Método de referencia: BM25

BM25 constituye un baseline fuerte en problemas de expansión de conjuntos documentales con PU Learning (Jacovi et al., 2021).

Métrica Referencia
Recall mínimo \(\geq 0.90\)
deseable \(\geq 0.95\)
WSS@95 \(\geq 0.10\)
  • Recall ≥ 0.90: criterio mínimo inicial. Valores de 0.90 y 0.95 se utilizan como objetivos de recuperación en estudios de cribado automatizado (Repke et al., 2026).
  • Recall ≥ 0.95: referencia deseable para minimizar la pérdida de estudios pertinentes (Feng et al., 2022).
  • WSS@95 ≥ 0.10: referencia pragmática de ahorro de trabajo manteniendo 95 % de recall (Cohen et al., 2006).

Estructuración temática

Método de referencia: LDA

LDA constituye un enfoque clásico de topic modeling y una referencia para comparar métodos basados en representaciones semánticas (Eklund & Forsman, 2022).

Métrica Referencia
Coherencia temática (Coh) \(\geq 0.80\)
Calidad de descripción temática (CDT) \(\geq 3\) en escala 1–4
  • Coh ≥ 0.80: al menos 80 % de los documentos evaluados deben corresponder al tema central (Eklund & Forsman, 2022).
  • CDT ≥ 3: las palabras que describen el tema deben alcanzar como mínimo una valoración buena en la escala utilizada por Eklund y Forsman (Eklund & Forsman, 2022).

Pasos 5 y 6. Modelado y validación

Paso 5. Modelado

Clasificación documental

Se evaluarán modelos compatibles con Positive-Unlabeled Learning, utilizando representaciones semánticas de título, resumen y palabras clave (Bekker & Davis, 2020; Jacovi et al., 2021).

La selección del modelo concreto considerará:

  • adecuación al escenario de pocos positivos;
  • ausencia de una clase negativa etiquetada;
  • capacidad para representar similitud semántica;
  • desempeño respecto del baseline.

Estructuración temática

Sobre los documentos pertinentes se evaluarán métodos de:

  • embeddings;
  • agrupamiento semántico;
  • topic modeling.

Estos métodos se contrastarán con el baseline definido mediante LDA.

Paso 6. Validación

La validación se realizará sobre un corpus independiente del utilizado para desarrollar los modelos.

Alternativas identificadas

  1. Nueva búsqueda bibliográfica reproducible, con evaluación humana posterior de los documentos recuperados.

  2. Corpus externo previamente clasificado, por ejemplo colecciones o proceedings que dispongan de categorías o decisiones documentadas.

  3. Corpus de una revisión sistemática previa del grupo, con decisiones humanas de inclusión y exclusión ya registradas y mantenido completamente fuera del entrenamiento.

Condiciones comunes

  • ausencia de solapamiento con los datos de desarrollo;
  • etiquetas humanas utilizadas solo para evaluación;
  • presencia de documentos pertinentes y no pertinentes para valorar la clasificación.

La alternativa definitiva se seleccionará después de auditar su cobertura, independencia y calidad de las etiquetas.

Pasos 7 y 8. Análisis de errores y uso previsto

Paso 7. Análisis de errores

Clasificación documental

Se analizarán especialmente:

  • falsos negativos, por constituir el error más crítico;
  • falsos positivos;
  • desacuerdos entre modelo y decisiones humanas;
  • patrones de error según características documentales.

Cuando el modelo lo permita, se examinarán los elementos que contribuyen a la clasificación o la similitud con documentos positivos de referencia.

Estructuración temática

Se revisarán:

  • temas con baja coherencia;
  • asignaciones poco consistentes;
  • temas de difícil interpretación.

Paso 8. Éxito y operación

El método se considerará satisfactorio si alcanza las referencias definidas en los baselines y reduce el esfuerzo de revisión humana.

Implementación prevista

Producto mínimo: pipeline reproducible en R o Python para:

  • cargar y procesar nuevas colecciones;
  • generar prioridades para el cribado;
  • estructurar temáticamente los documentos pertinentes;
  • exportar los resultados.

Monitoreo

Se registrarán las versiones del corpus y del modelo y se reevaluará su desempeño ante cambios relevantes en las fuentes, el idioma o el vocabulario del dominio.

Uso previsto: nueva colección documental → clasificación / priorización → revisión humana → elegibilidad a texto completo → estructuración temática

La decisión final de inclusión permanecerá a cargo del revisor humano.

Dificultades y próximos pasos

  • Completar la auditoría inicial de los datos, especialmente la disponibilidad y homogeneidad de la información textual.

  • Seleccionar definitivamente la colección de documentos no etiquetados (U) y el corpus independiente de validación.

  • Consolidar las decisiones metodológicas, incorporar las observaciones recibidas y preparar la presentación final del curso.

Referencias

Becerra Martín, D. I., Pinto Sosa, J. E., & Vásquez Ortiz, C. (2025). La estadística cívica, la ciudadanía y el pensamiento críticos en educación superior: Una revisión sistemática. Investigación e Innovación En Matemática Educativa, 10. https://doi.org/10.46618/iime.258
Bekker, J., & Davis, J. (2020). Learning from positive and unlabeled data: A survey. Machine Learning, 109, 719–760. https://doi.org/10.1007/s10994-020-05877-5
Cohen, A. M., Hersh, W. R., Peterson, K., & Yen, P.-Y. (2006). Reducing workload in systematic review preparation using automated citation classification. Journal of the American Medical Informatics Association, 13(2), 206–219. https://doi.org/10.1197/jamia.M1929
Eklund, A., & Forsman, M. (2022). Topic modeling by clustering language model embeddings: Human validation on an industry dataset. Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing: Industry Track, 635–643. https://doi.org/10.18653/v1/2022.emnlp-industry.65
Feng, Y., Liang, S., Zhang, Y., Chen, S., Wang, Q., Huang, T., Sun, F., Liu, X., Zhu, H., & Pan, H. (2022). Automated medical literature screening using artificial intelligence: A systematic review and meta-analysis. Journal of the American Medical Informatics Association, 29(8), 1425–1432. https://doi.org/10.1093/jamia/ocac066
Jacovi, A., Niu, G., Goldberg, Y., & Sugiyama, M. (2021). Scalable evaluation and improvement of document set expansion via neural positive-unlabeled learning. Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume, 581–592. https://doi.org/10.18653/v1/2021.eacl-main.47
Repke, T., Tinsdeall, F., Danilenko, D., Graziosi, S., Müller-Hansen, F., Schmidt, L., Thomas, J., & Valkenhoef, G. van. (2026). Don’t stop me now, ‘cause i’m having a good time screening: Evaluation of stopping methods for safe use of priority screening in systematic reviews. Cochrane Evidence Synthesis and Methods, 4(1), e70068. https://doi.org/10.1002/cesm.70068