Video de avance #3 – Propuesta metodológica + descripción inicial de datos disponibles
Definir la propuesta metodológica del proyecto, organizando las principales etapas que se seguirán para abordar el problema planteado.
Describir inicialmente los datos disponibles, considerando su origen, tipo, formato, cantidad aproximada y calidad.
Justificar la pertinencia de la metodología y de los datos disponibles para el desarrollo posterior del proyecto.
Analizar los principales alcances éticos asociados al desarrollo y uso de la propuesta.
Objetivo general
Diseñar, desarrollar y evaluar modelos de clasificación documental y de estructuración temática, basados en modelos de lenguaje, orientados a apoyar la identificación y organización de literatura científica sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, a partir de corpus documentales especializados disponibles y de referencia.
Objetivos específicos
Organizar, depurar y preparar los corpus documentales disponibles y de referencia, considerando sus textos disponibles, metadatos bibliográficos y criterios previos de clasificación o selección.
Generar representaciones semánticas de los documentos, a partir de su información textual y metadatos bibliográficos, para su uso en modelos de clasificación documental y estructuración temática.
Implementar y comparar modelos de clasificación documental para identificar artículos relacionados con la estadística cívica, contrastando sus resultados con corpus de referencia y decisiones humanas previamente registradas.
Aplicar modelos de estructuración temática para organizar los documentos según sus temas, enfoques y tipos de estudio, y evaluar la coherencia e interpretabilidad de los resultados.
1. Problema y métricas
↓
2. Auditoría de datos
↓
3. Diseño analítico
↓
4. Baselines
↓
5. Modelado
↓
6. Validación
↓
7. Análisis de errores y explicabilidad
↓
8. Criterios de éxito y operación
Principios transversales: reproducibilidad y trazabilidad · ética y cumplimiento · viabilidad operativa
Identificar, dentro de una colección de literatura científica, los documentos potencialmente pertinentes sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, para apoyar su cribado previo a la revisión a texto completo y organizar posteriormente la literatura identificada según su estructura temática.
Cada artículo académico o registro bibliográfico, representado principalmente mediante:
La clasificación priorizará la recuperación de documentos pertinentes y, condicionada a ella, la reducción del trabajo de revisión humana.
Se propone utilizar como corpus positivo de referencia los estudios incluidos en la revisión sistemática de Becerra Martín, Pinto Sosa y Vásquez Ortiz (Becerra Martín et al., 2025).
| Estudio | Año | Estudio | Año |
|---|---|---|---|
| Biehler et al. | 2018 | Engel | 2019 |
| Engel y Martignon | 2022 | Engel et al. | 2022 |
| François y Monteiro | 2022 | Frischemeier et al. | 2018 |
| Giordano et al. | 2022 | González-Lozano y Aravena-Domich | 2023 |
| Guglielmone | 2021 | Kovacs et al. | 2022 |
| Podworny et al. | 2018 | Ridgway | 2022 |
| Ridgway et al. | 2018 | Schiller y Engel | 2016 |
| Tauber | 2021 |
Fuente: elaboración propia a partir de Becerra et al. (2025).
Corpus positivo de referencia
↓
caracterización semántica del dominio
↓
aplicación sobre nuevas colecciones documentales
↓
identificación de documentos potencialmente pertinentes
15 documentos positivos
Una clase negativa documentada
Repetir actualmente la estrategia de búsqueda no garantiza recuperar exactamente la misma colección documental:
Positivos conocidos + ausencia de negativos etiquetados
Con los datos actualmente disponibles no puede construirse directamente un conjunto de entrenamiento binario supervisado sin realizar un nuevo proceso de etiquetado.
El diseño analítico deberá ser compatible con esta estructura de datos.
Cada observación corresponderá a un artículo científico, asociado a información textual y metadatos bibliográficos.
La representación inicial estará constituida principalmente por:
Título + resumen + palabras clave
Esta información corresponde a la disponible durante la fase de cribado, antes de la evaluación de elegibilidad a texto completo.
La información será estandarizada en una estructura tabular:
Se utilizará inicialmente la misma representación textual. La utilidad adicional del texto completo podrá evaluarse posteriormente.
Antes del modelado se verificará:
Se documentarán reglas reproducibles para:
Tamaño y cobertura
Sesgos
Leakage
Si existe cobertura suficiente de resúmenes en inglés, se utilizará una representación lingüística común.
La estructura de los datos conduce a un esquema de Positive-Unlabeled Learning (PU Learning):
U no se consideran negativos.El aprendizaje PU permite trabajar con positivos conocidos sin disponer de una clase negativa etiquetada (Bekker & Davis, 2020).
P + U
↓
representación semántica
↓
modelo PU
↓
puntuación o clasificación de pertinencia
↓
cribado y revisión humana
ULa colección candidata se obtendrá mediante una estrategia de recuperación bibliográfica reproducible.
Posibles fuentes:
Las etiquetas humanas o categorías temáticas disponibles se reservarán, cuando corresponda, para validación o contraste externo.
El diseño es cercano a la expansión de conjuntos documentales: partir de pocos documentos conocidos para identificar nuevos documentos relacionados en otra colección (Jacovi et al., 2021).
Los documentos finalmente pertinentes se organizarán mediante representaciones semánticas, agrupamiento y topic modeling.
Método de referencia: BM25
BM25 constituye un baseline fuerte en problemas de expansión de conjuntos documentales con PU Learning (Jacovi et al., 2021).
| Métrica | Referencia |
|---|---|
| Recall | mínimo \(\geq 0.90\) |
| deseable \(\geq 0.95\) | |
| WSS@95 | \(\geq 0.10\) |
Método de referencia: LDA
LDA constituye un enfoque clásico de topic modeling y una referencia para comparar métodos basados en representaciones semánticas (Eklund & Forsman, 2022).
| Métrica | Referencia |
|---|---|
| Coherencia temática (Coh) | \(\geq 0.80\) |
| Calidad de descripción temática (CDT) | \(\geq 3\) en escala 1–4 |
Clasificación documental
Se evaluarán modelos compatibles con Positive-Unlabeled Learning, utilizando representaciones semánticas de título, resumen y palabras clave (Bekker & Davis, 2020; Jacovi et al., 2021).
La selección del modelo concreto considerará:
Estructuración temática
Sobre los documentos pertinentes se evaluarán métodos de:
Estos métodos se contrastarán con el baseline definido mediante LDA.
La validación se realizará sobre un corpus independiente del utilizado para desarrollar los modelos.
Nueva búsqueda bibliográfica reproducible, con evaluación humana posterior de los documentos recuperados.
Corpus externo previamente clasificado, por ejemplo colecciones o proceedings que dispongan de categorías o decisiones documentadas.
Corpus de una revisión sistemática previa del grupo, con decisiones humanas de inclusión y exclusión ya registradas y mantenido completamente fuera del entrenamiento.
La alternativa definitiva se seleccionará después de auditar su cobertura, independencia y calidad de las etiquetas.
Clasificación documental
Se analizarán especialmente:
Cuando el modelo lo permita, se examinarán los elementos que contribuyen a la clasificación o la similitud con documentos positivos de referencia.
Estructuración temática
Se revisarán:
El método se considerará satisfactorio si alcanza las referencias definidas en los baselines y reduce el esfuerzo de revisión humana.
Implementación prevista
Producto mínimo: pipeline reproducible en R o Python para:
Monitoreo
Se registrarán las versiones del corpus y del modelo y se reevaluará su desempeño ante cambios relevantes en las fuentes, el idioma o el vocabulario del dominio.
Uso previsto: nueva colección documental → clasificación / priorización → revisión humana → elegibilidad a texto completo → estructuración temática
La decisión final de inclusión permanecerá a cargo del revisor humano.
Completar la auditoría inicial de los datos, especialmente la disponibilidad y homogeneidad de la información textual.
Seleccionar definitivamente la colección de documentos no etiquetados (U) y el corpus independiente de validación.
Consolidar las decisiones metodológicas, incorporar las observaciones recibidas y preparar la presentación final del curso.