Presentación Final
La estadística cívica es un campo emergente de la educación estadística orientado a comprender y utilizar información basada en datos sobre asuntos públicos (Engel, 2019).
En el contexto universitario, busca desarrollar capacidades para interpretar datos, fuentes, representaciones, comparaciones y evidencia vinculadas con problemas sociales (Engel & Weber-Stein, 2024; Gal & Geiger, 2022).
La identificación de literatura pertinente se dificulta por:
Esto puede producir omisiones de documentos pertinentes, resultados ambiguos y mayor esfuerzo de revisión manual.
Dada la dificultad para reconocer y organizar literatura pertinente en un campo emergente con terminología inestable y fronteras conceptuales difusas, el presente estudio se centra en desarrollar y evaluar modelos de clasificación documental y modelos de estructuración temática de textos científicos, basados en modelos de lenguaje, que permitan identificar artículos de educación estadística relacionados con la estadística cívica, con énfasis en el contexto universitario, y organizarlos según sus temas, enfoques y tipos de estudio.
La unidad de análisis estará constituida por cada artículo académico o registro bibliográfico recuperado en corpus documentales especializados disponibles y de referencia, representado principalmente por datos textuales no estructurados y metadatos bibliográficos.
El desempeño de los modelos se contrastará con corpus de referencia y decisiones humanas previamente registradas, mediante métricas de clasificación documental y criterios de coherencia temática.
Objetivo general
Diseñar, desarrollar y evaluar modelos de clasificación documental y de estructuración temática, basados en modelos de lenguaje, orientados a apoyar la identificación y organización de literatura científica sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, a partir de corpus documentales especializados disponibles y de referencia.
Objetivos específicos
Organizar, depurar y preparar los corpus documentales disponibles y de referencia, considerando sus textos disponibles, metadatos bibliográficos y criterios previos de clasificación o selección.
Generar representaciones semánticas de los documentos, a partir de su información textual y metadatos bibliográficos, para su uso en modelos de clasificación documental y estructuración temática.
Implementar y comparar modelos de clasificación documental para identificar artículos relacionados con la estadística cívica, contrastando sus resultados con corpus de referencia y decisiones humanas previamente registradas.
Aplicar modelos de estructuración temática para organizar los documentos según sus temas, enfoques y tipos de estudio, y evaluar la coherencia e interpretabilidad de los resultados.
1. Problema y métricas
↓
2. Auditoría de datos
↓
3. Diseño analítico
↓
4. Baselines
↓
5. Modelado
↓
6. Validación
↓
7. Análisis de errores y explicabilidad
↓
8. Criterios de éxito y operación
Principios transversales: reproducibilidad y trazabilidad · ética y cumplimiento · viabilidad operativa
Identificar documentos potencialmente pertinentes sobre estadística cívica en educación estadística, con énfasis en el contexto universitario, para apoyar el cribado previo a la revisión a texto completo.
Cada artículo o registro bibliográfico, representado inicialmente por:
\[ WSS@R = R-\frac{n_{\text{revisados}}}{N} \]
donde \(n_{\text{revisados}}\) es el número de documentos revisados, siguiendo el orden del modelo, hasta alcanzar \(R\).
Se utilizarán los 15 estudios incluidos en la revisión sistemática de Becerra Martín, Pinto Sosa y Vásquez Ortiz (Becerra Martín et al., 2025).
Funciona como referencia positiva del dominio.
Tenemos:
15 documentos conocidos como pertinentes.
No tenemos:
una clase negativa documentada y reutilizable.
Los documentos excluidos de la revisión original no están disponibles con sus decisiones individuales.
Repetir hoy la búsqueda no reproduciría necesariamente la misma colección, porque cambian:
Positivos conocidos + documentos no etiquetados
No corresponde construir directamente un clasificador binario supervisado sin un nuevo proceso de etiquetado.
Cada documento se organizará en una estructura tabular con:
Representación inicial: título + resumen + palabras clave
La misma representación se utilizará inicialmente para clasificación y estructuración temática.
El texto completo se evaluará posteriormente si aporta una mejora suficiente.
Se documentarán reglas reproducibles para:
Se verificará:
Si la cobertura de resúmenes en inglés es suficiente, se utilizará una representación lingüística común.
La estructura de los datos conduce a Positive-Unlabeled Learning (PU Learning):
U puede contener documentos pertinentes y no pertinentes.U no se considera una clase negativa.PU Learning permite aprender con positivos conocidos sin disponer de negativos etiquetados (Bekker & Davis, 2020).
Se evaluarán:
Su construcción deberá evitar data leakage.
UMediante recuperación bibliográfica reproducible a partir de:
Las etiquetas humanas disponibles se reservarán para validación o contraste externo.
El problema es cercano a la expansión de conjuntos documentales: partir de pocos documentos conocidos para localizar nuevos documentos relacionados (Jacovi et al., 2021).
P + U
↓
representaciones + atributos
↓
modelo PU
↓
puntuación de pertinencia
↓
cribado y revisión humana
Los documentos pertinentes pasarán posteriormente a la estructuración temática.
Baseline: BM25 (Jacovi et al., 2021)
| Métrica | Referencia |
|---|---|
| Recall | mínimo \(\geq 0.90\) |
| deseable \(\geq 0.95\) | |
| WSS@95 | \(\geq 0.10\) |
Baseline: LDA (Eklund & Forsman, 2022)
| Métrica | Referencia |
|---|---|
| Coherencia temática (Coh) | \(\geq 0.80\) |
| Calidad de descripción temática (CDT) | \(\geq 3\) en escala 1–4 |
Clasificación documental
Se evaluarán modelos compatibles con PU Learning, considerando:
Estructuración temática
Se compararán:
El muestreo de Gibbs podría refinar las asignaciones temáticas y mejorar coherencia y estabilidad, especialmente en corpus pequeños, aunque con mayor costo computacional (Zhu & Liu, 2025).
Se utilizará un corpus independiente del empleado para desarrollar los modelos.
Nueva búsqueda bibliográfica reproducible, con evaluación humana.
Corpus externo previamente clasificado, con categorías o decisiones documentadas.
Revisión sistemática previa del grupo, mantenida completamente fuera del entrenamiento.
Clasificación
Se analizarán:
Cuando sea posible, se examinará la contribución de los atributos o la similitud con documentos positivos.
Estructuración temática
Se revisarán:
El método será satisfactorio si:
Pipeline reproducible en R o Python para:
Se registrarán versiones del corpus y del modelo y se reevaluará el desempeño ante cambios relevantes en fuentes, idioma o vocabulario.
Uso previsto: nueva colección → clasificación / priorización → revisión humana → elegibilidad a texto completo → estructuración temática
La decisión final de inclusión permanecerá a cargo del revisor humano.
El corpus positivo fue definido previamente con participación de un integrante experto del equipo.
Para evitar sesgo en la validación:
Los supuestos requeridos por el modelo PU seleccionado deberán explicitarse y fundamentarse.
La equidad no se limitará a la ausencia de datos personales sensibles.
Se evaluará si existen diferencias sistemáticas de desempeño entre subgrupos documentales relevantes.
Un factor particular a auditar será el idioma, para verificar si la representación lingüística utilizada perjudica sistemáticamente a determinados documentos.
El análisis se sustentará en evidencia sobre el comportamiento del modelo entre estos grupos.
Se priorizará el desempeño del modelo, especialmente evitar que un artículo pertinente quede sin revisar.
Por ello, Recall será la métrica principal, Precision será complementaria y WSS permitirá comprobar el ahorro efectivo de revisión.
La interpretabilidad será útil para auditoría, pero no constituirá el criterio principal de selección del modelo.
La interpretabilidad sí será parte del resultado esperado: los temas obtenidos deberán ser coherentes y comprensibles para el investigador.
Utilizarán el modelo para priorizar documentos y esperan ahorrar tiempo sin omitir artículos pertinentes.
Define los datos, modelos, métricas y procedimientos de evaluación.
Aportarán decisiones humanas independientes para evaluar el modelo.
Pueden verse afectados indirectamente si un artículo pertinente queda fuera del proceso de revisión.
Separar desarrollo y validación, mantener sus etiquetas fuera del entrenamiento e incluir positivos y negativos.
Documentar fuentes, transformaciones, decisiones, supuestos y versiones.
Analizar falsos positivos, falsos negativos, Recall, WSS y diferencias entre subgrupos relevantes.
El modelo apoyará la priorización del cribado, pero la decisión final de inclusión permanecerá a cargo del revisor humano.