Clasificación y estructuración semiautomática de literatura científica multilingüe mediante modelos de lenguaje y aprendizaje activo

Video de avance #1 – Definición del problema

Juan Carlos Roa Anderson
Enver Gerald Tarazona Vargas
Carlos Andrés Valencia Moscoso

Objetivos de la semana

  • Plantear una necesidad o problemática real como un proyecto de ciencia de datos

  • Identificar y sintetizar las contribuciones más relevantes presentes en la literatura para un proyecto específico de ciencia de datos

Planteamiento y Justificación del Problema

Contexto y Motivación

La estadística cívica constituye un campo emergente dentro de la educación estadística, orientado al uso y la interpretación de datos relacionados con asuntos públicos, ciudadanía y participación informada. Quienes investigan esta área, al igual que quienes trabajan en otros campos emergentes, enfrentan dificultades para recuperar y organizar literatura científica pertinente, ya que los trabajos académicos pueden estar publicados en distintos idiomas y no siempre emplean explícitamente la denominación «estadística cívica» en sus títulos, resúmenes o palabras clave. Esta heterogeneidad terminológica, conceptual y lingüística prolonga las revisiones manuales y dificulta la trazabilidad de los procesos de identificación y caracterización de la producción científica del campo

Definición del Problema

Desarrollar y evaluar modelos de clasificación documental multilingüe y modelos de estructuración temática de textos científicos, basados en modelos de lenguaje, que permitan identificar artículos de educación estadística relacionados con la estadística cívica y organizarlos según sus temas, enfoques y tipos de estudio. La unidad de análisis estará constituida por cada artículo académico o registro bibliográfico recuperado en un corpus especializado en educación estadística y estadística cívica.

Delimitación operativa

Unidad de Análisis

Cada artículo académico o registro bibliográfico recuperado en el corpus documental.

Contexto

Corpus multilingüe de literatura científica sobre educación estadística y estadística cívica, compuesto por documentos en inglés, español y portugués, recuperados principalmente de Scopus y SciELO.

Fenómeno/Tarea Analítica

Identificación de artículos de educación estadística relacionados con estadística cívica y estructuración temática de los artículos identificados según temas, enfoques y tipos de estudio.

Horizonte operativo

El análisis comprende la consolidación del corpus, la clasificación documental y la organización temática de los registros. No corresponde a un estudio longitudinal, sino a una evaluación retrospectiva basada en decisiones humanas previamente registradas.

Resultado esperado

Modelos comparables con decisiones humanas previas, capaces de apoyar la identificación y organización de literatura en un campo emergente y multilingüe.

Justificación

  • El proyecto contribuye a la organización y delimitación de literatura científica en un campo emergente de la educación estadística.

  • El proyecto permite evaluar modelos de clasificación documental multilingüe y estructuración temática en un escenario realista: corpus especializado, emergente y terminológicamente heterogéneo.

  • El proyecto puede reducir la carga de revisión manual y mejorar la trazabilidad en procesos de búsqueda, clasificación y organización de literatura científica.

Métricas, supuestos y riesgos iniciales

  • Métricas iniciales: precisión, recall y F1 para la clasificación documental; coherencia temática y comparación con categorías humanas para la estructuración.

  • Supuestos: existencia de decisiones humanas previas sobre clasificación/codificación documental; disponibilidad de metadatos, resúmenes, palabras clave y, cuando sea posible, textos completos.

  • Restricciones: corpus especializado, multilingüe y de tamaño acotado; disponibilidad desigual de información entre registros.

  • Riesgos: posible desbalance entre artículos vinculados y no vinculados con estadística cívica; sesgo de cobertura de las bases consultadas; diferencias de calidad entre idiomas y fuentes.

  • Controles iniciales: no usar accuracy como métrica principal; revisar resultados por idioma/fuente; documentar los casos mal clasificados o temáticamente ambiguo

Avance semanal

  • Avances realizados: se llevó a cabo una reunión de coordinación, se socializó el proyecto propuesto y se avanzó en la formulación del problema de investigación, diferenciando el contexto operacional, la definición del problema y la delimitación operativa.

  • Dificultades identificadas: se presentaron dificultades para coordinar horarios entre los integrantes. Además, se identificó una inconsistencia en la conformación oficial del grupo, ya que un integrante que participó en el trabajo conjunto figuraba asignado a otro grupo.

  • Objetivos para la siguiente semana: iniciar la revisión de literatura relacionada con clasificación documental multilingüe, estructuración temática de textos científicos y uso de modelos de lenguaje en procesos de revisión de literatura.