1 Propósito del informe

El informe documenta la fase de preparación previa a la imputación múltiple mediante MICE para las bases de Saber 11 correspondientes al régimen nuevo, períodos 20142–20224.

La finalidad de esta etapa no es todavía generar valores imputados. El proceso realizado hasta este punto busca asegurar que:

  1. los archivos de entrada sean estructuralmente consistentes;
  2. las categorías socioeconómicas sean comparables entre períodos;
  3. los valores faltantes estén cuantificados y caracterizados;
  4. los casos con ausencia simultánea de información sean identificados;
  5. existan predictores auxiliares suficientes para apoyar la imputación;
  6. las variables tengan un tipo estadístico adecuado;
  7. los métodos MICE sean coherentes con la naturaleza de cada variable;
  8. la matriz de predictores se encuentre preparada antes de ejecutar mice().

Estado actual: todavía no se ha ejecutado la imputación MICE.

2 Datos utilizados

La entrada del proceso está formada por 14 archivos Parquet, uno por período:

Período Registros
20142 546.727
20151 25.973
20152 544.491
20161 13.095
20162 550.275
20171 13.018
20172 548.269
20181 32.348
20191 12.561
20194 1.096.524
20201 15.435
20211 15.528
20221 20.049
20224 1.065.888
Total 4.500.181

Cada archivo contiene 83 variables.

Las nueve variables socioeconómicas seleccionadas como objetivo de imputación son:

# Variable
1 fami_estratovivienda
2 fami_educacionmadre
3 fami_educacionpadre
4 fami_tieneinternet
5 fami_tieneautomovil
6 fami_cuartoshogar
7 fami_tienecomputador
8 fami_personashogar
9 fami_tienelavadora

Los archivos homologados se almacenan en:

D:/Proyectos_IA/prueba_saber_11/data/processed/saber11_homologado_por_periodo

La carpeta reservada para la futura salida imputada es:

D:/Proyectos_IA/prueba_saber_11/data/processed/saber11_imputado_por_periodo

3 Bloque 1 — Carga de paquetes

3.1 Objetivo

Cargar las librerías necesarias para lectura y escritura Parquet, manipulación de datos, iteración por períodos, tratamiento de texto y exportación de auditorías.

3.2 Paquetes utilizados

  • arrow
  • dplyr
  • tibble
  • purrr
  • stringr
  • readr

3.3 Conclusión

El entorno de trabajo quedó preparado para procesar archivos grandes de forma secuencial y conservar auditorías en CSV.

4 Bloque 2 — Semilla de reproducibilidad

Se fijó:

set.seed(5477976)

4.1 ¿Por qué?

MICE contiene procedimientos estocásticos. Una semilla fija permitirá que, cuando se ejecute la imputación, los resultados puedan reproducirse bajo la misma configuración.

4.2 Conclusión

La reproducibilidad quedó definida antes de cualquier procedimiento aleatorio.

5 Bloque 3 — Definición de rutas

Se definieron cuatro rutas principales:

  1. entrada de los 14 períodos certificados;
  2. salida de las bases homologadas;
  3. salida futura de las bases imputadas;
  4. carpeta de auditorías.

5.1 Conclusión

Se separó correctamente la información original, la homologada, la futura información imputada y las evidencias de auditoría.

6 Bloque 4 — Creación y validación de directorios

6.1 Resultado de consola

Entrada existe: TRUE
Salida homologación existe: TRUE
Salida imputación existe: TRUE
Auditorías existe: TRUE

6.2 Interpretación

Todas las rutas requeridas estaban disponibles. El proceso podía continuar sin riesgo de escribir resultados en ubicaciones inexistentes.

6.3 Conclusión

La infraestructura física del proceso quedó validada.

7 Bloque 5 — Definición de períodos y variables

Se declararon explícitamente los 14 períodos esperados y las 9 variables objetivo.

7.1 ¿Por qué?

Definirlos de forma explícita impide incorporar accidentalmente períodos no contemplados o dejar por fuera alguna de las variables socioeconómicas seleccionadas.

7.2 Conclusión

El universo temporal y el conjunto de variables objetivo quedaron fijados antes de transformar los datos.

8 Bloque 6 — Definición de niveles homologados

Se establecieron categorías comunes para:

  • estrato;
  • educación de madre y padre;
  • cuartos del hogar;
  • personas del hogar.

Se conservaron expresamente respuestas especiales como:

  • Sin Estrato;
  • no sabe;
  • no aplica.

8.1 Conclusión

No se eliminaron ni convirtieron arbitrariamente estas respuestas en NA. Se preservó su significado original.

9 Bloque 7 — Identificación y validación de archivos

9.1 Resultado de consola

Archivos encontrados: 14
Períodos esperados: 14
Períodos faltantes: 0
Períodos inesperados: 0

9.2 Interpretación

La serie temporal estaba completa: no faltaba ningún período y no se incorporaron archivos ajenos al diseño.

9.3 Conclusión

Se confirmó una correspondencia exacta entre los 14 períodos planificados y los 14 archivos disponibles.

10 Bloque 8 — Auditoría estructural de entrada

10.1 Resultado principal

Los 14 archivos presentaron:

  • 83 variables cada uno;
  • período interno correcto;
  • presencia de las 9 variables objetivo;
  • conservación del total certificado de registros.
Total de registros: 4500181
Total certificado esperado: 4500181
Coincidencia total: TRUE

10.2 Interpretación

Antes de modificar los datos se comprobó la integridad estructural del conjunto completo.

10.3 Conclusión

La entrada quedó certificada en 4.500.181 registros, sin pérdidas estructurales detectadas.

11 Bloque 9 — Auditoría de categorías originales

11.1 Resultado

Filas de auditoría generadas: 856

11.2 ¿Qué significa?

Se construyó un inventario de las combinaciones período–variable–categoría existentes antes de homologar.

11.3 ¿Por qué es importante?

Permite comparar el estado original con el estado posterior y demostrar qué categorías fueron transformadas.

11.4 Conclusión

Se obtuvo una línea base completa de las categorías originales.

12 Bloque 10 — Función de homologación

La función centralizó las reglas temporales de homologación.

12.1 fami_cuartoshogar

Se consolidaron:

Seis
Siete
Ocho
Nueve
Diez o más
Seis o mas

en:

Seis o mas

12.2 fami_personashogar

Se consolidaron las categorías históricas en:

1 a 2
3 a 4
5 a 6
7 a 8
9 o más

La cláusula final conservó cualquier valor no reconocido en lugar de transformarlo silenciosamente en NA.

12.3 Conclusión

La homologación temporal se diseñó de forma conservadora: recodifica únicamente las equivalencias conocidas.

13 Bloque 11 — Homologación y almacenamiento de los 14 períodos

13.1 Incidencia detectada

En el primer intento, la consola mostró:

archivo_creado = FALSE

para los 14 períodos, aunque los archivos sí existían físicamente.

La causa era una validación de ruta realizada después de convertir la ruta completa en nombre base.

13.2 Corrección

Se separó:

ruta_archivo_salida

de:

basename(ruta_archivo_salida)

y la existencia física se verificó utilizando la ruta absoluta.

13.3 Resultado final

Los 14 períodos mostraron:

filas_conservadas = TRUE
archivo_creado = TRUE

y cada archivo conservó exactamente su número de registros original.

13.4 Conclusión

La homologación fue completada sin pérdida de filas y los 14 Parquet homologados quedaron guardados correctamente.

14 Bloque 12 — Auditoría de categorías posteriores a la homologación

14.1 Resultados

Filas de auditoría generadas: 801
Períodos auditados: 14
Variables auditadas: 9

14.2 Categorías finales relevantes

14.2.1 Cuartos del hogar

Uno
Dos
Tres
Cuatro
Cinco
Seis o mas
NA

14.2.2 Personas del hogar

1 a 2
3 a 4
5 a 6
7 a 8
9 o más
NA

14.2.3 Variables binarias

si
no
NA

14.2.4 Estrato

Estrato 1 ... Estrato 6
Sin Estrato
NA

14.2.5 Educación

Se preservaron los niveles educativos y las categorías especiales no sabe y no aplica.

14.3 Conclusión

La reducción de 856 a 801 combinaciones refleja la consolidación de categorías equivalentes. La homologación produjo dominios más consistentes entre períodos.

15 Bloque 13 — Validación contra el diccionario de categorías

15.1 Resultado de consola

Categorías fuera del diccionario: 0
RESULTADO: todas las categorías observadas pertenecen al diccionario homologado.

15.2 Interpretación

No quedó ninguna categoría no reconocida entre las nueve variables.

15.3 Conclusión

La homologación categórica quedó validada antes de estudiar los valores faltantes.

16 Bloque 14 — Auditoría de valores faltantes

La auditoría evaluó:

14 períodos × 9 variables = 126 combinaciones

16.1 Resumen global

Variable NA % NA
fami_estratovivienda 179.066 3,98
fami_tieneinternet 162.321 3,61
fami_educacionpadre 159.014 3,53
fami_educacionmadre 158.922 3,53
fami_tieneautomovil 105.853 2,35
fami_cuartoshogar 100.445 2,23
fami_tienecomputador 100.057 2,22
fami_personashogar 99.292 2,21
fami_tienelavadora 99.172 2,20

16.2 Hallazgo temporal

El período 20201 presentó aproximadamente 9–10 % de faltantes en las nueve variables, notablemente por encima del promedio global.

16.3 Interpretación

La proporción global de ausencia es moderada, pero no es homogénea en el tiempo.

16.4 Conclusión

La imputación múltiple es metodológicamente plausible, pero era necesario estudiar si los NA se concentraban simultáneamente en los mismos registros.

17 Bloque 15 — Patrones conjuntos de valores faltantes

17.1 Resultado principal

Se identificaron:

331 patrones distintos de ausencia

entre las nueve variables.

Se encontraron registros con las 9 variables simultáneamente faltantes en 12 períodos.

Período Casos 9/9 % del período
20142 1.903 0,348
20152 136 0,025
20162 2.461 0,447
20171 110 0,845
20172 4.035 0,736
20181 483 1,49
20191 127 1,01
20194 16.116 1,47
20201 1.104 7,15
20211 297 1,91
20221 330 1,65
20224 24.608 2,31

No hubo casos 9/9 en 20151 ni 20161.

17.2 Interpretación

El período proporcionalmente más crítico fue 20201 (7,15 %).

En términos absolutos destacan:

  • 20224: 24.608 casos;
  • 20194: 16.116 casos.

17.3 Conclusión

No era adecuado construir MICE utilizando únicamente las nueve variables familiares entre sí, porque en una fila 9/9 ninguna de esas variables aporta información observada.

Era necesario incorporar predictores auxiliares.

18 Bloque 16 — Disponibilidad de predictores auxiliares en casos 9/9

Se analizaron nueve predictores candidatos:

  1. estu_genero;
  2. cole_naturaleza;
  3. cole_area_ubicacion;
  4. cole_calendario;
  5. cole_genero;
  6. cole_jornada;
  7. cole_sede_principal;
  8. cole_cod_depto_ubicacion;
  9. cole_cod_mcpio_ubicacion.

18.1 Hallazgo principal

En la gran mayoría de los registros con 9/9 faltantes, los predictores auxiliares estaban disponibles.

Ejemplos:

  • 20162, 20171, 20172, 20181, 20191, 20194, 20211 y 20221: los casos 9/9 conservaron los 9 auxiliares;
  • 20224: 24.606 de 24.608 registros conservaron los 9 auxiliares;
  • ningún período presentó casos 9/9 con cero auxiliares observados.

18.2 Conclusión

La información auxiliar es suficientemente rica para apoyar una estrategia MICE en los casos donde todas las variables familiares están ausentes.

19 Bloque 17 — Casos 9/9 con auxiliares incompletos

19.1 Resultado

Número de casos excepcionales: 468

Se identificaron cinco patrones:

Período Auxiliares observados Principal ausencia Casos
20142 8/9 estu_genero 458
20142 8/9 cole_area_ubicacion 5
20152 8/9 estu_genero 2
20201 8/9 estu_genero 1
20224 1/9 faltan 8 auxiliares 2

19.2 Interpretación

Aunque se detectaron 468 casos excepcionales:

  • 466 conservan 8 de 9 auxiliares;
  • solamente 2 registros de 20224 conservan un único auxiliar.

19.3 Conclusión

El problema real se redujo a dos registros extremos de 20224.

20 Bloque 18 — Investigación de los dos casos críticos de 20224

20.1 Resultados de consola

Identificadores críticos: 1
Registros encontrados: 2
Variables disponibles: 83
Duplicados exactos encontrados: 0

Los dos registros pertenecen al mismo:

estu_consecutivo = SB11202240550499

Las únicas variables diferentes fueron:

Variable Valores distintos
:id 2
:version 2
:created_at 2
:updated_at 2

Las 83 variables analíticas relevantes coinciden.

Ambos registros presentan además:

  • misma fecha de nacimiento;
  • mismo sexo;
  • misma residencia;
  • mismo lugar de presentación;
  • mismos puntajes;
  • puntaje global = 192;
  • las nueve variables familiares en NA;
  • prácticamente toda la información del colegio en NA.

20.2 Interpretación

No son duplicados físicos exactos debido a los metadatos técnicos, pero sí son duplicados analíticos.

20.3 Conclusión

La posible duplicación debe resolverse en la fase de control de calidad del dataset y no mediante la imputación. No se eliminó ningún registro en esta etapa.

21 Bloque 19 — Definición de tipos estadísticos para MICE

La clasificación final fue:

Variable Tratamiento
fami_estratovivienda nominal
fami_educacionmadre nominal
fami_educacionpadre nominal
fami_tieneinternet binaria
fami_tieneautomovil binaria
fami_cuartoshogar ordinal
fami_tienecomputador binaria
fami_personashogar ordinal
fami_tienelavadora binaria

21.1 ¿Por qué estrato y educación se trataron como nominales?

Aunque contienen información ordinal, también incluyen categorías especiales:

Sin Estrato
no sabe
no aplica

No es metodológicamente válido imponer relaciones como:

Estrato 6 < Sin Estrato

o:

postgrado < no sabe < no aplica

Por ello se preservaron como categorías válidas sin introducir un orden artificial.

21.2 Resultado de consola

Nominales: fami_estratovivienda, fami_educacionmadre, fami_educacionpadre
Binarias: fami_tieneinternet, fami_tieneautomovil, fami_tienecomputador, fami_tienelavadora
Ordinales: fami_cuartoshogar, fami_personashogar

21.3 Conclusión

La estructura estadística quedó preparada para asignar métodos MICE compatibles con cada variable.

22 Bloque 20 — Métodos preliminares de imputación

La configuración definida fue:

Variable Método MICE Justificación
fami_estratovivienda polyreg nominal multicategórica
fami_educacionmadre polyreg nominal multicategórica
fami_educacionpadre polyreg nominal multicategórica
fami_tieneinternet logreg binaria
fami_tieneautomovil logreg binaria
fami_cuartoshogar polr ordinal
fami_tienecomputador logreg binaria
fami_personashogar polr ordinal
fami_tienelavadora logreg binaria

Las nueve auxiliares quedaron con:

""

22.1 ¿Qué significa ""?

Significa que, en la configuración preliminar, la variable puede utilizarse como predictor, pero no se pretende imputarla como variable objetivo.

22.2 Conclusión

Se definió una estrategia de imputación acorde con la naturaleza de las nueve variables familiares.

23 Bloque 21 — Matriz preliminar de predictores

Se construyó una matriz de 18 × 18:

9 variables objetivo + 9 auxiliares

La lógica fue:

  • las nueve variables familiares pueden predecirse entre sí;
  • las nueve auxiliares pueden actuar como predictoras;
  • ninguna variable puede predecirse a sí misma;
  • las auxiliares no se configuran como variables objetivo.

23.1 Resultado de consola

Variables totales: 18
Variables objetivo: 9
Variables auxiliares no imputadas: 9
Diagonal diferente de cero: 0

23.2 Interpretación

La matriz es estructuralmente correcta.

Sin embargo, todavía es una matriz candidata, no la matriz científica definitiva. Debe revisarse la cardinalidad y conveniencia de cada predictor antes de ejecutar MICE.

23.3 Conclusión

El diseño de relaciones predictivas quedó correctamente construido, pero aún requiere selección final de predictores.

24 Bloque 22 — Valores faltantes en los predictores auxiliares

Se auditaron:

14 períodos × 9 auxiliares = 126 combinaciones

24.1 Resultados globales

Predictor auxiliar Observados Faltantes % faltantes
estu_genero 4.496.952 3.229 0,0718
cole_area_ubicacion 4.500.174 7 0,0002
cole_calendario 4.500.179 2 ~0
cole_cod_depto_ubicacion 4.500.179 2 ~0
cole_cod_mcpio_ubicacion 4.500.179 2 ~0
cole_genero 4.500.179 2 ~0
cole_jornada 4.500.179 2 ~0
cole_naturaleza 4.500.179 2 ~0
cole_sede_principal 4.500.179 2 ~0

24.2 Validación de consola

Combinaciones período-variable: 126
Períodos auditados: 14
Predictores auxiliares auditados: 9

24.3 Interpretación

La disponibilidad de predictores auxiliares es muy alta. No existe evidencia para descartar ninguna variable únicamente por falta de información.

24.4 Incidencia de auditoría

La columna:

periodos_con_faltantes

del resumen global muestra 1 para estu_genero, aunque el detalle evidencia faltantes en varios períodos.

Esto se debe a que dentro de summarise() se reutilizó el nombre faltantes antes de calcular periodos_con_faltantes.

24.4.1 Importante

Este problema:

  • no modifica ningún dato;
  • no afecta los archivos Parquet;
  • no afecta los conteos globales de NA;
  • únicamente afecta esa estadística resumida específica.

Debe corregirse en una versión posterior del reporte o script.

25 Archivos de auditoría generados

Hasta esta fase se produjeron:

01_auditoria_entrada.csv
02_categorias_antes_homologacion.csv
03_auditoria_homologacion.csv
04_categorias_despues_homologacion.csv
05_categorias_revisar.csv
06_faltantes_despues_homologacion.csv
07_resumen_faltantes_por_variable.csv
08_patrones_faltantes.csv
09_cantidad_faltantes_por_registro.csv
10_casos_nueve_variables_faltantes.csv
11_auxiliares_casos_9na.csv
12_resumen_auxiliares_casos_9na.csv
13_detalle_auxiliares_incompletos_9na.csv
14_resumen_auxiliares_incompletos_9na.csv
15_casos_criticos_20224.csv
16_diferencias_casos_criticos_20224.csv
17_faltantes_auxiliares_por_periodo.csv
18_resumen_faltantes_auxiliares.csv

Estos archivos constituyen la evidencia de trazabilidad previa a MICE.

26 Estado final de la preparación

El proceso ha permitido establecer lo siguiente:

  1. La entrada contiene exactamente 14 períodos y 4.500.181 registros.
  2. Los 14 archivos contienen 83 variables y las 9 variables socioeconómicas requeridas.
  3. La homologación temporal se ejecutó sin pérdida de registros.
  4. Todas las categorías posteriores pertenecen al diccionario definido.
  5. La ausencia global de las variables objetivo se encuentra aproximadamente entre 2,20 % y 3,98 %.
  6. El período 20201 presenta una concentración temporal mayor de faltantes.
  7. Existen 331 patrones de ausencia, por lo que el mecanismo de faltantes no es trivial.
  8. Hay casos con 9/9 variables socioeconómicas faltantes, lo cual hace imprescindibles los predictores auxiliares.
  9. Los auxiliares presentan una disponibilidad prácticamente completa.
  10. De los 468 casos 9/9 con algún auxiliar incompleto, 466 conservan 8/9 auxiliares.
  11. Los dos casos más extremos corresponden al mismo identificador y son analíticamente duplicados.
  12. Se definieron tipos estadísticos coherentes para las nueve variables.
  13. Se asignaron métodos preliminares polyreg, logreg y polr.
  14. Se construyó una matriz preliminar de 18 variables con diagonal en cero.
  15. Todavía no se ha ejecutado mice() ni se ha modificado ningún NA mediante imputación.

27 Conclusiones

La fase de preparación indica que el dataset es técnicamente apto para avanzar hacia una estrategia de imputación múltiple, pero la ejecución de MICE no debe iniciarse todavía de forma masiva.

El principal riesgo ya no es la falta de información auxiliar. La siguiente decisión debe centrarse en la calidad y complejidad de los predictores, especialmente por la cardinalidad de variables territoriales como cole_cod_mcpio_ubicacion.

Incorporar automáticamente un código municipal con cientos o más niveles en modelos polyreg, logreg o polr puede aumentar significativamente la matriz de diseño y generar problemas de memoria, separación o singularidad.

Por ello, la secuencia metodológica recomendada es:

Preparación y homologación                        
Auditoría de categorías                           
Auditoría de faltantes                            
Patrones conjuntos                                
Evaluación de casos 9/9                           
Auditoría de auxiliares                           
Tipos estadísticos                                
Métodos preliminares MICE                         
Matriz preliminar                                 
Disponibilidad de auxiliares                      
        ↓
Auditar cardinalidad de los predictores
        ↓
Construir matriz MICE definitiva
        ↓
Realizar prueba piloto en un período pequeño
        ↓
Validar el piloto
        ↓
Ejecutar MICE período por período
        ↓
Validar las imputaciones

28 Conclusión final

Hasta este punto, el archivo debe entenderse como:

05_PREPARACION_IMPUTACION_MICE.R

y no como un archivo de imputación definitiva.

La imputación real debe quedar separada en una fase posterior, por ejemplo:

06_IMPUTACION_MICE.R

seguida de:

07_VALIDACION_IMPUTACION_MICE.R

Esta separación mejora la reproducibilidad, la auditabilidad y la trazabilidad científica del proyecto.