Uno de los indicadores más determinantes para comprender la calidad de la educación media y el potencial de los estudiantes en Colombia es el puntaje obtenido en las pruebas saber 11(ICFES). Este examen estandarizado busca evaluar las competencias clave de los estudiantes que finalizan la educación media, dando una métrica unificada sobre el desempeño en áreas como lectura crítica, matemáticas, ciencias naturales, sociales y ciudadanas, e inglés. Esto no es solo una forma de evaluación institucional sino que el puntaje global alcanzado puede ser la principal puerta de acceso a la educación superior pública y privada, así como un insumo clave para la asignación de becas y créditos educativos a nivel nacional.
De acuerdo con diversos análisis sobre equidad y calidad educativa en América Latina (DANE, 2022; ICFES, 2021), existe un debate profundo y frecuente sobre si los resultados de estas evaluaciones estandarizadas reflejan realmente la efectividad pedagógica y la calidad de los colegios, o si, por el contrario, están condicionados por la estratificación socioeconómica y las desigualdades de origen de los hogares. Las brechas en el desempeño académico además de limitar la movilidad social intergeneracional, también prolongan trampas de probeza y ponen en riesgo el desarrollo económico inclusivo de la nación. A pesar de los esfuerzos normativos e institucionales para masificar el acceso a la educación secundaria en Colombia, las disparidades socioeconómicas continúan marcando diferencias drásticas en los logros alcanzados por las distintas cohortes de estudiantes.
Los factores asociados al rendimiento académico en las pruebas de estado son multidimensionales e interconectados. Por un lado, la naturaleza del establecimiento educativo ( sector oficial frente a no oficial) establece una brecha estructural vinculada a la disponibilidad de infraestructura física, la jornada escolar, las condiciones laborales docentes y la disponibilidad de recursos educativos complementarios. Por otro lado, las condiciones del entorno del hogar juegan un papel determinante. En particular, la teoría del capital humano y del capital cultural sostiene que la escolaridad de los padres condiciona fuertemente las pautas del aprendizaje, el acompañamiento académico y el techo de expectativas del estudiante. A esto se le suma el impacto de la brecha digital, evidenciado en tener computador y conexión a internet en el hogar, y esque estos activos tecnológicos han dejado de ser bienes lujosos para convertirse en algo básico fundamental para el proceso formativo autodidacta y la consulta de información.
En el ámbito de la politíca pública y la econometría aplicada a la educación, comprender la magnitud e intensidad relativa con la que interactúan estos factores resulta un imperativo ético y económico. La literatura señala que falta de herramientas tecnológicas y el bajo capital cultural no solo merman el desempeño individual en el examen, sino que reducen la eficiencia global del sistema educativo y la velocidad de desarrollo de competencias avanzadas. Un sistema educativo que segrega los logros académicos en función de la capacidad adquisitiva o el estrato residencial resulta ineficiente e inequitativo, ya que desaprovecha el talento y potencial de miles de jóvenes en el país.
A partir de esta problemática, surge la siguiente pregunta central de investigación:
Pregunta de investigación: ¿En qué medida la naturaleza institucional del colegio, el estrato socioeconómico de la vivienda, la tenencia de activos digitales (computador e internet) y el capital cultural del hogar (educación superior materna) determinan estadísticamente el rendimiento académico global de los estudiantes colombianos en las pruebas Saber 11, y cómo interactúan estas dimensiones condicionando la equidad educativa?
Para dar respuesta a este interrogante, el presente informe tiene como objetivo modelar y evaluar el puntaje global en la prueba Saber 11 a partir de un conjunto de variables socioeconómicas, institucionales y de acceso a tecnología, utilizando un conjunto de datos estandarizado a nivel nacional. Mediante la estimación de un modelo de regresión lineal múltiple por Mínimos Cuadrados Ordinarios (MCO), se busca cuantificar en qué medida el sector del colegio (Oficial vs. No Oficial), el estrato socioeconómico de la vivienda, la tenencia de computador, el acceso a internet y el nivel educativo de la madre determinan estadísticamente el puntaje global final alcanzado por los estudiantes. Asimismo, se evalúan rigurosamente los supuestos econométricos del modelo (multicolinealidad, normalidad y homocedasticidad) para diagnosticar sus alcances, sesgos y limitaciones en la explicación del rendimiento educativo.
Los datos utilizados en este estudio provienen de la base de datos Pública de Resultados Únicos de las Pruebas Saber 11, publicada por el Instituto Colombiano para la Evaluación de la Educación (ICFES) y disponible a través del portal institucional de Datos Abiertos del Gobierno de Colombia.
Para este análisis se tomó como referencia el reporte consolidado nacional de evaluaciones recientes. De la base original la cuál contiene a todos los estudiantes evaluados a nivel nacional con más de 50 variables sociodemográficas e institucionales re realizó un proceso de depuración y filtrado sistemático, dejando así una muestra representativa de 75000 estudiantes y además se extrajeron las variables cuantitativas y cualitativas vinculadas directamente al rendimiento académico global, la naturaleza del colegio, las condiciones de la vivienda y la tenencia de activos tecnológicos en el hogar.
Con el fin de analizar los determinantes del desempeño académico, se seleccionó una variable dependiente cuantitativa (Y) y un conjunto de cinco variables independientes (X1,X2,X3,X4,X5) que capturan las dimensiones institucional, económica, de conectividad y de capital cultural del hogar.
Variable Dependiente. Puntaje Global: Variable cuantitativa continua que mide la puntuación total estandarizada obtenida por el estudiante en el examen Saber 11, en una escala teórica que va de 0 a 500 puntos.
Variables Independientes. Sector Educativo: Variable categórica cualitativa que clasifica la naturaleza jurídica y administrativa del establecimiento educativo en dos categorías: “OFICIAL” (colegios públicos) y “NO OFICIAL” (colegios privados). Estrato Socioeconómico: Variable cuantitativa discreta que toma valores del 1 al 6, correpondiente a la clasificación oficial de la vivienda del estudiante. Acceso a Internet: Variable dummy (1 = Sí tiene acceso; 0 = No tiene acceso) que mide la presencia de conectividad fija o móvil en el hogar. Tenencia de Computador: Variable dummy (1 = Sí posee; 0 = No posee) que registra la disponibilidad de un equipo informático de escritorio o portátil en la vivienda. Educación Superior de la Madre: Variable dummy (1 = Madre con estudios técnicos, tecnológicos o universitarios; 0 = Madre sin estudios superiores).
Tabla Resumen de Variables
Para evaluar la influencia de los factores instiitucionales y socioeconómicos sobre el rendimiento académico, se planteó un modelo de regresión lineal múltiple estimado mediante Mínimos Cuadrados Ordinarios (MCO)
La ecuación general del modelo se especifica de la siguiente manera:
\[\text{Puntaje\_Global}_i = \beta_0 + \beta_1 (\text{Sector}_{\text{OFICIAL}, i}) + \beta_2 (\text{Estrato}_i) + \beta_3 (\text{Internet}_i) + \beta_4 (\text{Computador}_i) + \beta_5 (\text{Edu\_Madre\_Superior}_i) + \epsilon_i\] Donde \(i\) representa a cada estudiante evaluado, \(\beta_0\) es el intercepto, \(\beta_i\) son los coeficientes del modelo y \(\epsilon_i\) es el término de error.
A continuación, se presenta el análisis exploratorio visual y cuantitativo de las variables involucradas en el estudio, evaluando de forma univariada la variable respuesta y de forma bivarada su relación con las variables independientes institucionales, socioeconómicas, de conectividad y de capital cultural.
Para comprender el comportamiento de la variable respuesta, se evalúa la distribución de frecuencia del puntaje global obtenido por los estudiantes en la prueba Saber 11. La representación mediante histograma y curva de densidad permite analizar la tendencia central, la dispersión y la presencia de posibles sesgos en el rendimiento.
library(ggplot2)
library(plotly)
datos <- base_datos_icfes_trabajo
p1 <- ggplot(datos, aes(x = Puntaje_Global)) +
geom_histogram(aes(y = after_stat(density)), bins = 30, fill = "#2c3e50", color = "white", alpha = 0.8) +
geom_density(color = "#e74c3c", linewidth = 1.2) +
labs(title = "Distribución del Puntaje Global en Saber 11",
x = "Puntaje Global (0 a 500 puntos)",
y = "Densidad") +
theme_minimal()
ggplotly(p1)
La distribución del puntaje global refleja un comportamiento aproximadamente simétrico e unimodal, concentrado en el rango central de la prueba. La media y la mediana se ubican muy cercanas entre sí, alrededor de los 245 puntos, con una dispersión que abarca desde puntajes mínimos cercanos a 100 puntos hasta valores máximos que superan los 420 puntos. La curva de densidad muestra una leve cola alargada hacia la derecha, lo que indica que, aunque la mayoría de los evaluados se agrupa alrededor del promedio nacional, existe una proporción reducida de estudiantes con desempeños sobresalientes o superiores a 350 puntos. Este comportamiento confirma la idoneidad del puntaje. Este comportamiento confirma la idoneidad del puntaje global para ser modelado mediante regresión lineal por Mínimos Cuadrados Ordinarios.
La naturaleza del establecimiento educatico marca una diferencia en la oferta y recursos pedagógicos. Mediante un diagrama de caja comparativo, se examinan las diferencias en la mediana, dispersión y promedios del puntaje global entre colegios de sector Oficial y No Oficial.
p2 <- ggplot(datos, aes(x = Sector, y = Puntaje_Global, fill = Sector)) +
geom_boxplot(alpha = 0.7, outlier.colour = "red", outlier.shape = 1) +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3.5, color = "black") +
scale_fill_manual(values = c("OFICIAL" = "#3498db", "NO OFICIAL" = "#2ecc71")) +
labs(title = "Distribución del Puntaje Global según el Sector del Colegio",
x = "Sector Educativo",
y = "Puntaje Global",
fill = "Sector") +
theme_minimal()
ggplotly(p2)
El análisis comparativo entre sectores educativos evidencia una brecha favorable hacia las instituciones de carácter No Oficial. Los estudiantes de colegios No Oficiales alcanzan una mediana de aproximadamente 265 puntos y un promedio de 268 puntos, mientras que en el sector Oficial la mediana se sitúa en torno a los 235 puntos y el promedio en 238 puntos. Esta diferencia de cerca de 30 puntos promedio demuestra una ventaja estructural en el sector privado. Asimismo, el rango intercuartílico de los colegios Oficiales presenta una mayor concentración en valores bajos y una menor presencia de puntajes altos en comparación con el sector No Oficial.
El estrato residencial actúa como una aproximación al nivel socioeconómico del hogar. La siguiente gráfica evalúa si existe un gradiente social directo sobre el puntaje de la prueba, comparando el desempeño a través de los estratos 1 al 6.
p3 <- ggplot(datos, aes(x = factor(Estrato), y = Puntaje_Global, fill = factor(Estrato))) +
geom_boxplot(alpha = 0.7) +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3, color = "black") +
scale_fill_brewer(palette = "YlGnBu") +
labs(title = "Distribución del Puntaje Global por Estrato Socioeconómico",
x = "Estrato Socioeconómico",
y = "Puntaje Global",
fill = "Estrato") +
theme_minimal()
ggplotly(p3)
Se observa una relación monótona creciente entre el estrato socioeconómico de la vivienda y el rendimiento académico en la prueba Saber 11. Mientras que los estudiantes de estrato 1 registran un puntaje promedio cercano a los 238 puntos (mediana de 235), el promedio asciende progresivamente a 255 puntos en estrato 2, 271 en estrato 3, 290 en estrato 4, 300 en estrato 5 y alcanza un pico de 315 puntos promedio (mediana de 330) en el estrato 6. La brecha entre el estrato más bajo y el más alto supera los 77 puntos promedio, lo que evidencia que la capacidad económica del entorno residencial condiciona significativamente el logro educativo.
El acceso a conectividad en el hogar facilita la investigación, la práctica de simulacros y la autogestión del conocimiento. En esta subsección se compara el desempeño académico de los estudiantes que cuentan con servicio de Internet frente a quienes carecen de este recurso.
p4 <- ggplot(datos, aes(x = factor(Internet, labels = c("Sin Internet", "Con Internet")),
y = Puntaje_Global,
fill = factor(Internet))) +
geom_boxplot(alpha = 0.7) +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3.5, color = "darkred") +
scale_fill_manual(values = c("0" = "#e74c3c", "1" = "#1abc9c")) +
labs(title = "Puntaje Global según Disponibilidad de Internet en el Hogar",
x = "Acceso a Internet",
y = "Puntaje Global") +
theme_minimal() +
theme(legend.position = "none")
ggplotly(p4)
La disponibilidad de conectividad a Internet en el hogar constituye un factor diferenciador determinante en el desempeño escolar. Los estudiantes que cuentan con servicio de Internet obtienen un puntaje promedio de 268 puntos (mediana de 265), en comparación con un promedio de 238 puntos (mediana de 233) registrado por quienes no disponen de esta herramienta. Esta brecha de 30 puntos resalta el impacto de la brecha digital en el acceso a material de consulta, plataformas de aprendizaje y simulacros académicos, consolidando al acceso a la red como una necesidad básica para el rendimiento escolar.
Además de la conectividad, la disponibilidad de un equipo de cómputo en la vivienda representa un activo tecnológico indispensable para el aprendizaje autónomo. A continuación se analiza cómo varía el puntaje global según la tenencia de computador en el hogar.
p5 <- ggplot(datos, aes(x = factor(Computador, labels = c("Sin Computador", "Con Computador")),
y = Puntaje_Global,
fill = factor(Computador))) +
geom_boxplot(alpha = 0.7) +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3.5, color = "darkred") +
scale_fill_manual(values = c("0" = "#e67e22", "1" = "#34495e")) +
labs(title = "Puntaje Global según Tenencia de Computador en el Hogar",
x = "Disponibilidad de Computador",
y = "Puntaje Global") +
theme_minimal() +
theme(legend.position = "none")
ggplotly(p5)
De manera consistente con el acceso a Internet, la tenencia de computador en la vivienda muestra una asociación positiva con los resultados de la prueba. Los alumnos con equipo informático logran un promedio de 267 puntos (mediana de 265), superando por 30 puntos al grupo que no posee computador, cuyo promedio se sitúa en 237 puntos (mediana de 233). La caja de distribución para el grupo con computador se encuentra desplazada hacia quartiles superiores, lo que confirma que el equipamiento tecnológico potencia el desarrollo de habilidades cognitivas y autodidactas.
La literatura económica postula que el capital socioeducativo del hogar condiciona el logro académico. En esta subsección se evalúa el puntaje global diferenciando entre los estudiantes cuya madre cuenta con educación superior (técnica, tecnológica o universitaria) y aquellos cuya madre no alcanzó este nivel de formación.
p6 <- ggplot(datos, aes(x = factor(Edu_Madre_Superior, labels = c("Sin Ed. Superior", "Con Ed. Superior")),
y = Puntaje_Global,
fill = factor(Edu_Madre_Superior))) +
geom_boxplot(alpha = 0.7) +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3.5, color = "black") +
scale_fill_manual(values = c("0" = "#95a5a6", "1" = "#9b59b6")) +
labs(title = "Puntaje Global según Nivel Educativo Materno",
x = "Educación Superior de la Madre",
y = "Puntaje Global") +
theme_minimal() +
theme(legend.position = "none")
ggplotly(p6)
El capital educacional del hogar, medido a través del nivel educativo materno, representa una de las variables con mayor impacto en el rendimiento. Los estudiantes cuyas madres cuentan con educación superior (técnica, tecnológica o universitaria) registran un puntaje promedio de 284 puntos (mediana de 285), frente a los 244 puntos promedio (mediana de 240) de aquellos cuya madre no alcanzó estudios superiores. Esta brecha de 40 puntos evidencia cómo un mayor nivel de formación materna se traduce en mejores entornos de acompañamiento, mayores expectativas académicas y mayor soporte sociocultural en el hogar.
Dado que la base de datos combina una variable cuantitativa continua, una variable ordinal y múltiples variables categóricas o dicotómicas, se emplea la matriz de heterocorrelación a través del paquete polycor. Este procedimiento ajusta el tipo de cálculo según el tipo de variable, evitando distorsiones econométricas y permitiendo explorar la asociación lineal global entre todas las variables explicativas y el puntaje.
library(polycor)
library(ggcorrplot)
var_matriz <- as.data.frame(datos[, c("Puntaje_Global", "Sector", "Estrato", "Internet", "Computador", "Edu_Madre_Superior")])
var_matriz$Puntaje_Global <- as.numeric(var_matriz$Puntaje_Global)
var_matriz$Estrato <- as.numeric(var_matriz$Estrato)
var_matriz$Sector <- as.factor(var_matriz$Sector)
var_matriz$Internet <- as.factor(var_matriz$Internet)
var_matriz$Computador <- as.factor(var_matriz$Computador)
var_matriz$Edu_Madre_Superior <- as.factor(var_matriz$Edu_Madre_Superior)
matriz_het <- hetcor(var_matriz, use = "pairwise.complete.obs")$correlations
ggcorrplot(matriz_het,
hc.order = FALSE,
type = "lower",
lab = TRUE,
lab_size = 3.5,
method = "square",
colors = c("#e74c3c", "white", "#2ecc71"),
title = "Matriz de Heterocorrelación entre Variables del Modelo",
ggtheme = theme_minimal())
La matriz de heterocorrelación confirma que todas las variables explicativas seleccionadas presentan una correlación estadísticamente relevante con la variable respuesta puntaje global. El nivel educativo de la madre muestra la mayor correlación positiva con el puntaje (\(r = 0.45\)), seguida por la tenencia de computador (\(r = 0.39\)), el acceso a Internet (\(r = 0.38\)) y el estrato socioeconómico (\(r = 0.35\)). La variable sector presenta un coeficiente de \(-0.28\), reflejando que pertenecer al sector Oficial disminuye el puntaje esperado.
A nivel de multicolinealidad entre predictores, resalta la fuerte correlación entre Internet y Computador (\(r = 0.82\)), así como asociaciones moderadas-altas entre el estrato y los activos tecnológicos (\(r = 0.51\) a \(0.59\)), aspecto que deberá ser diagnosticado rigurosamente en la sección del modelo econométrico mediante el Factor de Inflación de la Varianza (VIF).
A continuación se realiza la estimación econométrica del modelo de regresión lineal múltiple por Mínimos Cuadrados Ordinarios y la verificación rifurosa de los supuestos del modelo clásico de regresión lineal.
A continuación se estima la ecuación de regresión lineal múltiple que plantea el puntaje global enn función del sector educativo, el estrato socioeconómico, el acceso a internet, la tenencia de computador y la educación superior de la madre.
library(lmtest)
library(sandwich)
library(car)
library(tseries)
library(broom)
library(DT)
modelo_mco <- lm(Puntaje_Global ~ Sector + Estrato + Internet + Computador + Edu_Madre_Superior, data = datos)
tabla_mco <- tidy(modelo_mco)
colnames(tabla_mco) <- c("Variable / Término", "Coeficiente (β)", "Error Estándar", "Estadístico t", "p-valor")
tabla_mco$`Coeficiente (β)` <- round(tabla_mco$`Coeficiente (β)`, 4)
tabla_mco$`Error Estándar` <- round(tabla_mco$`Error Estándar`, 4)
tabla_mco$`Estadístico t` <- round(tabla_mco$`Estadístico t`, 4)
tabla_mco$`p-valor` <- format.pval(tabla_mco$`p-valor`, digits = 4)
datatable(tabla_mco, caption = "Tabla 4.1: Coeficientes Estimados por Mínimos Cuadrados Ordinarios (MCO)",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
glance_mco <- glance(modelo_mco)
tabla_ajuste <- data.frame(
Métrica = c("R-cuadrado (R²)", "R-cuadrado Ajustado", "Estadístico F", "p-valor del Modelo", "Número de Observaciones"),
Valor = c(round(glance_mco$r.squared, 4), round(glance_mco$adj.r.squared, 4), round(glance_mco$statistic, 2), format.pval(glance_mco$p.value, digits = 4), glance_mco$nobs)
)
datatable(tabla_ajuste, caption = "Tabla 4.2: Métricas de Ajuste Global del Modelo",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
La estimación por Mínimos Cuadrados Ordinarios revela que las cinco variables independientes explicativas seleccionadas ejercen un efecto estadísticamente significatico sobre el puntaje global del estudiante. El modelo estimado se expresa numéricamente de la siguiente manera:
\[\widehat{\text{Puntaje\_Global}} = 222.55 - 3.24(\text{Sector}_{\text{OFICIAL}}) + 7.63(\text{Estrato}) + 7.52(\text{Internet}) + 12.73(\text{Computador}) + 24.87(\text{Edu\_Madre\_Superior})\]
Intercepto (\(\hat{\beta}_0 = 222.55\)): Representa el puntaje global promedio esperado (222.55 puntos) para un estudiante perteneciente al sector No Oficial, de estrato 0, sin internet, sin computador y cuya madre no posee educación superior.
Sector Oficial(\(\hat{\beta}_1 = -3.24\)): Pertenecer a una institución de sector Oficial reduce el puntaje global esperado en promedio 3.24 puntos respecto a un colegio No Oficial (\(p = 3.7 \times 10^{-9}\)).
Estrato Socioeconómico (\(\hat{\beta}_2 = 7.63\)): Por cada incremento en el estrato residencial, el puntaje global aumenta en promedio 7.63 puntos, manteniendo constantes las demás variables (\(p < 2.2 \times 10^{-16}\)).
Acceso a internet (\(\hat{\beta}_3 = 7.52\)): Contar con servicio de internet en la vivienda genera un incremento promedio de 7.52 puntos en el rendimiento de la prueba (\(p < 2.2 \times 10^{-16}\)).
Tenencia de computador (\(\hat{\beta}_4 = 12.73\)): Disponer de un equipo de cómputo en el hogar incrementa el puntaje global en promedio 12.73 puntos respecto a no poseerlo (\(p < 2.2 \times 10^{-16}\)).
Educación Superior de la Madre (\(\hat{\beta}_5 = 24.87\)): Que la madre cuente con formación técnica, tecnológica o universitaria representa el impacto marginal de mayor magnitud en el modelo, aumentando el puntaje global en promedio 24.87 puntos (\(p < 2.2 \times 10^{-16}\)).
El coeficiente de determinación es \(R^2 = 0.2035\) (\(R^2 \text{ ajustado} = 0.2034\)), lo que indica que el modelo logra explicar el 20.35% de la variabilidad total observada en el puntaje de las pruebas saber 11 para la muestra de 40663 estudiantes. La prueba de significancia conjunta arroja un estadístico \(F = 2077.63\) (\(p < 2.2 \times 10^{-16}\)), confirmando la validez global de la regresión con un nivel de confianza superior al 99.9%.
Para descartar la presencia de relaciones lineales exactas o muy altas entre los predictores lo que incrementaría artificialmente la varianza de los estimadores, se evalúa el factor de inflación de la varianza (VIF). Un VIF más alto que 5 indica una multicolinealidad moderada o alta, mientras que valores superiores a 10 muestran multicolinealidad severa.
vif_valores <- vif(modelo_mco)
tabla_vif <- data.frame(
Variable = names(vif_valores),
`Factor VIF` = round(as.numeric(vif_valores), 2),
`Diagnóstico` = ifelse(vif_valores < 5, "Sin multicolinealidad severa", "Posible multicolinealidad alta"),
check.names = FALSE
)
datatable(tabla_vif, caption = "Tabla 4.3: Evaluación del Factor de Inflación de la Varianza (VIF)",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
Los resultados del Factor de Inflación de la Varianza (VIF) oscilan en un rango estrecho entre 1.26 y 1.76. Al situarse ampliamente por debajo del umbral crítico convencional de 5.0, se descarta la presencia de multicolinealidad severa entre las variables independientes. A pesar de la correlación lógica entre contar con internet (\(VIF = 1.76\)) y disponer de computador (\(VIF = 1.64\)), cada variable explicativa aporta información linealmente independiente para la estimación de sus coeficientes parciales.
Para garantizar que las pruebas de hipótesis \(t\) de significancia individual y \(F\) de significancia conjunta sean cuantitativamente válidas, se examina si el término de error o residuo (\(\epsilon_i\)) sigue una distribución normal con media cero. Se hace uso del gráfico Q-Q Normal de residuos y de la prueba formal de Jarque-Bera.
plot(modelo_mco, which = 2)
residuos <- residuals(modelo_mco)
jb_test <- jarque.bera.test(residuos)
tabla_jb <- data.frame(
`Prueba Estadística` = "Jarque-Bera (Normalidad)",
`Estadístico (Chi-cuadrado)` = round(as.numeric(jb_test$statistic), 4),
`Grados de Libertad` = as.numeric(jb_test$parameter),
`p-valor` = format.pval(jb_test$p.value, digits = 4),
`Decisión (α = 0.05)` = ifelse(jb_test$p.value > 0.05, "No se rechaza Normalidad", "Se rechaza Normalidad"),
check.names = FALSE
)
datatable(tabla_jb, caption = "Tabla 4.4: Prueba Formal de Normalidad de los Residuos",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
La prueba formal de Jarque-Bera arroja un estadístico de 86.42 con un \(p\)-valor de \(< 2.2 \times 10^{-16}\), rechazando la hipótesis nula de normalidad estricta en la distribución de los residuos al nivel de significancia del \(5\%\). Sin embargo, la inspección del gráfico Q-Q Normal evidencia que los residuos muestrales se ajustan de manera casi perfecta a la línea diagonal teórica en la zona central de la distribución, desviándose únicamente en las colas extremas. Esto dado al elevado tamaño muestral (\(N = 40663\)), la propiedad asintótica del Teorema del Límite Central (TLC) garantiza que los estimadores MCO mantienen su consistencia y que las pruebas de hipótesis \(t\) y \(F\) continúan siendo válidas.
Uno de los supuestos fundamentales del MCO es la homocedasticidad, la cual establece que la variaza de los residuos es constante a lo largo de todas las observaciones. Se evalúa gráficamente mediante el diagrama de residuos vs valores ajustados y formalmente mediantes la prueba de Breusch-Pagan.
plot(modelo_mco, which = 1)
bp_test <- bptest(modelo_mco)
tabla_bp <- data.frame(
`Prueba Estadística` = "Breusch-Pagan (Homocedasticidad)",
`Estadístico (BP)` = round(as.numeric(bp_test$statistic), 4),
`Grados de Libertad` = as.numeric(bp_test$parameter),
`p-valor` = format.pval(bp_test$p.value, digits = 4),
`Decisión (α = 0.05)` = ifelse(bp_test$p.value > 0.05, "Homocedasticidad (Varianza Constante)", "Heterocedasticidad Detectada"),
check.names = FALSE
)
datatable(tabla_bp, caption = "Tabla 4.5: Prueba Formal de Homocedasticidad",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
La prueba de Breusch-Pagan registra un estadístico \(BP = 740.05\) con un \(p\)-valor de \(< 2.2 \times 10^{-16}\), lo que conduce al rechazo de la hipótesis nula de varianza constante y confirma la presencia de heterocedasticidad en los errores del modelo. Gráficamente, el diagrama de Residuos vs Valores Ajustados muestra una dispersión heterogénea de la varianza a lo largo de los distintos niveles del puntaje predicho (\(\hat{Y}\)). Este fenómeno es habitual en estudios microeconómicos de corte transversal con muestras amplias, donde la variabilidad del rendimiento académico tiende a ser más dispersa entre estudiantes con mayores activos socioeconómicos y de capital cultural.
Se verifica si la forma funcional del modelo es correcta mediante la prueba RESET de Ramsey, y se comprueba la no autocorrelación entre residuos mediante la prueba de Durbin-Watson.
reset_test <- resettest(modelo_mco, power = 2:3, type = "fitted")
dw_test <- dwtest(modelo_mco)
tabla_diag <- data.frame(
`Prueba Diagnóstica` = c("RESET de Ramsey (Forma Funcional)", "Durbin-Watson (Independencia de Errores)"),
`Estadístico` = c(round(as.numeric(reset_test$statistic), 4), round(as.numeric(dw_test$statistic), 4)),
`p-valor` = c(format.pval(reset_test$p.value, digits = 4), format.pval(dw_test$p.value, digits = 4)),
`Conclusión` = c(
ifelse(reset_test$p.value > 0.05, "Especificación funcional correcta", "Evidencia de mala especificación"),
ifelse(dw_test$p.value > 0.05, "Errores independientes (Sin autocorrelación)", "Presencia de autocorrelación")
),
check.names = FALSE
)
datatable(tabla_diag, caption = "Tabla 4.6: Diagnóstico de Especificación Funcional y Autocorrelación",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
La prueba RESET de Ramsey registra un estadístico de \(197.49\) (\(p < 2.2 \times 10^{-16}\)), rechazando la hipótesis de correcta especificación lineal estricta. Esto sugiere la existencia de posibles relaciones no lienales o la omisión de variables del entorno escolar no disponibles en la base depurada.
Por su parte, la prueba de Durbin-Watson arroja un estadístico \(DW = 1.6329\) (\(p < 2.2 \times 10^{-16}\)). Aunque el valor se aproxima a \(2.0\), la desviación respecto a la no autocorrelación perfecta responde al ordenamiento geográfico de las observaciones, donde estudiantes evaluados en una misma institución o municipio tienden a compartir características contextuales homogéneas.
Dado que en datos socioeconómicos de corte transversal es frecuente violar el supuesto de homocedasticidad, se realiza la reestimación de las desviaciones estándar utilizando la matriz de covarianza robusta a heterocedasticidad. Esto permite corregir las inferencias y p-valores sin alterar los coeficientes estimados por MCO.
mco_robusto <- coeftest(modelo_mco, vcov = vcovHC(modelo_mco, type = "HC1"))
tabla_robusta <- tidy(mco_robusto)
colnames(tabla_robusta) <- c("Variable / Término", "Coeficiente (β)", "Error Estándar Robusto", "Estadístico z", "p-valor Robusto")
tabla_robusta$`Coeficiente (β)` <- round(tabla_robusta$`Coeficiente (β)`, 4)
tabla_robusta$`Error Estándar Robusto` <- round(tabla_robusta$`Error Estándar Robusto`, 4)
tabla_robusta$`Estadístico z` <- round(tabla_robusta$`Estadístico z`, 4)
tabla_robusta$`p-valor Robusto` <- format.pval(tabla_robusta$`p-valor Robusto`, digits = 4)
datatable(tabla_robusta, caption = "Tabla 4.7: Estimación Final con Errores Estándar Robustos a Heterocedasticidad (HC1)",
rownames = FALSE, options = list(dom = 't', scrollX = TRUE), class = 'cell-border stripe hover')
Para solventar la violación del supuesto de homocedasticidad detectada en la sección 4.4 y garantizar inferencias insesgadas, se reestimó la matriz de covarianza mediantes rrores estándar robustos tipo HC1.
Como es teóricamente esperado, la magnitud de los coeficientes estimados (\(\hat{\beta}_j\)) no experimenta ningún cambio. Aunque los errores estándar ajustados registran incrementos leves ( por ejemplo, el error estándar del sector pasa de \(0.5492\) a \(0.5783\), y el de la educación superior de la madre de \(0.5572\) a \(0.5884\)), los estadísticos de prueba \(z\) se mantienen significativamente altos (\(\vert{}z\vert{} > 5.60\)) con \(p\)-valores robustos menores a \(0.001\).
En consecuencia, todas las variables del modelo conservan su significancia individual al 99.9% de confianza, confirmando que el sector educativo,el estrato socioeconómico, la conectividad, la tenencia de equipo informático y el nivel educativo materno son determinantes robustos e indispensables del rendimiento académico en Saber 11 en Colombia.
El análisis econométrico demuestra que el capital cultural del hogar, medido a través del nivel educativo superior de la madre, constituye el factor explicativo individual de mayor magnitud e impacto sobre el rendimiento en las pruebas Saber 11. El coeficiente estimado (\(\hat{\beta}_5 = 24.87, p < 0.001\)) indica que, manteniendo todas las demás variables constantes, contar con una madre con estudios técnicos, tecnológicos o universitarios genera un incremento promedio esperado de casi 25 puntos en el puntaje global final. Este resultado confirma empíricamente la teoría del capital cultural en la educación: la escolaridad materna no solo se traduce en mayores ingresos del hogar, sino en pautas de crianza orientadas al desarrollo cognitivo, hábitos de lectura reforzados, mayor acompañamiento pedagógico en tareas complejas y la consolidación de un horizonte de expectativas académicas superiores para los hijos. En el análisis descriptivo, esta variable exhibe la mayor correlación positiva con la variable respuesta (\(r = 0.45\)) y genera una brecha promedio de 40 puntos (284 puntos en estudiantes con madre profesional frente a 244 puntos en aquellos cuya madre no cuenta con estudios superiores), demostrando que las disparidades de origen familiar continúan condicionando fuertemente el éxito escolar en Colombia.
La tenencia de herramientas informáticas y la conectividad a internet en la vivienda se consolidan como determinantes críticos e indispensables del desempeño estudiantil. La estimación MCO asigna un efecto marginal positivo de \(12.73\) puntos al hecho de poseer computador en el hogar (\(\hat{\beta}_4 = 12.73, p < 0.001\)) y de \(7.52\) puntos adicionales por disponer de conexión a internet (\(\hat{\beta}_3 = 7.52, p < 0.001\)). De manera conjunta, un estudiante que goza de ambos activos digitales obtiene una ventaja econométrica superior a los 20 puntos respecto a un estudiante desprovisto de estas tecnologías, ceteris paribus. A nivel descriptivo, las brechas observadas alcanzan los 30 puntos promedio tanto para internet (268 vs. 238 puntos) como para computador (267 vs. 237 puntos). Aunque estas dos variables exhiben una correlación positiva considerable entre sí (\(r = 0.82\)), la prueba de Inflación de la Varianza (VIF de \(1.76\) e \(1.64\)) demostró que ambas aportan información linealmente independiente. Esto evidencia que el computador funciona como un activo de procesamiento y ejercitación activa (simulacros, redacción, software educativo), mientras que internet actúa como la ventana de acceso a repositorios de información y material bibliográfico.
Los resultados confirman que el entorno residencial y la naturaleza jurídica del colegio operan como canales de segregación socioeconómica que perpetúan la inercia social. El coeficiente asociado al estrato socioeconómico (\(\hat{\beta}_2 = 7.63, p < 0.001\)) indica que por cada nivel adicional en la estratificación de la vivienda, el puntaje global se incrementa en promedio \(7.63\) puntos, acumulando un gradiente social directo que supera los 77 puntos promedio entre el estrato 1 (238 puntos) y el estrato 6 (315 puntos). Respecto al sector educativo, pertenecer a una institución pública (Oficial) implica una penalización promedio de \(-3.24\) puntos en el modelo controlado (\(\hat{\beta}_1 = -3.24, p < 0.001\)), mientras que en la evaluación bivariada la brecha bruta entre el sector No Oficial (268 puntos promedio) y el Oficial (238 puntos promedio) asciende a 30 puntos. La diferencia entre la brecha bruta y la parcial econométrica revela que gran parte de la ventaja de los colegios privados responde a la selección socioeconómica de sus matriculados (estudiantes de mayor estrato, con internet y computadores), pero persiste un efecto atribuible a la infraestructura, jornada escolar y recursos del sector educativo.
Desde la perspectiva cuantitativa, el modelo lineal múltiple logra explicar un \(20.35\%\) de la variabilidad total en el puntaje global Saber 11 (\(R^2 = 0.2035, R^2_{\text{ajustado}} = 0.2034\)), respaldado por una prueba de significancia conjunta altamente concluyente (\(F = 2077.63, p < 0.001\)) sobre una muestra de 40.663 estudiantes. El análisis de supuestos reveló la ausencia de multicolinealidad severa (VIF \(< 1.76\)), y aunque la prueba Jarque-Bera rechazó la normalidad estricta de residuos (\(p < 0.001\)), el amplio volumen muestral permite invocar la propiedad asintótica del Teorema del Límite Central para sostener la validez de las inferencias. Por su parte, la detección de heterocedasticidad mediante la prueba de Breusch-Pagan (\(BP = 740.05, p < 0.001\)) identificó mayor dispersión del rendimiento en estudiantes con mayores recursos socioeconómicos. La aplicación exitosa de la corrección por errores estándar robustos a heterocedasticidad (HC1) mantuvo la significancia estadística al \(99.9\%\) de confianza para todos los predictores, confirmando la solidez de los coeficientes obtenidos. Finalmente, la prueba RESET de Ramsey (\(197.49, p < 0.001\)) sugiere la presencia de no linealidades o variables omitidas clave no capturadas en la base, como el liderazgo directivo, la calidad docente y las habilidades blandas.
Es indispensable diseñar e implementar una política de nivelación para los colegios del sector Oficial que apunte a cerrar la brecha estructural frente al sector privado. El Gobierno Nacional y las Secretarías de Educación territoriales deben focalizar la inversión en la masificación de la jornada única, garantizando no solo mayor intensidad horaria en áreas evaluadas (matemáticas, ciencias y lectura crítica), sino también complementos nutricionales adecuados y programas de fortalecimiento de competencias para los docentes. Asimismo, los presupuestos públicos deben priorizar la dotación de laboratorios, bibliotecas actualizadas y materiales de preparación estandarizada en colegios oficiales de zonas vulnerables, evitando que la calidad educativa dependa de la capacidad de pago del núcleo familiar.
Dado que la tenencia de computador y el acceso a internet representan conjuntamente un retorno econométrico superior a los 20 puntos en el examen, la conectividad debe ser declarada e implementada como un servicio público esencial y un derecho humano fundamental para la educación. Se recomienda desplegar un programa nacional de inclusión digital focalizado en los estratos 1, 2 y sectores rurales, articulando al Ministerio TIC y al Ministerio de Educación para subsidiar planes de banda ancha residencial de alta velocidad y la entrega de equipos portátiles pedagógicos en propiedad de las familias con estudiantes en educación media. Adicionalmente, las instituciones oficiales deben habilitar aulas digitales con conectividad extracurricular para que los estudiantes sin recursos en casa puedan realizar prácticas formativas autodidactas.
Para contrarrestar el sesgo de origen vinculado al nivel educativo de los padres (cuya falta de educación superior penaliza sustancialmente el rendimiento del estudiante), el Estado debe estructurar sistemas de tutoría escolar comunitaria y acompañamiento psicosocial. Es necesario crear programas de mentores universitarios (estudiantes de educación superior que realicen su servicio social o prácticas) encargados de asesorar a jóvenes de secundaria cuyas madres no tuvieron acceso a la educación superior. Estas mentorías deben suplir la falta de orientación en el hogar en materia de técnicas de estudio, orientación vocacional, preparación para pruebas estandarizadas y estímulo de expectativas universitarias.
Teniendo en cuenta que el \(20.35\%\) de la variabilidad de la prueba Saber 11 responde directamente a factores socioeconómicos ajenos al talento o esfuerzo individual del estudiante, los mecanismos de admisión a las universidades públicas y los programas estatales de becas o créditos condonables deben ajustar sus criterios de selección. Se recomienda transitar hacia modelos de acceso contextualizado o acciones afirmativas que evalúen el puntaje Saber 11 en relación con el entorno socioeconómico del aspirante (estrato, sector educativo y capital socioeducativo del hogar). Con ello, se garantizará que los jóvenes talentosos de contextos vulnerables no sean segregados por un filtro estandarizado que refleja las brechas sociales de origen, promoviendo una verdadera movilidad social intergeneracional en el país.