Planteamiento del Problema

El acceso a la educación superior está influenciado por múltiples factores, como las condiciones socioeconómicas, el género, la jornada de estudio y la preparación académica previa.
Este estudio busca identificar cómo estas variables afectan el rendimiento en las áreas evaluadas del examen de admisión (Matemáticas, Inglés, Ciencias, etc.), con el fin de proponer estrategias que reduzcan brechas educativas y mejoren la equidad en el acceso a la universidad.

Objetivo General

Analizar la relación entre variables sociodemográficas, la preparación académica y el rendimiento en el examen de admisión universitario.

Objetivos Específicos

  1. Comparar el rendimiento académico entre géneros.
  2. Evaluar el impacto de las condiciones socioeconómicas en los puntajes.
  3. Determinar si la jornada de estudio (diurna/nocturna) influye en los resultados.
  4. Analizar la efectividad de los cursos preparativos.

Cargar librerías y datos

Estadísticas descriptivas

summary(vars_cuant)
##   Matemáticas        Ingles      Lectura Crítica    Ciencias    
##  Min.   :50.00   Min.   :54.00   Min.   :48.00   Min.   :49.00  
##  1st Qu.:63.00   1st Qu.:66.00   1st Qu.:60.00   1st Qu.:63.00  
##  Median :73.00   Median :74.00   Median :69.00   Median :70.00  
##  Mean   :72.98   Mean   :75.05   Mean   :69.33   Mean   :71.58  
##  3rd Qu.:83.00   3rd Qu.:85.00   3rd Qu.:79.00   3rd Qu.:81.00  
##  Max.   :95.00   Max.   :97.00   Max.   :93.00   Max.   :94.00  
##  Razonamiento Cuantitativo    Historia    
##  Min.   :52.00             Min.   :47.00  
##  1st Qu.:63.00             1st Qu.:59.00  
##  Median :76.00             Median :67.00  
##  Mean   :74.11             Mean   :68.14  
##  3rd Qu.:84.00             3rd Qu.:78.00  
##  Max.   :96.00             Max.   :91.00

Histogramas por área

for (col in names(vars_cuant)) {
  hist(vars_cuant[[col]], main = paste("Histograma de", col), xlab = col, col = "lightblue", border = "white")
}

Diagramas de cajas por género

boxplot(datos$`Matemáticas` ~ datos$Genero, col = "tomato", main = "Matemáticas por Género")

boxplot(datos$Ingles ~ datos$Genero, col = "lightblue", main = "Inglés por Género")

boxplot(datos$`Lectura Crítica` ~ datos$Genero, col = "skyblue", main = "Lectura Crítica por Género")

boxplot(datos$Ciencias ~ datos$Genero, col = "lightgreen", main = "Ciencias por Género")

boxplot(datos$`Razonamiento Cuantitativo` ~ datos$Genero, col = "plum", main = "Razonamiento Cuantitativo por Género")

boxplot(datos$Historia ~ datos$Genero, col = "gold", main = "Historia por Género")

Interpretación:
Las mujeres tienden a tener un desempeño ligeramente superior en varias materias, especialmente Matemáticas y Lectura Crítica. Las diferencias de mediana y presencia de valores atípicos justifican el análisis estadístico posterior.

Diagramas de cajas por condiciones socioeconómicas

boxplot(datos$`Matemáticas` ~ datos$Condiciones.socioeconomicas, col = "tomato", main = "Matemáticas por Estrato")

boxplot(datos$Ingles ~ datos$Condiciones.socioeconomicas, col = "lightblue", main = "Inglés por Estrato")

boxplot(datos$`Lectura Crítica` ~ datos$Condiciones.socioeconomicas, col = "skyblue", main = "Lectura Crítica por Estrato")

boxplot(datos$Ciencias ~ datos$Condiciones.socioeconomicas, col = "lightgreen", main = "Ciencias por Estrato")

boxplot(datos$`Razonamiento Cuantitativo` ~ datos$Condiciones.socioeconomicas, col = "plum", main = "Razonamiento Cuantitativo por Estrato")

boxplot(datos$Historia ~ datos$Condiciones.socioeconomicas, col = "gold", main = "Historia por Estrato")

Interpretación:
El nivel socioeconómico influye notablemente en el rendimiento académico. Los estudiantes de estrato alto tienden a obtener mayores puntajes. Esto es evidente especialmente en Matemáticas y Lectura Crítica.

Tablas de frecuencia y diagramas circulares

tabla_genero <- table(datos$Genero)
tabla_estrato <- table(datos$Condiciones.socioeconomicas)
tabla_jornada <- table(datos$Jornada)
tabla_curso <- table(datos$`Curso Preparativo`)

pie(tabla_genero, main = "Distribución por Género", col = c("pink", "purple"))

pie(tabla_estrato, main = "Condiciones Socioeconómicas", col = c("lightblue", "steelblue", "skyblue"))

pie(tabla_jornada, main = "Jornada Académica", col = c("lightgreen", "darkgreen"))

pie(tabla_curso, main = "Curso Preparativo", col = c("orange", "darkorange"))

Análisis de correlación

pairs.panels(vars_cuant)

cor(vars_cuant)
##                           Matemáticas    Ingles Lectura Crítica  Ciencias
## Matemáticas                 1.0000000 0.9889290       0.9948376 0.9902607
## Ingles                      0.9889290 1.0000000       0.9892632 0.9924518
## Lectura Crítica             0.9948376 0.9892632       1.0000000 0.9922244
## Ciencias                    0.9902607 0.9924518       0.9922244 1.0000000
## Razonamiento Cuantitativo   0.9885871 0.9773417       0.9805138 0.9732362
## Historia                    0.9913610 0.9852189       0.9933654 0.9914185
##                           Razonamiento Cuantitativo  Historia
## Matemáticas                               0.9885871 0.9913610
## Ingles                                    0.9773417 0.9852189
## Lectura Crítica                           0.9805138 0.9933654
## Ciencias                                  0.9732362 0.9914185
## Razonamiento Cuantitativo                 1.0000000 0.9833587
## Historia                                  0.9833587 1.0000000

Pruebas estadísticas: Diferencias por género y estrato

ttest_mates <- t.test(`Matemáticas` ~ Genero, data = datos)
ttest_lectura <- t.test(`Lectura Crítica` ~ Genero, data = datos)

ttest_mates
## 
##  Welch Two Sample t-test
## 
## data:  Matemáticas by Genero
## t = 3.7079, df = 52.989, p-value = 0.0005012
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
##   5.043442 16.929464
## sample estimates:
##  mean in group Femenino mean in group Masculino 
##                78.37931                67.39286
ttest_lectura
## 
##  Welch Two Sample t-test
## 
## data:  Lectura Crítica by Genero
## t = 3.6318, df = 54.065, p-value = 0.0006264
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
##   4.696066 16.269451
## sample estimates:
##  mean in group Femenino mean in group Masculino 
##                74.48276                64.00000
anova_mates <- aov(`Matemáticas` ~ `Condiciones socioeconomicas`, data = datos)
anova_lectura <- aov(`Lectura Crítica` ~ `Condiciones socioeconomicas`, data = datos)

summary(anova_mates)
##                               Df Sum Sq Mean Sq F value   Pr(>F)    
## `Condiciones socioeconomicas`  2   5479    2739   48.02 1.04e-12 ***
## Residuals                     54   3080      57                     
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
summary(anova_lectura)
##                               Df Sum Sq Mean Sq F value   Pr(>F)    
## `Condiciones socioeconomicas`  2   5350  2674.8   53.08 1.78e-13 ***
## Residuals                     54   2721    50.4                     
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Resultados, Discusión y Conclusiones

Objetivo 1: Comparar el rendimiento académico entre géneros

Las mujeres obtienen mayores puntajes promedio que los hombres en Matemáticas y Lectura Crítica.
Estas diferencias son estadísticamente significativas (prueba t, p < 0.05).

Objetivo 2: Evaluar el impacto de las condiciones socioeconómicas

El rendimiento promedio en Matemáticas es considerablemente mayor en estudiantes de estrato alto (≈85 puntos) que en estrato bajo (≈62 puntos).
Estas diferencias fueron altamente significativas (ANOVA, p < 0.001).

Objetivo 3: Determinar si la jornada de estudio influye en los resultados

Los estudiantes de jornada diurna presentan mejores promedios que los de jornada nocturna.
Aunque no se aplicaron pruebas formales, los resultados descriptivos muestran un patrón claro.

Objetivo 4: Analizar la efectividad de los cursos preparativos

Quienes realizaron el curso preparativo obtuvieron entre 8 y 12 puntos más en promedio, lo que sugiere una influencia positiva.

Correlación entre áreas de conocimiento

Las materias presentan correlaciones altas (mayores a 0.8), destacando relaciones entre Matemáticas y Razonamiento Cuantitativo, e Historia con Lectura Crítica.

Conclusiones

Recomendaciones

  • Ampliar programas de becas y acompañamiento académico para estudiantes de bajos recursos.
  • Diseñar estrategias de apoyo para estudiantes de jornada nocturna.
  • Promover la participación en cursos preparativos, dada su efectividad demostrada.

Análisis comparativo con muestra aleatoria de tamaño 50

A continuación se toma una muestra aleatoria simple de tamaño 50 con el objetivo de comparar los resultados obtenidos con los del análisis completo.

set.seed(123)  # Para reproducibilidad
muestra_50 <- datos %>% sample_n(50)
vars_cuant_muestra <- muestra_50 %>% select(where(is.numeric))

Estadísticas descriptivas para la muestra

summary(vars_cuant_muestra)
##   Matemáticas        Ingles      Lectura Crítica    Ciencias    
##  Min.   :50.00   Min.   :54.00   Min.   :48.00   Min.   :49.00  
##  1st Qu.:62.25   1st Qu.:65.25   1st Qu.:60.00   1st Qu.:63.00  
##  Median :72.50   Median :74.00   Median :68.50   Median :69.50  
##  Mean   :72.46   Mean   :74.46   Mean   :68.74   Mean   :70.94  
##  3rd Qu.:81.75   3rd Qu.:83.00   3rd Qu.:77.75   3rd Qu.:79.75  
##  Max.   :94.00   Max.   :96.00   Max.   :91.00   Max.   :93.00  
##  Razonamiento Cuantitativo    Historia    
##  Min.   :52.00             Min.   :47.00  
##  1st Qu.:62.25             1st Qu.:59.00  
##  Median :75.50             Median :66.50  
##  Mean   :73.72             Mean   :67.64  
##  3rd Qu.:83.50             3rd Qu.:76.75  
##  Max.   :95.00             Max.   :90.00

Histogramas por área (muestra)

for (col in names(vars_cuant_muestra)) {
  hist(vars_cuant_muestra[[col]], main = paste("Histograma de", col, "(Muestra)"), xlab = col, col = "lightcoral", border = "white")
}

Diagramas de caja por género (muestra)

boxplot(muestra_50$`Matemáticas` ~ muestra_50$Genero, col = "tomato", main = "Matemáticas por Género (Muestra)")

boxplot(muestra_50$Ingles ~ muestra_50$Genero, col = "lightblue", main = "Inglés por Género (Muestra)")

boxplot(muestra_50$`Lectura Crítica` ~ muestra_50$Genero, col = "skyblue", main = "Lectura Crítica por Género (Muestra)")

boxplot(muestra_50$Ciencias ~ muestra_50$Genero, col = "lightgreen", main = "Ciencias por Género (Muestra)")

boxplot(muestra_50$`Razonamiento Cuantitativo` ~ muestra_50$Genero, col = "plum", main = "Razonamiento Cuantitativo por Género (Muestra)")

boxplot(muestra_50$Historia ~ muestra_50$Genero, col = "gold", main = "Historia por Género (Muestra)")

Correlaciones en la muestra

pairs.panels(vars_cuant_muestra)

cor(vars_cuant_muestra)
##                           Matemáticas    Ingles Lectura Crítica  Ciencias
## Matemáticas                 1.0000000 0.9877195       0.9944817 0.9905380
## Ingles                      0.9877195 1.0000000       0.9877194 0.9917210
## Lectura Crítica             0.9944817 0.9877194       1.0000000 0.9920715
## Ciencias                    0.9905380 0.9917210       0.9920715 1.0000000
## Razonamiento Cuantitativo   0.9897753 0.9795799       0.9814413 0.9776333
## Historia                    0.9907219 0.9841111       0.9928549 0.9931112
##                           Razonamiento Cuantitativo  Historia
## Matemáticas                               0.9897753 0.9907219
## Ingles                                    0.9795799 0.9841111
## Lectura Crítica                           0.9814413 0.9928549
## Ciencias                                  0.9776333 0.9931112
## Razonamiento Cuantitativo                 1.0000000 0.9825097
## Historia                                  0.9825097 1.0000000

Comparación General