Resumen

Este trabajo analizó la relación entre el estado socioeconómico de los estudiantes, la elección de un colegio público o privado y su estado académico. Para ello se utilizó la base de datos survey del paquete lsm de R y se seleccionó una muestra de 120 estudiantes formada por 60 de colegios públicos y 60 de colegios privados. El análisis se desarrolló mediante un enfoque descriptivo y exploratorio porque se buscó conocer la distribución de las variables e identificar posibles relaciones entre estas. Por esta razón se calcularon frecuencias absolutas y relativas y además se elaboraron tablas de contingencia y diagramas de barras. Los resultados mostraron que los estudiantes de las diferentes condiciones económicas asistían tanto a colegios públicos como privados. Asimismo en los colegios privados se observó una cantidad ligeramente mayor de estudiantes distinguidos mientras que en los públicos hubo más estudiantes con estado académico regular. Sin embargo las diferencias fueron pequeñas y tampoco se encontró un patrón académico definido según el estado económico. En conclusión el estado socioeconómico y el tipo de colegio presentaron algunas relaciones con el estado académico aunque no mostraron una influencia directa dentro de la muestra analizada.

Palabras Clave

Estado socioeconómico; tipo de colegio; estado académico; análisis exploratorio de datos; estadística descriptiva.

Introducción

La educación ayuda a los estudiantes a desarrollar sus capacidades y mejorar sus oportunidades futuras. Sin embargo, no todos tienen acceso a las mismas condiciones educativas. El estado socioeconómico familiar puede relacionarse con la elección de un colegio público o privado porque influye en la capacidad para pagar la educación y acceder a materiales, tecnología y espacios adecuados para estudiar. Además, estas condiciones pueden relacionarse con el estado académico del estudiante.

La UNESCO (2022) señala que las familias con mayores recursos suelen tener más opciones para elegir un colegio. En Colombia García Villegas et al. (2013) encontraron que las clases sociales suelen educarse por separado y que las familias con mayores ingresos acceden con más facilidad a instituciones privadas. Asimismo, Rangel y Lleras (2010) identificaron que el contexto económico familiar y los recursos del colegio se relacionan con el desempeño académico. Por otra parte, la OCDE (2023) encontró una diferencia de 79 puntos en matemáticas entre los estudiantes colombianos con mayores y menores ventajas socioeconómicas. De manera similar Cabra Hernández (2025) encontró diferencias académicas relacionadas con el nivel socioeconómico y con el carácter público o privado del colegio.

Este estudio es importante porque permite comprender mejor algunas diferencias educativas y puede ayudar a identificar estudiantes que necesiten mayor apoyo. Para ello se analiza una muestra de 120 estudiantes formada por 60 estudiantes de colegios públicos y 60 de colegios privados. Por lo tanto, el objetivo general del trabajo es analizar mediante técnicas de análisis exploratorio de datos la relación entre el estado socioeconómico de los estudiantes, el tipo de colegio al que asisten y su estado académico.

Marco Teórico

Este trabajo utiliza la estadística descriptiva porque busca organizar y resumir la información de los estudiantes, y para esto se trabajó con una muestra de 120 registros seleccionados de una base con 800 observaciones. Además, se aplicó el análisis exploratorio de datos porque permite revisar cómo está distribuida la información y también ayuda a descubrir patrones o diferencias entre los grupos sin comenzar con una conclusión fija. Las variables estudiadas son cualitativas y porque clasifican a los estudiantes mediante categorías.

Para organizar la información se utilizaron tablas de frecuencia que muestran cuántos estudiantes pertenecen a cada categoría y también frecuencias relativas que expresan esas cantidades como porcentajes. Además, se construyeron tablas de contingencia porque permiten comparar dos variables al mismo tiempo y observar cómo se distribuyen el estado académico según el tipo de colegio y cómo se relacionan el estado económico con ambas variables. Finalmente se utilizaron diagramas de barras para comparar gráficamente las categorías y aunque se encontraron algunas diferencias entre los grupos estas no fueron muy grandes por lo cual los resultados permiten identificar posibles relaciones pero no demuestran que una variable sea la causa directa de otra.

Metodología

El estudio se desarrolló mediante un enfoque cuantitativo de manera descriptiva y exploratoria porque se analizaron datos ya existentes sin modificar las condiciones de los estudiantes. La información se obtuvo de la base survey incluida en el paquete lsm de RStudio. La base original estaba formada por 800 observaciones y 66 variables y para efectos de este trabajo esos registros se consideraron la población de referencia. A partir de esta información se seleccionaron los primeros 120 estudiantes mediante el comando data[1:120,]. El análisis se realizó en R mediante un documento R Markdown y además se cargaron los paquetes lsm, dplyr, moments, e1071, ggplot2 y knitr para acceder a los datos, procesarlos y presentar las tablas y los gráficos.

En primer lugar, se revisaron las dimensiones, los nombres de las variables y la estructura de la base. Después se seleccionaron las variables School, Status y Economic que representan el tipo de colegio, el estado académico y el estado económico. La variable colegio se clasificó en público y privado mientras que el estado académico se dividió en distinguido, normal y regular y el estado económico en malo, bueno y regular. Como las tres variables eran categóricas se transformaron en factores mediante la función as.factor y luego las tablas obtenidas se convirtieron en data frames.

Finalmente se calcularon frecuencias absolutas y relativas para conocer la cantidad y el porcentaje de estudiantes en cada categoría. Además, se construyeron tablas de contingencia para comparar el estado económico con el tipo de colegio, el estado económico con el estado académico y el tipo de colegio con el estado académico. También se elaboraron diagramas de barras simples y agrupados mediante ggplot2 porque estos permiten observar con mayor claridad las diferencias entre las categorías. Estas técnicas fueron seleccionadas porque las variables son cualitativas y el propósito del trabajo es describir su distribución y explorar posibles relaciones sin afirmar que una variable sea la causa directa de otra.

Resultados

Instalación de Paquetes

Primero vamos a instalar los paquetes que contienen la base de datos que vamos a utilizar. Damos click en la herramienta “chunks” y pegamos los paquetes, procedemos a descargarlos y verificamos que hayan quedado correctamente instalados.

library(lsm)      # Para descargar una base de datos
library(dplyr)
## 
## Adjuntando el paquete: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library(moments)  # Para hallar las medidas de forma
library(e1071)
## 
## Adjuntando el paquete: 'e1071'
## The following objects are masked from 'package:moments':
## 
##     kurtosis, moment, skewness
library(ggplot2)
## 
## Adjuntando el paquete: 'ggplot2'
## The following object is masked from 'package:e1071':
## 
##     element
library(knitr)

Data Frame

A continuación, se consigue una base de datos del paquete lsm y se le asigna a la variable data.

data <- lsm::survey

1. Conociendo la Base de Datos

Explorar tamaños

Aquí exploramos ciertas características de los objetos y las variables.

length(data)   #A) Revisando número de variables del objeto
## [1] 66
dim(data)      #B Muestra las dimensiones del objeto.
## [1] 800  66
ncol(data)     #C) Muestra el número de columnas del objeto.
## [1] 66
nrow(data)     #D) Muestra el número de filas del objeto.
## [1] 800

La base de datos contiene 800 observaciones y 66 variables en total.

Nombres de las variables

names(data)    #A) Muestra los nombres de las columnas (variables).
##  [1] "Observation"  "ID"           "Gender"       "Like"         "Age"         
##  [6] "Smoke"        "Height"       "Weight"       "BMI"          "School"      
## [11] "SES"          "Enrollment"   "Score"        "MotherHeight" "MotherAge"   
## [16] "MotherCHD"    "FatherHeight" "FatherAge"    "FatherCHD"    "Status"      
## [21] "SemAcum"      "Exam1"        "Exam2"        "Exam3"        "Exam4"       
## [26] "ExamAcum"     "Definitive"   "Expense"      "Income"       "Gas"         
## [31] "Course"       "Law"          "Economic"     "Race"         "Region"      
## [36] "EMO1"         "EMO2"         "EMO3"         "EMO4"         "EMO5"        
## [41] "GOAL1"        "GOAL2"        "GOAL3"        "Pre_STAT1"    "Pre_STAT2"   
## [46] "Pre_STAT3"    "Pre_STAT4"    "Post_STAT1"   "Post_STAT2"   "Post_STAT3"  
## [51] "Post_STAT4"   "Pre_IDARE1"   "Pre_IDARE2"   "Pre_IDARE3"   "Pre_IDARE4"  
## [56] "Pre_IDARE5"   "Post_IDARE1"  "Post_IDARE2"  "Post_IDARE3"  "Post_IDARE4" 
## [61] "Post_IDARE5"  "PSICO1"       "PSICO2"       "PSICO3"       "PSICO4"      
## [66] "PSICO5"

Variables seleccionadas

  • Age–> numérica, indica la edad de la persona encuestada
  • Smoke–> categórica, indica si la persona encuestada fuma o no
  • Height–> numérica, indica la estatura de la persona encuestada
  • Weight–> numérica, indica el peso de la persona encuestada
  • ID–> caractér, indica el código de identificación de la persona encuestada.
str(data)   #A) Estructura de los datos
## tibble [800 × 66] (S3: tbl_df/tbl/data.frame)
##  $ Observation : num [1:800] 1 2 3 4 5 6 7 8 9 10 ...
##  $ ID          : chr [1:800] "SB11201910010435" "SB11201910004475" "SB11201910011427" "SB11201910041975" ...
##  $ Gender      : chr [1:800] "Female" "Male" "Male" "Male" ...
##  $ Like        : chr [1:800] "TV" "Network" "Network" "TV" ...
##  $ Age         : num [1:800] 21.4 21.1 20.9 18.4 16.6 ...
##  $ Smoke       : chr [1:800] "No" "Yes" "Yes" "Yes" ...
##  $ Height      : num [1:800] 1.58 1.6 1.5 1.53 1.78 1.65 1.73 1.53 1.64 1.52 ...
##  $ Weight      : num [1:800] 75 80 64 49 82 80 90 55 50 78 ...
##  $ BMI         : num [1:800] 30 31.2 28.4 20.9 25.9 ...
##  $ School      : chr [1:800] "Private" "Public" "Private" "Public" ...
##  $ SES         : chr [1:800] "Medium" "High" "High" "Low" ...
##  $ Enrollment  : chr [1:800] "Credit" "Scholarship" "Scholarship" "Credit" ...
##  $ Score       : num [1:800] 81 78 77 70 68 65 54 50 36 35 ...
##  $ MotherHeight: chr [1:800] "Short_M" "Normal_M" "Normal_M" "Tall_M" ...
##  $ MotherAge   : num [1:800] 41 45 45 45 46 46 47 48 48 48 ...
##  $ MotherCHD   : num [1:800] 0 0 0 0 1 0 0 0 0 1 ...
##  $ FatherHeight: chr [1:800] "Normal_F" "Short_F" "Tall_F" "Short_F" ...
##  $ FatherAge   : num [1:800] 40 43 44 45 45 46 46 48 48 49 ...
##  $ FatherCHD   : num [1:800] 1 1 1 2 1 1 1 1 1 1 ...
##  $ Status      : chr [1:800] "Distinguished" "Distinguished" "Distinguished" "Regular" ...
##  $ SemAcum     : num [1:800] 4.25 2.8 4.15 3.2 3.45 2.75 2.7 4.35 4.3 2.8 ...
##  $ Exam1       : num [1:800] 1.5 2.3 3.4 2.5 3.1 3.8 5 4 2.5 2.4 ...
##  $ Exam2       : num [1:800] 5 4.9 3.6 4.2 3.5 4.4 3 2.3 3.3 2.6 ...
##  $ Exam3       : num [1:800] 5 3.7 2 5 5 4.2 3.5 4.6 3.8 4.3 ...
##  $ Exam4       : num [1:800] 4.5 3.3 1.9 2.5 3 5 3.6 4.3 1.9 5 ...
##  $ ExamAcum    : num [1:800] 16 14.2 10.9 14.2 14.6 17.4 15.1 15.2 11.5 14.3 ...
##  $ Definitive  : num [1:800] 4 3.55 2.73 3.55 3.65 ...
##  $ Expense     : num [1:800] 48.9 72.1 85.2 56.6 64.6 63 40.8 65.4 37.3 63 ...
##  $ Income      : num [1:800] 1.61 2.07 2.84 1.55 2.32 2.1 1.69 2.18 1.71 2.1 ...
##  $ Gas         : num [1:800] 27.4 24.2 22.3 23.1 27.3 ...
##  $ Course      : chr [1:800] "Face-to-Face" "Virtual" "Face-to-Face" "Virtual" ...
##  $ Law         : chr [1:800] "Agree" "Agree" "Agree" "Agree" ...
##  $ Economic    : chr [1:800] "Regular" "Good" "Regular" "Bad" ...
##  $ Race        : chr [1:800] "Ethnic" "Ethnic" "Ethnic" "Ethnic" ...
##  $ Region      : chr [1:800] "North" "Center" "North" "Center" ...
##  $ EMO1        : num [1:800] 1 4 3 4 2 3 2 3 4 2 ...
##  $ EMO2        : num [1:800] 2 4 1 2 1 1 4 1 2 2 ...
##  $ EMO3        : num [1:800] 2 1 3 3 2 4 2 4 3 3 ...
##  $ EMO4        : num [1:800] 1 2 3 1 4 2 3 2 1 1 ...
##  $ EMO5        : num [1:800] 4 1 2 2 2 2 1 1 2 2 ...
##  $ GOAL1       : chr [1:800] "Strongly agree" "Undecided" "Agree" "Agree" ...
##  $ GOAL2       : chr [1:800] "Agree" "Disagree" "Disagree" "Undecided" ...
##  $ GOAL3       : chr [1:800] "Strongly agree" "Disagree" "Agree" "Strongly agree" ...
##  $ Pre_STAT1   : num [1:800] 2 1 5 4 1 4 4 2 2 2 ...
##  $ Pre_STAT2   : num [1:800] 4 1 1 3 4 1 2 3 3 5 ...
##  $ Pre_STAT3   : num [1:800] 2 1 3 1 1 5 4 3 3 2 ...
##  $ Pre_STAT4   : num [1:800] 5 1 1 2 2 3 2 3 2 4 ...
##  $ Post_STAT1  : num [1:800] 4 5 5 3 5 2 3 3 2 5 ...
##  $ Post_STAT2  : num [1:800] 5 1 2 2 3 3 2 3 2 3 ...
##  $ Post_STAT3  : num [1:800] 2 3 3 4 3 5 5 4 5 4 ...
##  $ Post_STAT4  : num [1:800] 2 3 3 5 4 4 3 5 5 1 ...
##  $ Pre_IDARE1  : chr [1:800] "Quite a bit" "Quite a bit" "Quite a bit" "Little" ...
##  $ Pre_IDARE2  : chr [1:800] "Little" "Little" "Little" "Nothing" ...
##  $ Pre_IDARE3  : chr [1:800] "Quite a bit" "A lot" "Quite a bit" "Quite a bit" ...
##  $ Pre_IDARE4  : chr [1:800] "Quite a bit" "Nothing" "Quite a bit" "Quite a bit" ...
##  $ Pre_IDARE5  : chr [1:800] "Little" "Quite a bit" "Little" "Nothing" ...
##  $ Post_IDARE1 : chr [1:800] "A lot" "A little" "Nothing" "Quite a bit" ...
##  $ Post_IDARE2 : chr [1:800] "A lot" "Nothing" "Quite a bit" "A little" ...
##  $ Post_IDARE3 : chr [1:800] "A little" "Quite a bit" "Nothing" "A lot" ...
##  $ Post_IDARE4 : chr [1:800] "Quite a bit" "A lot" "Nothing" "Quite a bit" ...
##  $ Post_IDARE5 : chr [1:800] "A lot" "Quite a bit" "Nothing" "A lot" ...
##  $ PSICO1      : chr [1:800] "Frequently" "Frequently" "Sometimes" "Almost always" ...
##  $ PSICO2      : chr [1:800] "Almost always" "Sometimes" "Sometimes" "Frequently" ...
##  $ PSICO3      : chr [1:800] "Frequently" "Sometimes" "Sometimes" "Frequently" ...
##  $ PSICO4      : chr [1:800] "Almost always" "Frequently" "Frequently" "Almost never" ...
##  $ PSICO5      : chr [1:800] "Almost always" "Frequently" "Sometimes" "Sometimes" ...

2. Selección de la muestra

Aquí seleccionamos una muestra de 120 estudiantes.

muestra <- data[1:120,]       # A) Un nuevo data frame 
muestra
## # A tibble: 120 × 66
##    Observation ID      Gender Like    Age Smoke Height Weight   BMI School SES  
##          <dbl> <chr>   <chr>  <chr> <dbl> <chr>  <dbl>  <dbl> <dbl> <chr>  <chr>
##  1           1 SB1120… Female TV     21.4 No      1.58     75  30.0 Priva… Medi…
##  2           2 SB1120… Male   Netw…  21.1 Yes     1.6      80  31.2 Public High 
##  3           3 SB1120… Male   Netw…  20.9 Yes     1.5      64  28.4 Priva… High 
##  4           4 SB1120… Male   TV     18.4 Yes     1.53     49  20.9 Public Low  
##  5           5 SB1120… Female TV     16.6 Yes     1.78     82  25.9 Priva… High 
##  6           6 SB1120… Female Netw…  16.0 No      1.65     80  29.4 Public Low  
##  7           7 SB1120… Female TV     19.3 Yes     1.73     90  30.1 Priva… Low  
##  8           8 SB1120… Female TV     18.6 Yes     1.53     55  23.5 Public Medi…
##  9           9 SB1120… Female TV     17.0 Yes     1.64     50  18.6 Priva… High 
## 10          10 SB1120… Male   TV     19.7 Yes     1.52     78  33.8 Public High 
## # ℹ 110 more rows
## # ℹ 55 more variables: Enrollment <chr>, Score <dbl>, MotherHeight <chr>,
## #   MotherAge <dbl>, MotherCHD <dbl>, FatherHeight <chr>, FatherAge <dbl>,
## #   FatherCHD <dbl>, Status <chr>, SemAcum <dbl>, Exam1 <dbl>, Exam2 <dbl>,
## #   Exam3 <dbl>, Exam4 <dbl>, ExamAcum <dbl>, Definitive <dbl>, Expense <dbl>,
## #   Income <dbl>, Gas <dbl>, Course <chr>, Law <chr>, Economic <chr>,
## #   Race <chr>, Region <chr>, EMO1 <dbl>, EMO2 <dbl>, EMO3 <dbl>, EMO4 <dbl>, …

3. Variables categóricas

Aquí seleccionamos las variables: School, Status y Economic.

Tablas de frecuencia

muestra<- data[1:120,]
#A) Definiendo y convirtiendo en factor
Colegio <- as.factor(muestra$School)
EstadoEstudiantil <- as.factor(muestra$Status)
EstadoEconomico <- as.factor(muestra$Economic)

#B) Calcular tabla de frecuencias

Tabla1 <- table(Colegio)
Tabla2 <- table(EstadoEstudiantil)
Tabla3 <- table(EstadoEconomico)

Tabla1_df <- as.data.frame(Tabla1)
kable(
  Tabla1_df,
  caption = "<div style='text-align: center;'><b>Tabla #1. Distribución de Colegio</b></div>",
  escape = FALSE
) 
Table:
Tabla #1. Distribución de Colegio
Colegio Freq
Private 60
Public 60
Tabla2_df <- as.data.frame(Tabla2)
kable(
  Tabla2_df,
  caption = "<div style='text-align: center;'><b>Tabla #2. Distribución de Estado Estudiantil</b></div>",
  escape = FALSE
) 
Table:
Tabla #2. Distribución de Estado Estudiantil
EstadoEstudiantil Freq
Distinguished 43
Normal 38
Regular 39
Tabla3_df <- as.data.frame(Tabla3)
kable(
  Tabla3_df,
  caption = "<div style='text-align: center;'><b>Tabla #3. Distribución de Estado Económico</b></div>",
  escape = FALSE
) 
Table:
Tabla #3. Distribución de Estado Económico
EstadoEconomico Freq
Bad 43
Good 47
Regular 30

Interpretación:

  • De los 120 estudiantes de la muestra, 60 estudian en colegios privados y 60 en colegios públicos.
  • De los 120 estudiantes de la muestra, 43 se encuentran en la categoría distinguida, 38 en la categoría normal y 39 en la categoría regular.
  • De los 120 estudiantes de la muestra, 43 se encuentran en una situación económica mala, 47 en una situación económica buena y 30 en una situación económica regular.

Frecuencias relativas

# Frecuencia R. en "Colegio"
60/120
## [1] 0.5
60/120
## [1] 0.5
#Frecuencia R. en "EstadoEstudiantil"
43/120
## [1] 0.3583333
38/120
## [1] 0.3166667
39/120
## [1] 0.325
#Frecuencia R. en " EstadoEconomico"
43/120
## [1] 0.3583333
47/120
## [1] 0.3916667
30/120
## [1] 0.25

Interpretaciones:

  • Del total de la muestra, el 50% de los encuestados estudian en un colegio privado, mientras que el 50% restante estudia en colegio público.
  • Del total de la muestra, el 35.8% de los encuestados mantienen un estado estudiantil distinguido, mientras que el 31.6% y el 32.5% tienen un estado normal y regular, respectivamente.
  • Del total de la muestra,el 35.8% de los encuestados tienen una mala situación económica, mientras que el 39.1% y el 25% tienen una situación económica buena y regular, respectivamente.

4.Tabla de contingencia

A continuación elaboramos las tablas de contingencia.

Tabla4 <- table(EstadoEconomico, Colegio)
Tabla5 <- table(EstadoEconomico,EstadoEstudiantil)
Tabla6 <- table(Colegio,EstadoEstudiantil)

Tabla4_df <- as.data.frame.matrix(Tabla4)
kable(
  Tabla4_df,
  caption = "<div style='text-align: center;'><b>Tabla #4. Estado Económico vs Colegio</b></div>",
  col.names = c("Estado Económico", "Público", "Privado"),
  escape = FALSE
) 
Table:
Tabla #4. Estado Económico vs Colegio
Estado Económico Público Privado
Bad 20 23
Good 22 25
Regular 18 12
Tabla5_df <- as.data.frame.matrix(Tabla5)
kable(
  Tabla5_df,
  caption = "<div style='text-align: center;'><b>Tabla #5. Estado Económico vs Estado Estudiantal</b></div>",
  col.names = c("Estado Económico","Distinguido", "Normal", "Regular"),
  escape = FALSE
) 
Table:
Tabla #5. Estado Económico vs Estado Estudiantal
Estado Económico Distinguido Normal Regular
Bad 17 12 14
Good 15 16 16
Regular 11 10 9
Tabla6_df <- as.data.frame.matrix(Tabla6)
kable(
  Tabla6_df,
  caption = "<div style='text-align: center;'><b>Tabla #6. Colegio vs Estado Estudiantil</b></div>",
  col.names = c("Colegio", "Distinguido", "Normal","Regular"),
  escape = FALSE
) 
Table:
Tabla #6. Colegio vs Estado Estudiantil
Colegio Distinguido Normal Regular
Private 23 20 17
Public 20 18 22
  • Las distribuciones en general no presentan cambios muy significativos, sin embargo, se observan diferencias en la distribución dentro del grupo de estudiantes con un estado económico regular, donde el 60% de estos pertenecen a colegios privados y el 40% de los estudiantes pertenecen a colegios públicos.Dentro del grupo de estudiantes que tienen un estado académico regular, el 43.5% de ellos pertenecen a colegios privados. mientras que el 56.4% pertenecen a colegios públicos.

  • Dicho lo anterior, aunque existen algunas diferencias, consideramos que no son los suficientemente significativas para concluir grandes cambios en las distribuciones de las variables, más alla de lo ya mencionado.

5.Diagrama de Barras

La función ggplot() nos permite elaborar gráficas de barras.

ggplot(muestra, aes(x = Colegio)) +                            #1
  #geom_bar() +                                             #2
  geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") +       #2 
  
  labs(x="Colegio",y= "Frecuencia")  +              #3               
  ylim(c(0,60)) +                               #4
  #xlim(c(0,300)) +                              #4
  ggtitle("Diagrama de barras#1")  +               #5
  
  # theme_bw() +                                 #6
  theme_bw(base_size = 12) +                     #6
  #coord_flip() +                                #7
  
  geom_text(aes(label=..count..), stat='count',  #8
            position=position_dodge(0.9), 
            vjust=-0.5, 
            size=5.0
            ) + 
  facet_wrap(~"Variable Colegio")                   #9

  • El 50% de los estudiantes asiste a colegio privado.
  • El 50% de los estudiantes asiste a colegio publico.
ggplot(muestra, aes(x = EstadoEconomico)) +                            #1
  #geom_bar() +                                             #2
  geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") +       #2 
  
  labs(x="Estado económico",y= "Frecuencia")  +              #3               
  ylim(c(0,60)) +                               #4
  #xlim(c(0,300)) +                              #4
  ggtitle("Diagrama de barras #2")  +               #5
  
  # theme_bw() +                                 #6
  theme_bw(base_size = 12) +                     #6
  #coord_flip() +                                #7
  
  geom_text(aes(label=..count..), stat='count',  #8
            position=position_dodge(0.9), 
            vjust=-0.5, 
            size=5.0
            ) + 
  facet_wrap(~"Variable Situación Económica")     

  • El 35.8% de estudiantes presenta un estado financiero deficiente.
  • El 39.1% de los estudiantes presenta un estado financiero bueno.
  • El 25% de los estudiantes presenta un estado financiero regular.
ggplot(muestra, aes(x = EstadoEstudiantil)) +                            #1
  #geom_bar() +                                             #2
  geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") +       #2 
  
  labs(x="Estado Estudiantil",y= "Frecuencia")  +              #3               
  ylim(c(0,60)) +                               #4
  #xlim(c(0,300)) +                              #4
  ggtitle("Diagrama de barras#3")  +               #5
  
  # theme_bw() +                                 #6
  theme_bw(base_size = 12) +                     #6
  #coord_flip() +                                #7
  
  geom_text(aes(label=..count..), stat='count',  #8
            position=position_dodge(0.9), 
            vjust=-0.5, 
            size=5.0
            ) + 
  facet_wrap(~"Distribución Estado estudiantil")     

  • El 35.8% de los estudiantes presentan un rendimiento académico distinguido.
  • El 31.6% de los estudiantes presentan un rendimiento académico normal.
  • El 32.5% de los estudiantes presentan un rendimiento académico regular.
ggplot(muestra, aes(EstadoEconomico, fill= EstadoEstudiantil)) +      
  geom_bar(position="dodge",colour="black") +
  
  labs(x= "Estado Económico",  y="Frecuencias", fill="Estado Estudiantil") +
  ylim(c(0,30)) +
  #xlim(c(0,300)) +   
  
  ggtitle("Diagrama de barras#4") + 
  
  #theme_bw() +                     
  theme_bw(base_size = 12) +          
  #coord_flip() + 
  
  #guides(fill=FALSE)+                                #8                                    
  scale_fill_manual(values = c("#528B8B","#698B69","#CD6090")) +   #9
  
  geom_text(aes(label=..count..), stat='count',       #10
            position=position_dodge(0.9),
            vjust=-0.5, 
            size=5.0
            )+
  
  facet_wrap(~"Estado Económico por Estudiante distinguido, regular y malo.")  #11

  • Dentro de los estudiantes que presentan un estado económico deficiente, el 39.5% son estudiantes distinguidos.
  • Dentro de los estudiantes que presentan un estado económico deficiente, el 27.9% son estudiantes con rendimiento académico normal.
  • Dentro de los estudiantes que presentan un estado económico deficiente, el 32.5% son estudiantes con rendimiento académico regular.
  • Dentro de los estudiantes que presentan un estado económico bueno, el 31.9% son estudiantes distinguidos.
  • Dentro de los estudiantes que presentan un estado económico bueno, el 34% son estudiantes con rendimiento académico normal.
  • Dentro de los estudiantes que presentan un estado económico bueno, el 34% son estudiantes con rendimiento académico regular.
  • Dentro de los estudiantes que presentan un estado económico regular, el 36.6% son estudiantes distinguidos.
  • Dentro de los estudiantes que presentan un estado económico regular, el 33.3% son estudiantes con rendimiento académico normal.
  • Dentro de los estudiantes que presentan un estado económico regular, el 30% son estudiantes con rendimiento académico regular.
ggplot(muestra, aes(Colegio,  fill= EstadoEstudiantil)) +      
  geom_bar(position="dodge",colour="black") +
  
  labs(x= "Colegio",  y="Frecuencias", fill="Estado Estudiantil") +
  ylim(c(0,30)) +
  #xlim(c(0,300)) +   
  
  ggtitle("Diagrama de barras#5") + 
  
  #theme_bw() +                     
  theme_bw(base_size = 12) +          
  #coord_flip() + 
  
  #guides(fill=FALSE)+                                #8                                    
  scale_fill_manual(values = c("#528B8B","#698B69","#CD6090")) +   #9
  
  geom_text(aes(label=..count..), stat='count',       #10
            position=position_dodge(0.9),
            vjust=-0.5, 
            size=5.0
            )+
  
  facet_wrap(~" Colegio por Estudiante Distinguido, Regular y Deficiente.")  #11

  • Dentro del grupo de estudiantes de colegio privado, el 38.3% son estudiantes con rendimiento académico distinguido.
  • Dentro del grupo de estudiantes de colegio privado, el 33.3% son estudiantes con rendimiento académico normal.
  • Dentro del grupo de estudiantes de colegio privado, el 28.3% son estudiantes con rendimiento académico regular.
  • Dentro del grupo de estudiantes de colegio público, el 33.3% son estudiantes con rendimiento académico distinguido.
  • Dentro del grupo de estudiantes de colegio público, el 30% son estudiantes con rendimiento académico normal.
  • Dentro del grupo de estudiantes de colegio público, el 36.6% son estudiantes con rendimiento académico regular.
ggplot(muestra, aes(EstadoEconomico,  fill= Colegio)) +      
  geom_bar(position="dodge",colour="black") +
  
  labs(x= "Estado Económico",  y="Frecuencias", fill="Colegio") +
  ylim(c(0,30)) +
  #xlim(c(0,300)) +   
  
  ggtitle("Diagrama de barras#6") + 
  
  #theme_bw() +                     
  theme_bw(base_size = 12) +          
  #coord_flip() + 
  
  #guides(fill=FALSE)+                                #8                                    
  scale_fill_manual(values = c("#528B8B","#698B69")) +   #9
  
  geom_text(aes(label=..count..), stat='count',       #10
            position=position_dodge(0.9),
            vjust=-0.5, 
            size=5.0
            )+
  
  facet_wrap(~"Estado Económico por Colegio Público y Privado")  #11

  • Dentro del grupo de estudiantes con estado económico malo, el 46.5% de ellos asiste a colegio privado.
  • Dentro del grupo de estudiantes con estado económico malo, el 53.4% de ellos asiste a colegio público.
  • Dentro del grupo de estudiantes con estado económico bueno, el 46.8% de ellos asiste a colegio privado.
  • Dentro del grupo de estudiantes con estado económico bueno, el 53.1% de ellos asiste a colegio público.
  • Dentro del grupo de estudiantes con estado económico regular, el 60% de ellos asiste a colegio privado.
  • Dentro del grupo de estudiantes con estado económico regular, el 40% de ellos asiste a colegio público.

6. Interpretación

La muestra está conformada por 120 estudiantes, distribuidos equitativamnete en colegios públicos y privados. Predominan los estudiantes con un estado financiero bueno, con un 39.1%, seguidos del estado financiero deficiente y finalmente regular. Por otro lado, predominan los estudiantes con rendimiento academico distinguido, seguidos de los estudiantes con rendimiento regular y normal, respectivamente. Aunque a grandes rasgos no se observan predominancias muy significativas.

Los graficos nos permiten observar mejor las diferencias de frecuencias entre variables y visualizar mejor el comportamiento de los datos de la muestra. Sin embargo, realizar solo un analisis exploratorio de datos nos trae ciertas limitaciones como, por ejemplo, el análisis de datos exploratorios nos permite ver el comportamiento de las variables, pero, no nos permite comprobar una hipótesis, ya que para comprobarlo se necesita de una prueba estadística, es decir, permite tener una idea del comportamiento de los datos pero solamente con él no puedes afirmar tus hipótesis.

Conclusiones

Al aplicar las herramientas básicas de exploración de datos estudiadas en clase, se pudo analizar y estudiar un conjunto de datos y las características de algunas de sus variables. Pudimos identificar las diferentes variables de la muestra y clasificarlas entre variables tipo caracter, como “ID”, variables de tipo numérica, como “age”, “height” y “weight” y variables categóricas como “smoke”. Mediante las tablas de frecuencia identificamos las características de las variables analizadas, como la predominancia de estudiantes con un estado económico bueno con un 39.1%, y estudiantes con rendimiento académico distinguido, con un 35.8%. Finalmente las graficas nos permitieron observar mejor aquellas diferencias de forma visual, a pesar de no constar con diferencias muy significativas en nuestra muestra de datos.

Bibliografía

Cabra Hernández, H. W. (2025). Socioeconomic achievement gaps in science and social studies in Colombia: An assessment of factors affecting school achievement. Frontiers in Education, 10, 1658707. https://doi.org/10.3389/feduc.2025.1658707

García Villegas, M., Espinosa Restrepo, J. R., Jiménez Ángel, F., y Parra Heredia, J. D. (2013). Separados y desiguales: Educación y clases sociales en Colombia. Dejusticia. https://doi.org/10.51438/DJgarcia2013a

Organización para la Cooperación y el Desarrollo Económicos. (2023). PISA 2022 results. Volume I: The state of learning and equity in education. OECD Publishing. https://doi.org/10.1787/53f23881-en

Rangel, C., y Lleras, C. (2010). Educational inequality in Colombia: Family background, school quality and student achievement in Cartagena. International Studies in Sociology of Education, 20(4), 291–317. https://doi.org/10.1080/09620214.2010.530855

UNESCO. (2022). Non-state actors in education: Who chooses? Who loses? Global Education Monitoring Report 2022 youth report. https://unesdoc.unesco.org/ark:/48223/pf0000381643

Declaraciones de IA