Este trabajo analizó la relación entre el estado socioeconómico de los estudiantes, la elección de un colegio público o privado y su estado académico. Para ello se utilizó la base de datos survey del paquete lsm de R y se seleccionó una muestra de 120 estudiantes formada por 60 de colegios públicos y 60 de colegios privados. El análisis se desarrolló mediante un enfoque descriptivo y exploratorio porque se buscó conocer la distribución de las variables e identificar posibles relaciones entre estas. Por esta razón se calcularon frecuencias absolutas y relativas y además se elaboraron tablas de contingencia y diagramas de barras. Los resultados mostraron que los estudiantes de las diferentes condiciones económicas asistían tanto a colegios públicos como privados. Asimismo en los colegios privados se observó una cantidad ligeramente mayor de estudiantes distinguidos mientras que en los públicos hubo más estudiantes con estado académico regular. Sin embargo las diferencias fueron pequeñas y tampoco se encontró un patrón académico definido según el estado económico. En conclusión el estado socioeconómico y el tipo de colegio presentaron algunas relaciones con el estado académico aunque no mostraron una influencia directa dentro de la muestra analizada.
Estado socioeconómico; tipo de colegio; estado académico; análisis exploratorio de datos; estadística descriptiva.
La educación ayuda a los estudiantes a desarrollar sus capacidades y mejorar sus oportunidades futuras. Sin embargo, no todos tienen acceso a las mismas condiciones educativas. El estado socioeconómico familiar puede relacionarse con la elección de un colegio público o privado porque influye en la capacidad para pagar la educación y acceder a materiales, tecnología y espacios adecuados para estudiar. Además, estas condiciones pueden relacionarse con el estado académico del estudiante.
La UNESCO (2022) señala que las familias con mayores recursos suelen tener más opciones para elegir un colegio. En Colombia García Villegas et al. (2013) encontraron que las clases sociales suelen educarse por separado y que las familias con mayores ingresos acceden con más facilidad a instituciones privadas. Asimismo, Rangel y Lleras (2010) identificaron que el contexto económico familiar y los recursos del colegio se relacionan con el desempeño académico. Por otra parte, la OCDE (2023) encontró una diferencia de 79 puntos en matemáticas entre los estudiantes colombianos con mayores y menores ventajas socioeconómicas. De manera similar Cabra Hernández (2025) encontró diferencias académicas relacionadas con el nivel socioeconómico y con el carácter público o privado del colegio.
Este estudio es importante porque permite comprender mejor algunas diferencias educativas y puede ayudar a identificar estudiantes que necesiten mayor apoyo. Para ello se analiza una muestra de 120 estudiantes formada por 60 estudiantes de colegios públicos y 60 de colegios privados. Por lo tanto, el objetivo general del trabajo es analizar mediante técnicas de análisis exploratorio de datos la relación entre el estado socioeconómico de los estudiantes, el tipo de colegio al que asisten y su estado académico.
Este trabajo utiliza la estadística descriptiva porque busca organizar y resumir la información de los estudiantes, y para esto se trabajó con una muestra de 120 registros seleccionados de una base con 800 observaciones. Además, se aplicó el análisis exploratorio de datos porque permite revisar cómo está distribuida la información y también ayuda a descubrir patrones o diferencias entre los grupos sin comenzar con una conclusión fija. Las variables estudiadas son cualitativas y porque clasifican a los estudiantes mediante categorías.
Para organizar la información se utilizaron tablas de frecuencia que muestran cuántos estudiantes pertenecen a cada categoría y también frecuencias relativas que expresan esas cantidades como porcentajes. Además, se construyeron tablas de contingencia porque permiten comparar dos variables al mismo tiempo y observar cómo se distribuyen el estado académico según el tipo de colegio y cómo se relacionan el estado económico con ambas variables. Finalmente se utilizaron diagramas de barras para comparar gráficamente las categorías y aunque se encontraron algunas diferencias entre los grupos estas no fueron muy grandes por lo cual los resultados permiten identificar posibles relaciones pero no demuestran que una variable sea la causa directa de otra.
El estudio se desarrolló mediante un enfoque cuantitativo de manera descriptiva y exploratoria porque se analizaron datos ya existentes sin modificar las condiciones de los estudiantes. La información se obtuvo de la base survey incluida en el paquete lsm de RStudio. La base original estaba formada por 800 observaciones y 66 variables y para efectos de este trabajo esos registros se consideraron la población de referencia. A partir de esta información se seleccionaron los primeros 120 estudiantes mediante el comando data[1:120,]. El análisis se realizó en R mediante un documento R Markdown y además se cargaron los paquetes lsm, dplyr, moments, e1071, ggplot2 y knitr para acceder a los datos, procesarlos y presentar las tablas y los gráficos.
En primer lugar, se revisaron las dimensiones, los nombres de las variables y la estructura de la base. Después se seleccionaron las variables School, Status y Economic que representan el tipo de colegio, el estado académico y el estado económico. La variable colegio se clasificó en público y privado mientras que el estado académico se dividió en distinguido, normal y regular y el estado económico en malo, bueno y regular. Como las tres variables eran categóricas se transformaron en factores mediante la función as.factor y luego las tablas obtenidas se convirtieron en data frames.
Finalmente se calcularon frecuencias absolutas y relativas para conocer la cantidad y el porcentaje de estudiantes en cada categoría. Además, se construyeron tablas de contingencia para comparar el estado económico con el tipo de colegio, el estado económico con el estado académico y el tipo de colegio con el estado académico. También se elaboraron diagramas de barras simples y agrupados mediante ggplot2 porque estos permiten observar con mayor claridad las diferencias entre las categorías. Estas técnicas fueron seleccionadas porque las variables son cualitativas y el propósito del trabajo es describir su distribución y explorar posibles relaciones sin afirmar que una variable sea la causa directa de otra.
Primero vamos a instalar los paquetes que contienen la base de datos que vamos a utilizar. Damos click en la herramienta “chunks” y pegamos los paquetes, procedemos a descargarlos y verificamos que hayan quedado correctamente instalados.
library(lsm) # Para descargar una base de datos
library(dplyr)
##
## Adjuntando el paquete: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(moments) # Para hallar las medidas de forma
library(e1071)
##
## Adjuntando el paquete: 'e1071'
## The following objects are masked from 'package:moments':
##
## kurtosis, moment, skewness
library(ggplot2)
##
## Adjuntando el paquete: 'ggplot2'
## The following object is masked from 'package:e1071':
##
## element
library(knitr)
A continuación, se consigue una base de datos del paquete lsm y se le asigna a la variable data.
data <- lsm::survey
Aquí exploramos ciertas características de los objetos y las variables.
length(data) #A) Revisando número de variables del objeto
## [1] 66
dim(data) #B Muestra las dimensiones del objeto.
## [1] 800 66
ncol(data) #C) Muestra el número de columnas del objeto.
## [1] 66
nrow(data) #D) Muestra el número de filas del objeto.
## [1] 800
La base de datos contiene 800 observaciones y 66 variables en total.
names(data) #A) Muestra los nombres de las columnas (variables).
## [1] "Observation" "ID" "Gender" "Like" "Age"
## [6] "Smoke" "Height" "Weight" "BMI" "School"
## [11] "SES" "Enrollment" "Score" "MotherHeight" "MotherAge"
## [16] "MotherCHD" "FatherHeight" "FatherAge" "FatherCHD" "Status"
## [21] "SemAcum" "Exam1" "Exam2" "Exam3" "Exam4"
## [26] "ExamAcum" "Definitive" "Expense" "Income" "Gas"
## [31] "Course" "Law" "Economic" "Race" "Region"
## [36] "EMO1" "EMO2" "EMO3" "EMO4" "EMO5"
## [41] "GOAL1" "GOAL2" "GOAL3" "Pre_STAT1" "Pre_STAT2"
## [46] "Pre_STAT3" "Pre_STAT4" "Post_STAT1" "Post_STAT2" "Post_STAT3"
## [51] "Post_STAT4" "Pre_IDARE1" "Pre_IDARE2" "Pre_IDARE3" "Pre_IDARE4"
## [56] "Pre_IDARE5" "Post_IDARE1" "Post_IDARE2" "Post_IDARE3" "Post_IDARE4"
## [61] "Post_IDARE5" "PSICO1" "PSICO2" "PSICO3" "PSICO4"
## [66] "PSICO5"
str(data) #A) Estructura de los datos
## tibble [800 × 66] (S3: tbl_df/tbl/data.frame)
## $ Observation : num [1:800] 1 2 3 4 5 6 7 8 9 10 ...
## $ ID : chr [1:800] "SB11201910010435" "SB11201910004475" "SB11201910011427" "SB11201910041975" ...
## $ Gender : chr [1:800] "Female" "Male" "Male" "Male" ...
## $ Like : chr [1:800] "TV" "Network" "Network" "TV" ...
## $ Age : num [1:800] 21.4 21.1 20.9 18.4 16.6 ...
## $ Smoke : chr [1:800] "No" "Yes" "Yes" "Yes" ...
## $ Height : num [1:800] 1.58 1.6 1.5 1.53 1.78 1.65 1.73 1.53 1.64 1.52 ...
## $ Weight : num [1:800] 75 80 64 49 82 80 90 55 50 78 ...
## $ BMI : num [1:800] 30 31.2 28.4 20.9 25.9 ...
## $ School : chr [1:800] "Private" "Public" "Private" "Public" ...
## $ SES : chr [1:800] "Medium" "High" "High" "Low" ...
## $ Enrollment : chr [1:800] "Credit" "Scholarship" "Scholarship" "Credit" ...
## $ Score : num [1:800] 81 78 77 70 68 65 54 50 36 35 ...
## $ MotherHeight: chr [1:800] "Short_M" "Normal_M" "Normal_M" "Tall_M" ...
## $ MotherAge : num [1:800] 41 45 45 45 46 46 47 48 48 48 ...
## $ MotherCHD : num [1:800] 0 0 0 0 1 0 0 0 0 1 ...
## $ FatherHeight: chr [1:800] "Normal_F" "Short_F" "Tall_F" "Short_F" ...
## $ FatherAge : num [1:800] 40 43 44 45 45 46 46 48 48 49 ...
## $ FatherCHD : num [1:800] 1 1 1 2 1 1 1 1 1 1 ...
## $ Status : chr [1:800] "Distinguished" "Distinguished" "Distinguished" "Regular" ...
## $ SemAcum : num [1:800] 4.25 2.8 4.15 3.2 3.45 2.75 2.7 4.35 4.3 2.8 ...
## $ Exam1 : num [1:800] 1.5 2.3 3.4 2.5 3.1 3.8 5 4 2.5 2.4 ...
## $ Exam2 : num [1:800] 5 4.9 3.6 4.2 3.5 4.4 3 2.3 3.3 2.6 ...
## $ Exam3 : num [1:800] 5 3.7 2 5 5 4.2 3.5 4.6 3.8 4.3 ...
## $ Exam4 : num [1:800] 4.5 3.3 1.9 2.5 3 5 3.6 4.3 1.9 5 ...
## $ ExamAcum : num [1:800] 16 14.2 10.9 14.2 14.6 17.4 15.1 15.2 11.5 14.3 ...
## $ Definitive : num [1:800] 4 3.55 2.73 3.55 3.65 ...
## $ Expense : num [1:800] 48.9 72.1 85.2 56.6 64.6 63 40.8 65.4 37.3 63 ...
## $ Income : num [1:800] 1.61 2.07 2.84 1.55 2.32 2.1 1.69 2.18 1.71 2.1 ...
## $ Gas : num [1:800] 27.4 24.2 22.3 23.1 27.3 ...
## $ Course : chr [1:800] "Face-to-Face" "Virtual" "Face-to-Face" "Virtual" ...
## $ Law : chr [1:800] "Agree" "Agree" "Agree" "Agree" ...
## $ Economic : chr [1:800] "Regular" "Good" "Regular" "Bad" ...
## $ Race : chr [1:800] "Ethnic" "Ethnic" "Ethnic" "Ethnic" ...
## $ Region : chr [1:800] "North" "Center" "North" "Center" ...
## $ EMO1 : num [1:800] 1 4 3 4 2 3 2 3 4 2 ...
## $ EMO2 : num [1:800] 2 4 1 2 1 1 4 1 2 2 ...
## $ EMO3 : num [1:800] 2 1 3 3 2 4 2 4 3 3 ...
## $ EMO4 : num [1:800] 1 2 3 1 4 2 3 2 1 1 ...
## $ EMO5 : num [1:800] 4 1 2 2 2 2 1 1 2 2 ...
## $ GOAL1 : chr [1:800] "Strongly agree" "Undecided" "Agree" "Agree" ...
## $ GOAL2 : chr [1:800] "Agree" "Disagree" "Disagree" "Undecided" ...
## $ GOAL3 : chr [1:800] "Strongly agree" "Disagree" "Agree" "Strongly agree" ...
## $ Pre_STAT1 : num [1:800] 2 1 5 4 1 4 4 2 2 2 ...
## $ Pre_STAT2 : num [1:800] 4 1 1 3 4 1 2 3 3 5 ...
## $ Pre_STAT3 : num [1:800] 2 1 3 1 1 5 4 3 3 2 ...
## $ Pre_STAT4 : num [1:800] 5 1 1 2 2 3 2 3 2 4 ...
## $ Post_STAT1 : num [1:800] 4 5 5 3 5 2 3 3 2 5 ...
## $ Post_STAT2 : num [1:800] 5 1 2 2 3 3 2 3 2 3 ...
## $ Post_STAT3 : num [1:800] 2 3 3 4 3 5 5 4 5 4 ...
## $ Post_STAT4 : num [1:800] 2 3 3 5 4 4 3 5 5 1 ...
## $ Pre_IDARE1 : chr [1:800] "Quite a bit" "Quite a bit" "Quite a bit" "Little" ...
## $ Pre_IDARE2 : chr [1:800] "Little" "Little" "Little" "Nothing" ...
## $ Pre_IDARE3 : chr [1:800] "Quite a bit" "A lot" "Quite a bit" "Quite a bit" ...
## $ Pre_IDARE4 : chr [1:800] "Quite a bit" "Nothing" "Quite a bit" "Quite a bit" ...
## $ Pre_IDARE5 : chr [1:800] "Little" "Quite a bit" "Little" "Nothing" ...
## $ Post_IDARE1 : chr [1:800] "A lot" "A little" "Nothing" "Quite a bit" ...
## $ Post_IDARE2 : chr [1:800] "A lot" "Nothing" "Quite a bit" "A little" ...
## $ Post_IDARE3 : chr [1:800] "A little" "Quite a bit" "Nothing" "A lot" ...
## $ Post_IDARE4 : chr [1:800] "Quite a bit" "A lot" "Nothing" "Quite a bit" ...
## $ Post_IDARE5 : chr [1:800] "A lot" "Quite a bit" "Nothing" "A lot" ...
## $ PSICO1 : chr [1:800] "Frequently" "Frequently" "Sometimes" "Almost always" ...
## $ PSICO2 : chr [1:800] "Almost always" "Sometimes" "Sometimes" "Frequently" ...
## $ PSICO3 : chr [1:800] "Frequently" "Sometimes" "Sometimes" "Frequently" ...
## $ PSICO4 : chr [1:800] "Almost always" "Frequently" "Frequently" "Almost never" ...
## $ PSICO5 : chr [1:800] "Almost always" "Frequently" "Sometimes" "Sometimes" ...
Aquí seleccionamos una muestra de 120 estudiantes.
muestra <- data[1:120,] # A) Un nuevo data frame
muestra
## # A tibble: 120 × 66
## Observation ID Gender Like Age Smoke Height Weight BMI School SES
## <dbl> <chr> <chr> <chr> <dbl> <chr> <dbl> <dbl> <dbl> <chr> <chr>
## 1 1 SB1120… Female TV 21.4 No 1.58 75 30.0 Priva… Medi…
## 2 2 SB1120… Male Netw… 21.1 Yes 1.6 80 31.2 Public High
## 3 3 SB1120… Male Netw… 20.9 Yes 1.5 64 28.4 Priva… High
## 4 4 SB1120… Male TV 18.4 Yes 1.53 49 20.9 Public Low
## 5 5 SB1120… Female TV 16.6 Yes 1.78 82 25.9 Priva… High
## 6 6 SB1120… Female Netw… 16.0 No 1.65 80 29.4 Public Low
## 7 7 SB1120… Female TV 19.3 Yes 1.73 90 30.1 Priva… Low
## 8 8 SB1120… Female TV 18.6 Yes 1.53 55 23.5 Public Medi…
## 9 9 SB1120… Female TV 17.0 Yes 1.64 50 18.6 Priva… High
## 10 10 SB1120… Male TV 19.7 Yes 1.52 78 33.8 Public High
## # ℹ 110 more rows
## # ℹ 55 more variables: Enrollment <chr>, Score <dbl>, MotherHeight <chr>,
## # MotherAge <dbl>, MotherCHD <dbl>, FatherHeight <chr>, FatherAge <dbl>,
## # FatherCHD <dbl>, Status <chr>, SemAcum <dbl>, Exam1 <dbl>, Exam2 <dbl>,
## # Exam3 <dbl>, Exam4 <dbl>, ExamAcum <dbl>, Definitive <dbl>, Expense <dbl>,
## # Income <dbl>, Gas <dbl>, Course <chr>, Law <chr>, Economic <chr>,
## # Race <chr>, Region <chr>, EMO1 <dbl>, EMO2 <dbl>, EMO3 <dbl>, EMO4 <dbl>, …
Aquí seleccionamos las variables: School, Status y Economic.
muestra<- data[1:120,]
#A) Definiendo y convirtiendo en factor
Colegio <- as.factor(muestra$School)
EstadoEstudiantil <- as.factor(muestra$Status)
EstadoEconomico <- as.factor(muestra$Economic)
#B) Calcular tabla de frecuencias
Tabla1 <- table(Colegio)
Tabla2 <- table(EstadoEstudiantil)
Tabla3 <- table(EstadoEconomico)
Tabla1_df <- as.data.frame(Tabla1)
kable(
Tabla1_df,
caption = "<div style='text-align: center;'><b>Tabla #1. Distribución de Colegio</b></div>",
escape = FALSE
)
Table:
| Colegio | Freq |
|---|---|
| Private | 60 |
| Public | 60 |
Tabla2_df <- as.data.frame(Tabla2)
kable(
Tabla2_df,
caption = "<div style='text-align: center;'><b>Tabla #2. Distribución de Estado Estudiantil</b></div>",
escape = FALSE
)
Table:
| EstadoEstudiantil | Freq |
|---|---|
| Distinguished | 43 |
| Normal | 38 |
| Regular | 39 |
Tabla3_df <- as.data.frame(Tabla3)
kable(
Tabla3_df,
caption = "<div style='text-align: center;'><b>Tabla #3. Distribución de Estado Económico</b></div>",
escape = FALSE
)
Table:
| EstadoEconomico | Freq |
|---|---|
| Bad | 43 |
| Good | 47 |
| Regular | 30 |
# Frecuencia R. en "Colegio"
60/120
## [1] 0.5
60/120
## [1] 0.5
#Frecuencia R. en "EstadoEstudiantil"
43/120
## [1] 0.3583333
38/120
## [1] 0.3166667
39/120
## [1] 0.325
#Frecuencia R. en " EstadoEconomico"
43/120
## [1] 0.3583333
47/120
## [1] 0.3916667
30/120
## [1] 0.25
A continuación elaboramos las tablas de contingencia.
Tabla4 <- table(EstadoEconomico, Colegio)
Tabla5 <- table(EstadoEconomico,EstadoEstudiantil)
Tabla6 <- table(Colegio,EstadoEstudiantil)
Tabla4_df <- as.data.frame.matrix(Tabla4)
kable(
Tabla4_df,
caption = "<div style='text-align: center;'><b>Tabla #4. Estado Económico vs Colegio</b></div>",
col.names = c("Estado Económico", "Público", "Privado"),
escape = FALSE
)
Table:
| Estado Económico | Público | Privado |
|---|---|---|
| Bad | 20 | 23 |
| Good | 22 | 25 |
| Regular | 18 | 12 |
Tabla5_df <- as.data.frame.matrix(Tabla5)
kable(
Tabla5_df,
caption = "<div style='text-align: center;'><b>Tabla #5. Estado Económico vs Estado Estudiantal</b></div>",
col.names = c("Estado Económico","Distinguido", "Normal", "Regular"),
escape = FALSE
)
Table:
| Estado Económico | Distinguido | Normal | Regular |
|---|---|---|---|
| Bad | 17 | 12 | 14 |
| Good | 15 | 16 | 16 |
| Regular | 11 | 10 | 9 |
Tabla6_df <- as.data.frame.matrix(Tabla6)
kable(
Tabla6_df,
caption = "<div style='text-align: center;'><b>Tabla #6. Colegio vs Estado Estudiantil</b></div>",
col.names = c("Colegio", "Distinguido", "Normal","Regular"),
escape = FALSE
)
Table:
| Colegio | Distinguido | Normal | Regular |
|---|---|---|---|
| Private | 23 | 20 | 17 |
| Public | 20 | 18 | 22 |
Las distribuciones en general no presentan cambios muy significativos, sin embargo, se observan diferencias en la distribución dentro del grupo de estudiantes con un estado económico regular, donde el 60% de estos pertenecen a colegios privados y el 40% de los estudiantes pertenecen a colegios públicos.Dentro del grupo de estudiantes que tienen un estado académico regular, el 43.5% de ellos pertenecen a colegios privados. mientras que el 56.4% pertenecen a colegios públicos.
Dicho lo anterior, aunque existen algunas diferencias, consideramos que no son los suficientemente significativas para concluir grandes cambios en las distribuciones de las variables, más alla de lo ya mencionado.
La función ggplot() nos permite elaborar gráficas de barras.
ggplot(muestra, aes(x = Colegio)) + #1
#geom_bar() + #2
geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") + #2
labs(x="Colegio",y= "Frecuencia") + #3
ylim(c(0,60)) + #4
#xlim(c(0,300)) + #4
ggtitle("Diagrama de barras#1") + #5
# theme_bw() + #6
theme_bw(base_size = 12) + #6
#coord_flip() + #7
geom_text(aes(label=..count..), stat='count', #8
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
) +
facet_wrap(~"Variable Colegio") #9
ggplot(muestra, aes(x = EstadoEconomico)) + #1
#geom_bar() + #2
geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") + #2
labs(x="Estado económico",y= "Frecuencia") + #3
ylim(c(0,60)) + #4
#xlim(c(0,300)) + #4
ggtitle("Diagrama de barras #2") + #5
# theme_bw() + #6
theme_bw(base_size = 12) + #6
#coord_flip() + #7
geom_text(aes(label=..count..), stat='count', #8
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
) +
facet_wrap(~"Variable Situación Económica")
ggplot(muestra, aes(x = EstadoEstudiantil)) + #1
#geom_bar() + #2
geom_bar(width=0.5, colour="#8B0A50", fill="#CD6090") + #2
labs(x="Estado Estudiantil",y= "Frecuencia") + #3
ylim(c(0,60)) + #4
#xlim(c(0,300)) + #4
ggtitle("Diagrama de barras#3") + #5
# theme_bw() + #6
theme_bw(base_size = 12) + #6
#coord_flip() + #7
geom_text(aes(label=..count..), stat='count', #8
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
) +
facet_wrap(~"Distribución Estado estudiantil")
ggplot(muestra, aes(EstadoEconomico, fill= EstadoEstudiantil)) +
geom_bar(position="dodge",colour="black") +
labs(x= "Estado Económico", y="Frecuencias", fill="Estado Estudiantil") +
ylim(c(0,30)) +
#xlim(c(0,300)) +
ggtitle("Diagrama de barras#4") +
#theme_bw() +
theme_bw(base_size = 12) +
#coord_flip() +
#guides(fill=FALSE)+ #8
scale_fill_manual(values = c("#528B8B","#698B69","#CD6090")) + #9
geom_text(aes(label=..count..), stat='count', #10
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
)+
facet_wrap(~"Estado Económico por Estudiante distinguido, regular y malo.") #11
ggplot(muestra, aes(Colegio, fill= EstadoEstudiantil)) +
geom_bar(position="dodge",colour="black") +
labs(x= "Colegio", y="Frecuencias", fill="Estado Estudiantil") +
ylim(c(0,30)) +
#xlim(c(0,300)) +
ggtitle("Diagrama de barras#5") +
#theme_bw() +
theme_bw(base_size = 12) +
#coord_flip() +
#guides(fill=FALSE)+ #8
scale_fill_manual(values = c("#528B8B","#698B69","#CD6090")) + #9
geom_text(aes(label=..count..), stat='count', #10
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
)+
facet_wrap(~" Colegio por Estudiante Distinguido, Regular y Deficiente.") #11
ggplot(muestra, aes(EstadoEconomico, fill= Colegio)) +
geom_bar(position="dodge",colour="black") +
labs(x= "Estado Económico", y="Frecuencias", fill="Colegio") +
ylim(c(0,30)) +
#xlim(c(0,300)) +
ggtitle("Diagrama de barras#6") +
#theme_bw() +
theme_bw(base_size = 12) +
#coord_flip() +
#guides(fill=FALSE)+ #8
scale_fill_manual(values = c("#528B8B","#698B69")) + #9
geom_text(aes(label=..count..), stat='count', #10
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
)+
facet_wrap(~"Estado Económico por Colegio Público y Privado") #11
La muestra está conformada por 120 estudiantes, distribuidos equitativamnete en colegios públicos y privados. Predominan los estudiantes con un estado financiero bueno, con un 39.1%, seguidos del estado financiero deficiente y finalmente regular. Por otro lado, predominan los estudiantes con rendimiento academico distinguido, seguidos de los estudiantes con rendimiento regular y normal, respectivamente. Aunque a grandes rasgos no se observan predominancias muy significativas.
Los graficos nos permiten observar mejor las diferencias de frecuencias entre variables y visualizar mejor el comportamiento de los datos de la muestra. Sin embargo, realizar solo un analisis exploratorio de datos nos trae ciertas limitaciones como, por ejemplo, el análisis de datos exploratorios nos permite ver el comportamiento de las variables, pero, no nos permite comprobar una hipótesis, ya que para comprobarlo se necesita de una prueba estadística, es decir, permite tener una idea del comportamiento de los datos pero solamente con él no puedes afirmar tus hipótesis.
Al aplicar las herramientas básicas de exploración de datos estudiadas en clase, se pudo analizar y estudiar un conjunto de datos y las características de algunas de sus variables. Pudimos identificar las diferentes variables de la muestra y clasificarlas entre variables tipo caracter, como “ID”, variables de tipo numérica, como “age”, “height” y “weight” y variables categóricas como “smoke”. Mediante las tablas de frecuencia identificamos las características de las variables analizadas, como la predominancia de estudiantes con un estado económico bueno con un 39.1%, y estudiantes con rendimiento académico distinguido, con un 35.8%. Finalmente las graficas nos permitieron observar mejor aquellas diferencias de forma visual, a pesar de no constar con diferencias muy significativas en nuestra muestra de datos.
Cabra Hernández, H. W. (2025). Socioeconomic achievement gaps in science and social studies in Colombia: An assessment of factors affecting school achievement. Frontiers in Education, 10, 1658707. https://doi.org/10.3389/feduc.2025.1658707
García Villegas, M., Espinosa Restrepo, J. R., Jiménez Ángel, F., y Parra Heredia, J. D. (2013). Separados y desiguales: Educación y clases sociales en Colombia. Dejusticia. https://doi.org/10.51438/DJgarcia2013a
Organización para la Cooperación y el Desarrollo Económicos. (2023). PISA 2022 results. Volume I: The state of learning and equity in education. OECD Publishing. https://doi.org/10.1787/53f23881-en
Rangel, C., y Lleras, C. (2010). Educational inequality in Colombia: Family background, school quality and student achievement in Cartagena. International Studies in Sociology of Education, 20(4), 291–317. https://doi.org/10.1080/09620214.2010.530855
UNESCO. (2022). Non-state actors in education: Who chooses? Who loses? Global Education Monitoring Report 2022 youth report. https://unesdoc.unesco.org/ark:/48223/pf0000381643