Inglés y lengua indígena en las escuelas primarias de Argentina

Para realizar el presente trabajo, tomamos la base de datos del Ministerio de Educación sobre la población en el año 2025.

A lo largo del mismo, vamos a analizar principalmente la enseñanza en el nivel primario de la lengua indígena y el idioma inglés, teniendo en cuenta también los sectores y el ámbito, es decir, si la enseñanza se da en escuales estatales o privadas, y en zonas rurales o urbanas.

library(tidyverse)

base_educacion <- read_csv2("~/Documents/Facultad/Investigación Empírica/Trabajo Final/2025 Poblacion - agregada(in).csv"
                            )

Ahora vamos a filtrar los datos que correspondan al nivel primario.

names(base_educacion) |> 
  grep("Primaria", x = _, value = TRUE)
##  [1] "PoblaciónIndigenaPrimaria"                    
##  [2] "IdiomasPrimariaInglés"                        
##  [3] "IdiomasPrimariaFrancés"                       
##  [4] "IdiomasPrimariaPortugués"                     
##  [5] "IdiomasPrimariaItaliano"                      
##  [6] "IdiomasPrimariaAlemán"                        
##  [7] "IdiomasPrimariaHebreo"                        
##  [8] "IdiomasPrimariaLenguaindígena"                
##  [9] "IdiomasPrimariaLSA"                           
## [10] "IdiomasPrimariaChino"                         
## [11] "IdiomasPrimariaOtro"                          
## [12] "IdiomasPrimariaMásdeunIdioma"                 
## [13] "BoliviaPrimaria"                              
## [14] "BrasilPrimaria"                               
## [15] "ChilePrimaria"                                
## [16] "ColombiaPrimaria"                             
## [17] "EcuadorPrimaria"                              
## [18] "ParaguayPrimaria"                             
## [19] "PerúPrimaria"                                 
## [20] "UruguayPrimaria"                              
## [21] "VenezuelaPrimaria"                            
## [22] "OtrospaísesdeAméricaPrimaria"                 
## [23] "EuropaPrimaria"                               
## [24] "AsiaPrimaria"                                 
## [25] "ÁfricaPrimaria"                               
## [26] "OceaníaPrimaria"                              
## [27] "TenenciadecomputadoraPrimaria"                
## [28] "AlumnosconPromociónasistidaacompañadaPrimaria"
## [29] "AlumnosenjornadacompletaPrimaria"             
## [30] "AlumnosenjornadaextendidaPrimaria"            
## [31] "TurnoMañanaPrimaria"                          
## [32] "TurnoIntermedioPrimaria"                      
## [33] "TurnoTardePrimaria"                           
## [34] "TurnoDoblePrimaria"                           
## [35] "DiscapacidadConapoyoestatalPrimaria"          
## [36] "DiscapacidadConapoyoprivadoPrimaria"          
## [37] "DiscapacidadSinapoyoPrimaria"
base_primaria <- base_educacion |> 
  select(provincia, departamento,sector, ambito, Localizacion, IdiomasPrimariaInglés, IdiomasPrimariaLenguaindígena) |> 
  rename(ingles = IdiomasPrimariaInglés, 
         lengua_indigena = IdiomasPrimariaLenguaindígena
         )

Una vez que tenemos los datos de primaria, vamos a analizar aquellos lugares donde se estudia inglés y la lengua indígena.

base_primaria <- base_primaria |>
  mutate(
    tiene_ingles = !is.na(ingles),
    tiene_lengua_indigena = !is.na(lengua_indigena)
  )

glimpse(base_primaria)
## Rows: 1,217
## Columns: 9
## $ provincia             <chr> "Buenos Aires", "Buenos Aires", "Buenos Aires", …
## $ departamento          <chr> "25 DE MAYO", "25 DE MAYO", "25 DE MAYO", "9 DE …
## $ sector                <chr> "Estatal", "Estatal", "Privado", "Estatal", "Est…
## $ ambito                <chr> "Rural", "Urbano", "Urbano", "Rural", "Urbano", …
## $ Localizacion          <dbl> 49, 43, 9, 49, 36, 8, 27, 18, 21, 13, 18, 11, 25…
## $ ingles                <dbl> 325, 1260, 676, 397, 1811, 557, 97, 499, 128, 37…
## $ lengua_indigena       <dbl> NA, NA, NA, NA, NA, NA, NA, NA, NA, NA, NA, NA, …
## $ tiene_ingles          <lgl> TRUE, TRUE, TRUE, TRUE, TRUE, TRUE, TRUE, TRUE, …
## $ tiene_lengua_indigena <lgl> FALSE, FALSE, FALSE, FALSE, FALSE, FALSE, FALSE,…
base_primaria |> 
  count(tiene_ingles)
## # A tibble: 2 × 2
##   tiene_ingles     n
##   <lgl>        <int>
## 1 FALSE          105
## 2 TRUE          1112
base_primaria |> 
  count(tiene_lengua_indigena)
## # A tibble: 2 × 2
##   tiene_lengua_indigena     n
##   <lgl>                 <int>
## 1 FALSE                  1063
## 2 TRUE                    154

Para este trabajo, en principio vamos a enfocarnos en el estudio de la enseñanza de la lengua índigena. Así, vamos a analizar por provincia y sus departamentos, cuánto se estudia esta lengua por sector urbano/rural.

base_provincia_ambito <- base_primaria |>
  group_by(provincia, ambito) |>
  summarise(
    total_lengua_indigena = sum(lengua_indigena, na.rm = TRUE),
    departamentos_con_oferta = sum(tiene_lengua_indigena),
    total_departamentos = n(),
    porcentaje_departamentos = departamentos_con_oferta / total_departamentos * 100,
    .groups = "drop"
  )

ggplot(base_provincia_ambito, aes(x = reorder(provincia, porcentaje_departamentos), 
                                    y = porcentaje_departamentos, 
                                    fill = ambito)) +
  geom_col(position = "dodge") +
  coord_flip() +
  labs(title = "Enseñanza de lengua indígena en primaria por provincia y ámbito",
       subtitle = "% de departamentos con oferta de lengua indígena",
       x = "Provincia", y = "Porcentaje de departamentos", fill = "Ámbito") +
  theme_minimal()

Ahora vamos a hacer lo mismo pero analizando si se enseña más la lengua en el sector privado o estatal.

base_provincia_sector <- base_primaria |>
  group_by(provincia, sector) |>
  summarise(
    total_lengua_indigena = sum(lengua_indigena, na.rm = TRUE),
    departamentos_con_oferta = sum(tiene_lengua_indigena),
    total_departamentos = n(),
    porcentaje_departamentos = departamentos_con_oferta / total_departamentos * 100,
    .groups = "drop"
  )


ggplot(base_provincia_sector, aes(x = reorder(provincia, porcentaje_departamentos), 
                                    y = porcentaje_departamentos, 
                                    fill = sector)) +
  geom_col(position = "dodge") +
  coord_flip() +
  labs(title = "Enseñanza de lengua indígena en primaria por provincia y sector",
       subtitle = "% de departamentos con oferta de lengua indígena",
       x = "Provincia", y = "Porcentaje de departamentos", fill = "Sector") +
  theme_minimal()

Es importante destacar que como hay una diferencia en la cantidad de observaciones entre la Base de Provincia por ámbito y la Base de Provincia por sector. Esto se debe a que hay una de las provincias que sólo es rural o urbano y no ambas.

base_primaria |>
  distinct(provincia, ambito) |>
  count(provincia) |>
  filter(n < 2)
## # A tibble: 1 × 2
##   provincia                  n
##   <chr>                  <int>
## 1 Ciudad de Buenos Aires     1

Viendo los datos analizados, podemos sostener que la enseñanza de la lengua índigena está más presente en las zonas rurales (siendo inexistente en algunas zonas urbanas) y que, principalmente está más concentrada en el sector estatal, de hecho, en la mayoría de las provincias el sector privado no la ofrece).

Lo que vamos a continuar analizando es si la oferta del idioma inglés y la lengua indígena coexisten en algunos departamentos de las distintas provincias y en qué sector predomina cada una.

Para eso, primero vamos a agrupar por provincias y departamentos si existe la oferta de estos idiomas.

base_departamento_sector <- base_primaria |>
  group_by(provincia, departamento, sector) |>
  summarise(
    tiene_ingles = any(tiene_ingles),
    tiene_lengua_indigena = any(tiene_lengua_indigena),
    .groups = "drop"
  )

Ahora, vamos a combinar ambas variables, si se dictan ambas lenguas, sólo una o ninguna.

base_departamento_sector <- base_departamento_sector |>
  mutate(categoria = case_when(
    tiene_ingles & tiene_lengua_indigena ~ "Ambos",
    tiene_ingles & !tiene_lengua_indigena ~ "Solo inglés",
    !tiene_ingles & tiene_lengua_indigena ~ "Solo lengua indígena",
    TRUE ~ "Ninguno"
  ))

Teniendo en cuenta estos datos, vamos a hacer un gráfico donde se observa más claro.

base_departamento_sector |>
  count(sector, categoria) |>
  ggplot(aes(x = categoria, y = n, fill = sector)) +
  geom_col(position = "dodge") +
  labs(title = "Combinación de oferta de inglés y lengua indígena por departamento",
       subtitle = "Cantidad de departamentos según sector de gestión",
       x = "Categoría", y = "Cantidad de departamentos", fill = "Sector") +
  theme_minimal()

Conclusión

Como podemos observar, en un mismo departamento, es común que el sector estatal ofrezca ambos idiomas a la vez (inglés + lengua indígena), mientras que el sector privado, cuando ofrece algo, es casi siempre solo inglés.

Esto nos amplía la observación que vimos anteriormente. La enseñanza de la lengua indígena efectivamente está menos en el sector privado en general, pero además, este sector prácticamente no la enseña ni siquiera cuando tiene la infraestructura para enseñar idiomas (porque sí enseña inglés). Esto podría indicarnos que no es por falta de estructura, sino que podría tratar de una falta de prioridad