Resumen

Este trabajo analiza la situación laboral de las personas en Paraguay durante el año 2023 utilizando datos de la Encuesta Permanente de Hogares (EPH). Se investigan los determinantes de la probabilidad de tener empleo, considerando variables como el área de residencia, el departamento de residencia y los años de estudio. Mediante técnicas estadísticas como la prueba de chi-cuadrado, Mantel-Haenszel y regresión logística, se identifican las asociaciones significativas y se estiman las probabilidades de empleo en función de las variables estudiadas. Los resultados destacan la importancia del área de residencia y la educación en la probabilidad de estar empleado.

INTRODUCCIÓN

El análisis de datos categóricos es fundamental para comprender diversas problemáticas sociales y económicas. En este contexto, el presente trabajo se enfoca en la situación laboral de las personas en Paraguay durante el año 2023. Utilizando la Encuesta Permanente de Hogares (EPH), se exploran las relaciones entre variables como el área de residencia, el departamento de residencia y los años de estudio, con el objetivo de identificar los factores que determinan la probabilidad de tener empleo. Este estudio no solo proporciona una visión detallada de la situación laboral en distintas regiones del país, sino que también resalta la utilidad de los datos abiertos y herramientas gratuitas como R para el análisis estadístico.

Objetivos

Objetivo General

Analizar la situación laboral de las personas en Paraguay en el año 2023, desglosada por área de residencia, departamento de residencia y años de estudio.

Objetivos Específicos

Describir la situación laboral por área y departamento. Verificar la asociación entre la situación laboral y el área de residencia. Verificar la asociación entre la situación laboral, el área de residencia y el departamento. Estimar las probabilidades de tener trabajo en función del área de residencia, departamento y años de estudio. # Metodología

Se utilizaron los datos correspondientes a la Encuesta Permanente de Hogares (EPH) del año 2023. Las variables analizadas fueron:

DPTO: Departamento de residencia. AREA: Área de residencia (Urbana/Rural). A02: Situación laboral en los últimos 7 días (Sí/No). AnioEstudio: Años de estudio. Para responder a los objetivos planteados, se emplearon las pruebas de chi-cuadrado, Mantel-Haenszel y regresión logística.

Resultados

Carga de Librerías

#install.packages(readr)

#Librerías a utilizar
library(readr)
library(dplyr)
library(ggplot2)
library(vcd)
library(vcdExtra)
library(ggmosaic)
library(MASS)
library(car) # Para verificar multicolinealidad library(pscl) # Para pseudo R-cuadrado library(epitools) # Para odds ratios

Importación de los Datos de la Encuesta Permanente de Hogares Continua 2023 y Selección de Variables para el Análisis

Lectura de los Datos

#Lectura de los datos
dataEPHC2023 <- read.csv2("REG02_ANUAL_2023.csv", stringsAsFactors = FALSE)

Exploración Inicial de los Datos

#Número de filas y columnas
dim(dataEPHC2023)
## [1] 58005   213
#Nombre de las variables
names(dataEPHC2023)
##   [1] "UPM"          "NVIVI"        "NHOGA"        "TRIMESTRE"    "AÑO"         
##   [6] "DPTO"         "AREA"         "L02"          "P02"          "P03"         
##  [11] "P04"          "P04A"         "P04B"         "P05C"         "P05P"        
##  [16] "P05M"         "P06"          "P08D"         "P08M"         "P08A"        
##  [21] "P09"          "A01"          "A01A"         "A02"          "A03"         
##  [26] "A04"          "A04A"         "A04B"         "A05"          "A07"         
##  [31] "A08"          "A10"          "A11A"         "A11M"         "A11S"        
##  [36] "A12"          "A13REC"       "A14REC"       "A15"          "A16"         
##  [41] "A17A"         "A17M"         "A17S"         "A18"          "B01REC"      
##  [46] "B02REC"       "B03LU"        "B03MA"        "B03MI"        "B03JU"       
##  [51] "B03VI"        "B03SA"        "B03DO"        "B04"          "B05"         
##  [56] "B06"          "B07A"         "B07M"         "B07S"         "B08"         
##  [61] "B09A"         "B09M"         "B09S"         "B10"          "B11"         
##  [66] "B12"          "B12A"         "B12B"         "B12C"         "B13"         
##  [71] "B14"          "B15"          "B16G"         "B16U"         "B16D"        
##  [76] "B16T"         "B17"          "B18AG"        "B18AU"        "B18BG"       
##  [81] "B18BU"        "B19"          "B20G"         "B20U"         "B20D"        
##  [86] "B20T"         "B21"          "B22"          "B23"          "B24"         
##  [91] "B25"          "B26"          "B271"         "B272"         "B28"         
##  [96] "B29"          "B30"          "B31"          "C01REC"       "C02REC"      
## [101] "C03"          "C04"          "C05"          "C06"          "C07"         
## [106] "C08"          "C09"          "C101"         "C102"         "C11G"        
## [111] "C11U"         "C11D"         "C11T"         "C12"          "C13AG"       
## [116] "C13AU"        "C13BG"        "C13BU"        "C14"          "C14A"        
## [121] "C14B"         "C14C"         "C15"          "C16REC"       "C17REC"      
## [126] "C18"          "C18A"         "C18B"         "C19"          "D01"         
## [131] "D02"          "D03"          "D04"          "D05"          "E01A"        
## [136] "E01B"         "E01C"         "E01D"         "E01E"         "E01F"        
## [141] "E01G"         "E01H"         "E01I"         "E01J"         "E01K"        
## [146] "E01L"         "E01M"         "ED01"         "ED02"         "ED03"        
## [151] "ED0504"       "ED06C"        "ED08"         "ED09"         "ED10"        
## [156] "ED11F1"       "ED11F1A"      "ED11GH1"      "ED11GH1A"     "S01A"        
## [161] "S01B"         "S02"          "S03"          "S03A"         "S03B"        
## [166] "S03C"         "S04"          "S05"          "S06"          "S07"         
## [171] "S08"          "S09"          "CATE_PEA"     "TAMA_PEA"     "OCUP_PEA"    
## [176] "RAMA_PEA"     "HORAB"        "HORABC"       "HORABCO"      "PEAD"        
## [181] "PEAA"         "TIPOHOGA"     "FEX.2022"     "NJEF"         "NCON"        
## [186] "NPAD"         "NMAD"         "añoest"       "ra06ya09"     "e01aimde"    
## [191] "e01bimde"     "e01cimde"     "e01dde"       "e01ede"       "e01fde"      
## [196] "e01gde"       "e01hde"       "e01ide"       "e01jde"       "e01kde"      
## [201] "e01lde"       "e01mde"       "e01kjde"      "e02bde"       "ingrevasode" 
## [206] "ipcm"         "pobrezai"     "pobnopoi"     "quintili"     "decili"      
## [211] "quintiai"     "decilai"      "informalidad"

Selección y Etiquetado de Variables

#Selección de variables
ephc2023final <- dataEPHC2023 %>% dplyr::select(DPTO, AREA, A02, añoest)


#Verificar niveles únicos de DPTO
unique_DPTOS <- sort(unique(ephc2023final$DPTO))
print(unique_DPTOS)
##  [1]  0  1  2  3  4  5  6  7  8  9 10 11 12 13 14 15
#Crear una lista completa de etiquetas para DPTO
table(ephc2023final$A02)
## 
##     1     6 
## 28238 20040
# Definir etiquetas correctas para DPTO (16 etiquetas)
dpto_labels <- c(
  "Asunción", "Concepción", "San Pedro", "Cordillera", "Guairá", 
  "Caaguazú", "Caazapá", "Itapúa", "Misiones", "Paraguarí", 
  "Alto Paraná", "Central", "Ñeembucú", "Amambay", 
  "Canindeyú", "Pdte Hayes" # Eliminado "Boquerón" para coincidir con 16 niveles
)

# Etiquetar las variables categóricas y remover 'añoest'
ephc2023final <- ephc2023final %>%
  mutate(
    DPTO = factor(DPTO, levels = unique_DPTOS, labels = dpto_labels),
    AREA = factor(AREA, levels = c("1", "6"), labels = c("Urbana", "Rural")),
    A02 = factor(A02, levels = c("1", "6"), labels = c("Sí", "No")),
    AnioEstudio = if_else(is.na(añoest) | añoest == 99, NA_integer_, as.integer(añoest))
  ) %>%
  dplyr::select(-añoest) # Usar dplyr::select para evitar conflictos

Resumen Breve de las Variables Seleccionadas

#Resumen de las variables seleccionadas
summary(ephc2023final)
##           DPTO           AREA         A02         AnioEstudio    
##  Central    :10036   Urbana:32940   Sí  :28238   Min.   : 0.000  
##  Alto Paraná: 6770   Rural :25065   No  :20040   1st Qu.: 4.000  
##  Itapúa     : 4708                  NA's: 9727   Median : 7.000  
##  Asunción   : 4157                               Mean   : 8.092  
##  San Pedro  : 3782                               3rd Qu.:12.000  
##  Caaguazú   : 3300                               Max.   :18.000  
##  (Other)    :25252                               NA's   :3815

Prueba de Independencia Chi-Cuadrado

Formulación de las Hipótesis

Hipótesis Nula (H0): El hecho de trabajar durante los últimos 7 días antes de la aplicación de la encuesta es independiente del área de residencia. Hipótesis Alternativa (H1): El hecho de trabajar durante los últimos 7 días antes de la aplicación de la encuesta no es independiente del área de residencia.

Visualización de la Distribución

#Filtrar los datos para excluir NA en AREA y A02
ephc2023final_filtrada <- ephc2023final %>% filter(!is.na(AREA) & !is.na(A02))

#Crear el gráfico de barras proporcional
ggplot(ephc2023final_filtrada, aes(x = AREA, fill = A02)) + geom_bar(position = "fill") + labs( title = "Distribución de Situación Laboral según Área de Residencia", x = "Área de Residencia", y = "Proporción", fill = "¿Trabajó en los últimos 7 días?" ) + scale_y_continuous(labels = scales::percent_format()) + theme_minimal()

Análisis de la Prueba Chi-Cuadrado

#Tabla de contingencia
tabla2x2 <- xtabs(~ AREA + A02, data = ephc2023final)
print(tabla2x2)
##         A02
## AREA        Sí    No
##   Urbana 16062 11696
##   Rural  12176  8344
#Prueba Chi-Cuadrado
resultado_chi <- chisq.test(tabla2x2)

#Resultados de la prueba
print(resultado_chi)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla2x2
## X-squared = 10.481, df = 1, p-value = 0.001206
#Verificar frecuencias esperadas
print(resultado_chi$expected)
##         A02
## AREA           Sí        No
##   Urbana 16235.77 11522.232
##   Rural  12002.23  8517.768
#Comprobar si todas las frecuencias esperadas son mayores a 5
all(resultado_chi$expected > 5)
## [1] TRUE

Interpretación: La prueba chi-cuadrado arroja un valor p de aproximadamente 0.0012, que es menor al nivel de significancia α = 0.05. Por lo tanto, rechazamos la hipótesis nula y concluimos que existe una asociación significativa entre la situación laboral y el área de residencia.

Cálculo del Odds Ratio

# Calcular Odds Ratio
OR <- (tabla2x2["Rural","Sí"] * tabla2x2["Urbana","No"]) / (tabla2x2["Rural","No"] * tabla2x2["Urbana","Sí"])
print(OR)
## [1] 1.062596

El valor calculado es 1.0625, lo que indica que las personas que viven en áreas rurales tienen un 6.25% más de probabilidades de estar empleadas en comparación con aquellas que residen en áreas urbanas, manteniendo constantes las demás variables del modelo.

Prueba de Cochran-Mantel-Haenszel para Tablas de Tres Entradas

Formulación de las Hipótesis

Hipótesis Nula (H0): No existe asociación entre la situación laboral y el área de residencia de la persona en los diferentes departamentos del país. Hipótesis Alternativa (H1): Existe asociación entre la situación laboral y el área de residencia de la persona en los diferentes departamentos del país. ### Visualización de la Relación por Departamento

# Gráfico de mosaico estratificado por departamento

ggplot(data = ephc2023final_filtrada) + geom_mosaic(aes(weight = 1, x = product(AREA, A02), fill = A02)) + facet_wrap(~ DPTO) + labs( title = "Relación entre Área de Residencia y Situación Laboral por Departamento", x = "Área de Residencia", y = "Frecuencia" ) + theme_minimal() + theme(legend.position = "none")

Análisis de la Prueba de Mantel-Haenszel

# Tablas de contingencia estratificadas por DPTO
tabla_2x2_dpto <- xtabs(~ AREA + A02 + DPTO, data = ephc2023final)

# Imprimir la tabla de contingencia para revisión
print(ftable(tabla_2x2_dpto, row.vars = c("AREA", "A02"), col.vars = "DPTO"))
##            DPTO Asunción Concepción San Pedro Cordillera Guairá Caaguazú Caazapá Itapúa Misiones Paraguarí Alto Paraná Central Ñeembucú Amambay Canindeyú Pdte Hayes
## AREA   A02                                                                                                                                                          
## Urbana Sí           2035        407       424        597    507      659     291   1041      773       397        2304    4226      550     806       634        411
##        No           1589        365       334        540    361      493     223    668      558       382        1602    2951      385     538       393        314
## Rural  Sí              0        611      1370        819    738      908    1248   1441      587       665         934     742      386     376       769        582
##        No              0        455       967        681    460      675     729    766      430       573         661     536      221     272       469        449
# Identificar departamentos con todas las combinaciones de AREA y A02
# Es decir, que cada DPTO tenga al menos una observación en cada celda 2x2
completo <- apply(tabla_2x2_dpto, 3, function(x) all(x > 0))

# Mostrar cuáles departamentos están completos y cuáles no
print(completo)
##    Asunción  Concepción   San Pedro  Cordillera      Guairá    Caaguazú 
##       FALSE        TRUE        TRUE        TRUE        TRUE        TRUE 
##     Caazapá      Itapúa    Misiones   Paraguarí Alto Paraná     Central 
##        TRUE        TRUE        TRUE        TRUE        TRUE        TRUE 
##    Ñeembucú     Amambay   Canindeyú  Pdte Hayes 
##        TRUE        TRUE        TRUE        TRUE
# Opcional: Listar departamentos incompletos
departamentos_incompletos <- names(completo)[!completo]
if(length(departamentos_incompletos) > 0){
  warning("Los siguientes departamentos no tienen todas las combinaciones y serán excluidos del análisis: ",
          paste(departamentos_incompletos, collapse = ", "))
}

# Filtrar solo los departamentos completos
tabla_2x2_dpto_completa <- tabla_2x2_dpto[, , completo]

# Verificar que la tabla filtrada tiene al menos un estrato
if(dim(tabla_2x2_dpto_completa)[3] < 1){
  stop("No hay departamentos con todas las combinaciones de AREA y A02. No se puede realizar la prueba de Mantel-Haenszel.")
}

# Imprimir la tabla filtrada
print(ftable(tabla_2x2_dpto_completa, row.vars = c("AREA", "A02"), col.vars = "DPTO"))
##            DPTO Concepción San Pedro Cordillera Guairá Caaguazú Caazapá Itapúa Misiones Paraguarí Alto Paraná Central Ñeembucú Amambay Canindeyú Pdte Hayes
## AREA   A02                                                                                                                                                 
## Urbana Sí              407       424        597    507      659     291   1041      773       397        2304    4226      550     806       634        411
##        No              365       334        540    361      493     223    668      558       382        1602    2951      385     538       393        314
## Rural  Sí              611      1370        819    738      908    1248   1441      587       665         934     742      386     376       769        582
##        No              455       967        681    460      675     729    766      430       573         661     536      221     272       469        449
# Prueba de Mantel-Haenszel
resultado_mantel <- mantelhaen.test(tabla_2x2_dpto_completa)
print(resultado_mantel)
## 
##  Mantel-Haenszel chi-squared test with continuity correction
## 
## data:  tabla_2x2_dpto_completa
## Mantel-Haenszel X-squared = 9.0343, df = 1, p-value = 0.00265
## alternative hypothesis: true common odds ratio is not equal to 1
## 95 percent confidence interval:
##  NA NA
## sample estimates:
## common odds ratio 
##         0.9384065

Interpretación: La Prueba de Mantel-Haenszel ha revelado una asociación significativa entre el área de residencia y la situación laboral en Paraguay durante el año 2023, controlando por el departamento de residencia. Aunque el OR común sugiere una ligera disminución en las probabilidades de empleo para residentes rurales en comparación con urbanos, la magnitud de este efecto es pequeña. Es importante considerar que, debido a la falta de un intervalo de confianza, se debe interpretar el OR con cautela y explorar más a fondo posibles factores que puedan influir en esta relación.

Descripción Metodológica del Modelo Logístico

Formulación de las Hipótesis

Hipótesis Nula (H0): Las variables independientes (Área de Residencia, Departamento de Residencia y Años de Estudio) no tienen efecto significativo sobre la situación laboral de las personas. Hipótesis Alternativa (H1): Al menos una de las variables independientes tiene un efecto significativo sobre la situación laboral de las personas.

Ajuste del Modelo de Regresión Logística

#Convertir A02 a variable binaria (Sí = 1, No = 0)
ephc2023final <- ephc2023final %>% mutate(A02_01 = ifelse(A02 == "Sí", 1, 0))

#Ajuste del modelo logístico
modelo_logit <- glm(A02_01 ~ AREA + DPTO + AnioEstudio, family = binomial(link = "logit"), data = ephc2023final)

#Resumen del modelo
summary(modelo_logit)
## 
## Call:
## glm(formula = A02_01 ~ AREA + DPTO + AnioEstudio, family = binomial(link = "logit"), 
##     data = ephc2023final)
## 
## Coefficients:
##                  Estimate Std. Error z value Pr(>|z|)    
## (Intercept)     -1.200878   0.043613 -27.535  < 2e-16 ***
## AREARural        0.360778   0.022597  15.965  < 2e-16 ***
## DPTOConcepción   0.181408   0.061174   2.965  0.00302 ** 
## DPTOSan Pedro    0.234895   0.053968   4.352 1.35e-05 ***
## DPTOCordillera   0.009812   0.054744   0.179  0.85775    
## DPTOGuairá       0.379934   0.059682   6.366 1.94e-10 ***
## DPTOCaaguazú     0.259749   0.054662   4.752 2.01e-06 ***
## DPTOCaazapá      0.453797   0.057884   7.840 4.51e-15 ***
## DPTOItapúa       0.569699   0.050659  11.246  < 2e-16 ***
## DPTOMisiones     0.270030   0.056635   4.768 1.86e-06 ***
## DPTOParaguarí    0.018703   0.059429   0.315  0.75298    
## DPTOAlto Paraná  0.338159   0.045503   7.432 1.07e-13 ***
## DPTOCentral      0.210338   0.041721   5.042 4.62e-07 ***
## DPTOÑeembucú     0.453149   0.065080   6.963 3.33e-12 ***
## DPTOAmambay      0.399500   0.059322   6.734 1.65e-11 ***
## DPTOCanindeyú    0.500227   0.058088   8.611  < 2e-16 ***
## DPTOPdte Hayes   0.172142   0.062129   2.771  0.00559 ** 
## AnioEstudio      0.127283   0.002335  54.501  < 2e-16 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 65496  on 48253  degrees of freedom
## Residual deviance: 62122  on 48236  degrees of freedom
##   (9751 observations deleted due to missingness)
## AIC: 62158
## 
## Number of Fisher Scoring iterations: 4

Evaluación del Modelo

#Verificar multicolinealidad
vif_values <- vif(modelo_logit)
print(vif_values)
##                 GVIF Df GVIF^(1/(2*Df))
## AREA        1.363201  1        1.167562
## DPTO        1.316146 15        1.009199
## AnioEstudio 1.146580  1        1.070785

Interpretación de los Resultados del Modelo

Interpretación: Área de Residencia (Rural): El odds ratio es 1.43, lo que indica que las personas que viven en áreas rurales tienen un 43% más de probabilidades de estar empleadas en comparación con las que viven en áreas urbanas, manteniendo constantes las demás variables. Este efecto es altamente significativo (p < 2e-16).

Departamento de Residencia: Concepción: OR = 1.20, p = 0.00302. Las personas en Concepción tienen un 20% más de probabilidades de estar empleadas en comparación con Asunción. Itapúa: OR = 1.77, p < 2e-16. Las personas en Itapúa tienen un 77% más de probabilidades de estar empleadas en comparación con Asunción. Cordillera: OR = 1.01, p = 0.85775. No hay un efecto significativo. Otros departamentos como Caazapá, Ñeembucú y Canindeyú también muestran efectos positivos significativos. Años de Estudio: OR = 1.14, p < 2e-16. Por cada año adicional de estudio, las probabilidades de estar empleado aumentan en un 14%.

Verificación de Multicolinealidad

Los valores de VIF son menores a 5, lo que indica que no hay problemas de multicolinealidad entre las variables independientes.

Evaluación del Ajuste del Modelo

El pseudo R-cuadrado de McFadden es 0.10, lo que sugiere un ajuste moderado del modelo. Aunque no es muy alto, es aceptable en modelos de regresión logística.

Conclusión

En este estudio se analizó la situación laboral de las personas en Paraguay en el año 2023 utilizando datos de la Encuesta Permanente de Hogares (EPH). Los principales hallazgos son:

Estos resultados destacan la importancia de considerar factores geográficos y educativos al diseñar políticas laborales y educativas. Además, subrayan el valor de utilizar datos abiertos y herramientas gratuitas como R para realizar análisis estadísticos robustos y aplicados a problemáticas reales.

Referencias

Instituto Nacional de Estadísticas del Paraguay. (2023). Encuesta Permanente de Hogares Continua. Venables, W. N., & Ripley, B. D. (2002). Modern Applied Statistics with S. Springer.