Este trabajo analiza la situación laboral de las personas en Paraguay durante el año 2023 utilizando datos de la Encuesta Permanente de Hogares (EPH). Se investigan los determinantes de la probabilidad de tener empleo, considerando variables como el área de residencia, el departamento de residencia y los años de estudio. Mediante técnicas estadísticas como la prueba de chi-cuadrado, Mantel-Haenszel y regresión logística, se identifican las asociaciones significativas y se estiman las probabilidades de empleo en función de las variables estudiadas. Los resultados destacan la importancia del área de residencia y la educación en la probabilidad de estar empleado.
El análisis de datos categóricos es fundamental para comprender diversas problemáticas sociales y económicas. En este contexto, el presente trabajo se enfoca en la situación laboral de las personas en Paraguay durante el año 2023. Utilizando la Encuesta Permanente de Hogares (EPH), se exploran las relaciones entre variables como el área de residencia, el departamento de residencia y los años de estudio, con el objetivo de identificar los factores que determinan la probabilidad de tener empleo. Este estudio no solo proporciona una visión detallada de la situación laboral en distintas regiones del país, sino que también resalta la utilidad de los datos abiertos y herramientas gratuitas como R para el análisis estadístico.
Analizar la situación laboral de las personas en Paraguay en el año 2023, desglosada por área de residencia, departamento de residencia y años de estudio.
Describir la situación laboral por área y departamento. Verificar la asociación entre la situación laboral y el área de residencia. Verificar la asociación entre la situación laboral, el área de residencia y el departamento. Estimar las probabilidades de tener trabajo en función del área de residencia, departamento y años de estudio. # Metodología
Se utilizaron los datos correspondientes a la Encuesta Permanente de Hogares (EPH) del año 2023. Las variables analizadas fueron:
DPTO: Departamento de residencia. AREA: Área de residencia (Urbana/Rural). A02: Situación laboral en los últimos 7 días (Sí/No). AnioEstudio: Años de estudio. Para responder a los objetivos planteados, se emplearon las pruebas de chi-cuadrado, Mantel-Haenszel y regresión logística.
#install.packages(readr)
#Librerías a utilizar
library(readr)
library(dplyr)
library(ggplot2)
library(vcd)
library(vcdExtra)
library(ggmosaic)
library(MASS)
library(car) # Para verificar multicolinealidad library(pscl) # Para pseudo R-cuadrado library(epitools) # Para odds ratios
#Lectura de los datos
dataEPHC2023 <- read.csv2("REG02_ANUAL_2023.csv", stringsAsFactors = FALSE)
#Número de filas y columnas
dim(dataEPHC2023)
## [1] 58005 213
#Nombre de las variables
names(dataEPHC2023)
## [1] "UPM" "NVIVI" "NHOGA" "TRIMESTRE" "AÑO"
## [6] "DPTO" "AREA" "L02" "P02" "P03"
## [11] "P04" "P04A" "P04B" "P05C" "P05P"
## [16] "P05M" "P06" "P08D" "P08M" "P08A"
## [21] "P09" "A01" "A01A" "A02" "A03"
## [26] "A04" "A04A" "A04B" "A05" "A07"
## [31] "A08" "A10" "A11A" "A11M" "A11S"
## [36] "A12" "A13REC" "A14REC" "A15" "A16"
## [41] "A17A" "A17M" "A17S" "A18" "B01REC"
## [46] "B02REC" "B03LU" "B03MA" "B03MI" "B03JU"
## [51] "B03VI" "B03SA" "B03DO" "B04" "B05"
## [56] "B06" "B07A" "B07M" "B07S" "B08"
## [61] "B09A" "B09M" "B09S" "B10" "B11"
## [66] "B12" "B12A" "B12B" "B12C" "B13"
## [71] "B14" "B15" "B16G" "B16U" "B16D"
## [76] "B16T" "B17" "B18AG" "B18AU" "B18BG"
## [81] "B18BU" "B19" "B20G" "B20U" "B20D"
## [86] "B20T" "B21" "B22" "B23" "B24"
## [91] "B25" "B26" "B271" "B272" "B28"
## [96] "B29" "B30" "B31" "C01REC" "C02REC"
## [101] "C03" "C04" "C05" "C06" "C07"
## [106] "C08" "C09" "C101" "C102" "C11G"
## [111] "C11U" "C11D" "C11T" "C12" "C13AG"
## [116] "C13AU" "C13BG" "C13BU" "C14" "C14A"
## [121] "C14B" "C14C" "C15" "C16REC" "C17REC"
## [126] "C18" "C18A" "C18B" "C19" "D01"
## [131] "D02" "D03" "D04" "D05" "E01A"
## [136] "E01B" "E01C" "E01D" "E01E" "E01F"
## [141] "E01G" "E01H" "E01I" "E01J" "E01K"
## [146] "E01L" "E01M" "ED01" "ED02" "ED03"
## [151] "ED0504" "ED06C" "ED08" "ED09" "ED10"
## [156] "ED11F1" "ED11F1A" "ED11GH1" "ED11GH1A" "S01A"
## [161] "S01B" "S02" "S03" "S03A" "S03B"
## [166] "S03C" "S04" "S05" "S06" "S07"
## [171] "S08" "S09" "CATE_PEA" "TAMA_PEA" "OCUP_PEA"
## [176] "RAMA_PEA" "HORAB" "HORABC" "HORABCO" "PEAD"
## [181] "PEAA" "TIPOHOGA" "FEX.2022" "NJEF" "NCON"
## [186] "NPAD" "NMAD" "añoest" "ra06ya09" "e01aimde"
## [191] "e01bimde" "e01cimde" "e01dde" "e01ede" "e01fde"
## [196] "e01gde" "e01hde" "e01ide" "e01jde" "e01kde"
## [201] "e01lde" "e01mde" "e01kjde" "e02bde" "ingrevasode"
## [206] "ipcm" "pobrezai" "pobnopoi" "quintili" "decili"
## [211] "quintiai" "decilai" "informalidad"
#Selección de variables
ephc2023final <- dataEPHC2023 %>% dplyr::select(DPTO, AREA, A02, añoest)
#Verificar niveles únicos de DPTO
unique_DPTOS <- sort(unique(ephc2023final$DPTO))
print(unique_DPTOS)
## [1] 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
#Crear una lista completa de etiquetas para DPTO
table(ephc2023final$A02)
##
## 1 6
## 28238 20040
# Definir etiquetas correctas para DPTO (16 etiquetas)
dpto_labels <- c(
"Asunción", "Concepción", "San Pedro", "Cordillera", "Guairá",
"Caaguazú", "Caazapá", "Itapúa", "Misiones", "Paraguarí",
"Alto Paraná", "Central", "Ñeembucú", "Amambay",
"Canindeyú", "Pdte Hayes" # Eliminado "Boquerón" para coincidir con 16 niveles
)
# Etiquetar las variables categóricas y remover 'añoest'
ephc2023final <- ephc2023final %>%
mutate(
DPTO = factor(DPTO, levels = unique_DPTOS, labels = dpto_labels),
AREA = factor(AREA, levels = c("1", "6"), labels = c("Urbana", "Rural")),
A02 = factor(A02, levels = c("1", "6"), labels = c("Sí", "No")),
AnioEstudio = if_else(is.na(añoest) | añoest == 99, NA_integer_, as.integer(añoest))
) %>%
dplyr::select(-añoest) # Usar dplyr::select para evitar conflictos
#Resumen de las variables seleccionadas
summary(ephc2023final)
## DPTO AREA A02 AnioEstudio
## Central :10036 Urbana:32940 Sí :28238 Min. : 0.000
## Alto Paraná: 6770 Rural :25065 No :20040 1st Qu.: 4.000
## Itapúa : 4708 NA's: 9727 Median : 7.000
## Asunción : 4157 Mean : 8.092
## San Pedro : 3782 3rd Qu.:12.000
## Caaguazú : 3300 Max. :18.000
## (Other) :25252 NA's :3815
Hipótesis Nula (H0): El hecho de trabajar durante los últimos 7 días antes de la aplicación de la encuesta es independiente del área de residencia. Hipótesis Alternativa (H1): El hecho de trabajar durante los últimos 7 días antes de la aplicación de la encuesta no es independiente del área de residencia.
#Filtrar los datos para excluir NA en AREA y A02
ephc2023final_filtrada <- ephc2023final %>% filter(!is.na(AREA) & !is.na(A02))
#Crear el gráfico de barras proporcional
ggplot(ephc2023final_filtrada, aes(x = AREA, fill = A02)) + geom_bar(position = "fill") + labs( title = "Distribución de Situación Laboral según Área de Residencia", x = "Área de Residencia", y = "Proporción", fill = "¿Trabajó en los últimos 7 días?" ) + scale_y_continuous(labels = scales::percent_format()) + theme_minimal()
#Tabla de contingencia
tabla2x2 <- xtabs(~ AREA + A02, data = ephc2023final)
print(tabla2x2)
## A02
## AREA Sí No
## Urbana 16062 11696
## Rural 12176 8344
#Prueba Chi-Cuadrado
resultado_chi <- chisq.test(tabla2x2)
#Resultados de la prueba
print(resultado_chi)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: tabla2x2
## X-squared = 10.481, df = 1, p-value = 0.001206
#Verificar frecuencias esperadas
print(resultado_chi$expected)
## A02
## AREA Sí No
## Urbana 16235.77 11522.232
## Rural 12002.23 8517.768
#Comprobar si todas las frecuencias esperadas son mayores a 5
all(resultado_chi$expected > 5)
## [1] TRUE
Interpretación: La prueba chi-cuadrado arroja un valor p de aproximadamente 0.0012, que es menor al nivel de significancia α = 0.05. Por lo tanto, rechazamos la hipótesis nula y concluimos que existe una asociación significativa entre la situación laboral y el área de residencia.
# Calcular Odds Ratio
OR <- (tabla2x2["Rural","Sí"] * tabla2x2["Urbana","No"]) / (tabla2x2["Rural","No"] * tabla2x2["Urbana","Sí"])
print(OR)
## [1] 1.062596
El valor calculado es 1.0625, lo que indica que las personas que viven en áreas rurales tienen un 6.25% más de probabilidades de estar empleadas en comparación con aquellas que residen en áreas urbanas, manteniendo constantes las demás variables del modelo.
Hipótesis Nula (H0): No existe asociación entre la situación laboral y el área de residencia de la persona en los diferentes departamentos del país. Hipótesis Alternativa (H1): Existe asociación entre la situación laboral y el área de residencia de la persona en los diferentes departamentos del país. ### Visualización de la Relación por Departamento
# Gráfico de mosaico estratificado por departamento
ggplot(data = ephc2023final_filtrada) + geom_mosaic(aes(weight = 1, x = product(AREA, A02), fill = A02)) + facet_wrap(~ DPTO) + labs( title = "Relación entre Área de Residencia y Situación Laboral por Departamento", x = "Área de Residencia", y = "Frecuencia" ) + theme_minimal() + theme(legend.position = "none")
# Tablas de contingencia estratificadas por DPTO
tabla_2x2_dpto <- xtabs(~ AREA + A02 + DPTO, data = ephc2023final)
# Imprimir la tabla de contingencia para revisión
print(ftable(tabla_2x2_dpto, row.vars = c("AREA", "A02"), col.vars = "DPTO"))
## DPTO Asunción Concepción San Pedro Cordillera Guairá Caaguazú Caazapá Itapúa Misiones Paraguarí Alto Paraná Central Ñeembucú Amambay Canindeyú Pdte Hayes
## AREA A02
## Urbana Sí 2035 407 424 597 507 659 291 1041 773 397 2304 4226 550 806 634 411
## No 1589 365 334 540 361 493 223 668 558 382 1602 2951 385 538 393 314
## Rural Sí 0 611 1370 819 738 908 1248 1441 587 665 934 742 386 376 769 582
## No 0 455 967 681 460 675 729 766 430 573 661 536 221 272 469 449
# Identificar departamentos con todas las combinaciones de AREA y A02
# Es decir, que cada DPTO tenga al menos una observación en cada celda 2x2
completo <- apply(tabla_2x2_dpto, 3, function(x) all(x > 0))
# Mostrar cuáles departamentos están completos y cuáles no
print(completo)
## Asunción Concepción San Pedro Cordillera Guairá Caaguazú
## FALSE TRUE TRUE TRUE TRUE TRUE
## Caazapá Itapúa Misiones Paraguarí Alto Paraná Central
## TRUE TRUE TRUE TRUE TRUE TRUE
## Ñeembucú Amambay Canindeyú Pdte Hayes
## TRUE TRUE TRUE TRUE
# Opcional: Listar departamentos incompletos
departamentos_incompletos <- names(completo)[!completo]
if(length(departamentos_incompletos) > 0){
warning("Los siguientes departamentos no tienen todas las combinaciones y serán excluidos del análisis: ",
paste(departamentos_incompletos, collapse = ", "))
}
# Filtrar solo los departamentos completos
tabla_2x2_dpto_completa <- tabla_2x2_dpto[, , completo]
# Verificar que la tabla filtrada tiene al menos un estrato
if(dim(tabla_2x2_dpto_completa)[3] < 1){
stop("No hay departamentos con todas las combinaciones de AREA y A02. No se puede realizar la prueba de Mantel-Haenszel.")
}
# Imprimir la tabla filtrada
print(ftable(tabla_2x2_dpto_completa, row.vars = c("AREA", "A02"), col.vars = "DPTO"))
## DPTO Concepción San Pedro Cordillera Guairá Caaguazú Caazapá Itapúa Misiones Paraguarí Alto Paraná Central Ñeembucú Amambay Canindeyú Pdte Hayes
## AREA A02
## Urbana Sí 407 424 597 507 659 291 1041 773 397 2304 4226 550 806 634 411
## No 365 334 540 361 493 223 668 558 382 1602 2951 385 538 393 314
## Rural Sí 611 1370 819 738 908 1248 1441 587 665 934 742 386 376 769 582
## No 455 967 681 460 675 729 766 430 573 661 536 221 272 469 449
# Prueba de Mantel-Haenszel
resultado_mantel <- mantelhaen.test(tabla_2x2_dpto_completa)
print(resultado_mantel)
##
## Mantel-Haenszel chi-squared test with continuity correction
##
## data: tabla_2x2_dpto_completa
## Mantel-Haenszel X-squared = 9.0343, df = 1, p-value = 0.00265
## alternative hypothesis: true common odds ratio is not equal to 1
## 95 percent confidence interval:
## NA NA
## sample estimates:
## common odds ratio
## 0.9384065
Interpretación: La Prueba de Mantel-Haenszel ha revelado una asociación significativa entre el área de residencia y la situación laboral en Paraguay durante el año 2023, controlando por el departamento de residencia. Aunque el OR común sugiere una ligera disminución en las probabilidades de empleo para residentes rurales en comparación con urbanos, la magnitud de este efecto es pequeña. Es importante considerar que, debido a la falta de un intervalo de confianza, se debe interpretar el OR con cautela y explorar más a fondo posibles factores que puedan influir en esta relación.
Hipótesis Nula (H0): Las variables independientes (Área de Residencia, Departamento de Residencia y Años de Estudio) no tienen efecto significativo sobre la situación laboral de las personas. Hipótesis Alternativa (H1): Al menos una de las variables independientes tiene un efecto significativo sobre la situación laboral de las personas.
#Convertir A02 a variable binaria (Sí = 1, No = 0)
ephc2023final <- ephc2023final %>% mutate(A02_01 = ifelse(A02 == "Sí", 1, 0))
#Ajuste del modelo logístico
modelo_logit <- glm(A02_01 ~ AREA + DPTO + AnioEstudio, family = binomial(link = "logit"), data = ephc2023final)
#Resumen del modelo
summary(modelo_logit)
##
## Call:
## glm(formula = A02_01 ~ AREA + DPTO + AnioEstudio, family = binomial(link = "logit"),
## data = ephc2023final)
##
## Coefficients:
## Estimate Std. Error z value Pr(>|z|)
## (Intercept) -1.200878 0.043613 -27.535 < 2e-16 ***
## AREARural 0.360778 0.022597 15.965 < 2e-16 ***
## DPTOConcepción 0.181408 0.061174 2.965 0.00302 **
## DPTOSan Pedro 0.234895 0.053968 4.352 1.35e-05 ***
## DPTOCordillera 0.009812 0.054744 0.179 0.85775
## DPTOGuairá 0.379934 0.059682 6.366 1.94e-10 ***
## DPTOCaaguazú 0.259749 0.054662 4.752 2.01e-06 ***
## DPTOCaazapá 0.453797 0.057884 7.840 4.51e-15 ***
## DPTOItapúa 0.569699 0.050659 11.246 < 2e-16 ***
## DPTOMisiones 0.270030 0.056635 4.768 1.86e-06 ***
## DPTOParaguarí 0.018703 0.059429 0.315 0.75298
## DPTOAlto Paraná 0.338159 0.045503 7.432 1.07e-13 ***
## DPTOCentral 0.210338 0.041721 5.042 4.62e-07 ***
## DPTOÑeembucú 0.453149 0.065080 6.963 3.33e-12 ***
## DPTOAmambay 0.399500 0.059322 6.734 1.65e-11 ***
## DPTOCanindeyú 0.500227 0.058088 8.611 < 2e-16 ***
## DPTOPdte Hayes 0.172142 0.062129 2.771 0.00559 **
## AnioEstudio 0.127283 0.002335 54.501 < 2e-16 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## (Dispersion parameter for binomial family taken to be 1)
##
## Null deviance: 65496 on 48253 degrees of freedom
## Residual deviance: 62122 on 48236 degrees of freedom
## (9751 observations deleted due to missingness)
## AIC: 62158
##
## Number of Fisher Scoring iterations: 4
#Verificar multicolinealidad
vif_values <- vif(modelo_logit)
print(vif_values)
## GVIF Df GVIF^(1/(2*Df))
## AREA 1.363201 1 1.167562
## DPTO 1.316146 15 1.009199
## AnioEstudio 1.146580 1 1.070785
Interpretación: Área de Residencia (Rural): El odds ratio es 1.43, lo que indica que las personas que viven en áreas rurales tienen un 43% más de probabilidades de estar empleadas en comparación con las que viven en áreas urbanas, manteniendo constantes las demás variables. Este efecto es altamente significativo (p < 2e-16).
Departamento de Residencia: Concepción: OR = 1.20, p = 0.00302. Las personas en Concepción tienen un 20% más de probabilidades de estar empleadas en comparación con Asunción. Itapúa: OR = 1.77, p < 2e-16. Las personas en Itapúa tienen un 77% más de probabilidades de estar empleadas en comparación con Asunción. Cordillera: OR = 1.01, p = 0.85775. No hay un efecto significativo. Otros departamentos como Caazapá, Ñeembucú y Canindeyú también muestran efectos positivos significativos. Años de Estudio: OR = 1.14, p < 2e-16. Por cada año adicional de estudio, las probabilidades de estar empleado aumentan en un 14%.
Verificación de Multicolinealidad
Los valores de VIF son menores a 5, lo que indica que no hay problemas de multicolinealidad entre las variables independientes.
Evaluación del Ajuste del Modelo
El pseudo R-cuadrado de McFadden es 0.10, lo que sugiere un ajuste moderado del modelo. Aunque no es muy alto, es aceptable en modelos de regresión logística.
En este estudio se analizó la situación laboral de las personas en Paraguay en el año 2023 utilizando datos de la Encuesta Permanente de Hogares (EPH). Los principales hallazgos son:
Asociación entre Situación Laboral y Área de Residencia: Existe una relación significativa entre estar empleado en los últimos 7 días y el área de residencia, siendo más probable el empleo en áreas rurales.
Influencia del Departamento de Residencia: Al controlar por el departamento de residencia, se confirma que ciertas regiones como Itapúa y Canindeyú tienen una mayor probabilidad de empleo en comparación con Asunción.
Impacto de la Educación: Los años de estudio tienen un efecto positivo y significativo sobre la probabilidad de estar empleado. Cada año adicional de educación incrementa las oportunidades laborales en un 14%.
Recomendaciones: Invitamos a los estudiantes a aprovechar los datos abiertos y herramientas gratuitas como R y Posit Cloud para realizar análisis que reflejen la realidad del país. El uso de estos recursos no solo mejora el aprendizaje práctico, sino que también permite abordar problemáticas reales con datos verídicos, fomentando habilidades analíticas y críticas esenciales para su desarrollo profesional.
Estos resultados destacan la importancia de considerar factores geográficos y educativos al diseñar políticas laborales y educativas. Además, subrayan el valor de utilizar datos abiertos y herramientas gratuitas como R para realizar análisis estadísticos robustos y aplicados a problemáticas reales.
Instituto Nacional de Estadísticas del Paraguay. (2023). Encuesta Permanente de Hogares Continua. Venables, W. N., & Ripley, B. D. (2002). Modern Applied Statistics with S. Springer.