Introducción

En Paraguay, la distribución de ingresos refleja disparidades significativas que están influenciadas por factores como el nivel educativo, el área de residencia y la situación laboral. Estas diferencias son particularmente relevantes entre los jóvenes de 18 a 29 años, un grupo etario clave para el desarrollo económico y social del país. El análisis de este segmento permite identificar patrones y desigualdades que pueden tener un impacto duradero en su calidad de vida y oportunidades futuras.

Comprender los factores que determinan la probabilidad de que los jóvenes perciban ingresos altos es crucial para diseñar políticas públicas efectivas que fomenten la movilidad social y reduzcan las brechas económicas. Este estudio busca explorar estas relaciones utilizando información proveniente de la Encuesta Permanente de Hogares Continua 2023, con un enfoque particular en variables como el nivel educativo, el área de residencia, el sexo y el estado civil.

El objetivo principal de este trabajo es determinar qué factores tienen mayor influencia en la probabilidad de que un joven perciba ingresos altos. Para ello, se emplea un enfoque analítico que incluye tanto una descripción estadística de las variables de interés como la implementación de un modelo de regresión logística que permita identificar relaciones significativas.

El documento está estructurado de la siguiente manera: en la sección ‘Fuente de datos’ se describe el origen y las características de los datos utilizados. En la sección ‘Hipótesis’ se plantean las relaciones que serán analizadas. Posteriormente, se detallan las variables seleccionadas y el procesamiento de los datos. Finalmente, se presentan los resultados obtenidos y las conclusiones derivadas del análisis.

Fuente de datos

Los datos utilizados en este análisis provienen de la Encuesta Permanente de Hogares Continua (EPHC) correspondiente al año 2023, un instrumento desarrollado por la Dirección General de Estadísticas, Encuestas y Censos (DGEEC) de Paraguay. Esta encuesta constituye una de las principales fuentes de información estadística del país y proporciona datos representativos sobre las características demográficas, educativas, laborales y económicas de la población.

El archivo utilizado para el presente estudio, denominado REG02_ANUAL_2023.csv, está disponible en el portal de microdatos de la DGEEC y se puede acceder a través del siguiente enlace: https://www.ine.gov.py/microdatos/register/EPCH_ANUAL/EPHC_2023_ANUAL/REG02_ANUAL_2023.csv

El conjunto de datos incluye información detallada de cada hogar y sus miembros, permitiendo un análisis robusto de las variables de interés. Para este trabajo, se seleccionaron específicamente los datos de jóvenes de 18 a 29 años que residen en áreas urbanas y están ocupados en el mercado laboral.

El procesamiento de los datos implicó la selección de variables clave relacionadas con características demográficas, educativas y laborales, las cuales se describen en detalle en la sección de ‘Variables seleccionadas’. Se realizaron filtros y transformaciones para garantizar la consistencia y relevancia de las observaciones incluidas en el análisis.

El análisis estadístico de esta fuente de datos permite explorar cómo los distintos factores socioeconómicos y demográficos inciden en la probabilidad de percibir ingresos altos, en el contexto urbano paraguayo, con énfasis en el área metropolitana del Gran Asunción.

Hipótesis a plantear

La presente investigación se enfoca en determinar los factores que inciden en la probabilidad de que un joven perciba ingresos altos, considerando su nivel educativo, situación laboral, y lugar de residencia. En este contexto, se plantea la siguiente hipótesis:

Hipótesis principal

La probabilidad de que un joven, de entre 18 y 29 años, perciba ingresos altos está influenciada significativamente por las siguientes variables:

  • Haber completado estudios universitarios.
  • Residir en áreas urbanas de Gran Asunción.
  • El sexo (hombre o mujer).
  • El estado civil (soltero o no soltero).
  • Trabajar más de ocho horas diarias.

Esta hipótesis parte del supuesto de que la combinación de características demográficas, educativas, y laborales afecta directamente las oportunidades económicas de los jóvenes.

Objetivos específicos asociados a la hipótesis

  • Analizar la relación entre el nivel educativo y la percepción de ingresos altos.

  • Examinar el impacto de residir en el Gran Asunción en las oportunidades económicas.

  • Identificar posibles diferencias en los ingresos según el sexo.

  • Evaluar la influencia del estado civil en la probabilidad de percibir ingresos altos.

  • Determinar si trabajar más de ocho horas al día está asociado con mejores ingresos.

A través de la exploración y el modelado de datos, se buscará validar esta hipótesis y comprender la relevancia de cada factor en el contexto socioeconómico de los jóvenes en Paraguay.

Variables seleccionadas

Para abordar la hipótesis planteada, se seleccionaron las siguientes variables relevantes del conjunto de datos proporcionado, clasificadas en dos grupos principales:

Variables principales (independientes y dependiente)

Estas variables permiten evaluar directamente los factores asociados a la percepción de ingresos altos:

  • EDAD (P02): Edad del individuo (en años), restringida al rango de 18 a 29 años.

  • Nivel y grado más alto que aprobó (ED0504): Variable que indica el nivel educativo alcanzado.

  • Área de residencia (AREA): Distingue entre áreas urbanas y rurales.

  • Actividad económica (PEAA): Indica si el individuo se encuentra ocupado laboralmente.

  • Ingreso mensual por ocupación (E01A): Ingreso mensual reportado en la ocupación principal, categorizado como “Ingresos altos” si supera Gs. 5.000.000.

Factores adicionales (moduladores o categóricos)

Estos factores complementan el análisis al incorporar información demográfica y laboral relevante:

  • Departamento de residencia (DPTO): Determina si el individuo reside en el Gran Asunción o en otras áreas del país.

  • Sexo (P06): Clasifica a los individuos como hombres o mujeres.

  • Estado civil (P09): Distingue entre personas solteras y no solteras.

  • Horas trabajadas (HORABCO): Cantidad de horas trabajadas semanalmente, categorizada como “Más de 8 horas” o “Menos de 8 horas”.

Justificación de la selección de variables

La selección de estas variables se fundamenta en su relación directa con la hipótesis planteada. Estas permiten analizar cómo aspectos educativos, demográficos y laborales influyen en los ingresos percibidos por los jóvenes. Adicionalmente, la categorización de variables como el ingreso y las horas trabajadas facilita la interpretación y el modelado estadístico.

Relación con el modelo de análisis

El análisis integrará estas variables mediante técnicas estadísticas descriptivas y un modelo de regresión logística, evaluando la significancia de cada factor en la probabilidad de percibir ingresos altos.

Lectura y procesamiento de datos

# Cargar las bibliotecas necesarias
#install.packages("readr")
#install.packages("dplyr")
#install.packages("tidyverse")
#install.packages("conflicted")

library("readr")     # Para leer archivos CSV con una codificación rápida y flexible
library("dplyr")     # Para manipulación de datos
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library("tidyverse") # Contiene varias herramientas útiles como ggplot2, tidyr, dplyr, entre otros
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ forcats   1.0.0     ✔ stringr   1.5.1
## ✔ ggplot2   3.5.1     ✔ tibble    3.2.1
## ✔ lubridate 1.9.3     ✔ tidyr     1.3.1
## ✔ purrr     1.0.2
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
library("conflicted") # Para resolver posibles conflictos de nombres entre paquetes
#Se cargan los datos desde un archivo CSV en formato delimitado por punto y coma
eph23 = read.csv2("REG02_ANUAL_2023.csv", header=TRUE, sep=";", dec=",")
# Definir las columnas que queremos seleccionar
# Aquí seleccionamos columnas específicas que nos interesan para nuestro análisis
variables <- c("P02", "ED0504", "AREA", "PEAA", "E01A", "DPTO", "P06", "P09", "HORABCO")

# Se filtran las columnas que se encuentran en 'variables' usando 'select' de 'dplyr'
eph23selec <- eph23 %>%
  select(any_of(variables))

# Se verifican los nombres de las columnas seleccionadas
names(eph23selec)
## [1] "P02"     "ED0504"  "AREA"    "PEAA"    "E01A"    "DPTO"    "P06"    
## [8] "P09"     "HORABCO"
# Resolvemos posibles conflictos de nombres de funciones entre paquetes
conflicts_prefer(dplyr::filter)
## [conflicted] Will prefer dplyr::filter over any other package.
# Se filtran los datos según las condiciones especificadas
eph23fil <- eph23selec %>%
  filter((ED0504>=2401 & ED0504 <=2406) & (P02>=18 & P02<=29) & AREA==1 & PEAA==1)

# Se verifican las columnas del dataframe filtrado
names(eph23fil)
## [1] "P02"     "ED0504"  "AREA"    "PEAA"    "E01A"    "DPTO"    "P06"    
## [8] "P09"     "HORABCO"

Procesamiento por variables

Nivel de Ingreso por categoría

# Categorizamos la variable E01A en dos niveles
# "Ingresos altos" si es mayor o igual a 5000000 y "Ingresos no altos" si es menor

eph23fil <- eph23fil %>%
  mutate(IngresoCat = ifelse(E01A >= 5000000, "Ingresos altos", "Ingresos no altos"))

# Contar la frecuencia de cada categoría de ingresos
tabla_Ingresos <- table(eph23fil$IngresoCat, useNA = "ifany")
tabla_Ingresos
## 
##    Ingresos altos Ingresos no altos 
##               200              1430

Departamento de Residencia

# Categorizamos si una persona vive en Gran Asunción o no
eph23fil <- eph23fil %>%
  mutate(
    viveCentral = case_when(
      DPTO != 0 & DPTO != 11 ~ "No vive en Gran Asunción",
      TRUE ~ "Vive en Gran Asunción" # Manejo de valores inesperados
    )
  )

# Mostrar la distribución de personas según su ubicación
table(eph23fil$viveCentral)
## 
## No vive en Gran Asunción    Vive en Gran Asunción 
##                      891                      739

Sexo

# Convertir 'P06' a una factor para representar a hombres y mujeres con etiquetas más legibles
eph23fil$P06 <- factor(eph23fil$P06, levels = c(1,6), labels = c("Hombres", "Mujeres"))

# Mostrar la distribución por sexo
tabla_Sexo <- table(eph23fil$P06, useNA = "ifany")
tabla_Sexo
## 
## Hombres Mujeres 
##     692     938

Estado civil

# Clasificar el estado civil en 'Es soltero' o 'No es soltero' según P09
eph23fil <- eph23fil %>%
  mutate(
    esSoltero = case_when(
      P09 >= 1 & P09 <= 2 ~ "No es soltero",
      TRUE ~ "Es soltero" # Manejo de valores inesperados
    )
  )

# Mostrar la distribución de las categorías de estado civil
table(eph23fil$esSoltero)
## 
##    Es soltero No es soltero 
##          1205           425

Trabaja más de ocho horas

# Clasificar las horas trabajadas en menos de 8 horas o más de 8 horas según 'HORABCO'
eph23fil <- eph23fil %>%
  mutate(horasTrab = ifelse(HORABCO < 8, "Menos de 8 horas", "Más de 8 horas"))

# Mostrar la distribución de las horas trabajadas
table(eph23fil$horasTrab)
## 
##   Más de 8 horas Menos de 8 horas 
##             1611               19

Descriptivo bivariado para la situación de Nivel de Ingresos

#install.packages("vcd")
library("vcd")  # Cargar vcd para mosaico de gráficos más avanzados
## Loading required package: grid

Nivel de Ingresos vs Departamento de Residencia

# Crear una tabla de contingencia entre el nivel de ingresos y el departamento de residencia
tabla_INGRESOvsDPTO = table(eph23fil$viveCentral, eph23fil$IngresoCat)
tabla_INGRESOvsDPTO
##                           
##                            Ingresos altos Ingresos no altos
##   No vive en Gran Asunción             73               818
##   Vive en Gran Asunción               127               612

Prueba de independencia para Nivel de Ingresos vs Departamento de Residencia

# Visualización de la relación entre el nivel de ingresos y el departamento de residencia utilizando un gráfico de mosaico
mosaicplot(tabla_INGRESOvsDPTO, 
           main = "Mosaico de Nivel de Ingresos por Departamento de Residencia",
           xlab = "Departamento de Residencia", 
           ylab = "Nivel de Ingresos",
           col = c("lightblue", "salmon"), shade = TRUE)

# Prueba de independencia Chi-cuadrado para evaluar la relación entre el nivel de ingresos y el departamento de residencia
chi_sq <- chisq.test(tabla_INGRESOvsDPTO)

print(chi_sq)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla_INGRESOvsDPTO
## X-squared = 29.516, df = 1, p-value = 5.547e-08

Interpretación: El valor de p de la prueba Chi-cuadrado es muy bajo (p < 0.05), lo que indica que existe una relación significativa entre el nivel de ingresos y el departamento de residencia, es decir, los ingresos altos o bajos varían dependiendo del lugar de residencia.

Nivel de Ingresos vs Sexo

# Crear una tabla de contingencia entre el nivel de ingresos y el sexo
tabla_INGRESOvsSEXO = table(eph23fil$P06, eph23fil$IngresoCat)
tabla_INGRESOvsSEXO
##          
##           Ingresos altos Ingresos no altos
##   Hombres             99               593
##   Mujeres            101               837

Prueba de independencia para Nivel de Ingresos vs Sexo

# Visualización de la relación entre el nivel de ingresos y el sexo utilizando un gráfico de mosaico
mosaicplot(tabla_INGRESOvsSEXO, 
           main = "Mosaico de Nivel de Ingresos por Sexo",
           xlab = "Sexo", 
           ylab = "Nivel de Ingresos",
           col = c("lightblue", "salmon"), shade = TRUE)

# Prueba de independencia Chi-cuadrado para evaluar la relación entre el nivel de ingresos y el sexo
chi_sq <- chisq.test(tabla_INGRESOvsSEXO)

print(chi_sq)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla_INGRESOvsSEXO
## X-squared = 4.3098, df = 1, p-value = 0.03789

Interpretación: El valor de p de la prueba Chi-cuadrado es 0.03789, que es menor a 0.05. Esto indica que existe una relación significativa entre el sexo y el nivel de ingresos, lo que sugiere que los ingresos altos o bajos pueden estar asociados con el género.

Nivel de Ingresos vs Estado Civil

# Crear una tabla de contingencia entre el nivel de ingresos y el estado civil
tabla_INGRESOvsEstCiv = table(eph23fil$esSoltero, eph23fil$IngresoCat)
tabla_INGRESOvsEstCiv
##                
##                 Ingresos altos Ingresos no altos
##   Es soltero               148              1057
##   No es soltero             52               373

Prueba de independencia para Nivel de Ingresos vs Estado Civil

# Visualización de la relación entre el nivel de ingresos y el estado civil utilizando un gráfico de mosaico
mosaicplot(tabla_INGRESOvsEstCiv, 
           main = "Mosaico de Nivel de Ingresos por Estado Civil",
           xlab = "Estado Civil", 
           ylab = "Nivel de Ingresos",
           col = c("lightblue", "salmon"), shade = TRUE)

# Prueba de independencia Chi-cuadrado para evaluar la relación entre el nivel de ingresos y el estado civil
chi_sq <- chisq.test(tabla_INGRESOvsEstCiv)

print(chi_sq)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla_INGRESOvsEstCiv
## X-squared = 1.2734e-28, df = 1, p-value = 1

Interpretación: El valor p de la prueba Chi-cuadrado es 1, lo que sugiere que no hay evidencia suficiente para rechazar la hipótesis nula de independencia entre el estado civil y el nivel de ingresos. En otras palabras, el estado civil no está relacionado de manera significativa con el nivel de ingresos.

Nivel de Ingresos vs Horas de Trabajo

# Crear una tabla de contingencia entre el nivel de ingresos y las horas trabajadas
tabla_INGRESOvsHORAS = table(eph23fil$horasTrab, eph23fil$IngresoCat)
tabla_INGRESOvsHORAS
##                   
##                    Ingresos altos Ingresos no altos
##   Más de 8 horas              198              1413
##   Menos de 8 horas              2                17

Prueba de independencia para Nivel de Ingresos vs Horas de Trabajo

# Visualización de la relación entre el nivel de ingresos y las horas trabajadas utilizando un gráfico de mosaico
mosaicplot(tabla_INGRESOvsHORAS, 
           main = "Mosaico de Nivel de Ingresos por Horas Trabajadas",
           xlab = "Horas Trabajadas", 
           ylab = "Nivel de Ingresos",
           col = c("lightblue", "salmon"), shade = TRUE)

# Prueba de independencia Chi-cuadrado para evaluar la relación entre el nivel de ingresos y las horas trabajadas
chi_sq <- chisq.test(tabla_INGRESOvsHORAS)
## Warning in chisq.test(tabla_INGRESOvsHORAS): Chi-squared approximation may be
## incorrect
print(chi_sq)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla_INGRESOvsHORAS
## X-squared = 6.4573e-29, df = 1, p-value = 1

Interpretación: La prueba Chi-cuadrado sugiere que no hay diferencia significativa entre los grupos en cuanto a las horas trabajadas y el nivel de ingresos. Sin embargo, dado el pequeño número de observaciones en las celdas “Menos de 8 horas” y “Ingresos altos” (solo 2 casos), los resultados de la prueba no son confiables.

Dado que los tamaños de muestra en algunas celdas son muy pequeños, consideramos usar una prueba exacta de Fisher para este tipo de tabla de contingencia 2x2.

# Prueba exacta de Fisher
fisher_test <- fisher.test(tabla_INGRESOvsHORAS)
print(fisher_test)
## 
##  Fisher's Exact Test for Count Data
## 
## data:  tabla_INGRESOvsHORAS
## p-value = 1
## alternative hypothesis: true odds ratio is not equal to 1
## 95 percent confidence interval:
##   0.2793084 10.7060309
## sample estimates:
## odds ratio 
##   1.190935

Interpretación: La Prueba Exacta de Fisher no muestra evidencia de una relación significativa entre las horas trabajadas y el nivel de ingresos en esta muestra. Aunque el odds ratio es ligeramente mayor que 1, el intervalo de confianza amplio y el valor p de 1 sugieren que los resultados son poco concluyentes y que los tamaños de muestra pequeños en las celdas podrían estar afectando la validez de la prueba. Por lo tanto, no podemos inferir que el nivel de ingresos esté relacionado de manera significativa con las horas trabajadas en este conjunto de datos.

Análisis de Regresión Logística

#Para explicar el nivel de ingreso para los factores dados
library(dplyr)
library(ggplot2)
library(pscl)
## Classes and Methods for R originally developed in the
## Political Science Computational Laboratory
## Department of Political Science
## Stanford University (2002-2015),
## by and under the direction of Simon Jackman.
## hurdle and zeroinfl functions by Achim Zeileis.
eph23fil <- eph23fil %>%
  mutate(IngresoCatNum = ifelse(IngresoCat == "Ingresos altos", 1, 0))


modelo_logit <- glm(IngresoCatNum ~ viveCentral + P06 + esSoltero + horasTrab,
                    data = eph23fil, 
                    family= binomial)


summary(modelo_logit)
## 
## Call:
## glm(formula = IngresoCatNum ~ viveCentral + P06 + esSoltero + 
##     horasTrab, family = binomial, data = eph23fil)
## 
## Coefficients:
##                                  Estimate Std. Error z value Pr(>|z|)    
## (Intercept)                      -2.25678    0.15358 -14.695  < 2e-16 ***
## viveCentralVive en Gran Asunción  0.83805    0.15664   5.350 8.78e-08 ***
## P06Mujeres                       -0.30668    0.15287  -2.006   0.0448 *  
## esSolteroNo es soltero            0.04741    0.17432   0.272   0.7857    
## horasTrabMenos de 8 horas        -0.15069    0.75917  -0.198   0.8427    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 1213.6  on 1629  degrees of freedom
## Residual deviance: 1179.2  on 1625  degrees of freedom
## AIC: 1189.2
## 
## Number of Fisher Scoring iterations: 5

Interpretación del modelo logit

  • (Intercept): El valor de -2.25678 indica la probabilidad de tener ingresos altos cuando todas las variables son 0 (referencia). El valor p < 2e-16 indica que el intercepto es altamente significativo.

  • viveCentralVive en Gran Asunción: El coeficiente es 0.83805, lo que implica que las personas que viven en la Gran Asunción tienen una mayor probabilidad de tener ingresos altos en comparación con las personas que no viven allí. La prueba de significancia muestra un valor p muy bajo (8.78e-08), lo que sugiere que esta variable es altamente significativa.

  • P06Mujeres: El coeficiente es -0.30668, lo que significa que las mujeres tienen una menor probabilidad de tener ingresos altos en comparación con los hombres. Este coeficiente es estadísticamente significativo con un valor p de 0.0448.

  • esSolteroNo es soltero: El coeficiente de 0.04741 indica que no ser soltero tiene un pequeño efecto positivo sobre la probabilidad de tener ingresos altos, pero el valor p de 0.7857 sugiere que esta variable no es significativa.

  • horasTrabMenos de 8 horas: El coeficiente es -0.15069, lo que indica que trabajar menos de 8 horas se asocia con una menor probabilidad de tener ingresos altos. Sin embargo, el valor p de 0.8427 sugiere que esta variable no es significativa.

Interpretación de los coeficientes en términos de odds ratios

exp(coef(modelo_logit))
##                      (Intercept) viveCentralVive en Gran Asunción 
##                        0.1046873                        2.3118584 
##                       P06Mujeres           esSolteroNo es soltero 
##                        0.7358864                        1.0485478 
##        horasTrabMenos de 8 horas 
##                        0.8601162
  • (Intercept): Un odds ratio de 0.1047 sugiere que, cuando todas las variables son 0, la probabilidad de tener ingresos altos es mucho menor que la de no tener ingresos altos.

  • viveCentralVive en Gran Asunción: El odds ratio de 2.3119 indica que vivir en la Gran Asunción duplica las probabilidades de tener ingresos altos en comparación con no vivir allí.

  • P06Mujeres: Un odds ratio de 0.7359 significa que las mujeres tienen aproximadamente un 26% menos de probabilidades de tener ingresos altos en comparación con los hombres.

  • esSolteroNo es soltero: Un odds ratio de 1.0485 sugiere que las personas que no son solteras tienen un 4.85% más de probabilidades de tener ingresos altos, pero debido a que no es significativo, no tiene mucho impacto.

  • horasTrabMenos de 8 horas: Un odds ratio de 0.8601 indica que trabajar menos de 8 horas está asociado con un 14% menos de probabilidades de tener ingresos altos, aunque esta relación no es significativa.

Intervalos de confianza para los odds ratios

exp(confint(modelo_logit))
## Waiting for profiling to be done...
##                                       2.5 %    97.5 %
## (Intercept)                      0.07682857 0.1403536
## viveCentralVive en Gran Asunción 1.70563617 3.1544240
## P06Mujeres                       0.54521664 0.9934253
## esSolteroNo es soltero           0.73971837 1.4668296
## horasTrabMenos de 8 horas        0.13441094 3.0923331
  • viveCentralVive en Gran Asunción: El intervalo de confianza de [1.7056, 3.1544] no incluye 1, lo que confirma que vivir en la Gran Asunción aumenta significativamente las probabilidades de tener ingresos altos.

  • P06Mujeres: El intervalo de confianza de [0.5452, 0.9934] incluye 1, lo que significa que la diferencia entre hombres y mujeres no es significativa en términos de ingresos altos.

  • esSolteroNo es soltero: El intervalo de confianza de [0.7397, 1.4668] también incluye 1, lo que sugiere que no ser soltero no tiene un impacto significativo sobre los ingresos.

  • horasTrabMenos de 8 horas: El intervalo de confianza de [0.1344, 3.0923] incluye 1, lo que implica que no se puede afirmar que trabajar menos de 8 horas tenga un efecto significativo en los ingresos altos.

Distribución de las Probabilidades Predichas

#Evaluación de la bondad de ajuste utilizando Pseudo R-squared
library(pscl)
pR2(modelo_logit)
## fitting null model for pseudo-r2
##           llh       llhNull            G2      McFadden          r2ML 
## -589.58175991 -606.79855133   34.43358285    0.02837316    0.02090333 
##          r2CU 
##    0.03981235
#Predicciones del modelo
eph23fil <- eph23fil %>%
  mutate(
    probabilidad = predict(modelo_logit, type = "response"),
    prediccion = ifelse(probabilidad > 0.5, 1, 0)
  )
ggplot(eph23fil, aes(x = probabilidad, fill = factor(IngresoCat))) + 
  geom_histogram(binwidth = 0.05, alpha = 0.07, position = "identity") + 
  theme_minimal() + 
  labs(title = "Distribución de probabilidades predichas",
       x = "Probabilidad de tener ingresos altos",
       y = "Frecuencia",
       fill = "Ingreso Alto") + 
  scale_fill_manual(values = c("red", "green"))

Interpretacion Final

El análisis de regresión logística realizado para predecir los ingresos altos en función de las variables viveCentral, P06, esSoltero y horasTrab muestra que:

  • Vivir en la Gran Asunción aumenta significativamente las probabilidades de tener ingresos altos. Este resultado es respaldado por un odds ratio de 2.31, lo que sugiere que las personas que viven en la Gran Asunción tienen más del doble de probabilidades de tener ingresos altos en comparación con quienes viven fuera de la capital.

  • El sexo (mujeres vs hombres) muestra una diferencia estadísticamente significativa. Las mujeres tienen un odds ratio de 0.74, lo que significa que tienen aproximadamente un 26% menos de probabilidades de tener ingresos altos en comparación con los hombres, lo que puede reflejar disparidades de género en los ingresos.

  • El estado civil (soltero vs no soltero) no tiene un impacto significativo en las probabilidades de tener ingresos altos. El odds ratio cercano a 1 y el valor p alto sugieren que no hay diferencia relevante entre solteros y no solteros en este contexto.

  • Las horas trabajadas (más o menos de 8 horas) tampoco muestran un impacto significativo. Aunque el coeficiente es negativo, el valor p alto indica que esta variable no tiene un efecto estadísticamente significativo sobre los ingresos altos.

A pesar de que algunas variables muestran resultados significativos, el modelo en su conjunto tiene un bajo Pseudo R-squared (0.028), lo que sugiere que las variables seleccionadas no explican una gran parte de la variabilidad en los ingresos altos. Esto puede indicar que existen factores adicionales no contemplados en el modelo que podrían tener un mayor impacto en el nivel de ingresos.

Conclusiones

El análisis de regresión logística ha proporcionado información valiosa sobre las relaciones entre el nivel de ingresos y diversas características demográficas y laborales. Sin embargo, el modelo tiene limitaciones en su capacidad explicativa debido a un bajo ajuste general (Pseudo R-squared). Esto sugiere que, aunque las variables seleccionadas (como el lugar de residencia y el sexo) influyen en la probabilidad de tener ingresos altos, aún faltan factores clave que podrían mejorar la predicción.

Es posible que se necesiten otras variables para obtener un modelo más robusto que pueda explicar de manera más completa los factores que determinan el nivel de ingresos.

Referencias