1. Modelo de Riesgo crediticio

DEFAULTi =β1+β2LIMITBAL+β3SEX +β4POSTG+ β5UNIV +β6SECUN +β7MARRIAGE+β8AGE+ β9PAY0+···+β16PAY6+εi

A

options(scipen = 999)
model_logit <- glm(default_pay ~ LIMIT_BAL + SEX + postgraduate + university + secundary + MARRIAGE + AGE + PAY_0 + 
                     
                     PAY_2 + PAY_3 + PAY_4 + PAY_5 + PAY_6 , data = base, family = binomial(link = "logit"))
summary(model_logit) 
## 
## Call:
## glm(formula = default_pay ~ LIMIT_BAL + SEX + postgraduate + 
##     university + secundary + MARRIAGE + AGE + PAY_0 + PAY_2 + 
##     PAY_3 + PAY_4 + PAY_5 + PAY_6, family = binomial(link = "logit"), 
##     data = base)
## 
## Coefficients:
##                   Estimate    Std. Error z value             Pr(>|z|)    
## (Intercept)  -2.9453595424  0.2001443446 -14.716 < 0.0000000000000002 ***
## LIMIT_BAL    -0.0000018470  0.0000001417 -13.038 < 0.0000000000000002 ***
## SEX           0.1232160946  0.0316433236   3.894        0.00009864331 ***
## postgraduate  1.1273503792  0.1910694782   5.900        0.00000000363 ***
## university    1.1097457201  0.1904372969   5.827        0.00000000563 ***
## secundary     1.0616517350  0.1928815457   5.504        0.00000003709 ***
## MARRIAGE      0.1701017082  0.0352211258   4.830        0.00000136851 ***
## AGE           0.0046755069  0.0019087784   2.449              0.01431 *  
## PAY_0         0.9023304040  0.0250813022  35.976 < 0.0000000000000002 ***
## PAY_2         0.0551987736  0.0262462073   2.103              0.03546 *  
## PAY_3         0.1281577379  0.0280332256   4.572        0.00000483928 ***
## PAY_4         0.0700857304  0.0314604591   2.228              0.02590 *  
## PAY_5         0.0967119773  0.0340856881   2.837              0.00455 ** 
## PAY_6         0.1558557552  0.0288872703   5.395        0.00000006841 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## (Dispersion parameter for binomial family taken to be 1)
## 
##     Null deviance: 31705  on 29999  degrees of freedom
## Residual deviance: 26789  on 29986  degrees of freedom
## AIC: 26817
## 
## Number of Fisher Scoring iterations: 5

Los resultados de la regresión logística muestran que las variables LIMIT_BAL, SEX, EDUCATION (posgrado, universidad y secundaria), MARRIAGE, AGE y todas las variables del historial de pagos (PAY_0, PAY_2, PAY_3, PAY_4, PAY_5 y PAY_6) son determinantes de la probabilidad de impago, ya que presentan valores p inferiores a 0.05. Esto indica que todas ellas tienen una influencia estadísticamente significativa sobre la probabilidad de que un cliente incumpla sus obligaciones de pago. ¿Cuáles son las más importantes? Las variables con mayor influencia son las del historial de pagos, especialmente: PAY_0 (estado de pago más reciente): es la variable más importante. Un mayor retraso en el pago aumenta considerablemente la probabilidad de incumplimiento. PAY_6, PAY_3, PAY_5, PAY_2 y PAY_4: también incrementan la probabilidad de impago, aunque con un efecto menor que PAY_0. LIMIT_BAL: tiene un coeficiente negativo, por lo que un mayor límite de crédito se asocia con una menor probabilidad de incumplimiento. Edad (AGE): tiene un efecto positivo, pero de magnitud pequeña. Sexo, estado civil y nivel educativo también son significativos, aunque su impacto es menor que el del historial de pagos.

## 
## Please cite as:
##  Hlavac, Marek (2022). stargazer: Well-Formatted Regression and Summary Statistics Tables.
##  R package version 5.2.3. https://CRAN.R-project.org/package=stargazer
##        factor     AME     SE        z      p   lower   upper
##           AGE  0.0007 0.0003   2.4500 0.0143  0.0001  0.0012
##     LIMIT_BAL -0.0000 0.0000 -12.9911 0.0000 -0.0000 -0.0000
##      MARRIAGE  0.0238 0.0049   4.8329 0.0000  0.0141  0.0334
##         PAY_0  0.1262 0.0033  38.6017 0.0000  0.1198  0.1326
##         PAY_2  0.0077 0.0037   2.1038 0.0354  0.0005  0.0149
##         PAY_3  0.0179 0.0039   4.5765 0.0000  0.0102  0.0256
##         PAY_4  0.0098 0.0044   2.2284 0.0259  0.0012  0.0184
##         PAY_5  0.0135 0.0048   2.8386 0.0045  0.0042  0.0229
##         PAY_6  0.0218 0.0040   5.4029 0.0000  0.0139  0.0297
##  postgraduate  0.1577 0.0267   5.9027 0.0000  0.1053  0.2100
##     secundary  0.1485 0.0270   5.5061 0.0000  0.0956  0.2013
##           SEX  0.0172 0.0044   3.8957 0.0001  0.0086  0.0259
##    university  0.1552 0.0266   5.8298 0.0000  0.1030  0.2074

Los efectos marginales (AME) muestran cuánto cambia la probabilidad de que ocurra el evento cuando una variable aumenta una unidad o cuando se pertenece a una categoría determinada, manteniendo las demás variables constantes.

AGE (Edad): AME = 0.0007. Cada año adicional de edad aumenta la probabilidad del evento en aproximadamente 0.07%. Es un efecto pequeño, aunque estadísticamente significativo (p = 0.0143).

LIMIT_BAL (Límite de crédito): AME ≈ -0.0000. Un mayor límite de crédito reduce ligeramente la probabilidad del evento, pero el efecto es muy pequeño, casi nulo.

MARRIAGE (Estado civil): AME = 0.0238. Pertenecer a esa categoría de estado civil incrementa la probabilidad del evento en 2.38 puntos porcentuales respecto a la categoría de referencia.

PAY_0: AME = 0.1262. Es la variable con mayor efecto. Un aumento de una categoría en el historial de pago del mes más reciente incrementa la probabilidad del evento en 12.62 puntos porcentuales.

PAY_2: AME = 0.0077. Incrementa la probabilidad en 0.77 puntos porcentuales.

PAY_3: AME = 0.0179. Incrementa la probabilidad en 1.79 puntos porcentuales.

PAY_4: AME = 0.0098. Incrementa la probabilidad en 0.98 puntos porcentuales.

PAY_5: AME = 0.0135. Incrementa la probabilidad en 1.35 puntos porcentuales.

PAY_6: AME = 0.0218. Incrementa la probabilidad en 2.18 puntos porcentuales.

Postgraduate: AME = 0.1577. Tener estudios de posgrado aumenta la probabilidad del evento en 15.77 puntos porcentuales respecto al nivel educativo de referencia.

Secondary: AME = 0.1485. Tener educación secundaria aumenta la probabilidad en 14.85 puntos porcentuales frente a la categoría de referencia.

SEX: AME = 0.0172. El sexo correspondiente al código de la base de datos tiene una probabilidad 1.72 puntos porcentuales mayor que la categoría de referencia.

University: AME = 0.1552. Tener educación universitaria aumenta la probabilidad en 15.52 puntos porcentuales respecto a la categoría de referencia.

B

## Type 'citation("pROC")' for a citation.
## 
## Adjuntando el paquete: 'pROC'
## The following objects are masked from 'package:stats':
## 
##     cov, smooth, var
## Setting levels: control = 0, case = 1
## Setting direction: controls < cases

La curva ROC muestra que el modelo de regresión logística tiene un AUC de 0.7668, lo que indica una buena capacidad para predecir la incapacidad de pago de los clientes. Lo que significa que el modelo puede distinguir correctamente entre un cliente que incumplirá sus obligaciones financieras y uno que no lo hará en aproximadamente el 75.5% de los casos. Este resultado es significativamente superior al de una clasificación al azar (AUC = 0.50), por lo que el modelo presenta un buen desempeño predictivo. Aunque no alcanza una precisión perfecta (AUC = 1), su capacidad de discriminación es adecuada para apoyar la evaluación del riesgo crediticio y la toma de decisiones sobre el otorgamiento de préstamos o tarjetas de crédito.

C

mean_prob <- mean(base$prob_pred)
mean_prob
## [1] 0.2212

La probabilidad promedio de impago obtenida por el modelo es de 0.2212 (22.12%). Esto significa que, en promedio, el modelo estima que un cliente de la base de datos tiene un 22.12% de probabilidad de incumplir con sus obligaciones de pago

D

prob_impago <- predict(model_logit, newdata = frecuencia_impago, type = "response")
prob_pago   <- predict(model_logit, newdata = frecuencia_pago, type = "response")

prob_impago
##        1 
## 0.348582
prob_pago
##         1 
## 0.1619796

prob_impago = 0.349 (34.9%): El modelo estima que un cliente con las características promedio de quienes incumplieron sus pagos tiene una probabilidad del 34.9% de volver a presentar un impago.

prob_pago = 0.162 (16.2%): El modelo estima que un cliente con las características promedio de quienes sí cumplieron con sus pagos tiene una probabilidad del 16.2% de incurrir en un impago.

Modelo de elección laboral

desempleadoi = β1 +β2 Educi + β3Mujeri +β4edadi+ β5edad2 i + β6jefei + β7estcivili + β8ln(¯Ihi) +εi

library(dplyr)
datos_suc <- read_dta(file = "Muestra Sucre.dta") %>%
  mutate(sexo = case_when(P6020 == 1 ~ 0,
                          P6020 == 2 ~ 1),
                          estado_civil = case_when(P6070 %in% c(2,3) ~ 1,
                                                   TRUE ~ 0),
         jefe = case_when(P6050 == 1 ~ 1,
                          TRUE ~ 0),
         edad = P6040,
         edad2 = edad*edad,
         ln_ingreso = log(INGLABO + 1),
         nivel_educ = case_when(P6210 %in% c(1,2,3,9) ~ 1,
                                P6210 %in% c(4,5) ~ 2,
                                TRUE ~ 3),
         desempleo = case_when(P6920 %in% c(1) ~ 0,
                              P6920 %in% c(2,3) ~ 1)) %>% 
  group_by(DIRECTORIO) %>%
  mutate(n_ninos6 = sum(edad <= 6),
         esc_hog = mean(ESC, na.rm = T)) %>%
  select(DIRECTORIO, ESC, sexo, estado_civil, jefe, edad, edad2, nivel_educ, ln_ingreso, desempleo, n_ninos6, esc_hog) %>%
  filter(!is.na(desempleo))

A

summary(datos_suc[,c("edad","ln_ingreso")])
##       edad         ln_ingreso   
##  Min.   :15.00   Min.   : 0.00  
##  1st Qu.:29.00   1st Qu.:12.90  
##  Median :39.00   Median :13.46  
##  Mean   :40.83   Mean   :13.18  
##  3rd Qu.:51.00   3rd Qu.:13.82  
##  Max.   :90.00   Max.   :17.03  
##                  NA's   :183
table(datos_suc$sexo)
## 
##    0    1 
## 2204 1789
table(datos_suc$jefe) 
## 
##    0    1 
## 2274 1719
table(datos_suc$estado_civil)
## 
##    0    1 
## 1601 2392
table(datos_suc$nivel_educ)
## 
##    1    2    3 
##  946 1583 1464

B

El modelo planteado busca explicar la probabilidad de que un individuo se encuentre desempleado a partir de diferentes características económicas y personales. Para entender esta relación, se pueden utilizar dos enfoques teóricos principales: el modelo ocio-consumo de decisión laboral y el modelo de búsqueda secuencial de empleo. Ambos permiten analizar cómo los individuos toman decisiones frente al mercado laboral, considerando tanto sus preferencias personales como las oportunidades de empleo disponibles.

Desde el modelo ocio-consumo, la decisión de trabajar parte de la idea de que los individuos distribuyen su tiempo entre dos actividades principales: el trabajo, que les permite obtener ingresos para consumir bienes, y el ocio, que genera satisfacción directamente. En este sentido, el individuo busca maximizar su utilidad a partir del consumo y del tiempo libre, representado mediante una función de utilidad U(C,L), donde C representa el consumo de bienes y L la cantidad de ocio. El ingreso disponible depende del salario que recibe por trabajar y de otros ingresos del hogar, por lo que una persona debe decidir si el beneficio económico de trabajar compensa la pérdida de tiempo libre.

Bajo esta lógica, la decisión de participar en el mercado laboral depende de comparar el ingreso que puede obtener trabajando frente al valor que le asigna al ocio. Si el salario esperado es suficientemente alto, el individuo tendrá mayores incentivos para buscar empleo; mientras que, si cuenta con otras fuentes de ingreso, puede reducir su necesidad de trabajar y dedicar más tiempo al ocio. Por esta razón, la variable ingreso promedio del hogar en logaritmo ln(Iˉh) puede interpretarse como una medida de los recursos económicos alternativos del individuo. Se espera que su efecto sea positivo (β8>0), ya que mayores ingresos familiares pueden permitir que la persona permanezca más tiempo sin trabajar o sea más selectiva al momento de aceptar un empleo.

Por otro lado, la educación representa el nivel de capital humano acumulado por el individuo. Según la teoría del capital humano, planteada por Becker, una mayor educación aumenta las habilidades, la productividad y las posibilidades de acceder a mejores oportunidades laborales. Por esta razón, se espera que la educación tenga un efecto negativo sobre el desempleo (β2<0), debido a que las personas con más años de estudio suelen tener mejores herramientas para encontrar empleo. Sin embargo, en algunos casos los individuos con mayor educación pueden permanecer desempleados durante más tiempo mientras buscan un trabajo que se ajuste a sus expectativas salariales o a su nivel de formación.

La variable género también puede influir en la probabilidad de desempleo. La variable mujer busca capturar las diferencias existentes entre hombres y mujeres dentro del mercado laboral. Estas diferencias pueden estar relacionadas con factores como la distribución de responsabilidades familiares, restricciones de tiempo, discriminación laboral o desigualdad en el acceso a ciertos empleos. Por estas razones, generalmente se espera que ser mujer aumente la probabilidad de desempleo (β3>0), aunque este efecto puede variar dependiendo de las condiciones del mercado laboral.

En cuanto a la edad, el modelo incluye tanto la edad como la edad al cuadrado para capturar que la relación entre edad y desempleo no necesariamente es lineal. Los trabajadores jóvenes suelen presentar mayores tasas de desempleo porque tienen menos experiencia laboral, menor conocimiento del mercado y se encuentran en procesos iniciales de búsqueda de empleo. A medida que aumenta la edad, la experiencia y la estabilidad laboral pueden reducir la probabilidad de desempleo. Sin embargo, después de cierto punto, una mayor edad puede dificultar la búsqueda de empleo debido a factores como menor movilidad laboral, cambios tecnológicos o posibles barreras asociadas a la edad. Por esta razón, se espera una relación en forma de U, donde inicialmente la edad reduce el desempleo (β4<0), pero después de cierto nivel puede aumentarlo (β5>0). La condición de jefe de hogar también tiene importancia dentro del modelo, ya que representa a aquellos individuos que tienen una mayor responsabilidad económica dentro de la familia. Desde la perspectiva del modelo ocio-consumo, los jefes de hogar tienen mayores incentivos para participar en el mercado laboral porque necesitan generar ingresos para cubrir las necesidades del hogar. Por esta razón, se espera que ser jefe de hogar reduzca la probabilidad de desempleo (β6<0), debido a que estas personas podrían aceptar oportunidades laborales con mayor rapidez.

De manera similar, el estado civil puede afectar las decisiones laborales, aunque su efecto no es completamente definido. Por un lado, estar casado puede aumentar la necesidad de generar ingresos y, por lo tanto, reducir el desempleo (β7<0). Pero, por otro lado, si la persona cuenta con apoyo económico de su pareja, puede tener mayor capacidad para prolongar su búsqueda de empleo y esperar mejores oportunidades, aumentando el tiempo en desempleo (β7>0). Por esto, el efecto del estado civil dependerá de las características económicas del hogar y del papel que desempeñe cada individuo dentro de él.

Complementando el modelo ocio-consumo, el enfoque de búsqueda secuencial de empleo permite entender el desempleo como una decisión relacionada con la búsqueda de mejores oportunidades laborales. Según este modelo, una persona desempleada no acepta necesariamente la primera oferta que recibe, sino que compara las opciones disponibles con un salario mínimo que está dispuesta a aceptar, conocido como salario de reserva. Mientras las ofertas salariales sean menores que este salario esperado, el individuo continuará buscando empleo.

Desde esta perspectiva, variables como educación, ingresos del hogar y edad influyen en la duración del desempleo. Por ejemplo, los individuos con mayor educación pueden tener un salario de reserva más alto porque esperan acceder a empleos mejor remunerados, lo que puede aumentar temporalmente su permanencia en desempleo (β2>0 durante el proceso de búsqueda). De igual forma, un mayor ingreso del hogar permite financiar períodos más largos de búsqueda, ya que reduce la presión económica por aceptar rápidamente cualquier empleo disponible (β8>0). Finalmente, la edad refleja un equilibrio entre experiencia y expectativas salariales: los trabajadores mayores pueden encontrar empleo más fácilmente gracias a su experiencia, pero también pueden tardar más en aceptar ofertas si sus expectativas laborales son mayores.

C

options(scipen = 999)
modelo <- lm(desempleo ~ nivel_educ + jefe + edad + edad2 + sexo + estado_civil + ln_ingreso, data = datos_suc)
summary(modelo)
## 
## Call:
## lm(formula = desempleo ~ nivel_educ + jefe + edad + edad2 + sexo + 
##     estado_civil + ln_ingreso, data = datos_suc)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.52913 -0.36595  0.07202  0.27997  0.66883 
## 
## Coefficients:
##                 Estimate  Std. Error t value             Pr(>|t|)    
## (Intercept)   2.42887699  0.06825651  35.585 < 0.0000000000000002 ***
## nivel_educ   -0.24133661  0.00903668 -26.706 < 0.0000000000000002 ***
## jefe         -0.01279278  0.01352825  -0.946              0.34439    
## edad         -0.01516654  0.00255084  -5.946         0.0000000030 ***
## edad2         0.00015068  0.00002805   5.371         0.0000000829 ***
## sexo         -0.04215351  0.01307231  -3.225              0.00127 ** 
## estado_civil -0.03398329  0.01322348  -2.570              0.01021 *  
## ln_ingreso   -0.06118143  0.00398435 -15.355 < 0.0000000000000002 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.3769 on 3802 degrees of freedom
##   (183 observations deleted due to missingness)
## Multiple R-squared:  0.2877, Adjusted R-squared:  0.2864 
## F-statistic: 219.4 on 7 and 3802 DF,  p-value: < 0.00000000000000022

Nivel educativo (nivel_educ): Presenta un coeficiente de -0.2413 y un valor p menor a 0.001 (), por lo que es estadísticamente significativo. Esto indica que, manteniendo constantes las demás variables, un mayor nivel educativo se asocia con una disminución del desempleo. Jefe de hogar (jefe): Tiene un coeficiente de -0.0128 y un valor p de 0.344, superior a 0.05. Por tanto, no es estadísticamente significativo, lo que significa que no hay evidencia suficiente para afirmar que ser jefe de hogar influya sobre el desempleo. Edad (edad): Su coeficiente es -0.0152 y el valor p es menor a 0.001 (), por lo que es estadísticamente significativa. Esto sugiere que, inicialmente, un aumento en la edad reduce la probabilidad de desempleo. Edad al cuadrado (edad2): Presenta un coeficiente positivo de 0.00015 y un valor p menor a 0.001 (*), siendo también estadísticamente significativa. Esto indica una relación no lineal entre la edad y el desempleo, donde el efecto de la edad cambia a medida que esta aumenta. Sexo: Tiene un coeficiente de -0.0422 y un valor p de 0.00127 (**), por lo que es estadísticamente significativo. Esto evidencia que existen diferencias en el desempleo según el sexo. Estado civil (estado_civil): Su coeficiente es -0.0340 y el valor p es 0.0102 (), por lo que es estadísticamente significativo al 5%. Esto indica que el estado civil tiene un efecto sobre el desempleo. Logaritmo del salario (ln_salario): Presenta un coeficiente de -0.0612 y un valor p menor a 0.001 (), siendo altamente significativo. Esto sugiere que un mayor salario está asociado con una menor probabilidad de desempleo.

resultado <- summary(modelo)$coefficients

beta8 <- resultado["ln_ingreso","Estimate"]
se8 <- resultado["ln_ingreso","Std. Error"]

t <- beta8/se8

p_value <- pt(t, df = modelo$df.residual, lower.tail = FALSE)

p_value
## [1] 1
if(p_value < 0.05){
  print("Se rechaza H0: el ingreso del hogar es una fuente de financiación para continuar buscando empleo")
} else {
  print("No se rechaza H0: no hay evidencia suficiente de que el ingreso del hogar financie la búsqueda de empleo")
}
## [1] "No se rechaza H0: no hay evidencia suficiente de que el ingreso del hogar financie la búsqueda de empleo"

F

A partir de los resultados econométricos, se puede recomendar que las políticas de empleo en Sincelejo se enfoquen en mejorar la formación laboral, facilitar la búsqueda de empleo y promover una mayor generación de trabajos formales. Los resultados muestran que las características personales y del hogar tienen influencia sobre la probabilidad de estar desempleado, por lo que el desempleo no depende únicamente de la decisión de trabajar, sino también de las condiciones económicas y del mercado laboral.

Si los resultados indican que la educación disminuye la probabilidad de desempleo, sería importante fortalecer los programas de capacitación técnica y formación para el trabajo, especialmente para los jóvenes. En Sincelejo, donde predominan actividades como comercio y servicios, es necesario impulsar habilidades que respondan a las necesidades del mercado.

Asimismo, si el ingreso del hogar tiene un efecto negativo sobre el desempleo, esto muestra que contar con mayores recursos facilita la búsqueda de trabajo, ya que permite cubrir gastos como transporte, acceso a internet o capacitación. Por esta razón, se podrían implementar apoyos para las personas con menos recursos durante su proceso de búsqueda laboral.

También es importante prestar atención a los jóvenes, quienes suelen enfrentar mayores dificultades para acceder al primer empleo. Programas de prácticas laborales, formación y alianzas con empresas podrían ayudar a mejorar su inserción en el mercado laboral.

En general, los resultados sugieren que para reducir el desempleo en Sincelejo se requiere una combinación de políticas que mejoren la educación, reduzcan las barreras para conseguir empleo y fomenten la creación de trabajos formales.