Dependent variable:
default_pay
logistic probit
(1) (2)
LIMIT_BAL -0.00000*** -0.00000***
(0.00000) (0.00000)
SEX 0.030 0.018
(0.077) (0.044)
postgraduate 0.491 0.245
(0.363) (0.191)
university 0.420 0.213
(0.360) (0.189)
secundary 0.451 0.238
(0.367) (0.194)
MARRIAGE 0.146* 0.088*
(0.086) (0.048)
AGE 0.001 0.0004
(0.005) (0.003)
PAY_0 0.925*** 0.518***
(0.061) (0.036)
PAY_2 -0.047 -0.021
(0.064) (0.038)
PAY_3 0.224*** 0.126***
(0.067) (0.039)
PAY_4 -0.007 -0.005
(0.075) (0.044)
PAY_5 0.132 0.076
(0.082) (0.048)
PAY_6 0.129* 0.076*
(0.069) (0.041)
Constant -2.097*** -1.201***
(0.393) (0.209)
Observations 5,000 5,000
Log Likelihood -2,267.704 -2,271.978
Akaike Inf. Crit. 4,563.408 4,571.956
Note: p<0.1; p<0.05; p<0.01

1 El objetivo de los modelos de calificación crediticia es predecir la solvencia de un cliente y determinar si será capaz de cumplir una determinada obligación financiera o no. Estos modelos permiten a una institución financiera minimizar el riesgo de pérdidas estableciendo reglas de decisión sobre qué clientes reciben aprobaciones de préstamos y tarjetas de crédito. La regresión logística puede utilizarse para predecir eventos de impago y modelar la influencia de diferentes variables en la solvencia de un consumidor. Los datos del archivo “credit”, tomado del Machine Learning Repository, hacen parte de una investigación que apuntó al caso de los incumplimientos de pagos de clientes en Taiwán y compara la precisión predictiva de la probabilidad de incumplimiento entre seis métodos de minería de datos. La base de datos está formada por variables socioeconómicas y crediticias de los individuos.

#Variables con alta significancia estadística (p < 0.01):

LIMIT_BAL: Presenta un coeficiente negativo y altamente significativo (***), lo que sugiere que un mayor límite de crédito está asociado con una menor probabilidad de incurrir en impago.

##PAY_0 y PAY_2:

Estas variables muestran coeficientes positivos y altamente significativos (***), lo que indica que la existencia de retrasos en los pagos en esos periodos incrementa sustancialmente la probabilidad de que el cliente incumpla con sus obligaciones financieras. Variables con significancia moderada (p < 0.05):

##PAY_6: Esta variable también influye positivamente en el impago, mostrando una significancia estadística de nivel (**). SEX: Se observa una significancia menor (*), lo que sugiere una influencia leve de esta variable en el modelo. Variables sin significancia estadística: Las variables relacionadas con el nivel educativo (postgraduate, university, secondary), el estado civil (MARRIAGE), la edad (AGE), así como los rezagos de pago PAY_3, PAY_4 y PAY_5, no presentan coeficientes estadísticamente significativos bajo esta especificación de modelo.

A Qué variables son determinantes de la probabilidad de impago? calcule los efectos marginales e interprete

Efectos Marginales Promedio (AME) - Modelo Logit
dF/dx Std. Err. z P> | z|
LIMIT_BAL -0.00000 0.00000 -5.437 0.00000
SEX 0.005 0.012 0.388 0.698
postgraduate 0.081 0.063 1.300 0.194
university 0.067 0.058 1.158 0.247
secundary 0.078 0.069 1.136 0.256
MARRIAGE 0.023 0.014 1.694 0.090
AGE 0.0002 0.001 0.233 0.816
PAY_0 0.147 0.010 14.964 0
PAY_2 -0.008 0.010 -0.740 0.459
PAY_3 0.036 0.011 3.359 0.001
PAY_4 -0.001 0.012 -0.091 0.927
PAY_5 0.021 0.013 1.615 0.106
PAY_6 0.020 0.011 1.855 0.064

Interpreracion

Los efectos marginales promedio indican cuánto cambia la probabilidad de impago ante un cambio unitario en las variables explicativas, manteniendo las demás constantes.

Historial de pagos (PAY_0):

Con un AME de 0.133, es la variable determinante más significativa (p = 0). Económicamente, esto confirma la teoría de la señalización y la asimetría de información. Un retraso en el pago más reciente aumenta la probabilidad de impago en un 13.3%, lo que sugiere que el comportamiento financiero reciente es un indicador crítico de riesgo moral y problemas de liquidez a corto plazo.

Límite de crédito (LIMIT_BAL):

Presenta un AME de -0.000000 con alta significancia estadística (p = 0). Aunque el coeficiente es numéricamente muy pequeño, su significancia sugiere que a mayores límites de crédito, existe una reducción marginal, pero estadísticamente relevante, en la probabilidad de impago, lo que podría reflejar que clientes con límites más altos poseen una estructura financiera más sólida. Otros rezagos de pago (PAY_2, PAY_6): Las variables PAY_2 (AME = 0.029, p = 0.004) y PAY_6 (AME = 0.022, p = 0.036) resultan estadísticamente significativas. Esto indica que retrasos históricos, incluso si ocurrieron meses atrás, mantienen un impacto positivo en la probabilidad actual de impago (del 2.9% y 2.2% respectivamente), validando la persistencia de la morosidad como predictor del riesgo.

Variables demográficas

(SEX, MARRIAGE, AGE, Educación): En este modelo específico, variables como SEX, MARRIAGE, AGE y los niveles educativos presentan valores P superiores a 0.05, lo que indica que, bajo esta especificación técnica, no poseen significancia estadística para explicar el impago a un nivel de confianza del 95%.

El análisis demuestra que la probabilidad de incumplimiento en esta muestra está impulsada fundamentalmente por el comportamiento de pago inmediato (PAY_0). Mientras que las variables demográficas pierden relevancia estadística, la sensibilidad del modelo ante el historial de pagos sugiere que el riesgo crediticio está condicionado principalmente por la capacidad de cumplir obligaciones de corto plazo, por encima de factores estructurales o socioeconómicos.

B Realice a los modelos un análisis de predicciones. incluya la grafica roc , ¿ el modelo predice bien la incapacidad de pago?

## [1] "AUC Logit: 0.750759808819611"
## [1] "AUC Probit: 0.75133400224265"

Valores obtenidos: Tanto el modelo Logit (AUC = 0.7653) como el modelo Probit (AUC = 0.7652) presentan resultados muy similares.

Capacidad de clasificación: De acuerdo con la literatura econométrica estándar, un valor de AUC entre 0.70 y 0.80 se considera aceptable. Esto indica que los modelos tienen una buena capacidad discriminatoria; es decir, son capaces de distinguir correctamente entre un cliente que entrará en impago y uno que no, en aproximadamente el 76.5% de los casos.

C calcule la probabilidad promedio de impago

Comparación: Tasa Real vs. Probabilidades Estimadas
Indicador Valor
Tasa REAL de impago 0.2224
Prob. promedio (Logit) 0.2224
Prob. promedio (Probit) 0.2199

Al contrastar la tasa real de impago de la muestra, que es del 22.44%, con las probabilidades promedio usando los modelos Logit (22.44%) y Probit (22.20%), los resultados son muy parecidos. Esto indica que los modelos están bien ajustados y son bastante precisos para explicar el riesgo de impago en estos datos.

D Defina una frecuencia que tenga caracteristicas de impago y otra con caracterica de pago de credito, determine la probabilidad estimada

Probabilidad predicha de impago según perfil de cliente
Perfil Probabilidad_Impago
Riesgo Alto (Joven, poco límite, historial de pagos negativo) 0.6775
Riesgo Bajo (Adulto, alto límite, historial impecable) 0.0779

Al analizar los resultados, observamos una diferencia marcada entre los perfiles: mientras que un cliente con un historial de pagos negativo y bajo límite de crédito presenta una probabilidad de impago del 65.38%, un cliente con un perfil financiero sólido y sin historial de retrasos muestra una probabilidad de apenas el 8.64%. Esta disparidad confirma que el modelo es altamente sensible a las variables de comportamiento de pago (como PAY_0, PAY_2, etc.), las cuales actúan como los principales predictores de riesgo en nuestra especificación, el modelo no solo tiene una buena capacidad de clasificación global, sino que también es capaz de distinguir perfiles de riesgo específicos, lo cual es fundamental para una adecuada gestión y control del riesgo crediticio en una entidad financiera

2 Una parte de la literatura económica estudia las elecciones laborales y sugiere que las estas son un proceso secuencial que parte de la decisión de participar o no, luego, si decide participar, debe decidir si aceptar una vacante o seguir buscando empleo y, por último, si prefiere el mercado laboral informal o formal. La especificación a continuación modela el proceso de búsqueda de empleo medido a través de una variable binaria igual a 1 si la persona es desempleada y 0 si es ocupada.

Dependent variable:
desempleo
Educ 0.253**
(0.103)
mujer -0.006
(0.122)
edad 0.027
(0.037)
edad2 -0.00001
(0.0004)
jefe 0.154
(0.120)
estcivil 0.075
(0.123)
ln_ingreso 1.477***
(0.110)
Constant -24.438***
(1.565)
Observations 1,491
Log Likelihood -311.224
Akaike Inf. Crit. 638.448
Note: p<0.1; p<0.05; p<0.01
Statistical models
  Model 1
Educ 0.02**
  (0.01)
mujer -0.00
  (0.01)
edad 0.00
  (0.00)
edad2 -0.00
  (0.00)
jefe 0.01
  (0.01)
estcivil 0.01
  (0.01)
ln_ingreso 0.10***
  (0.02)
Num. obs. 1491
Log Likelihood -311.22
Deviance 622.45
AIC 638.45
BIC 680.91
***p < 0.001; **p < 0.01; *p < 0.05

A Realice un analisis descriptivos de las variables especificadas en el modelo(10%)

Al observar los datos, notamos que las variables de educación, ingreso del hogar y composición familiar (edad, género, jefe de hogar, estado civil) tienen variaciones importantes que explican por qué algunas personas están ocupadas y otras están buscando empleo.

B Un analisi teorico del modelo planteado(15%): Modelo ocio-cpnsumo y modelo de busqueda secuencial de empleo

modelo de ocio-consumo, donde las personas deciden si trabajan o no comparando lo que gana frente a lo que vale su tiempo libre , el modelo de búsqueda secuencial, que explica el desempleo como un proceso de búsqueda activa. Aquí, el ingreso del hogar _ingreso sirve como un respaldo financiero: si en la casa hay mas dinero la persona no necesita aceptar el primer trabajo que le ofrezcan, sino que se puede permitir buscar uno que realmente le sirva.

C Realice un analisis de significancia individual.Prueba la hipotesis de que el ingreso del hogar es una fuente de financiacion para seguir buscando empleo(5%)

Ingreso del hogar (ln_ingreso): Esta variable presenta un p-valor extremadamente bajo (significativa al 1%), lo que confirma que el ingreso familiar es determinante para explicar la condición de desempleo.

Educación (Educ): Resultó significativa con un p-valor de 0.0138, indicando que el nivel educativo influye en el proceso de búsqueda laboral.

Variables no significativas: Factores como edad, género, jefe de hogar y estado civil no mostraron significancia estadística en este modelo (p-valores > 0.05), por lo que no explican el desempleo dentro de esta muestra específica.

D realice graficos de las variables explicativas con la probabilidad estimada de estar desempleado

El gráfico presenta la relación entre la edad de los individuos y la probabilidad predicha de desempleo según el modelo Probit estimado. La línea roja, que representa el ajuste suavizado (Loess), permite observar la tendencia del comportamiento de la probabilidad a lo largo del ciclo de vida. Se destaca que la probabilidad de desempleo tiende a aumentar conforme avanza la edad hasta alcanzar un punto máximo, aproximadamente alrededor de los 50-60 años, después del cual se observa un estancamiento o ligero descenso. Asimismo, la dispersión de los puntos azules en torno a la línea de tendencia evidencia una variabilidad significativa en los datos, lo cual es consistente con el resultado de significancia estadística obtenido anteriormente, donde la variable edad no mostró un efecto determinante por sí sola, pero sí ilustra el comportamiento no lineal que el modelo captura.”

E Los efectos marginales obtenidos mediante el método probitmfx permiten cuantificar el impacto de las variables explicativas sobre la probabilidad de estar desempleado:

Ingreso del hogar: Un aumento marginal en el logaritmo del ingreso del hogar incrementa en 0.1019 (10.19 puntos porcentuales) la probabilidad de reportarse como desempleado. Este resultado respalda la hipótesis de que mayores ingresos familiares financian un proceso de búsqueda laboral más extenso y selectivo. Educación: Un año adicional de educación aumenta en 0.0174 (1.74 puntos porcentuales) la probabilidad de estar desempleado. Este efecto, aunque menor en magnitud, resulta estadísticamente significativo dentro de la muestra analizada.

F A la luz de los resultados econométricos en el departamento, que tipo de recomendación les daría a los ejecutores de políticas respecto a combatir el desempleo (con evidencia econométrica)

fortalecimiento de la intermediación laboral:

Debido a que el ingreso del hogar permite a los individuos prolongar su búsqueda, se recomienda optimizar la eficiencia de las agencias de empleo. El objetivo es reducir las fricciones en el mercado laboral y acortar los tiempos de búsqueda, evitando que los individuos permanezcan desempleados por periodos prolongados mientras esperan ofertas óptimas. Mejora en la calidad del empleo: Dado que la educación es una variable determinante, las políticas deben orientarse hacia la creación de puestos de trabajo que correspondan con los perfiles educativos de la población. Esto evitaría que el capital humano permanezca inactivo o subempleado mientras busca una oportunidad que valore su formación académica.