1 Introducción

La rotación de empleados representa un problema relevante para la gestión del talento humano porque puede generar pérdida de conocimiento organizacional, costos de reemplazo, disminución de productividad y afectaciones en la continuidad de los equipos de trabajo. En esta actividad se utiliza la base rotacion para estudiar factores asociados con la probabilidad de que un empleado cambie de cargo.

El análisis se desarrolla mediante regresión logística binaria, donde la variable respuesta se codifica como \(Y=1\) cuando existe rotación y \(Y=0\) cuando no existe rotación. El objetivo no es solamente identificar asociaciones estadísticas, sino construir una herramienta predictiva que permita priorizar acciones preventivas de retención.

La base contiene 1470 empleados y 24 variables. Para el modelo se seleccionaron seis covariables: tres categóricas y tres cuantitativas.

2 1. Selección de variables e hipótesis

Se seleccionaron variables con una interpretación razonable desde la gestión del talento humano y con capacidad potencial para representar carga de trabajo, movilidad, compensación y estabilidad laboral.

Variables seleccionadas e hipótesis de trabajo
Tipo Variable Relacion_esperada Justificacion
Categórica Horas extra Positiva para Sí frente a No La sobrecarga y la reducción del equilibrio vida-trabajo pueden aumentar la intención de cambiar de cargo.
Categórica Estado civil Mayor en Soltero frente a Casado Se plantea que las personas solteras podrían presentar mayor movilidad laboral; es una hipótesis analítica y no un criterio de intervención.
Categórica Viaje de negocios Mayor en Frecuentemente frente a Raramente Los viajes frecuentes pueden generar desgaste, presión operativa y menor tiempo personal.
Cuantitativa Edad Negativa La mayor edad suele asociarse con mayor estabilidad laboral y menor movilidad.
Cuantitativa Ingreso mensual Negativa Una compensación mayor puede reducir los incentivos económicos para buscar alternativas.
Cuantitativa Antigüedad en el cargo Negativa Una mayor permanencia en el cargo puede reflejar estabilidad, experiencia y adaptación al rol.

Las hipótesis planteadas son direccionales. En particular, se espera que las horas extra y los viajes frecuentes se relacionen positivamente con la rotación, mientras que la edad, el ingreso mensual y la antigüedad en el cargo presenten una relación negativa. El estado civil se incluye como una variable de caracterización; cualquier asociación encontrada debe interpretarse con cautela y no utilizarse para decisiones discriminatorias.

3 2. Análisis univariado

3.1 2.1 Caracterización general

La siguiente tabla resume el tipo de información disponible en la base.

Estructura general de la base de datos
Variable Clase Faltantes
rotacion rotacion factor 0
edad edad numeric 0
viaje_negocios viaje_negocios factor 0
departamento departamento character 0
distancia_casa distancia_casa numeric 0
educacion educacion numeric 0
campo_educacion campo_educacion character 0
satisfaccion_ambiental satisfaccion_ambiental numeric 0
genero genero character 0
cargo cargo character 0
satisfaccion_laboral satisfaccion_laboral numeric 0
estado_civil estado_civil factor 0
ingreso_mensual ingreso_mensual numeric 0
trabajos_anteriores trabajos_anteriores numeric 0
horas_extra horas_extra factor 0
porcentaje_aumento_salarial porcentaje_aumento_salarial numeric 0
rendimiento_laboral rendimiento_laboral numeric 0
anios_experiencia anios_experiencia numeric 0
capacitaciones capacitaciones numeric 0
equilibrio_trabajo_vida equilibrio_trabajo_vida numeric 0
antiguedad antiguedad numeric 0
antiguedad_cargo antiguedad_cargo numeric 0
anios_ultima_promocion anios_ultima_promocion numeric 0
anios_mismo_jefe anios_mismo_jefe numeric 0
rotacion_num rotacion_num integer 0
ingreso_miles ingreso_miles numeric 0

3.2 2.2 Variable respuesta: rotación

Distribución de la variable rotación
rotacion Frecuencia Porcentaje
No 1233 83.88
Si 237 16.12

La proporción observada de empleados con rotación es de 16.12 %. Por tanto, la clase positiva es menos frecuente que la clase sin rotación. Esta característica es importante porque una evaluación basada solamente en exactitud podría resultar engañosa; por esta razón se utiliza la curva ROC y el AUC.

3.3 2.3 Variables categóricas seleccionadas

3.3.1 horas_extra

horas_extra Frecuencia Porcentaje
No 1054 71.7
Si 416 28.3

3.3.2 estado_civil

estado_civil Frecuencia Porcentaje
Casado 673 45.78
Divorciado 327 22.24
Soltero 470 31.97

3.3.3 viaje_negocios

viaje_negocios Frecuencia Porcentaje
Raramente 1043 70.95
Frecuentemente 277 18.84
No_Viaja 150 10.20

3.4 2.4 Variables cuantitativas seleccionadas

Resumen descriptivo de variables cuantitativas
Variable N Media Desv_Estandar Minimo Q1 Mediana Q3 Maximo
Edad 1470 36.92 9.14 18 30 36 43 60
Ingreso mensual 1470 6502.93 4707.96 1009 2911 4919 8379 19999
Antigüedad en el cargo 1470 4.23 3.62 0 2 3 7 18

4 3. Análisis bivariado

Para cada variable seleccionada se ajustó inicialmente una regresión logística simple, utilizando rotacion_num como respuesta. Un coeficiente positivo indica aumento de los log-odds de rotación; equivalentemente, un odds ratio mayor que 1 indica mayores posibilidades relativas de rotación. Un coeficiente negativo produce un odds ratio menor que 1.

4.1 3.1 Asociación gráfica

4.2 3.2 Regresiones logísticas bivariadas

Significancia global de los modelos bivariados
Variable P_global Significativa_5pct
horas_extra 0e+00 Sí
estado_civil 0e+00 Sí
viaje_negocios 1e-05 Sí
edad 0e+00 Sí
ingreso_miles 0e+00 Sí
antiguedad_cargo 0e+00 Sí
Coeficientes y odds ratios de los modelos bivariados
Variable term estimate std.error p.value Odds_Ratio OR_LI_95 OR_LS_95 Direccion Significativo_5pct
horas_extra horas_extraSi 1.3274 0.1466 0.0000 3.7712 2.8296 5.0263 Aumenta Sí
estado_civil estado_civilDivorciado -0.2395 0.2175 0.2709 0.7871 0.5139 1.2054 Disminuye No
estado_civil estado_civilSoltero 0.8772 0.1575 0.0000 2.4041 1.7657 3.2733 Aumenta Sí
viaje_negocios viaje_negociosFrecuentemente 0.6346 0.1638 0.0001 1.8862 1.3682 2.6004 Aumenta Sí
viaje_negocios viaje_negociosNo_Viaja -0.7044 0.3132 0.0245 0.4944 0.2676 0.9136 Disminuye Sí
edad edad -0.0523 0.0087 0.0000 0.9491 0.9330 0.9654 Disminuye Sí
ingreso_miles ingreso_miles -0.1271 0.0216 0.0000 0.8806 0.8441 0.9188 Disminuye Sí
antiguedad_cargo antiguedad_cargo -0.1463 0.0242 0.0000 0.8639 0.8238 0.9060 Disminuye Sí

Las variables con evidencia global de asociación al 5 % son: horas_extra, estado_civil, viaje_negocios, edad, ingreso_miles, antiguedad_cargo.

Para las variables cuantitativas, el signo permite contrastar directamente la hipótesis: un signo negativo para edad, ingreso o antigüedad en el cargo es coherente con lo planteado inicialmente. Para las variables categóricas, cada coeficiente se interpreta frente a la categoría de referencia.

5 4. Estimación del modelo de regresión logística

Para evitar evaluar el modelo con los mismos registros utilizados durante el ajuste, la base se dividió de manera estratificada en aproximadamente 70 % para entrenamiento y 30 % para prueba.

Partición estratificada de los datos
Conjunto N Porcentaje_rotacion
Entrenamiento 1028 16.05
Prueba 442 16.29

El modelo estimado es:

\[ \operatorname{logit}(p)= \beta_0+ \beta_1(\text{Horas extra})+ \beta_2(\text{Estado civil})+ \beta_3(\text{Viaje})+ \beta_4(\text{Edad})+ \beta_5(\text{Ingreso})+ \beta_6(\text{Antigüedad cargo}) \]

donde \(p\) es la probabilidad de rotación.

Modelo logístico múltiple: coeficientes y odds ratios
term estimate std.error p.value Odds_Ratio OR_LI_95 OR_LS_95 Significativo_5pct
(Intercept) -1.0529 0.4125 0.0107 0.3489 0.1554 0.7832 Sí
horas_extraSi 1.4368 0.1878 0.0000 4.2073 2.9120 6.0788 Sí
estado_civilDivorciado -0.2080 0.2705 0.4420 0.8122 0.4780 1.3801 No
estado_civilSoltero 0.8739 0.2042 0.0000 2.3963 1.6058 3.5760 Sí
viaje_negociosFrecuentemente 0.4646 0.2153 0.0309 1.5914 1.0436 2.4266 Sí
viaje_negociosNo_Viaja -0.8340 0.4012 0.0376 0.4343 0.1978 0.9534 Sí
edad -0.0222 0.0118 0.0605 0.9780 0.9556 1.0010 No
ingreso_miles -0.0535 0.0289 0.0643 0.9479 0.8956 1.0032 No
antiguedad_cargo -0.1040 0.0323 0.0013 0.9013 0.8460 0.9601 Sí

La interpretación mediante odds ratios es preferible a interpretar solamente los coeficientes logísticos. Un OR mayor que 1 representa un incremento en las posibilidades relativas de rotación; un OR menor que 1 representa una reducción, manteniendo constantes las demás variables.

Para ingreso_miles, una unidad representa 1.000 unidades monetarias de ingreso mensual. Por tanto, su odds ratio debe interpretarse por cada incremento de 1.000 unidades monetarias, no por una sola unidad.

5.1 4.1 Significancia global de los predictores

Pruebas de significancia global del modelo múltiple
Variable Df Deviance AIC P_global
horas_extra 1 826.3720 842.3720 0.0000
estado_civil 2 792.5686 806.5686 0.0000
viaje_negocios 2 778.5202 792.5202 0.0033
edad 1 770.7181 786.7181 0.0564
ingreso_miles 1 770.6877 786.6877 0.0574
antiguedad_cargo 1 778.1691 794.1691 0.0009

Los predictores con evidencia global de asociación en el modelo múltiple son: horas_extra, estado_civil, viaje_negocios, antiguedad_cargo.

6 5. Evaluación: curva ROC y AUC

La curva ROC evalúa la capacidad del modelo para ordenar correctamente a empleados con y sin rotación a lo largo de distintos puntos de corte. El AUC resume esta capacidad discriminante.

El AUC obtenido en entrenamiento es 0.768, mientras que en prueba es 0.792. El intervalo de confianza del 95 % para el AUC de prueba es aproximadamente [0.734, 0.851].

Con la regla descriptiva utilizada en este informe, el modelo presenta una capacidad de discriminación aceptable. El AUC de prueba es el indicador principal, dado que corresponde a observaciones que no fueron utilizadas para estimar los coeficientes.

6.1 5.1 Punto de corte y métricas de clasificación

El punto de corte se seleccionó mediante el índice de Youden utilizando únicamente el conjunto de entrenamiento. De esta forma se evita utilizar la información del conjunto de prueba para elegir el umbral.

Métricas predictivas en el conjunto de prueba
AUC Corte Sensibilidad Especificidad Precision Exactitud F1
0.7925 0.2319 0.6111 0.8216 0.4 0.7873 0.4835
Matriz de confusión en el conjunto de prueba
No Si
No 304 66
Si 28 44

El punto de corte seleccionado fue 0.232. En un contexto de retención, puede ser razonable priorizar sensibilidad si el costo de no identificar a un empleado con riesgo real de rotación es elevado.

7 6. Predicción de un empleado hipotético

Se construyó un perfil hipotético con características que permiten ilustrar el uso operativo del modelo.

Predicción para un empleado hipotético
Horas_extra Estado_civil Viaje_negocios Edad Ingreso_mensual Antiguedad_cargo Probabilidad_rotacion Corte Decision
Si Soltero Frecuentemente 30 3500 1 0.6825 0.2319 Intervenir preventivamente

La probabilidad estimada de rotación para este perfil es de 68.25 %. Como el punto de corte es 23.19 %, la recomendación automática del modelo es: Intervenir preventivamente.

Si el empleado supera el umbral, la intervención no debe entenderse como una sanción ni como una decisión automática. Debe activar una conversación preventiva y confidencial sobre carga de trabajo, desarrollo profesional, compensación, viajes y condiciones del cargo.

8 7. Conclusiones y estrategia de retención

El análisis permite identificar patrones asociados con la rotación y traducirlos en acciones de gestión. Las asociaciones bivariadas sirven para comprender cada variable por separado, mientras que el modelo múltiple permite evaluar su efecto manteniendo constantes las demás covariables.

Horas extra. La organización debería revisar la distribución de carga, turnos, dotación de personal, descansos compensatorios y reconocimiento del trabajo adicional.

Viajes de negocios. Conviene evaluar la frecuencia de desplazamientos, opciones híbridas, recuperación posterior al viaje y planificación anticipada.

Antigüedad en el cargo. Deben fortalecerse las rutas de carrera, movilidad interna, capacitación y oportunidades de promoción para evitar estancamiento.

Estado civil. Aunque pueda presentar asociación estadística, no debe utilizarse como criterio directo de intervención. La acción debe centrarse en condiciones laborales modificables y ofrecerse de forma equitativa.

La estrategia general de retención debería priorizar factores accionables. El modelo puede utilizarse como una herramienta de alerta temprana, pero no sustituye la conversación con el empleado ni demuestra causalidad. Las decisiones finales deben combinar evidencia cuantitativa, conocimiento del contexto organizacional y criterios de equidad.

También es recomendable monitorear periódicamente el desempeño del modelo, porque las relaciones observadas en datos históricos pueden cambiar con modificaciones en salarios, políticas de trabajo, liderazgo o condiciones económicas.

9 Consideraciones metodológicas y éticas

  1. La regresión logística estima asociaciones y probabilidades; no demuestra causalidad.
  2. El AUC se evaluó en un conjunto de prueba separado para reducir optimismo en la medición del desempeño.
  3. El punto de corte se seleccionó en entrenamiento para evitar fuga de información.
  4. Edad y estado civil son variables sensibles desde el punto de vista de gestión. Aunque pueden ser útiles para diagnosticar patrones agregados, no deben convertirse en reglas discriminatorias de decisión.
  5. Antes de implementar el modelo en producción, se recomienda realizar validación temporal, análisis de calibración y evaluación de equidad entre grupos.

10 Referencias

  • Centro Magis. Actividad 3: Problema de rotación de cargo. Curso Modelos Estadísticos para la Toma de Decisiones.
  • Base de datos rotacion, paquete paqueteMODELOS.
  • Robin, X. et al. (2011). pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics, 12, 77.

11 Anexo: reproducibilidad

## R version 4.5.2 (2025-10-31 ucrt)
## Platform: x86_64-w64-mingw32/x64
## Running under: Windows 11 x64 (build 26200)
## 
## Matrix products: default
##   LAPACK version 3.12.1
## 
## locale:
## [1] LC_COLLATE=Spanish_Colombia.utf8  LC_CTYPE=Spanish_Colombia.utf8   
## [3] LC_MONETARY=Spanish_Colombia.utf8 LC_NUMERIC=C                     
## [5] LC_TIME=Spanish_Colombia.utf8    
## 
## time zone: America/Bogota
## tzcode source: internal
## 
## attached base packages:
## [1] stats     graphics  grDevices utils     datasets  methods   base     
## 
## other attached packages:
## [1] scales_1.4.0  knitr_1.52    pROC_1.19.1   broom_1.0.12  ggplot2_4.0.3
## [6] tidyr_1.3.2   dplyr_1.2.1  
## 
## loaded via a namespace (and not attached):
##  [1] gtable_0.3.6         jsonlite_2.0.0       compiler_4.5.2      
##  [4] Rcpp_1.1.1           tidyselect_1.2.1     jquerylib_0.1.4     
##  [7] yaml_2.3.12          fastmap_1.2.0        R6_2.6.1            
## [10] labeling_0.4.3       generics_0.1.4       backports_1.5.0     
## [13] tibble_3.3.1         bslib_0.10.0         pillar_1.11.1       
## [16] RColorBrewer_1.1-3   paqueteMODELOS_0.1.0 rlang_1.3.0         
## [19] cachem_1.1.0         xfun_0.56            sass_0.4.10         
## [22] S7_0.2.1             otel_0.2.0           cli_3.6.5           
## [25] withr_3.0.2          magrittr_2.0.4       digest_0.6.39       
## [28] grid_4.5.2           rstudioapi_0.18.0    lifecycle_1.0.5     
## [31] vctrs_0.7.1          evaluate_1.0.5       glue_1.8.0          
## [34] farver_2.1.2         rmarkdown_2.32       purrr_1.2.1         
## [37] tools_4.5.2          pkgconfig_2.0.3      htmltools_0.5.9