Introducción

El ausentismo laboral puede afectar la continuidad de las operaciones, la productividad y la organización del trabajo. El propósito de este informe es describir algunos patrones presentes en la base de datos seleccionada en la Actividad 112, relacionada con incapacidades laborales del Grupo Éxito. Para cumplir con la Actividad 122 se analizan dos variables cualitativas —naturaleza de la incapacidad y zona regional— y dos variables cuantitativas —días reales de incapacidad y edad—.

El análisis es descriptivo. Por esta razón, los resultados permiten resumir y comparar los registros incluidos en la base, pero no establecer relaciones de causa y efecto.

Descripción y revisión de la base

El archivo completo contiene 79.031 registros y 24 variables. Como la pregunta de investigación está delimitada al año 2021, se filtraron 47.466 registros, comprendidos entre 01/01/2021 y 31/12/2021. Cada fila representa un registro de incapacidad y no necesariamente una persona diferente, porque un trabajador puede aparecer más de una vez.

calidad <- data.frame(
  Indicador = c(
    "Registros del archivo completo",
    "Registros analizados del año 2021",
    "Número de variables",
    "Personas diferentes en 2021",
    "Datos faltantes en las cuatro variables analizadas"
  ),
  Resultado = c(
    format(nrow(datos_completos), big.mark = "."),
    format(nrow(datos), big.mark = "."),
    ncol(datos_completos),
    format(n_distinct(datos$Nombre), big.mark = "."),
    sum(is.na(datos$`Incapacidad NATURALEZA`)) +
      sum(is.na(datos$`Zona Regionales`)) +
      sum(is.na(datos$`Dias reales`)) +
      sum(is.na(datos$Edad))
  )
)

kable(calidad, align = c("l", "r"))
Indicador Resultado
Registros del archivo completo 79.031
Registros analizados del año 2021 47.466
Número de variables 24
Personas diferentes en 2021 16.242
Datos faltantes en las cuatro variables analizadas 0

Las cuatro variables seleccionadas no presentan datos faltantes en los registros del año 2021.

Variables seleccionadas

Para el análisis se escogieron variables relacionadas con el tipo de incapacidad, la ubicación del registro, su duración y la edad de la persona. Su clasificación es la siguiente:

variables_seleccionadas <- data.frame(
  Variable = c("Incapacidad NATURALEZA", "Zona Regionales", "Dias reales", "Edad"),
  Tipo = c("Cualitativa nominal", "Cualitativa nominal",
           "Cuantitativa discreta", "Cuantitativa discreta"),
  Descripción = c(
    "Origen o naturaleza de la incapacidad",
    "Zona regional donde se registra la incapacidad",
    "Duración de la incapacidad en días",
    "Edad en años"
  )
)
kable(variables_seleccionadas, align = c("l", "l", "l"))
Variable Tipo Descripción
Incapacidad NATURALEZA Cualitativa nominal Origen o naturaleza de la incapacidad
Zona Regionales Cualitativa nominal Zona regional donde se registra la incapacidad
Dias reales Cuantitativa discreta Duración de la incapacidad en días
Edad Cuantitativa discreta Edad en años

Para proteger la información personal de los trabajadores, la vista previa presenta solamente las cuatro variables utilizadas y no incluye nombres, entidades de seguridad social ni lugares específicos de trabajo.

datatable(
  head(
    datos %>%
      select(`Incapacidad NATURALEZA`, `Zona Regionales`, `Dias reales`, Edad),
    8
  ),
  options = list(pageLength = 8, scrollX = TRUE),
  rownames = FALSE,
  caption = "Primeros ocho registros de la base"
)

Variables cualitativas

Naturaleza de la incapacidad

frecuencia_naturaleza <- tabla_frecuencia(datos$`Incapacidad NATURALEZA`)
kable(frecuencia_naturaleza, align = c("l", "r", "r"))
Categoría Frecuencia Porcentaje
1 Incap. enf. común 41929 88.33
5 Licencia de maternidad 3196 6.73
2 Incapacidad accidente de trabajo 1664 3.51
4 Ley Maria 349 0.74
3 Incapacidad por enfermedad profesiona 328 0.69

La categoría modal es Incap. enf. común, con 41929 registros, equivalentes al 88.33 %. Esto muestra que la mayor parte de las ausencias registradas corresponde a enfermedad común. Las licencias de maternidad ocupan el segundo lugar, mientras que los accidentes de trabajo y las demás categorías tienen una participación menor.

ggplot(frecuencia_naturaleza,
       aes(x = reorder(Categoría, Frecuencia), y = Frecuencia)) +
  geom_col(fill = "#2C7FB8") +
  coord_flip() +
  scale_y_continuous(labels = scales::label_number(big.mark = ".")) +
  labs(
    title = "Registros según naturaleza de la incapacidad",
    x = NULL,
    y = "Frecuencia"
  ) +
  theme_minimal()

Zona regional

frecuencia_zona <- tabla_frecuencia(datos$`Zona Regionales`)
kable(frecuencia_zona, align = c("l", "r", "r"))
Categoría Frecuencia Porcentaje
1 Antioquia 24826 52.30
5 Cundinamarca 8454 17.81
7 Occidente 5122 10.79
4 Costa 5090 10.72
2 Bogota 2426 5.11
3 Cali 1232 2.60
6 Llano 276 0.58
8 Santanderes 40 0.08

La zona modal es Antioquia, con 24826 registros, que representan el 52.3 %. Cundinamarca ocupa el segundo lugar con 17.81 %. Por tanto, los resultados generales de la base están fuertemente influenciados por los registros de Antioquia y Cundinamarca. Estas frecuencias no deben interpretarse automáticamente como tasas de ausentismo, porque no se dispone del número total de trabajadores expuestos en cada zona.

ggplot(frecuencia_zona,
       aes(x = reorder(Categoría, Frecuencia), y = Frecuencia)) +
  geom_col(fill = "#41AB5D") +
  coord_flip() +
  scale_y_continuous(labels = scales::label_number(big.mark = ".")) +
  labs(
    title = "Registros de incapacidad según zona regional",
    x = NULL,
    y = "Frecuencia"
  ) +
  theme_minimal()

Variables cuantitativas

resumen <- bind_rows(
  resumen_numerico(datos$`Dias reales`, "Días reales de incapacidad"),
  resumen_numerico(datos$Edad, "Edad")
)

columnas_numericas <- setdiff(names(resumen), c("Variable", "N", "Moda"))
resumen[columnas_numericas] <- lapply(resumen[columnas_numericas], round, 2)
kable(resumen, align = c("l", rep("r", ncol(resumen) - 1)))
Variable N Media Mediana Moda Mínimo Q1 Q3 Máximo Rango RIC Varianza Desviación CV_porcentaje
Días reales de incapacidad 47466 14.08 3 2 1 2 7 180 179 5 1045.53 32.33 229.61
Edad 47466 34.70 33 29 18 26 43 64 46 17 107.38 10.36 29.86

Días reales de incapacidad

Los días reales de incapacidad presentan una media de 14.08 días, una mediana de 3 días y una moda de 2 días. La media es bastante mayor que la mediana debido a la existencia de incapacidades prolongadas. El 50 % central de los registros se encuentra entre 2 y 7 días, mientras que el máximo alcanza 180 días.

La desviación estándar es de 32.33 días y el coeficiente de variación alcanza 229.61 %, lo cual confirma una dispersión considerable. En esta variable, la mediana y el rango intercuartílico describen mejor el comportamiento típico que la media y la desviación estándar, pues son menos sensibles a los valores extremos.

ggplot(datos, aes(x = `Dias reales`)) +
  geom_histogram(binwidth = 5, boundary = 0, fill = "#756BB1", color = "white") +
  labs(
    title = "Distribución de los días reales de incapacidad",
    x = "Días reales",
    y = "Frecuencia"
  ) +
  theme_minimal()

El histograma presenta una cola larga hacia la derecha: existen muchos registros de corta duración y una cantidad menor de incapacidades prolongadas.

Edad

La edad promedio es 34.7 años, la mediana es 33 años y la moda es 29 años. El 50 % central de los registros corresponde a edades entre 26 y 43 años. La cercanía entre la media y la mediana indica una distribución más equilibrada que la observada en los días de incapacidad.

La edad mínima es de 18 años y la máxima de 64 años. La desviación estándar es de 10.36 años y el coeficiente de variación es de 29.86 %. En el subconjunto correspondiente a 2021 no se encontraron edades inferiores a 18 años.

ggplot(datos, aes(x = Edad)) +
  geom_histogram(binwidth = 2, boundary = 0, fill = "#E6550D", color = "white") +
  labs(
    title = "Distribución de la edad en los registros de incapacidad",
    x = "Edad (años)",
    y = "Frecuencia"
  ) +
  theme_minimal()

El histograma muestra una concentración mayor en edades adultas jóvenes y una disminución gradual en las edades más altas. Esta distribución es mucho menos asimétrica que la de los días reales de incapacidad.

Principales hallazgos y conclusiones

  1. La enfermedad común concentra la mayoría de los registros de incapacidad (88.33 %), por lo que es la categoría que más influye en los resultados generales de la base.
  2. Antioquia y Cundinamarca reúnen la mayor parte de los registros. No obstante, sin conocer la cantidad total de trabajadores por zona no es posible afirmar que estas regiones tengan una tasa de ausentismo más alta.
  3. La duración típica de una incapacidad es corta: la mediana es de 3 días y la moda de 2 días. La media aumenta hasta 14.08 días por la presencia de incapacidades largas.
  4. La edad de los registros se concentra principalmente entre 26 y 43 años, con una mediana de 33 años.
  5. Las cuatro variables seleccionadas están completas para 2021, lo cual permite calcular sus tablas e indicadores sin eliminar observaciones por datos faltantes.

En conclusión, las tablas de frecuencia y los indicadores estadísticos permitieron resumir el comportamiento de las variables seleccionadas. Los resultados describen los registros disponibles, pero no permiten explicar las causas del ausentismo ni comparar tasas entre zonas sin información adicional sobre el número de trabajadores.