El ausentismo laboral puede afectar la continuidad de las operaciones, la productividad y la organización del trabajo. El propósito de este informe es describir algunos patrones presentes en la base de datos seleccionada en la Actividad 112, relacionada con incapacidades laborales del Grupo Éxito. Para cumplir con la Actividad 122 se analizan dos variables cualitativas —naturaleza de la incapacidad y zona regional— y dos variables cuantitativas —días reales de incapacidad y edad—.
El análisis es descriptivo. Por esta razón, los resultados permiten resumir y comparar los registros incluidos en la base, pero no establecer relaciones de causa y efecto.
El archivo completo contiene 79.031 registros y 24 variables. Como la pregunta de investigación está delimitada al año 2021, se filtraron 47.466 registros, comprendidos entre 01/01/2021 y 31/12/2021. Cada fila representa un registro de incapacidad y no necesariamente una persona diferente, porque un trabajador puede aparecer más de una vez.
calidad <- data.frame(
Indicador = c(
"Registros del archivo completo",
"Registros analizados del año 2021",
"Número de variables",
"Personas diferentes en 2021",
"Datos faltantes en las cuatro variables analizadas"
),
Resultado = c(
format(nrow(datos_completos), big.mark = "."),
format(nrow(datos), big.mark = "."),
ncol(datos_completos),
format(n_distinct(datos$Nombre), big.mark = "."),
sum(is.na(datos$`Incapacidad NATURALEZA`)) +
sum(is.na(datos$`Zona Regionales`)) +
sum(is.na(datos$`Dias reales`)) +
sum(is.na(datos$Edad))
)
)
kable(calidad, align = c("l", "r"))
| Indicador | Resultado |
|---|---|
| Registros del archivo completo | 79.031 |
| Registros analizados del año 2021 | 47.466 |
| Número de variables | 24 |
| Personas diferentes en 2021 | 16.242 |
| Datos faltantes en las cuatro variables analizadas | 0 |
Las cuatro variables seleccionadas no presentan datos faltantes en los registros del año 2021.
Para el análisis se escogieron variables relacionadas con el tipo de incapacidad, la ubicación del registro, su duración y la edad de la persona. Su clasificación es la siguiente:
variables_seleccionadas <- data.frame(
Variable = c("Incapacidad NATURALEZA", "Zona Regionales", "Dias reales", "Edad"),
Tipo = c("Cualitativa nominal", "Cualitativa nominal",
"Cuantitativa discreta", "Cuantitativa discreta"),
Descripción = c(
"Origen o naturaleza de la incapacidad",
"Zona regional donde se registra la incapacidad",
"Duración de la incapacidad en días",
"Edad en años"
)
)
kable(variables_seleccionadas, align = c("l", "l", "l"))
| Variable | Tipo | Descripción |
|---|---|---|
| Incapacidad NATURALEZA | Cualitativa nominal | Origen o naturaleza de la incapacidad |
| Zona Regionales | Cualitativa nominal | Zona regional donde se registra la incapacidad |
| Dias reales | Cuantitativa discreta | Duración de la incapacidad en días |
| Edad | Cuantitativa discreta | Edad en años |
Para proteger la información personal de los trabajadores, la vista previa presenta solamente las cuatro variables utilizadas y no incluye nombres, entidades de seguridad social ni lugares específicos de trabajo.
datatable(
head(
datos %>%
select(`Incapacidad NATURALEZA`, `Zona Regionales`, `Dias reales`, Edad),
8
),
options = list(pageLength = 8, scrollX = TRUE),
rownames = FALSE,
caption = "Primeros ocho registros de la base"
)
frecuencia_naturaleza <- tabla_frecuencia(datos$`Incapacidad NATURALEZA`)
kable(frecuencia_naturaleza, align = c("l", "r", "r"))
| Categoría | Frecuencia | Porcentaje | |
|---|---|---|---|
| 1 | Incap. enf. común | 41929 | 88.33 |
| 5 | Licencia de maternidad | 3196 | 6.73 |
| 2 | Incapacidad accidente de trabajo | 1664 | 3.51 |
| 4 | Ley Maria | 349 | 0.74 |
| 3 | Incapacidad por enfermedad profesiona | 328 | 0.69 |
La categoría modal es Incap. enf. común, con 41929 registros, equivalentes al 88.33 %. Esto muestra que la mayor parte de las ausencias registradas corresponde a enfermedad común. Las licencias de maternidad ocupan el segundo lugar, mientras que los accidentes de trabajo y las demás categorías tienen una participación menor.
ggplot(frecuencia_naturaleza,
aes(x = reorder(Categoría, Frecuencia), y = Frecuencia)) +
geom_col(fill = "#2C7FB8") +
coord_flip() +
scale_y_continuous(labels = scales::label_number(big.mark = ".")) +
labs(
title = "Registros según naturaleza de la incapacidad",
x = NULL,
y = "Frecuencia"
) +
theme_minimal()
frecuencia_zona <- tabla_frecuencia(datos$`Zona Regionales`)
kable(frecuencia_zona, align = c("l", "r", "r"))
| Categoría | Frecuencia | Porcentaje | |
|---|---|---|---|
| 1 | Antioquia | 24826 | 52.30 |
| 5 | Cundinamarca | 8454 | 17.81 |
| 7 | Occidente | 5122 | 10.79 |
| 4 | Costa | 5090 | 10.72 |
| 2 | Bogota | 2426 | 5.11 |
| 3 | Cali | 1232 | 2.60 |
| 6 | Llano | 276 | 0.58 |
| 8 | Santanderes | 40 | 0.08 |
La zona modal es Antioquia, con 24826 registros, que representan el 52.3 %. Cundinamarca ocupa el segundo lugar con 17.81 %. Por tanto, los resultados generales de la base están fuertemente influenciados por los registros de Antioquia y Cundinamarca. Estas frecuencias no deben interpretarse automáticamente como tasas de ausentismo, porque no se dispone del número total de trabajadores expuestos en cada zona.
ggplot(frecuencia_zona,
aes(x = reorder(Categoría, Frecuencia), y = Frecuencia)) +
geom_col(fill = "#41AB5D") +
coord_flip() +
scale_y_continuous(labels = scales::label_number(big.mark = ".")) +
labs(
title = "Registros de incapacidad según zona regional",
x = NULL,
y = "Frecuencia"
) +
theme_minimal()
resumen <- bind_rows(
resumen_numerico(datos$`Dias reales`, "Días reales de incapacidad"),
resumen_numerico(datos$Edad, "Edad")
)
columnas_numericas <- setdiff(names(resumen), c("Variable", "N", "Moda"))
resumen[columnas_numericas] <- lapply(resumen[columnas_numericas], round, 2)
kable(resumen, align = c("l", rep("r", ncol(resumen) - 1)))
| Variable | N | Media | Mediana | Moda | Mínimo | Q1 | Q3 | Máximo | Rango | RIC | Varianza | Desviación | CV_porcentaje |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Días reales de incapacidad | 47466 | 14.08 | 3 | 2 | 1 | 2 | 7 | 180 | 179 | 5 | 1045.53 | 32.33 | 229.61 |
| Edad | 47466 | 34.70 | 33 | 29 | 18 | 26 | 43 | 64 | 46 | 17 | 107.38 | 10.36 | 29.86 |
Los días reales de incapacidad presentan una media de 14.08 días, una mediana de 3 días y una moda de 2 días. La media es bastante mayor que la mediana debido a la existencia de incapacidades prolongadas. El 50 % central de los registros se encuentra entre 2 y 7 días, mientras que el máximo alcanza 180 días.
La desviación estándar es de 32.33 días y el coeficiente de variación alcanza 229.61 %, lo cual confirma una dispersión considerable. En esta variable, la mediana y el rango intercuartílico describen mejor el comportamiento típico que la media y la desviación estándar, pues son menos sensibles a los valores extremos.
ggplot(datos, aes(x = `Dias reales`)) +
geom_histogram(binwidth = 5, boundary = 0, fill = "#756BB1", color = "white") +
labs(
title = "Distribución de los días reales de incapacidad",
x = "Días reales",
y = "Frecuencia"
) +
theme_minimal()
El histograma presenta una cola larga hacia la derecha: existen muchos registros de corta duración y una cantidad menor de incapacidades prolongadas.
La edad promedio es 34.7 años, la mediana es 33 años y la moda es 29 años. El 50 % central de los registros corresponde a edades entre 26 y 43 años. La cercanía entre la media y la mediana indica una distribución más equilibrada que la observada en los días de incapacidad.
La edad mínima es de 18 años y la máxima de 64 años. La desviación estándar es de 10.36 años y el coeficiente de variación es de 29.86 %. En el subconjunto correspondiente a 2021 no se encontraron edades inferiores a 18 años.
ggplot(datos, aes(x = Edad)) +
geom_histogram(binwidth = 2, boundary = 0, fill = "#E6550D", color = "white") +
labs(
title = "Distribución de la edad en los registros de incapacidad",
x = "Edad (años)",
y = "Frecuencia"
) +
theme_minimal()
El histograma muestra una concentración mayor en edades adultas jóvenes y una disminución gradual en las edades más altas. Esta distribución es mucho menos asimétrica que la de los días reales de incapacidad.
En conclusión, las tablas de frecuencia y los indicadores estadísticos permitieron resumir el comportamiento de las variables seleccionadas. Los resultados describen los registros disponibles, pero no permiten explicar las causas del ausentismo ni comparar tasas entre zonas sin información adicional sobre el número de trabajadores.