Entender la evolución del coeficiente de desigualdad humana a lo largo del tiempo es fundamental por múltiples razones que afectan tanto a nivel macro como microeconómico. La desigualdad humana, que abarca la salud, educación e ingresos, es un indicador clave del bienestar general y del progreso de una sociedad. Al examinar cómo ha cambiado este coeficiente, obtenemos una imagen más clara de los desafíos y avances de las naciones, lo que es esencial para diseñar políticas que promuevan el desarrollo equitativo y el crecimiento inclusivo.
datos <- read.csv("Datos/Coefficient_of_human_inequality_2010-2019.csv", sep = ";")
El dataset recopila diferentes variables relacionadas con el índice
de desigualdad humana en el mundo. Tiene las siguientes variables:
HDI.Rank: Clasificación del Índice
de Desarrollo Humano, con valores que varían desde 8 (muy alto
desarrollo humano) hasta 189 (más bajo en el conjunto dado). El IDH es
un resumen compuesto de estadísticas de esperanza de vida, educación e
ingresos per cápita que se utilizan para clasificar los países en cuatro
niveles de desarrollo humano.
Country: Los nombres de los países
correspondientes a cada fila.
ISO3: Códigos de tres letras ISO
3166-1 alfa-3 para cada país, que son códigos estandarizados
internacionalmente para la representación de nombres de países.
variable: Una columna que
representa el año al que se refieren los datos.
value: Los valores asociados con
cada país para su respectivo año. Esta columna parece contener datos
numéricos que podrían representar el valor del IDH o quizás un indicador
relacionado. Algunos valores son NA, lo
que indica datos faltantes. Los valores numéricos están en formato de
cadena de texto, lo que necesita una transformación a valores
numéricos.
Primeramente necesitamos cargar los paquetes necesarios para este análisis:
tidyverse
El tidyverse es una colección de
paquetes de R diseñados para trabajar con datos de manera eficiente y
coherente. Estos paquetes, incluyendo
dplyr,
tidyr,
readr, y
purrr, proporcionan herramientas para
leer, manipular, y escribir datos de manera efectiva.
tidyverse se centra en la claridad y la
simplicidad, haciendo que el código sea más legible y el proceso de
análisis de datos más intuitivo. Es especialmente útil para el
preprocesamiento de datos antes de su visualización o análisis
estadístico, facilitando tareas como la transformación de formatos de
datos, la limpieza de conjuntos de datos, y la realización de
operaciones complejas con datos.
ggthemes
ggthemes es un complemento para
ggplot2 que ofrece una variedad de temas y
escalas adicionales para personalizar aún más la apariencia de los
gráficos. Con ggthemes, los usuarios
pueden aplicar estilos estéticos y temas prediseñados, como temas que
imitan la apariencia de publicaciones y medios conocidos, o ajustar los
detalles visuales para que coincidan con las directrices de estilo
corporativo o personal. Este paquete es ideal para quienes buscan
refinar la presentación visual de sus gráficos, proporcionando opciones
para cambiar desde fuentes y colores hasta la configuración general del
tema del gráfico.
scales
El paquete scales es una herramienta
esencial para ajustar las escalas en los gráficos creados con
ggplot2. Ofrece funciones para
personalizar la apariencia de los ejes y leyendas, como el formato de
los valores de los ejes, la transformación de escalas (por ejemplo,
logarítmicas o de probabilidad), y la personalización de las paletas de
colores. scales permite a los usuarios
mejorar la legibilidad y la interpretación de sus gráficos, asegurando
que la información clave sea destacada y fácil de entender para el
espectador.
Estadísticas
Este es un paquete creado buscando facilitar la implantación de pruebas estadísticas básicas.
library(tidyverse)
library(ggthemes)
library(scales)
library(estadistica)
Para comenzar a analizar los datos limpiamos las filas y columnas que tengan el formato incorrecto o presenten valores NA esto con el fin de simplificar y pulir los resultados obtenidos.
### eliminamos los valores NA
datos <- na.omit(datos)
## corregir los valores numericos en formato de cadena
datos$value <- gsub(",", ".", datos$value) |> as.numeric()
Usamos la función resúmenes descriptivos para analizar las estadísticas descriptivas del conjunto de datos y los valores de desigualdad.
resumen.descriptivos(datos$value)
variable.x
media 20.4140
mínimo 3.6000
cuartil 1 10.9000
mediana 19.4000
cuartil 3 29.5000
máximo 45.9000
varianza 106.1605
desviación típica 10.3034
coef.variación 0.5047
RIC 18.6000
asimetría 0.2821
curtosis -1.1148
moda_1 7.7000
moda_2 7.9000
Media: El valor medio del IDH es 20.0072. Esto indica que, en promedio, el índice de desigualdad en el conjunto de datos es ligeramente superior a 20. Este es un indicador central y da una idea general del nivel de desigualdad humana en los datos analizados.
Mínimo: El valor mínimo registrado de IDH es 0.7, lo que sugiere que el país con la menor desigualdad en el conjunto de datos tiene un índice muy bajo, cercano a 0.
Cuartil 1 (Q1): El primer cuartil es 6.25, lo que significa que el 25% de los datos tienen un IDH de 6.25 o menos. Esto implica que una cuarta parte de los países tienen una desigualdad relativamente baja.
Mediana: La mediana o el valor medio del conjunto de datos es 17.1. Esto indica que la mitad de los países tiene un IDH menor que 17.1 y la otra mitad tiene un valor mayor. La mediana es resistente a valores atípicos y proporciona una mejor idea de la tendencia central en datos con posibles valores extremos.
Cuartil 3 (Q3): El tercer cuartil está en 32.2, indicando que el 75% de los países tienen un IDH de 32.2 o menos, y el 25% restante tiene un IDH superior a este valor.
Máximo: El valor máximo es 50.1, lo que significa que el país con la mayor desigualdad en el conjunto de datos tiene un IDH de 50.1.
Varianza: La varianza es 213.7859, una medida que indica qué tan dispersos están los valores del IDH alrededor de la media. Una varianza más alta significa más dispersión.
Desviación típica (estándar): La desviación estándar es 14.6214, que es la raíz cuadrada de la varianza. Proporciona una medida de dispersión que está en la misma unidad que los datos originales, facilitando su interpretación.
Coeficiente de variación (CV): El CV es 0.7308. Este es un indicador de la variabilidad relativa y se calcula como la desviación estándar dividida por la media. Un CV más alto indica una mayor variabilidad en relación con la media.
Rango intercuartílico (RIC): El RIC es 25.95, que es la diferencia entre el tercer y el primer cuartil (Q3 - Q1). Ofrece una medida de la dispersión del 50% central de los datos y es útil para identificar valores atípicos.
Obtenemos el promedio por cada año con la función aggregate y graficamos utilizando la función de ggplot2.
media <- aggregate(datos$value, list(datos$variable), mean)
media
Group.1 x
1 2010 22.13741
2 2011 20.98731
3 2012 21.14621
4 2013 20.75793
5 2014 20.91126
6 2015 20.60728
7 2016 20.06040
8 2017 19.72649
9 2018 19.10667
10 2019 19.00197
ggplot(media, aes(as.factor(media$Group.1), media$x, group = 1)) +
geom_point() + geom_line(size = 1.2) + theme_minimal() +
labs(title = "Puntaje promedio del coeficiente de desigualdad humana", x = "Año", y = "Puntaje CDH") + theme(plot.title = element_text(size = 14, hjust = 0.5))
En el año 2010, el puntaje del CDH comienza en un valor que está por encima de 21, lo cual sugiere un nivel de desigualdad medido por el indicador utilizado.
Entre 2010 y 2011, hay un ligero aumento en el coeficiente, lo que indica que la desigualdad humana promedio pudo haber aumentado durante este período.
A partir de 2011, se observa una tendencia general decreciente en el coeficiente de desigualdad humana. Esto sugiere que la desigualdad, según los criterios medidos, ha estado disminuyendo en promedio a lo largo de esta década.
La pendiente de la línea decrece más pronunciadamente después de 2014, indicando una reducción más rápida de la desigualdad en los años subsiguientes.
Para el final del período representado, en 2019, el puntaje del CDH ha descendido a un valor cercano a 19, lo cual señala una disminución significativa en la desigualdad humana con respecto al inicio de la década.
ggplot(datos, aes(datos$value)) + geom_density(fill ="lightblue") + facet_wrap(~datos$variable, scales = "free_x") + theme_minimal() +
labs(x = "", y = "")
Los gráficos son de tipo cresta, útiles para comparar cambios en distribuciones a lo largo del tiempo o entre grupos. Cada gráfico muestra la densidad de alguna variable, donde el eje x representa el rango de la variable y el eje y representa la densidad o frecuencia de las observaciones.
Parece haber un patrón común donde hay un pico en el lado izquierdo del gráfico, un valle en el medio y otro pico hacia la derecha.
ggplot(datos, aes(as.factor(datos$variable), datos$value)) + geom_boxplot() + theme_minimal() +
labs(x = "", y = "")
Estos gráficos son útiles para visualizar la distribución de un conjunto de datos numéricos a través de su cuartiles y para detectar valores atípicos.
Eje X: Cada caja está etiquetada con un año, lo que indica que los datos dentro de cada caja pertenecen a ese año específico.
Eje Y: El rango del eje y va de 0 a 50, lo que sugiere que la variable medida se encuentra en ese intervalo.
Las Cajas: La parte central de cada gráfico de caja (la “caja” propiamente dicha) muestra el rango intercuartílico (RIC), que abarca desde el primer cuartil (Q1) hasta el tercer cuartil (Q3). Esta es la mitad “media” de los datos, y su altura indica la dispersión de los valores centrales del conjunto de datos.
La Línea dentro de las Cajas: La línea que se encuentra en el centro de cada caja representa la mediana del conjunto de datos de ese año. La mediana es el valor que divide al conjunto de datos en dos partes iguales.
Los Bigotes: Las líneas que se extienden desde la parte superior e inferior de cada caja, conocidas como “bigotes”, indican la variabilidad fuera del RIC. Usualmente representan los valores dentro de 1.5 veces el RIC desde el primer y tercer cuartil, aunque este valor puede variar según la convención utilizada.
Valores Atípicos: No se observan puntos individuales fuera de los bigotes, lo que sugeriría la presencia de valores atípicos.
Variabilidad y Tendencia: Parece haber cierta consistencia en la mediana a lo largo de los años, lo que indica que la mediana de la variable medida no ha cambiado dramáticamente. Sin embargo, hay variaciones en la altura de las cajas y la longitud de los bigotes, lo que sugiere cambios en la dispersión de los datos y posiblemente en la variabilidad.
Consistencia: La uniformidad en la anchura de las cajas sugiere que cada año tiene una cantidad similar de datos, lo que indica que la comparación entre los años es equitativa en términos de volumen de datos.
data <- datos[order(datos$value, decreasing = T), ]
data <- data %>%
group_by(variable) %>%
slice_head(n = 1) %>%
ungroup()
ggplot(data, aes(as.factor(data$variable), data$value,
fill = data$Country)) + geom_col() +
theme_minimal() +
labs(x = "", y = "", title = "Paises con mayor índice de desigualdad humana de 2010 a 2019",
fill = "Pais") +
scale_fill_tableau()
La mayoria de paises con un alto índice de desigualdad humana pertenecen al continente africano, revelando sus altos problemas en materia de desarrollo. Se destaca el país de comoros que se mantiene con el país con el indice de desigualdad mas alto en los ultimos años.
data <- datos[order(datos$value), ]
data <- data %>%
group_by(variable) %>%
slice_head(n = 1) %>%
ungroup()
ggplot(data, aes(as.factor(data$variable), data$value,
fill = data$Country)) + geom_col() +
theme_minimal() +
labs(x = "", y = "", title = "Paises con menor índice de desigualdad humana de 2010 a 2019",
fill = "Pais") +
scale_fill_tableau()
El análisis del índice de desigualdad en los países mostrados en el gráfico anterior indica que Noruega se distingue consistentemente por tener el índice más bajo de desigualdad humana durante la década estudiada. Este patrón sugiere que Noruega ha mantenido un alto nivel de equidad en la distribución de recursos y oportunidades entre su población. A pesar de las fluctuaciones leves que se pueden observar en el transcurso de los años, la tendencia general refleja un compromiso sostenido con la igualdad social, lo que sitúa a Noruega como un líder en la promoción de condiciones equitativas para sus ciudadanos en comparación con los otros países evaluados.
El análisis previo sugiere que, en términos generales, la tendencia del índice de desigualdad ha mostrado una disminución a lo largo de los años. Esta observación, que indica una posible convergencia hacia una equidad mejorada, debe interpretarse con cautela. Cabe destacar que dicha tendencia global podría enmascarar variaciones significativas a nivel local. Es plausible que en países o regiones específicas, factores como crisis sociales, políticas económicas o eventos extraordinarios puedan haber influido de manera divergente, resultando en un incremento del índice de desigualdad especialmente en años recientes.
Por lo tanto, aunque la mediana del índice se mantenga estable, la desigualdad puede haber experimentado cambios más pronunciados en escalas más reducidas. En algunas áreas, las políticas redistributivas, la inversión en educación y salud, y la estabilidad macroeconómica pueden haber contribuido a una reducción en la desigualdad. Por el contrario, otras regiones podrían haber sufrido un aumento en la disparidad debido a la inestabilidad política, recesiones económicas o políticas fiscales regresivas.