Universidad de El Salvador · Facultad de Ciencias Económicas
Métodos para el Análisis Económico · Tarea A22

1 · El clustering: aprendizaje no supervisado

Integrante 1 · Erick Hernández
  • No hay variable dependiente ni una “respuesta correcta” etiquetada, a diferencia de una regresión o un modelo de clasificación.
  • El objetivo es descubrir una estructura de agrupamiento latente sólo a partir de las distancias o similitudes entre observaciones.
  • En este trabajo, las observaciones son economías y las variables, indicadores de la API del Banco Mundial.
  • El algoritmo no conoce ninguna clasificación oficial de “desarrollados” o “en desarrollo”: todo grupo debe justificarse por la estructura estadística de los datos.
Dos grandes enfoques: métodos jerárquicos y métodos no jerárquicos.

¿Qué es un dendrograma?

Integrante 1 · Erick Hernández
  • Un método jerárquico no entrega una partición, sino todas, anidadas unas dentro de otras.
  • El dendrograma las dibuja: cada unión de ramas es una fusión de dos grupos.
  • Cortar el árbol a una altura produce una partición: más abajo, más grupos; más arriba, menos.
  • Si dos países se unen a cierta altura, siguen juntos en todos los cortes por encima.

Métodos jerárquicos: Ward es aglomerativo

Integrante 1 · Erick Hernández

No producen una partición, sino una secuencia completa de particiones anidadas, representada en un dendrograma.

  • Aglomerativa: cada observación empieza como un grupo y en cada paso se fusionan los dos más similares, hasta quedar uno solo. Es la estrategia dominante.
  • Divisiva: el proceso inverso; es más costosa, porque dividir bien es un problema combinatorio más difícil que fusionar.
Ward es jerárquico aglomerativo: en cada paso ejecuta la fusión que produce el menor incremento de la suma de cuadrados intragrupo. Es un procedimiento ávido: una fusión nunca se revisa. El resultado es un árbol binario donde la altura de cada fusión refleja su costo en homogeneidad.

¿Cómo se decide qué grupos están “más cerca”?

Integrante 1 · Erick Hernández

Todos los métodos aglomerativos siguen el mismo esquema. Lo que cambia es el criterio de fusión (enlace):

Criterio Cómo mide la cercanía entre dos grupos Tipo de grupos que tiende a formar
Enlace simple los dos miembros más cercanos cadenas largas
Enlace completo los dos miembros más lejanos grupos de diámetro pequeño
Enlace promedio el promedio de todas las distancias intermedio
Ward cuánto aumenta la suma de cuadrados al unirlos compactos y de tamaño parecido
Elegir el criterio no es un detalle técnico: es definir qué significa un conglomerado.

Métodos no jerárquicos: los otros tres equipos

Integrante 1 · Erick Hernández

Entregan una única partición, sin estructura de árbol.

Lógica Métodos Qué exigen de antemano
Particionales basados en prototipos K-means (centroide), K-medianas/PAM (medoide) fijar el número de grupos \(k\)
Basados en densidad DBSCAN radio \(\varepsilon\) y MinPts; trata como ruido lo que no cae en una región densa
Los tres exigen una decisión ex ante y devuelven una sola solución: explorar otra configuración implica volver a ejecutar el algoritmo. Ward construye el árbol completo y el número de grupos se decide después.

¿Por qué Ward para datos del Banco Mundial?

Integrante 1 · Erick Hernández
  1. Variables continuas de gradación, no categorías: el PIB per cápita o la esperanza de vida ubican a los países en un espectro continuo de desarrollo; el dendrograma muestra si hay quiebres naturales.
  2. Varios niveles de agregación a la vez: el mismo árbol contiene la solución de 2, 3, 4 o 10 grupos.
  3. Coherente con la multidimensionalidad del desarrollo: agrupa países globalmente parecidos en todas las variables estandarizadas a la vez.
  4. No exige comprometerse con un número de grupos: no hay un número “correcto” de categorías de desarrollo conocido a priori.

Síntesis del punto 1

Integrante 1 · Erick Hernández
El método de Ward se clasifica como jerárquico aglomerativo porque construye progresivamente, de abajo hacia arriba, un árbol binario mediante fusiones sucesivas que minimizan el incremento de la varianza intragrupo.
Resulta idóneo para los datos del Banco Mundial porque éstos describen un fenómeno —el desarrollo económico— de naturaleza continua y multidimensional, mejor capturado por una jerarquía completa que por una partición única y fija.

2 · Dos países: la distancia euclidiana

Integrante 2 · Harold López
  • A = (1, 2) y B = (4, 6). Cada país es un punto.
  • La distancia es la hipotenusa (Pitágoras): d(A,B)=32+42=25=5
  • Ward trabaja con la distancia al cuadrado porque se reparte entre los indicadores: 25 = 9 + 16. Sin el cuadrado no ocurre: 5 ≠ 3 + 4.

Con más indicadores: la fórmula general

Integrante 2 · Harold López

d(i,j)=∑v=1p(xiv−xjv)2⇒d2(i,j)=∑v=1p(xiv−xjv)2

  • Con \(p\) indicadores se suma un cateto al cuadrado por cada indicador; cada uno aporta su parte a \(d^2\).
  • Por qué hay que estandarizar: si un país difiere de otro en US$ 1 000 de PIB per cápita y en 5 años de esperanza de vida, los cuadrados son 1 000 000 y 25. El PIB se llevaría prácticamente toda la distancia sólo por estar medido en números más grandes.
  • scale() lleva cada indicador a media 0 y desviación estándar 1: todos pesan lo mismo en la distancia.

El error cuadrático y el costo de fusión

Integrante 2 · Harold López

Si A y B forman un grupo, su centroide es el promedio: (2,5; 4). El error cuadrático (SCE) suma las distancias al cuadrado de cada país al centroide, como los residuos en MCO:

País Dif. ind. 1 Dif. ind. 2 Distancia²
A −1,5 → 2,25 −2 → 4 6,25
B 1,5 → 2,25 2 → 4 6,25
SCE 12,5

Separados, cada país era su propio centro: error 0. El aumento es el costo de fusión:

Δ=SCE(G1∪G2)−SCE(G1)−SCE(G2)

12,5 es la mitad de 25: para dos países sueltos, el costo es la mitad de su distancia al cuadrado.

Llega un tercer país: Ward une el par más barato

Integrante 2 · Harold López

Agregamos C = (1, 3). Hay tres fusiones posibles:

Fusión Distancia² Costo
A-B 25 12,5
A-C 1 0,5
B-C 18 9
El criterio de Ward: en cada paso, fusionar el par con el menor costo. Por eso se dice que “minimiza la varianza”: minimiza el aumento de la SCE en cada paso.

Unir B al grupo {A, C}: la cuenta completa

Integrante 2 · Harold López

1. Error del grupo nuevo. Centroide de {A, B, C}: (2; 11/3).

País Dif. ind. 1 Dif. ind. 2 Distancia²
A = (1, 2) −1 → 1 −5/3 → 25/9 34/9 ≈ 3,778
B = (4, 6) 2 → 4 7/3 → 49/9 85/9 ≈ 9,444
C = (1, 3) −1 → 1 −2/3 → 4/9 13/9 ≈ 1,444
SCE 132/9 ≈ 14,667

2. Cuánto sube el error.

Momento Error
Antes: {A, C} y {B} 0,5 + 0 = 0,5
Después: {A, B, C} 14,667
Costo 14,167
La regla de la mitad daría 21,25 / 2 = 10,625. El costo real es mayor.

El tamaño también cuesta

Integrante 2 · Harold López

{A, C} “pesa” el doble que B: el centro nuevo apenas se mueve hacia B (un tercio del camino) y B queda lejos. En general:

Δ(G1,G2)=n1n2n1+n2‖x‾G1−x‾G2‖2

Qué se une Factor de tamaño Costo con distancia² = 21,25
País + país 1/2 10,625
Grupo de 2 + país 2/3 14,167
Grupo de 2 + grupo de 2 1 21,25
Unir grupos grandes cuesta más: Ward tiende a grupos de tamaño parecido y deja a los atípicos para el final.

Cuarto país: dos grupos y la última fusión

Integrante 2 · Harold López

Llega D = (4, 8). Unir B con D (costo 2) es más barato que unir B con {A, C} (14,167).

Paso Fusión Costo
1 A + C 0,5
2 B + D 2
3 {A, C} + {B, D} 29,25
Suma 31,75 = T

El presupuesto: T = W + B y el R² de cada corte

Integrante 2 · Harold López

La suma de los costos, 31,75, es la variación total T de los cuatro países respecto a su media. Cada fusión gasta una parte:

Corte Grupos W (dentro) B = T − W (entre) R² = B / T
4 grupos {A}, {B}, {C}, {D} 0 31,75 100 %
3 grupos {A, C}, {B}, {D} 0,5 31,25 98,4 %
2 grupos {A, C}, {B, D} 2,5 29,25 92,1 %
1 grupo {A, B, C, D} 31,75 0 0 %
Como en el ANOVA: T = W + B. T no depende de cómo se agrupe, así que minimizar W equivale a maximizar B: grupos homogéneos por dentro son grupos distintos entre sí.

Lance-Williams: actualizar sin recalcular

Integrante 2 · Harold López

Con cientos de países no se recalculan centroides: cuando se fusionan \(i\) y \(j\), la disimilitud con otro grupo \(k\) se actualiza con las que ya se conocían.

D(i∪j,k)=ni+nkni+nj+nkD(i,k)+nj+nkni+nj+nkD(j,k)−nkni+nj+nkD(i,j)

  • \(D\) se aplica a distancias al cuadrado y equivale al doble del costo: \(D = 2\Delta\).
  • Tras unir A y C: D(AC,B)=23(25)+23(18)−13(1)=853≈28,33=2×14,167
  • Tras unir B y D: D(BD,AC)=34⋅853+34⋅1573−24(4)=58,5=2×29,25

Cómo se lee la altura del dendrograma

Integrante 2 · Harold López

h=2Δ⇔Δ=h22

  • La altura no es la distancia entre dos países: es el precio en homogeneidad de unirlos (1, 2 y 7,65 → 0,5, 2 y 29,25).
  • Las alturas suman T: cada corte tiene un R².
  • Las alturas nunca bajan: el árbol se puede cortar horizontalmente.
  • Un salto grande indica dónde cortar: aquí, en {A, C} y {B, D}.

ward.D2 y la lectura económica

Integrante 2 · Harold López
Opción en R Alturas Σ h²/2 ¿Suma T = 31,75?
hclust(dist(X), "ward.D2") 1,00; 2,00; 7,65 31,75 sí
hclust(dist(X), "ward.D") 1,00; 2,00; 9,39 46,59 no
ward.D aplica la recurrencia a las distancias sin elevar al cuadrado: corre sin error, pero no minimiza la suma de cuadrados. Se usa siempre ward.D2.
Lectura económica: tratar a A y C como iguales cuesta 0,5 de 31,75 (1,6 % de la variación); tratar a los cuatro países como un solo bloque, por ejemplo para una política común, cuesta 29,25 (92 %).

3 · Ward frente a los métodos que ya vimos

Integrante 3 · Maydelline Santamaría
Ward DBSCAN PAM K-means
Idea de grupo compacto, de varianza mínima región densa de puntos grupo alrededor de un país real (medoide) grupo alrededor de un promedio (centroide)
Resultado árbol con todas las particiones grupos + ruido una partición una partición
Qué hay que fijar nada; se corta después eps y minPts K K (y una semilla)
Para cada método veremos las fortalezas y limitaciones de Ward, y dos ejemplos simulados que las hacen visibles.

Ward frente a DBSCAN (densidad)

Integrante 3 · Maydelline Santamaría

Fortalezas de Ward

  • Ward genera un dendrograma que permite visualizar cómo se forman y relacionan los clusters; DBSCAN no proporciona esta estructura jerárquica.
  • Ward permite obtener diferentes cantidades de clusters mediante distintos cortes del mismo dendrograma, mientras que en DBSCAN modificar ε o MinPts puede cambiar la estructura de los grupos.
  • Ward no requiere establecer parámetros de densidad específicos, mientras que DBSCAN puede presentar dificultades cuando los clusters tienen densidades muy diferentes.

Limitaciones de Ward

  • Tiende a favorecer conglomerados compactos, mientras que DBSCAN encuentra clusters que tienen formas irregulares (alargados, curvos, etc.).
  • DBSCAN clasifica los outliers como ruido, es más robusto. Ward es muy sensible a valores atípicos, que pueden afectar considerablemente las fusiones.
  • Requiere exploración: DBSCAN determina los conglomerados a partir de los parámetros de densidad, mientras que Ward requiere decidir dónde cortar el dendrograma.

Ejemplo: grupos con forma arbitraria

Integrante 3 · Maydelline Santamaría

Datos simulados con dos “lunas”. Ward busca grupos compactos alrededor de un centro y asigna mal 44 de los 120 puntos de la segunda luna; DBSCAN sigue la densidad y las separa bien.

Ward frente a PAM (medoides)

Integrante 3 · Maydelline Santamaría

Fortalezas de Ward

  • Ward construye una jerarquía de agrupamientos y posteriormente permite elegir el número de clusters mediante el dendrograma, mientras que PAM requiere especificar K previamente.
  • Ward puede presentar un menor costo computacional que PAM en determinados conjuntos de datos y condiciones.
  • Ward explora múltiples niveles; PAM sólo da una partición según el K establecido.

Limitaciones de Ward

  • Ward es muy sensible a valores atípicos, mientras que PAM es mucho más robusto.
  • Ward está vinculado a la distancia euclidiana al cuadrado y al criterio de mínima varianza, mientras que PAM es más flexible en la elección de la medida de disimilitud.
  • Una vez que Ward fusiona dos grupos, esa decisión no puede deshacerse posteriormente, mientras que PAM puede modificar las asignaciones mediante el intercambio de medoides.

Ejemplo: un país atípico

Integrante 3 · Maydelline Santamaría

Dos grupos de 30 países y un atípico arriba. En Ward el atípico se une a un grupo y desplaza su centro (✕); el medoide de PAM (◇) es un país real y no se mueve; DBSCAN lo marca como ruido (▲).

Ward frente a K-means (centroides)

Integrante 3 · Maydelline Santamaría

Fortalezas de Ward

  • Ward permite seleccionar posteriormente el número de clusters mediante el dendrograma, mientras que K-means requiere definir K previamente.
  • El dendrograma de Ward permite visualizar cómo se van formando los clusters y analizar diferentes niveles de agrupamiento sin volver a ejecutar el algoritmo.

Limitaciones de Ward

  • Las decisiones en Ward son irreversibles: una vez que dos grupos se unen, no pueden separarse, mientras que K-means permite reasignar iterativamente las observaciones hasta alcanzar una solución estable.
  • La estructura jerárquica de Ward puede resultar poco práctica para conjuntos de datos muy grandes, mientras que K-means está diseñado para particionar grandes conjuntos de datos directamente en K grupos.

Síntesis: fortalezas y limitaciones de Ward

Integrante 3 · Maydelline Santamaría

Fortalezas

  • Dendrograma intuitivo para el análisis exploratorio
  • No requiere especificar K previamente
  • Determinístico (sin variabilidad)
  • Excelente para entender la estructura jerárquica

Limitaciones

  • Muy sensible a outliers (pierde frente a DBSCAN y PAM)
  • Lento en datos grandes (pierde frente a K-means)
  • Asume clusters esféricos
  • Alto consumo de memoria

¿Cuándo conviene cada método?

Integrante 3 · Maydelline Santamaría
Si la prioridad es… Conviene
Explorar la estructura a varios niveles, sin fijar K, con decenas o cientos de observaciones Ward
La mejor partición en K grupos con muchos datos K-means
Robustez ante atípicos y un país real como representante de cada grupo PAM
Grupos de forma irregular y separar el ruido DBSCAN

4 · Cuatro métricas, cuatro lógicas

Integrante 4 · Cristofer Cedillos
Métrica Método Cómo se usa
Método del codo K-means se grafica la suma de cuadrados intraclúster (WSS) contra \(k\); el “codo” marca el \(k\) óptimo
Coeficiente de silueta K-medianas/PAM cuánto encaja cada observación en su grupo frente al vecino; se elige el \(k\) con mayor silueta promedio
Gráfico de k-vecinos DBSCAN no elige \(k\): calibra el radio épsilon buscando el “codo” de las distancias al k-ésimo vecino
Dendrograma Ward primero se construye el árbol completo; después se decide, visual y analíticamente, a qué altura cortarlo

El criterio de Ward: el salto de altura

Integrante 4 · Cristofer Cedillos
  • La altura de cada fusión mide el incremento de la ESS que costó unir esos dos grupos.
  • Alturas parecidas entre fusiones consecutivas: seguir fusionando “no duele mucho”.
  • Un salto grande: esa fusión unió grupos realmente distintos; forzarla ya no se justifica.
alturas_lac <- rev(modelo_ward_lac$height)          # alturas de mayor a menor
saltos_lac  <- -diff(alturas_lac)                   # diferencia entre alturas consecutivas
k_optimo_lac <- which.max(saltos_lac) + 1           # posición del salto más grande + 1
Es una forma analítica y reproducible de cortar el árbol, no una “lectura a ojo” del gráfico.

Aplicación: 19 países de América Latina

Integrante 4 · Cristofer Cedillos

Países (código ISO3): ARG, BOL, BRA, CHL, COL, CRI, CUB, DOM, ECU, SLV, GTM, HND, MEX, NIC, PAN, PRY, PER, URY y VEN.

codigos_paises_lac los une en "ARG;BOL;BRA;...": la API acepta todos en una sola consulta.

Indicador Código WDI
PIB per cápita (US$) NY.GDP.PCAP.CD
Esperanza de vida SP.DYN.LE00.IN
Usuarios de internet (%) IT.NET.USER.ZS
Acceso a electricidad (%) EG.ELC.ACCS.ZS
Gasto en salud (% del PIB) SH.XPD.CHEX.GD.ZS
Cinco indicadores que en conjunto describen el nivel de desarrollo: ingreso, salud, conectividad, infraestructura y gasto social.

Descarga: un año común para todos los países

Integrante 4 · Cristofer Cedillos
  • Si cada país aporta “su” último año, uno podría reportar 2024 y otro 2021: la comparación no sería en igualdad de condiciones.
  • La función descargar_indicador_lac() consulta una ventana de 5 años y elige, para cada indicador, el año más reciente con mayor cobertura.
Indicador PIB per cápita Esperanza de vida Internet Electricidad Gasto en salud
Año común 2020 2024 2024 2024 2023
Países con dato 19 19 19 19 19
El PIB per cápita queda en 2020 porque es el último año en que los 19 países tienen dato: en los años siguientes falta al menos uno.

Faltantes y estandarización

Integrante 4 · Cristofer Cedillos
datos_lac_limpios <- datos_lac %>%
  mutate(across(pib_percapita:gasto_salud,
                ~ ifelse(is.na(.), mean(., na.rm = TRUE), .))) %>%   # imputación por la media
  na.omit()                                                          # salvaguarda
matriz_lac_escalada <- scale(matriz_lac)                             # puntuación Z
modelo_ward_lac <- hclust(dist(matriz_lac_escalada, method = "euclidean"), method = "ward.D2")
  • Faltantes: se reemplazan por la media de la columna, una de las dos vías que admite la tarea.
  • Estandarización: dólares, años y porcentajes quedan en la misma escala; el PIB per cápita no domina las distancias.
  • Modelo: empieza con 19 grupos y fusiona el par que menos incrementa la ESS, hasta quedar uno.

El salto más grande indica k = 3

Integrante 4 · Cristofer Cedillos

Fusión j Altura Salto
1 7,91 1,73
2 6,19 2,01
3 4,18 0,78
4 3,40 0,28
5 3,12 0,13

La fila \(j\) es la fusión que pasa de \(j+1\) a \(j\) grupos. El mayor salto está en \(j = 2\) → k = 3.

Confirmación visual: dendrograma con k = 3

Integrante 4 · Cristofer Cedillos

fviz_dend() traza los rectángulos del corte en el número óptimo identificado analíticamente.

Contraste: el codo y la silueta coinciden

Integrante 4 · Cristofer Cedillos

Sobre el mismo árbol, el codo de la WSS está en k = 3 y la silueta promedio es máxima en k = 3 (0,295): las tres métricas apuntan al mismo número de grupos.

Lectura económica de los tres grupos

Integrante 4 · Cristofer Cedillos
Grupo Países PIB per cápita (US$) Esperanza de vida Internet (%) Electricidad (%) Gasto en salud (% PIB)
1 10 9 070 78,1 83,0 99,4 8,7
2 5 6 133 73,9 82,0 99,5 5,5
3 4 3 152 72,9 60,8 93,2 8,0

Medianas de cada grupo en unidades originales.

  • Grupo 1: mayor ingreso y esperanza de vida; incluye al Cono Sur, Costa Rica y Panamá.
  • Grupo 2: ingreso intermedio y el menor gasto en salud (México, Perú, República Dominicana, Bolivia, Venezuela).
  • Grupo 3: Guatemala, Honduras, Nicaragua y El Salvador: el menor ingreso y el menor acceso a internet.

Lectura del resultado

Integrante 4 · Cristofer Cedillos
No decidimos el número de grupos “porque el dendrograma se ve bien”, sino porque es matemáticamente donde el costo de seguir fusionando se dispara.
Para Ward, el método exacto que corresponde es el dendrograma con el criterio del salto de altura, y el resultado (k = 3) es reproducible por cualquiera que corra el mismo código.

5 · Ejemplo práctico: datos y variables

Integrante 5 · Heysol Puro
  • Remesas personales: transferencias de dinero de personas residentes en el extranjero (generalmente trabajadores migrantes) a sus familiares en el país de origen. Se destinan sobre todo al consumo básico: alimentación, vivienda, educación, salud y servicios.
  • Ingresos tributarios: recursos que el Estado recauda de forma obligatoria de personas naturales y jurídicas, en ejercicio de su potestad tributaria, para financiar el gasto público.
  • Gasto público: recursos que el Estado (gobierno central, gobiernos locales y entidades descentralizadas) destina a bienes, servicios, inversión y transferencias.
Los tres indicadores, como % del PIB, provienen de la API del Banco Mundial.

Descarga con wbstats

Integrante 5 · Heysol Puro
library(wbstats)
indicadores <- wb_indicators(lang = "es")                 # catálogo de indicadores en español
mis_indicadores <- c(Gasto_Publico        = "GC.XPN.TOTL.GD.ZS",
                     Ingresos_Tributarios = "GC.TAX.TOTL.GD.ZS",
                     Remesas_Personales   = "BX.TRF.PWKR.DT.GD.ZS")
datos_wb <- wb_data(indicator = mis_indicadores, start_date = 2000, end_date = 2000,
                    return_wide = TRUE)
País Gasto público Remesas Ingresos tributarios
Aruba NA 0,06 NA
Afghanistan NA NA NA
Angola 21,83 NA 28,70
Albania NA 16,68 NA
Andorra NA NA NA
United Arab Emirates NA NA NA

Preparación de datos

Integrante 5 · Heysol Puro
ejemplo <- datos_wb %>%
  select(country, Gasto_Publico, Remesas_Personales, Ingresos_Tributarios)
datos <- ejemplo %>% tibble::column_to_rownames(var = "country")
datos_limpios   <- na.omit(datos)          # eliminar faltantes
datos_escalados <- scale(datos_limpios)    # media 0, desviación estándar 1
Paso Qué hace Resultado
select() deja sólo el país y los tres indicadores (sin ISO ni año) 4 columnas
column_to_rownames() los nombres de los países pasan a ser los nombres de las filas 3 variables numéricas
na.omit() elimina los países con algún faltante de 217 a 74 países
scale() estandariza para que las variables sean comparables media 0, desv. 1

Función hclust

Integrante 5 · Heysol Puro
# Matriz de distancias (disimilitud)
matriz <- dist(datos_escalados, method = "euclidean")
# Agrupamiento jerárquico por el método de Ward
grafico <- hclust(matriz, method = "ward.D2")
plot(grafico, cex = 0.6, hang = -1,
     main = "Dendrograma - Método de Ward")
  • dist() calcula la distancia euclidiana entre cada par de países: cuanto mayor, menos se parecen.
  • hclust() necesita esa matriz de distancias; con "ward.D2" aplica el criterio de Ward.

Función agnes: el coeficiente de aglomeración

Integrante 5 · Heysol Puro
library(cluster)
grafico_2  <- agnes(datos_escalados, method = "complete")
grafico_22 <- agnes(datos_escalados, method = "ward")
Enlace Coeficiente de aglomeración
Completo 0,942
Ward 0,962
  • Mide la cantidad de estructura de agrupamiento encontrada: valores cercanos a 1 sugieren una estructura fuerte.
  • Sirve para comparar métodos sobre los mismos datos; tiende a crecer con el número de observaciones.

Dendrograma con agnes

Integrante 5 · Heysol Puro
pltree(grafico_22, cex = 0.6, hang = -1,
       main = "Dendrograma - función agnes")
  • agnes(..., method = "ward") aplica el mismo criterio que hclust(..., "ward.D2").
  • Por eso produce el mismo árbol: las mismas fusiones a las mismas alturas.

Corte con rect.hclust

Integrante 5 · Heysol Puro
alturas   <- rev(grafico$height)
k_ejemplo <- which.max(-diff(alturas)[1:9]) + 1
plot(grafico, cex = 0.6, hang = -1)
grupos <- cutree(grafico, k = k_ejemplo)
rect.hclust(grafico, k = k_ejemplo,
            border = unique(grupos[grafico$order]) + 1)
table(grupos)
  • El criterio del salto de altura (sección 4) indica k = 3.
  • rect.hclust() enmarca los grupos; cutree() asigna cada país: 43, 30, 1 países.

Cruce de variables

Integrante 5 · Heysol Puro

pairs(datos_limpios, col = grupos + 1,
      pch = 19)
  • Cada panel cruza dos indicadores en sus unidades originales; el color es el grupo de Ward.
  • Rojo y verde se separan en gasto e ingresos tributarios.
  • Azul se separa en remesas.

Perfil de los grupos

Integrante 5 · Heysol Puro
Grupo Países Gasto público Remesas Ingresos tributarios
1 43 18,4 1,5 13,6
2 30 36,8 0,4 23,4
3 1 33,8 53,8 22,9

Medianas de cada grupo, % del PIB, año 2000.

  • Grupo 1: gasto e impuestos del gobierno central bajos. Aquí están todos los países latinoamericanos con datos, incluido El Salvador (gasto 15,0, remesas 15,0, impuestos 10,6).
  • Grupo 2: gasto e impuestos del gobierno central altos; sobre todo economías europeas.
  • Países federales (EE. UU., Alemania, Canadá) quedan en el grupo 1: el indicador mide sólo el gobierno central.
  • Grupo 3: Lesoto, con remesas superiores al 50 % de su PIB: un atípico que Ward deja solo.

Conclusiones

Integrante 5 · Heysol Puro
  1. Clasificación: Ward es jerárquico aglomerativo; entrega el árbol completo y el número de grupos se decide después.
  2. Matemática: en cada paso fusiona lo que menos aumenta la suma de cuadrados intragrupo; la altura del dendrograma es el precio de cada fusión, y todas suman la variación total.
  3. Comparación: su fuerte es la lectura jerárquica y el determinismo; sus débiles, los atípicos, las formas no esféricas y los datos muy grandes.
  4. Número de grupos: su criterio es el dendrograma con el salto de altura (k = 3 en 19 países de América Latina, confirmado por el codo y la silueta).
  5. Ejemplo en R: na.omit(), scale(), dist(), hclust(..., "ward.D2"), rect.hclust(), cutree() y pairs() resuelven el análisis completo.

Tarea de comprobación

Integrante 5 · Heysol Puro
  1. ¿Por qué se dice que el método de Ward es un método jerárquico aglomerativo? Explica qué ocurre con los grupos desde el inicio hasta que se forma el dendrograma.
  2. ¿Qué criterio utiliza Ward para decidir qué dos grupos deben fusionarse en cada paso? ¿Por qué este criterio es importante para mantener grupos relativamente homogéneos?
  3. Al observar un dendrograma obtenido mediante Ward, ¿cómo determinarías cuántos clusters sería posible obtener? Explica qué representa realizar un “corte” en una determinada altura del dendrograma.
  4. Según el código distancia <- dist(datos), modelo <- hclust(distancia, method = "ward.D2"), plot(modelo), ¿qué función cumple cada parte: dist(datos), hclust(), method = "ward.D2" y plot(modelo)?
  5. Suponga que está agrupando países utilizando indicadores económicos y obtiene tres clusters. ¿Qué significa económicamente que dos países pertenezcan al mismo cluster? ¿Significa necesariamente que sus economías son iguales?

Informe, código y datos: RPubs — [enlace de publicación] · Gracias. ¿Preguntas?