1. Einleitung & Forschungsfrage

Forschungsfrage: Besteht ein Zusammenhang zwischen der allgemeinen Bildungsqualität (Learning-Adjusted Years of Schooling, LAYS) eines Landes und seinem Gender Development Index (GDI)?

2. Hypothesen

  • H1: Länder mit höherer Bildungsqualität (LAYS) haben tendenziell einen höheren GDI (positive Korrelation).
  • H2: Bildungsqualität ist nicht der alleinige Faktor, der einen hohen GDI vorhersagt. Da weitere, hier nicht gemessene Einflüsse eine Rolle spielen dürften, ist zu erwarten, dass einzelne Länder deutlich vom allgemeinen Trend abweichen.

3. Datenquellen & Methodik

Übersicht der verwendeten Datenquellen
Datensatz Quelle Verwendete Spalte Jahr
Gender Development Index UNDP Gender Development Index 2020
Learning-Adjusted Years of Schooling World Bank (Filmer et al.) Learning-adjusted years 2020

4. Verwendete Pakete

  • tidyverse (Datenaufbereitung und Visualisierung)
  • knitr (Tabellenausgabe)
  • kableExtra (erweiterte Tabellenformatierung)

5. Datenaufbereitung

# Beide CSV-Dateien einlesen und als Tabellen speichern
gdi <- read_csv("gender-development-index.csv")
schooling <- read_csv("years-of-schooling-among-children-by-measure.csv")
# GDI-Datensatz: nur das Jahr 2020 behalten, relevante Spalten auswählen und umbenennen
gdi_2020 <- gdi %>%
  filter(Year == 2020) %>%
  select(Entity, Code, GDI = `Gender Development Index`)

# Schooling-Datensatz: nur das Jahr 2020 behalten, relevante Spalten auswählen,
# und Länder ohne LAYS-Wert (NA) aussortieren
schooling_2020 <- schooling %>%
  filter(Year == 2020) %>%
  select(Entity, Code, LAYS = `Learning-adjusted years`) %>%
  filter(!is.na(LAYS))
# Beide Tabellen zusammenführen: nur Länder behalten, die in BEIDEN Datensätzen vorkommen
merged <- inner_join(gdi_2020, schooling_2020, by = c("Entity", "Code"))

Nach dem Zusammenführen (inner join) bleiben 167 Länder, für die sowohl ein GDI-Wert als auch ein LAYS-Wert für 2020 vorliegt.

# Kontrolle: Gibt es nach dem Join noch Zeilen mit fehlenden Werten?
merged %>% filter(is.na(GDI) | is.na(LAYS))
## # A tibble: 0 × 4
## # ℹ 4 variables: Entity <chr>, Code <chr>, GDI <dbl>, LAYS <dbl>

6. Deskriptive Statistik

# Kennzahlen für GDI einzeln berechnen
mean_GDI <- mean(merged$GDI, na.rm = TRUE)
sd_GDI   <- sd(merged$GDI, na.rm = TRUE)
min_GDI  <- min(merged$GDI, na.rm = TRUE)
max_GDI  <- max(merged$GDI, na.rm = TRUE)

# Kennzahlen für LAYS einzeln berechnen
mean_LAYS <- mean(merged$LAYS, na.rm = TRUE)
sd_LAYS   <- sd(merged$LAYS, na.rm = TRUE)
min_LAYS  <- min(merged$LAYS, na.rm = TRUE)
max_LAYS  <- max(merged$LAYS, na.rm = TRUE)

# Ergebnisse zu einer übersichtlichen Tabelle zusammenfassen
tibble(
  Kennzahl = c("Mittelwert", "Standardabweichung", "Minimum", "Maximum"),
  GDI = c(mean_GDI, sd_GDI, min_GDI, max_GDI),
  LAYS = c(mean_LAYS, sd_LAYS, min_LAYS, max_LAYS)
) %>%
  kable(digits = 3) %>%
  kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = FALSE) %>%
  row_spec(0, background = "#2E5C8A", color = "white", bold = TRUE)
Kennzahl GDI LAYS
Mittelwert 0.953 7.849
Standardabweichung 0.068 2.436
Minimum 0.447 2.207
Maximum 1.038 12.813

Der GDI streut mit einer Standardabweichung von 0.068 nur eng um seinen Mittelwert (0.953), während LAYS mit 2.44 Jahren deutlich stärker streut (Mittelwert 7.85 Jahre). Relativ zum Mittelwert entspricht das rund 7 % Streuung beim GDI gegenüber rund 31 % bei LAYS: Der GDI liegt in den meisten Ländern auf ähnlich hohem Niveau, die Bildungsqualität unterscheidet sich dagegen deutlich stärker.

# Boxplots nebeneinander darstellen (1 Zeile, 2 Spalten)
par(mfrow = c(1, 2))

boxplot(merged$GDI, main = "Boxplot: GDI", ylab = "GDI", col = "blue")
boxplot(merged$LAYS, main = "Boxplot: LAYS", ylab = "LAYS (Jahre)", col = "blue")

par(mfrow = c(1, 1))

Der Boxplot bestätigt visuell, was die Tabelle bereits zeigt: Der GDI ist eng um einen hohen Wert konzentriert, mit einem einzelnen, deutlich abgesetzten Ausreißer nach unten. LAYS streut sichtbar breiter über die gesamte Box, ohne so einen extremen Einzelausreißer.

7. Ergebnisse: Korrelation (Test von H1)

# Pearson-Korrelation zwischen LAYS und GDI berechnen (liefert r-Wert und p-Wert gleichzeitig)
cor_test_result <- cor.test(merged$LAYS, merged$GDI, method = "pearson")
cor_test_result
## 
##  Pearson's product-moment correlation
## 
## data:  merged$LAYS and merged$GDI
## t = 8.9051, df = 165, p-value = 9.337e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  0.4574568 0.6641403
## sample estimates:
##     cor 
## 0.56974
# r-Wert und p-Wert aus dem Testergebnis herausziehen, um sie im Text weiterzuverwenden
r_value <- round(cor_test_result$estimate, 3)
p_value <- cor_test_result$p.value

Kernergebnis: Korrelation von r = 0.57 (p < 0.001).

Die Korrelation ist mit r = 0.57 moderat bis mittelstark und statistisch hoch signifikant. H1 wird bestätigt: Höhere Bildungsqualität geht tendenziell mit höherem GDI einher. Das lineare Modell (Kapitel 8) erklärt dabei nur rund 32 % der Unterschiede im GDI (R² = 0.325); die übrigen 68 % gehen auf andere, hier nicht gemessene Faktoren zurück. Bildungsqualität allein ist damit kein hinreichender Erklärungsfaktor für Geschlechtergerechtigkeit im Sinne des GDI.

8. Ergebnisse: Ausreißer & lineares Modell (Test von H2)

# Lineares Regressionsmodell: GDI durch LAYS erklären
model <- lm(GDI ~ LAYS, data = merged)
summary(model)
## 
## Call:
## lm(formula = GDI ~ LAYS, data = merged)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -0.44694 -0.02321  0.00489  0.03208  0.09721 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) 0.827050   0.014768  56.004  < 2e-16 ***
## LAYS        0.016007   0.001797   8.905 9.34e-16 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.05641 on 165 degrees of freedom
## Multiple R-squared:  0.3246, Adjusted R-squared:  0.3205 
## F-statistic:  79.3 on 1 and 165 DF,  p-value: 9.337e-16
# Für jedes Land den vom Modell vorhergesagten Wert (fitted) und die Abweichung
# vom tatsächlichen Wert (residual) berechnen und der Tabelle hinzufügen
merged <- merged %>%
  mutate(fitted = fitted(model), residual = resid(model))
# Länder nach der Größe ihrer Abweichung (unabhängig vom Vorzeichen) sortieren
# und die 10 größten Ausreißer anzeigen
top_outliers <- merged %>%
  arrange(desc(abs(residual))) %>%
  slice_head(n = 10) %>%
  select(Entity, GDI, LAYS, residual)

top_outliers %>%
  kable(digits = 3, col.names = c("Land", "GDI", "LAYS", "Residuum")) %>%
  kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = FALSE) %>%
  row_spec(0, background = "#2E5C8A", color = "white", bold = TRUE)
Land GDI LAYS Residuum
Yemen 0.447 4.179 -0.447
Afghanistan 0.715 5.053 -0.193
India 0.843 7.102 -0.098
Panama 1.028 6.481 0.097
Dominican Republic 1.027 6.559 0.095
Iraq 0.799 4.031 -0.093
Chad 0.782 2.830 -0.090
Namibia 1.011 6.106 0.086
Iran 0.873 8.192 -0.085
Botswana 0.993 5.083 0.085

Mit einem R² von 0.325 zeigt sich bereits, dass Bildungsqualität nur einen Teil der GDI-Unterschiede erklärt, sie ist also nicht der alleinige Faktor. Die Residuen-Analyse macht das zusätzlich an einzelnen Ländern sichtbar: Yemen weicht mit einem Residuum von −0.447 am stärksten vom erwarteten Trend ab, der tatsächliche GDI liegt deutlich unter dem Modell-Erwartungswert. Afghanistan, Iraq und Iran fallen ebenfalls negativ auf, während Panama, Dominican Republic und Namibia einen höheren GDI zeigen als erwartet. H2 wird bestätigt: Einzelne Länder weichen deutlich vom allgemeinen Trend ab, was auf zusätzliche, hier nicht gemessene Einflussfaktoren wie rechtliche Rahmenbedingungen oder politische Instabilität hindeutet.

9. Visualisierung: Zusammenhang LAYS und GDI

# Streudiagramm: jeder Punkt ist ein Land (x = LAYS, y = GDI)
plot(merged$LAYS, merged$GDI,
     col = "blue", pch = 16,
     main = "Zusammenhang zwischen Schulqualität (LAYS) und GDI (2020)",
     xlab = "Learning-Adjusted Years of Schooling (LAYS)",
     ylab = "Gender Development Index (GDI)")

# Regressionsgerade (Trendlinie) in den bestehenden Plot einzeichnen
abline(lm(merged$GDI ~ merged$LAYS), col = "red", lwd = 2)

# Legende mit r-Wert und Stichprobengröße hinzufügen
legend("bottomright",
       legend = paste0("Pearson r = ", r_value, ", n = ", nrow(merged)),
       bty = "n")

# Die 5 größten Ausreißer für die Beschriftung im Plot auswählen
top5_outliers <- merged %>% arrange(desc(abs(residual))) %>% slice_head(n = 5)

# Gleicher Plot wie oben
plot(merged$LAYS, merged$GDI,
     col = "blue", pch = 16,
     main = "Zusammenhang zwischen LAYS und GDI: auffälligste Ausreißer",
     xlab = "Learning-Adjusted Years of Schooling (LAYS)",
     ylab = "Gender Development Index (GDI)")
abline(lm(merged$GDI ~ merged$LAYS), col = "red", lwd = 2)

# Ländernamen der 5 größten Ausreißer neben ihre Punkte schreiben
text(top5_outliers$LAYS, top5_outliers$GDI,
     labels = top5_outliers$Entity,
     pos = 3, cex = 0.8, col = "black")

Die Trendlinie zeigt den positiven Zusammenhang. Yemen (LAYS ≈ 4) fällt mit einem stark unterdurchschnittlichen GDI auf; auch Afghanistan, Panama und Dominican Republic weichen deutlich vom Trend ab.

10. Visualisierung: Spitzenreiter im Vergleich

# Top 5 Länder nach Bildungsqualität (LAYS) ermitteln
top5_lays <- merged %>%
  arrange(desc(LAYS)) %>%
  slice_head(n = 5) %>%
  select(Entity, value = LAYS) %>%
  mutate(Measure = "Top 5: Bildungsqualität (LAYS)")

# Top 5 Länder nach GDI ermitteln
top5_gdi <- merged %>%
  arrange(desc(GDI)) %>%
  slice_head(n = 5) %>%
  select(Entity, value = GDI) %>%
  mutate(Measure = "Top 5: Gender Development Index (GDI)")

# Beide Ranglisten zu einer gemeinsamen Tabelle zusammenfügen
top5_combined <- bind_rows(top5_lays, top5_gdi)

# Zwei Balkendiagramme nebeneinander darstellen (eines pro Rangliste)
ggplot(top5_combined, aes(x = reorder(Entity, value), y = value, fill = Measure)) +
  geom_col(show.legend = FALSE) +
  facet_wrap(~Measure, scales = "free") +
  coord_flip() +
  labs(
    title = "Die stärksten Länder 2020: Bildungsqualität vs. Gender Development Index",
    x = NULL, y = NULL
  ) +
  theme_minimal(base_size = 13)

Die Top-5-Länder bei LAYS und beim GDI überschneiden sich in keinem Fall.

11. Kritische Reflexion

Die Ergebnisse sind kritisch einzuordnen: Korrelation bedeutet keine Kausalität, Wohlstand ist ein plausibler Confounder für beide Variablen. Der GDI misst zudem nur ein rechnerisches Verhältnis (weiblicher zu männlicher HDI), keine tatsächliche rechtliche oder politische Gleichstellung. Die Stichprobe deckt außerdem nur 167 von weltweit rund 195 Ländern ab, tendenziell mit einer Verzerrung zugunsten datenreicherer Staaten.

12. Fazit

Die Analyse bestätigt einen moderaten, hoch signifikanten positiven Zusammenhang zwischen Bildungsqualität und Gender Development Index (r = 0.57, R² ≈ 32 %). Ausreißer wie Yemen und Afghanistan sowie die fehlende Überschneidung der Spitzenreiter-Länder zeigen, dass Bildungsqualität allein den GDI nicht hinreichend erklärt.