Data real yang digunakan pada tugas ini berfokus pada bidang Kesehatan. Data diimpor langsung dari file Excel data_real.xlsx.
Penjelasan Sumber Data: Dataset yang digunakan merupakan data sekunder indikator kesehatan masyarakat. Data ini mencakup 15 observasi sampel responden dengan 4 variabel utama, yaitu:
Status_Kesehatan (Kategorik/Kualitatif): Tingkat
kondisi kesehatan umum responden (Baik, Cukup, Kurang).Tingkat_Aktivitas (Kategorik/Kualitatif): Frekuensi
aktivitas fisik harian (Tinggi, Sedang, Rendah).Pengeluaran_Kesehatan (Numerik/Kuantitatif): Rata-rata
pengeluaran bulanan untuk kebutuhan kesehatan (dalam ribuan
Rupiah).Angka_Harapan_Hidup (Numerik/Kuantitatif): Proyeksi
usia harapan hidup individu (dalam tahun).Review Singkat Alasan Pemilihan Data: Kami memilih topik dan dataset bidang kesehatan ini karena isu kesehatan merupakan faktor vital yang berkaitan langsung dengan kualitas hidup masyarakat. Selain itu, dataset ini memiliki kelengkapan struktur variabel yang seimbang—terdiri dari variabel kualitatif/kategorik dan kuantitatif/numerik—sehingga sangat ideal untuk diolah dan dipetakan secara visual menggunakan Bar Chart, Histogram, serta Scatter Plot tanpa memicu adanya bias informasi.
data_real <- read_excel("data_real.xlsx")
data_real
## # A tibble: 15 × 4
## Status_Kesehatan Tingkat_Aktivitas Pengeluaran_Kesehatan Angka_Harapan_Hidup
## <chr> <chr> <dbl> <dbl>
## 1 Baik Tinggi 450 76.5
## 2 Cukup Sedang 250 71.2
## 3 Baik Tinggi 520 78
## 4 Kurang Rendah 120 65.4
## 5 Baik Sedang 380 74.8
## 6 Cukup Rendah 200 69.1
## 7 Baik Tinggi 600 79.5
## 8 Kurang Rendah 150 66.8
## 9 Cukup Sedang 310 72.3
## 10 Baik Tinggi 480 77.2
## 11 Baik Sedang 410 75.1
## 12 Cukup Rendah 180 68.5
## 13 Baik Tinggi 550 78.8
## 14 Kurang Rendah 110 64.2
## 15 Cukup Sedang 290 71.8
Berikut adalah visualisasi data kualitatif untuk membandingkan frekuensi status kesehatan responden:
ggplot(data_real, aes(x = Status_Kesehatan, fill = Status_Kesehatan)) +
geom_bar() +
scale_fill_brewer(palette = "Set2") +
labs(
title = "Distribusi Status Kesehatan Responden",
x = "Status Kesehatan",
y = "Frekuensi"
) +
theme_minimal()
Berdasarkan hasil grafik di atas, sebagian besar responden memiliki status kesehatan dalam kategori Baik, diikuti oleh kategori Cukup dan Kurang.
Berikut adalah distribusi penyebaran data kontinu dari variabel Angka Harapan Hidup:
ggplot(data_real, aes(x = Angka_Harapan_Hidup)) +
geom_histogram(binwidth = 3, fill = "#27ae60", color = "white") +
labs(
title = "Distribusi Angka Harapan Hidup",
x = "Angka Harapan Hidup (Tahun)",
y = "Frekuensi"
) +
theme_minimal()
Berdasarkan histogram di atas, pola sebaran angka harapan hidup terpusat pada kisaran 70 hingga 80 tahun.
Berikut adalah analisis hubungan antara dua variabel numerik (Pengeluaran Kesehatan vs Angka Harapan Hidup):
ggplot(data_real, aes(x = Pengeluaran_Kesehatan, y = Angka_Harapan_Hidup)) +
geom_point(color = "#e74c3c", size = 3) +
geom_smooth(method = "lm", se = FALSE, color = "black", linetype = "dashed") +
labs(
title = "Hubungan Pengeluaran Kesehatan vs Angka Harapan Hidup",
x = "Pengeluaran Kesehatan (Ribu Rp)",
y = "Angka Harapan Hidup (Tahun)"
) +
theme_minimal()
Berdasarkan scatter plot di atas, terdapat kecenderungan korelasi positif di mana semakin tinggi alokasi pengeluaran kesehatan, semakin tinggi pula angka harapan hidupnya.
Sebagian besar responden memiliki kondisi kesehatan dalam kategori Baik.
Kategori kesehatan Cukup dan Kurang berada pada urutan berikutnya dengan frekuensi yang lebih rendah.
Terdapat korelasi positif antara besarnya alokasi pengeluaran kesehatan dengan tingkat angka harapan hidup.
Semakin tinggi pengeluaran/investasi finansial yang dialokasikan untuk kesehatan, maka semakin tinggi pula kecenderungan angka harapan hidup individu/masyarakat tersebut.
Laporan visualisasi ini secara keseluruhan menunjukkan bahwa alokasi finansial yang memadai pada sektor kesehatan berbanding lurus dengan peningkatan kualitas dan angka harapan hidup masyarakat.