Analisis Cluster Hierarchy Untuk Pengelompokkan Kota/Kabupaten di Nusa Tenggara Timur Berdasarkan Indikator Pendidikan Usia 15 Tahun Ke Atas

Amellia Megadita Pratiwi

Mei 2022


1 PENDAHULUAN

1.1 Latar Belakang

Pendidikan merupakan kompenen penting dalam pembangunan bangsa. Kualitas pendidikan dapat menggambarkan seberapa baik SDM suatu negara. Dengan kualitas pendidikan yang baik dapat meningkatkan potensi untuk menghasilkan SDM yang unggul dan dapat bersaing di masa depan. Menurut Alpian,Y dkk., (2019) pendidikan sangatlah penting bagi manusia dengan pendidikan manusia dapat mengembangkan kompetensi diri untuk menjawab tantangan zaman. Maka dari itu peningkatan kualitas pendidikan menjadi hal yang perlu diperhatikan oleh pemerintah.

Nusa Tenggara Timur merupakan salah satu provinsi di Indonesia yang dikenal sebagai wilayah dengan tingkat pendidikan yang rendah bila dibandingkan wilayah lain di Indonesia. Menurut data BPS (2019) rata-rata lama sekolah penduduk NTT adalah 7,99 tahun, angka tersebut dapat dikatakan cukup rendah. Berdasarkan Peraturan Presiden Tahun 2015 sebagian besar kabupaten di Nusa Tenggara Timur masuk dalam kategori daerah tertinggal. Oleh karena itu daerah-daerah tersebut perlu penangan khusus yaitu memerlukan perhatian dalam pengembangan daerah dalam hal transportasi, infrastruktur, dan juga tenaga pengajar (Hermansyah, A. K., dkk, 2020). Oleh sebab itu diperlukan langkah peningkatan kualitas pendidikan di provinsi ini.

Salah satu cara dalam meningkatakan kualitas pendidikan adalah dengan mengelompokkan kota/kabupaten yang memiliki kriteria sama dengan menggunakan metode clustering. Dengan adanya pengelompokkan tersebut pemerintah daerah dapat mengetahui daerah mana yang memerlukan perhatian khusus dalam mengatasi masalah pendidikan. Selain itu pengelompokkan akan memberi kemudahan dalam menentukan kebijakan yang harus diambil untuk setiap kelompok tersebut.

1.2 Statistika Deskriptif

Statistika deskriptif adalah metode-metode statistika yang digunakan untuk menggambarkan data yang telah dikumpulkan (Mason, 1996). Data yang ada perlu disajikan agar mudah dimengerti, menarik, komunikatif, dan informatif bagi pembaca. Statistika deskriptif memberikan informasi mengenai data namun tidak melakukan penarikan kesimpulan. Contoh penerapan statistika deskriptif yaitu, penyajian grafik, gambar, diagram, tabel, ukuran pemusatan data, maupun ukuran penyebaran data.

1.3 Analisis Cluster

Analisis cluster merupakan salah satu metode dalam analisis multivariat yang bertujuan untuk mengidentifikasi kesamaan entitas dari karakteristik yang dimilikinya (Hair, Black, Anderson, dan Tatham, 1987). Analisis cluster dilakukan untuk mengelompokkan objek-objek yang memiliki kesamaan. Analisis ini termasuk dalam unsupervised learning karena cluster yang terbentuk belum memiliki label. Tujuan akhir dari suatu pengelompokkan adalah didapatkan keragaman yang besar antar cluster dan keragaman minimum antara objek dalam cluster.

Ukuran kesamaan (similarity) dalam analisis klaster ditentukan berdasarkan jarak (distance) antar titik (Gudono, 2012). Salah satunya adalah dengan menggunakan jarak Euclidian dengan rumus sebagai berikut (Johnson, R. A., dan Wichern, D. W, 2014) :

\[ d(x_i,x_j)= \sqrt{\sum\limits_{i}^{i\ne j}{(x_{ik}-x_{jk})^2}}\tag{1} \] dengan \(i= 1,2,..n\), \(j=1,2,..,p\), dan \(i\ne j\).

Salah satu metode analisis cluster adalah hierarchical clustering. Dalam Irwansyah, E., dan Faisal, M (2015) disebutkan bahwa hierarchical clustering adalah metode dimana data dikelompokkan melalui suatu bagan yang berupa hirarki, dimana terdapat penggabungan dua grup yang terdekat di setiap iterasinya ataupun pembagian dari seluruh set data kedalam cluster. Salah satu metode dalam hierarchical clustering adalah agglomerative method.


Gambar 1 Agglomerative dan Divisive Clustering Hierarchy pada Data Object (a,b,c,d,e) (Tan,P.N, Steinbach, M, dan Kumar.V, 2013)

Dalam analisis cluster dikenal beberapa metode pautan yang umum digunakan diantaranya yaitu:

  • Single Linkage
    Jarak terdekat atau tautan tunggal memberikan hasil bila kelompok-kelompok digabungankan menurut jarak antara anggota-anggota yang terdekat diantara dua kelompok. Dengan terlebih dahulu menghitung matriks jarak, lalu didapatkan dengan persamaan sebagai berikut (Johnson, R. A., dan Wichern, D. W, 2014):
    \[ d_{(UV)W} = min(d_{UV},d_{VW})\tag{2} \]

  • Complete Linkage
    Pada metode ini seluruh objek dalam suatu cluster dikaitkan dengan jarak maksimum. Sama seperti single linkage kita perlu menghitung matriks jarak, lalu dihitung dengan persamaan berikut (Johnson, R. A., dan Wichern, D. W, 2014):
    \[ d_{(UV)W} = max(d_{UV},d_{VW})\tag{3} \]

  • Average Linkage
    Pada metode ini dilakukan pengelompokkan dengan menguunakan jarak rata-rata atau tautan rata-rata digabungkan menurut jarak rata-rata pasangan-pasangan anggota masing-masing pada himpunan di antara dua kelompok berikut (Nofriansyah, D dan Nurcahyo, G, 2015):  \[ d_{(UV)W} = \frac{\sum\limits_{i}\sum\limits_{k}{d_{ik}}}{N_{(UV)}N_W}\tag{4} \]

  • Metode Ward
    Metode ward adalah metode klasterisasi yang bertujuan untuk mendapatkan kelompok yang memiliki varian internal sekecil mungkin. Metode ini memaksimumkan homogenitas di dalam satu kelompok. Ukuran yang digunakan adalah Sum of Square Error (SSE) variabel. Metode Ward dapat dihitung dengan berdasarkan persamaan sebagai berikut:
    \[ SSE =\sum\limits_{i=1}^{n}{({X_i - \bar x})'- (X_i - \bar x)}\tag{5} \]

1.4 Data

Data yang digunakan dalam penelitian ini adalah data sekunder yang diambil dari Statitsitik Pendidikan Provinsi Nusa Tenggara Timur tahun 2020 dari website Badan Pusat Statistik Nusa Tenggara Timur. Dengan variabel yang digunakan untuk pengelompokkan kabupaten/kota di Provinsi NTT adalah sebagai berikut: Angka partisipasi sekolah usia 16-18 tahun \((X_1)\), Angka partisipasi kasar siswa SMA \((X_2)\), Angka partisipasi murni siswa SMA \((X_3)\), Angka buta huruf 15 tahun ke atas \((X_4)\), dan Rata-rata lama sekolah penduduk 15 tahun ke atas \((X_5)\).

2 SOURCE CODE

2.1 Library yang Dibutuhkan

> # Library
> library(readxl)
> library(cluster)
> library(dendextend)
> library(factoextra)
> library(tidyverse)

2.2 Memanggil Data

> dataNTT = read_excel("dataNTT.xlsx")
> data = as.data.frame(dataNTT)
> #Menampilkan beberapa data awal 
> kable(head(data),
+       caption="Tabel 1 Data Indikator Pendidikan Kota/Kab di NTT")
Tabel 1 Data Indikator Pendidikan Kota/Kab di NTT
Daerah X1 X2 X3 X4 X5
Sumba Barat 78.93 90.39 56.39 13.40 7.39
Sumba Timur 70.00 78.94 51.39 4.30 7.58
Kupang 80.86 95.82 58.35 7.18 8.06
Timor Tengah Selatan 71.29 80.16 53.29 10.01 7.06
Timor Tengah Utara 74.05 74.96 54.37 3.89 8.17
Belu 61.93 72.77 54.76 7.61 7.79

2.3 Statistika Deskriptif

> #Menampilkan statistik deskriptif dari data Indikator Pendidikan di NTT
> StatDeskriptif = data.frame(
+   var = c("APS", "APK", "APM", "Angka Buta Huruf", "Rata-Rata Lama Sekolah"),
+   min = c(min(data$X1), min(data$X2), min(data$X3), min(data$X4), min(data$X5)),
+   max = c(max(data$X1), max(data$X2), max(data$X3), max(data$X4), max(data$X5)),
+   mean = c(mean(data$X1), mean(data$X2), mean(data$X3), mean(data$X4), mean(data$X5)),
+   stdv = c(sd(data$X1), sd(data$X2), sd(data$X3), sd(data$X4), sd(data$X5))
+ )
> Tabel2= kable(StatDeskriptif,caption="Tabel 2 Statistika Deskriptif")

2.4 Analisis Cluster

  • Transformasi data
> #Menstandarisasi data
> data1 = scale(data[,2:6])
  • Jarak Euclidean
> #Mencari jarak dengan metode Euclidean
> jarak = dist(data1, method = "euclidean")
  • Clusterisasi
> #Melakukan klasterisasi dengan 4 metode berbeda
> single = hclust(jarak, method="single")
> complete = hclust(jarak, method="complete")
> average = hclust(jarak, method="average")
> ward = hclust(jarak, method = "ward.D2")
> #Menghitung korelasi antara jarak cophenetic dengan jarak asli
> cor_single = cor((cophenetic(single)), jarak)
> cor_complete = cor((cophenetic(complete)), jarak)
> cor_avg = cor((cophenetic(average)), jarak)
> cor_ward = cor((cophenetic(ward)), jarak)
> 
> #Membuat data frame untuk jarak cophnetic
> jarak_cophenetic <- data.frame (
+   metode = c("Single", "Complete", "Average", "Ward"),
+   korelasi = c(cor_single, cor_complete, cor_avg, cor_ward)
+ )
> 
> #Data frame ditampilkan dalam bentuk tabel
> Tabel3 = kable(jarak_cophenetic, caption = "Tabel 3 Korelasi Jarak Cophnetic dengan Jarak Asli")
> #Mencari jumlah cluster optimum dengan plot WSS
> plot_wss= fviz_nbclust(data1, FUN=hcut, method= "wss")
> plot_wss
Gambar 2 Plot WSS

Gambar 2 Plot WSS

> #Membuat plot dendogram untuk metode average linkage
> plot(average, data$Daerah, hang = -1)
> #Menandai anggota kelompok pada setiap cluster pada dendogram
> rect.hclust(average,k=3,border=2:3)
Gambar 3 Dendogram Hasil Clustering

Gambar 3 Dendogram Hasil Clustering

> #Menampilkan hasil cluster dalam bentuk data frame
> average.cut = cutree(average,3)
> daftar_cluster = data.frame(Daerah=data$Daerah, Cluster= average.cut)
> #Mengurutkan kota/kab berdasarkan cluster dan diubah dalam bentuk tabel
> kable(arrange(daftar_cluster, Cluster),
+        caption="Tabel 4 Tabel Hasil Cluster")
Tabel 4 Tabel Hasil Cluster
Daerah Cluster
Sumba Barat 1
Kupang 1
Timor Tengah Selatan 1
Sikka 1
Ende 1
Manggarai 1
Rote Ndao 1
Sumba Tengah 1
Sumba Barat Daya 1
Sabu Raijua 1
Malaka 1
Sumba Timur 2
Timor Tengah Utara 2
Belu 2
Alor 2
Lembata 2
Flores Timur 2
Ngada 2
Manggarai Barat 2
Nagekeo 2
Manggarai Timur 2
Kota Kupang 3
> #Mencari summary untuk mengetahui karakteristik setiap cluster
> summary = data[,2:6]%>%
+     mutate(Cluster=average.cut)%>%
+     group_by(Cluster)%>%
+     summarise_all("mean")
> 
> #Mengubah menjadi data frame
> tabelSummary= as.data.frame(summary)
> 
> #Mengubah nama kolom dan tampilan data frame diubah menjadi bentuk tabel
> Tabel5 = kable(
+   tabelSummary %>%
+   rename(
+     "APS" = X1,
+     "APK"= X2,
+     "APM" = X3, 
+     "Angka Buta Huruf"= X4,
+     "Rata-Rata Lama Sekolah" = X5
+     ), caption = "Tabel 5 Karakteristik Setiap Cluster")

Data dipanggil dengan package readxl digunakan untuk memasukkan file excel ke dalam R. Kemudian mengubah struktur data menjadi data frame dengan menggunakan function as.data.frame. Selanjutnya ingin diketahui statistika deskriptif dari masing-masing variabel yang digunakan. Pertama min untuk mengetahui nilai terendah, max untuk mengetahui nilai tertinggi, mean mengetahui rata-rata, dan sd untuk mendapatkan standar deviasi. Kemudian semua informasi tersebut dibentuk dalam bentuk data frame, selanjutkan digunakan function kable untuk menampilkan data frame dalam bentuk tabel.

Selanjutnya untuk analisis cluster pertama karena kelima variabel memiliki satuan yang berbeda beda perlu dilakukan standarisasi data dengan menggunakan function scale. Argumen yang diisikan pada function ini adalah data yang ingin distandarisasi dalam hal ini yaitu kolom ke 2 sampai 6. Kemudian akan dicari jarak antar titik dengan menggunakan dist, dimana diisikan 2 argumen yaitu data yang telah di standarisasi dan metode penentuan jarak yang digunakan kali ini akan digunakan jarak euclidean.

Lalu dengan menggunakan function hclust dilakukakan klasterisasi dengan menggunakan hierarchical cluster. Dimana terdapat dua argumen yaitu d yang diisikan dengan jarak antar titik yang sudah didapatkan sebelumnya dan argumen kedua yaitu method untuk menentukan metode aglomerasi yang digunakan. Kali ini akan digunakan 4 metode yaitu “single”, “complete”, “average”, dan “ward”.

Dari keempat metode aglomerasi ingin dicari metode manakah yang paling baik, dengan melihat korelasi antara jarak cophenetic dengan jarak aslinya. Sehingga digunakan function cor dengan 2 argumen, pertama jarak cophenetic dengan menggunakan function cophenetic (dengan hasil clustering sesuai metode yang digunakan sebagai argumen) untuk mencari jarak cophnetic. Sementara argumen kedua pada fungsi cor yaitu jarak asli dengan metode euclidean. Setelah mencari nilai korelasi untuk keempat metode aglomerasi, informasi tersebut ditampung dalam data frame dan ditampilkan dalam bentuk tabel dengan kable.

Function fviz_nbclustdigunakan untuk menentukan jumlah cluster optimal yang dapat digunakan. Argumen pertama yang diisikan adalah x yaitu matrix atau data frame dari data yang ingin dilakukan klasterisasi, kedua FUN adalah argumen yang digunakan untuk memanggil fungsi lain kemudian diteruskan ke fungsi yang saat ini diterapkan. FUN disini digunakan untuk memanggil function hclust untuk menghitung klasterisasi dengan metode hirarki dan melakukan pemotongan pohon menjadi k klaster. Argumen terakhir yaitu method untuk menentukan metode yang digunakan dalam pengestimasian jumlah cluster optimal kali ini digunakan 2 metode yaitu wss dan silhoutte.

Setelah diketahui metode terbaik dan k klaster yang optimal selanjutnya akan dibuat dendogram. Digunakan plot untuk membuat dendogram memasukkan 3 argumen pertama x, hasil dari proses clustering, label untuk menampilkan objek yang dikelompokkan, dan terakhir hang untuk membuat label menggantung di bawah plot. Selanjutnya untuk rect.hclustdigunakan untuk menggambar kotak disekitar dendogram untuk menandai setiap kelompok yang terbentuk. Diisikan argumen tree dalam hal ini adalah hasil dari proses clustering oleh hclust, k adalah angka numerik sesuai jumlah cluster, and border warna batas persegi pada dendogram.

Kemudian ingin dibuat tabel yang berisi daftar kota/kabupaten dan berada di cluster manakah kota/kabupaten tersebut. Pertama dengan menggunakan cutree untuk memotong dendogram menjadi k grup, dengan argumen tree sebagai produk cluster dan k sebagai jumlah cluster. Kemudian dengan data_frame dibentuk tabel dengan 2 kolom yaitu daerah(kota/kab) dan cluster lalu diurutkan berdasarkan cluster.

Terakhir ingin mengatahui summary dari setiap cluster yang terbentuk. Pertama hanya digunakan data pada kolom 2 sampai 6. Digunakan %>% untuk mempersingkat syntax. Lalu digunakan mutate untuk membuat variabel baru dan mempertahankan yang sudah ada. Dengan argumen yang diisikan yaitu data untuk mengisikan variabel yang ingin ditambahkan. Kemudian dikelompokkan dengan menggunakan group_by terakhir untuk mendapatkan rata-rata untuk semua variabel digunakan summarise_all dengan argument “mean”, lalu diubah dalam bentuk data frame. Untuk mempermudah pembaca kolom variabel X1 sampai X5 diubah menjadi nama variabel yaitu APS, APK, dan seterusnya dengan bantuan %>% dan rename kemudian menggunakan kable data frame diubah menjadi tampilan tabel.

3 HASIL DAN PEMBAHASAN

3.1 Statistika Deskriptif

Berdasarkan hasil perhitungan hasil statistika deskriptif dapat dilihat karakteristik indikator pendidikan di provinsi NTT pada tabel 2 berikut:

> Tabel2
Tabel 2 Statistika Deskriptif
var min max mean stdv
APS 61.93 88.74 74.056818 5.9582655
APK 62.95 111.59 83.057273 12.7419103
APM 43.86 70.58 53.993636 6.9008782
Angka Buta Huruf 1.24 13.96 6.157273 4.2067748
Rata-Rata Lama Sekolah 6.13 11.19 7.909091 0.9328498

Beberapa informasi penting yang dapat diambil dari tabel tersebut yaitu, APS memiliki rata-rata sebesar 74.057%, sementara APK memiliki rata-rata sebesar 83.057% dan APM sebesar 53.994%. Angka tersebut masih berada di bawah target nasional yaitu 100%. Rata- rata angka buta huruf sebesar 6.157% dengan rata-rata lama sekolah yang masih rendah yaitu sekitar 7-8 tahun. Nilai standart deviasi yang cukup besar pada APK yaitu 12.449% pada APK menunjukkan perbedaan yang cukup tinggi antar kabupaten/kota artinya partisipasi penduduk yang sedang mengenyam pendidikan sesuai dengan jenjang pendidikannya di provinsi NTT masih belum merata untuk setiap kabupaten dan kotanya.

3.2 Analisis Cluster

Analisis klaster dilakukan pada variabel-variabel yang ada didalam indikator pendidikan. Dalam hal ini digunakan tiga metode yaitu single linkage, average linkage, dan complete linkage. Dari ketiga metode tersebut dilakukan pemilihan metode yang paling baik dengan menggunakan korelasi cophenetic distance dengan jarak original masing-masing observasi yang telah dihitung. Semakin besar nilai korelasi artinya semakin baik pengelompokkan dengan menggunakan metode tersebut. Nilai korelasi pada masing-masing metode ditunjukan pada tabel 2 berikut:

> Tabel3
Tabel 3 Korelasi Jarak Cophnetic dengan Jarak Asli
metode korelasi
Single 0.8037817
Complete 0.7642317
Average 0.8367742
Ward 0.6059704

Berdasarkan tabel 3 tersebut dapat diketahui bahwa metode pengolompokkan yang paling baik adalah metode average linkage karena memiliki nilai korelasi paling besar diantara ketiga metode lainnya sebesar 0.8367.

Selanjutnya menentukan jumlah klaster optimum yang digunakan untuk pengelompokkan dengan menggunakan jumlah kuadrat dalam kelompok yang terkecil. Ditentukan oleh within cluster sum of squares (WSS) minimum seperti pada gambar 2 di bawah ini:

> plot_wss
Gambar 2 Plot WSS

Gambar 2 Plot WSS

Berdasarkan plot diatas terlihat bahwa pada saat jumlah klaster sebanyak 3 sudah tidak terjadi penurunan WSS yang signifikan. Sehingga dapat disimpulkan jumlah klaster optimum yang dapat digunakan adalah sebanyak 3 klaster. Sebanyak 3 klaster akan menggambarkan kabupaten/kota di Nusa Tenggara Timur yang memiliki kesamaan kondisi berdasarkan indikator pendidikan

Dari hasil klasterisasi dengan melihat dendogram pada gambar 3 didapatkan hasil pengelompokkan setiap kabupaten/kota di provinsi NTT. Terlihat bahwa kelompok 1 terdiri dari 11 anggota, kelompok 2 terdiri dari 9 anggota, dan terakhir kelompok 3 terdiri dari 1 anggota. Adapun anggota kabupaten/kota pada setiap kelompok dengan metode average linkage berdasarkan indikator pendidikan sebagai berikut:

  • Kelompok 1: Sumba Barat, Kupang, Timor Tengah Selatan, Sikka, Ende, Manggarai, Rota Ndao, Sumba Tengah, Sumba Barat Daya, Sabu Raijua, dan Malaka.

  • Kelompok 2: Sumba Timur, Timor Tengah Utara, Belu, Alor, Lembata, Flores Timur, Ngada, Manggarai Barat, dan Nagakeo.

  • Kelompok 3: Kota Kupang.

Dari setiap klaster yang terbentuk memeliki ciri atau karakteristik masing-masing. Dapat dilihat dari perhitungang rata-rata untuk setiap kelompok sebagai berikut:

> Tabel5
Tabel 5 Karakteristik Setiap Cluster
Cluster APS APK APM Angka Buta Huruf Rata-Rata Lama Sekolah
1 76.56727 88.46909 54.40091 9.110909 7.427273
2 69.82700 74.25100 52.32000 3.400000 8.111000
3 88.74000 111.59000 66.25000 1.240000 11.190000

Berdasarkan tabel 5 tersebut dapat ditarik beberapa kesimpulan sebagai berikut:
- Cluster 1:
Untuk APK, APM, dan APS pada kelompok ini berada diurutan kedua diantara cluster lainnya. Namun cluster 1 memiliki angka buta huruf tertinggi dibandingankan dan rata-rata lama sekolah terendah dibandingkan 2 cluster lainnya. Maka untuk cluster ini dapat difokuskan untuk menurunkan angka buta huruf sehingga semakin banyak penduduk yang dapat membaca dan menulis serta meningkatkan lagi rata-rata lama sekolah agar semakin banyak penduduk yang mengenyam pendidikan hingga paling tidak Sekolah Menengah Atas, sembari meningkatkan partisipasi penduduk dalam pendidikan sehingga nilai APK, APM, dan APS meningkat pula.
- Cluster 2:
Untuk APK, APM, dan APS pada kelompok ini memiliki nilai terendah diantara cluster lainnya. Angka buta huruf sudah cukup rendah namun rata-rata lama sekolah nampaknya masih perlu ditingkatkan lagi. Maka untuk cluster ini dapat difokuskan pada peningkatan rata-rata lama sekolah dan partisipasi penduduk dalam pendidikan sehingga nilai APK, APM, dan APS dapat meningkat. *
- Cluster 3:
Untuk APK, APM, dan APS pada kelompok ini merupakan yang tertinggi dibandingkan 2 cluster lain. Angka buta huruf terendah dan rata-rata lama sekolah tertinggi bahkan hampir sesuai dengan anjuran wajib belajar 12 tahun. Dapat disimpulkan Kota Kupang memiliki kondisi pendidikan yang paling baik dibandingkan daerah lainnya.

4 DAFTAR PUSTAKA

Alpian, Y., Anggraeni, S. W., Wiharti, U., & Soleha, N. M. (2019). Pentingnya pendidikan bagi manusia. Jurnal Buana Pengabdian, 1(1), 66-72, (Online), (https://journal.ubpkarawang.ac.id/index.php/JurnalBuanaPengabdian/article/view/58)

BPS Provinsi NTT. Statistik Pendidikan Provinsi Nusa Tenggara Timur 2019. 2019. (Online), (https://ntt.bps.go.id/publication/2020/03/13/04cec3d22184c1c3fb2f612a/statistik- pendidikan-provinsi-nusa-tenggara-timur-2019.html)

BPS Provinsi NTT. Statistik Pendidikan Provinsi Nusa Tenggara Timur 2020. 2020. Online), (https://ntt.bps.go.id/publication/2021/03/16/b89689c7de337e792a363c3a/statistik- pendidikan-provinsi-nusa-tenggara-timur-2020.html)

Gudono. 2012. Analisis Data Multivariat edisi 2. Yogyakarta. BPFE

Hair, J. F., Black, W. C., Anderson, R. E., & Tatham, R. L. (1987). Multivariate Data Analysis with Readings. New York: Macmillan Publishing Company.
Hermansyah, A. K., Sumarsono, A., Rahayu, D. P., & Fredy, F. (2020). Motivasi Tenaga Pengajar Di Pedalaman Papua Dalam Mengajar dan Melanjutkan Studi pada Jurusan Pendidikan Guru Sekolah Dasar (Sebuah Kajian Fenomenologis). Sekolah Dasar: Kajian Teori Dan Praktik Pendidikan, 29(1), 51-63. (Online), (http://journal2.um.ac.id/index.php/sd/article/view/12339)

Irwansyah, E., & Faisal, M. (2015). Advanced Clustering: Teori dan Aplikasi. Deepublish..

Johnson, R. A., & Wichern, D. W. (2014). Applied multivariate statistical analysis (Vol. 6). London, UK:: Pearson.

Mason, R. D. 1996. Teknik Statistika untuk Bisnis dan Ekonomi. Jakarta: Erlangga.

Nofriansyah, D., & Nurcahyo, G. W. 2015. Algoritma Data Mining dan Pengujian. Deepublish.

Tan, P. N., Steinbach, M., & Kumar, V. 2013. Data mining cluster analysis: basic concepts and algorithms. Introduction to data mining, 487-533.