Pendidikan merupakan kompenen penting dalam pembangunan bangsa. Kualitas pendidikan dapat menggambarkan seberapa baik SDM suatu negara. Dengan kualitas pendidikan yang baik dapat meningkatkan potensi untuk menghasilkan SDM yang unggul dan dapat bersaing di masa depan. Menurut Alpian,Y dkk., (2019) pendidikan sangatlah penting bagi manusia dengan pendidikan manusia dapat mengembangkan kompetensi diri untuk menjawab tantangan zaman. Maka dari itu peningkatan kualitas pendidikan menjadi hal yang perlu diperhatikan oleh pemerintah.
Nusa Tenggara Timur merupakan salah satu provinsi di Indonesia yang dikenal sebagai wilayah dengan tingkat pendidikan yang rendah bila dibandingkan wilayah lain di Indonesia. Menurut data BPS (2019) rata-rata lama sekolah penduduk NTT adalah 7,99 tahun, angka tersebut dapat dikatakan cukup rendah. Berdasarkan Peraturan Presiden Tahun 2015 sebagian besar kabupaten di Nusa Tenggara Timur masuk dalam kategori daerah tertinggal. Oleh karena itu daerah-daerah tersebut perlu penangan khusus yaitu memerlukan perhatian dalam pengembangan daerah dalam hal transportasi, infrastruktur, dan juga tenaga pengajar (Hermansyah, A. K., dkk, 2020). Oleh sebab itu diperlukan langkah peningkatan kualitas pendidikan di provinsi ini.
Salah satu cara dalam meningkatakan kualitas pendidikan adalah dengan mengelompokkan kota/kabupaten yang memiliki kriteria sama dengan menggunakan metode clustering. Dengan adanya pengelompokkan tersebut pemerintah daerah dapat mengetahui daerah mana yang memerlukan perhatian khusus dalam mengatasi masalah pendidikan. Selain itu pengelompokkan akan memberi kemudahan dalam menentukan kebijakan yang harus diambil untuk setiap kelompok tersebut.
Statistika deskriptif adalah metode-metode statistika yang digunakan untuk menggambarkan data yang telah dikumpulkan (Mason, 1996). Data yang ada perlu disajikan agar mudah dimengerti, menarik, komunikatif, dan informatif bagi pembaca. Statistika deskriptif memberikan informasi mengenai data namun tidak melakukan penarikan kesimpulan. Contoh penerapan statistika deskriptif yaitu, penyajian grafik, gambar, diagram, tabel, ukuran pemusatan data, maupun ukuran penyebaran data.
Analisis cluster merupakan salah satu metode dalam analisis multivariat yang bertujuan untuk mengidentifikasi kesamaan entitas dari karakteristik yang dimilikinya (Hair, Black, Anderson, dan Tatham, 1987). Analisis cluster dilakukan untuk mengelompokkan objek-objek yang memiliki kesamaan. Analisis ini termasuk dalam unsupervised learning karena cluster yang terbentuk belum memiliki label. Tujuan akhir dari suatu pengelompokkan adalah didapatkan keragaman yang besar antar cluster dan keragaman minimum antara objek dalam cluster.
Ukuran kesamaan (similarity) dalam analisis klaster ditentukan berdasarkan jarak (distance) antar titik (Gudono, 2012). Salah satunya adalah dengan menggunakan jarak Euclidian dengan rumus sebagai berikut (Johnson, R. A., dan Wichern, D. W, 2014) :
\[ d(x_i,x_j)= \sqrt{\sum\limits_{i}^{i\ne j}{(x_{ik}-x_{jk})^2}}\tag{1} \] dengan \(i= 1,2,..n\), \(j=1,2,..,p\), dan \(i\ne j\).
Salah satu metode analisis cluster adalah hierarchical clustering. Dalam Irwansyah, E., dan Faisal, M (2015) disebutkan bahwa hierarchical clustering adalah metode dimana data dikelompokkan melalui suatu bagan yang berupa hirarki, dimana terdapat penggabungan dua grup yang terdekat di setiap iterasinya ataupun pembagian dari seluruh set data kedalam cluster. Salah satu metode dalam hierarchical clustering adalah agglomerative method.
Gambar 1 Agglomerative dan Divisive Clustering
Hierarchy pada Data Object (a,b,c,d,e) (Tan,P.N, Steinbach, M, dan
Kumar.V, 2013)
Dalam analisis cluster dikenal beberapa metode pautan yang umum digunakan diantaranya yaitu:
Single Linkage
Jarak terdekat atau tautan tunggal memberikan hasil bila
kelompok-kelompok digabungankan menurut jarak antara anggota-anggota
yang terdekat diantara dua kelompok. Dengan terlebih dahulu menghitung
matriks jarak, lalu didapatkan dengan persamaan sebagai berikut
(Johnson, R. A., dan Wichern, D. W, 2014):
\[
d_{(UV)W} = min(d_{UV},d_{VW})\tag{2}
\]
Complete Linkage
Pada metode ini seluruh objek dalam suatu cluster dikaitkan dengan jarak
maksimum. Sama seperti single linkage kita perlu menghitung matriks
jarak, lalu dihitung dengan persamaan berikut (Johnson, R. A., dan
Wichern, D. W, 2014):
\[
d_{(UV)W} = max(d_{UV},d_{VW})\tag{3}
\]
Average Linkage
Pada metode ini dilakukan pengelompokkan dengan menguunakan jarak
rata-rata atau tautan rata-rata digabungkan menurut jarak rata-rata
pasangan-pasangan anggota masing-masing pada himpunan di antara dua
kelompok berikut (Nofriansyah, D dan Nurcahyo, G, 2015): \[
d_{(UV)W} =
\frac{\sum\limits_{i}\sum\limits_{k}{d_{ik}}}{N_{(UV)}N_W}\tag{4}
\]
Metode Ward
Metode ward adalah metode klasterisasi yang bertujuan untuk mendapatkan
kelompok yang memiliki varian internal sekecil mungkin. Metode ini
memaksimumkan homogenitas di dalam satu kelompok. Ukuran yang digunakan
adalah Sum of Square Error (SSE) variabel. Metode Ward dapat
dihitung dengan berdasarkan persamaan sebagai berikut:
\[
SSE =\sum\limits_{i=1}^{n}{({X_i - \bar x})'- (X_i - \bar x)}\tag{5}
\]
Data yang digunakan dalam penelitian ini adalah data sekunder yang diambil dari Statitsitik Pendidikan Provinsi Nusa Tenggara Timur tahun 2020 dari website Badan Pusat Statistik Nusa Tenggara Timur. Dengan variabel yang digunakan untuk pengelompokkan kabupaten/kota di Provinsi NTT adalah sebagai berikut: Angka partisipasi sekolah usia 16-18 tahun \((X_1)\), Angka partisipasi kasar siswa SMA \((X_2)\), Angka partisipasi murni siswa SMA \((X_3)\), Angka buta huruf 15 tahun ke atas \((X_4)\), dan Rata-rata lama sekolah penduduk 15 tahun ke atas \((X_5)\).
> # Library
> library(readxl)
> library(cluster)
> library(dendextend)
> library(factoextra)
> library(tidyverse)> dataNTT = read_excel("dataNTT.xlsx")
> data = as.data.frame(dataNTT)
> #Menampilkan beberapa data awal
> kable(head(data),
+ caption="Tabel 1 Data Indikator Pendidikan Kota/Kab di NTT")| Daerah | X1 | X2 | X3 | X4 | X5 |
|---|---|---|---|---|---|
| Sumba Barat | 78.93 | 90.39 | 56.39 | 13.40 | 7.39 |
| Sumba Timur | 70.00 | 78.94 | 51.39 | 4.30 | 7.58 |
| Kupang | 80.86 | 95.82 | 58.35 | 7.18 | 8.06 |
| Timor Tengah Selatan | 71.29 | 80.16 | 53.29 | 10.01 | 7.06 |
| Timor Tengah Utara | 74.05 | 74.96 | 54.37 | 3.89 | 8.17 |
| Belu | 61.93 | 72.77 | 54.76 | 7.61 | 7.79 |
> #Menampilkan statistik deskriptif dari data Indikator Pendidikan di NTT
> StatDeskriptif = data.frame(
+ var = c("APS", "APK", "APM", "Angka Buta Huruf", "Rata-Rata Lama Sekolah"),
+ min = c(min(data$X1), min(data$X2), min(data$X3), min(data$X4), min(data$X5)),
+ max = c(max(data$X1), max(data$X2), max(data$X3), max(data$X4), max(data$X5)),
+ mean = c(mean(data$X1), mean(data$X2), mean(data$X3), mean(data$X4), mean(data$X5)),
+ stdv = c(sd(data$X1), sd(data$X2), sd(data$X3), sd(data$X4), sd(data$X5))
+ )
> Tabel2= kable(StatDeskriptif,caption="Tabel 2 Statistika Deskriptif")> #Menstandarisasi data
> data1 = scale(data[,2:6])> #Mencari jarak dengan metode Euclidean
> jarak = dist(data1, method = "euclidean")> #Melakukan klasterisasi dengan 4 metode berbeda
> single = hclust(jarak, method="single")
> complete = hclust(jarak, method="complete")
> average = hclust(jarak, method="average")
> ward = hclust(jarak, method = "ward.D2")> #Menghitung korelasi antara jarak cophenetic dengan jarak asli
> cor_single = cor((cophenetic(single)), jarak)
> cor_complete = cor((cophenetic(complete)), jarak)
> cor_avg = cor((cophenetic(average)), jarak)
> cor_ward = cor((cophenetic(ward)), jarak)
>
> #Membuat data frame untuk jarak cophnetic
> jarak_cophenetic <- data.frame (
+ metode = c("Single", "Complete", "Average", "Ward"),
+ korelasi = c(cor_single, cor_complete, cor_avg, cor_ward)
+ )
>
> #Data frame ditampilkan dalam bentuk tabel
> Tabel3 = kable(jarak_cophenetic, caption = "Tabel 3 Korelasi Jarak Cophnetic dengan Jarak Asli")> #Mencari jumlah cluster optimum dengan plot WSS
> plot_wss= fviz_nbclust(data1, FUN=hcut, method= "wss")
> plot_wssGambar 2 Plot WSS
> #Membuat plot dendogram untuk metode average linkage
> plot(average, data$Daerah, hang = -1)
> #Menandai anggota kelompok pada setiap cluster pada dendogram
> rect.hclust(average,k=3,border=2:3)Gambar 3 Dendogram Hasil Clustering
> #Menampilkan hasil cluster dalam bentuk data frame
> average.cut = cutree(average,3)
> daftar_cluster = data.frame(Daerah=data$Daerah, Cluster= average.cut)
> #Mengurutkan kota/kab berdasarkan cluster dan diubah dalam bentuk tabel
> kable(arrange(daftar_cluster, Cluster),
+ caption="Tabel 4 Tabel Hasil Cluster")| Daerah | Cluster |
|---|---|
| Sumba Barat | 1 |
| Kupang | 1 |
| Timor Tengah Selatan | 1 |
| Sikka | 1 |
| Ende | 1 |
| Manggarai | 1 |
| Rote Ndao | 1 |
| Sumba Tengah | 1 |
| Sumba Barat Daya | 1 |
| Sabu Raijua | 1 |
| Malaka | 1 |
| Sumba Timur | 2 |
| Timor Tengah Utara | 2 |
| Belu | 2 |
| Alor | 2 |
| Lembata | 2 |
| Flores Timur | 2 |
| Ngada | 2 |
| Manggarai Barat | 2 |
| Nagekeo | 2 |
| Manggarai Timur | 2 |
| Kota Kupang | 3 |
> #Mencari summary untuk mengetahui karakteristik setiap cluster
> summary = data[,2:6]%>%
+ mutate(Cluster=average.cut)%>%
+ group_by(Cluster)%>%
+ summarise_all("mean")
>
> #Mengubah menjadi data frame
> tabelSummary= as.data.frame(summary)
>
> #Mengubah nama kolom dan tampilan data frame diubah menjadi bentuk tabel
> Tabel5 = kable(
+ tabelSummary %>%
+ rename(
+ "APS" = X1,
+ "APK"= X2,
+ "APM" = X3,
+ "Angka Buta Huruf"= X4,
+ "Rata-Rata Lama Sekolah" = X5
+ ), caption = "Tabel 5 Karakteristik Setiap Cluster")Data dipanggil dengan package readxl digunakan untuk
memasukkan file excel ke dalam R. Kemudian mengubah struktur data
menjadi data frame dengan menggunakan function
as.data.frame. Selanjutnya ingin diketahui statistika
deskriptif dari masing-masing variabel yang digunakan. Pertama
min untuk mengetahui nilai terendah, max untuk
mengetahui nilai tertinggi, mean mengetahui rata-rata, dan
sd untuk mendapatkan standar deviasi. Kemudian semua
informasi tersebut dibentuk dalam bentuk data frame, selanjutkan
digunakan function kable untuk menampilkan data
frame dalam bentuk tabel.
Selanjutnya untuk analisis cluster pertama karena kelima
variabel memiliki satuan yang berbeda beda perlu dilakukan standarisasi
data dengan menggunakan function scale. Argumen
yang diisikan pada function ini adalah data yang ingin distandarisasi
dalam hal ini yaitu kolom ke 2 sampai 6. Kemudian akan dicari jarak
antar titik dengan menggunakan dist, dimana diisikan 2
argumen yaitu data yang telah di standarisasi dan metode penentuan jarak
yang digunakan kali ini akan digunakan jarak euclidean.
Lalu dengan menggunakan function hclust
dilakukakan klasterisasi dengan menggunakan hierarchical
cluster. Dimana terdapat dua argumen yaitu d yang diisikan dengan
jarak antar titik yang sudah didapatkan sebelumnya dan argumen kedua
yaitu method untuk menentukan metode aglomerasi yang digunakan. Kali ini
akan digunakan 4 metode yaitu “single”, “complete”, “average”, dan
“ward”.
Dari keempat metode aglomerasi ingin dicari metode manakah yang
paling baik, dengan melihat korelasi antara jarak cophenetic
dengan jarak aslinya. Sehingga digunakan function
cor dengan 2 argumen, pertama jarak cophenetic
dengan menggunakan function cophenetic (dengan hasil
clustering sesuai metode yang digunakan sebagai argumen) untuk
mencari jarak cophnetic. Sementara argumen kedua pada fungsi
cor yaitu jarak asli dengan metode euclidean. Setelah mencari nilai
korelasi untuk keempat metode aglomerasi, informasi tersebut ditampung
dalam data frame dan ditampilkan dalam bentuk tabel dengan
kable.
Function fviz_nbclustdigunakan untuk menentukan
jumlah cluster optimal yang dapat digunakan. Argumen pertama
yang diisikan adalah x yaitu matrix atau data frame dari data
yang ingin dilakukan klasterisasi, kedua FUN adalah argumen yang
digunakan untuk memanggil fungsi lain kemudian diteruskan ke fungsi yang
saat ini diterapkan. FUN disini digunakan untuk memanggil
function hclust untuk menghitung klasterisasi
dengan metode hirarki dan melakukan pemotongan pohon menjadi k klaster.
Argumen terakhir yaitu method untuk menentukan metode yang digunakan
dalam pengestimasian jumlah cluster optimal kali ini digunakan
2 metode yaitu wss dan silhoutte.
Setelah diketahui metode terbaik dan k klaster yang optimal
selanjutnya akan dibuat dendogram. Digunakan plot untuk
membuat dendogram memasukkan 3 argumen pertama x, hasil dari proses
clustering, label untuk menampilkan objek yang dikelompokkan,
dan terakhir hang untuk membuat label menggantung di bawah plot.
Selanjutnya untuk rect.hclustdigunakan untuk menggambar
kotak disekitar dendogram untuk menandai setiap kelompok yang terbentuk.
Diisikan argumen tree dalam hal ini adalah hasil dari proses
clustering oleh hclust, k adalah angka numerik
sesuai jumlah cluster, and border warna batas persegi pada
dendogram.
Kemudian ingin dibuat tabel yang berisi daftar kota/kabupaten dan
berada di cluster manakah kota/kabupaten tersebut. Pertama dengan
menggunakan cutree untuk memotong dendogram menjadi k grup,
dengan argumen tree sebagai produk cluster dan k sebagai jumlah
cluster. Kemudian dengan data_frame dibentuk tabel
dengan 2 kolom yaitu daerah(kota/kab) dan cluster lalu
diurutkan berdasarkan cluster.
Terakhir ingin mengatahui summary dari setiap
cluster yang terbentuk. Pertama hanya digunakan data pada kolom
2 sampai 6. Digunakan %>% untuk mempersingkat syntax. Lalu digunakan
mutate untuk membuat variabel baru dan mempertahankan yang
sudah ada. Dengan argumen yang diisikan yaitu data untuk mengisikan
variabel yang ingin ditambahkan. Kemudian dikelompokkan dengan
menggunakan group_by terakhir untuk mendapatkan rata-rata
untuk semua variabel digunakan summarise_all dengan
argument “mean”, lalu diubah dalam bentuk data frame. Untuk mempermudah
pembaca kolom variabel X1 sampai X5 diubah menjadi nama variabel yaitu
APS, APK, dan seterusnya dengan bantuan %>% dan rename
kemudian menggunakan kable data frame diubah menjadi
tampilan tabel.
Berdasarkan hasil perhitungan hasil statistika deskriptif dapat dilihat karakteristik indikator pendidikan di provinsi NTT pada tabel 2 berikut:
> Tabel2| var | min | max | mean | stdv |
|---|---|---|---|---|
| APS | 61.93 | 88.74 | 74.056818 | 5.9582655 |
| APK | 62.95 | 111.59 | 83.057273 | 12.7419103 |
| APM | 43.86 | 70.58 | 53.993636 | 6.9008782 |
| Angka Buta Huruf | 1.24 | 13.96 | 6.157273 | 4.2067748 |
| Rata-Rata Lama Sekolah | 6.13 | 11.19 | 7.909091 | 0.9328498 |
Beberapa informasi penting yang dapat diambil dari tabel tersebut yaitu, APS memiliki rata-rata sebesar 74.057%, sementara APK memiliki rata-rata sebesar 83.057% dan APM sebesar 53.994%. Angka tersebut masih berada di bawah target nasional yaitu 100%. Rata- rata angka buta huruf sebesar 6.157% dengan rata-rata lama sekolah yang masih rendah yaitu sekitar 7-8 tahun. Nilai standart deviasi yang cukup besar pada APK yaitu 12.449% pada APK menunjukkan perbedaan yang cukup tinggi antar kabupaten/kota artinya partisipasi penduduk yang sedang mengenyam pendidikan sesuai dengan jenjang pendidikannya di provinsi NTT masih belum merata untuk setiap kabupaten dan kotanya.
Analisis klaster dilakukan pada variabel-variabel yang ada didalam indikator pendidikan. Dalam hal ini digunakan tiga metode yaitu single linkage, average linkage, dan complete linkage. Dari ketiga metode tersebut dilakukan pemilihan metode yang paling baik dengan menggunakan korelasi cophenetic distance dengan jarak original masing-masing observasi yang telah dihitung. Semakin besar nilai korelasi artinya semakin baik pengelompokkan dengan menggunakan metode tersebut. Nilai korelasi pada masing-masing metode ditunjukan pada tabel 2 berikut:
> Tabel3| metode | korelasi |
|---|---|
| Single | 0.8037817 |
| Complete | 0.7642317 |
| Average | 0.8367742 |
| Ward | 0.6059704 |
Berdasarkan tabel 3 tersebut dapat diketahui bahwa metode pengolompokkan yang paling baik adalah metode average linkage karena memiliki nilai korelasi paling besar diantara ketiga metode lainnya sebesar 0.8367.
Selanjutnya menentukan jumlah klaster optimum yang digunakan untuk pengelompokkan dengan menggunakan jumlah kuadrat dalam kelompok yang terkecil. Ditentukan oleh within cluster sum of squares (WSS) minimum seperti pada gambar 2 di bawah ini:
> plot_wssGambar 2 Plot WSS
Berdasarkan plot diatas terlihat bahwa pada saat jumlah klaster sebanyak 3 sudah tidak terjadi penurunan WSS yang signifikan. Sehingga dapat disimpulkan jumlah klaster optimum yang dapat digunakan adalah sebanyak 3 klaster. Sebanyak 3 klaster akan menggambarkan kabupaten/kota di Nusa Tenggara Timur yang memiliki kesamaan kondisi berdasarkan indikator pendidikan
Dari hasil klasterisasi dengan melihat dendogram pada gambar 3 didapatkan hasil pengelompokkan setiap kabupaten/kota di provinsi NTT. Terlihat bahwa kelompok 1 terdiri dari 11 anggota, kelompok 2 terdiri dari 9 anggota, dan terakhir kelompok 3 terdiri dari 1 anggota. Adapun anggota kabupaten/kota pada setiap kelompok dengan metode average linkage berdasarkan indikator pendidikan sebagai berikut:
Kelompok 1: Sumba Barat, Kupang, Timor Tengah Selatan, Sikka, Ende, Manggarai, Rota Ndao, Sumba Tengah, Sumba Barat Daya, Sabu Raijua, dan Malaka.
Kelompok 2: Sumba Timur, Timor Tengah Utara, Belu, Alor, Lembata, Flores Timur, Ngada, Manggarai Barat, dan Nagakeo.
Kelompok 3: Kota Kupang.
Dari setiap klaster yang terbentuk memeliki ciri atau karakteristik masing-masing. Dapat dilihat dari perhitungang rata-rata untuk setiap kelompok sebagai berikut:
> Tabel5| Cluster | APS | APK | APM | Angka Buta Huruf | Rata-Rata Lama Sekolah |
|---|---|---|---|---|---|
| 1 | 76.56727 | 88.46909 | 54.40091 | 9.110909 | 7.427273 |
| 2 | 69.82700 | 74.25100 | 52.32000 | 3.400000 | 8.111000 |
| 3 | 88.74000 | 111.59000 | 66.25000 | 1.240000 | 11.190000 |
Berdasarkan tabel 5 tersebut dapat ditarik beberapa kesimpulan
sebagai berikut:
- Cluster 1:
Untuk APK, APM, dan APS pada kelompok ini berada diurutan kedua diantara
cluster lainnya. Namun cluster 1 memiliki angka buta
huruf tertinggi dibandingankan dan rata-rata lama sekolah terendah
dibandingkan 2 cluster lainnya. Maka untuk cluster ini
dapat difokuskan untuk menurunkan angka buta huruf sehingga semakin
banyak penduduk yang dapat membaca dan menulis serta meningkatkan lagi
rata-rata lama sekolah agar semakin banyak penduduk yang mengenyam
pendidikan hingga paling tidak Sekolah Menengah Atas, sembari
meningkatkan partisipasi penduduk dalam pendidikan sehingga nilai APK,
APM, dan APS meningkat pula.
- Cluster 2:
Untuk APK, APM, dan APS pada kelompok ini memiliki nilai terendah
diantara cluster lainnya. Angka buta huruf sudah cukup rendah
namun rata-rata lama sekolah nampaknya masih perlu ditingkatkan lagi.
Maka untuk cluster ini dapat difokuskan pada peningkatan
rata-rata lama sekolah dan partisipasi penduduk dalam pendidikan
sehingga nilai APK, APM, dan APS dapat meningkat. *
- Cluster 3:
Untuk APK, APM, dan APS pada kelompok ini merupakan yang tertinggi
dibandingkan 2 cluster lain. Angka buta huruf terendah dan
rata-rata lama sekolah tertinggi bahkan hampir sesuai dengan anjuran
wajib belajar 12 tahun. Dapat disimpulkan Kota Kupang memiliki kondisi
pendidikan yang paling baik dibandingkan daerah lainnya.
Alpian, Y., Anggraeni, S. W., Wiharti, U., & Soleha, N. M. (2019). Pentingnya pendidikan bagi manusia. Jurnal Buana Pengabdian, 1(1), 66-72, (Online), (https://journal.ubpkarawang.ac.id/index.php/JurnalBuanaPengabdian/article/view/58)
BPS Provinsi NTT. Statistik Pendidikan Provinsi Nusa Tenggara Timur 2019. 2019. (Online), (https://ntt.bps.go.id/publication/2020/03/13/04cec3d22184c1c3fb2f612a/statistik- pendidikan-provinsi-nusa-tenggara-timur-2019.html)
BPS Provinsi NTT. Statistik Pendidikan Provinsi Nusa Tenggara Timur 2020. 2020. Online), (https://ntt.bps.go.id/publication/2021/03/16/b89689c7de337e792a363c3a/statistik- pendidikan-provinsi-nusa-tenggara-timur-2020.html)
Gudono. 2012. Analisis Data Multivariat edisi 2. Yogyakarta. BPFE
Hair, J. F., Black, W. C., Anderson, R. E., & Tatham, R. L.
(1987). Multivariate Data Analysis with Readings. New York: Macmillan
Publishing Company.
Hermansyah, A. K., Sumarsono, A., Rahayu, D. P., & Fredy, F. (2020).
Motivasi Tenaga Pengajar Di Pedalaman Papua Dalam Mengajar dan
Melanjutkan Studi pada Jurusan Pendidikan Guru Sekolah Dasar (Sebuah
Kajian Fenomenologis). Sekolah Dasar: Kajian Teori Dan Praktik
Pendidikan, 29(1), 51-63. (Online), (http://journal2.um.ac.id/index.php/sd/article/view/12339)
Irwansyah, E., & Faisal, M. (2015). Advanced Clustering: Teori dan Aplikasi. Deepublish..
Johnson, R. A., & Wichern, D. W. (2014). Applied multivariate statistical analysis (Vol. 6). London, UK:: Pearson.
Mason, R. D. 1996. Teknik Statistika untuk Bisnis dan Ekonomi. Jakarta: Erlangga.
Nofriansyah, D., & Nurcahyo, G. W. 2015. Algoritma Data Mining dan Pengujian. Deepublish.
Tan, P. N., Steinbach, M., & Kumar, V. 2013. Data mining cluster analysis: basic concepts and algorithms. Introduction to data mining, 487-533.