Eksplorasi dan Identifikasi Permasalahan Kualitas Data Mahasiswa

I. Pendahuluan

1.1 Latar Belakang

Data merupakan salah satu komponen penting dalam proses analisis karena hasil analisis sangat bergantung pada kualitas data yang digunakan. Data mahasiswa dapat digunakan untuk menggambarkan berbagai karakteristik mahasiswa, seperti identitas, kondisi akademik, kebiasaan belajar, penggunaan internet, waktu tidur, hingga tingkat kepuasan terhadap perkuliahan.

Dataset mahasiswa yang digunakan dalam kegiatan ini terdiri atas data yang tersusun dalam baris dan kolom dengan berbagai variabel yang menggambarkan karakteristik identitas, akademik, kebiasaan belajar, penggunaan internet, waktu tidur, dan kepuasan terhadap perkuliahan. Data tersebut dapat memberikan informasi yang berguna untuk analisis lebih lanjut, tetapi sebelum digunakan, kualitas data perlu diperiksa terlebih dahulu.

Dalam suatu dataset dapat ditemukan berbagai permasalahan yang dapat memengaruhi proses pengolahan dan hasil analisis. Beberapa permasalahan tersebut antara lain missing value, inkonsistensi penulisan data, duplikasi data, serta data yang tidak wajar atau noisy data. Missing value dapat menyebabkan informasi yang tersedia menjadi tidak lengkap. Sementara itu, inkonsistensi penulisan dapat menyebabkan kategori yang sebenarnya sama terbaca sebagai kategori yang berbeda. Data duplikat juga dapat menyebabkan suatu objek dihitung lebih dari satu kali, sedangkan data noisy dapat menghasilkan nilai yang tidak sesuai dengan kondisi atau batas logis suatu variabel.

Oleh karena itu, diperlukan proses eksplorasi dan pemeriksaan kualitas data sebelum data digunakan untuk analisis lebih lanjut. Proses tersebut dilakukan untuk mengetahui kondisi awal dataset, mengidentifikasi berbagai permasalahan yang terdapat di dalamnya, serta menentukan langkah yang sesuai untuk memperbaiki atau membersihkan data.

Pada kegiatan ini dilakukan eksplorasi dan data cleaning terhadap dataset mahasiswa. Proses pembersihan meliputi pemeriksaan missing value, penghapusan data duplikat, standarisasi data kategorik, penanganan nilai yang tidak wajar, serta pengisian missing value pada variabel numerik menggunakan median. Setelah proses pembersihan selesai, data digunakan untuk analisis lanjutan berupa regresi linear berganda dan pengelompokan variabel jam belajar mahasiswa.

Dengan adanya proses eksplorasi dan pembersihan data ini, diharapkan dataset yang digunakan memiliki kualitas yang lebih baik dan lebih siap untuk digunakan dalam proses analisis selanjutnya.

1.2 Tujuan

Kegiatan eksplorasi dan pembersihan data ini memiliki beberapa tujuan, yaitu:

  1. Mengetahui kondisi dan gambaran umum dari dataset mahasiswa.
  2. Mengidentifikasi keberadaan missing value pada dataset.
  3. Mengidentifikasi inkonsistensi penulisan pada variabel kategorik.
  4. Mengidentifikasi adanya data duplikat dalam dataset.
  5. Menemukan data yang tidak wajar atau noisy data berdasarkan batas logis masing-masing variabel.
  6. Melakukan proses pembersihan dan perapian data agar lebih siap digunakan untuk analisis.
  7. Melakukan pengelompokan dan encoding pada variabel jam belajar mahasiswa.
  8. Menggunakan data yang telah dibersihkan untuk analisis regresi linear berganda dan pemeriksaan asumsi model.

II. Gambaran Dalam Dataset

Dataset yang digunakan dalam kegiatan ini merupakan dataset mahasiswa yang terdiri dari 1.215 baris dan 15 kolom.

Objek yang terdapat dalam dataset adalah mahasiswa dengan beberapa variabel yang menggambarkan karakteristik identitas, akademik, kebiasaan belajar, penggunaan internet, waktu tidur, dan kepuasan terhadap perkuliahan.

1.215

Baris Data

15

Variabel

Cleaning

Data Wrangling

Analisis

Regresi & Uji Asumsi

2.1 Variabel dalam Dataset

  1. ID_Mahasiswa
  2. Nama
  3. Gender
  4. Umur
  5. Semester
  6. Program_Studi
  7. Kota_Asal
  8. Jam_Belajar_per_Minggu
  9. Kehadiran_Persen
  10. Nilai_Tugas
  11. Nilai_Ujian
  12. Nilai_Akhir
  13. Jam_Internet_per_Hari
  14. Jam_Tidur_per_Hari
  15. Kepuasan_Kuliah

III. Import Data

Data dimasukkan ke dalam R secara langsung dari file Excel menggunakan package readxl. Dataset kemudian disimpan dalam objek df untuk digunakan pada tahap eksplorasi, data wrangling, dan analisis selanjutnya.

3.1 Membaca Excel

Keterangan Nilai
Jumlah baris 1215
Jumlah kolom 15

3.2 Konversi Data ke Numerik

Beberapa variabel yang seharusnya berupa data numerik dapat terbaca sebagai karakter (chr) ketika data Excel memiliki format atau penulisan yang beragam. Oleh karena itu, dilakukan konversi terhadap variabel yang seharusnya memiliki tipe numerik.

3.3 Ukuran Dataset

Ukuran dataset diperiksa menggunakan fungsi dim().

Ukuran Jumlah
Baris 1215
Kolom 15

Fungsi tersebut menghasilkan informasi berupa jumlah baris dan jumlah kolom. Berdasarkan dataset yang digunakan, terdapat 1.215 baris dan 15 kolom.

3.4 Nama Variabel

Nama variabel diperiksa menggunakan:

No Variabel
1 ID_Mahasiswa
2 Nama
3 Gender
4 Umur
5 Semester
6 Program_Studi
7 Kota_Asal
8 Jam_Belajar_per_Minggu
9 Kehadiran_Persen
10 Nilai_Tugas
11 Nilai_Ujian
12 Nilai_Akhir
13 Jam_Internet_per_Hari
14 Jam_Tidur_per_Hari
15 Kepuasan_Kuliah

Pemeriksaan ini bertujuan memastikan bahwa nama variabel yang terbaca oleh R sesuai dengan struktur dataset.

IV. Eksplorasi Permasalahan Data

Sebelum dilakukan proses data cleaning, dilakukan eksplorasi terhadap dataset untuk mengetahui permasalahan kualitas data yang terdapat di dalamnya.

Permasalahan yang diperiksa meliputi:

  • Missing value
  • Inkonsistensi data
  • Duplikasi data
  • Noisy data

4.1 Missing Value

Missing value merupakan kondisi ketika terdapat data yang kosong atau tidak memiliki nilai pada suatu variabel. Berdasarkan hasil eksplorasi, ditemukan beberapa missing value pada dataset mahasiswa.

Variabel yang memiliki missing value adalah:

  1. Jam_Belajar_per_Minggu: 12 data kosong
  2. Kehadiran_Persen: 10 data kosong
  3. Nilai_Tugas: 8 data kosong
  4. Nilai_Ujian: 8 data kosong
  5. Kepuasan_Kuliah: 8 data kosong

Pemeriksaan Missing Value dengan R:

Variabel Nilai
ID_Mahasiswa 0
Nama 0
Gender 0
Umur 0
Semester 0
Program_Studi 0
Kota_Asal 0
Jam_Belajar_per_Minggu 12
Kehadiran_Persen 10
Nilai_Tugas 8
Nilai_Ujian 8
Nilai_Akhir 0
Jam_Internet_per_Hari 0
Jam_Tidur_per_Hari 0
Kepuasan_Kuliah 8

Untuk menampilkan hanya variabel yang memiliki missing value:

Variabel Nilai
Jam_Belajar_per_Minggu 12
Kehadiran_Persen 10
Nilai_Tugas 8
Nilai_Ujian 8
Kepuasan_Kuliah 8

Hasil pemeriksaan digunakan untuk mengetahui variabel mana yang memerlukan penanganan missing value. Missing value tersebut nantinya akan ditangani bersama dengan nilai tidak wajar yang telah diubah menjadi NA.

4.2 Inkonsistensi Data

4.2.1 Inkonsistensi Gender

Inkonsistensi ditemukan pada variabel Gender. Kategori laki-laki ditulis dalam beberapa bentuk, yaitu:

  1. Laki-laki
  2. Male
  3. Pria
  4. L

Sedangkan kategori perempuan ditulis sebagai:

  1. Perempuan
  2. Female
  3. Wanita
  4. P

Walaupun memiliki arti yang sama, perbedaan penulisan tersebut dapat menyebabkan kategori terbaca sebagai kelompok yang berbeda.

Pemeriksaan dilakukan dengan:

Gender Jumlah
Female 6
L 2
Laki-laki 539
Male 4
P 8
Perempuan 646
Pria 3
Wanita 7

4.2.2 Inkonsistensi Kota Asal

Inkonsistensi juga ditemukan pada variabel Kota_Asal, terutama dalam penggunaan huruf kapital.

Sebagai contoh, kota yang sama dapat ditulis:

  1. Pekanbaru
  2. pekanbaru
  3. PEKANBARU

Hal yang sama juga ditemukan pada beberapa kota lainnya seperti Padang, Jambi, Dumai, dan Medan.

Eksplorasi:

Kota_Asal
Dumai
DUMAI
jambi
Jambi
JAMBI
Medan
MEDAN
padang
Padang
PADANG
pekanbaru
Pekanbaru
PEKANBARU

Permasalahan tersebut menunjukkan perlunya standarisasi penulisan pada tahap data wrangling.

4.3 Duplikasi Data

Duplikasi data merupakan kondisi ketika suatu baris data atau identitas yang sama muncul lebih dari satu kali.

Duplikasi dapat menjadi masalah karena satu mahasiswa dapat terhitung lebih dari satu kali. Jika data tersebut langsung digunakan dalam analisis, jumlah observasi dan hasil perhitungan dapat terpengaruh.

Berdasarkan eksplorasi pada dataset:

  1. Terdapat 15 ID_Mahasiswa yang muncul lebih dari satu kali.
  2. Terdapat 14 baris yang merupakan duplikat identik.

Salah satu ID yang muncul lebih dari satu kali adalah Mahasiswa_0866.

Pemeriksaan Duplikat Identik:

## [1] 14

Pemeriksaan ID yang Berulang:

ID_Mahasiswa n
100032 2
100096 2
100213 2
100425 2
100435 2
100443 2
100557 2
100761 2
100769 2
100844 2
100866 2
100947 2
100994 2
101011 2
101086 2

Hasil pemeriksaan tersebut menjadi dasar untuk melakukan penghapusan duplikasi pada tahap data wrangling.

4.4 Data Noisy

Noisy data merupakan data yang mengandung nilai tidak wajar, tidak logis, atau berada di luar batas yang seharusnya.

Berbeda dengan missing value yang berupa data kosong, noisy data memiliki nilai tetapi nilai tersebut tidak sesuai dengan kondisi yang diharapkan.

Pada dataset mahasiswa ditemukan noisy data pada beberapa variabel.

4.4.1 Noisy Data pada Umur

Variabel Umur memiliki nilai dari -3 hingga 150 tahun.

Umur bernilai negatif tidak mungkin secara logis. Sementara itu, umur 150 tahun tidak wajar jika dikaitkan dengan karakteristik mahasiswa. Oleh karena itu, nilai-nilai tersebut perlu diperiksa dan ditangani.

ID_Mahasiswa Umur
100637 150
100895 -3

4.4.2 Noisy Data pada Kehadiran

Variabel Kehadiran_Persen memiliki nilai mulai dari -10% hingga 125%.

Secara logis, persentase kehadiran berada pada rentang 0% sampai 100%. Oleh karena itu, nilai di bawah 0% dan di atas 100% merupakan nilai yang tidak valid.

ID_Mahasiswa Kehadiran_Persen
100080 -10
101068 125

4.4.3 Noisy Data pada Nilai Akademik

Nilai tugas, ujian, dan nilai akhir menggunakan skala 0 sampai 100. Namun, ditemukan nilai seperti:

  1. -5
  2. -8
  3. 105
  4. 120
  5. 150

Nilai tersebut berada di luar skala yang digunakan sehingga dianggap sebagai nilai yang tidak valid.

ID_Mahasiswa Jenis_Nilai Nilai
101129 Nilai_Akhir -8
100849 Nilai_Ujian -2
100781 Nilai_Ujian 150
100259 Nilai_Tugas 105
100548 Nilai_Tugas -5
100861 Nilai_Akhir 120

4.4.4 Noisy Data pada Kepuasan Kuliah

Variabel Kepuasan_Kuliah menggunakan skala 1 sampai 5. Namun, ditemukan nilai 0 dan 8.

Nilai 0 berada di bawah batas minimum, sedangkan nilai 8 berada di atas batas maksimum. Oleh karena itu, kedua nilai tersebut dikategorikan sebagai nilai yang tidak sesuai dengan skala variabel.

ID_Mahasiswa Kepuasan_Kuliah
100827 8
100726 0

4.4.5 Noisy Data pada Jam Internet

Pada variabel Jam_Internet_per_Hari, ditemukan nilai -1 jam dan 30 jam.

Nilai -1 tidak mungkin karena waktu tidak dapat bernilai negatif, sedangkan 30 jam melebihi jumlah waktu dalam satu hari, yaitu 24 jam. Oleh karena itu, kedua nilai tersebut dianggap tidak logis.

ID_Mahasiswa Jam_Internet_per_Hari
101011 30
101099 -1

V. Data Wrangling

Setelah seluruh permasalahan data berhasil diidentifikasi melalui tahap eksplorasi, tahap selanjutnya adalah melakukan data wrangling.

Data wrangling merupakan proses menyiapkan data agar menjadi lebih terstruktur, konsisten, dan sesuai untuk digunakan dalam analisis.

Pada kegiatan ini, proses data wrangling dilakukan berdasarkan permasalahan yang ditemukan pada tahap sebelumnya.

Tahapan yang dilakukan meliputi:

  1. Membersihkan data duplikat.
  2. Memperbaiki kapitalisasi data.
  3. Menyeragamkan penulisan Gender.
  4. Menangani nilai noisy data.
  5. Mengubah nilai tidak valid menjadi NA.
  6. Mengisi nilai kosong pada variabel numerik menggunakan median.
  7. Melakukan pemeriksaan ulang setelah proses pembersihan.

5.1 Membersihkan Data Duplikat

Tahap pertama adalah menghapus data duplikat.

Duplikasi identik dihapus terlebih dahulu menggunakan distinct(). Setelah itu dilakukan pemeriksaan berdasarkan ID_Mahasiswa agar satu ID mahasiswa hanya muncul satu kali.

Setelah proses tersebut dilakukan, jumlah duplikat diperiksa kembali.

Pemeriksaan Jumlah
Duplikat identik 0

Langkah ini dilakukan untuk memastikan bahwa data yang digunakan dalam analisis tidak mengandung baris duplikat.

5.2 Memperbaiki Kapitalisasi Kota Asal

Permasalahan berikutnya adalah perbedaan penggunaan huruf besar dan kecil pada Kota_Asal.

Untuk memperbaikinya digunakan fungsi str_trim() dan str_to_title().

Fungsi str_trim() digunakan untuk menghilangkan spasi yang tidak diperlukan di awal atau akhir teks. Sementara itu, str_to_title() digunakan untuk membuat huruf awal setiap kata menjadi huruf kapital.

Dengan demikian, bentuk penulisan seperti pekanbaru, PEKANBARU, dan Pekanbaru akan diseragamkan menjadi Pekanbaru.

5.3 Menyeragamkan Penulisan Gender

Permasalahan inkonsistensi pada Gender ditangani dengan mengelompokkan beberapa bentuk penulisan ke dalam kategori yang sama.

Setelah dilakukan standarisasi, dilakukan pemeriksaan kembali untuk melihat kategori yang tersisa.

Variabel Nilai
Laki-laki 539
Perempuan 661

Tahapan ini membuat kategori Gender menjadi lebih konsisten sehingga kategori yang sebenarnya sama tidak lagi dipisahkan hanya karena perbedaan penulisan.

5.4 Standarisasi Program Studi

Selain Gender dan Kota_Asal, variabel Program_Studi juga distandarisasi untuk mengurangi perbedaan penulisan.

Langkah tersebut dilakukan agar penulisan kategori program studi lebih seragam.

5.5 Menangani Data Noisy

Setelah nilai noisy diidentifikasi, nilai tersebut tidak langsung diganti dengan nilai tertentu. Nilai yang berada di luar batas logis diubah terlebih dahulu menjadi NA.

Cara tersebut memungkinkan nilai yang tidak valid diperlakukan sebagai data yang perlu ditangani bersama dengan missing value.

Setelah nilai noisy diubah menjadi NA, jumlah missing value dapat bertambah. Hal ini terjadi karena nilai yang sebelumnya ada tetapi tidak valid sekarang diperlakukan sebagai data kosong.

5.6 Mengisi Nilai Kosong dengan Median

Tahap berikutnya adalah menangani nilai kosong yang berasal dari missing value awal maupun nilai noisy yang telah diubah menjadi NA.

Pada kegiatan ini digunakan median sebagai metode pengisian nilai kosong untuk variabel numerik.

Median merupakan nilai tengah dari data yang telah diurutkan. Dengan menggunakan median, nilai kosong diisi berdasarkan nilai tengah dari data yang tersedia pada variabel tersebut.

Proses tersebut dilakukan secara berulang untuk seluruh variabel numerik. Dengan demikian, setiap NA pada variabel numerik akan digantikan dengan median dari variabel tersebut.

5.7 Pemeriksaan Setelah Cleaning

Setelah seluruh proses pembersihan selesai, dilakukan pemeriksaan kembali untuk memastikan kondisi data.

Pemeriksaan Missing Value:

Variabel Nilai
ID_Mahasiswa 0
Nama 0
Gender 0
Umur 0
Semester 0
Program_Studi 0
Kota_Asal 0
Jam_Belajar_per_Minggu 0
Kehadiran_Persen 0
Nilai_Tugas 0
Nilai_Ujian 0
Nilai_Akhir 0
Jam_Internet_per_Hari 0
Jam_Tidur_per_Hari 0
Kepuasan_Kuliah 0

Jika proses pengisian berhasil dilakukan, variabel numerik yang sebelumnya memiliki missing value tidak lagi memiliki nilai NA.

Pemeriksaan Duplikasi:

## [1] 0

Pemeriksaan ini dilakukan untuk memastikan bahwa tidak terdapat lagi baris duplikat identik.

Pemeriksaan Struktur Data:

Variabel Tipe
ID_Mahasiswa numeric
Nama character
Gender character
Umur numeric
Semester numeric
Program_Studi character
Kota_Asal character
Jam_Belajar_per_Minggu numeric
Kehadiran_Persen numeric
Nilai_Tugas numeric
Nilai_Ujian numeric
Nilai_Akhir numeric
Jam_Internet_per_Hari numeric
Jam_Tidur_per_Hari numeric
Kepuasan_Kuliah numeric

Melihat Data Setelah Cleaning:

ID_Mahasiswa Nama Gender Umur Semester Program_Studi Kota_Asal Jam_Belajar_per_Minggu Kehadiran_Persen Nilai_Tugas Nilai_Ujian Nilai_Akhir Jam_Internet_per_Hari Jam_Tidur_per_Hari Kepuasan_Kuliah
100740 Mahasiswa_0740 Laki-laki 20 3 Statistika Pekanbaru 3.6 90.0 45.0 95.2 78.6 5.8 4.9 5
100789 Mahasiswa_0789 Perempuan 21 3 Statistika Dumai 13.0 81.0 74.7 81.6 81.1 3.4 7.7 4
100044 Mahasiswa_0044 Perempuan 19 3 Matematika Pekanbaru 13.3 83.4 76.9 94.3 86.7 4.4 5.6 4
100156 Mahasiswa_0156 Laki-laki 24 5 Statistika Pekanbaru 11.8 87.9 55.4 93.4 80.0 4.6 7.5 3
100495 Mahasiswa_0495 Perempuan 20 5 Statistika Pekanbaru 13.8 93.8 83.7 100.0 93.8 5.6 6.3 5
100971 Mahasiswa_0971 Perempuan 21 3 Statistika Pekanbaru 20.1 87.7 71.3 91.5 86.6 5.9 6.3 3

Tahap pemeriksaan akhir penting karena proses cleaning dapat mengubah isi dataset. Dengan melakukan pemeriksaan ulang, kondisi dataset setelah wrangling dapat dibandingkan dengan kondisi awal.

VI. Analisis Data Setelah Wrangling

Setelah proses eksplorasi dan data wrangling selesai, dataset telah dipersiapkan untuk digunakan dalam analisis lanjutan.

Analisis yang dilakukan terdiri dari:

  1. Regresi linear berganda.
  2. Uji normalitas residual.
  3. Uji homoskedastisitas.
  4. Pengelompokan jam belajar.
  5. Encoding kategori jam belajar.
  6. Visualisasi kategori jam belajar.

6.1 Uji Asumsi Model

Model regresi perlu diperiksa melalui beberapa asumsi agar hasil analisis dapat dievaluasi berdasarkan kondisi residual model.

Dalam kegiatan ini digunakan dua pemeriksaan, yaitu:

  • Uji normalitas residual menggunakan Kolmogorov-Smirnov.
  • Uji homoskedastisitas menggunakan Breusch-Pagan.

6.1.1 Regresi Linear Berganda

Regresi linear berganda digunakan untuk membentuk model yang melibatkan satu variabel respons dengan lebih dari satu variabel prediktor.

Dalam kegiatan ini, variabel yang digunakan adalah:

  • Jam_Tidur_per_Hari sebagai variabel respons.
  • Jam_Internet_per_Hari sebagai variabel prediktor.
  • Jam_Belajar_per_Minggu sebagai variabel prediktor.

Model dibentuk menggunakan fungsi lm().

Variabel Estimate Std. Error t value Pr(>|t|)
(Intercept) 6.4859 0.1218 53.2479 0.0000
Jam_Internet_per_Hari 0.0098 0.0178 0.5509 0.5818
Jam_Belajar_per_Minggu 0.0140 0.0063 2.2388 0.0254

Secara umum, bentuk model regresi yang digunakan adalah:

Jam Tidur = β₀ + β₁(Jam Internet) + β₂(Jam Belajar) + ε

Tabel koefisien model memberikan informasi mengenai estimasi parameter, galat baku, statistik uji, dan nilai signifikansi yang dihasilkan dari regresi linear berganda.

6.1.2 Uji Normalitas Residual

Residual merupakan selisih antara nilai aktual dan nilai yang diprediksi oleh model.

Uji Kolmogorov-Smirnov digunakan untuk memeriksa distribusi residual.

## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  residu
## D = 0.031506, p-value = 0.1845
## alternative hypothesis: two-sided

Hasil uji digunakan untuk mengevaluasi apakah residual model memenuhi asumsi distribusi normal berdasarkan pengujian yang dilakukan.

6.1.3 Uji Homoskedastisitas

Homoskedastisitas berkaitan dengan kesamaan varians residual pada berbagai nilai prediksi.

Uji Breusch-Pagan digunakan untuk melakukan pemeriksaan tersebut.

## 
##  studentized Breusch-Pagan test
## 
## data:  model
## BP = 0.66852, df = 2, p-value = 0.7159

Hasil pengujian dapat digunakan untuk mengevaluasi apakah terdapat indikasi ketidaksamaan varians residual pada model.

VII. Integrasi Data I

7.1 Penjelasan Integrasi Data

Integrasi Data I merupakan proses penggabungan dua dataset mahasiswa menggunakan ID_Mahasiswa sebagai key. Data 1 digunakan sebagai data utama, sedangkan Data 2 memberikan informasi tambahan berupa Kategori_Belajar.

Integrasi data merupakan proses menggabungkan dua dataset yang memiliki informasi mengenai objek yang sama. Pada Integrasi Data I, penggabungan dilakukan menggunakan ID_Mahasiswa sebagai key atau kunci utama.

Tujuan integrasi adalah menggabungkan informasi dari Data 1 dan Data 2 sehingga diperoleh dataset yang lebih lengkap. Pada tahap ini, Data 2 memberikan informasi tambahan berupa Kategori_Belajar yang diperoleh dari pengelompokan Jam_Belajar_per_Minggu.

7.2 Data 1

Data 1 merupakan data utama yang berisi informasi mahasiswa mengenai waktu tidur, penggunaan internet, dan waktu belajar.

Variabel yang digunakan adalah:

  1. ID_Mahasiswa
  2. Jam_Tidur_per_Hari
  3. Jam_Internet_per_Hari
  4. Jam_Belajar_per_Minggu
ID_Mahasiswa Jam_Tidur_per_Hari Jam_Internet_per_Hari Jam_Belajar_per_Minggu
100740 4.9 5.8 3.6
100789 7.7 3.4 13.0
100044 5.6 4.4 13.3
100156 7.5 4.6 11.8
100495 6.3 5.6 13.8
100971 6.3 5.9 20.1

ID_Mahasiswa digunakan sebagai kunci untuk menghubungkan Data 1 dengan Data 2.

7.3 Data 2

Data 2 merupakan data tambahan yang berisi kategori berdasarkan jumlah jam belajar mahasiswa.

Sebelum membuat Data 2, Jam_Belajar_per_Minggu dikelompokkan menjadi tiga kategori:

Rentang Kategori
< 10 jam Rendah
10–20 jam Sedang
> 20 jam Tinggi

Selanjutnya Data 2 dibuat dengan:

ID_Mahasiswa Kategori_Belajar
100740 Rendah
100789 Sedang
100044 Sedang
100156 Sedang
100495 Sedang
100971 Tinggi

Data 2 kemudian digunakan sebagai sumber informasi tambahan pada proses integrasi.

7.4 Data Gabungan

Data 1 dan Data 2 digabungkan menggunakan ID_Mahasiswa sebagai key. Penggabungan menggunakan left_join() agar seluruh data pada Data 1 tetap dipertahankan.

ID_Mahasiswa Jam_Tidur_per_Hari Jam_Internet_per_Hari Jam_Belajar_per_Minggu Kategori_Belajar
100740 4.9 5.8 3.6 Rendah
100789 7.7 3.4 13.0 Sedang
100044 5.6 4.4 13.3 Sedang
100156 7.5 4.6 11.8 Sedang
100495 6.3 5.6 13.8 Sedang
100971 6.3 5.9 20.1 Tinggi

Pemeriksaan hasil integrasi dilakukan dengan:

Pemeriksaan Jumlah
Baris data gabungan 1200
NA Kategori_Belajar 0

Pemeriksaan tersebut bertujuan memastikan bahwa data berhasil digabungkan dan Kategori_Belajar telah ditambahkan dengan benar.

Grafik Data Gabungan I:

Grafik menunjukkan distribusi jumlah mahasiswa berdasarkan kategori jam belajar, yaitu Rendah, Sedang, dan Tinggi.

7.5 Data Encoding

Pada tahap ini, Kategori_Belajar diubah menjadi bentuk faktor dan kemudian diberikan kode numerik.

Urutan kategori yang digunakan adalah:

  1. Rendah = 1
  2. Sedang = 2
  3. Tinggi = 3

Pertama, dibuat variabel faktor:

Kemudian dibuat kode numerik:

Pemeriksaan hasil encoding:

ID_Mahasiswa Jam_Belajar_per_Minggu Jam_Belajar_Factor Jam_Belajar_Code
100740 3.6 Rendah 1
100789 13.0 Sedang 2
100044 13.3 Sedang 2
100156 11.8 Sedang 2
100495 13.8 Sedang 2
100971 20.1 Tinggi 3
100271 7.0 Rendah 1
100591 14.4 Sedang 2
100124 10.4 Sedang 2
100114 21.4 Tinggi 3

Hasil encoding digunakan pada tahap Integrasi Data II.

7.6 Kesimpulan Integrasi Data I

Integrasi Data I berhasil menggabungkan Data 1 dan Data 2 menggunakan ID_Mahasiswa sebagai key. Data gabungan menghasilkan informasi mengenai jam tidur, jam internet, jam belajar, serta kategori belajar mahasiswa.

Selanjutnya, Kategori_Belajar diubah menjadi faktor dan kode numerik sebagai persiapan untuk proses Integrasi Data II.

VIII. Integrasi Data II

8.1 Penjelasan Integrasi Data

Integrasi Data II merupakan tahap lanjutan yang menggabungkan data utama dengan hasil encoding jam belajar. Penggabungan tetap menggunakan ID_Mahasiswa sebagai key agar informasi faktor dan kode numerik jam belajar terhubung dengan mahasiswa yang sesuai.

Integrasi Data II merupakan tahap lanjutan setelah Integrasi Data I dan proses encoding. Pada tahap ini, data utama digabungkan dengan data yang telah memiliki kategori faktor dan kode numerik jam belajar.

Penggabungan tetap menggunakan ID_Mahasiswa sebagai key agar informasi dari kedua data dapat dicocokkan dengan mahasiswa yang sesuai.

8.2 Data 1

Data 1 pada Integrasi Data II berisi informasi mengenai mahasiswa dan penggunaan internet.

Variabel yang digunakan adalah:

  1. ID_Mahasiswa
  2. Jam_Internet_per_Hari
ID_Mahasiswa Jam_Internet_per_Hari
100740 5.8
100789 3.4
100044 4.4
100156 4.6
100495 5.6
100971 5.9

Data ini digunakan sebagai data utama dalam Integrasi Data II.

8.3 Data 2

Data 2 merupakan data hasil encoding yang berisi kategori faktor dan kode numerik jam belajar.

Variabel yang digunakan adalah:

  1. ID_Mahasiswa
  2. Jam_Belajar_Factor
  3. Jam_Belajar_Code
ID_Mahasiswa Jam_Belajar_Factor Jam_Belajar_Code
100740 Rendah 1
100789 Sedang 2
100044 Sedang 2
100156 Sedang 2
100495 Sedang 2
100971 Tinggi 3

Data 2 memberikan informasi tambahan mengenai kategori dan kode jam belajar setiap mahasiswa.

8.4 Data Gabungan

Data 1 dan Data 2 digabungkan berdasarkan ID_Mahasiswa.

ID_Mahasiswa Jam_Internet_per_Hari Jam_Belajar_Factor Jam_Belajar_Code
100740 5.8 Rendah 1
100789 3.4 Sedang 2
100044 4.4 Sedang 2
100156 4.6 Sedang 2
100495 5.6 Sedang 2
100971 5.9 Tinggi 3

Pemeriksaan kategori:

Variabel Nilai
Rendah 260
Sedang 815
Tinggi 125

Hasil tersebut digunakan untuk memastikan proses integrasi dan encoding telah berjalan dengan baik.

Grafik Data Gabungan II:

Grafik menunjukkan jumlah mahasiswa pada masing-masing kategori jam belajar.

8.5 Data Encoding

Data encoding pada Integrasi Data II terdiri dari dua variabel:

  1. Jam_Belajar_Factor
  2. Jam_Belajar_Code

Kode yang digunakan adalah:

  1. Jam_Belajar_Factor = Rendah, Sedang, Tinggi
  2. Jam_Belajar_Code = 1, 2, 3

Hasil encoding dapat diperiksa dengan:

ID_Mahasiswa Jam_Belajar_Factor Jam_Belajar_Code
100740 Rendah 1
100789 Sedang 2
100044 Sedang 2
100156 Sedang 2
100495 Sedang 2
100971 Tinggi 3
100271 Rendah 1
100591 Sedang 2
100124 Sedang 2
100114 Tinggi 3

Dengan adanya kode numerik, kategori jam belajar dapat digunakan dalam proses analisis yang membutuhkan representasi numerik.

8.6 Kesimpulan Integrasi Data II

Integrasi Data II berhasil menggabungkan informasi Jam_Internet_per_Hari dengan hasil encoding jam belajar menggunakan ID_Mahasiswa sebagai key.

Hasil akhir memiliki informasi mengenai penggunaan internet, kategori jam belajar, dan kode numerik jam belajar. Data tersebut selanjutnya dapat digunakan untuk analisis dan visualisasi.

IX. Ringkasan Akhir

X. Kesimpulan

Berdasarkan seluruh tahapan yang dilakukan, dataset mahasiswa telah melalui proses eksplorasi, data wrangling, analisis regresi dan pemeriksaan asumsi, serta integrasi dan encoding data. Permasalahan kualitas data ditangani melalui pembersihan duplikasi, standarisasi data kategorik, penanganan nilai tidak valid, dan pengisian missing value numerik menggunakan median.

Selanjutnya, proses integrasi menggunakan ID_Mahasiswa sebagai key menghasilkan data yang lebih terstruktur dan siap digunakan untuk analisis berikutnya.