Eksplorasi dan Identifikasi Permasalahan Kualitas Data Mahasiswa
I. Pendahuluan
1.1 Latar Belakang
Data merupakan salah satu komponen penting dalam proses analisis karena hasil analisis sangat bergantung pada kualitas data yang digunakan. Data mahasiswa dapat digunakan untuk menggambarkan berbagai karakteristik mahasiswa, seperti identitas, kondisi akademik, kebiasaan belajar, penggunaan internet, waktu tidur, hingga tingkat kepuasan terhadap perkuliahan.
Dataset mahasiswa yang digunakan dalam kegiatan ini terdiri atas data yang tersusun dalam baris dan kolom dengan berbagai variabel yang menggambarkan karakteristik identitas, akademik, kebiasaan belajar, penggunaan internet, waktu tidur, dan kepuasan terhadap perkuliahan. Data tersebut dapat memberikan informasi yang berguna untuk analisis lebih lanjut, tetapi sebelum digunakan, kualitas data perlu diperiksa terlebih dahulu.
Dalam suatu dataset dapat ditemukan berbagai permasalahan yang dapat memengaruhi proses pengolahan dan hasil analisis. Beberapa permasalahan tersebut antara lain missing value, inkonsistensi penulisan data, duplikasi data, serta data yang tidak wajar atau noisy data. Missing value dapat menyebabkan informasi yang tersedia menjadi tidak lengkap. Sementara itu, inkonsistensi penulisan dapat menyebabkan kategori yang sebenarnya sama terbaca sebagai kategori yang berbeda. Data duplikat juga dapat menyebabkan suatu objek dihitung lebih dari satu kali, sedangkan data noisy dapat menghasilkan nilai yang tidak sesuai dengan kondisi atau batas logis suatu variabel.
Oleh karena itu, diperlukan proses eksplorasi dan pemeriksaan kualitas data sebelum data digunakan untuk analisis lebih lanjut. Proses tersebut dilakukan untuk mengetahui kondisi awal dataset, mengidentifikasi berbagai permasalahan yang terdapat di dalamnya, serta menentukan langkah yang sesuai untuk memperbaiki atau membersihkan data.
Pada kegiatan ini dilakukan eksplorasi dan data cleaning terhadap dataset mahasiswa. Proses pembersihan meliputi pemeriksaan missing value, penghapusan data duplikat, standarisasi data kategorik, penanganan nilai yang tidak wajar, serta pengisian missing value pada variabel numerik menggunakan median. Setelah proses pembersihan selesai, data digunakan untuk analisis lanjutan berupa regresi linear berganda dan pengelompokan variabel jam belajar mahasiswa.
Dengan adanya proses eksplorasi dan pembersihan data ini, diharapkan dataset yang digunakan memiliki kualitas yang lebih baik dan lebih siap untuk digunakan dalam proses analisis selanjutnya.
1.2 Tujuan
Kegiatan eksplorasi dan pembersihan data ini memiliki beberapa tujuan, yaitu:
- Mengetahui kondisi dan gambaran umum dari dataset mahasiswa.
- Mengidentifikasi keberadaan missing value pada dataset.
- Mengidentifikasi inkonsistensi penulisan pada variabel kategorik.
- Mengidentifikasi adanya data duplikat dalam dataset.
- Menemukan data yang tidak wajar atau noisy data berdasarkan batas logis masing-masing variabel.
- Melakukan proses pembersihan dan perapian data agar lebih siap digunakan untuk analisis.
- Melakukan pengelompokan dan encoding pada variabel jam belajar mahasiswa.
- Menggunakan data yang telah dibersihkan untuk analisis regresi linear berganda dan pemeriksaan asumsi model.
II. Gambaran Dalam Dataset
Dataset yang digunakan dalam kegiatan ini merupakan dataset mahasiswa yang terdiri dari 1.215 baris dan 15 kolom.
Objek yang terdapat dalam dataset adalah mahasiswa dengan beberapa variabel yang menggambarkan karakteristik identitas, akademik, kebiasaan belajar, penggunaan internet, waktu tidur, dan kepuasan terhadap perkuliahan.
1.215
Baris Data
15
Variabel
Cleaning
Data Wrangling
Analisis
Regresi & Uji Asumsi
2.1 Variabel dalam Dataset
ID_MahasiswaNamaGenderUmurSemesterProgram_StudiKota_AsalJam_Belajar_per_MingguKehadiran_PersenNilai_TugasNilai_UjianNilai_AkhirJam_Internet_per_HariJam_Tidur_per_HariKepuasan_Kuliah
III. Import Data
Data dimasukkan ke dalam R secara langsung dari file Excel
menggunakan package readxl. Dataset kemudian disimpan dalam
objek df untuk digunakan pada tahap eksplorasi, data
wrangling, dan analisis selanjutnya.
3.1 Membaca Excel
| Keterangan | Nilai |
|---|---|
| Jumlah baris | 1215 |
| Jumlah kolom | 15 |
3.2 Konversi Data ke Numerik
Beberapa variabel yang seharusnya berupa data numerik dapat terbaca
sebagai karakter (chr) ketika data Excel memiliki format
atau penulisan yang beragam. Oleh karena itu, dilakukan konversi
terhadap variabel yang seharusnya memiliki tipe numerik.
3.3 Ukuran Dataset
Ukuran dataset diperiksa menggunakan fungsi dim().
| Ukuran | Jumlah |
|---|---|
| Baris | 1215 |
| Kolom | 15 |
Fungsi tersebut menghasilkan informasi berupa jumlah baris dan jumlah kolom. Berdasarkan dataset yang digunakan, terdapat 1.215 baris dan 15 kolom.
3.4 Nama Variabel
Nama variabel diperiksa menggunakan:
| No | Variabel |
|---|---|
| 1 | ID_Mahasiswa |
| 2 | Nama |
| 3 | Gender |
| 4 | Umur |
| 5 | Semester |
| 6 | Program_Studi |
| 7 | Kota_Asal |
| 8 | Jam_Belajar_per_Minggu |
| 9 | Kehadiran_Persen |
| 10 | Nilai_Tugas |
| 11 | Nilai_Ujian |
| 12 | Nilai_Akhir |
| 13 | Jam_Internet_per_Hari |
| 14 | Jam_Tidur_per_Hari |
| 15 | Kepuasan_Kuliah |
Pemeriksaan ini bertujuan memastikan bahwa nama variabel yang terbaca oleh R sesuai dengan struktur dataset.
IV. Eksplorasi Permasalahan Data
Sebelum dilakukan proses data cleaning, dilakukan eksplorasi terhadap dataset untuk mengetahui permasalahan kualitas data yang terdapat di dalamnya.
Permasalahan yang diperiksa meliputi:
- Missing value
- Inkonsistensi data
- Duplikasi data
- Noisy data
4.1 Missing Value
Missing value merupakan kondisi ketika terdapat data yang kosong atau tidak memiliki nilai pada suatu variabel. Berdasarkan hasil eksplorasi, ditemukan beberapa missing value pada dataset mahasiswa.
Variabel yang memiliki missing value adalah:
- Jam_Belajar_per_Minggu: 12 data kosong
- Kehadiran_Persen: 10 data kosong
- Nilai_Tugas: 8 data kosong
- Nilai_Ujian: 8 data kosong
- Kepuasan_Kuliah: 8 data kosong
Pemeriksaan Missing Value dengan R:
| Variabel | Nilai |
|---|---|
| ID_Mahasiswa | 0 |
| Nama | 0 |
| Gender | 0 |
| Umur | 0 |
| Semester | 0 |
| Program_Studi | 0 |
| Kota_Asal | 0 |
| Jam_Belajar_per_Minggu | 12 |
| Kehadiran_Persen | 10 |
| Nilai_Tugas | 8 |
| Nilai_Ujian | 8 |
| Nilai_Akhir | 0 |
| Jam_Internet_per_Hari | 0 |
| Jam_Tidur_per_Hari | 0 |
| Kepuasan_Kuliah | 8 |
Untuk menampilkan hanya variabel yang memiliki missing value:
| Variabel | Nilai |
|---|---|
| Jam_Belajar_per_Minggu | 12 |
| Kehadiran_Persen | 10 |
| Nilai_Tugas | 8 |
| Nilai_Ujian | 8 |
| Kepuasan_Kuliah | 8 |
Hasil pemeriksaan digunakan untuk mengetahui variabel mana yang memerlukan penanganan missing value. Missing value tersebut nantinya akan ditangani bersama dengan nilai tidak wajar yang telah diubah menjadi NA.
4.2 Inkonsistensi Data
4.2.1 Inkonsistensi Gender
Inkonsistensi ditemukan pada variabel Gender. Kategori laki-laki ditulis dalam beberapa bentuk, yaitu:
- Laki-laki
- Male
- Pria
- L
Sedangkan kategori perempuan ditulis sebagai:
- Perempuan
- Female
- Wanita
- P
Walaupun memiliki arti yang sama, perbedaan penulisan tersebut dapat menyebabkan kategori terbaca sebagai kelompok yang berbeda.
Pemeriksaan dilakukan dengan:
| Gender | Jumlah |
|---|---|
| Female | 6 |
| L | 2 |
| Laki-laki | 539 |
| Male | 4 |
| P | 8 |
| Perempuan | 646 |
| Pria | 3 |
| Wanita | 7 |
4.2.2 Inkonsistensi Kota Asal
Inkonsistensi juga ditemukan pada variabel Kota_Asal, terutama dalam penggunaan huruf kapital.
Sebagai contoh, kota yang sama dapat ditulis:
- Pekanbaru
- pekanbaru
- PEKANBARU
Hal yang sama juga ditemukan pada beberapa kota lainnya seperti Padang, Jambi, Dumai, dan Medan.
Eksplorasi:
| Kota_Asal |
|---|
| Dumai |
| DUMAI |
| jambi |
| Jambi |
| JAMBI |
| Medan |
| MEDAN |
| padang |
| Padang |
| PADANG |
| pekanbaru |
| Pekanbaru |
| PEKANBARU |
Permasalahan tersebut menunjukkan perlunya standarisasi penulisan pada tahap data wrangling.
4.3 Duplikasi Data
Duplikasi data merupakan kondisi ketika suatu baris data atau identitas yang sama muncul lebih dari satu kali.
Duplikasi dapat menjadi masalah karena satu mahasiswa dapat terhitung lebih dari satu kali. Jika data tersebut langsung digunakan dalam analisis, jumlah observasi dan hasil perhitungan dapat terpengaruh.
Berdasarkan eksplorasi pada dataset:
- Terdapat 15 ID_Mahasiswa yang muncul lebih dari satu kali.
- Terdapat 14 baris yang merupakan duplikat identik.
Salah satu ID yang muncul lebih dari satu kali adalah Mahasiswa_0866.
Pemeriksaan Duplikat Identik:
## [1] 14
Pemeriksaan ID yang Berulang:
| ID_Mahasiswa | n |
|---|---|
| 100032 | 2 |
| 100096 | 2 |
| 100213 | 2 |
| 100425 | 2 |
| 100435 | 2 |
| 100443 | 2 |
| 100557 | 2 |
| 100761 | 2 |
| 100769 | 2 |
| 100844 | 2 |
| 100866 | 2 |
| 100947 | 2 |
| 100994 | 2 |
| 101011 | 2 |
| 101086 | 2 |
Hasil pemeriksaan tersebut menjadi dasar untuk melakukan penghapusan duplikasi pada tahap data wrangling.
4.4 Data Noisy
Noisy data merupakan data yang mengandung nilai tidak wajar, tidak logis, atau berada di luar batas yang seharusnya.
Berbeda dengan missing value yang berupa data kosong, noisy data memiliki nilai tetapi nilai tersebut tidak sesuai dengan kondisi yang diharapkan.
Pada dataset mahasiswa ditemukan noisy data pada beberapa variabel.
4.4.1 Noisy Data pada Umur
Variabel Umur memiliki nilai dari -3 hingga 150 tahun.
Umur bernilai negatif tidak mungkin secara logis. Sementara itu, umur 150 tahun tidak wajar jika dikaitkan dengan karakteristik mahasiswa. Oleh karena itu, nilai-nilai tersebut perlu diperiksa dan ditangani.
| ID_Mahasiswa | Umur |
|---|---|
| 100637 | 150 |
| 100895 | -3 |
4.4.2 Noisy Data pada Kehadiran
Variabel Kehadiran_Persen memiliki nilai mulai dari -10% hingga 125%.
Secara logis, persentase kehadiran berada pada rentang 0% sampai 100%. Oleh karena itu, nilai di bawah 0% dan di atas 100% merupakan nilai yang tidak valid.
| ID_Mahasiswa | Kehadiran_Persen |
|---|---|
| 100080 | -10 |
| 101068 | 125 |
4.4.3 Noisy Data pada Nilai Akademik
Nilai tugas, ujian, dan nilai akhir menggunakan skala 0 sampai 100. Namun, ditemukan nilai seperti:
- -5
- -8
- 105
- 120
- 150
Nilai tersebut berada di luar skala yang digunakan sehingga dianggap sebagai nilai yang tidak valid.
| ID_Mahasiswa | Jenis_Nilai | Nilai |
|---|---|---|
| 101129 | Nilai_Akhir | -8 |
| 100849 | Nilai_Ujian | -2 |
| 100781 | Nilai_Ujian | 150 |
| 100259 | Nilai_Tugas | 105 |
| 100548 | Nilai_Tugas | -5 |
| 100861 | Nilai_Akhir | 120 |
4.4.4 Noisy Data pada Kepuasan Kuliah
Variabel Kepuasan_Kuliah menggunakan skala 1 sampai 5. Namun, ditemukan nilai 0 dan 8.
Nilai 0 berada di bawah batas minimum, sedangkan nilai 8 berada di atas batas maksimum. Oleh karena itu, kedua nilai tersebut dikategorikan sebagai nilai yang tidak sesuai dengan skala variabel.
| ID_Mahasiswa | Kepuasan_Kuliah |
|---|---|
| 100827 | 8 |
| 100726 | 0 |
4.4.5 Noisy Data pada Jam Internet
Pada variabel Jam_Internet_per_Hari, ditemukan nilai -1 jam dan 30 jam.
Nilai -1 tidak mungkin karena waktu tidak dapat bernilai negatif, sedangkan 30 jam melebihi jumlah waktu dalam satu hari, yaitu 24 jam. Oleh karena itu, kedua nilai tersebut dianggap tidak logis.
| ID_Mahasiswa | Jam_Internet_per_Hari |
|---|---|
| 101011 | 30 |
| 101099 | -1 |
V. Data Wrangling
Setelah seluruh permasalahan data berhasil diidentifikasi melalui tahap eksplorasi, tahap selanjutnya adalah melakukan data wrangling.
Data wrangling merupakan proses menyiapkan data agar menjadi lebih terstruktur, konsisten, dan sesuai untuk digunakan dalam analisis.
Pada kegiatan ini, proses data wrangling dilakukan berdasarkan permasalahan yang ditemukan pada tahap sebelumnya.
Tahapan yang dilakukan meliputi:
- Membersihkan data duplikat.
- Memperbaiki kapitalisasi data.
- Menyeragamkan penulisan Gender.
- Menangani nilai noisy data.
- Mengubah nilai tidak valid menjadi NA.
- Mengisi nilai kosong pada variabel numerik menggunakan median.
- Melakukan pemeriksaan ulang setelah proses pembersihan.
5.1 Membersihkan Data Duplikat
Tahap pertama adalah menghapus data duplikat.
Duplikasi identik dihapus terlebih dahulu menggunakan
distinct(). Setelah itu dilakukan pemeriksaan berdasarkan
ID_Mahasiswa agar satu ID mahasiswa hanya muncul satu kali.
Setelah proses tersebut dilakukan, jumlah duplikat diperiksa kembali.
| Pemeriksaan | Jumlah |
|---|---|
| Duplikat identik | 0 |
Langkah ini dilakukan untuk memastikan bahwa data yang digunakan dalam analisis tidak mengandung baris duplikat.
5.2 Memperbaiki Kapitalisasi Kota Asal
Permasalahan berikutnya adalah perbedaan penggunaan huruf besar dan kecil pada Kota_Asal.
Untuk memperbaikinya digunakan fungsi str_trim() dan
str_to_title().
Fungsi str_trim() digunakan untuk menghilangkan spasi
yang tidak diperlukan di awal atau akhir teks. Sementara itu,
str_to_title() digunakan untuk membuat huruf awal setiap
kata menjadi huruf kapital.
Dengan demikian, bentuk penulisan seperti pekanbaru, PEKANBARU, dan Pekanbaru akan diseragamkan menjadi Pekanbaru.
5.3 Menyeragamkan Penulisan Gender
Permasalahan inkonsistensi pada Gender ditangani dengan mengelompokkan beberapa bentuk penulisan ke dalam kategori yang sama.
Setelah dilakukan standarisasi, dilakukan pemeriksaan kembali untuk melihat kategori yang tersisa.
| Variabel | Nilai |
|---|---|
| Laki-laki | 539 |
| Perempuan | 661 |
Tahapan ini membuat kategori Gender menjadi lebih konsisten sehingga kategori yang sebenarnya sama tidak lagi dipisahkan hanya karena perbedaan penulisan.
5.4 Standarisasi Program Studi
Selain Gender dan Kota_Asal, variabel Program_Studi juga distandarisasi untuk mengurangi perbedaan penulisan.
Langkah tersebut dilakukan agar penulisan kategori program studi lebih seragam.
5.5 Menangani Data Noisy
Setelah nilai noisy diidentifikasi, nilai tersebut tidak langsung diganti dengan nilai tertentu. Nilai yang berada di luar batas logis diubah terlebih dahulu menjadi NA.
Cara tersebut memungkinkan nilai yang tidak valid diperlakukan sebagai data yang perlu ditangani bersama dengan missing value.
Setelah nilai noisy diubah menjadi NA, jumlah missing value dapat bertambah. Hal ini terjadi karena nilai yang sebelumnya ada tetapi tidak valid sekarang diperlakukan sebagai data kosong.
5.6 Mengisi Nilai Kosong dengan Median
Tahap berikutnya adalah menangani nilai kosong yang berasal dari missing value awal maupun nilai noisy yang telah diubah menjadi NA.
Pada kegiatan ini digunakan median sebagai metode pengisian nilai kosong untuk variabel numerik.
Median merupakan nilai tengah dari data yang telah diurutkan. Dengan menggunakan median, nilai kosong diisi berdasarkan nilai tengah dari data yang tersedia pada variabel tersebut.
Proses tersebut dilakukan secara berulang untuk seluruh variabel numerik. Dengan demikian, setiap NA pada variabel numerik akan digantikan dengan median dari variabel tersebut.
5.7 Pemeriksaan Setelah Cleaning
Setelah seluruh proses pembersihan selesai, dilakukan pemeriksaan kembali untuk memastikan kondisi data.
Pemeriksaan Missing Value:
| Variabel | Nilai |
|---|---|
| ID_Mahasiswa | 0 |
| Nama | 0 |
| Gender | 0 |
| Umur | 0 |
| Semester | 0 |
| Program_Studi | 0 |
| Kota_Asal | 0 |
| Jam_Belajar_per_Minggu | 0 |
| Kehadiran_Persen | 0 |
| Nilai_Tugas | 0 |
| Nilai_Ujian | 0 |
| Nilai_Akhir | 0 |
| Jam_Internet_per_Hari | 0 |
| Jam_Tidur_per_Hari | 0 |
| Kepuasan_Kuliah | 0 |
Jika proses pengisian berhasil dilakukan, variabel numerik yang sebelumnya memiliki missing value tidak lagi memiliki nilai NA.
Pemeriksaan Duplikasi:
## [1] 0
Pemeriksaan ini dilakukan untuk memastikan bahwa tidak terdapat lagi baris duplikat identik.
Pemeriksaan Struktur Data:
| Variabel | Tipe |
|---|---|
| ID_Mahasiswa | numeric |
| Nama | character |
| Gender | character |
| Umur | numeric |
| Semester | numeric |
| Program_Studi | character |
| Kota_Asal | character |
| Jam_Belajar_per_Minggu | numeric |
| Kehadiran_Persen | numeric |
| Nilai_Tugas | numeric |
| Nilai_Ujian | numeric |
| Nilai_Akhir | numeric |
| Jam_Internet_per_Hari | numeric |
| Jam_Tidur_per_Hari | numeric |
| Kepuasan_Kuliah | numeric |
Melihat Data Setelah Cleaning:
| ID_Mahasiswa | Nama | Gender | Umur | Semester | Program_Studi | Kota_Asal | Jam_Belajar_per_Minggu | Kehadiran_Persen | Nilai_Tugas | Nilai_Ujian | Nilai_Akhir | Jam_Internet_per_Hari | Jam_Tidur_per_Hari | Kepuasan_Kuliah |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 100740 | Mahasiswa_0740 | Laki-laki | 20 | 3 | Statistika | Pekanbaru | 3.6 | 90.0 | 45.0 | 95.2 | 78.6 | 5.8 | 4.9 | 5 |
| 100789 | Mahasiswa_0789 | Perempuan | 21 | 3 | Statistika | Dumai | 13.0 | 81.0 | 74.7 | 81.6 | 81.1 | 3.4 | 7.7 | 4 |
| 100044 | Mahasiswa_0044 | Perempuan | 19 | 3 | Matematika | Pekanbaru | 13.3 | 83.4 | 76.9 | 94.3 | 86.7 | 4.4 | 5.6 | 4 |
| 100156 | Mahasiswa_0156 | Laki-laki | 24 | 5 | Statistika | Pekanbaru | 11.8 | 87.9 | 55.4 | 93.4 | 80.0 | 4.6 | 7.5 | 3 |
| 100495 | Mahasiswa_0495 | Perempuan | 20 | 5 | Statistika | Pekanbaru | 13.8 | 93.8 | 83.7 | 100.0 | 93.8 | 5.6 | 6.3 | 5 |
| 100971 | Mahasiswa_0971 | Perempuan | 21 | 3 | Statistika | Pekanbaru | 20.1 | 87.7 | 71.3 | 91.5 | 86.6 | 5.9 | 6.3 | 3 |
Tahap pemeriksaan akhir penting karena proses cleaning dapat mengubah isi dataset. Dengan melakukan pemeriksaan ulang, kondisi dataset setelah wrangling dapat dibandingkan dengan kondisi awal.
VI. Analisis Data Setelah Wrangling
Setelah proses eksplorasi dan data wrangling selesai, dataset telah dipersiapkan untuk digunakan dalam analisis lanjutan.
Analisis yang dilakukan terdiri dari:
- Regresi linear berganda.
- Uji normalitas residual.
- Uji homoskedastisitas.
- Pengelompokan jam belajar.
- Encoding kategori jam belajar.
- Visualisasi kategori jam belajar.
6.1 Uji Asumsi Model
Model regresi perlu diperiksa melalui beberapa asumsi agar hasil analisis dapat dievaluasi berdasarkan kondisi residual model.
Dalam kegiatan ini digunakan dua pemeriksaan, yaitu:
- Uji normalitas residual menggunakan Kolmogorov-Smirnov.
- Uji homoskedastisitas menggunakan Breusch-Pagan.
6.1.1 Regresi Linear Berganda
Regresi linear berganda digunakan untuk membentuk model yang melibatkan satu variabel respons dengan lebih dari satu variabel prediktor.
Dalam kegiatan ini, variabel yang digunakan adalah:
- Jam_Tidur_per_Hari sebagai variabel respons.
- Jam_Internet_per_Hari sebagai variabel prediktor.
- Jam_Belajar_per_Minggu sebagai variabel prediktor.
Model dibentuk menggunakan fungsi lm().
| Variabel | Estimate | Std. Error | t value | Pr(>|t|) |
|---|---|---|---|---|
| (Intercept) | 6.4859 | 0.1218 | 53.2479 | 0.0000 |
| Jam_Internet_per_Hari | 0.0098 | 0.0178 | 0.5509 | 0.5818 |
| Jam_Belajar_per_Minggu | 0.0140 | 0.0063 | 2.2388 | 0.0254 |
Secara umum, bentuk model regresi yang digunakan adalah:
Jam Tidur = β₀ + β₁(Jam Internet) + β₂(Jam Belajar) + ε
Tabel koefisien model memberikan informasi mengenai estimasi parameter, galat baku, statistik uji, dan nilai signifikansi yang dihasilkan dari regresi linear berganda.
6.1.2 Uji Normalitas Residual
Residual merupakan selisih antara nilai aktual dan nilai yang diprediksi oleh model.
Uji Kolmogorov-Smirnov digunakan untuk memeriksa distribusi residual.
##
## Asymptotic one-sample Kolmogorov-Smirnov test
##
## data: residu
## D = 0.031506, p-value = 0.1845
## alternative hypothesis: two-sided
Hasil uji digunakan untuk mengevaluasi apakah residual model memenuhi asumsi distribusi normal berdasarkan pengujian yang dilakukan.
6.1.3 Uji Homoskedastisitas
Homoskedastisitas berkaitan dengan kesamaan varians residual pada berbagai nilai prediksi.
Uji Breusch-Pagan digunakan untuk melakukan pemeriksaan tersebut.
##
## studentized Breusch-Pagan test
##
## data: model
## BP = 0.66852, df = 2, p-value = 0.7159
Hasil pengujian dapat digunakan untuk mengevaluasi apakah terdapat indikasi ketidaksamaan varians residual pada model.
VII. Integrasi Data I
7.1 Penjelasan Integrasi Data
Integrasi Data I merupakan proses penggabungan dua dataset mahasiswa
menggunakan ID_Mahasiswa sebagai key. Data 1
digunakan sebagai data utama, sedangkan Data 2 memberikan informasi
tambahan berupa Kategori_Belajar.
Integrasi data merupakan proses menggabungkan dua dataset yang
memiliki informasi mengenai objek yang sama. Pada Integrasi Data I,
penggabungan dilakukan menggunakan ID_Mahasiswa sebagai key
atau kunci utama.
Tujuan integrasi adalah menggabungkan informasi dari Data 1 dan Data 2 sehingga diperoleh dataset yang lebih lengkap. Pada tahap ini, Data 2 memberikan informasi tambahan berupa Kategori_Belajar yang diperoleh dari pengelompokan Jam_Belajar_per_Minggu.
7.2 Data 1
Data 1 merupakan data utama yang berisi informasi mahasiswa mengenai waktu tidur, penggunaan internet, dan waktu belajar.
Variabel yang digunakan adalah:
- ID_Mahasiswa
- Jam_Tidur_per_Hari
- Jam_Internet_per_Hari
- Jam_Belajar_per_Minggu
| ID_Mahasiswa | Jam_Tidur_per_Hari | Jam_Internet_per_Hari | Jam_Belajar_per_Minggu |
|---|---|---|---|
| 100740 | 4.9 | 5.8 | 3.6 |
| 100789 | 7.7 | 3.4 | 13.0 |
| 100044 | 5.6 | 4.4 | 13.3 |
| 100156 | 7.5 | 4.6 | 11.8 |
| 100495 | 6.3 | 5.6 | 13.8 |
| 100971 | 6.3 | 5.9 | 20.1 |
ID_Mahasiswa digunakan sebagai kunci untuk menghubungkan Data 1 dengan Data 2.
7.3 Data 2
Data 2 merupakan data tambahan yang berisi kategori berdasarkan jumlah jam belajar mahasiswa.
Sebelum membuat Data 2, Jam_Belajar_per_Minggu dikelompokkan menjadi tiga kategori:
| Rentang | Kategori |
|---|---|
| < 10 jam | Rendah |
| 10–20 jam | Sedang |
| > 20 jam | Tinggi |
Selanjutnya Data 2 dibuat dengan:
| ID_Mahasiswa | Kategori_Belajar |
|---|---|
| 100740 | Rendah |
| 100789 | Sedang |
| 100044 | Sedang |
| 100156 | Sedang |
| 100495 | Sedang |
| 100971 | Tinggi |
Data 2 kemudian digunakan sebagai sumber informasi tambahan pada proses integrasi.
7.4 Data Gabungan
Data 1 dan Data 2 digabungkan menggunakan ID_Mahasiswa sebagai key.
Penggabungan menggunakan left_join() agar seluruh data pada
Data 1 tetap dipertahankan.
| ID_Mahasiswa | Jam_Tidur_per_Hari | Jam_Internet_per_Hari | Jam_Belajar_per_Minggu | Kategori_Belajar |
|---|---|---|---|---|
| 100740 | 4.9 | 5.8 | 3.6 | Rendah |
| 100789 | 7.7 | 3.4 | 13.0 | Sedang |
| 100044 | 5.6 | 4.4 | 13.3 | Sedang |
| 100156 | 7.5 | 4.6 | 11.8 | Sedang |
| 100495 | 6.3 | 5.6 | 13.8 | Sedang |
| 100971 | 6.3 | 5.9 | 20.1 | Tinggi |
Pemeriksaan hasil integrasi dilakukan dengan:
| Pemeriksaan | Jumlah |
|---|---|
| Baris data gabungan | 1200 |
| NA Kategori_Belajar | 0 |
Pemeriksaan tersebut bertujuan memastikan bahwa data berhasil digabungkan dan Kategori_Belajar telah ditambahkan dengan benar.
Grafik Data Gabungan I:
Grafik menunjukkan distribusi jumlah mahasiswa berdasarkan kategori jam belajar, yaitu Rendah, Sedang, dan Tinggi.
7.5 Data Encoding
Pada tahap ini, Kategori_Belajar diubah menjadi bentuk faktor dan kemudian diberikan kode numerik.
Urutan kategori yang digunakan adalah:
- Rendah = 1
- Sedang = 2
- Tinggi = 3
Pertama, dibuat variabel faktor:
Kemudian dibuat kode numerik:
Pemeriksaan hasil encoding:
| ID_Mahasiswa | Jam_Belajar_per_Minggu | Jam_Belajar_Factor | Jam_Belajar_Code |
|---|---|---|---|
| 100740 | 3.6 | Rendah | 1 |
| 100789 | 13.0 | Sedang | 2 |
| 100044 | 13.3 | Sedang | 2 |
| 100156 | 11.8 | Sedang | 2 |
| 100495 | 13.8 | Sedang | 2 |
| 100971 | 20.1 | Tinggi | 3 |
| 100271 | 7.0 | Rendah | 1 |
| 100591 | 14.4 | Sedang | 2 |
| 100124 | 10.4 | Sedang | 2 |
| 100114 | 21.4 | Tinggi | 3 |
Hasil encoding digunakan pada tahap Integrasi Data II.
7.6 Kesimpulan Integrasi Data I
Integrasi Data I berhasil menggabungkan Data 1 dan Data 2 menggunakan ID_Mahasiswa sebagai key. Data gabungan menghasilkan informasi mengenai jam tidur, jam internet, jam belajar, serta kategori belajar mahasiswa.
Selanjutnya, Kategori_Belajar diubah menjadi faktor dan kode numerik sebagai persiapan untuk proses Integrasi Data II.
VIII. Integrasi Data II
8.1 Penjelasan Integrasi Data
Integrasi Data II merupakan tahap lanjutan yang menggabungkan data
utama dengan hasil encoding jam belajar. Penggabungan tetap menggunakan
ID_Mahasiswa sebagai key agar informasi faktor dan
kode numerik jam belajar terhubung dengan mahasiswa yang sesuai.
Integrasi Data II merupakan tahap lanjutan setelah Integrasi Data I dan proses encoding. Pada tahap ini, data utama digabungkan dengan data yang telah memiliki kategori faktor dan kode numerik jam belajar.
Penggabungan tetap menggunakan ID_Mahasiswa sebagai
key agar informasi dari kedua data dapat dicocokkan dengan
mahasiswa yang sesuai.
8.2 Data 1
Data 1 pada Integrasi Data II berisi informasi mengenai mahasiswa dan penggunaan internet.
Variabel yang digunakan adalah:
- ID_Mahasiswa
- Jam_Internet_per_Hari
| ID_Mahasiswa | Jam_Internet_per_Hari |
|---|---|
| 100740 | 5.8 |
| 100789 | 3.4 |
| 100044 | 4.4 |
| 100156 | 4.6 |
| 100495 | 5.6 |
| 100971 | 5.9 |
Data ini digunakan sebagai data utama dalam Integrasi Data II.
8.3 Data 2
Data 2 merupakan data hasil encoding yang berisi kategori faktor dan kode numerik jam belajar.
Variabel yang digunakan adalah:
- ID_Mahasiswa
- Jam_Belajar_Factor
- Jam_Belajar_Code
| ID_Mahasiswa | Jam_Belajar_Factor | Jam_Belajar_Code |
|---|---|---|
| 100740 | Rendah | 1 |
| 100789 | Sedang | 2 |
| 100044 | Sedang | 2 |
| 100156 | Sedang | 2 |
| 100495 | Sedang | 2 |
| 100971 | Tinggi | 3 |
Data 2 memberikan informasi tambahan mengenai kategori dan kode jam belajar setiap mahasiswa.
8.4 Data Gabungan
Data 1 dan Data 2 digabungkan berdasarkan ID_Mahasiswa.
| ID_Mahasiswa | Jam_Internet_per_Hari | Jam_Belajar_Factor | Jam_Belajar_Code |
|---|---|---|---|
| 100740 | 5.8 | Rendah | 1 |
| 100789 | 3.4 | Sedang | 2 |
| 100044 | 4.4 | Sedang | 2 |
| 100156 | 4.6 | Sedang | 2 |
| 100495 | 5.6 | Sedang | 2 |
| 100971 | 5.9 | Tinggi | 3 |
Pemeriksaan kategori:
| Variabel | Nilai |
|---|---|
| Rendah | 260 |
| Sedang | 815 |
| Tinggi | 125 |
Hasil tersebut digunakan untuk memastikan proses integrasi dan encoding telah berjalan dengan baik.
Grafik Data Gabungan II:
Grafik menunjukkan jumlah mahasiswa pada masing-masing kategori jam belajar.
8.5 Data Encoding
Data encoding pada Integrasi Data II terdiri dari dua variabel:
- Jam_Belajar_Factor
- Jam_Belajar_Code
Kode yang digunakan adalah:
- Jam_Belajar_Factor = Rendah, Sedang, Tinggi
- Jam_Belajar_Code = 1, 2, 3
Hasil encoding dapat diperiksa dengan:
| ID_Mahasiswa | Jam_Belajar_Factor | Jam_Belajar_Code |
|---|---|---|
| 100740 | Rendah | 1 |
| 100789 | Sedang | 2 |
| 100044 | Sedang | 2 |
| 100156 | Sedang | 2 |
| 100495 | Sedang | 2 |
| 100971 | Tinggi | 3 |
| 100271 | Rendah | 1 |
| 100591 | Sedang | 2 |
| 100124 | Sedang | 2 |
| 100114 | Tinggi | 3 |
Dengan adanya kode numerik, kategori jam belajar dapat digunakan dalam proses analisis yang membutuhkan representasi numerik.
8.6 Kesimpulan Integrasi Data II
Integrasi Data II berhasil menggabungkan informasi Jam_Internet_per_Hari dengan hasil encoding jam belajar menggunakan ID_Mahasiswa sebagai key.
Hasil akhir memiliki informasi mengenai penggunaan internet, kategori jam belajar, dan kode numerik jam belajar. Data tersebut selanjutnya dapat digunakan untuk analisis dan visualisasi.
IX. Ringkasan Akhir
X. Kesimpulan
Berdasarkan seluruh tahapan yang dilakukan, dataset mahasiswa telah melalui proses eksplorasi, data wrangling, analisis regresi dan pemeriksaan asumsi, serta integrasi dan encoding data. Permasalahan kualitas data ditangani melalui pembersihan duplikasi, standarisasi data kategorik, penanganan nilai tidak valid, dan pengisian missing value numerik menggunakan median.
Selanjutnya, proses integrasi menggunakan ID_Mahasiswa
sebagai key menghasilkan data yang lebih terstruktur dan siap
digunakan untuk analisis berikutnya.