Analisis ini dilakukan untuk mengetahui karakteristik data penggunaan harian 15 pengguna aktif aplikasi jejak karbon EcoTrack. Analisis yang digunakan meliputi ukuran pemusatan data, ukuran penyebaran data, ukuran letak data, serta kemencengan distribusi data.
Data penggunaan harian yang dianalisis adalah sebagai berikut:
22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23.
Data dimasukkan ke dalam R menggunakan fungsi c().
data_ecotrack <- c(22, 25, 19, 30, 24, 21, 45, 23, 20,
26, 24, 22, 18, 27, 23)
data_ecotrack
## [1] 22 25 19 30 24 21 45 23 20 26 24 22 18 27 23
Berdasarkan data tersebut, terdapat 15 data penggunaan harian pengguna EcoTrack.
Mean atau rata-rata digunakan untuk mengetahui nilai rata-rata dari seluruh data. Mean dihitung dengan menjumlahkan seluruh nilai kemudian membaginya dengan jumlah data.
mean_ecotrack <- mean(data_ecotrack)
mean_ecotrack
## [1] 24.6
Hasil perhitungan menunjukkan bahwa mean data adalah 24,6 menit.
Median merupakan nilai tengah dari data setelah data diurutkan dari nilai terkecil hingga terbesar.
sort(data_ecotrack)
## [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45
median_ecotrack <- median(data_ecotrack)
median_ecotrack
## [1] 23
Hasil perhitungan menunjukkan bahwa median data adalah 23 menit. Artinya, nilai tengah dari data penggunaan harian adalah 23 menit. Artinya, rata-rata penggunaan harian aplikasi EcoTrack adalah 24,6 menit.
Modus merupakan nilai yang paling sering muncul dalam suatu kumpulan data. Frekuensi setiap nilai dapat dilihat menggunakan fungsi table().
frekuensi <- table(data_ecotrack)
frekuensi
## data_ecotrack
## 18 19 20 21 22 23 24 25 26 27 30 45
## 1 1 1 1 2 2 2 1 1 1 1 1
Untuk menentukan nilai yang memiliki frekuensi paling tinggi:
modus_ecotrack <- frekuensi[frekuensi == max(frekuensi)]
modus_ecotrack
## data_ecotrack
## 22 23 24
## 2 2 2
Berdasarkan hasil tersebut, nilai 22, 23, dan 24 masing-masing muncul sebanyak 2 kali. Dengan demikian, data memiliki tiga modus, yaitu 22, 23, dan 24 menit.
Kuartil digunakan untuk mengetahui posisi data berdasarkan pembagian data menjadi empat bagian. Q1 merupakan kuartil pertama, sedangkan Q3 merupakan kuartil ketiga.
Perhitungan kuartil dilakukan menggunakan fungsi quantile().
kuartil_ecotrack <- quantile(data_ecotrack)
kuartil_ecotrack
## 0% 25% 50% 75% 100%
## 18.0 21.5 23.0 25.5 45.0
Berdasarkan hasil perhitungan R diperoleh:
Q1 = 22 menit Q2 atau median = 23 menit Q3 = 25 menit
Selanjutnya, Interquartile Range (IQR) dihitung dengan fungsi IQR()
iqr_ecotrack <- IQR(data_ecotrack)
iqr_ecotrack
## [1] 4
Hasil perhitungan menunjukkan bahwa nilai IQR adalah 3 menit.
IQR menunjukkan rentang 50% data yang berada di bagian tengah. Dengan demikian, berdasarkan hasil R, 50% data tengah berada pada rentang sekitar 22 sampai 25 menit.
Varians digunakan untuk mengetahui tingkat penyebaran data terhadap rata-ratanya. Semakin besar nilai varians, semakin besar penyebaran data.
Varians sampel dihitung menggunakan fungsi var().
varians_ecotrack <- var(data_ecotrack)
varians_ecotrack
## [1] 41.54286
Hasil perhitungan menunjukkan bahwa varians data adalah sekitar 41,54 menit².
Standar deviasi merupakan akar dari varians dan digunakan untuk melihat seberapa jauh data menyebar dari nilai rata-ratanya.
sd_ecotrack <- sd(data_ecotrack)
sd_ecotrack
## [1] 6.445375
Hasil perhitungan menunjukkan bahwa standar deviasi data adalah sekitar 6,45 menit.
Berdasarkan hasil perhitungan, diperoleh varians sebesar 41,54 menit² dan standar deviasi sebesar 6,45 menit.
Menurut saya, data tersebut tergolong memiliki variasi yang cukup tinggi. Hal ini terlihat dari standar deviasi sebesar 6,45 menit dibandingkan dengan mean sebesar 24,6 menit. Selain itu, terdapat nilai 45 menit yang relatif jauh dari sebagian besar data sehingga turut meningkatkan penyebaran data.
Skewness digunakan untuk mengetahui arah kemencengan distribusi data. Koefisien skewness Pearson dihitung menggunakan rumus:
\[ Sk = \frac{3(\bar{x} - Me)}{s} \]
Keterangan:
\(\bar{x}\) = mean \(Me\) = median \(s\) = standar deviasi
Nilai mean, median, dan standar deviasi yang telah diperoleh sebelumnya digunakan untuk menghitung skewness Pearson.
mean_ecotrack <- mean(data_ecotrack)
median_ecotrack <- median(data_ecotrack)
sd_ecotrack <- sd(data_ecotrack)
pearson_skewness <-
3 * (mean_ecotrack - median_ecotrack) / sd_ecotrack
pearson_skewness
## [1] 0.7447201
Hasil perhitungan menunjukkan bahwa koefisien skewness Pearson adalah sekitar 0,745.
Nilai skewness yang positif menunjukkan bahwa distribusi data memiliki kemencengan ke arah kanan (positive/right skewness). Hal tersebut juga dapat dilihat dari adanya nilai 45 menit yang relatif tinggi dibandingkan sebagian besar data.
Verifikasi dilakukan menggunakan fungsi skewness() dari package e1071.
library(e1071)
skewness_ecotrack <- skewness(data_ecotrack)
skewness_ecotrack
## [1] 1.995046
Hasil fungsi skewness() digunakan sebagai pembanding untuk melihat arah kemencengan distribusi data. Hasil yang bernilai positif menunjukkan bahwa data memiliki kecenderungan menceng ke kanan.
Apabila EcoTrack memiliki data yang lebih besar, misalnya 100 pengguna, data dapat disajikan dalam bentuk tabel distribusi frekuensi agar lebih mudah dianalisis.
Langkah pertama adalah menentukan nilai minimum dan maksimum data. Selanjutnya, ditentukan jumlah kelas dan panjang interval kelas. Data kemudian dikelompokkan ke dalam interval yang telah ditentukan dan dihitung frekuensinya.
Untuk menghitung mean data berkelompok, terlebih dahulu ditentukan titik tengah setiap kelas. Titik tengah diperoleh dengan rumus:
\[ x_i = \frac{\text{batas bawah} + \text{batas atas}}{2} \]
Setelah titik tengah diperoleh, setiap titik tengah dikalikan dengan frekuensi kelasnya. Selanjutnya, seluruh hasil perkalian dijumlahkan dan dibagi dengan jumlah frekuensi.
Rumus mean data berkelompok:
\[ \bar{x} = \frac{\sum f_i x_i}{\sum f_i} \]
Dengan demikian, langkahnya adalah menentukan interval kelas, menghitung frekuensi, menentukan titik tengah, menghitung \(f_i x_i\), kemudian menggunakan rumus mean.
Untuk menentukan median data berkelompok, terlebih dahulu dihitung posisi median dengan rumus:
\[ \frac{n}{2} \]
Kemudian ditentukan kelas median berdasarkan frekuensi kumulatif. Setelah kelas median diketahui, nilai median dihitung menggunakan rumus:
\[ Me = L + \left(\frac{\frac{n}{2}-F}{f}\right)c \]
Keterangan:
\(L\) = tepi bawah kelas median \(n\) = jumlah seluruh data \(F\) = frekuensi kumulatif sebelum kelas median \(f\) = frekuensi kelas median \(c\) = panjang interval kelas
Untuk menentukan modus data berkelompok, terlebih dahulu dicari kelas dengan frekuensi paling tinggi. Kelas tersebut disebut kelas modus.
Nilai modus kemudian dapat dihitung menggunakan rumus:
\[ Mo = L + \left(\frac{d_1}{d_1+d_2}\right)c \]
Keterangan:
\(L\) = tepi bawah kelas modus \(d_1\) = selisih frekuensi kelas modus dengan kelas sebelumnya \(d_2\) = selisih frekuensi kelas modus dengan kelas sesudahnya \(c\) = panjang interval kelas
Dengan demikian, proses perhitungan data berkelompok dimulai dari menentukan interval kelas, menghitung frekuensi dan frekuensi kumulatif, menentukan titik tengah, kemudian menghitung mean, median, dan modus berdasarkan rumus masing-masing.
Berdasarkan analisis statistik deskriptif terhadap data penggunaan harian EcoTrack, diperoleh mean sebesar 24,6 menit, median sebesar 23 menit, dan modus sebesar 22, 23, dan 24 menit.
Hasil analisis kuartil menunjukkan Q1 sebesar 22 menit dan Q3 sebesar 25 menit, dengan IQR sebesar 3 menit. Varians data sebesar sekitar 41,54 menit², sedangkan standar deviasi sebesar sekitar 6,45 menit.
Koefisien skewness Pearson yang diperoleh sebesar sekitar 0,745. Nilai tersebut menunjukkan bahwa distribusi data memiliki kemencengan positif atau cenderung ke arah kanan. Hal ini berkaitan dengan adanya nilai 45 menit yang relatif jauh dari sebagian besar data.