Aplikasi jejak karbon EcoTrack mencatat waktu penggunaan harian dari 15 pengguna aktif dalam satu minggu.
Data yang diperoleh adalah:
22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23.
data <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
data
## [1] 22 25 19 30 24 21 45 23 20 26 24 22 18 27 23
Mean atau rata-rata dihitung menggunakan fungsi mean().
mean(data)
## [1] 24.6
Hasil perhitungan menunjukkan bahwa rata-rata waktu penggunaan EcoTrack adalah 24,6 menit per hari.
Median merupakan nilai tengah dari data yang telah diurutkan.
median(data)
## [1] 23
Hasil median adalah 23 menit.
Modus merupakan nilai yang paling sering muncul. Untuk melihat frekuensi setiap nilai digunakan fungsi table().
table(data)
## data
## 18 19 20 21 22 23 24 25 26 27 30 45
## 1 1 1 1 2 2 2 1 1 1 1 1
Berdasarkan hasil tersebut, nilai 22, 23, dan 24 masing-masing muncul sebanyak 2 kali.
Jadi, modus data adalah 22, 23, dan 24 menit.
Kuartil digunakan untuk membagi data menjadi beberapa bagian. Q1 merupakan kuartil pertama, Q2 merupakan median, dan Q3 merupakan kuartil ketiga.
Q1 <- quantile(data, 0.25)
Q2 <- quantile(data, 0.50)
Q3 <- quantile(data, 0.75)
c(Q1 = Q1, Q2 = Q2, Q3 = Q3)
## Q1.25% Q2.50% Q3.75%
## 21.5 23.0 25.5
Berdasarkan hasil R:
Selanjutnya, IQR dihitung dengan rumus:
\[ IQR = Q3 - Q1 \]
IQR(data)
## [1] 4
Hasil IQR adalah 4 menit.
IQR sebesar 4 menit menunjukkan bahwa 50% data yang berada di bagian tengah memiliki rentang penggunaan antara 21,5 sampai 25,5 menit per hari.
Varians digunakan untuk mengetahui tingkat penyebaran data terhadap rata-rata.
var(data)
## [1] 41.54286
Hasil varians adalah sekitar 41,54 menit².
Standar deviasi dapat dihitung menggunakan fungsi sd().
sd(data)
## [1] 6.445375
Hasil standar deviasi adalah sekitar 6,45 menit.
Standar deviasi sebesar sekitar 6,45 menit menunjukkan bahwa waktu penggunaan harian cukup menyebar dari nilai rata-ratanya, yaitu 24,6 menit. Salah satu faktor yang menyebabkan penyebaran cukup besar adalah adanya nilai 45 menit yang lebih tinggi dibandingkan sebagian besar data.
Koefisien skewness Pearson dihitung menggunakan rumus:
\[ Sk = \frac{3(\bar{x}-Me)}{s} \]
Diketahui:
Maka:
\[ Sk = \frac{3(24,6-23)}{6,445375} \]
\[ Sk \approx 0,745 \]
Jadi, koefisien skewness Pearson adalah sekitar 0,745.
Karena nilainya positif, maka data memiliki kemencengan ke kanan (positive skewness).
Package e1071 digunakan untuk menghitung skewness menggunakan fungsi skewness().
library(e1071)
skewness(data)
## [1] 1.995046
Hasil dari R adalah sekitar 1,995046.
Nilai tersebut berbeda dengan perhitungan Pearson secara manual karena fungsi skewness() menggunakan metode perhitungan skewness yang berbeda. Namun, keduanya menghasilkan nilai positif sehingga menunjukkan bahwa data memiliki kemencengan ke kanan.
Jika EcoTrack memiliki data yang lebih besar, misalnya dari 100 pengguna, maka data dapat disajikan dalam bentuk tabel distribusi frekuensi berkelompok.
Langkah-langkah yang dilakukan adalah sebagai berikut:
Nilai minimum dan maksimum digunakan sebagai dasar untuk menentukan rentang data.
Range dihitung menggunakan rumus:
\[ R = X_{maks} - X_{min} \]
Jumlah kelas dapat ditentukan menggunakan rumus Sturges:
\[ k = 1 + 3,3\log(n) \]
dengan \(n\) merupakan jumlah data.
Panjang interval kelas dihitung dengan:
\[ p = \frac{R}{k} \]
Data kemudian dikelompokkan berdasarkan interval kelas dan dihitung frekuensinya. Selain frekuensi, dapat dibuat juga frekuensi kumulatif.
Pertama-tama menentukan nilai tengah setiap kelas:
\[ x_i = \frac{batas\ bawah + batas\ atas}{2} \]
Kemudian mean dihitung dengan:
\[ \bar{x} = \frac{\sum f_i x_i}{\sum f_i} \]
Tentukan terlebih dahulu kelas median berdasarkan posisi:
\[ \frac{n}{2} \]
Kemudian gunakan rumus:
\[ Me = L + \left(\frac{\frac{n}{2}-F}{f}\right)p \]
Kelas dengan frekuensi paling tinggi merupakan kelas modus. Selanjutnya modus dihitung menggunakan rumus:
\[ Mo = L + \left(\frac{d_1}{d_1+d_2}\right)p \]
Dengan demikian, mean, median, dan modus data berkelompok dapat diperoleh berdasarkan tabel distribusi frekuensi yang telah dibuat.