Soal dan Ilustrasi Kasus: EcoTrack

Aplikasi jejak karbon EcoTrack mencatat menit penggunaan harian dari 15 pengguna aktif dalam satu minggu:

22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23

  1. Hitung mean, median, dan modus secara manual, lalu verifikasi dengan RStudio. (Manual + RStudio)
  2. Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini. (Manual + RStudio)
  3. Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah? (Manual + RStudio)
  4. Hitung koefisien skewness Pearson dan tentukan arah kemencengannya; verifikasi dengan fungsi skewness() di R. (RStudio)
  5. Jika EcoTrack ingin menyusun tabel distribusi frekuensi berkelompok dari data yang lebih besar (misalnya 100 pengguna), jelaskan langkah-langkah menghitung mean, median, dan modus berkelompok (cukup jelaskan prosedurnya, tanpa perlu menghitung angka). (Tulis di Kertas)

(catatan: untuk jawaban nomor 5 berada di kertas, alasan mengapa soal nomor 5 ada di sini yaitu karena nomor 5 termasuk ke dalam format tugas pendalaman pertemuan ke-4 jadi lebih baik ditambahkan saja agar tidak terjadi kekeliruan.)


Data

Data ini berisi berupa menit penggunaan harian aplikasi EcoTrack dari 15 pengguna aktif dalam satu minggu.

data<-c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
sort(data)
##  [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45

1. Mean, Median, dan Modus

mean(data)
## [1] 24.6
median(data)
## [1] 23
table(data)
## data
## 18 19 20 21 22 23 24 25 26 27 30 45 
##  1  1  1  1  2  2  2  1  1  1  1  1

Interpretasi: Rata-rata pengguna memakai EcoTrack selama 24,6 menit per hari. Median-nya 23 menit, artinya separuh pengguna memakai aplikasi 23 menit atau kurang. Modusnya ada tiga, yaitu 22, 23, dan 24 menit, yang merupakan durasi paling sering muncul. Mean (24,6) lebih besar dari median (23) karena ada satu pengguna dengan 45 menit yang menarik mean ke atas, sehingga median dan modus lebih mewakili pengguna pada umumnya.

2. Q1, Q3, dan IQR

Q1<-quantile(data, c(0.25),type = 6)
Q3<-quantile(data, c(0.75),type = 6)
IQR(data,type = 6)
## [1] 5

Interpretasi: Q1 = 21 menit dan Q3 = 26 menit, sehingga IQR = 5 menit. Artinya 50% pengguna di bagian tengah memakai EcoTrack antara 21 sampai 26 menit per hari, dengan selisih hanya 5 menit. Penggunaan sebagian besar pengguna cukup seragam. Nilai 45 menit berada di atas batas atas (Q3 + 1,5 x IQR = 33,5), sehingga tergolong pencilan.

(catatan: type = 6 dipakai agar hasilnya sama dengan rumus i(n+1)/4.)

3. Varians dan Standar Deviasi

var(data)
## [1] 41.54286
sd(data)
## [1] 6.445375
sd(data) / mean(data) * 100        # koefisien variasi (%)
## [1] 26.20071
sd(data[data != 45])               # standar deviasi tanpa pencilan
## [1] 3.231031

Interpretasi: Varians = 41,54 dan standar deviasi = 6,45 menit, artinya waktu penggunaan menyimpang rata-rata sekitar 6,45 menit dari mean. Koefisien variasinya 26,2%, jadi variasi tergolong sedang. Variasi ini terutama disebabkan oleh pencilan 45 menit. Tanpa nilai tersebut, standar deviasi turun menjadi sekitar 3,23 menit, sehingga data tergolong bervariasi rendah. Dengan kata lain, perilaku penggunaan EcoTrack umumnya homogen.

4. Skewness

library(e1071)

mean_data<-mean(data)
median_data<-median(data)
sd_data<-sd(data)

3 * (mean_data - median_data) / sd_data   # skewness Pearson
## [1] 0.7447201
skewness(data)                         # fungsi skewness() di R
## [1] 1.995046

Interpretasi: Skewness Pearson = 0,745 (positif), sehingga distribusi menceng ke kanan: ekor memanjang ke sisi nilai besar karena pengguna 45 menit menarik mean di atas median. Fungsi skewness() juga bernilai positif (sekitar 2,00). Angkanya berbeda karena rumusnya berbeda, tetapi arahnya sama, yaitu menceng ke kanan.