Ilustrasi Kasus — ‘EcoTrack’

Aplikasi jejak karbon ‘EcoTrack’ mencatat menit penggunaan harian dari 15 pengguna aktif dalam satu minggu:

22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23

x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
n <- length(x)
n
## [1] 15
sort(x)
##  [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45

Soal 1 — Mean, Median, dan Modus

Soal: Hitung mean, median, dan modus data tersebut secara manual, lalu verifikasi dengan RStudio.

Verifikasi RStudio

mean_x   <- mean(x)
median_x <- median(x)

# R tidak punya fungsi bawaan untuk modus, jadi dibuat sendiri
tabel_frek <- table(x)
modus_x    <- as.numeric(names(tabel_frek[tabel_frek == max(tabel_frek)]))

cat("Mean   :", mean_x, "\n")
## Mean   : 24.6
cat("Median :", median_x, "\n")
## Median : 23
cat("Modus  :", modus_x, "\n")
## Modus  : 22 23 24
tabel_frek
## x
## 18 19 20 21 22 23 24 25 26 27 30 45 
##  1  1  1  1  2  2  2  1  1  1  1  1

Interpretasi: Rata-rata penggunaan sebesar 24,6 menit/hari lebih besar daripada median 23 menit karena ada pengguna dengan nilai ekstrem (45 menit) yang menarik mean ke atas. Modus bernilai ganda (22, 23, dan 24 menit) karena masing-masing muncul dua kali.


Soal 2 — Q1, Q3, dan IQR

Soal: Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini.

Verifikasi RStudio

Q1    <- quantile(x, 0.25)
Q3    <- quantile(x, 0.75)
IQR_x <- IQR(x)

Q1
##  25% 
## 21.5
Q3
##  75% 
## 25.5
IQR_x
## [1] 4
summary(x)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##    18.0    21.5    23.0    24.6    25.5    45.0
# Batas pencilan (aturan 1,5 x IQR)
batas_bawah <- Q1 - 1.5 * IQR_x
batas_atas  <- Q3 + 1.5 * IQR_x
c(batas_bawah = unname(batas_bawah), batas_atas = unname(batas_atas))
## batas_bawah  batas_atas 
##        15.5        31.5
x[x < batas_bawah | x > batas_atas]
## [1] 45
boxplot(x, horizontal = TRUE, col = "lightgreen",
        main = "Boxplot Menit Penggunaan EcoTrack", xlab = "Menit per hari")

Interpretasi: IQR sebesar 4 menit berarti 50% pengguna di bagian tengah memiliki durasi penggunaan harian yang hanya berbeda sekitar 4 menit (rentang 21,5–25,5 menit). Artinya sebagian besar pengguna cukup homogen. Nilai 45 menit berada di atas batas atas pencilan (31,5) sehingga tergolong pencilan.


Soal 3 — Varians, Standar Deviasi, dan Tingkat Variasi

Soal: Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah?

Verifikasi RStudio

var_x <- var(x)   # varians sampel (n-1)
sd_x  <- sd(x)    # simpangan baku sampel
cv_x  <- sd_x / mean(x) * 100

cat("Varians :", round(var_x, 2), "\n")
## Varians : 41.54
cat("Std dev :", round(sd_x, 2), "\n")
## Std dev : 6.45
cat("CV (%)  :", round(cv_x, 2), "\n")
## CV (%)  : 26.2

Interpretasi: Standar deviasi sebesar 6,45 menit terhadap rata-rata 24,6 menit (CV ≈ 26%) menunjukkan variasi sedang cenderung cukup tinggi. Variasi ini sebagian besar dipengaruhi oleh satu pengguna ekstrem (45 menit). Pembuktian:

x_tanpa <- x[x != 45]
c(sd_dengan = sd(x), sd_tanpa_45 = sd(x_tanpa),
  cv_tanpa_45 = sd(x_tanpa) / mean(x_tanpa) * 100)
##   sd_dengan sd_tanpa_45 cv_tanpa_45 
##    6.445375    3.231031   13.961244

Soal 4 — Koefisien Skewness Pearson

Soal: Hitung koefisien skewness Pearson dan tentukan arah kemencengannya; verifikasi dengan fungsi skewness() di R.

Verifikasi RStudio

# install.packages("moments")   # jalankan sekali jika belum terpasang
library(moments)

sk_pearson2 <- 3 * (mean(x) - median(x)) / sd(x)
sk_fungsi   <- skewness(x)      # fungsi skewness() dari package moments

cat("Skewness Pearson (koef. 2) :", round(sk_pearson2, 3), "\n")
## Skewness Pearson (koef. 2) : 0.745
cat("skewness() moments         :", round(sk_fungsi, 3), "\n")
## skewness() moments         : 2.213
hist(x, breaks = 8, col = "skyblue", border = "white",
     main = "Histogram Menit Penggunaan EcoTrack", xlab = "Menit per hari")
abline(v = c(mean(x), median(x)), col = c("red", "darkgreen"), lwd = 2, lty = 2)
legend("topright", legend = c("Mean", "Median"),
       col = c("red", "darkgreen"), lty = 2, lwd = 2)

Interpretasi: Karena modus tidak tunggal, digunakan koefisien Pearson kedua (berbasis median). Kedua ukuran bernilai positif, sehingga distribusi menceng positif (right-skewed): mean (24,6) > median (23), dengan ekor panjang di sisi kanan akibat pengguna 45 menit. Nilai skewness() lebih besar dari koefisien Pearson karena menggunakan momen ketiga yang sangat sensitif terhadap pencilan, namun arah kemencengannya tetap sama.


Kesimpulan

Data penggunaan EcoTrack memiliki mean 24,6 menit, median 23 menit, dan modus ganda (22, 23, 24). Distribusinya menceng ke kanan karena pencilan 45 menit, yang juga membuat standar deviasi (6,45) terlihat cukup besar. Untuk data seperti ini, median dan IQR lebih representatif dibanding mean dan standar deviasi.