Aplikasi jejak karbon ‘EcoTrack’ mencatat menit penggunaan harian dari 15 pengguna aktif dalam satu minggu:
22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23
x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
n <- length(x)
n
## [1] 15
sort(x)
## [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45
Soal: Hitung mean, median, dan modus data tersebut secara manual, lalu verifikasi dengan RStudio.
mean_x <- mean(x)
median_x <- median(x)
# R tidak punya fungsi bawaan untuk modus, jadi dibuat sendiri
tabel_frek <- table(x)
modus_x <- as.numeric(names(tabel_frek[tabel_frek == max(tabel_frek)]))
cat("Mean :", mean_x, "\n")
## Mean : 24.6
cat("Median :", median_x, "\n")
## Median : 23
cat("Modus :", modus_x, "\n")
## Modus : 22 23 24
tabel_frek
## x
## 18 19 20 21 22 23 24 25 26 27 30 45
## 1 1 1 1 2 2 2 1 1 1 1 1
Interpretasi: Rata-rata penggunaan sebesar 24,6 menit/hari lebih besar daripada median 23 menit karena ada pengguna dengan nilai ekstrem (45 menit) yang menarik mean ke atas. Modus bernilai ganda (22, 23, dan 24 menit) karena masing-masing muncul dua kali.
Soal: Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini.
Q1 <- quantile(x, 0.25)
Q3 <- quantile(x, 0.75)
IQR_x <- IQR(x)
Q1
## 25%
## 21.5
Q3
## 75%
## 25.5
IQR_x
## [1] 4
summary(x)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.0 21.5 23.0 24.6 25.5 45.0
# Batas pencilan (aturan 1,5 x IQR)
batas_bawah <- Q1 - 1.5 * IQR_x
batas_atas <- Q3 + 1.5 * IQR_x
c(batas_bawah = unname(batas_bawah), batas_atas = unname(batas_atas))
## batas_bawah batas_atas
## 15.5 31.5
x[x < batas_bawah | x > batas_atas]
## [1] 45
boxplot(x, horizontal = TRUE, col = "lightgreen",
main = "Boxplot Menit Penggunaan EcoTrack", xlab = "Menit per hari")
Interpretasi: IQR sebesar 4 menit berarti 50% pengguna di bagian tengah memiliki durasi penggunaan harian yang hanya berbeda sekitar 4 menit (rentang 21,5–25,5 menit). Artinya sebagian besar pengguna cukup homogen. Nilai 45 menit berada di atas batas atas pencilan (31,5) sehingga tergolong pencilan.
Soal: Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah?
var_x <- var(x) # varians sampel (n-1)
sd_x <- sd(x) # simpangan baku sampel
cv_x <- sd_x / mean(x) * 100
cat("Varians :", round(var_x, 2), "\n")
## Varians : 41.54
cat("Std dev :", round(sd_x, 2), "\n")
## Std dev : 6.45
cat("CV (%) :", round(cv_x, 2), "\n")
## CV (%) : 26.2
Interpretasi: Standar deviasi sebesar 6,45 menit terhadap rata-rata 24,6 menit (CV ≈ 26%) menunjukkan variasi sedang cenderung cukup tinggi. Variasi ini sebagian besar dipengaruhi oleh satu pengguna ekstrem (45 menit). Pembuktian:
x_tanpa <- x[x != 45]
c(sd_dengan = sd(x), sd_tanpa_45 = sd(x_tanpa),
cv_tanpa_45 = sd(x_tanpa) / mean(x_tanpa) * 100)
## sd_dengan sd_tanpa_45 cv_tanpa_45
## 6.445375 3.231031 13.961244
Soal: Hitung koefisien skewness Pearson dan tentukan
arah kemencengannya; verifikasi dengan fungsi skewness() di
R.
# install.packages("moments") # jalankan sekali jika belum terpasang
library(moments)
sk_pearson2 <- 3 * (mean(x) - median(x)) / sd(x)
sk_fungsi <- skewness(x) # fungsi skewness() dari package moments
cat("Skewness Pearson (koef. 2) :", round(sk_pearson2, 3), "\n")
## Skewness Pearson (koef. 2) : 0.745
cat("skewness() moments :", round(sk_fungsi, 3), "\n")
## skewness() moments : 2.213
hist(x, breaks = 8, col = "skyblue", border = "white",
main = "Histogram Menit Penggunaan EcoTrack", xlab = "Menit per hari")
abline(v = c(mean(x), median(x)), col = c("red", "darkgreen"), lwd = 2, lty = 2)
legend("topright", legend = c("Mean", "Median"),
col = c("red", "darkgreen"), lty = 2, lwd = 2)
Interpretasi: Karena modus tidak tunggal, digunakan
koefisien Pearson kedua (berbasis median). Kedua ukuran bernilai
positif, sehingga distribusi menceng positif
(right-skewed): mean (24,6) > median (23), dengan ekor
panjang di sisi kanan akibat pengguna 45 menit. Nilai
skewness() lebih besar dari koefisien Pearson karena
menggunakan momen ketiga yang sangat sensitif terhadap pencilan, namun
arah kemencengannya tetap sama.
Data penggunaan EcoTrack memiliki mean 24,6 menit, median 23 menit, dan modus ganda (22, 23, 24). Distribusinya menceng ke kanan karena pencilan 45 menit, yang juga membuat standar deviasi (6,45) terlihat cukup besar. Untuk data seperti ini, median dan IQR lebih representatif dibanding mean dan standar deviasi.