Aplikasi EcoTrack mencatat menit penggunaan harian dari 15 pengguna aktif.
library(moments)
menit <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
n <- length(menit)
n
## [1] 15
sort(menit)
## [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45
Rumus: \(\bar{x} = \frac{\sum x_i}{n}\)
sum(menit) # jumlah seluruh data
## [1] 369
sum(menit) / n # hitung manual
## [1] 24.6
mean(menit) # verifikasi dengan fungsi bawaan
## [1] 24.6
Karena n = 15 (ganjil), median adalah data ke-(n+1)/2 = data ke-8.
(n + 1) / 2 # posisi median
## [1] 8
sort(menit)[8] # data ke-8 pada data terurut
## [1] 23
median(menit) # verifikasi dengan fungsi bawaan
## [1] 23
table(menit) # frekuensi tiap nilai
## menit
## 18 19 20 21 22 23 24 25 26 27 30 45
## 1 1 1 1 2 2 2 1 1 1 1 1
modus <- function(x) {
t <- table(x)
as.numeric(names(t[t == max(t)]))
}
modus(menit)
## [1] 22 23 24
Interpretasi: Mean (24,6) lebih besar dari median (23) karena ada outlier 45 menit yang menarik mean ke atas. Data memiliki tiga modus (22, 23, dan 24) masing-masing muncul 2 kali. Median lebih representatif untuk data ini.
Rumus: \(Q_i = x_{\left(\frac{i(n+1)}{4}\right)}\)
(1 * (n + 1)) / 4 # posisi Q1
## [1] 4
(3 * (n + 1)) / 4 # posisi Q3
## [1] 12
# type = 6 -> posisi i(n+1)/4, sesuai rumus manual
quantile(menit, probs = c(0.25, 0.75), type = 6)
## 25% 75%
## 21 26
IQR(menit, type = 6)
## [1] 5
Interpretasi: IQR = 5 menit. Sebanyak 50% pengguna di bagian tengah memakai EcoTrack antara 21 sampai 26 menit per hari, dengan selisih hanya 5 menit, sehingga bagian tengah data cukup seragam.
Rumus: \(s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}\)
rata <- mean(menit)
# tabel penjumlahan manual
tabel <- data.frame(
xi = sort(menit),
selisih = sort(menit) - rata,
kuadrat = (sort(menit) - rata)^2
)
tabel
## xi selisih kuadrat
## 1 18 -6.6 43.56
## 2 19 -5.6 31.36
## 3 20 -4.6 21.16
## 4 21 -3.6 12.96
## 5 22 -2.6 6.76
## 6 22 -2.6 6.76
## 7 23 -1.6 2.56
## 8 23 -1.6 2.56
## 9 24 -0.6 0.36
## 10 24 -0.6 0.36
## 11 25 0.4 0.16
## 12 26 1.4 1.96
## 13 27 2.4 5.76
## 14 30 5.4 29.16
## 15 45 20.4 416.16
sum(tabel$kuadrat) # jumlah kuadrat selisih
## [1] 581.6
sum(tabel$kuadrat) / (n - 1) # varians (manual)
## [1] 41.54286
var(menit) # varians (fungsi)
## [1] 41.54286
sqrt(var(menit)) # SD (manual)
## [1] 6.445375
sd(menit) # SD (fungsi)
## [1] 6.445375
# pelengkap interpretasi
sd(menit) / mean(menit) * 100 # koefisien variasi (%)
## [1] 26.20071
sd(menit[menit != 45]) # SD tanpa outlier 45
## [1] 3.231031
Interpretasi: Varians sekitar 41,54 dan standar deviasi sekitar 6,45 menit (koefisien variasi sekitar 26%). Data tergolong bervariasi cukup tinggi, terutama karena outlier 45 menit. Tanpa nilai tersebut, SD turun menjadi sekitar 3,2 menit.
Rumus Pearson: \(Sk = \frac{3(\bar{x} - Me)}{s}\)
# Pearson (sesuai hitungan manual)
3 * (mean(menit) - median(menit)) / sd(menit)
## [1] 0.7447201
# Fungsi skewness() dari package moments
skewness(menit)
## [1] 2.212573
Interpretasi: Koefisien Pearson bernilai positif
(sekitar 0,74), dan skewness() juga positif (sekitar 2,21).
Nilainya berbeda karena rumus yang dipakai berbeda, tetapi arahnya sama,
yaitu distribusi menceng kanan. Hal ini sesuai dengan
mean yang lebih besar dari median dan adanya outlier 45 menit.