Ilustrasi kasus - Eco Track

Aplikasi jejak karbon EcoTrack mencatat menit penggunaan harian dari 15 pengguna aktif dalam satu minggu:

22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23

  1. Hitung mean, median, dan modus data tersebut secara manual, lalu verifikasi dengan RStudio. (Manual + RStudio)
  2. Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini. (Manual + RStudio)
  3. Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah? (Manual + RStudio)
  4. Hitung koefisien skewness Pearson dan tentukan arah kemencengannya; verifikasi dengan fungsi skewness() di R. (RStudio)
  5. Jika EcoTrack ingin menyusun tabel distribusi frekuensi berkelompok dari data yang lebih besar (misalnya 100 pengguna), jelaskan langkah-langkah menghitung mean, median, dan modus berkelompok (cukup jelaskan prosedurnya, tanpa perlu menghitung angka). (Tulis di Kertas)


1.Mean, median, dan modus

x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)

# MEAN: x_bar = sum(xi) / n
n <- length(x)
mean_manual <- sum(x) / n
mean_manual                      # 24.6
## [1] 24.6
# MEDIAN: urutkan dulu, lalu pakai rumus sesuai n ganjil/genap
x_urut <- sort(x)
if (n %% 2 == 1) {
  median_manual <- x_urut[(n + 1) / 2]                  # data ke-(n+1)/2
} else {
  median_manual <- (x_urut[n / 2] + x_urut[n / 2 + 1]) / 2
}
median_manual                    # 23
## [1] 23
# MODUS: nilai dengan frekuensi terbesar
frek <- table(x)
modus <- as.numeric(names(frek)[frek == max(frek)])
modus                            # 22 23 24
## [1] 22 23 24
# VERIFIKASI dengan fungsi bawaan R
mean(x)                          # 24.6
## [1] 24.6
median(x)                        # 23
## [1] 23

Mean adalah jumlah semua data dibagi banyaknya data. Mean mudah tertarik oleh nilai ekstrem. Di data EcoTrack, mean = 24,6 naik karena ada satu pengguna dengan 45 menit.

Median adalah nilai tengah setelah data diurutkan, sehingga tidak terpengaruh nilai ekstrem. Di data EcoTrack, median = 23.

Modus adalah nilai yang paling sering muncul. Di data EcoTrack ada tiga modus (22, 23, 24) karena masing-masing muncul 2 kali.


2.Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini. (Manual + RStudio)

# 2. Q1, Q3, dan IQR

x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
n <- length(x)
x_urut <- sort(x)
x_urut
##  [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45
# Rumus slide: Qi = data ke-i(n+1)/4
q1  <- x_urut[1 * (n + 1) / 4]   # data ke-4  = 21
q3  <- x_urut[3 * (n + 1) / 4]   # data ke-12 = 26
iqr <- q3 - q1                   # 5
q1; q3; iqr
## [1] 21
## [1] 26
## [1] 5
# Verifikasi: type = 6 memakai rumus i(n+1)/4 yang sama
quantile(x, c(0.25, 0.75), type = 6)   # 21 dan 26
## 25% 75% 
##  21  26
IQR(x, type = 6)                       # 5
## [1] 5

Data terurut: 18, 19, 20, 21, 22, 22, 23, 23, 24, 24, 25, 26, 27, 30, 45 (n = 15).

Interpretasi: IQR = 5 berarti 50% pengguna di tengah memakai EcoTrack dengan selisih 5 menit per hari (antara 21 sampai 26 menit). Rentangnya kecil, sehingga kebiasaan sebagian besar pengguna mirip. Nilai 45 menit tidak memengaruhi IQR karena berada di luar 50% data tengah.

3.Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah? (Manual + RStudio)

x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)
n <- length(x)

# Rumus slide: s^2 = sum((xi - x_bar)^2) / (n - 1)
jkt <- sum((x - mean(x))^2)
jkt                           # 581.6
## [1] 581.6
varians <- jkt / (n - 1)
varians                       # 41.54286
## [1] 41.54286
std_dev <- sqrt(varians)
std_dev                       # 6.445
## [1] 6.445375
# Verifikasi dengan fungsi bawaan
var(x)                        # 41.54286
## [1] 41.54286
sd(x)                         # 6.445
## [1] 6.445375
# Koefisien variasi (untuk menilai tinggi atau rendah)
cv <- sd(x) / mean(x) * 100
cv                            # 26.2
## [1] 26.20071

Koefisien variasi s / x̄ ≈ 26%, jadi data tergolong bervariasi sedang menuju tinggi. Penyebab utamanya satu data, yaitu 45 menit, yang menyumbang 416,16 dari total 581,6. Tanpa data itu, penggunaan EcoTrack cukup seragam.

4.Hitung koefisien skewness Pearson dan tentukan arah kemencengannya; verifikasi dengan fungsi skewness() di R. (RStudio)

x <- c(22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23)

# Rumus slide: Sk = 3(x_bar - Me) / s
sk <- 3 * (mean(x) - median(x)) / sd(x)
sk                              # 0.7447
## [1] 0.7447201
# Verifikasi dengan skewness()
library(moments)                # install.packages("moments") jika belum ada
skewness(x)                     # 2.21
## [1] 2.212573
library(e1071)                  # install.packages("e1071") jika belum ada
## 
## Attaching package: 'e1071'
## The following objects are masked from 'package:moments':
## 
##     kurtosis, moment, skewness
skewness(x)                     # 1.99
## [1] 1.995046

Angka skewness() (2,21 atau 1,99) berbeda dengan Sk Pearson (0,74) karena skewness() memakai rumus momen ke-3, bukan rumus Pearson. Yang perlu dicocokkan adalah arahnya: semuanya positif, jadi sama-sama menunjukkan menceng ke kanan.