Data EcoTrack

Aplikasi jejak karbon EcoTrack mencatat menit penggunaan harian dari 15 pengguna aktif selama satu minggu.

Data yang digunakan:

data <- c(22, 25, 19, 30, 24, 21, 45, 23,
          20, 26, 24, 22, 18, 27, 23)

data
##  [1] 22 25 19 30 24 21 45 23 20 26 24 22 18 27 23

Data setelah diurutkan:

sort(data)
##  [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45

1. Mean, Median, dan Modus

Mean

Mean atau rata-rata dihitung menggunakan fungsi mean().

mean_data <- mean(data)
mean_data
## [1] 24.6

Hasil mean adalah 24,6 menit.

Secara manual:

\[ \bar{x} = \frac{\sum x}{n} = \frac{369}{15} = 24,6 \]

Jadi, rata-rata waktu penggunaan EcoTrack adalah 24,6 menit.

Median

Median dihitung menggunakan fungsi median().

median_data <- median(data)
median_data
## [1] 23

Hasil median adalah 23 menit.

Karena terdapat 15 data, posisi median adalah:

\[ \frac{15+1}{2}=8 \]

Data ke-8 setelah diurutkan adalah 23.

Modus

Untuk mencari modus, digunakan tabel frekuensi.

frekuensi <- table(data)
frekuensi
## data
## 18 19 20 21 22 23 24 25 26 27 30 45 
##  1  1  1  1  2  2  2  1  1  1  1  1

Nilai yang memiliki frekuensi terbesar adalah:

modus <- as.numeric(names(frekuensi[frekuensi == max(frekuensi)]))
modus
## [1] 22 23 24

Hasilnya adalah 22, 23, dan 24 menit. Data mempunyai tiga modus (trimodal).

2. Q1, Q3, dan IQR

Kuartil dapat dihitung menggunakan fungsi quantile().

quantile(data)
##   0%  25%  50%  75% 100% 
## 18.0 21.5 23.0 25.5 45.0

Hasil:

Q1 <- quantile(data, 0.25)
Q3 <- quantile(data, 0.75)

Q1
##  25% 
## 21.5
Q3
##  75% 
## 25.5

IQR dihitung dengan:

\[ IQR = Q3-Q1 \]

IQR_data <- IQR(data)
IQR_data
## [1] 4

Hasil:

\[ IQR = 25,5-21,5=4 \]

Jadi, IQR = 4 menit.

Interpretasi

IQR sebesar 4 menit menunjukkan bahwa 50% data tengah berada pada rentang 21,5 sampai 25,5 menit. Penyebaran data pada bagian tengah relatif tidak terlalu besar.

3. Varians dan Standar Deviasi

Varians

Varians sampel dihitung menggunakan fungsi var().

varians <- var(data)
varians
## [1] 41.54286

Hasil: Varians sampel = 41,54 menit².

Standar Deviasi

Standar deviasi sampel dihitung menggunakan fungsi sd().

standar_deviasi <- sd(data)
standar_deviasi
## [1] 6.445375

Hasil: Standar deviasi sampel = 6,45 menit.

round(varians, 2)
## [1] 41.54
round(standar_deviasi, 2)
## [1] 6.45

Interpretasi

Standar deviasi sekitar 6,45 menit menunjukkan bahwa data memiliki penyebaran yang cukup terlihat dari rata-ratanya. Sebagian besar data berada pada kisaran 20–30 menit, tetapi nilai 45 menit membuat penyebaran menjadi lebih besar. Data dapat dikatakan memiliki variasi sedang.

Catatan: var() dan sd() di R menggunakan rumus sampel dengan penyebut \(n-1\).

4. Koefisien Skewness Pearson

Koefisien skewness Pearson dihitung dengan:

\[ Sk = 3\left(\frac{\bar{x}-Me}{SD}\right) \]

Untuk memperoleh SD populasi yang digunakan pada rumus Pearson:

mean_data <- mean(data)
median_data <- median(data)

sd_populasi <- sqrt(mean((data - mean_data)^2))

pearson_skewness <- 3 *
  (mean_data - median_data) / sd_populasi

pearson_skewness
## [1] 0.7708585

Hasil:

Skewness Pearson ≈ 0,771.

round(pearson_skewness, 3)
## [1] 0.771

Interpretasi

Nilai skewness Pearson sebesar 0,771 bernilai positif. Oleh karena itu, distribusi data memiliki kemencengan ke kanan (positive/right skewness). Kemencengan ini terutama dipengaruhi oleh nilai 45 menit, yang lebih tinggi dibandingkan sebagian besar data lainnya.

Verifikasi dengan fungsi skewness()

Fungsi skewness() dapat digunakan dari package e1071.

install.packages("e1071")

Setelah package terpasang:

mean_data <- mean(data)
median_data <- median(data)

# SD populasi
sd_populasi <- sqrt(mean((data - mean_data)^2))

# Pearson Skewness
pearson_skewness <- 3 *
  (mean_data - median_data) / sd_populasi

round(pearson_skewness, 3)
## [1] 0.771

Nilai dari fungsi skewness() dapat berbeda dari 0,771 karena menggunakan definisi/perhitungan skewness yang berbeda. Untuk soal ini, nilai 0,771 merupakan koefisien skewness Pearson sesuai rumus di atas.

5. Mean, Median, dan Modus Data Berkelompok

Jika EcoTrack memiliki data yang lebih besar, misalnya 100 pengguna, langkahnya adalah sebagai berikut.

Langkah 1: Menentukan nilai minimum dan maksimum

Tentukan nilai terkecil dan terbesar dari seluruh data, kemudian hitung range:

\[ R=X_{maks}-X_{min} \]

Langkah 2: Menentukan jumlah kelas

Gunakan aturan Sturges:

\[ k=1+3,3\log(n) \]

Untuk 100 data:

\[ k=1+3,3\log(100)\approx7,6 \]

Sehingga dapat digunakan sekitar 8 kelas.

Langkah 3: Menentukan panjang interval

\[ P=\frac{R}{k} \]

Hasil kemudian dibulatkan agar interval kelas mudah digunakan.

Langkah 4: Membuat tabel distribusi frekuensi

Tabel dibuat dengan kolom interval kelas, frekuensi, titik tengah, dan frekuensi kumulatif.

Mean data berkelompok

\[ \bar{x}=\frac{\sum f_i x_i}{\sum f_i} \]

Median data berkelompok

Cari kelas yang mencakup posisi \(n/2\), kemudian gunakan:

\[ Me=L+\left(\frac{\frac{n}{2}-F}{f}\right)p \]

Keterangan: \(L\) = tepi bawah kelas median, \(F\) = frekuensi kumulatif sebelum kelas median, \(f\) = frekuensi kelas median, dan \(p\) = panjang interval.

Modus data berkelompok

Cari kelas dengan frekuensi terbesar, kemudian gunakan:

\[ Mo=L+\left(\frac{d_1}{d_1+d_2}\right)p \]

Dengan demikian, mean dihitung menggunakan titik tengah dan frekuensi, median menggunakan kelas median, sedangkan modus menggunakan kelas dengan frekuensi terbesar.

Kesimpulan

Berdasarkan analisis data 15 pengguna EcoTrack diperoleh:

hasil <- data.frame(
  Ukuran = c(
    "Mean", "Median", "Modus", "Q1", "Q3", "IQR",
    "Varians Sampel", "Standar Deviasi Sampel", "Skewness Pearson"
  ),
  Hasil = c(
    mean_data,
    median_data,
    paste(modus, collapse = ", "),
    as.numeric(Q1),
    as.numeric(Q3),
    IQR_data,
    round(varians, 2),
    round(standar_deviasi, 2),
    round(pearson_skewness, 3)
  )
)

hasil

Secara keseluruhan, data mempunyai rata-rata penggunaan 24,6 menit, median 23 menit, dan modus 22, 23, serta 24 menit. Nilai IQR sebesar 4 menit menunjukkan penyebaran 50% data tengah yang relatif sempit. Standar deviasi sampel sebesar 6,45 menit menunjukkan variasi sedang. Koefisien skewness Pearson sebesar 0,771 menunjukkan distribusi data miring ke kanan, salah satunya dipengaruhi oleh nilai penggunaan sebesar 45 menit.