Aplikasi jejak karbon EcoTrack mencatat menit penggunaan harian dari 15 pengguna aktif selama satu minggu.
Data yang digunakan:
data <- c(22, 25, 19, 30, 24, 21, 45, 23,
20, 26, 24, 22, 18, 27, 23)
data
## [1] 22 25 19 30 24 21 45 23 20 26 24 22 18 27 23
Data setelah diurutkan:
sort(data)
## [1] 18 19 20 21 22 22 23 23 24 24 25 26 27 30 45
Mean atau rata-rata dihitung menggunakan fungsi
mean().
mean_data <- mean(data)
mean_data
## [1] 24.6
Hasil mean adalah 24,6 menit.
Secara manual:
\[ \bar{x} = \frac{\sum x}{n} = \frac{369}{15} = 24,6 \]
Jadi, rata-rata waktu penggunaan EcoTrack adalah 24,6 menit.
Median dihitung menggunakan fungsi median().
median_data <- median(data)
median_data
## [1] 23
Hasil median adalah 23 menit.
Karena terdapat 15 data, posisi median adalah:
\[ \frac{15+1}{2}=8 \]
Data ke-8 setelah diurutkan adalah 23.
Untuk mencari modus, digunakan tabel frekuensi.
frekuensi <- table(data)
frekuensi
## data
## 18 19 20 21 22 23 24 25 26 27 30 45
## 1 1 1 1 2 2 2 1 1 1 1 1
Nilai yang memiliki frekuensi terbesar adalah:
modus <- as.numeric(names(frekuensi[frekuensi == max(frekuensi)]))
modus
## [1] 22 23 24
Hasilnya adalah 22, 23, dan 24 menit. Data mempunyai tiga modus (trimodal).
Kuartil dapat dihitung menggunakan fungsi
quantile().
quantile(data)
## 0% 25% 50% 75% 100%
## 18.0 21.5 23.0 25.5 45.0
Hasil:
Q1 <- quantile(data, 0.25)
Q3 <- quantile(data, 0.75)
Q1
## 25%
## 21.5
Q3
## 75%
## 25.5
IQR dihitung dengan:
\[ IQR = Q3-Q1 \]
IQR_data <- IQR(data)
IQR_data
## [1] 4
Hasil:
\[ IQR = 25,5-21,5=4 \]
Jadi, IQR = 4 menit.
IQR sebesar 4 menit menunjukkan bahwa 50% data tengah berada pada rentang 21,5 sampai 25,5 menit. Penyebaran data pada bagian tengah relatif tidak terlalu besar.
Varians sampel dihitung menggunakan fungsi var().
varians <- var(data)
varians
## [1] 41.54286
Hasil: Varians sampel = 41,54 menit².
Standar deviasi sampel dihitung menggunakan fungsi
sd().
standar_deviasi <- sd(data)
standar_deviasi
## [1] 6.445375
Hasil: Standar deviasi sampel = 6,45 menit.
round(varians, 2)
## [1] 41.54
round(standar_deviasi, 2)
## [1] 6.45
Standar deviasi sekitar 6,45 menit menunjukkan bahwa data memiliki penyebaran yang cukup terlihat dari rata-ratanya. Sebagian besar data berada pada kisaran 20–30 menit, tetapi nilai 45 menit membuat penyebaran menjadi lebih besar. Data dapat dikatakan memiliki variasi sedang.
Catatan:
var()dansd()di R menggunakan rumus sampel dengan penyebut \(n-1\).
Koefisien skewness Pearson dihitung dengan:
\[ Sk = 3\left(\frac{\bar{x}-Me}{SD}\right) \]
Untuk memperoleh SD populasi yang digunakan pada rumus Pearson:
mean_data <- mean(data)
median_data <- median(data)
sd_populasi <- sqrt(mean((data - mean_data)^2))
pearson_skewness <- 3 *
(mean_data - median_data) / sd_populasi
pearson_skewness
## [1] 0.7708585
Hasil:
Skewness Pearson ≈ 0,771.
round(pearson_skewness, 3)
## [1] 0.771
Nilai skewness Pearson sebesar 0,771 bernilai positif. Oleh karena itu, distribusi data memiliki kemencengan ke kanan (positive/right skewness). Kemencengan ini terutama dipengaruhi oleh nilai 45 menit, yang lebih tinggi dibandingkan sebagian besar data lainnya.
skewness()Fungsi skewness() dapat digunakan dari package
e1071.
install.packages("e1071")
Setelah package terpasang:
mean_data <- mean(data)
median_data <- median(data)
# SD populasi
sd_populasi <- sqrt(mean((data - mean_data)^2))
# Pearson Skewness
pearson_skewness <- 3 *
(mean_data - median_data) / sd_populasi
round(pearson_skewness, 3)
## [1] 0.771
Nilai dari fungsi
skewness()dapat berbeda dari 0,771 karena menggunakan definisi/perhitungan skewness yang berbeda. Untuk soal ini, nilai 0,771 merupakan koefisien skewness Pearson sesuai rumus di atas.
Jika EcoTrack memiliki data yang lebih besar, misalnya 100 pengguna, langkahnya adalah sebagai berikut.
Tentukan nilai terkecil dan terbesar dari seluruh data, kemudian hitung range:
\[ R=X_{maks}-X_{min} \]
Gunakan aturan Sturges:
\[ k=1+3,3\log(n) \]
Untuk 100 data:
\[ k=1+3,3\log(100)\approx7,6 \]
Sehingga dapat digunakan sekitar 8 kelas.
\[ P=\frac{R}{k} \]
Hasil kemudian dibulatkan agar interval kelas mudah digunakan.
Tabel dibuat dengan kolom interval kelas, frekuensi, titik tengah, dan frekuensi kumulatif.
\[ \bar{x}=\frac{\sum f_i x_i}{\sum f_i} \]
Cari kelas yang mencakup posisi \(n/2\), kemudian gunakan:
\[ Me=L+\left(\frac{\frac{n}{2}-F}{f}\right)p \]
Keterangan: \(L\) = tepi bawah kelas median, \(F\) = frekuensi kumulatif sebelum kelas median, \(f\) = frekuensi kelas median, dan \(p\) = panjang interval.
Cari kelas dengan frekuensi terbesar, kemudian gunakan:
\[ Mo=L+\left(\frac{d_1}{d_1+d_2}\right)p \]
Dengan demikian, mean dihitung menggunakan titik tengah dan frekuensi, median menggunakan kelas median, sedangkan modus menggunakan kelas dengan frekuensi terbesar.
Berdasarkan analisis data 15 pengguna EcoTrack diperoleh:
hasil <- data.frame(
Ukuran = c(
"Mean", "Median", "Modus", "Q1", "Q3", "IQR",
"Varians Sampel", "Standar Deviasi Sampel", "Skewness Pearson"
),
Hasil = c(
mean_data,
median_data,
paste(modus, collapse = ", "),
as.numeric(Q1),
as.numeric(Q3),
IQR_data,
round(varians, 2),
round(standar_deviasi, 2),
round(pearson_skewness, 3)
)
)
hasil
Secara keseluruhan, data mempunyai rata-rata penggunaan 24,6 menit, median 23 menit, dan modus 22, 23, serta 24 menit. Nilai IQR sebesar 4 menit menunjukkan penyebaran 50% data tengah yang relatif sempit. Standar deviasi sampel sebesar 6,45 menit menunjukkan variasi sedang. Koefisien skewness Pearson sebesar 0,771 menunjukkan distribusi data miring ke kanan, salah satunya dipengaruhi oleh nilai penggunaan sebesar 45 menit.