Ilustrasi Kasus

Aplikasi jejak karbon ‘EcoTrack’ mencatat menit pengguna aktif dalam 1 minggu :

22, 25, 19, 30, 24, 21, 45, 23, 20, 26, 24, 22, 18, 27, 23.

  1. Hitung mean, median, dan modus data tersebut.
  2. Tentukan Q1 dan Q3, lalu interpretasikan IQR-nya dalam konteks kasus ini.
  3. Hitung varians dan standar deviasi; menurut Anda, apakah data ini tergolong bervariasi tinggi atau rendah?
  4. Hitung koefisien skewness Pearson dan tentukan arah kemencengannya; verifikasi dengan fungsi skewness() di R.
  5. Jika EcoTrack ingin menyusun tabel distribusi frekuensi berkelompok dari data yang lebih besar (misalnya 100 pengguna), jelaskan langkahlangkah menghitung mean, median, dan modus berkelompok (cukup jelaskan prosedurnya, tanpa perlu menghitung angka). (Tulis di Kertas)

1. Menghitung Mean, Median, dan Modus

data_pengguna <- c(18, 19, 20, 21, 22, 22, 23, 23, 24, 24, 25, 26, 27, 30, 45)


n <- length(data_pengguna)
mean(data_pengguna)
## [1] 24.6
median(data_pengguna)
## [1] 23
modus <- function(x) {
  x <- x[!is.na(x)]
  frek <- table(x)
  maks <- max(frek)
  
  
  hasil <- frek[frek == maks]
  data.frame(Nilai = names(hasil),
             Frekuensi = as.vector(hasil))
}

modus(data_pengguna)
##   Nilai Frekuensi
## 1    22         2
## 2    23         2
## 3    24         2

2. Menghitung Q1 & Q2, Interpresentasikan IQR

skor <- c(18, 19, 20, 21, 22, 22, 23, 23, 24, 24, 25, 26, 27, 30, 45)

quantile(skor, probs = c(0.25, 0.75), type = 6)
## 25% 75% 
##  21  26
Q1 <- quantile(skor, 0.25, type = 6)
Q3 <- quantile(skor, 0.75, type = 6)
iqr <- Q3 - Q1
unname(iqr)
## [1] 5

Berdasarkan hasil yang diperoleh Q1 = 21 dan Q3 = 26. Nilai IQR sebesar 5, menunjukan bahwa 50% data yang berada di bagian tengah memiliki rentang nilai antara 21 hingga 26, dengan lebar penyebaran sebesar 5 satuan

3. Varian dan Standar Deviasi

# Data
skor <- c(18, 19, 20, 21, 22, 22, 23, 23, 
          24, 24, 25, 26, 27, 30, 45)


n <- length(skor)


mean_data <- mean(skor)


varians <- var(skor)


standar_deviasi <- sd(skor)

n
## [1] 15
mean_data
## [1] 24.6
varians
## [1] 41.54286
standar_deviasi
## [1] 6.445375

4. Hitung Koefisiens Skewness Pearson dan Tentukan Arah Kemencengan

data <- c(18, 19, 20, 21, 22, 22, 23, 23, 
          24, 24, 25, 26, 27, 30, 45)
mean(data); median(data); sd(data)
## [1] 24.6
## [1] 23
## [1] 6.445375
library(moments)
skewness(data)
## [1] 2.212573
kurtosis(data)
## [1] 7.879086

Arah kemencengan

library(ggplot2)


data_penggunaan <- c(
  18, 19, 20, 21, 22, 22, 23, 23,
  24, 24, 25, 26, 27, 30, 45
)


mu <- mean(data_penggunaan)
sigma <- sd(data_penggunaan)


x <- seq(
  mu - 4*sigma,
  mu + 4*sigma,
  length.out = 1000
)

y <- dnorm(
  x,
  mean = mu,
  sd = sigma
)

data_normal <- data.frame(x, y)


x_shade <- seq(
  mu - sigma,
  mu + sigma,
  length.out = 300
)

y_shade <- dnorm(
  x_shade,
  mean = mu,
  sd = sigma
)

data_shade <- data.frame(
  x = x_shade,
  y = y_shade
)


ggplot(data_normal, aes(x = x, y = y)) +
  
  geom_line(linewidth = 1.2) +
  
  geom_area(
    data = data_shade,
    aes(x = x, y = y),
    alpha = 0.25
  ) +
  
  geom_vline(
    xintercept = mu - sigma,
    linetype = "dashed"
  ) +
  
  geom_vline(
    xintercept = mu,
    linetype = "dashed"
  ) +
  
  geom_vline(
    xintercept = mu + sigma,
    linetype = "dashed"
  ) +
  
  annotate(
    "text",
    x = mu - sigma,
    y = 0.005,
    label = "μ - σ"
  ) +
  
  annotate(
    "text",
    x = mu,
    y = 0.005,
    label = "μ"
  ) +
  
  annotate(
    "text",
    x = mu + sigma,
    y = 0.005,
    label = "μ + σ"
  ) +
  
  labs(
    title = "Kurva Distribusi Normal Data Skor",
    subtitle = paste(
      "Mean =", round(mu, 2),
      "| Standar Deviasi =", round(sigma, 2)
    ),
    x = "Nilai X",
    y = "Density"
  ) +
  
  theme_minimal()

Interpresentasikan : Berdasarkan perhitungan koefisien skewness Pearson dengan metode kedua, diperoleh nilai skewness sebesar 0,745. Karena nilai skewness bernilai positif, maka distribusi data menceng ke kanan (positively skewed). Kemencengan ke kanan disebabkan oleh adanya nilai 45 yang relatif jauh lebih besar dibandingkan sebagian besar data lainnya.