library(dplyr)
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
datapendidikan <- read.csv("~/PSD/dataset_pendidikan.csv")
head(datapendidikan)
##   ID_Mahasiswa  IPK Semester Total_Kehadiran Total_Jam_Belajar Rata2_Jam_Tidur
## 1       MHS001 3.45        2              58               238             7.5
## 2       MHS002 3.13        5              54               246             7.1
## 3       MHS003 2.75        4              61                91             7.0
## 4       MHS004 3.52        4              67               162             6.6
## 5       MHS005 3.57        4              56               258             7.4
## 6       MHS006 3.52        7              56               222             7.5

no 1

# Berapa jumlah mahasiswa yang memiliki IPK lebih besar atau sama dengan 3,5?

library(dplyr)
Q1 <- datapendidikan %>%
  filter(IPK >= 3.5) %>%
  nrow()
Q1
## [1] 49

no 2

# Siapa saja yang menjadi top 3 IPK tertinggi?

Q2 <- datapendidikan %>%
  arrange(desc(IPK)) %>%
  head(3)
Q2
##   ID_Mahasiswa IPK Semester Total_Kehadiran Total_Jam_Belajar Rata2_Jam_Tidur
## 1       MHS052   4        4              70               377             6.8
## 2       MHS111   4        6              61               258             7.2
## 3       MHS123   4        4              66               341             6.2

no 3

# Buat kolom Kategori_IPK dengan case_when(): <2,50 = Kurang; 2,50-2,99 = Cukup; 3,00-3,49 = Baik; >=3,50 = Sangat Baik. Berapa mahasiswa yang masuk kategori "Baik"?

Q3 <- datapendidikan %>%
  mutate (Kategori_IPK = case_when(
    IPK < 2.50 ~ "Kurang",
    IPK >= 2.50 & IPK <= 2.99 ~ "Cukup",
    IPK >= 3.00 & IPK <= 3.49 ~ "Baik",
    IPK >= 3.50 ~ "Sangat Baik")) %>%
  filter(Kategori_IPK == "Baik") %>%
  nrow()
Q3
## [1] 71

no 4

# Hitung rata-rata IPK per semester dengan group_by() dan summarise(). Semester berapa yang rata-rata IPK-nya tertinggi?

Q4 <- datapendidikan %>%
  group_by(Semester) %>%
  summarise(rata_IPK = mean(IPK, na.rm = TRUE)) %>%
  filter(rata_IPK == max(rata_IPK))
Q4
## # A tibble: 1 × 2
##   Semester rata_IPK
##      <int>    <dbl>
## 1        4     3.20

no 5

# Jumlah pertemuan per semester adalah 70 (= 100%). Buat kolom Persen_Kehadiran = Total_Kehadiran / 70 * 100. Berapa mahasiswa yang kehadirannya kurang dari 75%?

Q5 <- datapendidikan %>%
  mutate (Persen_Kehadiran = Total_Kehadiran / 70 * 100) %>%
  filter (Persen_Kehadiran < 75) %>%
  nrow()

Q5
## [1] 40

no 6

# Mahasiswa "rajin tapi IPK rendah" didefinisikan sebagai jam belajar di atas median DAN IPK di bawah rata-rata IPK seluruh mahasiswa. Berapa jumlahnya?

Q6 <- datapendidikan %>%
  filter(Total_Jam_Belajar > median(Total_Jam_Belajar), IPK < mean(IPK)) %>%
  nrow()
Q6
## [1] 17