library(dplyr)
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union

#IMPORT DATA DARI CSV

df_customer <- read.csv("C:/Users/ACER/OneDrive/Documents/Pengantar Sains Data/df_customer.csv")
head(df_customer)
##   X ID_Pelanggan Jenis_Kelamin Tempat_Tinggal Penghasilan Total_Belanja
## 1 1      ID00031     Laki-laki           Desa     2227350       2563031
## 2 2      ID00079     Perempuan           Kota     9047608       8369550
## 3 3      ID00051     Perempuan           Kota     9735540       8053033
## 4 4      ID00014     Laki-laki           Kota    13510126       9799876
## 5 5      ID00067     Perempuan           Desa     7773498       6982081
## 6 6      ID00042     Laki-laki           Desa     6666740       4782002

#MELIHAT STRUKTUR DATA

str(df_customer)
## 'data.frame':    300 obs. of  6 variables:
##  $ X             : int  1 2 3 4 5 6 7 8 9 10 ...
##  $ ID_Pelanggan  : chr  "ID00031" "ID00079" "ID00051" "ID00014" ...
##  $ Jenis_Kelamin : chr  "Laki-laki" "Perempuan" "Perempuan" "Laki-laki" ...
##  $ Tempat_Tinggal: chr  "Desa" "Kota" "Kota" "Kota" ...
##  $ Penghasilan   : int  2227350 9047608 9735540 13510126 7773498 6666740 5658721 7637656 6776730 10412102 ...
##  $ Total_Belanja : int  2563031 8369550 8053033 9799876 6982081 4782002 4286283 4779797 6315967 5106141 ...

#MELIHAT RINGKASAN DATA

summary(df_customer)
##        X             ID_Pelanggan   Jenis_Kelamin   Tempat_Tinggal
##  Min.   :  1.00   Length   :300   Length   :300   Length   :300   
##  1st Qu.: 75.75   N.unique : 94   N.unique :  2   N.unique :  2   
##  Median :150.50   N.blank  :  0   N.blank  :  0   N.blank  :  0   
##  Mean   :150.50   Min.nchar:  7   Min.nchar:  9   Min.nchar:  4   
##  3rd Qu.:225.25   Max.nchar:  7   Max.nchar:  9   Max.nchar:  4   
##  Max.   :300.00                                                   
##   Penghasilan       Total_Belanja     
##  Min.   :  901314   Min.   : 2534171  
##  1st Qu.: 6426148   1st Qu.: 5360644  
##  Median : 8630042   Median : 6552757  
##  Mean   : 8656732   Mean   : 6679163  
##  3rd Qu.:10921107   3rd Qu.: 7895702  
##  Max.   :16145151   Max.   :11626302

#IDENTIFIKASI PELANGGAN YANG UNIK

#berdasarkan id pelanggan
unique(df_customer$ID_Pelanggan)
##  [1] "ID00031" "ID00079" "ID00051" "ID00014" "ID00067" "ID00042" "ID00050"
##  [8] "ID00043" "ID00025" "ID00090" "ID00091" "ID00069" "ID00057" "ID00092"
## [15] "ID00009" "ID00093" "ID00099" "ID00072" "ID00026" "ID00007" "ID00083"
## [22] "ID00036" "ID00078" "ID00081" "ID00076" "ID00015" "ID00032" "ID00041"
## [29] "ID00074" "ID00023" "ID00027" "ID00060" "ID00053" "ID00096" "ID00038"
## [36] "ID00089" "ID00034" "ID00063" "ID00013" "ID00082" "ID00097" "ID00021"
## [43] "ID00047" "ID00095" "ID00016" "ID00094" "ID00006" "ID00086" "ID00039"
## [50] "ID00004" "ID00052" "ID00022" "ID00087" "ID00035" "ID00040" "ID00030"
## [57] "ID00012" "ID00064" "ID00071" "ID00085" "ID00037" "ID00008" "ID00098"
## [64] "ID00084" "ID00046" "ID00017" "ID00062" "ID00054" "ID00024" "ID00005"
## [71] "ID00070" "ID00055" "ID00075" "ID00048" "ID00077" "ID00056" "ID00068"
## [78] "ID00001" "ID00088" "ID00020" "ID00049" "ID00059" "ID00011" "ID00066"
## [85] "ID00044" "ID00045" "ID00033" "ID00010" "ID00058" "ID00061" "ID00029"
## [92] "ID00073" "ID00018" "ID00002"
#menghitung total id pelanggan yang unik
length(unique(df_customer$ID_Pelanggan))
## [1] 94

#MENGIDENTIFIKASI SIAPA PELANGGAN YANG PALING SERING BERBELANJA

sort(table(df_customer$ID_Pelanggan), decreasing = TRUE)[1:3]
## 
## ID00007 ID00025 ID00089 
##       9       7       7
#decreasing untuk mengurutkan data dari yang terbesar ke yang terkecil
#1:3 hanya menampilkan data 1-3 id pelanggan yg paling sering berbelanja

#MENGHITUNG RATA-RATA

#rata rata penghasilan berdasarkan jenis kelamin
aggregate(Penghasilan ~ Jenis_Kelamin, data = df_customer, mean)
##   Jenis_Kelamin Penghasilan
## 1     Laki-laki     8880902
## 2     Perempuan     8505199
#aggregate untuk menghitung rata" berdasarkan variabel yg dipilih
#rata rata penghasilan berdasarkan tempat tinggal
aggregate(Penghasilan ~ Tempat_Tinggal, data = df_customer, mean)
##   Tempat_Tinggal Penghasilan
## 1           Desa     6249122
## 2           Kota     9878685
#rata rata total belanja berdasarkan tempat tinggal
aggregate(Total_Belanja ~ Tempat_Tinggal, data = df_customer, mean)
##   Tempat_Tinggal Total_Belanja
## 1           Desa       5022231
## 2           Kota       7520118

#PELANGGAN DENGAN TOTAL BELANJA TERTINGGI

# menampilkan lima pelanggan dengan nilai belanja tertinggi 
df_customer[order(-df_customer$Total_Belanja), c("ID_Pelanggan", "Total_Belanja")] |> head(5)
##     ID_Pelanggan Total_Belanja
## 76       ID00034      11626302
## 175      ID00011      11527638
## 228      ID00057      11031197
## 287      ID00093      10984825
## 33       ID00007      10846012

#MENGIDENTIFIKASI JUMLAH TRANSAKSI

#Jumlah transaksi yang dilakukan oleh pelanggan perempuan dan laki-lak
table(df_customer$Jenis_Kelamin)
## 
## Laki-laki Perempuan 
##       121       179

#MELAKUKAN PENGKATEGORISASIAN DATA

#melakukan kategori penghasilan 
df_customer$Kategori_Penghasilan <- cut(df_customer$Penghasilan,
                                        breaks = c(-Inf, 5000000, 10000000, Inf),
                                        labels = c("Rendah", "Menengah", "Tinggi"))
table(df_customer$Kategori_Penghasilan)
## 
##   Rendah Menengah   Tinggi 
##       27      175       98
?aggregate
## starting httpd help server ... done
#jika lupa format penulisannya

#PERTANYAAN ##Siapa pelanggan yang paling sering membeli dengan total belanja lebih dari 5000000

#NO 1
q1 <- df_customer %>%
  filter(Total_Belanja > 5000000) %>%
  count(ID_Pelanggan, sort = TRUE)%>%
  slice_head(n=4)
q1
##   ID_Pelanggan n
## 1      ID00007 7
## 2      ID00025 7
## 3      ID00026 6
## 4      ID00089 6

##Ada berapa banyak perempuan di kota yang berbelanja lebih dari 5x

#NO 2
q2 <- df_customer[
  df_customer$Jenis_Kelamin == "Perempuan" &
  df_customer$Tempat_Tinggal == "Kota",
]

freq2 <- table(q2$ID_Pelanggan)

sum(freq2 > 5)
## [1] 0

##Siapa pelanggan yang paling sering membeli dengan penghasilan lebih dari 5000000

# NO 3
q3 <- df_customer[df_customer$Penghasilan > 5000000, ]

sort(table(q3$ID_Pelanggan), decreasing = TRUE)[1]
## ID00007 
##       9

##Berjenis kelamin apa pelanggan yang tinggal di desa namun memiliki total belanja yang lebih dari 5000000

# NO 4
data4 <- df_customer[
  df_customer$Tempat_Tinggal == "Desa" &
  df_customer$Total_Belanja > 5000000,
]

table(data4$Jenis_Kelamin)
## 
## Laki-laki Perempuan 
##        10        37

##Berpenghasilan berapa pelanggan yang tinggal di desa namun memiliki total belanja lebih dari 5000000

#NO 5
q5 <- df_customer[
  df_customer$Tempat_Tinggal == "Desa" &
  df_customer$Total_Belanja > 5000000,
]
unique(q5$Penghasilan)
##  [1]  7773498  6776730  8108645  9032981  5616450  4481204  6128487  5947963
##  [9]  9231091  5940612  8032910  7822419  9331982  7082568  9657061  7651846
## [17]  5575699  8635642  5809025  6005712  4849165  4626369  5455465  6467267
## [25]  3157783  6093467  6193172  9024791  9310352  8141032  6499451 10832415
## [33] 11664452  6455085  6571179  9498495  5671820  3726214  6533837  6856664
## [41]  7212261  6928182  3373098  6940985  6915574  7028460  9810087
library(jsonlite)