df_customer <- read.csv("df_customer.csv")
head(df_customer)
## X ID_Pelanggan Jenis_Kelamin Tempat_Tinggal Penghasilan Total_Belanja
## 1 1 ID00031 Laki-laki Desa 2227350 2563031
## 2 2 ID00079 Perempuan Kota 9047608 8369550
## 3 3 ID00051 Perempuan Kota 9735540 8053033
## 4 4 ID00014 Laki-laki Kota 13510126 9799876
## 5 5 ID00067 Perempuan Desa 7773498 6982081
## 6 6 ID00042 Laki-laki Desa 6666740 4782002
str(df_customer)
## 'data.frame': 300 obs. of 6 variables:
## $ X : int 1 2 3 4 5 6 7 8 9 10 ...
## $ ID_Pelanggan : chr "ID00031" "ID00079" "ID00051" "ID00014" ...
## $ Jenis_Kelamin : chr "Laki-laki" "Perempuan" "Perempuan" "Laki-laki" ...
## $ Tempat_Tinggal: chr "Desa" "Kota" "Kota" "Kota" ...
## $ Penghasilan : int 2227350 9047608 9735540 13510126 7773498 6666740 5658721 7637656 6776730 10412102 ...
## $ Total_Belanja : int 2563031 8369550 8053033 9799876 6982081 4782002 4286283 4779797 6315967 5106141 ...
summary(df_customer)
## X ID_Pelanggan Jenis_Kelamin Tempat_Tinggal
## Min. : 1.00 Length :300 Length :300 Length :300
## 1st Qu.: 75.75 N.unique : 94 N.unique : 2 N.unique : 2
## Median :150.50 N.blank : 0 N.blank : 0 N.blank : 0
## Mean :150.50 Min.nchar: 7 Min.nchar: 9 Min.nchar: 4
## 3rd Qu.:225.25 Max.nchar: 7 Max.nchar: 9 Max.nchar: 4
## Max. :300.00
## Penghasilan Total_Belanja
## Min. : 901314 Min. : 2534171
## 1st Qu.: 6426148 1st Qu.: 5360644
## Median : 8630042 Median : 6552757
## Mean : 8656732 Mean : 6679163
## 3rd Qu.:10921107 3rd Qu.: 7895702
## Max. :16145151 Max. :11626302
cekna <- colSums(is.na(df_customer))
cekna
## X ID_Pelanggan Jenis_Kelamin Tempat_Tinggal Penghasilan
## 0 0 0 0 0
## Total_Belanja
## 0
nrow(df_customer)
## [1] 300
unique(df_customer$ID_Pelanggan)
## [1] "ID00031" "ID00079" "ID00051" "ID00014" "ID00067" "ID00042" "ID00050"
## [8] "ID00043" "ID00025" "ID00090" "ID00091" "ID00069" "ID00057" "ID00092"
## [15] "ID00009" "ID00093" "ID00099" "ID00072" "ID00026" "ID00007" "ID00083"
## [22] "ID00036" "ID00078" "ID00081" "ID00076" "ID00015" "ID00032" "ID00041"
## [29] "ID00074" "ID00023" "ID00027" "ID00060" "ID00053" "ID00096" "ID00038"
## [36] "ID00089" "ID00034" "ID00063" "ID00013" "ID00082" "ID00097" "ID00021"
## [43] "ID00047" "ID00095" "ID00016" "ID00094" "ID00006" "ID00086" "ID00039"
## [50] "ID00004" "ID00052" "ID00022" "ID00087" "ID00035" "ID00040" "ID00030"
## [57] "ID00012" "ID00064" "ID00071" "ID00085" "ID00037" "ID00008" "ID00098"
## [64] "ID00084" "ID00046" "ID00017" "ID00062" "ID00054" "ID00024" "ID00005"
## [71] "ID00070" "ID00055" "ID00075" "ID00048" "ID00077" "ID00056" "ID00068"
## [78] "ID00001" "ID00088" "ID00020" "ID00049" "ID00059" "ID00011" "ID00066"
## [85] "ID00044" "ID00045" "ID00033" "ID00010" "ID00058" "ID00061" "ID00029"
## [92] "ID00073" "ID00018" "ID00002"
length(unique(df_customer$ID_Pelanggan))
## [1] 94
sort(table(df_customer$ID_Pelanggan), decreasing = TRUE)[1:4]
##
## ID00007 ID00025 ID00089 ID00093
## 9 7 7 7
aggregate(Penghasilan ~ Jenis_Kelamin, data = df_customer, mean)
## Jenis_Kelamin Penghasilan
## 1 Laki-laki 8880902
## 2 Perempuan 8505199
aggregate(Total_Belanja ~ Jenis_Kelamin, data = df_customer, mean)
## Jenis_Kelamin Total_Belanja
## 1 Laki-laki 6034728
## 2 Perempuan 7114786
aggregate(Penghasilan ~ Tempat_Tinggal, data = df_customer, mean)
## Tempat_Tinggal Penghasilan
## 1 Desa 6249122
## 2 Kota 9878685
aggregate(Total_Belanja ~ Tempat_Tinggal, data = df_customer, mean)
## Tempat_Tinggal Total_Belanja
## 1 Desa 5022231
## 2 Kota 7520118
df_customer[order(-df_customer$Total_Belanja), c("ID_Pelanggan", "Total_Belanja")] |> head(5)
## ID_Pelanggan Total_Belanja
## 76 ID00034 11626302
## 175 ID00011 11527638
## 228 ID00057 11031197
## 287 ID00093 10984825
## 33 ID00007 10846012
table(df_customer$Jenis_Kelamin)
##
## Laki-laki Perempuan
## 121 179
df_customer$Kategori_Penghasilan <- cut(df_customer$Penghasilan,
breaks = c(-Inf, 5000000, 10000000, Inf),
labels = c("Rendah", "Menengah", "Tinggi"))
table(df_customer$Kategori_Penghasilan)
##
## Rendah Menengah Tinggi
## 27 175 98
library(dplyr)
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
TUGAS WEEK 5
# Siapa pelanggan yang paling sering membeli dengan total belanja lebih dari 5000000
data1 <- subset(df_customer, Total_Belanja > 5000000)
sort(table(data1$ID_Pelanggan), decreasing = TRUE)[1:4]
##
## ID00007 ID00025 ID00026 ID00089
## 7 7 6 6
# Ada berapa banyak perempuan di kota yang berbelanja lebih dari 5x
data2 <- subset(df_customer,
Jenis_Kelamin == "Perempuan" &
Tempat_Tinggal == "Kota")
freq2 <- table(data2$ID_Pelanggan)
sum(freq2 > 5)
## [1] 0
# Siapa pelanggan yang paling sering membeli dengan penghasilan lebih dari 5000000
data3 <- subset(df_customer, Penghasilan > 5000000)
sort(table(data3$ID_Pelanggan), decreasing = TRUE)[1:3]
##
## ID00007 ID00025 ID00093
## 9 7 7
# Berjenis kelamin apa pelanggan yang tinggal di desa namun memiliki total belanja yang lebih dari 5000000
data4 <- subset(df_customer,
Tempat_Tinggal == "Desa" &
Total_Belanja > 5000000)
table(data4$Jenis_Kelamin)
##
## Laki-laki Perempuan
## 10 37
# Berpenghasilan berapa pelanggan yang tinggal di desa namun memiliki total belanja lebih dari 5000000
data5 <- subset(df_customer,
Tempat_Tinggal == "Desa" &
Total_Belanja > 5000000)
data5$Penghasilan
## [1] 7773498 6776730 8108645 9032981 5616450 4481204 6128487 5947963
## [9] 9231091 5940612 8032910 7822419 9331982 7082568 9657061 7651846
## [17] 5575699 8635642 5809025 6005712 4849165 4626369 5455465 6467267
## [25] 3157783 6093467 6193172 9024791 9310352 8141032 6499451 10832415
## [33] 11664452 6455085 6571179 9498495 5671820 3726214 6533837 6856664
## [41] 7212261 6928182 3373098 6940985 6915574 7028460 9810087
freq <- as.data.frame(table(df_customer$Jenis_Kelamin))
freq
## Var1 Freq
## 1 Laki-laki 121
## 2 Perempuan 179