Sử dụng các gói lệnh, ví dụ:

library(table1); library(lessR)
## 
## Attaching package: 'table1'
## The following objects are masked from 'package:base':
## 
##     units, units<-
## 
## lessR 4.4.3                         feedback: gerbing@pdx.edu 
## --------------------------------------------------------------
## > d <- Read("")  Read data file, many formats available, e.g., Excel
##   d is default data frame, data= in analysis routines optional
## 
## Many examples of reading, writing, and manipulating data, 
## graphics, testing means and proportions, regression, factor analysis,
## customization, forecasting, and aggregation from pivot tables
##   Enter: browseVignettes("lessR")
## 
## View lessR updates, now including time series forecasting
##   Enter: news(package="lessR")
## 
## Interactive data analysis
##   Enter: interact()
## 
## Attaching package: 'lessR'
## The following object is masked from 'package:table1':
## 
##     label
library(dplyr)
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:lessR':
## 
##     order_by, recode, rename
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library(ggplot2)

Việc 3. Đọc dữ liệu “birthwt.csv” vào R và gọi dữ liệu là “bw”

bw = read.csv("/Users/thaovu/Downloads/birthwt.csv", header = T, na.strings = "")

Việc 4. Thông tin về dữ liệu bw này

4.1 Có bao nhiêu biến số (variable) và quan sát (observation)

quan sát (observation) và số (variable) lần lượt là:

dim(bw)
## [1] 189  11

##4.2 Liệt kê 6 quan sát đầu tiên của dữ liệu.

head(bw,6)
##   id low age lwt race smoke ptl ht ui ftv  bwt
## 1 85   0  19 182    2     0   0  0  1   0 2523
## 2 86   0  33 155    3     0   0  0  0   3 2551
## 3 87   0  20 105    1     1   0  0  0   1 2557
## 4 88   0  21 108    1     1   0  0  1   2 2594
## 5 89   0  18 107    1     1   0  0  1   0 2600
## 6 91   0  21 124    3     0   0  0  0   0 2622

Việc 5. Biên tập dữ liệu

5.1 Tạo biến số mới mwt là cân nặng của mẹ tính bằng kg

bw$mwt = bw$lwt*0.45359237
head(bw,6)
##   id low age lwt race smoke ptl ht ui ftv  bwt      mwt
## 1 85   0  19 182    2     0   0  0  1   0 2523 82.55381
## 2 86   0  33 155    3     0   0  0  0   3 2551 70.30682
## 3 87   0  20 105    1     1   0  0  0   1 2557 47.62720
## 4 88   0  21 108    1     1   0  0  1   2 2594 48.98798
## 5 89   0  18 107    1     1   0  0  1   0 2600 48.53438
## 6 91   0  21 124    3     0   0  0  0   0 2622 56.24545

5.2 Tạo biến số mới ethnicity là biến factor với điều kiện sau:

Nếu race = 1 thì ethnicity = “White”

Nếu race = 2 thì ethnicity = “Black”

Nếu race = 3 thì ethnicity = “Other”

bw$ethnicity [bw$race==1] = "White"
bw$ethnicity [bw$race==2] = "Black"
bw$ethnicity [bw$race==3] = "Other"
head(bw,6)
##   id low age lwt race smoke ptl ht ui ftv  bwt      mwt ethnicity
## 1 85   0  19 182    2     0   0  0  1   0 2523 82.55381     Black
## 2 86   0  33 155    3     0   0  0  0   3 2551 70.30682     Other
## 3 87   0  20 105    1     1   0  0  0   1 2557 47.62720     White
## 4 88   0  21 108    1     1   0  0  1   2 2594 48.98798     White
## 5 89   0  18 107    1     1   0  0  1   0 2600 48.53438     White
## 6 91   0  21 124    3     0   0  0  0   0 2622 56.24545     Other

Thay doi thu tu theo cach minh thich

5.3 Tạo 1 tập dữ liệu bw1 chỉ gồm 3 biến số id, low và bwt. Dữ liệu này có bao nhiêu biến số và quan sát?

bw1 = bw[,c("id","low", "bwt")]
dim(bw1) ### số biến số và quan sát là
## [1] 189   3
## 5.4 Tạo 1 tập dữ liệu bw2 chỉ gồm những thai phụ có cân nặng thấp (low = 1). Dữ liệu này có bao nhiêu biến số và quan sát?
bw2 = subset(bw, low == 1)

## 5.5 Tạo 1 tập dữ liệu bw3 chỉ gồm những thai phụ có cân nặng thấp (low = 1) và có hút thuốc trong lúc mang thai (smoke = 1). Dữ liệu này có bao nhiêu biến số và quan sát?
bw3 = subset(bw, low == 1 & smoke ==1)


# Việc 6. Phân tích mô tả:
## 6.1 Mô tả đặc điểm tuổi của mẹ (age), cân nặng của mẹ (lwt) và cân nặng của con (bwt)
table1(~age + lwt + bwt, data = bw)
Overall
(N=189)
age
Mean (SD) 23.2 (5.30)
Median [Min, Max] 23.0 [14.0, 45.0]
lwt
Mean (SD) 130 (30.6)
Median [Min, Max] 121 [80.0, 250]
bwt
Mean (SD) 2940 (729)
Median [Min, Max] 2980 [709, 4990]
## 6.2 Mô tả đặc điểm tuổi của mẹ (age), cân nặng của mẹ (lwt), tình trạng hút thuốc trong thai kỳ (smoke) , chủng tộc (race), và cân nặng của con (bwt) theo tình trạng trẻ thiếu cân (low)
bw$smoking <- factor(bw$smoke, levels=c(1,2), labels= c("Yes","No"))
bw$low <- factor(bw$smoke, levels=c(1,0), labels= c("Low BW","Normal"))
               
table1(~age + lwt + smoke + ethnicity+ bwt | low, data = bw)
Low BW
(N=74)
Normal
(N=115)
Overall
(N=189)
age
Mean (SD) 22.9 (5.05) 23.4 (5.47) 23.2 (5.30)
Median [Min, Max] 22.0 [14.0, 35.0] 23.0 [14.0, 45.0] 23.0 [14.0, 45.0]
lwt
Mean (SD) 128 (33.8) 131 (28.4) 130 (30.6)
Median [Min, Max] 120 [80.0, 250] 124 [85.0, 241] 121 [80.0, 250]
smoke
Mean (SD) 1.00 (0) 0 (0) 0.392 (0.489)
Median [Min, Max] 1.00 [1.00, 1.00] 0 [0, 0] 0 [0, 1.00]
ethnicity
Black 10 (13.5%) 16 (13.9%) 26 (13.8%)
Other 12 (16.2%) 55 (47.8%) 67 (35.4%)
White 52 (70.3%) 44 (38.3%) 96 (50.8%)
bwt
Mean (SD) 2770 (660) 3060 (753) 2940 (729)
Median [Min, Max] 2780 [709, 4240] 3100 [1020, 4990] 2980 [709, 4990]
#Histogram(bwt, fill='pink', xlab='birthweight (g)', ylab = "Frequency", data =bw)

Việc 7. Bạn hãy ghi lại tất cả những hàm/lệnh trên trong RMarkdown và chia sẻ trên mạng rpubs.com/tài khoản của bạn (https://rpubs.com/ThachTran/1321730).