Bộ dữ liệu bao gồm 534, 11 biến
Biến định tính:
Biến ethnicity: Dân tộc (gồm 3 biểu hiện “cauc” là người Hoa Kỳ, “hispanic” là người gốc Tây Ban Nha, “other” là người nơi khác.
region: Cá nhân có sống ở miền Nam không?
gender: Biến phân loại chỉ giới tính.
Biến occupation: Nghề nghiệp với các mức độ “worker” (người lao động tay nghề hoặc công nhân dây chuyền lắp ráp), “technical” (công nhân kỹ thuật hoặc chuyên nghiệp), “services” (công nhân dịch vụ), “office” (nhân viên văn phòng và thư ký), “sales” (nhân viên bán hàng), “management” (quản lý và hành chính).
Biến sector: Lĩnh vực làm việc với các mức độ “manufacturing” (sản xuất hoặc khai thác mỏ), “construction” (xây dựng), “other” (khác).
Biến union: Cá nhân có làm việc với đoàn thể không?
Biến married: Cá nhân có kết hôn không?
Biến định lượng:
library(ggplot2)
Khai báo Package AER chứa dữ liệu cần dùng
library(AER)
## Loading required package: car
## Loading required package: carData
## Loading required package: lmtest
## Loading required package: zoo
##
## Attaching package: 'zoo'
## The following objects are masked from 'package:base':
##
## as.Date, as.Date.numeric
## Loading required package: sandwich
## Loading required package: survival
Khai báo Package DT dùng để hiển thị bảng dữ liệu
library(DT)
Hiện dataset cần phân tích trong package AER và gáng dataset vào d
data("CPS1985")
d <- CPS1985
datatable(d)
t1 <- table(d$gender)
addmargins(t1)
##
## male female Sum
## 289 245 534
round((table(d$gender)/sum(table(d$gender))*100),2)
##
## male female
## 54.12 45.88
d |> ggplot(aes(x = d$gender, y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'green', vjust = - .5) + theme_classic() + labs(x = 'Giới tính', y = 'Số người')
Nhận xét,trong 534 người khảo sát có :
Nam là 289 người (chiếm khoảng 54.1%)
Nữ là 245 người (chiếm 45.9%), giới tính tương đối đồng đều, với nam và nữ không chênh lệch quá nhiều (chênh lệch khoảng 8.2%).
t2 <- table(d$married)
addmargins(t2)
##
## no yes Sum
## 184 350 534
round((table(d$married)/sum(table(d$married))*100),2)
##
## no yes
## 34.46 65.54
d |> ggplot(aes(x = d$married, y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'green', vjust = - .5) + theme_classic() + labs(x = 'kết hôn', y = 'Số người')
Trong 534 người khảo sát, Tỷ lệ kết hôn chiếm số lượng lớn, có 350 người đã kết hôn (chiếm 65.5%),180 người chưa kết hôn (34.5%), cho thấy là có sự chênh lệch rất lớn giữa người đã kết hôn và người chưa kết hôn (31%)
th4 <- table(d$occupation)
addmargins(th4)
##
## worker technical services office sales management Sum
## 156 105 83 97 38 55 534
round((table(d$occupation)/sum(table(d$occupation))*100),2)
##
## worker technical services office sales management
## 29.21 19.66 15.54 18.16 7.12 10.30
d |> ggplot(aes(x = d$occupation, y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'green', vjust = - .5) + theme_classic() + labs(x = 'Nghề nghiệp', y = 'Số người')
Nhận xét:
Biểu đồ cho thấy nghề công nhân chiếm tỷ lệ cao nhất (29.2%), trong khi nghề bán hàng chiếm tỷ lệ thấp nhất (7.1%). Các nghề kỹ thuật, văn phòng và dịch vụ có tỷ lệ tương đối cao, lần lượt là 19.7%, 18.2%, và 15.5%.
summary(d$wage)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 1.000 5.250 7.780 9.024 11.250 44.500
var(d$wage)
## [1] 26.41032
sd(d$wage)
## [1] 5.139097
ggplot(d, aes(x = wage)) +
geom_density(fill = "black", color = "brown", alpha = 0.5) +
labs(x = "Tiền lương")
Nhận xét:
Giá trị nhỏ nhất của tiền lương là 1 USD/H, giá trị lớn nhất đạt tới 44.50 USD. Trung vị của tiền lương là 7.78 USD, có nghĩa là 50% số người lao động có mức lương dưới hoặc bằng 7.78 đUSD. Giá trị trung bình của tiền lương là 9.02 , cao hơn trung vị, điều này cho thấy sự tồn tại của một số giá trị cực đại kéo giá trị trung bình lên cao hơn.
Phương sai là 26.41 và độ lệch chuẩn là 5.14. Những con số này cho thấy mức độ biến thiên tương đối lớn của tiền lương quanh giá trị trung bình. Phần tư thứ nhất (5.25) và phần tư thứ ba (11.25) cho biết 50% số người lao động có mức lương nằm trong khoảng từ 5.25 đến 11.25 đơn vị tiền tệ.
summary(d$age)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.00 28.00 35.00 36.83 44.00 64.00
var(d$age)
## [1] 137.5125
sd(d$age)
## [1] 11.72657
ggplot(d, aes(x = age)) +
geom_histogram(fill = "black", color = "pink", bins = 10) +
labs(x = "Tuổi")
Nhận xét:
Dựa vào kết quả thống kê mô tả chúng ta thấy là độ tuổi lớn nhất là 64, nhỏ nhất là 18 và độ tuổi trung bình là 36.83333. Dựa vào tứ phân vị thì có 25% người có tuổi nhỏ hơn 28 và có 25% trong số người khảo sát lớn hơn 44 tuổi. Dựa trên những đặc trưng đo lường, tiến hành phân tổ hai biến định lượng.
summary(d$education)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 2.00 12.00 12.00 13.02 15.00 18.00
var(d$education)
## [1] 6.840174
sd(d$education)
## [1] 2.615373
d |> ggplot(aes(x = d$education, y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'green', vjust = - .5) + theme_classic() + labs(x = 'Trình độ học vấn ', y = 'Số người')
Nhận xét:
Biểu đồ cho thấy trình độ học vấn lớp 12 chiếm tỷ lệ cao nhất (41.01%), trình độ sau 12 cũng chiếm tỷ lệ lớn, trình độ từ lớp 1 - 11 chiếm tỷ lệ nhỏ cho thấy là dữ liệu nghiên cứu có số người có trình độ 12 nhiều hơn.
d$age <- cut(d$age, breaks=c(17, 36,65), labels=c('duoi 36', 'tren 36'))
table(d$age)
##
## duoi 36 tren 36
## 302 232
d$wage <- cut(d$wage, breaks=c(0,12,45),labels=c('thap','cao'))
table(d$wage )
##
## thap cao
## 422 112
table(d$gender,d$wage)
##
## thap cao
## male 206 83
## female 216 29
round((table(d$gender, d$wage) / sum(table(d$gender, d$wage)) * 100), 2)
##
## thap cao
## male 38.58 15.54
## female 40.45 5.43
addmargins(table(d$gender,d$wage))
##
## thap cao Sum
## male 206 83 289
## female 216 29 245
## Sum 422 112 534
Nhận xét:
Tổng số nam là 289, số người nam có lương thấp là 205 người chiếm 38,58%, số nam có lương cao là 83 người chiếm 15.54%
Tổng số nữ trong mẫu nghiêm cứu là 245 người, trong đó số lượng nữ có lương thấp chiếm số lượng lớn là 216 người chiếm 40.55%, số lượng nữ có lương cao chiếm 5.43%.
library(DescTools)
## Warning: package 'DescTools' was built under R version 4.3.3
##
## Attaching package: 'DescTools'
## The following object is masked from 'package:car':
##
## Recode
library(epitools)
##
## Attaching package: 'epitools'
## The following object is masked from 'package:survival':
##
## ratetable
t3 <- table(d$gender,d$wage)
RelRisk(t3)
## [1] 0.8085031
riskratio(t3, rev = 'b')
## $data
##
## cao thap Total
## female 29 216 245
## male 83 206 289
## Total 112 422 534
##
## $measure
## risk ratio with 95% C.I.
## estimate lower upper
## female 1.0000000 NA NA
## male 0.8085031 0.7415993 0.8814427
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## female NA NA NA
## male 1.293077e-06 1.358458e-06 1.795767e-06
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "Unconditional MLE & normal approximation (Wald) CI"
epitab(t3, method = 'riskratio', rev = 'c')
## $tab
##
## cao p0 thap p1 riskratio lower upper p.value
## male 83 0.2871972 206 0.7128028 1.000000 NA NA NA
## female 29 0.1183673 216 0.8816327 1.236854 1.134504 1.348437 1.358458e-06
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ số rủi ro là 0.809 với khoảng tin cậy 95% từ 0.740 đến 0.88. Điều này có nghĩa là nam có lương thấp bằng 0.809 lần so với nữ. Khoảng tin cậy 95% cho biết rằng chúng ta có thể tin tưởng rằng giá trị thực của tỷ số rủi ro nằm trong khoảng từ 0.740 đến 0.88 với xác suất 95%.
OddsRatio(t3)
## [1] 0.3332218
oddsratio(t3)
## $data
##
## thap cao Total
## male 206 83 289
## female 216 29 245
## Total 422 112 534
##
## $measure
## odds ratio with 95% C.I.
## estimate lower upper
## male 1.0000000 NA NA
## female 0.3349143 0.2074688 0.5275531
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## male NA NA NA
## female 1.293077e-06 1.358458e-06 1.795767e-06
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "median-unbiased estimate & mid-p exact CI"
epitab(t3, method = 'oddsratio')
## $tab
##
## thap p0 cao p1 oddsratio lower upper
## male 206 0.4881517 83 0.7410714 1.0000000 NA NA
## female 216 0.5118483 29 0.2589286 0.3332218 0.2095441 0.5298968
##
## p.value
## male NA
## female 1.358458e-06
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét: Tỷ lệ odds ratio của nữ (so với nam làm cơ sở) là 0.332 với khoảng tin cậy 95% từ 0.208 đến 0.527. Khoảng tin cậy 95% cho tỷ lệ odds ratio là từ 0.208 đến 0.527.Điều này cho thấy chúng ta có thể tin tưởng rằng giá trị thực của tỷ lệ odds ratio nằm trong khoảng này với xác suất 95%.
P-value = 1.3004e-06 cho tỷ lệ odds ratio của nữ là rất nhỏ , cho thấy sự khác biệt về odds giữa nam và nữ là có ý nghĩa thống kê.
table(d$married,d$wage)
##
## thap cao
## no 154 30
## yes 268 82
round((table(d$married,d$wage) / sum(table(d$married,d$wage)) * 100), 2)
##
## thap cao
## no 28.84 5.62
## yes 50.19 15.36
addmargins(table(d$married,d$wage))
##
## thap cao Sum
## no 154 30 184
## yes 268 82 350
## Sum 422 112 534
Nhận xét:
Trong nhóm không kết hôn, có 154 người lương thấp và 30 người lương cao.
Trong nhóm kết hôn, có 268 người lương thấp và 82 người lương cao.
library(DescTools)
library(epitools)
t4 <- table(d$married,d$wage)
RelRisk(t4)
## [1] 1.09304
riskratio(t4, rev = 'b')
## $data
##
## cao thap Total
## yes 82 268 350
## no 30 154 184
## Total 112 422 534
##
## $measure
## risk ratio with 95% C.I.
## estimate lower upper
## yes 1.00000 NA NA
## no 1.09304 1.002797 1.191405
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## yes NA NA NA
## no 0.05348128 0.05782378 0.05464336
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "Unconditional MLE & normal approximation (Wald) CI"
epitab(t4, method = 'riskratio', rev = 'c')
## $tab
##
## cao p0 thap p1 riskratio lower upper p.value
## no 30 0.1630435 154 0.8369565 1.0000000 NA NA NA
## yes 82 0.2342857 268 0.7657143 0.9148794 0.8393455 0.9972108 0.05782378
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ lệ nguy cơ (Risk Ratio) của nhóm không kết hôn so với nhóm kết hôn là 1.094, với khoảng tin cậy 95% từ 1.004 đến 1.193. Giá trị p-value cho thấy giữa hai nhóm gần đạt mức ý nghĩa thống kê 0.05. Tỷ lệ nguy cơ của nhóm kết hôn so với nhóm không kết hôn là 0.914, với khoảng tin cậy 95% từ 0.839 đến 0.996, cho thấy người kết hôn có có mức lương cao thấp hơn 8.6% so với những người không kết hôn.
OddsRatio(t3)
## [1] 0.3332218
oddsratio(t3)
## $data
##
## thap cao Total
## male 206 83 289
## female 216 29 245
## Total 422 112 534
##
## $measure
## odds ratio with 95% C.I.
## estimate lower upper
## male 1.0000000 NA NA
## female 0.3349143 0.2074688 0.5275531
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## male NA NA NA
## female 1.293077e-06 1.358458e-06 1.795767e-06
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "median-unbiased estimate & mid-p exact CI"
epitab(t3, method = 'oddsratio')
## $tab
##
## thap p0 cao p1 oddsratio lower upper
## male 206 0.4881517 83 0.7410714 1.0000000 NA NA
## female 216 0.5118483 29 0.2589286 0.3332218 0.2095441 0.5298968
##
## p.value
## male NA
## female 1.358458e-06
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ lệ odds ratio giữa nam và nữ là khoảng 0.332 với p-value = 1.3*10^-6.Cho thấy sự khác biệt về odds giữa nam và nữ là có ý nghĩa thống kê. Nam có odds thấp hơn so với nữ trong việc có lương thấp, và sự khác biệt này là có ý nghĩa thống kê.
trinhdo <-cut(d$education, breaks=c(1,12,18), labels=c('thấp', ' cao'))
table(trinhdo)
## trinhdo
## thấp cao
## 302 232
k <- data.frame(d$wage, d$education, d$experience, d$age, d$ethnicity, d$region, d$gender, d$occupation, d$sector, d$union, d$married, trinhdo)
table(k$d.gender,k$trinhdo)
##
## thấp cao
## male 159 130
## female 143 102
addmargins(table(k$d.gender,k$trinhdo))
##
## thấp cao Sum
## male 159 130 289
## female 143 102 245
## Sum 302 232 534
d |> ggplot(aes(x = d$gender , y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'red', vjust = - .5) + facet_grid(. ~ k$trinhdo) + labs(x = 'Giới tính', y = 'Số người')
Nhận xét:
Người có trình độ 12 là 302 người chiếm 56.5%, người có trình độ đại học là 232 người chiếm 43.5%.
Số người có trình độ thấp luôn nhiều hơn so với số người có trình độ cao ở cả nam và nữ. Đối với nam, có 159 người có trình độ thấp và 130 người có trình độ cao, trong khi đối với nữ, số liệu tương ứng lần lượt là 143 và 102 người.
Sự chênh lệch giữa số người có trình độ thấp và trình độ cao lớn hơn ở nữ so với nam, với 41 người ở nữ và 29 người ở nam. Điều này có thể chỉ ra sự khác biệt trong phân bố trình độ giáo dục hoặc khả năng học tập giữa nam và nữ trong mẫu dữ liệu này.
th5 <- table(d$gender, k$trinhdo)
RelRisk(th5)
## [1] 0.9426041
riskratio(th5, rev = 'b')
## $data
##
## cao thấp Total
## female 102 143 245
## male 130 159 289
## Total 232 302 534
##
## $measure
## risk ratio with 95% C.I.
## estimate lower upper
## female 1.0000000 NA NA
## male 0.9426041 0.812526 1.093507
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## female NA NA NA
## male 0.4382977 0.4834948 0.4364356
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "Unconditional MLE & normal approximation (Wald) CI"
epitab(th5, method = 'riskratio', rev = 'c')
## $tab
##
## cao p0 thấp p1 riskratio lower upper p.value
## male 130 0.4498270 159 0.5501730 1.000000 NA NA NA
## female 102 0.4163265 143 0.5836735 1.060891 0.9144892 1.23073 0.4834948
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ số rủi ro là 0.9426,điều này có nghĩa là nam có trình độ thấp so với nữ.
Giá trị p-value là khoảng 0.44, không đủ bằng chứng để kết luận về sự khác biệt đáng kể về nguy cơ có trình độ thấp giữa nam và nữ.
Tỷ lệ rủi ro của nam so với nữ là 1.06, với khoảng tin cậy 95% nằm giữa 0.91 và 1.23. Kết quả này cũng không đủ mạnh để kết luận rằng có sự khác biệt đáng kể về nguy cơ có trình độ thấp giữa hai giới tính.
OddsRatio(th5)
## [1] 0.8724045
epitab(th5, method = 'oddsratio')
## $tab
##
## thấp p0 cao p1 oddsratio lower upper p.value
## male 159 0.5264901 130 0.5603448 1.0000000 NA NA NA
## female 143 0.4735099 102 0.4396552 0.8724045 0.6185641 1.230414 0.4834948
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Giá trị odds ratio giữa nam và nữ là khoảng 0.87. Khi giá trị odds ratio nhỏ hơn 1, điều này ngụ ý rằng nam có trình độ thấp hơn so với nữ.
Tuy nhiên, giá trị p-value là khoảng 0.48, không đủ bằng chứng để kết luận về sự khác biệt đáng kể về nguy cơ có trình độ thấp giữa nam và nữ.
th9 <- table(k$trinhdo,k$d.wage)
addmargins(th9)
##
## thap cao Sum
## thấp 268 34 302
## cao 154 78 232
## Sum 422 112 534
d |> ggplot(aes(x = d$wage , y = after_stat(count))) + geom_bar(fill = 'black') + geom_text(aes(label = scales::percent(after_stat(count/sum(count)))), stat = 'count', color = 'red', vjust = - .5) + facet_grid(. ~ k$trinhdo) + labs(x = 'Lương', y = 'Số người')
Nhận xét:
Trong dữ liệu này này, ta có:
301 người có mức lương thấp, trong đó có 267 người có trình độ thấp và 34 người có trình độ cao.
232 người có mức lương cao, trong đó có 154 người có trình độ thấp và 78 người có trình độ cao.
RelRisk(th9)
## [1] 1.336888
riskratio(th9, rev = 'b')
## $data
##
## cao thap Total
## cao 78 154 232
## thấp 34 268 302
## Total 112 422 534
##
## $measure
## risk ratio with 95% C.I.
## estimate lower upper
## cao 1.000000 NA NA
## thấp 1.336888 1.209665 1.477492
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## cao NA NA NA
## thấp 3.645124e-10 4.68842e-10 3.139058e-10
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "Unconditional MLE & normal approximation (Wald) CI"
epitab(th9, method = 'riskratio', rev = 'c')
## $tab
##
## cao p0 thap p1 riskratio lower upper p.value
## thấp 34 0.1125828 268 0.8874172 1.0000000 NA NA NA
## cao 78 0.3362069 154 0.6637931 0.7480057 0.6768226 0.8266752 4.68842e-10
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ lệ rủi ro giữa nhóm có mức lương thấp và nhóm có mức lương cao là khoảng 1.34. Điều này ngụ ý rằngnhóm có mức lương thấp cao hơn khoảng 34% so với nhóm có mức lương cao.
Giá trị p-value = 4.840357259e-10 cho thấy sự khác biệt đáng kể. Điều này ngụ ý rằng sự khác biệt về nguy cơ giữa hai nhóm là có ý nghĩa thống kê.
OddsRatio(th9)
## [1] 3.992361
oddsratio(th9)
## $data
##
## thap cao Total
## thấp 268 34 302
## cao 154 78 232
## Total 422 112 534
##
## $measure
## odds ratio with 95% C.I.
## estimate lower upper
## thấp 1.000000 NA NA
## cao 3.972397 2.553012 6.294682
##
## $p.value
## two-sided
## midp.exact fisher.exact chi.square
## thấp NA NA NA
## cao 3.645124e-10 4.68842e-10 3.139058e-10
##
## $correction
## [1] FALSE
##
## attr(,"method")
## [1] "median-unbiased estimate & mid-p exact CI"
epitab(th9, method = 'oddsratio')
## $tab
##
## thap p0 cao p1 oddsratio lower upper p.value
## thấp 268 0.6350711 34 0.3035714 1.000000 NA NA NA
## cao 154 0.3649289 78 0.6964286 3.992361 2.548441 6.254389 4.68842e-10
##
## $measure
## [1] "wald"
##
## $conf.level
## [1] 0.95
##
## $pvalue
## [1] "fisher.exact"
Nhận xét:
Tỷ lệ cơ hội giữa nhóm có mức lương thấp và nhóm có mức lương cao là khoảng 3.98. Điều này có nghĩa là nguy cơ của nhóm có mức lương thấp gần 4 lần so với nhóm có mức lương cao.
Giá trị p-value = 4.840357259e-10. Điều này cho thấy sự khác biệt về nguy cơ giữa hai nhóm là có ý nghĩa thống kê.
Kiểm định tính độc lập cho 2 biến định tính: Giả thuyết \(H_0\) : độc lập. Giả thuyết \(H_1\): không độc lập
chisq.test(t3)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: t3
## X-squared = 21.795, df = 1, p-value = 3.034e-06
Nhận xét:
Bác bỏ giả thuyết \(H_0\), chấp nhận giả thuyết \(H_1\), giới tính và lương có liên quan tới nhau.
chisq.test(t4)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: t4
## X-squared = 3.2756, df = 1, p-value = 0.07032
Nhận xét:
Bác bỏ giả thuyết \(H_0\), chấp nhận giả thuyết \(H_1\), kết hôn và lương có liên quan tới nhau.
chisq.test(th5)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: th5
## X-squared = 0.47697, df = 1, p-value = 0.4898
Nhận xét:
Bác bỏ giả thuyết \(H_0\), chấp nhận giả thuyết \(H_1\), giới tính và trình độ học vấn có liên quan tới nhau.
chisq.test(th9)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: th9
## X-squared = 38.248, df = 1, p-value = 6.229e-10
Nhận xét:
Bác bỏ giả thuyết \(H_0\), chấp nhận giả thuyết \(H_1\), trình độ học vấn và lương có liên quan tới nhau.