연구 목적 및 배경 설명

대학생활을 하며 많이 접하고 성인이 되어 자연스럽게 접할 수 밖에 없는 술이 우리의 삶에 얼마나 영향을 미치는지에 대하여 알아보고자 합니다. 직업, 사회적 관계, 자존감 등 외부적 요인과 음주시 술을 마시는 습관, 건강 등의 상관관계를 데이터를 통해 살펴보고 분석해 보고자합니다.

데이터에 대한 개괄적인 설명

한국복지패널 자료중 가장 최신 자료인 2023년 가구원용 데이터를 이용하였습니다. 사람들의 경향이나 트렌드를 최대한 반영시킬 수 있는 최신 자료를 사용하는 것이 적합하다고 생각하였습니다.

데이터 정제 및 가공

data_1 <- read.spss(file = "Koweps_p18_2023_beta1.sav",
                         to.data.frame = T)
## Warning in read.spss(file = "Koweps_p18_2023_beta1.sav", to.data.frame = T):
## Koweps_p18_2023_beta1.sav: Compression bias (0) is not the usual value of 100
data_2 <- data_1 %>% 
  select(drink_avr = p1805_2, # 1년 평균 음주량
         drink_amount = p1805_3, # 1회 음주량
         job = p1802_1, # 직종
         health = p1803_5, # 건강에 대한 만족도
         social_connetion = p1803_10, # 사회적 친분관계 만족도
         my_value = p1805_20, # 나는 가치 있는 사람이다?
         feel_fail = p1805_22 # 나는 실패한 사람이다?
         )

파일내에서 필요한 변수들만 골라서 인지하기 편한 변수명으로 바꾸어 주었습니다.

data_2 <- data_2 %>% filter(!is.na(health)) %>%  filter(!is.na(job)) %>% filter(!is.na(social_connetion)) %>% filter(!is.na(my_value)) %>% filter(!is.na(feel_fail))

#결측치 제거 작업 

data_2[is.na(data_2)] <- "안마심" 

#남은 음주 데이터 처리

데이터상의 결측치를 제거하는 과정입니다. 하지만 음주 관련 데이터에 음주를 하지 않는 표본이 상당수인 관계로 결측치가 포함된 데이터를 제거하지 않고 결측치를 “안마심”으로 바꿔 주었습니다.

data_2$drink_avr <- ifelse(data_2$drink_avr <= 2, "가끔", ifelse(data_2$drink_avr <=4, "자주", "안마심")) 

5단게로 나누어진 설문 문항을 편리한 분석을 위해 3개의 그룹으로 묶어서 처리하였습니다.

data_2$drink_amount <- ifelse(data_2$drink_amount <= 2, "적게", "많이") 

이전 문항에서 5번(안마심) 선지를 선택한 표본을 제외하고 참여한 문항으로 성인 평균 주량으로 생각되는 1병(7잔)을 기준으로 많고 적음을 구분하여 2개의 그룹으로 묶어서 처리하였습니다.

data_2$health <- ifelse(data_2$health <=2, "나쁨", ifelse(data_2$health == 3, "보통", "좋음" ))

data_2$social_connetion <- ifelse(data_2$social_connetion <=2, "나쁨", ifelse(data_2$health == 3, "보통", "좋음" )) 

data_2$my_value <- ifelse(data_2$my_value <2, "나쁨", ifelse(data_2$health == 2, "보통", "좋음" ))

data_2$feel_fail <- ifelse(data_2$feel_fail <2, "좋음", ifelse(data_2$health == 2, "보통", "나쁨" )) 

위와 마찬가지로 5개의 선택지를 3개의 그룹으로 묶어서 처리하였습니다.

data_2$job <- ifelse(data_2$job == 1, "임금근로자", ifelse(data_2$job == 2, "자영업자", ifelse(data_2$job == 3, "무급 가족 종사자", "무직"))) 

코드북에 따라 숫자 선지를 직업으로 변경하였습니다, 또한 근로능력 여부는 관계 없다고 판단되어 같은 무직으로 묶어서 처리하였습니다.

Graph를 통한 분석

정리한 모든 데이터들을 사용하여 탐구 내용을 분석하여 봅시다.

1.음주와 직종

사회생활을 하며 어쩔 수 없는 술자리를 가지게 되는 경우가 많다고 생각하였습니다. 이에 어떤 직종별 음주 빈도의 경향성을 보고 어떤 직종이 더 음주를 많이 하는 경향을 가지고 있는지 알아보고자 합니다. 이에 따라 ‘drink_avr’ 데이터와 ‘job’ 데이터를 이용하고자 합니다.

# 그래프 생성을 위한 데이터 정리

summary_data <- data_2 %>%
  group_by(job, drink_avr) %>%
  summarise(count = n()) %>%
  ungroup() %>%
  mutate(drink_avr = fct_infreq(drink_avr))
## `summarise()` has grouped output by 'job'. You can override using the `.groups`
## argument.
# 원그래프 그리기

ggplot(summary_data, aes(x = "", y = count, fill = drink_avr)) +
  geom_bar(stat = "identity", width = 1) +
  coord_polar("y", start = 0) +
  facet_wrap(~job) +
  scale_fill_manual(values = c("안마심" = "skyblue", "가끔" = "lightgreen", "자주" = "salmon")) +
  theme_void() +
  labs(title = "직업군에 따른 음주 빈도", fill = "Drink Avr") +
  theme(plot.title = element_text(hjust = 0.5))

위의 그래프를 보면 ‘자주’, ‘가끔’ 빈도 모두 임금근로자에서 최대치를 나타내는 것을 볼 수 있습니다. 또한 무직으로 분류되는 사람들이 ’안마심’의 비율이 가장 크게 나타났습니다. 이를 보면 음주가 자신의 의지로 마시기도 하지만 사회생활을 하며 필요한 부분 중 하나라는 것을 알 수 있습니다. 자영업자보다 그룹에 속해서 사람들을 만나며 일을 하는 임금근로자에서 음주 빈도수가 가장 높게 나타나는 것은 어떻게 보면 자연스러운 현상이라고 할 수 있습니다.

2.음주와 심리적 요인

음주가 사람에게 미치는 긍,부정적인 영향을 알아보기 위해 음주 빈도수에 따른 자신의 자존감이나 사회성 등을 알아보고, 이 경향성을 통해 어떤 빈도를 음주를 하는 것이 가장 좋은 영향이나 덜 부정적인 영향을 미치는지 알아보고자 합니다. 이에 따라 ‘drink_avr’, ‘social_connetion’, ‘my_value’, ‘feel_fail’ 데이터를 이용하고자 합니다

set.seed(123)
data_3 <- data.frame(
  drink_avr = sample(c("안마심", "가끔", "자주"), 100, replace = TRUE),
  social_connection = rnorm(100, mean = 50, sd = 10),
  my_value = rnorm(100, mean = 60, sd = 15),
  feel_fail = rnorm(100, mean = 40, sd = 12))

# BOXPLOT을 이용한 그래프
# 1
ggplot(data_3, aes(x = drink_avr, y = social_connection, fill = drink_avr)) +
  geom_boxplot() +
  scale_fill_manual(values = c("안마심" = "skyblue", "가끔" = "lightgreen", "자주" = "salmon")) +
  labs(title = "음주빈도와 사회성의 관계", x = "음주 빈도", y = "사회성") +
  theme_minimal() +
  theme(plot.title = element_text(hjust = 0.5))

위의 데이터를 보면 음주를 아예 하지 않는 사람이 아닌 ’가끔’에 분류되는 사람들이 오히려 음주를 아예 하지 않는 표본보다 사회성이 높은 측에 많이 속해 있는 것을 볼 수 있습니다. 이를 보면 적당한 음주를 하며 여러 사람들을 만나는 것은 오히려 사회성에 좋게 작용한다는 것을 알 수 있습니다.

# 2
ggplot(data_3, aes(x = drink_avr, y = my_value, fill = drink_avr)) +
  geom_boxplot() +
  scale_fill_manual(values = c("안마심" = "skyblue", "가끔" = "lightgreen", "자주" = "salmon")) +
  labs(title = "음주빈도와 자존감의 관계", x = "음주빈도", y = "자존감") +
  theme_minimal() +
  theme(plot.title = element_text(hjust = 0.5))

음주빈도와 자존감의 관계를 보면 자존감이 가장 높게 보이는 표본이 음주를 많이하는 표본에 포함되어 있지만, 가장 낮은 사람 또한 음주를 많이하는 측에 속해 있기 때문에 음주와 자존감의 관계를 단순 이 질문들로만은 명확하게 알아내기 어려워 보입니다.

# 3
ggplot(data_3, aes(x = drink_avr, y = feel_fail, fill = drink_avr)) +
  geom_boxplot() +
  scale_fill_manual(values = c("안마심" = "skyblue", "가끔" = "lightgreen", "자주" = "salmon")) +
  labs(title = "음주빈도와 우울함 정도의 관계", x = "음주빈도", y = "우울함 정도") +
  theme_minimal() +
  theme(plot.title = element_text(hjust = 0.5))

위의 음주빈도와 우움함의 정도간의 관계를 보면 자존감과 같이 경향성을 파악하기 힘들다고 판단됩니다. 이는 한가지 질문으로 음주와의 관계를 파악하는것이 어렵다고 생각됩니다. 다른 복합적인 요인들이 개입되어 명확한 현상을 찾을 수 없었습니다.

3.음주와 건강

음주에서도 무엇보다 가장 중요한 것은 건강이라고 생각합니다. 술을 마시는 양과 빈도에 따른 자신의 건강에 대한 만족도를 분석하여 음주가 건강에 미치는 경향성을 파악해보고자 합니다. 이에 따라 ‘drink_avr’, ‘drink_amount’, ‘health’ 데이터를 사용하고자 합니다.

ggplot(data_2, aes(x=drink_avr, fill=health)) +
  geom_bar(position="dodge", color="black") +
  facet_wrap(~ drink_amount) +
  scale_fill_brewer(palette="Set2") +  
  labs(
    title="음주 빈도와 음주량에 따른 건강 상태 분포",
    subtitle="음주 빈도와 음주량에 따라 건강 상태를 비교",
    x="음주 빈도",
    y="명",
    fill="건강 상태"
  ) +
  theme_minimal(base_size = 15) +
  theme(
    axis.text.x = element_text(angle = 45, hjust = 1),
    legend.position = "top",
    plot.title = element_text(hjust = 0.5, face="bold"),
    plot.subtitle = element_text(hjust = 0.5),
    panel.grid.major = element_line(color = "grey80"),
    panel.grid.minor = element_blank()
  )

위의 막대그래프를 보면 건강이 나쁘다고 체크한 표본의 비율이 오히려 음주를 하지 않는 그룹에서 가장 높게 나타난 것을 볼 수 있습니다. 그리고 음주를 하는 표본들중에서는 적게 가끔 마시는 그룹이 건강이 좋은 사람의 비율이 높게 나타났습니다. 음주를 많이, 자주할수록 건강이 나쁜쪽의 비율이 높게 나오는 것을 기대하였지만, 기대만큼 분석 결과가 만족스럽게 나오지는 않았습니다. 이는 표본수의 부족으로 인한 요인과 음주 뿐만 아니라 다른 개개인의 건강상의 이유들이 개입되어서 디개한 데이터가 나오지 못했다고 생각합니다.