5주차 데이터 실험 집계

실험의 목적

5주차 구글 예습 설문지 「05. 한글의 힘과 문해력 조사(260929)」 의 집계결과를 분석합니다. 설문지를 낼 때 보았던 그 문항들입니다.

Q1~Q6에서는 랜덤화의 효과로 Red, Black 이 얼마나 닮았는지 알아봅니다.

Q7에서는 컵에 가득 찬 음료수의 반을 쏟은 상황을 두고, 긍정적인 낱말들을 먼저 읽은 뒤에 물을 때(Red)와 부정적인 낱말들을 먼저 읽은 뒤에 물을 때(Black) 반응이 달라지는지 알아봅니다.

끝으로 제출시간의 분포가 날마다 고른지, Red, Black 간에는 닮았는지 알아봅니다.

자료 점검

Red, Black을 잘못 표시한 사람들

  Red(구글예습퀴즈) Black(구글예습퀴즈)
Red(랜덤화출석부) 139 2
Black(랜덤화출석부) 0 142
계 139 144

랜덤화출석부에 있는 Red, Black 과 실제 구글설문에 올린 Red, Black 이 다른 사람들의 수효는 2명입니다.

Red를 Black 이라고 한 사람이 2명, Black 을 Red 라고 한 사람이 0명입니다.

두 가지 방법으로 분석합니다.

우선 Red, Black 을 잘못 선택한 2명을 랜덤하게 둘로 나누면 어느 한 쪽 집단에 들어갈 기대인원은 2명을 둘로 나눈 1(명)이고, 표준오차는 2의 제곱근에 1/2을 곱해 준 0.7명이 됩니다.

실제로 Red 를 Black 이라고 한 사람수 2명, Black 을 Red 라고 한 사람수 0명은 기대인원 1명으로부터 표준오차 범위를 벗어납니다. (기대인원과의 차이가 표준오차의 1.4배입니다.)

사실 표준오차 범위를 벗어나는 정도가 아니라 2명을 랜덤하게 둘로 나눌 때 가장 극단적으로 치우친 경우가 나왔습니다.

두 번째 분석 방법은 확률을 계산해 보는 것입니다.

Red, Black 을 잘못 선택한 2명을 랜덤하게 둘로 나눌 때, 실제로 관찰된 2명 이상이나 0명 이하로 잘못 선택한 사람수가 나올 가능성은 얼마나 되는가 입니다.

이 경우 공평한 동전던지기를 확률 법칙으로 표현한 이항분포로부터 계산할 수 있습니다.

시행횟수가 2 이고 한 번 시행에서 성공확률이 1/2 인 이항분포에서 성공횟수가 0 이하이거나 2 이상을 관찰할 확률은 0.5 입니다.

공평한 동전 던지기에서 앞면이 0개 이하 나오는 확률은 2개 이상 나오는 확률과 같기 때문에 사실상 한쪽만 계산해서 2배 해 주면 됩니다.

이 값을 p-value 라고 하는데, p-value 가 0.05보다 작을 때 통계적으로 유의한 차이를 관찰하였다고 말합니다.

즉, 공평한 동전을 던지는 것과 같은 과정이라고 가정하였을 때 실제로 관찰된 값들이 가정으로부터 얼마나 떨어져 있는지를 표현한 것입니다.

0.05, 즉 1/20은 이런 실험을 스무 번 정도 반복하면 1번 나올 정도로 드문 사건을 의미합니다. 즉 가정이 타당하다면 나오기 힘든 결과라는 것입니다.

Red, Black 을 잘못 표시한 사람들의 분포에서 관찰된 p-value 는 0.5 으로 0.05보다 큽니다. 공평한 동전을 던져서도 이 정도 치우침은 심심찮게 나옵니다. 따라서 통계적으로 유의한 차이라고 할 수 없습니다. 오표시가 어느 한 방향으로 쏠렸다고 볼 근거가 없다는 뜻입니다.

응답인원의 Red, Black

Red 로 응답한 인원은 139명, Black 에 응답한 인원은 144명입니다.

전체 응답인원 283 명을 랜덤하게 둘로 나눌 때 어느 한 쪽의 기대인원은 전체 응답인원의 절반인 141.5명이고, 표준오차는 전체 응답인원의 제곱근에 1/2을 곱해 준 8.4 명입니다.

따라서 Red, Black 각 그룹에 관찰된 인원은 기대인원으로부터 표준오차 범위 안에 들어갑니다. (기대인원과의 차이가 표준오차의 0.3배입니다.)

일반적으로 기대인원으로부터 표준오차 범위, 혹은 두 배의 표준오차 범위 안에 들어간다는 것은 기억해 둘 필요가 있습니다.

Q1. 한글의 문자 유형

한글은 민주 문자

  민주 문자 엘리트 문자 계
Red 137 2 139
Black 136 8 144
계 273 10 283
Pearson’s Chi-squared test with Yates’ continuity correction: m
Test statistic df P value
2.412 1 0.1204

Q1의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 2.41, 자유도는 1 , p-value 는 0.1204이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

한글은 민주 문자(%)

민주 문자 엘리트 문자 계
96.5 3.5 100.0

정답률은 Red, Black 을 합하여 계산하는데, 96.5(%) 입니다.

Q2. 정보혁명과 문자 체계

정보혁명을 이끄는 문자는 한글(집계표)

  한자 한글 계
Red 15 124 139
Black 7 137 144
계 22 261 283
Pearson’s Chi-squared test with Yates’ continuity correction: m
Test statistic df P value
2.691 1 0.1009

Q2의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 2.69, 자유도는 1, p-value 는 0.1009이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

정보혁명을 이끄는 문자는 한글(%)

한자 한글 계
7.8 92.2 100.0

정답률은 Red, Black 을 합하여 계산하는데, 92.2(%) 입니다.

Q3. 알기 힘든 전문 용어

몇 개나 아나요?(집계표)

  하나도 없다 1개 2개 3개 4개 계
Red 69 40 25 2 3 139
Black 65 48 15 5 11 144
계 134 88 40 7 14 283
Pearson’s Chi-squared test: m
Test statistic df P value
9.118 4 0.05821

Q3의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 9.118, 자유도는 4, p-value 는 0.0582이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

몇 개나 아나요?(%)

하나도 없다 1개 2개 3개 4개 계
47.3 31.1 14.1 2.5 4.9 100.0

이 문항에는 정답이 없으므로 정답률은 의미가 없습니다.

가장 많은 사람이 고른 것은 하나도 없다 이고 47.3(%) 입니다.

Q4. 해방직후 비문해율

집계

  90% 80% 50% 20% 10% 계
Red 3 115 8 12 1 139
Black 6 116 10 11 1 144
계 9 231 18 23 2 283
Pearson’s Chi-squared test: m
Test statistic df P value
1.182 4 0.881

Q4의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 1.182, 자유도는 4, p-value 는 0.8810이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

집계(%)

90% 80% 50% 20% 10% 계
3.18 81.63 6.36 8.13 0.71 100.00

정답률은 Red, Black 을 합하여 계산하는데, 81.6(%) 입니다.

Q5. 세대간 문해력 격차

집계

  대한민국 영국 이탈리아 미국 계
Red 122 3 3 11 139
Black 126 3 6 9 144
계 248 6 9 20 283
Pearson’s Chi-squared test: m
Test statistic df P value
1.177 3 0.7586

Q5의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 1.177, 자유도는 3, p-value 는 0.7586이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

집계(%)

대한민국 영국 이탈리아 미국 계
87.6 2.1 3.2 7.1 100.0

정답률은 Red, Black 을 합하여 계산하는데, 87.6(%) 입니다.

Q6. 문해력 격차의 파급효과

집계

  60% 낮은 임금 실직 가능성 나쁜 건강 활동 불참 덜 신뢰 계
Red 108 9 9 8 5 139
Black 111 11 15 3 4 144
계 219 20 24 11 9 283
Pearson’s Chi-squared test: m
Test statistic df P value
4.038 4 0.4009

Q6의 집계 결과가 Red, Black 간에 통계적으로 유의한 차이가 있는지 알아보기 위하여 카이제곱 테스트를 수행하였습니다.

그 결과 카이제곱 통계량은 4.038, 자유도는 4, p-value 는 0.4009이므로 Red, Black 간에 통계적으로 유의한 차이를 보이지 않습니다.

실제로 닮은 게 느껴집니까?

집계(%)

60% 낮은 임금 실직 가능성 나쁜 건강 활동 불참 덜 신뢰 계
77.4 7.1 8.5 3.9 3.2 100.0

정답률은 Red, Black 을 합하여 계산하는데, 77.4(%) 입니다.

Q7. 프레임을 설정하는 단어의 힘

컵 가득 음료수를 채웠는데 미끄러지면서 반을 쏟았습니다.

이 상황에서 어떤 사람은 “그래도 반이나 남았네”라고 긍정적으로 반응하고, 또 다른 사람은 “반 밖에 안 남았네”라고 부정적으로 반응합니다.

반응을 묻기 전에 Red 에는 긍정적인 낱말들을, Black 에는 부정적인 낱말들을 먼저 읽게 했습니다. 먼저 읽은 낱말이 반응에 영향을 미치지 않는다면 Red 와 Black 에 차이가 없어야 할 텐데 집계결과는 어떻게 나오고 있나요?

집계표와 카이제곱 테스트로 확인해 보겠습니다.

집계

  반이나 반밖에 모름/기타 계
Red(긍정적 단어) 98 34 7 139
Black(부정적 단어) 57 80 7 144
계 155 114 14 283
Pearson’s Chi-squared test: m
Test statistic df P value
29.33 2 4.282e-07 * * *

Q7의 Red는 긍정적인 낱말들을 먼저 읽은 뒤에 물었을 때 139명이 응답한 가운데 98명이 “반이나 남았네”라는 반응을 보이고, 34명이 “반 밖에 안 남았네”라는 반응을 보입니다.

Black은 같은 상황에서 부정적인 낱말들을 먼저 읽은 뒤에 물었을 때 144명이 응답한 가운데 57명이 “반이나 남았네”라는 반응을 보이고, 80명이 “반 밖에 안 남았네”라는 반응을 보입니다.

그리고 “모름/기타”에 답한 인원은 Red에 7명, Black 에 7명이 응답하였습니다.

카이제곱 테스트로 두 설계의 차이가 우연으로 보기 어려운 수준인지 살펴봅니다.

카이제곱 통계량은 29.327, 자유도는 2, p-value 는 4.3e-07 입니다.

여기서 먼저 읽은 낱말이 반응에 영향을 끼치지 않는다고 가정해 봅니다. 그 가정이 맞다면 랜덤화의 효과로 Red, Black 의 응답은 Q1 ~ Q6 에서처럼 닮게 마련이고, 통계적으로 유의한 차이가 나오지 않아야 합니다.

그런데 실제로 관찰된 p-value 는 0.05보다 작습니다. 가정이 맞다면 나오기 어려운 결과가 나온 것이므로, 먼저 읽은 낱말이 반응에 영향을 끼친다고 보아야 합니다. 이러한 논증 방식을 귀류법이라고 합니다.

% 비교

  반이나 반밖에 모름/기타 계
Red(긍정적 단어) 70.5 24.5 5.0 100.0
Black(부정적 단어) 39.6 55.6 4.9 100.0

긍정적인 낱말을 먼저 읽은 Red에서 “반이나 남았네”라고 응답하는 사람들의 백분율, 70.5(%)은 “반 밖에 안 남았네”라고 응답하는 사람들의 백분율, 24.5(%)보다 높습니다.

부정적인 낱말을 먼저 읽은 Black에서 “반이나 남았네”라고 응답하는 사람들의 백분율, 39.6(%)은 “반 밖에 안 남았네”라고 응답하는 사람들의 백분율, 55.6(%)보다 낮습니다.

“반이나 남았네”의 백분율을 Red 와 Black 에서 나란히 놓고 보면, 먼저 읽은 낱말이 반응을 어떻게 갈라 놓는지 알 수 있습니다.

전체적으로 어느 정도가 “반이나 남았네”이고 어느 정도가 “반 밖에 안 남았네”인지 합쳐 보겠습니다.

% 합계

반이나 반밖에 모름/기타 계
54.8 40.3 4.9 100.0

“반이나 남았네”라고 응답한 백분율은 Red, Black 합쳐서 54.8(%), “반 밖에 안 남았네”라고 응답한 백분율은 40.3(%) 입니다.

다만 이 합계는 두 설계를 섞어 놓은 값입니다. Red 와 Black 이 서로 다른 낱말을 먼저 읽고 답했으므로, 이 숫자를 「우리 학생들의 성향」으로 읽으면 안 됩니다. 어느 낱말을 먼저 보여 주느냐에 따라 이 합계도 움직입니다.

그리고 모름/기타는 4.9(%) 입니다.

Mosaic Plot

Mosaic Plot 은 이 집계결과를 시각적으로 잘 보여줍니다.

칸의 세로 길이는 그 집단 안에서의 비율이고 가로 폭은 그 집단의 응답인원이므로, 비율과 인원을 한 그림에서 함께 읽을 수 있습니다. 긍정적인 낱말을 먼저 읽은 Red 와 부정적인 낱말을 먼저 읽은 Black 에서 “반이나 남았네” 칸의 높이가 어떻게 달라지는지 보기 바랍니다.

마감 시간으로부터 제출 시간의 분포

분포표

제출일 (왼쪽이 개시 첫날 = 1일차, 오른쪽이 오늘 = 10일차)
  1일차 2일차 3일차 4일차 5일차 6일차 7일차 8일차 9일차 10일차 계
Red 25 11 12 12 13 24 26 7 8 1 139
Black 21 22 15 9 13 16 31 8 9 0 144
계 46 33 27 21 26 40 57 15 17 1 283

분포표로부터 두 가지 문제를 살펴보겠습니다.

첫째, 날마다 고르게 제출하는가?

둘째, Red, Black 간에 통계적으로 유의한 차이가 있는가?

각 문제를 살펴보기 위해서는 분포표의 일부분을 대상으로 카이제곱 테스트를 수행합니다.

날마다 고르게 제출하는가?

1일차 2일차 3일차 4일차 5일차 6일차 7일차 8일차 9일차 10일차
46 33 27 21 26 40 57 15 17 1
Chi-squared test for given probabilities: x
Test statistic df P value
85.02 9 1.616e-14 * * *

날마다 고르게 제출하는지 알아 보았습니다.

분포표의 “계”행에서 ’계’열을 제외하고 카이제곱테스트를 수행합니다.

분포표 만으로도 쉽게 파악할 수 있지만 카이제곱테스트가 명확히 해 줍니다.

카이제곱 통계량은 85.02, 자유도는 9.00, p-value 는 1.6e-14 이므로 결코 고르게 제출한다고 말할 수 없겠습니다.

막대그래프로 살펴 보겠습니다.

막대그래프

아직 마감 전입니다. 지금까지 낸 283(명) 가운데 가장 많았던 날은 7일차로 57(명), 20(%) 입니다. 왼쪽 끝, 곧 설문지가 열린 첫날에는 46(명)이 냈습니다. 마감일 칸은 그 날이 와야 채워집니다.

Red, Black 간에 닮았는가?

  1일차 2일차 3일차 4일차 5일차 6일차 7일차 8일차 9일차 10일차
Red 25 11 12 12 13 24 26 7 8 1
Black 21 22 15 9 13 16 31 8 9 0
Pearson’s Chi-squared test: x
Test statistic df P value
7.855 9 0.5489

제출시간의 분포가 Red, Black 간에 닮았는지 알아 보았습니다.

이번에는 분포표의 첫번째와 두번째 행, ’계’열을 제외한 나머지 열에 대해서 카이제곱테스트를 수행합니다.

카이제곱 통계량은 7.855, 자유도는 9, p-value 는 0.5489 이므로 제출 시간의 분포는 Red, Black 간에 통계적으로 유의한 차이가 관찰되지 않습니다.

이 사실을 Mosaic Plot 을 이용하여 시각적으로 살펴보겠습니다.

닮았다고 느껴지나요?

Mosaic Plot