Em muitas análises estatísticas pode surgir o interesse em verificar se a proporção de ocorrência de uma certa característica populacional é a mesma entre dois (2) grupos independentes que desejamos comparar.
Exemplo: O caso da Amamentação na infância e câncer de mama
Em 1994, Freudenheim et al. realizaram um estudo do tipo caso-controle nos condados de Erie e Níagara situados na parte oeste do estado de Nova York (EUA) para verificar se o fato de ter sido amamentado pela mãe é um fator de proteçãao para o câncer de mama. As pacientes tomadas como controle (sem câncer) foram escolhidas na população da região, não havendo emparelhamento (independente das que tiveram câncer).
Os dados deste estudo estão sendo disponibilizados numa planilha Excel em anexo, a qual pode ser exportada para uma base de dados no formato de um arquivo do tipo .csv e posteriormente utilizada em R ou Python para testar as seguintes hipóteses:
H0: a proporção de mulheres com câncer dentre as que amamentam (pa) a mesma que dentre as que não amamentam (pna) e, portanto, o fato de amamentar não diminui a chance de ter câncer. Em notação matemática, fica:
H0 : pa = pna => H0 : pa − pna = 0
H1: as proporções de casos com câncer diferem entre as mulheres que amamentam e as que não amamentam e, neste caso, o fato de amamentar é um fator de proteção para o câncer de mama (à rigor deveríamos testar de forma unilateral à esquerda mas para efeito didático não o faremos aqui). Em notação matemática, fica:
H1 : pa 6= pna => H1 : pa − pna 6= 0
Baseado nos dados da pesquisa e na aplicação de um teste adequado, você conclui que o fato de uma paciente ter sido amamentada na infância diminui o risco de ter câncer? Use uma estatística de teste adequada e funções do R ou Python para chegar a sua conclusão.
Observação importante!
E possível mostrar que, para um teste que tem por intuito verificar a hipótese de que não há diferença entre duas probabilidades de sucesso (proporções), existem algumas estatísticas de teste equivalentes que podem ser usadas quando a hipótese alternativa é do tipo bilateral. Uma delas é a estatística X2 de Pearson (lê-se: estatística Quiquadrado de Pearson), proposto primeiramente por Karl Pearson. Esta estatística é, de forma equivalente, utilizada para testar a associação ou independência entre dois fatores em uma tabela de contigência 2 × 2 (2 variáveis dicotômicas) (ver David Collett, 2003).
Diante das informações acima, desenvolva os testes de hipóteses utilizando tanto a forma de comparação de 2 proporções quanto de associação ou independência entre duas variáveis qualitativas, usando R ou Python. Descreva de forma prática o resultado obtido sobre a existência ou não de associação (ou independência) entre amamentação na infância e câncer.
# Importando a biblioteca
library(tidyverse)
## ── Attaching packages ─────────────────────────────────────── tidyverse 1.3.1 ──
## ✓ ggplot2 3.3.3 ✓ purrr 0.3.4
## ✓ tibble 3.1.1 ✓ dplyr 1.0.6
## ✓ tidyr 1.1.3 ✓ stringr 1.4.0
## ✓ readr 1.4.0 ✓ forcats 0.5.1
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## x dplyr::filter() masks stats::filter()
## x dplyr::lag() masks stats::lag()
Carregando os dados que vão ser utilizados na questão.
dados = read.csv("/cloud/project/data/dados.csv")
dados
# Selecionando os dados da coluna referente ao cancer
cancer = array(unlist(dados %>% select(cancer)))
# Analisando os dados
summary(cancer)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.0000 0.0000 0.0000 0.4673 1.0000 1.0000
# Selecionando os dados referentes a amamentação
amamentacao = array(unlist(dados %>% select(amamentacao)))
# Analisando os dados
summary(amamentacao)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.0000 0.0000 1.0000 0.7097 1.0000 1.0000
# Gerando uma tabela com os dados do cancer e da amamentação
dados.table = table(cancer, amamentacao)
dados.table
## amamentacao
## cancer 0 1
## 0 153 449
## 1 175 353
Inicialmente, a teste a ser realizado é o Qui-quadrado de Pearson utilizando a tabela gerada.
# Teste Qui-quadrado de Pearson com a tabela
chisq.test(dados.table, correct = TRUE)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: dados.table
## X-squared = 7.785, df = 1, p-value = 0.005268
Ao analisar os resultados, obtemos um p-valor de 0.005268, o que nos da um indicativo de que pode existir uma associação entre as duas variáveis ‘amamentacao’ e ‘cancer’.
Agora, vamos realizar um teste de igualdade entre as proporcoes.
# Teste de igualdade entre as proporcoes
prop.test(dados.table, correct = TRUE, alternative = "two.sided")
##
## 2-sample test for equality of proportions with continuity correction
##
## data: dados.table
## X-squared = 7.785, df = 1, p-value = 0.005268
## alternative hypothesis: two.sided
## 95 percent confidence interval:
## -0.13218438 -0.02238876
## sample estimates:
## prop 1 prop 2
## 0.2541528 0.3314394
Ao observar os resultados, percebemos que foi obtido um p-valor igual o anterior, e os valores das estimativas foram:
0.2541528 e 0.3314394, onde a diferença de valor é diferente de 0.
Portanto, podemos concluir que o fato de uma mulher amamentar pode ser um fator de proteção para o cancer de mama.