Na teoria e prática estatística muitas vezes é necessário que os dados a serem analisados sejam provenientes de uma população com distribuição de probabilidade normal. Desta forma, em testes como; por exemplo; t de Student; utilizado para testar uma média no caso da variância populacional ser desconhecida; ́e importante testar a hipótese de que os dados são provenientes de uma distribuição normal. Assim, as seguintes hip ́oteses podem ser formuladas:
H0: os dados provêm de uma distribuição normal
H1: os dados não tem distribuição normal
Considerando estas hipóteses para testar a normalidade dos dados leia o Artigo no site e sabendo usar as funçõoes do R para obter o Valor p, interprete-o e conclua sobre a normalidade dos dados referentes ao tempo de rea ̧c ̃ao do novo medicamento apresentado na questão anterior.
Observações:
Note que nem sempre é necessario saber calcular a estatística de teste como; por exemplo; a de Shapiro-Wilk e Kolmogorov-Smirnov; mas somente saber estabelecer as hipótese nula e alternativa e o teste correto a ser aplicado (normal, t de Student, Qui-quadrado, ShapiroWilk, Kolmogorov-Smirnov, etc) com a posterior interpretação do Valor p, necessária para a tomada de decisão.
Geralmente, antes de partir para um teste de hipótese sobre a normalidade dos dados, uma análise gráfica (subjetiva) pode ser feita construindo; por exemplo; um histograma e um gráfico chamado Q-Q plot (Quantil-Quantil plot). Sendo os dados provenientes de uma distribuição normal, espera-se um histograma em forma de sino (dados simétricos em torno da média) e dados relativamente próximos da reta à 45o no Q-Q plot.
Levando em consideração a observação 2, construa os gráficos histograma e Q-Q plot no R (ver, por exemplo, link) ou Python e descreva suas impressões sobre a normalidade dos dados.
# Criando amostra
dados = c(2.9, 3.4, 3.5, 4.1, 4.6, 4.7, 4.5, 3.8, 5.3, 4.9, 4.8, 5.7, 5.8, 5.0, 3.4, 5.9, 6.3, 4.6, 5.5, 6.2)
dados
## [1] 2.9 3.4 3.5 4.1 4.6 4.7 4.5 3.8 5.3 4.9 4.8 5.7 5.8 5.0 3.4 5.9 6.3 4.6 5.5
## [20] 6.2
# Gráfico 1
hist(dados, freq = FALSE, col = "blue")
curve(dnorm(x,mean=mean(dados),sd=sd(dados)),col=2,lty=2,lwd=2,add=TRUE)
# Gráfico 2
qqnorm(dados, main = "", xlab = "Quantis teóricos N(0,1)", pch = 20,
ylab = "Tempo de reação (em minutos)")
qqline(dados, lty = 2, col = "blue")
O p-valor é de 0.5986. Isto indica que os dados são normais, pois p-valores menores que 0.05 são os casos onde os dados não apresentam normalidade.
# Teste de Shapiro-Wilk
shapiro.test(dados)
##
## Shapiro-Wilk normality test
##
## data: dados
## W = 0.96267, p-value = 0.5986