Bastão de Asclépio & Distribuição Normal

Bastão de Asclépio & Distribuição Normal

1 Gabarito

1.1 Teste de hipótese nula: conceito e teste z

  • 2.1 APEx 7703: A
  • 2.2 APEx 7706: D
  • 2.3 APEx 7708: C
  • 2.4 APEx 7722: D
  • 2.5 APEx 7852: B
  • 2.6 APEx 9456: A
  • 2.7 APEx 10175: A
  • 2.8 APEx 10090: B
  • 2.9 APEx 10486: C
  • 2.10 APEx 10487: A
  • 2.11 APEx 10488: C
  • 2.12 APEx 10490: E
  • 2.13 APEx 10491: B
  • 2.14 APEx 10492: D
  • 2.15 APEx 10493: D
  • 2.16 APEx 11431: A
  • 2.17 APEx 12945: C
  • 2.18 APEx 12944: C
  • 2.19 APEx 11541: F
  • 2.20 APEx 12181: G
  • 2.21 APEx 12183: A
  • 2.22 APEx 12184: B

2 Testagem de hipótese nula: conceito e teste z

2.1 APEx 7703: Probabilidade de um tipo de erro

A probabilidade de que um efeito tenha surgido devido apenas ao erro amostral, dado que a hipótese nula é verdadeira, é representada por:

A. α (alfa)
B. β (beta)
C. 1 − β (um menos beta)
D. 1 − α (um menos alfa)
E. α + β (alfa mais beta)

Explicações e justificativas:

Alternativa correta: A.

Por definição, α é a probabilidade de rejeitar a hipótese nula quando ela é verdadeira, isto é, a probabilidade de um erro do tipo I. Essa probabilidade quantifica a chance de observar um efeito estatisticamente significante.

2.2 APEx 7706: Poder

O poder de um teste é representado por:

A. α (alfa)
B. β (beta)
C. 1 − α (um menos alfa)
D. 1 − β (um menos beta)
E. α + β (alfa mais beta)

Explicações e justificativas:

Alternativa correta: D.

Por definição, o poder estatístico de um teste é a probabilidade de rejeitar a hipótese nula quando ela é falsa, isto é, a probabilidade de detectar um efeito verdadeiro. Essa quantidade é expressa por \(1 - \beta\), sendo que \(\beta\) é a probabilidade de erro do tipo II.

2.3 APEx 7708: Hipótese alternativa

Se você obtém em um estudo o valor-p de \(p = 0.01\), a probabilidade de que a hipótese alternativa seja verdadeira é:

A. 0,99
B. 0,01
C. Indeterminada

Explicações e justificativas:

Alternativa correta: C.

O valor-p é definido como a probabilidade de obter um resultado tão extremo quanto o observado (ou mais), assumindo que a hipótese nula é verdadeira. Ele não fornece a probabilidade de a hipótese alternativa ser verdadeira. Portanto, essa probabilidade é indeterminada a partir do valor-p.

2.4 APEx 7722: \(p = 0{,}000\)

Um software estatístico informa \(p = 0{,}000\).

Como esse valor-p deve ser relatado?

A. \(p = 0{,}000\)
B. \(p = 0\)
C. \(p < 0{,}01\)
D. \(p < 0{,}001\)
E. \(p < 0{,}0001\)

Explicações e justificativas:

Alternativa correta: D.

Valores-p nunca são exatamente zero. Quando um software reporta \(p = 0{,}000\), isso indica apenas que o valor-p é menor do que o limite de precisão exibido. Pela convenção (por exemplo, APA), valores muito pequenos devem ser relatados como desigualdade, tipicamente \(p < 0.001\).

# Exemplo de um valor-p muito pequeno
p_value <- 2.2e-16

# Formatação padrão (estilo APA)
formatted_p <- format.pval(p_value, digits = 3, eps = .001)
cat("p", formatted_p, "\n", sep = "")
p<0.001

2.5 APEx 7852: Teste de hipótese nula

Ceteris paribus, num teste de hipótese nula:

A. Quanto maior a amostra, menor o poder
B. Quanto maior a amostra, maior o poder
C. O tamanho da amostra não está relacionado ao poder
D. Quanto maior a amostra, mais difícil determinar o poder

Explicações e justificativas:

Alternativa correta: B.

Mantidos constantes o tamanho do efeito, o nível de significância \(\alpha\) e a variabilidade, o aumento do tamanho amostral reduz o erro-padrão, aumentando a probabilidade de rejeitar a hipótese nula quando ela é falsa. Portanto, o poder do teste cresce com o tamanho da amostra.

Ver Figure 4: Power and sample size, Krzywinski & Altman, Nature Methods, 2013.

2.7 APEx 10175: Significância estatística

Em Daniel J. et al. (2018) Redefine statistical significance. Nature Human Behaviour 2: 6–10, os autores afirmam:

“For fields where the threshold for defining statistical significance for new discoveries is \(p < 0.05\), we propose a change to \(p < 0.005\). This simple step would immediately improve the reproducibility of scientific research in many fields. Results that would currently be called significant but do not meet the new threshold should instead be called suggestive.”

Esta proposta, para alterar o critério tradicional de \(0.05\) para \(0.005\) no planejamento dos testes estatísticos, implica em:

A. diminuir o nível de significância
B. diminuir a probabilidade do erro do tipo II
C. aumentar o poder
D. diminuir o valor-p

Explicações e justificativas:

Alternativa correta: A.

A proposta consiste em reduzir o nível de significância \(\alpha\) de \(0.05\) para \(0.005\), tornando mais rigoroso o critério para rejeição da hipótese nula e reduzindo a probabilidade do erro do tipo I.

Ceteris paribus, a redução de \(\alpha\) implica aumento de \(\beta\), a probabilidade do erro do tipo II, e consequente diminuição do poder do teste (\(1-\beta\)). Portanto, as alternativas que sugerem diminuição de \(\beta\) ou aumento do poder são incorretas.

O valor-p é uma estatística observada após a realização do teste e não um parâmetro de planejamento; logo, não faz sentido afirmar que o critério proposto “diminui o valor-p”.

2.8 APEx 10090: Alfa

Quase todos os dias nos deparamos com o conceito de “significância estatística” dos resultados de um estudo clínico, geralmente avaliada através da expressão \(p < 0.05\) ou semelhantes. No entanto, o significado de “nível de significância” nem sempre é corretamente compreendido na prática clínica.

Na linguagem coloquial, “significante” sugere algo importante. Em Estatística, o termo refere-se a um resultado pouco compatível com a hipótese nula, isto é, improvável sob um modelo puramente aleatório. Um achado pode ser estatisticamente significante sem ser clinicamente relevante.

A probabilidade de cometer um erro do tipo I é \(\alpha\), definido a priori como o nível de significância do teste de hipóteses.

Fonte: Quais são os erros do tipo I e II?: Suporte ao Minitab 18).

A probabilidade do erro do tipo I:

A. mensura o defeito no planejamento do experimento.
B. define o critério para a decisão estatística.
C. estima o poder para aceitar hipóteses.
D. avalia o viés da obtenção da amostra.

Explicações e justificativas:

Alternativa correta: B.

O nível de significância \(\alpha\) é fixado antes da coleta dos dados e estabelece o critério de decisão do teste estatístico. Ao comparar o valor-\(p\) observado com \(\alpha\), decide-se rejeitar ou não rejeitar a hipótese nula. Portanto, \(\alpha\) não mede defeitos do planejamento, não estima poder e não avalia viés amostral; ele define explicitamente a regra de decisão estatística.

2.9 APEx 10486: Significância estatística

A significância estatística:

A. Indica a importância prática.
B. Mostra a significância clínica.
C. Depende do tamanho da amostra.

Explicações e justificativas:

Alternativa correta: C.

A significância estatística depende do tamanho da amostra, pois, ceteris paribus, amostras maiores reduzem o erro-padrão e aumentam a probabilidade de rejeitar a hipótese nula. Significância estatística não implica, necessariamente, importância prática ou relevância clínica.

2.10 APEx 10487: Teste estatístico – lógica

A lógica dos testes estatísticos inferenciais é determinar a probabilidade de:

A. observar efeito devido à flutuação amostral quando a hipótese nula é verdadeira.
B. obter erro amostral quando a hipótese da diferença é falseável.
C. cometer um erro do Tipo II quando a hipótese alternativa é verdadeira.
D. determinar o tamanho de efeito quando o erro amostral está presente.

Explicações e justificativas:

Alternativa correta: A.

Nos testes estatísticos clássicos, calcula-se o valor-p, definido como a probabilidade de observar um resultado tão extremo quanto o obtido, ou mais, assumindo que a hipótese nula é verdadeira. Essa lógica quantifica a compatibilidade dos dados com \(H_0\) sob a hipótese de que o efeito observado se deve apenas à flutuação amostral.

2.11 APEx 10488: \(p = 4\%\)

Se você obtém um valor-p de \(4\%\), isso significa que:

A. A probabilidade de que a hipótese nula seja verdadeira é \(4\%\) e que a hipótese alternativa seja \(96\%\).
B. A probabilidade de que a hipótese nula seja falsa é \(4\%\) e, portanto, a sua probabilidade de ser verdadeira é \(96\%\).
C. A probabilidade de se obter o efeito observado devido apenas ao erro amostral é \(4\%\), se a hipótese nula é verdadeira.
D. A probabilidade de não existir efeito devido ao erro amostral é \(96\%\), se a hipótese alternativa é verdadeira.

Explicações e justificativas:

Alternativa correta: C.

O valor-p é definido como a probabilidade de observar um resultado tão extremo quanto o observado, ou mais, assumindo que a hipótese nula é verdadeira. Assim, um valor-p de \(0.04\) indica que, sob \(H_0\), a chance de obter o efeito observado apenas por flutuação amostral é de \(4\%\). O valor-p não fornece probabilidades para a veracidade de \(H_0\) ou \(H_1\).

2.12 APEx 10490: Goodcoin – erros tipo I e II

Utilize o simulador Goodcoin.R. Explicação sobre Goodcoin.R está em Testagem de hipótese nula e significância estatística em R.

Para decidir se uma moeda é desbalanceada (tida como falsa) ou balanceada (tida como verdadeira), um experimento consiste em lançá-la “cara ou coroa” um determinado número de vezes (tamanho da amostra). Os lançamentos dentro e entre experimentos são independentes e identicamente distribuídos, isto é, aleatórios.

Simulando-se muitos experimentos, obtém-se a distribuição das decisões, evidenciando seus erros. Com essas simulações busca-se distinguir moedas falsas das verdadeiras, minimizando as probabilidades dos erros do tipo I (\(\alpha\)) e do tipo II (\(\beta\)). Há duas estratégias fundamentais:

  1. alterar \(\alpha\) (equivalente a mudar o critério de decisão);
  2. alterar o número de lançamentos de cada moeda (equivalente a mudar o tamanho da amostra).

Dica: para aproximar-se da solução, use um número menor de experimentos (por exemplo, entre 6000 e 10000 moedas), mas para conferir a resposta, simule números maiores, como \(10^5\) (100.000) moedas, para maior precisão.

Tendo encontrado o tamanho da amostra para \(\alpha = 5\%\) e poder de \(90\%\), considerando moedas desbalanceadas com probabilidade de \(70\%\) de resultarem coroa, o que aconteceria se as moedas fossem viciadas para coroa com probabilidade de \(30\%\)? A(s) probabilidade(s) do(s) erro(s) do(s) tipo(s):

A. I diminui
B. I aumenta
C. II diminui
D. II aumenta
E. I e II não mudam

Explicações e justificativas:

Alternativa correta: E.

Como a moeda de referência é balanceada, com \(p(\text{coroa}) = 0.5\), alterar a probabilidade da moeda desbalanceada de \(0.7\) para \(0.3\) corresponde a uma transformação simétrica em torno de \(0.5\). Mantidos o critério de decisão e o tamanho da amostra, as distribuições sob as hipóteses alternativa à direita (\(p=0.7\)) e à esquerda (\(p=0.3\)) são simétricas. Portanto, as probabilidades dos erros do tipo I e do tipo II permanecem inalteradas.

2.13 APEx 10491: Goodcoin – tamanho amostral e poder

Utilize o simulador Goodcoin.R. Explicação sobre Goodcoin.R está em Testagem de hipótese nula e significância estatística em R.

Para decidir se uma moeda é desbalanceada (tida como falsa) ou balanceada (tida como verdadeira), um experimento consiste em lançá-la “cara ou coroa” um determinado número de vezes (tamanho da amostra). Os lançamentos dentro e entre experimentos são independentes e identicamente distribuídos, isto é, aleatórios.

Simulando-se muitos experimentos, obtém-se a distribuição da tomada de decisão, evidenciando seus erros. Com essas simulações busca-se distinguir moedas falsas das verdadeiras, minimizando as probabilidades dos erros do tipo I (\(\alpha\)) e do tipo II (\(\beta\)). Há duas estratégias fundamentais:

  1. alterar \(\alpha\) (equivalente a mudar o critério de decisão);
  2. alterar o número de lançamentos de cada moeda (equivalente a mudar o tamanho da amostra).

Dica: para aproximar-se da solução, use um número menor de experimentos (por exemplo, entre 6000 e 10000 moedas), mas para conferir a resposta, simule números maiores, como \(10^5\) (100.000) moedas, para maior precisão.

Tendo estabelecido o tamanho da amostra com \(\alpha = 5\%\) e \(\beta = 10\%\) para moedas com \(p(\text{coroa}) = 0.7\), é possível reduzir o tamanho da amostra, mantendo o poder do teste?

A. Não é possível.
B. Sim, aumentando \(\alpha\).
C. Sim, reduzindo \(\alpha\).
D. Sim, aumentando \(\beta\).
E. Sim, reduzindo \(\beta\).

Explicações e justificativas:

Alternativa correta: B.

Manter o poder significa manter \(1-\beta = 0.90\), isto é, manter \(\beta = 0.10\). Reduzir o tamanho da amostra aumenta a variabilidade amostral relativa (maior dispersão da distribuição binomial), aumentando a sobreposição entre as distribuições sob \(H_0\) e \(H_1\) e, portanto, tendendo a aumentar \(\beta\) (perda de poder), se o critério de decisão for mantido fixo.

Para compensar a redução de \(n\) e manter \(\beta\) em \(0.10\), é necessário deslocar o ponto crítico de decisão de modo a reduzir a região de não rejeição de \(H_0\), o que aumenta a probabilidade de rejeitar \(H_0\) quando ela é verdadeira. Em termos de erros, isso corresponde a aumentar \(\alpha\).

2.14 APEx 10492: Goodcoin – aproximação da alternativa

Utilize o simulador Goodcoin.R. Explicação sobre Goodcoin.R está em Testagem de hipótese nula e significância estatística em R.

Para decidir se uma moeda é desbalanceada (tida como falsa) ou balanceada (tida como verdadeira), um experimento consiste em lançá-la “cara ou coroa” um determinado número de vezes (tamanho da amostra). Os lançamentos dentro e entre experimentos são independentes e identicamente distribuídos, isto é, aleatórios.

Simulando-se muitos experimentos, obtém-se a distribuição da tomada de decisão, evidenciando seus erros. Com essas simulações busca-se distinguir moedas falsas das verdadeiras, minimizando as probabilidades dos erros do tipo I (\(\alpha\)) e do tipo II (\(\beta\)). Há duas estratégias fundamentais:

  1. alterar \(\alpha\) (equivalente a mudar o critério de decisão);
  2. alterar o número de lançamentos de cada moeda (equivalente a mudar o tamanho da amostra).

Dica: para aproximar-se da solução, use um número menor de experimentos (por exemplo, entre 6000 e 10000 moedas), mas para conferir a resposta, simule números maiores, como \(10^5\) (100.000) moedas, para maior precisão.

Tendo encontrado o tamanho da amostra para \(\alpha = 5\%\) e poder de \(90\%\), para moedas desbalanceadas com probabilidade de \(70\%\) para sortear coroa, o que aconteceria se as moedas fossem viciadas para coroa com probabilidade de \(60\%\)? A(s) probabilidade(s) do(s) erro(s) do(s) tipo(s):

A. I diminui e II não se altera
B. I aumenta e II não se altera
C. I não se altera e II diminui
D. I não se altera e II aumenta
E. I e II não se alteram
F. I diminui e II aumenta
G. I aumenta e II diminui
H. I e II aumentam
I. I e II diminuem

Explicações e justificativas:

Alternativa correta: D.

O critério de decisão foi calibrado para \(\alpha = 0.05\) com \(H_0: p(\text{coroa}) = 0.5\). Mantendo o mesmo ponto crítico e o mesmo tamanho amostral, \(\alpha\) não muda, pois depende apenas da distribuição sob \(H_0\) e da região crítica fixada.

Ao alterar a hipótese alternativa de \(p(\text{coroa}) = 0.7\) para \(p(\text{coroa}) = 0.6\), a distribuição sob \(H_1\) se aproxima da distribuição sob \(H_0\), aumentando a sobreposição. Consequentemente, cresce a probabilidade de a estatística cair na região de não rejeição de \(H_0\) quando \(H_1\) é verdadeira, isto é, aumenta \(\beta\), e o poder \(1-\beta\) diminui.

2.15 APEx 10493: Goodcoin – tamanho amostral

Utilize o simulador Goodcoin.R. Explicação sobre Goodcoin.R está em Testagem de hipótese nula e significância estatística em R.

Para decidir se uma moeda é desbalanceada (tida como falsa) ou balanceada (tida como verdadeira), um experimento consiste em lançá-la “cara ou coroa” um determinado número de vezes (tamanho da amostra). Os lançamentos dentro e entre experimentos são independentes e identicamente distribuídos, isto é, aleatórios.

Simulando-se muitos experimentos, obtém-se a distribuição da tomada de decisão, evidenciando seus erros. Com essas simulações busca-se distinguir moedas falsas das verdadeiras, minimizando as probabilidades dos erros do tipo I (\(\alpha\)) e do tipo II (\(\beta\)). Há duas estratégias fundamentais:

  1. alterar \(\alpha\) (equivalente a mudar o critério de decisão);
  2. alterar o número de lançamentos de cada moeda (equivalente a mudar o tamanho da amostra).

Dica: para aproximar-se da solução, use um número menor de experimentos (por exemplo, entre 6000 e 10000 moedas), mas para conferir a resposta, simule números maiores, como \(10^5\) (100.000) moedas, para maior precisão.

Encontre, aproximadamente, o tamanho da amostra, para \(\alpha = 5\%\) e poder de \(90\%\), assumindo que as moedas desbalanceadas têm probabilidade de \(70\%\) para sortear coroa.

A. 20
B. 40
C. 60
D. 80
E. 100
F. 120

Explicações e justificativas:

Alternativa correta: D.

O tamanho da amostra corresponde ao número de lançamentos independentes da moeda em cada experimento. Mantido \(\alpha = 0.05\), o poder do teste (\(1-\beta\)) aumenta com o número de lançamentos, pois a variabilidade relativa da proporção observada diminui.

Ao testar os valores sugeridos no simulador Goodcoin.R, observa-se que cerca de \(n \approx 80\) lançamentos são necessários para atingir aproximadamente \(90\%\) de poder quando a moeda desbalanceada tem \(p(\text{coroa}) = 0.7\).

2.16 APEx 11431: Goodcoin – tamanho amostral e significância

Imagine que você conduziu dois estudos em uma população com prevalência de depressão de 35%, verificando-se o efeito de novas terapias.

No estudo A com 200 participantes submetidos à uma das terapias, o número de deprimidos caiu para 50 (25%) pacientes que continuaram deprimidos. No estudo B com 20 participantes submetidos à outra terapia, o número foi reduzido para 5 (25%) que continuaram deprimidos.

Sugerimos que resolva esta questão utilizando o simulador Goodcoin.R. Explicação sobre Goodcoin.R está em Testagem de hipótese nula e significância estatística em R.

Em qual dos dois estudos observamos efeito da(s) terapia(s) com nível de significância de \(5\%\)?

A. Nos dois estudos
B. Estudo A
C. Estudo B
D. Em nenhum dos dois estudos
E. Impossível determinar

Explicações e justificativas:

Alternativa correta: B.

Modela-se “deprimido” como “coroa” e considera-se como referência a prevalência populacional sob a hipótese nula,

\[ H_0:\ p = 0.35 \quad\text{vs}\quad H_1:\ p < 0.35 \]

com \(\alpha = 0.05\) (teste monocaudal à esquerda). O valor observado foi \(p_{\text{obs}}=0.25\) em ambos os estudos, mas o teste depende de \(n\).

Pelo Goodcoin.R (ou, equivalentemente, pela distribuição binomial):

Para o estudo A, usando \(n=200\) e \(p_0=0.35\), a região crítica para \(\alpha \approx 0.05\) ocorre para números de “coroas” suficientemente pequenos; com 50 deprimidos, o resultado cai na região de rejeição de \(H_0\), portanto há evidência de redução (significância a 5%).

Para o estudo B, com \(n=20\) e o mesmo \(p_0=0.35\), a região crítica é muito mais extrema devido ao pequeno tamanho amostral; com 5 deprimidos, o resultado não cai na região de rejeição. Assim, não há evidência suficiente a \(\alpha=0.05\).

Resumo: com o mesmo \(p_{\text{obs}}=0.25\), apenas o estudo com maior \(n\) atinge significância a 5%.

2.17 APEx 12945: RNBP e etilismo I

Um pesquisador deseja investigar recém-nascidos de baixo peso ao nascer (RNBP) e etilismo na prenhez. A média e o desvio-padrão (g) de recém-nascido de um tipo de rato branco de fêmea não-etilista são, respectivamente, 20 e 4. Cinquenta fêmeas são emprenhadas num experimento no qual elas recebem doses diárias de álcool. A média dos RNBP dessas fêmeas no experimento é 18 g.

O teste mais adequado para analisar se há o efeito de etilismo no RNBP é:

A. Monocaudal à direita
B. Monocaudal à esquerda

Explicações e justificativas:

Alternativa correta: B.

O interesse é detectar redução do peso ao nascer em relação ao valor de referência de fêmeas não-etilistas. Assim, define-se

\[ H_0:\ \mu = 20 \quad\text{vs}\quad H_1:\ \mu < 20 \]

sendo que \(\mu\) é a média populacional do peso ao nascer sob etilismo. Portanto, o teste é monocaudal à esquerda, com região crítica na cauda inferior.

# parâmetros conhecidos (exemplo de z-teste)
mu0 <- 20
sigma <- 4
n <- 50
xbar <- 18

z <- (xbar - mu0) / (sigma / sqrt(n))
z
[1] -3.535534
# valor-p (cauda à esquerda)
pval <- pnorm(z, lower.tail = TRUE)
pval
[1] 0.000203476

Fonte: Exemplo 4 na p. 146 do capítulo 8 - Introdução ao teste de hipóteses e ao z-Test Statistic do livro Statistics in Psychology (2009) de L. J. Stephens, Schaum’s Outline Series, NY: McGraw-Hill.

2.18 APEx 12944: RNBP e etilismo II

Um pesquisador deseja investigar recém-nascidos de baixo peso ao nascer (RNBP) e etilismo na prenhez. A média e o desvio-padrão (g) de recém-nascido de um tipo de rato branco de fêmea não-etilista são, respectivamente, 20 e 4. Cinquenta fêmeas foram emprenhadas num experimento no qual elas receberam doses diárias de álcool. A média dos RNBP dessas fêmeas no experimento é 21 g.

O teste mais adequado para analisar se há o efeito de etilismo no RNBP é:

A. Monocaudal à direita
B. Monocaudal à esquerda

Explicações e justificativas:

Alternativa correta: B.

O teste estatístico é definido pela hipótese científica, e não pelo valor observado da média amostral. O interesse do pesquisador é verificar se o etilismo reduz o peso ao nascer em relação ao valor de referência de fêmeas não-etilistas. Assim, as hipóteses são

\[ H_0:\ \mu = 20 \quad\text{vs}\quad H_1:\ \mu < 20 \]

o que caracteriza um teste monocaudal à esquerda, independentemente de a média observada na amostra ter sido maior que 20 g.

# parâmetros conhecidos (exemplo de z-teste)
mu0 <- 20
sigma <- 4
n <- 50
xbar <- 21

z <- (xbar - mu0) / (sigma / sqrt(n))
z
[1] 1.767767
# valor-p (cauda à esquerda)
pval <- pnorm(z, lower.tail = TRUE)
pval
[1] 0.9614501

O valor-\(z\) é positivo e o valor-\(p\) é elevado, indicando ausência de evidência contra \(H_0\). Ainda assim, o teste apropriado permanece monocaudal à esquerda, pois a direção da hipótese alternativa é definida a priori.

Fonte: Exemplo 4 na p. 146 do capítulo 8 - Introdução ao teste de hipóteses e ao z-Test Statistic do livro Statistics in Psychology (2009) de L. J. Stephens, Schaum’s Outline Series, NY: McGraw-Hill.

2.19 APEx 11541: Estatística de teste

Se o tamanho da amostra aumenta, ceteris paribus, o valor absoluto da estatística de teste:

A. Diminui
B. Aumenta
C. Não muda
D. Tudo pode acontecer

Explicações e justificativas:

Alternativa correta: B.

Mantidos constantes o tamanho do efeito populacional e a variabilidade, o aumento do tamanho da amostra reduz o erro-padrão da estimativa. Como a estatística de teste é a razão entre um efeito estimado e seu erro-padrão, o valor absoluto da estatística de teste aumenta quando o número de unidades experimentais aumenta.

2.20 APEx 12181: Teste z, nifedipina

Suspeita-se de que um medicamento vasodilatador (Nifedipina) para Hipertensão Arterial, amplamente receitado, esteja aumentando a frequência cardíaca dos pacientes.

É sabido que a frequência cardíaca fisiológica tem Distribuição Normal com média 70 batimentos por minuto (bpm) e desvio-padrão 2 bpm.

Para verificar essa suspeita, planejou-se obter uma amostra aleatória de 50 pacientes que recebem Nifedipina para se medir a frequência cardíaca.

A amostra de 50 pacientes forneceu:

72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
74, 67, 69, 71, 71, 73, 71, 71, 70, 71

Tendo sido encontrada média amostral igual a 70.58 bpm, o pesquisador tem evidência a favor do aumento da frequência cardíaca com o uso da nifedipina?

A. Rejeitar a hipótese nula
B. Não rejeitar a hipótese nula
C. Aceitar a hipótese nula
D. Aceitar a hipótese alternativa
E. Rejeitar a hipótese alternativa
F. Não rejeitar a hipótese alternativa
G. Impossível decidir

Explicações e justificativas:

Alternativa correta: G.

O delineamento sugere um teste z unilateral à direita, pois \(\sigma\) populacional é conhecido e a suspeita é de aumento:

\[ H_0:\ \mu = 70 \quad\text{vs}\quad H_1:\ \mu > 70 \]

Com os dados, obtém-se \(z \approx 2.05\) e valor-\(p \approx 0.020\), isto é, evidência contra \(H_0\) sob um critério usual como \(\alpha = 0.05\). No entanto, como o enunciado não especifica o nível de significância \(\alpha\), a regra de decisão (“rejeitar” ou “não rejeitar” \(H_0\)) não está definida a priori. Logo, formalmente, é impossível decidir no sentido de teste de hipótese.

mu <- 70
sigma <- 2
alfa <- 0.05
side <- "greater"

dados <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
           71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
           70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
           67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
           74, 67, 69, 71, 71, 73, 71, 71, 70, 71)

z.test <- BSDA::z.test(x = dados, sigma.x = sigma, mu = mu,
                       alternative = side, conf.level = 1 - alfa)
print(z.test)

    One-sample z-Test

data:  dados
z = 2.0506, p-value = 0.02015
alternative hypothesis: true mean is greater than 70
95 percent confidence interval:
 70.11477       NA
sample estimates:
mean of x 
    70.58 
media <- mean(dados)
d <- (media - mu) / sigma
cat("\nd de Cohen =", d, "(", effectsize::interpret_cohens_d(d), ")\n")

d de Cohen = 0.29 ( small )

2.21 APEx 12183: Teste z, nifedipina

Suspeita-se de que um medicamento vasodilatador (Nifedipina) para Hipertensão Arterial, amplamente receitado, esteja diminuindo a frequência cardíaca dos pacientes.

É sabido que a frequência cardíaca fisiológica tem Distribuição Normal com média 70 batimentos por minuto (bpm) e desvio-padrão 2 bpm.

Para verificar essa suspeita, planejou-se obter uma amostra aleatória de 50 pacientes que recebem Nifedipina para se medir a frequência cardíaca.

A amostra de 50 pacientes forneceu:

72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
74, 67, 69, 71, 71, 73, 71, 71, 70, 71

Tendo sido encontrada média amostral igual a 70.58 bpm, qual é, aproximadamente, o valor-p do teste estatístico apropriado?

A. 0.00822
B. 0.00829
C. 0.02015
D. 0.97985
E. 0.47985
F. Depende do valor de \(\alpha\) escolhido

Explicações e justificativas:

Alternativa correta: D.

A suspeita científica define um teste monocaudal à esquerda, com

\[ H_0:\ \mu = 70 \quad\text{vs}\quad H_1:\ \mu < 70 \]

Como o desvio-padrão populacional é conhecido, aplica-se um teste z. A estatística observada é positiva (\(z \approx 2.05\)), indicando que a média amostral está acima da média sob \(H_0\). Em um teste unilateral à esquerda, isso produz um valor-p próximo de 1:

\[ p \approx 0.98 \]

O valor-\(p\) não depende do nível de significância \(\alpha\); apenas a decisão de rejeitar ou não \(H_0\) depende de \(\alpha\).

mu <- 70
sigma <- 2
side <- "less"

dados <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
           71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
           70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
           67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
           74, 67, 69, 71, 71, 73, 71, 71, 70, 71)

z.test <- BSDA::z.test(x = dados, sigma.x = sigma, mu = mu,
                       alternative = side)
print(z.test)

    One-sample z-Test

data:  dados
z = 2.0506, p-value = 0.9798
alternative hypothesis: true mean is less than 70
95 percent confidence interval:
       NA 71.04523
sample estimates:
mean of x 
    70.58 
media <- mean(dados)
d <- (media - mu) / sigma
cat("\nd de Cohen =", d, "(", effectsize::interpret_cohens_d(d), ")\n")

d de Cohen = 0.29 ( small )

2.22 APEx 12184: Teste z, nifedipina

Suspeita-se de que um medicamento vasodilatador (Nifedipina) para Hipertensão Arterial, amplamente receitado, esteja aumentando a frequência cardíaca dos pacientes.

É sabido que a frequência cardíaca fisiológica tem Distribuição Normal com média 70 batimentos por minuto (bpm) e desvio-padrão 2 bpm.

Para verificar essa suspeita, planejou-se obter uma amostra aleatória de 50 pacientes que recebem Nifedipina para se medir a frequência cardíaca.

A amostra de 50 pacientes forneceu:

72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
74, 67, 69, 71, 71, 73, 71, 71, 70, 71

Tendo sido encontrada média amostral igual a 70.58 bpm, qual é, aproximadamente, o valor-\(p\) do teste estatístico apropriado?

A. 0.00822
B. 0.00829
C. 0.02015
D. 0.97985
E. 0.47985
F. Depende do valor de \(\alpha\) escolhido

Explicações e justificativas:

Alternativa correta: C.

A suspeita define um teste monocaudal à direita, com

\[ H_0:\ \mu = 70 \quad\text{vs}\quad H_1:\ \mu > 70 \]

Como o desvio-padrão populacional é conhecido, aplica-se um teste \(z\):

\[ z = \frac{\bar x - \mu_0}{\sigma/\sqrt{n}} = \frac{70.58 - 70}{2/\sqrt{50}} \approx 2.05 \]

e o valor-p unilateral à direita é

\[ p = P(Z \ge 2.05) \approx 0.020 \]

O valor-\(p\) não depende de \(\alpha\); \(\alpha\) afeta apenas a decisão de rejeitar ou não rejeitar \(H_0\).

mu <- 70
sigma <- 2
side <- "greater"

dados <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74,
           71, 71, 70, 73, 69, 68, 68, 71, 71, 72,
           70, 69, 73, 69, 71, 70, 72, 73, 70, 72,
           67, 72, 67, 68, 69, 72, 70, 70, 70, 71,
           74, 67, 69, 71, 71, 73, 71, 71, 70, 71)

z.test <- BSDA::z.test(x = dados, sigma.x = sigma, mu = mu,
                       alternative = side)
print(z.test)

    One-sample z-Test

data:  dados
z = 2.0506, p-value = 0.02015
alternative hypothesis: true mean is greater than 70
95 percent confidence interval:
 70.11477       NA
sample estimates:
mean of x 
    70.58 
media <- mean(dados)
d <- (media - mu) / sigma
cat("\nd de Cohen =", d, "(", effectsize::interpret_cohens_d(d), ")\n")

d de Cohen = 0.29 ( small )