Bastão de Asclépio & Distribuição Normal
suppressMessages(library(boot, warn.conflicts=FALSE))
suppressMessages(library(bootES, warn.conflicts=FALSE))
suppressMessages(library(car, warn.conflicts = FALSE))
suppressMessages(library(effsize, warn.conflicts=FALSE))
suppressMessages(library(effectsize, warn.conflicts = FALSE))
suppressMessages(library(ggplot2, warn.conflicts = FALSE))
suppressMessages(library(gplots, warn.conflicts = FALSE))
suppressMessages(library(knitr, warn.conflicts=FALSE))
suppressMessages(library(onewaytests, warn.conflicts=FALSE))
suppressMessages(library(psych, warn.conflicts=FALSE))
suppressMessages(library(pwr, warn.conflicts=FALSE))
suppressMessages(library(readxl, warn.conflicts=FALSE))
suppressMessages(library(Rmisc, warn.conflicts=FALSE))
suppressMessages(library(TOSTER, warn.conflicts=FALSE))Código R
Animacao_t_central.RAnimacao_t_nao_central.Rdemo_sodio.Rdemo_sodio_descritiva.Rdemo_sodio_efeito.Rdemo_sodio_eta2.Rdemo_sodio_t.Reiras.bartitle.Reiras.tab.dCohen.Reiras.tab.eta2.RNifedipina.RTestetRelacionadoBilateral_SemDadosBrutos.RTestetRelacionadoUnilateralDireita_SemDadosBrutos.RTestetRelacionadoUnilateralEsquerda_SemDadosBrutos.RTestetWelchBilateral_SemDadosBrutos.RTestetWelchUnilatDir_SemDadosBrutos.RTestetWelchUnilatEsq_SemDadosBrutos.RArquivo de dados
RPubs
O teste t foi inicialmente publicado em 1908 por William Sealy Gosset, sob o pseudônimo de Student. Em seu trabalho, Gosset já incorporava implicitamente a perda de um grau de liberdade associada à estimação da média, embora não utilizasse essa terminologia. Posteriormente, Ronald Fisher sistematizou e difundiu o conceito de graus de liberdade na teoria estatística.
Em R, o teste t para duas amostras independentes é
executado, por default, como teste de Welch
(var.equal = FALSE), no qual os graus de liberdade são
estimados pela aproximação de Satterthwaite. O teste t clássico
de Student, que pressupõe igualdade das variâncias populacionais e
utiliza a variância combinada (pooled variance), pode ser
obtido especificando var.equal = TRUE.
O teste t de Student bilateral do exemplo da ingestão de sódio é computado com:
alfa <- 0.05
Dados <- readRDS("Nutricao.rds")
print(Dados)
fit <- t.test(Sodium~Instructor,
var.equal=TRUE,
conf.level=1-alfa,
data=Dados)
print(fit)
Instructor Student Sodium
1 Brendon Small a 1200
2 Brendon Small b 1400
3 Brendon Small c 1350
4 Brendon Small d 950
5 Brendon Small e 1400
6 Brendon Small f 1150
7 Brendon Small g 1300
8 Brendon Small h 1325
9 Brendon Small i 1425
10 Brendon Small j 1500
11 Brendon Small k 1250
12 Brendon Small l 1150
13 Brendon Small m 950
14 Brendon Small n 1150
15 Brendon Small o 1600
16 Brendon Small p 1300
17 Brendon Small q 1050
18 Brendon Small r 1300
19 Brendon Small s 1700
20 Brendon Small t 1300
21 Coach McGuirk u 1100
22 Coach McGuirk v 1200
23 Coach McGuirk w 1250
24 Coach McGuirk x 1050
25 Coach McGuirk y 1200
26 Coach McGuirk z 1250
27 Coach McGuirk aa 1350
28 Coach McGuirk ab 1350
29 Coach McGuirk ac 1325
30 Coach McGuirk ad 1525
31 Coach McGuirk ae 1225
32 Coach McGuirk af 1125
33 Coach McGuirk ag 1000
34 Coach McGuirk ah 1125
35 Coach McGuirk ai 1400
36 Coach McGuirk aj 1200
37 Coach McGuirk ak 1150
38 Coach McGuirk al 1400
39 Coach McGuirk am 1500
40 Coach McGuirk an 1200
Two Sample t-test
data: Sodium by Instructor
t = 0.76722, df = 38, p-value = 0.4477
alternative hypothesis: true difference in means between group Brendon Small and group Coach McGuirk is not equal to 0
95 percent confidence interval:
-67.59215 150.09215
sample estimates:
mean in group Brendon Small mean in group Coach McGuirk
1287.50 1246.25
É uma distribuição de probabilidades que considera graus de liberdade (\(\nu\), letra grega ni).
A distribuição t central é simétrica e tem mais valores mais concentrados em torno de sua média nula do que a normal padrão (mesocúrtica), i.e., a distribuição t central é leptocúrtica. A comparação gráfica da normal pradrão com a t central está errada em quase todos os textos, exceto em Spanos (1998, p. 119-20, 205-7).
A distribuição t não é uma única curva, mas uma família delas que varia com os graus de liberdade. O número de graus de liberdade não é uma variável discreta (conjunto dos números naturais), mas contínua (conjunto dos números reais positivos).
Podemos pensar na distribuição t como um avanço histórico em relação à distribuição normal padrão - em um teste \(z\), o desvio-padrão populacional é conhecido; no teste t usa-se o desvio-padrão amostral como seu estimador. A incerteza adicional pela falta de conhecimento do desvio-padrão populacional é considerada por meio dos graus de liberdade, alterando a distribuição sobre a qual a estatística do teste funciona.
Os graus de liberdade dependem do tamanho da amostra e do delineamento do estudo; quanto menor o tamanho da amostra, mais pesadas são as suas caudas e, portanto, diferenças numéricas precisam que ser maiores para que consigamos rejeitar a hipótese nula.
|
Experimente
|
R dispõe de uma família de funções básicas para cada tipo de distribuição. Estes pequenos conjuntos são análogos uns aos outros conjuntos, facilitando o aprendizado.
Para a distribuição t, as funções são similares:
dt(x, df, ncp, log = FALSE)pt(q, df, ncp, lower.tail = TRUE, log.p = FALSE)qt(p, df, ncp, lower.tail = TRUE, log.p = FALSE)rt(n, df, ncp)Assim como a distribuição normal, a distribuição t é uma distribuição contínua.
A distribuição t de Student é caracterizada por dois parâmetros:
df, do inglês degrees
of freedom)ncp)No caso do teste t de Student, o número de graus de
liberdade está diretamente relacionado com o tamanho da amostra e o
delineamento do estudo. A distribuição t central tem ncp
= 0. i.e., parâmetro de não centralidade nulo.
À medida que o número de graus de liberdade aumenta, a distribuição t de Student se aproxima da distribuição normal padrão.
gl <- c(1, 2, 5, 10, 30)
x <- seq(-5, 5, length.out = 1000)
densidade <- sapply(
gl,
function(g) stats::dt(x, df = g)
)
matplot(
x, densidade,
type = "l",
lty = 1,
lwd = 2,
xlab = "t",
ylab = "Densidade",
main = "Distribuição t de Student central\nEfeito dos graus de liberdade"
)
lines(
x,
stats::dnorm(x),
lwd = 2,
lty = 2
)
legend(
"topright",
legend = c(paste0("gl = ", gl), "Normal padrão"),
lty = c(rep(1, length(gl)), 2),
lwd = 2,
col = c(seq_along(gl), 1),
bty = "n"
)A distribuição t de Student apresenta caudas mais pesadas do que a distribuição normal. Para comparar apenas a forma das distribuições, podemos escalonar a variável t para que tenha variância igual a 1, assim como a normal padrão.
Se \(T \sim t_\nu\), então, para \(\nu>2\),
\[ \operatorname{Var}(T)=\frac{\nu}{\nu-2} \]
Definindo
\[ T^*=T\sqrt{\frac{\nu-2}{\nu}} \]
temos
\[ \operatorname{Var}(T^*)=1 \]
gl <- c(5, 10, 30)
x <- seq(-4, 4, length.out = 1000)
# Normal padrão
plot(
x,
stats::dnorm(x),
type = "l",
lwd = 3,
lty = 2,
xlab = "t",
ylab = "Densidade",
ylim = c(0, 0.55),
main = "Distribuição t de Student escalonada\nVariância = 1"
)
# Distribuições t escalonadas para variância igual a 1
for (i in seq_along(gl)) {
nu <- gl[i]
escala <- sqrt((nu - 2) / nu)
densidade <- stats::dt(x / escala, df = nu) / escala
lines(
x,
densidade,
lwd = 2,
col = i
)
}
legend(
"topright",
legend = c(paste0("gl = ", gl), "Normal padrão"),
col = c(seq_along(gl), 1),
lty = c(rep(1, length(gl)), 2),
lwd = c(rep(2, length(gl)), 3),
bty = "n"
)Após o escalonamento, todas as distribuições têm média 0 e variância 1. A distribuição t apresenta simultaneamente um pico mais elevado e caudas mais pesadas do que a normal padrão, evidenciando seu caráter leptocúrtico.
Para \(\nu>4\), o excesso de curtose da distribuição t é
\[ \gamma_2=\frac{6}{\nu-4} \]
Portanto, à medida que o número de graus de liberdade aumenta,
\[ \gamma_2 \longrightarrow 0 \]
e a distribuição t se aproxima da distribuição normal padrão.
Quando definimos a hipótese alternativa para detectar determinado
tamanho de efeito populacional, consideramos uma distribuição da
estatística de teste não centrada em zero. É para isto que existe o
parâmetro de não centralidade ncp na família de funções da
distribuição t. Este parâmetro está relacionado com o tamanho
de efeito.
Além da translação da distribuição quando ncp não é
zero, estas distribuições t não centrais são assimétricas. Por
exemplo, para 5 graus de liberdade:
t <- seq(from=-6, to=6, by=0.01)
H0_t <- dt(x=t, df=5, ncp=0)
plot(t, H0_t,
xlab="t", ylab="densidade",
type="l")
H1_t <- dt(x=t, df=5, ncp=2)
lines(t, H1_t, lty=2)Para observar o comportamento das distribuições t,
implementamos Animacao_t_nao_central.R, que compara a
curva observada sob a hipótese nula da animação anterior com diversas
curvas representando as hipóteses alternativas. Observe, sob \(H_1\), a assimetria das distribuições, e as
áreas correspondentes a \(\beta\) e ao
poder do teste (\(1 - \beta\)) a
priori.
Análise estatística inferencial é o processo de estimar características de uma população a partir de uma amostra, por meio do teste de hipótese nula.
Os testes \(t\) para duas condições independentes avaliam se a diferença observada entre duas médias amostrais é suficientemente incompatível com \(H_0:\mu_1-\mu_2=\Delta_0\) para rejeitá-la ao nível de significância adotado. Usualmente, \(\Delta_0=0\).
O teste \(t\) de Student assume homogeneidade das variâncias populacionais, \(\sigma_1^2=\sigma_2^2\), e utiliza a variância combinada
\[s_p^2=\dfrac{(n_1-1)s_1^2+(n_2-1)s_2^2}{n_1+n_2-2}\].
A estatística é
\[ t=\dfrac{(\bar{x}_1-\bar{x}_2)-\Delta_0}{s_p\sqrt{1/n_1+1/n_2}} \]
com \(\text{df}=n_1+n_2-2\).
set.seed(123)
# Dados simulados de MCT (kg)
n_homens <- 40
n_mulheres <- 45
MCT_homens <- stats::rnorm(
n_homens,
mean = 78,
sd = 12
)
MCT_mulheres <- stats::rnorm(
n_mulheres,
mean = 66,
sd = 9
)
Dados <- data.frame(
MCT = c(MCT_homens, MCT_mulheres),
Sexo = factor(
c(
rep("Homens", n_homens),
rep("Mulheres", n_mulheres)
),
levels = c("Homens", "Mulheres")
)
)
# Estatísticas descritivas
print(aggregate(
MCT ~ Sexo,
data = Dados,
FUN = function(x) c(
n = length(x),
media = mean(x),
dp = stats::sd(x)
)
), digits=5) Sexo MCT.n MCT.media MCT.dp
1 Homens 40.0000 78.5422 10.7734
2 Mulheres 45.0000 66.0351 8.2161
# ------------------------------------------------------------
# Teste t de Student
# H0: mu_Homens - mu_Mulheres = 0 kg
# ------------------------------------------------------------
print(stats::t.test(
MCT ~ Sexo,
data = Dados,
mu = 0,
var.equal = TRUE,
alternative = "two.sided"
), digits=5)
Two Sample t-test
data: MCT by Sexo
t = 6.06, df = 83, p-value = 3.9e-08
alternative hypothesis: true difference in means between group Homens and group Mulheres is not equal to 0
95 percent confidence interval:
8.3994 16.6148
sample estimates:
mean in group Homens mean in group Mulheres
78.542 66.035
# ------------------------------------------------------------
# Teste t de Student
# H0: mu_Homens - mu_Mulheres = 10 kg
# ------------------------------------------------------------
print(stats::t.test(
MCT ~ Sexo,
data = Dados,
mu = 10,
var.equal = TRUE,
alternative = "two.sided"
), digits=5)
Two Sample t-test
data: MCT by Sexo
t = 1.21, df = 83, p-value = 0.23
alternative hypothesis: true difference in means between group Homens and group Mulheres is not equal to 10
95 percent confidence interval:
8.3994 16.6148
sample estimates:
mean in group Homens mean in group Mulheres
78.542 66.035
O teste \(t\) de Welch não assume igualdade entre as variâncias populacionais. A estatística é
\[t_W=\dfrac{(\bar{x}_1-\bar{x}_2)-\Delta_0}{\sqrt{s_1^2/n_1+s_2^2/n_2}}\]
Os graus de liberdade são aproximados pelo método de Satterthwaite:
\[ \text{df}_S=\dfrac{(s_1^2/n_1+s_2^2/n_2)^2}{\dfrac{(s_1^2/n_1)^2}{n_1-1}+\dfrac{(s_2^2/n_2)^2}{n_2-1}} \]
set.seed(123)
# Dados simulados de MCT (kg)
n_homens <- 40
n_mulheres <- 45
Dados <- data.frame(
MCT = c(
stats::rnorm(n_homens, mean = 78, sd = 12),
stats::rnorm(n_mulheres, mean = 66, sd = 9)
),
Sexo = factor(
c(
rep("Homens", n_homens),
rep("Mulheres", n_mulheres)
),
levels = c("Homens", "Mulheres")
)
)
# ------------------------------------------------------------
# Teste t de Welch
# H0: delta0 = 0
# H0: mu_Homens - mu_Mulheres = 0
# ------------------------------------------------------------
t_welch_0 <- stats::t.test(
MCT ~ Sexo,
data = Dados,
mu = 0,
var.equal = FALSE,
alternative = "two.sided"
)
print(t_welch_0, digits = 5)
Welch Two Sample t-test
data: MCT by Sexo
t = 5.96, df = 72.6, p-value = 8.3e-08
alternative hypothesis: true difference in means between group Homens and group Mulheres is not equal to 0
95 percent confidence interval:
8.3253 16.6889
sample estimates:
mean in group Homens mean in group Mulheres
78.542 66.035
# ------------------------------------------------------------
# Teste t de Welch
# H0: delta0 = 10
# H0: mu_Homens - mu_Mulheres = 10
# ------------------------------------------------------------
t_welch_10 <- stats::t.test(
MCT ~ Sexo,
data = Dados,
mu = 10,
var.equal = FALSE,
alternative = "two.sided"
)
print(t_welch_10, digits = 5)
Welch Two Sample t-test
data: MCT by Sexo
t = 1.19, df = 72.6, p-value = 0.24
alternative hypothesis: true difference in means between group Homens and group Mulheres is not equal to 10
95 percent confidence interval:
8.3253 16.6889
sample estimates:
mean in group Homens mean in group Mulheres
78.542 66.035
No R, var.equal = FALSE é o padrão.
O teste \(t\) compara uma diferença observada com a variabilidade esperada dessa diferença sob a hipótese nula.
De forma geral,
\[ t=\frac{\text{estimativa}-\text{valor sob }H_0}{\text{SE}_{\text{estimativa}}} \]
Para duas médias independentes, a estimativa é \(\bar{x}_1-\bar{x}_2\). Se \(H_0:\mu_1-\mu_2=\Delta_0\), então
\[ t=\frac{(\bar{x}_1-\bar{x}_2)-\Delta_0}{\text{SE}_{\bar{x}_1-\bar{x}_2}} \]
Como as amostras são independentes, a variância da diferença entre as médias é a soma das variâncias das médias:
\[ \operatorname{Var}(\bar X_1-\bar X_2) = \operatorname{Var}(\bar X_1) + \operatorname{Var}(\bar X_2) \]
No teste de Welch, essa variância é estimada por
\[ \widehat{\operatorname{Var}}(\bar X_1-\bar X_2) = \frac{s_1^2}{n_1} + \frac{s_2^2}{n_2} \]
de modo que
\[ \text{SE}_{\bar{x}_1-\bar{x}_2} = \sqrt{ \frac{s_1^2}{n_1} + \frac{s_2^2}{n_2} } \]
Assim, a estatística de Welch é
\[ t_W= \frac{(\bar{x}_1-\bar{x}_2)-\Delta_0} {\sqrt{s_1^2/n_1+s_2^2/n_2}} \]
Definindo os erros-padrão das médias por \(\text{SE}_1=s_1/\sqrt{n_1}\) e \(\text{SE}_2=s_2/\sqrt{n_2}\), temos \(\text{SE}_{\bar{x}_1-\bar{x}_2}=\sqrt{\text{SE}_1^2+\text{SE}_2^2}\).
Os graus de liberdade são aproximados pela equação de Satterthwaite:
\[ df_S= \frac{(\text{SE}_1^2+\text{SE}_2^2)^2} {\dfrac{\text{SE}_1^4}{n_1-1} + \dfrac{\text{SE}_2^4}{n_2-1}} \]
Como \(\text{SE}_{\bar{x}_1-\bar{x}_2}^2=\text{SE}_1^2+\text{SE}_2^2\), essa expressão também pode ser escrita como
\[ df_S= \frac{\text{SE}_{\bar{x}_1-\bar{x}_2}^{\,4}} {\dfrac{\text{SE}_1^4}{n_1-1} + \dfrac{\text{SE}_2^4}{n_2-1}} \]
Portanto, \(t_W\) expressa quantos erros-padrão a diferença observada entre as médias se afasta de \(\Delta_0\), enquanto \(\text{df}_S\) ajusta a distribuição de referência para a incerteza associada às duas variâncias estimadas separadamente. Quanto maior \(|t_W|\), maior a incompatibilidade dos dados com a hipótese nula.
O teste de Student combina as variâncias dos grupos e pressupõe homocedasticidade. O teste de Welch mantém as variâncias separadas e é mais robusto à heterogeneidade de variâncias, especialmente quando os tamanhos amostrais também diferem.
O valor p quantifica o grau de incompatibilidade dos dados com \(H_0\). Se \(p<\alpha\), rejeita-se \(H_0\) ao nível de significância adotado.
O intervalo de confiança para \(\mu_1-\mu_2\) complementa o teste e informa a precisão da estimativa. Em um teste bilateral de 5%, se o intervalo de 95% não contém zero, rejeita-se \(H_0\).
A magnitude da diferença deve ser avaliada separadamente por uma medida de tamanho de efeito.
“A quantidade diária de sódio disponível para consumo nos domicílios brasileiros foi de 4,7 g para ingestão diária de 2.000 kcal, mantendo-se mais de duas vezes superior ao limite recomendado de ingestão desse nutriente.” (Sarno et al., 2013)
Quando temos duas condições independentes (como no exemplo das estaturas de mulheres e homens), i.e., delineamento entre participantes, com amostras provenientes de uma população cujos desvios-padrão são desconhecidos, podemos utilizar o teste t para testar a igualdade das médias populacionais.
Por exemplo,
https://www.fns.usda.gov/snap/supplemental-nutrition-assistance-program-education-snap-ed
O SNAP-Ed (Supplemental Nutrition Assistance Program Education) é um programa baseado em evidências que ajuda as pessoas a terem uma vida mais saudável.
O SNAP-Ed ensina às pessoas que usam ou qualificam para o SNAP uma boa nutrição e como fazer com que o seu dinheiro de alimentação se estenda ainda mais.
Os participantes do SNAP-Ed também aprendem a ser fisicamente ativos.
Brendon e McGuirk fazem com que seus alunos do SNAP-Ed mantenham diários do que comem por uma semana e depois calculem a ingestão diária de sódio em miligramas.
Desde que as classes receberam diferentes programas de educação nutricional, eles querem ver se a ingestão média de sódio é a mesma para as duas turmas.
\[ \begin{cases} H_0: \mu_{\text{Brendon}} = \mu_{\text{McGuirk}} \\ H_1: \mu_{\text{Brendon}} \ne \mu_{\text{McGuirk}} \end{cases} \\ \alpha=0.05 \]
O subscrito na média populacional \(\mu\) das hipóteses nula e alternativa podem não ser os mais felizes. Note que, com o teste, nosso objetivo final é a inferência: não é avaliar a turma de Brendon em comparação à do McGuirk que interessa aqui, mas se populacionalmente os efeitos dos programas adotados por Brendon e pelo McGuirk são iguais ou não, tendo por base o que acontecer em suas respectivas turmas de estudantes.
Utilizaremos os dados disponíveis na planilha Nutricao.xlsx, na aba
independente.
Dados <- data.frame(readxl::read_excel("Nutricao.xlsx", sheet="independente"))
Dados$Student <- factor(Dados$Student)
Dados$Instructor <- factor(Dados$Instructor)
print(Dados) Instructor Student Sodium
1 Brendon Small a 1200
2 Brendon Small b 1400
3 Brendon Small c 1350
4 Brendon Small d 950
5 Brendon Small e 1400
6 Brendon Small f 1150
7 Brendon Small g 1300
8 Brendon Small h 1325
9 Brendon Small i 1425
10 Brendon Small j 1500
11 Brendon Small k 1250
12 Brendon Small l 1150
13 Brendon Small m 950
14 Brendon Small n 1150
15 Brendon Small o 1600
16 Brendon Small p 1300
17 Brendon Small q 1050
18 Brendon Small r 1300
19 Brendon Small s 1700
20 Brendon Small t 1300
21 Coach McGuirk u 1100
22 Coach McGuirk v 1200
23 Coach McGuirk w 1250
24 Coach McGuirk x 1050
25 Coach McGuirk y 1200
26 Coach McGuirk z 1250
27 Coach McGuirk aa 1350
28 Coach McGuirk ab 1350
29 Coach McGuirk ac 1325
30 Coach McGuirk ad 1525
31 Coach McGuirk ae 1225
32 Coach McGuirk af 1125
33 Coach McGuirk ag 1000
34 Coach McGuirk ah 1125
35 Coach McGuirk ai 1400
36 Coach McGuirk aj 1200
37 Coach McGuirk ak 1150
38 Coach McGuirk al 1400
39 Coach McGuirk am 1500
40 Coach McGuirk an 1200
Instructor Sodium
Brendon Small:20 Min. : 950
Coach McGuirk:20 1st Qu.:1150
Median :1250
Mean :1267
3rd Qu.:1362
Max. :1700
Começamos com a estatística descritiva (demo_sodio_descritiva.R):
item group1 vars n mean sd median trimmed mad min max
Sodium1 1 Brendon Small 1 20 1287.5 193.7 1300.0 1284.4 166.8 950 1700
Sodium2 2 Coach McGuirk 1 20 1246.2 142.4 1212.5 1240.6 148.3 1000 1525
range skew kurtosis se
Sodium1 750 0.1 -0.5 43.3
Sodium2 525 0.3 -0.8 31.8
Instructor Sodium.upper Sodium.mean Sodium.lower
1 Brendon Small 1393 1288 1182
2 Coach McGuirk 1324 1246 1169
Observando se não há valores discrepantes, indicando possíveis erros na entrada de dados.
A significância estatística avalia, com base na evidência amostral, se os dados são suficientemente incompatíveis com a hipótese nula para justificar sua rejeição ao nível de significância adotado. O valor p quantifica o grau dessa incompatibilidade, enquanto o nível de significância \(\alpha\) define o limiar para a decisão estatística.
O teste t a ser aplicado é de Satterthwaite (apesar do R exibir como teste de Welch), conforme Satterthwaite (1946), Welch (1947) e Manuais do STATA.
Operacionalização do teste t de Welch com a função
t.test (demo_sodio_t.R):
Welch Two Sample t-test
data: Sodium by Instructor
t = 0.767, df = 34.9, p-value = 0.45
alternative hypothesis: true difference in means between group Brendon Small and group Coach McGuirk is not equal to 0
95 percent confidence interval:
-67.911 150.411
sample estimates:
mean in group Brendon Small mean in group Coach McGuirk
1287.5 1246.2
Não rejeitamos \(H_0\): não há elementos para afirmar que há diferença de resultado, quanto à ingestão de sódio, quando comparamos os dois grupos submetidos a diferentes programas educacionais.
Uma das premissas para a aplicação do teste t de Student,
discutido adiante, é a homocedasticidade (a variância populacional da
variável dependente deve ser igual nos dois grupos estudados). O teste
t de Welch (ou Satterthwaite) é um método mais robusto que o
teste t de Student tradicional: a modificação proposta por
Satterthwaite e Welch prescinde da homocedasticidade, corrigindo os
graus de liberdade (df).
Uma forma heurística para sabermos se há indícios de heterocedasticidade é comparar os desvios-padrão: se a razão do maior e menor desvios-padrão é maior que 2, é indício de heterocedasticidade.
Uma forma mais rigorosa é testar homocedasticidade estatisticamente, por exemplo com:
Fligner-Killeen test of homogeneity of variances
data: Sodium by Instructor
Fligner-Killeen:med chi-squared = 0.682, df = 1, p-value = 0.41
Este teste não rejeita a hipótese nula de homocedasticidade para qualquer nível de significância razoável.
Uma forma mais rigorosa é testar normalidade para cada condição independente estatisticamente, por exemplo com:
Shapiro-Wilk normality test
data: Dados[Dados$Instructor == "Brendon Small", "Sodium"]
W = 0.972, p-value = 0.8
Shapiro-Wilk normality test
data: Dados[Dados$Instructor == "Coach McGuirk", "Sodium"]
W = 0.968, p-value = 0.71
Este teste não rejeita a hipótese nula de normalidade para cada grupo para qualquer nível de significância razoável.
Utilizaremos o teste t de Welch neste caso, mesmo sendo
possível o uso do teste t de Student por meio do parâmetro
var.equal = TRUE da função t.test.
No caso de duas condições independentes, \(A\) e \(B\), o número de graus de liberdade é dados por \(\text{df}_{\text{max}} = n_A + n_B - 2=38\). A saída relata 34.893 graus de liberdade. No teste t de Welch, quanto maior for a heterocedasticidade, menor será o número de graus de liberdade. Esta correção leva em conta a heterocedasticidade amostral, numérica, incorporando um ajuste gradual que traz uma vantagem sobre o teste t de Student. Além disto, como a correção é sempre feita, prescinde da necessidade do teste de homocedasticidade.
Como foi visto, menor número de graus de liberdade equivale a caudas mais pesadas para a distribuição t e, portanto, mais incerteza é levada em conta para a decisão estatística quanto maior for a heterocedasticidade entre os grupos amostrados das duas condições experimentais, compensando o quanto a falta de homocedasticidade “atrapalha” o teste t.
Outra observação interessante sobre a correção de Welch é sobre seus valores extremos. O limite superior é \(\text{df}_{\text{max}} = n_A + n_B - 2\). Temos, neste exemplo, dois grupos de 20 estudantes e \(\text{df}_{\text{max}} = 38\). Também sabemos que na situação do teste t relacionado, os graus de liberdade são dados por \(\text{df}=n-1\). Este é o limite inferior dos graus de liberdade, como se fossem os mesmos indivíduos submetidos a ambas as condições: \(\text{df}_{\text{min}} = \text{min}(n_A, n_B) - 1\) que, neste exemplo é \(\text{df}_{\text{min}} = 19\), valor que seria alcançado se houvesse heterocedasticidade extrema.
|
O número de graus de liberdade é a quantidade necessária de unidades experimentais para que o estimador da variância do estimador do efeito do teste (diferença padronizada das médias amostrais) usando todas as medidas independentes da amostra seja não-viesado.
Quando ouvimos sobre o tamanho da amostra, habitualmente estão se referindo ao tamanho nominal da amostra. O número de graus de liberdade constitui o tamanho efetivo da amostra.
|
A significância prática avalia a magnitude e a relevância do efeito populacional. O tamanho de efeito quantifica essa magnitude, por meio de medidas como \(d\) de Cohen, \(\eta^2\) e \(r\), enquanto seu intervalo de confiança expressa a precisão com que o efeito populacional foi estimado a partir da amostra.
Quando duas condições independentes são comparadas, o tamanho de efeito procura quantificar a magnitude da diferença entre suas médias em uma escala padronizada. Se não se assume igualdade entre as variâncias populacionais, como no teste \(t\) de Welch, é conveniente evitar a padronização pelo desvio-padrão combinado.
Uma escolha coerente é \(d_{\text{av}}=(\bar{x}_1-\bar{x}_2)/s_{\text{av}}\), em que \(s_{\text{av}}=\sqrt{(s_1^2+s_2^2)/2}\). O parâmetro populacional correspondente é \(\delta_{\text{av}}=(\mu_1-\mu_2)/\sqrt{(\sigma_1^2+\sigma_2^2)/2}\).
Assim, \(d_{\text{av}}\) expressa a diferença entre as médias observadas em unidades de uma medida comum de dispersão, sem pressupor uma variância populacional única para os dois grupos.
O teste de Welch utiliza \(t_W=(\bar{x}_1-\bar{x}_2)/\sqrt{s_1^2/n_1+s_2^2/n_2}\), com graus de liberdade aproximados pelo método de Welch-Satterthwaite.
Como o numerador de \(t_W\) e de \(d_{\text{av}}\) é a mesma diferença entre médias, as duas estatísticas estão relacionadas por \(d_{\text{av}}=t_W\sqrt{s_1^2/n_1+s_2^2/n_2}/s_{\text{av}}\).
Diferentemente do teste de uma condição, não existe uma transformação entre \(t_W\) e \(d_{\text{av}}\) que dependa apenas do tamanho amostral. A relação depende também das variâncias dos dois grupos.
O teste \(t\) avalia a evidência amostral sobre uma diferença entre as médias populacionais, enquanto \(d_{\text{av}}\) quantifica a magnitude dessa diferença em uma escala padronizada.
O valor \(d_{\text{av}}\) é uma estimativa amostral de \(\delta_{\text{av}}\). Como médias e variâncias variam entre amostras, diferentes amostras produzem diferentes valores de \(d_{\text{av}}\).
Por isso, a estimativa pontual deve ser acompanhada de um intervalo de confiança, que representa a precisão com que a magnitude do efeito populacional foi estimada.
Uma abordagem analítica para o intervalo de confiança utiliza a distribuição \(t\) não central. O princípio consiste em inverter a distribuição da estatística \(t_W\) para determinar valores plausíveis do parâmetro de não centralidade e, posteriormente, convertê-los para a escala do efeito padronizado.
No teste de Welch, essa conversão depende dos tamanhos amostrais e das variâncias dos dois grupos. Portanto, não existe a transformação simples \(\lambda/\sqrt{n}\) observada no teste de uma condição.
O método da \(t\) não central é particularmente adequado porque parte diretamente da distribuição amostral da estatística de teste e fornece uma estimativa intervalar do efeito padronizado.
A reamostragem fornece uma abordagem complementar para avaliar a precisão de \(d_{\text{av}}\). Os indivíduos são reamostrados com reposição separadamente dentro de cada grupo e, em cada reamostra, calculam-se novamente as médias, as variâncias e \(d_{\text{av}}\).
Assim, em cada amostra bootstrap calcula-se \(d_{\text{av}}^*=(\bar{x}_1^*-\bar{x}_2^*)/\sqrt{[(s_1^*)^2+(s_2^*)^2]/2}\), produzindo uma distribuição empírica do tamanho de efeito.
Essa distribuição pode ser utilizada para construir intervalos de confiança, como o intervalo BCa. É importante que o método analítico e o bootstrap estimem a mesma quantidade. Se a análise principal utiliza \(d_{\text{av}}\), a reamostragem também deve recalcular \(d_{\text{av}}\) em cada amostra.
A proximidade entre o intervalo obtido pela \(t\) não central e o intervalo bootstrap BCa constitui uma análise de sensibilidade útil. Resultados semelhantes indicam que a conclusão sobre a magnitude do efeito é relativamente estável em relação ao método utilizado para construir o intervalo.
A reamostragem não demonstra matematicamente a validade do método analítico. Ela fornece uma verificação empírica complementar baseada na estrutura observada dos dados.
A estatística de Welch pode ser transformada para uma escala de proporção por \(\eta^2_{\text{equiv}}=t_W^2/(t_W^2+\text{df}_W)\), em que \(\text{df}_W\) são os graus de liberdade de Welch-Satterthwaite.
Essa quantidade varia entre 0 e 1 e representa a magnitude associada ao teste em uma escala semelhante à de \(\eta^2\).
Entretanto, no contexto de Welch, ela não deve ser interpretada como o \(\eta^2\) convencional obtido pela decomposição das somas de quadrados de uma ANOVA homocedástica. Trata-se de uma transformação equivalente da estatística \(t_W\) para uma escala de proporção.
Assim, \(d_{\text{av}}\) e \(\eta^2_{\text{equiv}}\) descrevem o mesmo contraste entre médias em escalas diferentes, mas não existe entre eles uma relação simples que dependa apenas do tamanho amostral.
A estatística de Welch também pode ser transformada para uma escala correlacional por \(|r|_{\text{equiv}}=|t_W|/\sqrt{t_W^2+\text{df}}\).
Como \(\eta^2_{\text{equiv}}=t_W^2/(t_W^2+\text{df}_W)\), segue diretamente que \(|r|_{\text{equiv}}=\sqrt{\eta^2_{\text{equiv}}}\).
Neste caso interessa apenas a magnitude da associação equivalente, razão pela qual se utiliza o valor absoluto de \(r\).
Essa quantidade não deve ser confundida com a correlação de Pearson ponto-bisserial convencional entre grupo e resposta. No teste de Welch, ela deve ser interpretada como uma transformação da estatística de teste para uma escala correlacional.
O mesmo contraste entre duas condições independentes pode ser representado em diferentes escalas. O \(d_{\text{av}}\) expressa a diferença entre médias em unidades de dispersão; \(\eta^2_{\text{equiv}}\) expressa a magnitude associada ao teste em uma escala de proporção; e \(|r|_{\text{equiv}}=\sqrt{\eta^2_{\text{equiv}}}\) expressa essa magnitude em uma escala correlacional.
Essas medidas não representam evidências independentes. São diferentes formas de expressar a magnitude associada ao mesmo contraste entre as duas condições.
Como outras diferenças padronizadas, \(d_{\text{av}}\) pode apresentar pequeno viés em amostras finitas. Uma correção pode ser obtida aplicando um fator de Hedges, produzindo uma versão corrigida geralmente denotada por \(g_{\text{av}}\).
Essa correção é mais relevante em amostras pequenas e tende a desaparecer à medida que os graus de liberdade aumentam.
No teste \(t\) de Welch, as médias de duas condições independentes são comparadas sem pressupor igualdade de variâncias. Por coerência, a magnitude da diferença pode ser quantificada por \(d_{\text{av}}=(\bar{x}_1-\bar{x}_2)/\sqrt{(s_1^2+s_2^2)/2}\).
O intervalo baseado na distribuição \(t\) não central fornece uma abordagem analítica para representar a incerteza de \(\delta_{\text{av}}\), enquanto o bootstrap BCa, recalculando o mesmo \(d_{\text{av}}\) em cada reamostra, fornece uma análise de sensibilidade complementar.
A estatística \(t_W\) também pode ser transformada nas escalas \(\eta^2_{\text{equiv}}=t_W^2/(t_W^2+\text{df}_W)\) e \(|r|_{\text{equiv}}=\sqrt{\eta^2_{\text{equiv}}}\). Essas medidas representam diferentes escalas para a magnitude associada ao mesmo contraste, mas não devem ser confundidas com o \(\eta^2\) convencional da ANOVA homocedástica nem com a correlação de Pearson ponto-bisserial usual.
Calculamos d de Cohen (tamanho de efeito) (demo_sodio_efeito.R):
alfa <- 0.05
Dados <- readRDS("Nutricao.rds")
dC <- effectsize::cohens_d(
Sodium ~ Instructor,
data = Dados,
pooled_sd = FALSE,
ci = 1 - alfa,
alternative = "two.sided"
)
print(dC, digits=4)Cohen's d | 95% CI
-----------------------------
0.2426 | [-0.3815, 0.8633]
- Estimated using un-pooled SD.
es <- effectsize::interpret_cohens_d(d=dC$Cohens_d,
rules="cohen1988")
names(es) <- c("Tamanho de efeito: estimativa pontual")
print(es)Tamanho de efeito: estimativa pontual
"small"
(Rules: cohen1988)
# Bootstrap BCa
d_av_boot <- function(dados, indices) {
db <- dados[indices, ]
x1 <- db$Sodium[
db$Instructor == "Brendon Small"
]
x2 <- db$Sodium[
db$Instructor == "Coach McGuirk"
]
s_av <- sqrt(
(stats::var(x1) + stats::var(x2)) / 2
)
(mean(x1) - mean(x2)) / s_av
}
set.seed(123)
B <- 1e5
dCb <- boot::boot(
data = Dados,
statistic = d_av_boot,
R = B,
strata = Dados$Instructor
)
print(dCb, digits=4)
STRATIFIED BOOTSTRAP
Call:
boot::boot(data = Dados, statistic = d_av_boot, R = B, strata = Dados$Instructor)
Bootstrap Statistics :
original bias std. error
t1* 0.2426 0.0126 0.3279
BOOTSTRAP CONFIDENCE INTERVAL CALCULATIONS
Based on 100000 bootstrap replicates
CALL :
boot::boot.ci(boot.out = dCb, conf = 1 - alfa, type = "bca")
Intervals :
Level BCa
95% (-0.4116, 0.8816 )
Calculations and Intervals on Original Scale
es <- effectsize::interpret_cohens_d(
d = dCb$t0,
rules = "cohen1988"
)
names(es) <- "Tamanho de efeito: estimativa pontual"
print(es)Tamanho de efeito: estimativa pontual
"small"
(Rules: cohen1988)
# ------------------------------------------------------------
# Teste t de Welch
# ------------------------------------------------------------
t_out <- stats::t.test(
Sodium ~ Instructor,
data = Dados,
var.equal = FALSE,
conf.level = 1 - alfa,
alternative = "two.sided"
)
print(t_out, digits = 5)
Welch Two Sample t-test
data: Sodium by Instructor
t = 0.767, df = 34.9, p-value = 0.45
alternative hypothesis: true difference in means between group Brendon Small and group Coach McGuirk is not equal to 0
95 percent confidence interval:
-67.911 150.411
sample estimates:
mean in group Brendon Small mean in group Coach McGuirk
1287.5 1246.2
# ------------------------------------------------------------
# Eta^2 equivalente e |r| equivalente
# ------------------------------------------------------------
t <- as.numeric(t_out$statistic)
df <- as.numeric(t_out$parameter)
F <- t^2
eta2_equiv <- F / (F + df)
r_abs <- sqrt(eta2_equiv)
cat(
"\nEta^2 equivalente = ",
round(eta2_equiv, 4),
"\n",
sep = ""
)
Eta^2 equivalente = 0.0166
|r| equivalente = 0.1288
A média de ingestão de sódio foi maior no grupo Brendon Small (\(1287.5\)) do que no grupo Coach McGuirk (\(1246.2\)), correspondendo a uma diferença amostral de \(41.3\) unidades. Entretanto, o teste \(t\) de Welch não apresentou evidência estatística de diferença entre as médias populacionais, \(t(34.9)=0.767\), \(p=0.45\). O intervalo de confiança de 95% para a diferença entre as médias, \([-67.9,;150.4]\), inclui zero e mostra considerável incerteza quanto à magnitude e à direção da diferença populacional.
A diferença padronizada, calculada sem pressupor igualdade das variâncias, foi \(d_{av}=0.243\). Pela classificação de Cohen, a estimativa pontual corresponde a um efeito pequeno. O intervalo de confiança analítico de 95%, obtido pelo método da \(t\) não central, foi \([-0.382,;0.863]\). Portanto, apesar da estimativa pontual pequena e positiva, os dados são compatíveis com uma ampla faixa de efeitos populacionais, incluindo efeito nulo, efeito em direção oposta e efeito positivo de magnitude consideravelmente maior.
A reamostragem BCa produziu \(d_{av}=0.243\) e \(IC_{95\%}=[-0.412,;0.882]\). Esse intervalo é muito semelhante ao intervalo analítico pela \(t\) não central, indicando boa concordância entre os dois métodos de estimação intervalar. O bootstrap, portanto, fornece uma análise de sensibilidade favorável à estabilidade do procedimento analítico, embora ambos revelem baixa precisão na estimação da magnitude do efeito.
A estatística de Welch também pode ser expressa em outras escalas de tamanho de efeito. Obteve-se \(\eta^2_{\text{equiv}}=0.0166\). Em uma interpretação análoga à do \(\eta^2\) da ANOVA, isso corresponde a aproximadamente \(1.66%\) da variância da variável dependente, ingestão de sódio, explicada pela variável independente instrutor. Como esse valor é derivado da estatística de Welch, deve ser entendido como uma aproximação equivalente de proporção de variância explicada, e não como o \(\eta^2\) clássico obtido diretamente pela decomposição das somas de quadrados.
A correlação equivalente absoluta foi \(|r|_{\text{equiv}}=0.1288\), também indicando efeito de pequena magnitude na escala correlacional. Como \(|r|_{\text{equiv}}=\sqrt{\eta^2_{\text{equiv}}}\), essas duas medidas são apenas representações distintas da magnitude associada ao mesmo efeito do instrutor sobre a ingestão de sódio.
Em síntese, a diferença observada entre as condições é pequena, \(d_{av}=0.243\), e não foi estatisticamente significante. O instrutor explica, na escala equivalente de \(\eta^2\), aproximadamente \(1.66%\) da variabilidade da ingestão de sódio. Entretanto, os intervalos de confiança para \(d_{av}\) são amplos e incluem zero; portanto, a magnitude e a direção do efeito populacional ainda são estimadas com baixa precisão.
Eta ao quadrado de Cohen (notado como eta^2 ou \(\eta^2\)) é uma medida de tamanho de
efeito.
Uma medida de tamanho de efeito tem as seguintes características:
Existem equivalências do \(\eta^2\) com outras medidas de tamanho de efeito:
Este exercício direto só pode ser feito com dois instrutores. Não
podemos computar a correlação diretamente com três ou mais instrutores.
Para calcular a correlação implicada pelo GLM entre uma VI nominal e uma
VD intervalar quando a função cor não pode ser utilizada,
basta computar \(\sqrt{\eta^2}=\eta\).
\(\eta\) é correlação de Pearson absoluta implicada pelo GML.
Portanto, \(\eta^2\) é uma forma mais geral para medirmos o tamanho de efeito.
O valor de \(\eta^2\) é a proporção
da variância da VD (Sodium) explicada pela VI
(Instructor).
Neste caso existe apenas uma VI e, portanto, o tamanho de efeito global é também o atribuído à única VI existente. Veremos em capítulos adiante \(\eta^2\) global para o modelo e \(\eta^2\) parciais para os efeitos das VI.
Elis, 2010
A estimação pontual e por intervalo de confiança de \(\eta^2\) está implementada em demo_sodio_eta2.R:
alfa <- 0.05
Dados <- readRDS("Nutricao.rds")
fit <- oneway.test(data=Dados,
Sodium~Instructor)
print(fit, digits=5)
One-way analysis of means (not assuming equal variances)
data: Sodium and Instructor
F = 0.589, num df = 1.0, denom df = 34.9, p-value = 0.45
eta2 <- effectsize::eta_squared(fit,
ci = 1 - alfa,
var.equal = FALSE,
alternative = "two.sided",
verbose=TRUE)For one-way between subjects designs, partial eta squared is equivalent
to eta squared. Returning eta squared.
`var.equal = FALSE` - effect size is an approximation.
# Effect Size for ANOVA
Eta2 | 95% CI
-------------------------
0.0166 | [0.0000, 0.1755]
es <- effectsize::interpret_eta_squared(eta2$Eta2, rules = "cohen1992")
names(es) <- c("Tamanho de efeito: estimativa pontual")
print(es)Tamanho de efeito: estimativa pontual
"very small"
(Rules: cohen1992)
|r| equivalente = 0.1288
A ANOVA de Welch não apresentou evidência estatística de diferença entre as médias das condições, \(F(1,34.9)=0.589\), \(p=0.45\). Portanto, ao nível de significância de 5%, os dados não são suficientemente incompatíveis com a hipótese nula de igualdade das médias.
A magnitude do efeito foi pequena: \(\eta^2_{\text{equiv}}=0.0166\). Esse valor corresponde a uma transformação da estatística de Welch para uma escala semelhante à de proporção de variância e foi classificado como muito pequeno segundo o critério adotado.
O intervalo de confiança bilateral de 95% foi \([0.0000,;0.1755]\). Embora a estimativa pontual seja muito pequena, o intervalo é amplo e mostra incerteza considerável sobre a magnitude do efeito populacional. Os dados são compatíveis tanto com um efeito praticamente nulo quanto com um efeito de magnitude maior.
A correlação equivalente absoluta é \(|r|_{\text{equiv}}=\sqrt{\eta^2_{\text{equiv}}}\approx0.129\), também indicando efeito de pequena magnitude na escala correlacional.
Assim, a ausência de significância estatística deve ser interpretada juntamente com a estimativa do tamanho de efeito e seu intervalo de confiança: o efeito observado é pequeno, mas sua magnitude populacional ainda é estimada com baixa precisão.
Aplica-se tipicamente às situações em que o mesmo indivíduo (ou a mesma unidade experimental) tem uma variável de desfecho intervalar medida em dois momentos ou em duas condições experimentais dependentes. As duas medidas feitas em um mesmo indivíduo não podem ser consideradas independentes: ao contrário, estão relacionadas entre si por tudo que for idiossincrático.
Retomamos o exemplo anterior, no qual Brendon e McGuirk fazem com que seus alunos do SNAP-Ed mantenham diários do que comem por uma semana e depois calculem a ingestão diária de sódio em miligramas. No entanto, vamos imaginar que os mesmos estudantes passaram pelos dois programas, e portanto pretendemos verificar se a ingestão média de sódio foi a mesma para estes indivíduos nas duas situações.
Quando podemos submeter um grupo de indivíduos a duas situações e obtemos as mesmas medidas, podemos decidir com base na diferença entre as medidas de cada indivíduo, para sabermos se o efeito obtido é ou não similar (um teste bilateral). O mesmo raciocínio é aplicável a quaisquer duas condições: reações a drogas, sucessos em tratamentos, reações a influências ambientais ou respostas a estímulos.
|
O teste t relacionado também costuma ser chamado de teste t pareado. O problema de denominá-lo de pareado é a confusão conceitual entre o cálculo estatístico, que é o mesmo, e o delineamento dos estudos, que é diverso. Um desenho de estudo pareado não usa os mesmos indivíduos “antes e depois” nem “sob condição A e condição B”, mas indivíduos diferentes. No entanto, não são indivíduos quaisquer, mas pares de indivíduos o mais similares possíveis em todas as variáveis outras, que não a que nos interessa estudar, das quais sabemos ter influência em nossa medida. Por exemplo, para ver o efeito do tratamento em pares de hipertensos, podemos utilizar pares de indivíduos com o mesmo IMC, idade, sexo, nível de colesterol, hábitos de dieta etc. |
Desde que cada participante foi submetido aos dois programas de educação nutricional, as hipóteses são:
\[ \begin{cases} H_0: \mu_{\text{McGuirk}} - \mu_{\text{Brendon}} = 0 \\ H_1: \mu_{\text{McGuirk}} - \mu_{\text{Brendon}} \ne 0 \end{cases} \\ \alpha=0.05 \]
Utilizaremos os mesmos dados numéricos de antes, mas rearranjados
como medidas de um mesmo participante nas duas condições, disponíveis na
mesma planilha Nutricao.xlsx, na aba
dependente. Os dados podem ser lidos e exibidos assim:
Dtfrm <- data.frame(readxl::read_excel("Nutricao.xlsx", sheet="dependente"))
Dtfrm$Student <- factor(Dtfrm$Student)
print(Dtfrm) Student Brendon.Small Coach.McGuirk dif
1 a 1200 1100 -100
2 b 1400 1200 -200
3 c 1350 1250 -100
4 d 950 1050 100
5 e 1400 1200 -200
6 f 1150 1250 100
7 g 1300 1350 50
8 h 1325 1350 25
9 i 1425 1325 -100
10 j 1500 1525 25
11 k 1250 1225 -25
12 l 1150 1125 -25
13 m 950 1000 50
14 n 1150 1125 -25
15 o 1600 1400 -200
16 p 1300 1200 -100
17 q 1050 1150 100
18 r 1300 1400 100
19 s 1700 1500 -200
20 t 1300 1200 -100
A planilha Nutricao.xlsx tem duas abas. Os dados no formato
adequado para o teste t relacionado está na aba “dependente”.
Observe como usamos a função read_excel para ler a aba
correta (por default esta função lê a primeira aba da
planilha).
|
Os códigos R são fundamentalmente os mesmos, com a importante
diferença de que usaremos principalmente a coluna dif para
a tomada de decisões.
Diferentemente da seção anterior, fornecemos aqui o código demo_sodio.R, o
qual faz todos os passos sequencialmente: estatística descritiva,
significância estatística e significância prática. A saída é longa, e
deve ser vista passo-a-passo:
----------------------
Estatistica descritiva
----------------------
Brendon.Small Coach.McGuirk dif
Min. : 950 Min. :1000 Min. :-200
1st Qu.:1150 1st Qu.:1144 1st Qu.:-100
Median :1300 Median :1212 Median : -25
Mean :1288 Mean :1246 Mean : -41
3rd Qu.:1400 3rd Qu.:1350 3rd Qu.: 50
Max. :1700 Max. :1525 Max. : 100
------------------------------------
Analise de significancia estatistica
------------------------------------
Tamanho da amostra
n = 20 pares
One Sample t-test
data: dif
t = -1.7, df = 19, p-value = 0.11
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
-92.0773 9.5773
sample estimates:
mean of x
-41.25
--------------------------------
Analise de significancia pratica
--------------------------------
Eta^2 = 0.1318 (medium)
IC bootstrap de 95% para Eta^2:
BCa: [0.0007, 0.4285]
A primeira parte da saída é a análise descritiva. Na parte textual e
nos gráficos verificamos que não há valores estranhos ou discrepantes.
Em seguida, aparece o teste t relacionado usando a função
t.test e o gráfico correspondente. Aqui o teste t
é feito com a diferença entre as medidas, e a conclusão é pela não
rejeição da hipótese nula. Finalmente, fazemos a análise da
significância prática.
|
No caso de duas condições dependentes, o número de graus de liberdade é dado por \(\text{df}_{\text{max}} = n - 1\), igual a \(19\) neste exemplo. Para analisar o tamanho de efeito, o \(d\) de Cohen não é calculado aqui. A medida preferível é \(\eta^2\). |
Suponha que tivéssemos conhecimento prévio de que o programa do instrutor McGuirk é mais bem sucedido (i.e., reduz mais a ingestão de sódio) que o do instrutor Brendon, e quiséssemos testar esta hipótese. O teste passa a ser unilateral. As hipóteses serão:
\[ \begin{cases} H_0: \mu_{\text{McGuirk}} - \mu_{\text{Brendon}} = 0 \\ H_1: \mu_{\text{McGuirk}} - \mu_{\text{Brendon}} < 0 \end{cases}\\ \alpha=0.05 \]
O mesmo código está adaptado para esta situação, mudando o parâmetro
alternative:
----------------------
Estatistica descritiva
----------------------
Brendon.Small Coach.McGuirk dif
Min. : 950 Min. :1000 Min. :-200
1st Qu.:1150 1st Qu.:1144 1st Qu.:-100
Median :1300 Median :1212 Median : -25
Mean :1288 Mean :1246 Mean : -41
3rd Qu.:1400 3rd Qu.:1350 3rd Qu.: 50
Max. :1700 Max. :1525 Max. : 100
------------------------------------
Analise de significancia estatistica
------------------------------------
Tamanho da amostra
n = 20 pares
One Sample t-test
data: dif
t = -1.7, df = 19, p-value = 0.053
alternative hypothesis: true mean is less than 0
95 percent confidence interval:
-Inf 0.74054
sample estimates:
mean of x
-41.25
--------------------------------
Analise de significancia pratica
--------------------------------
Eta^2 = 0.1318 (medium)
IC bootstrap de 95% para Eta^2:
BCa: [0.0007, 0.4285]
Suspeita-se de que um medicamento vasodilatador (Nifedipina) para Hipertensão Arterial, amplamente receitado, esteja aumentando a frequência cardíaca dos pacientes.
É sabido que a frequência cardíaca fisiológica tem distribuição normal com média 70 bpm.
Para verificar essa suspeita, planejou-se obter uma amostra aleatória de 50 pacientes que recebem Nifedipina para se medir a frequência cardíaca.
\[ \begin{cases} H_0: \mu_{\text{nifedipina}} = \mu_0 \\ H_1: \mu_{\text{nifedipina}} > \mu_0 \end{cases} \]
Adota-se \(\mu_0 = 70\).
A amostra de 50 pacientes forneceu:
72, 74, 70, 70, 69, 71, 72, 71, 69, 74, 71, 71, 70, 73, 69, 68, 68, 71, 71, 72, 70, 69, 73, 69, 71, 70, 72, 73, 70, 72, 67, 72, 67, 68, 69, 72, 70, 70, 70, 71, 74, 67, 69, 71, 71, 73, 71, 71, 70, 71
bpm <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74, 71, 71, 70, 73, 69, 68, 68,
71, 71, 72, 70, 69, 73, 69, 71, 70, 72, 73, 70, 72, 67, 72, 67, 68,
69, 72, 70, 70, 70, 71, 74, 67, 69, 71, 71, 73, 71, 71, 70, 71)
print(fivenum(bpm))[1] 67 69 71 72 74
Min. 1st Qu. Median Mean 3rd Qu. Max.
67.00 69.25 71.00 70.58 72.00 74.00
densprob <- density(bpm)
plot(densprob,
main="Distribuição dos dados amostrais",
xlab="Batimentos cardíacos",
ylab="Densidade")por inspeção visual, parece aproximar-se da distribuição normal?
# dados
bpm <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74, 71, 71, 70, 73, 69, 68, 68,
71, 71, 72, 70, 69, 73, 69, 71, 70, 72, 73, 70, 72, 67, 72, 67, 68,
69, 72, 70, 70, 70, 71, 74, 67, 69, 71, 71, 73, 71, 71, 70, 71)
# density plot
densprob <- density(bpm)
plot(densprob,
main="Distribuição dos dados amostrais",
xlab="Batimentos cardíacos", ylab="Densidade")
# distribuicao com media +- 4 desvios-padrao
media_bpm <- mean(bpm, na.rm = TRUE)
dp_bpm <- sd(bpm, na.rm = TRUE)
x <- seq(media_bpm-4*dp_bpm,media_bpm+4*dp_bpm,by=0.1)
distnormal <- dnorm(x, mean=media_bpm, sd=dp_bpm)
lines(x, distnormal, lty=2)Para um teste t com uma condição, unilateral à direita (note
o uso de greater), é necessário fornecer o valor de
referência (mu_pop <- 70) executado com:
bpm <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74, 71, 71, 70, 73, 69, 68, 68,
71, 71, 72, 70, 69, 73, 69, 71, 70, 72, 73, 70, 72, 67, 72, 67, 68,
69, 72, 70, 70, 70, 71, 74, 67, 69, 71, 71, 73, 71, 71, 70, 71)
mu_pop <- 70
alfa <- 0.05
t_out <- t.test(bpm,
mu=mu_pop,
conf.level = 1-alfa,
alternative = "greater")
print(t_out, digits=5)
One Sample t-test
data: bpm
t = 2.31, df = 49, p-value = 0.013
alternative hypothesis: true mean is greater than 70
95 percent confidence interval:
70.159 Inf
sample estimates:
mean of x
70.58
Para a decisão estatística, observe o valor da estatística do teste, guardada em t_out$statistic=2.3120489 e o valor-\(p\) associado em t_out$p.value=0.0125097.
Para \(\alpha=0.05\), rejeita-se \(H_0\) e, portanto, o uso de nifedipina está associada ao aumento da frequência cardíaca neste estudo.
Para \(\alpha=0.01\), não se rejeita \(H_0\) e, portanto, não há elementos neste estudo para afirmar-se que o uso de nifedipina está associada ao aumento da frequência cardíaca.
FALTOU escolher \(\alpha\) no planejamento do estudo.
Quando uma única amostra é comparada com um valor de referência \(\mu_0\), o parâmetro populacional de interesse pode ser expresso como a diferença média padronizada \(\delta=(\mu-\mu_0)/\sigma\). Como \(\mu\) e \(\sigma\) são desconhecidos, utiliza-se o estimador amostral \(d=(\bar{x}-\mu_0)/s\).
O \(d\) de Cohen indica quantos desvios-padrão separam a média observada do valor de referência. O sinal informa a direção da diferença e o valor absoluto informa sua magnitude.
No teste \(t\) para uma amostra, \(t=(\bar{x}-\mu_0)/(s/\sqrt{n})\). Consequentemente, existe a relação exata \(d=t/\sqrt{n}\). Assim, a estimativa pontual de \(d\) pode ser calculada diretamente a partir dos dados ou da estatística \(t\).
É importante distinguir \(d\) de \(\delta\). O valor \(d\) é uma estatística calculada na amostra, enquanto \(\delta=(\mu-\mu_0)/\sigma\) é o parâmetro populacional que se pretende estimar.
Diferentes amostras da mesma população produzem diferentes valores de \(\bar{x}\), \(s\) e, consequentemente, diferentes valores de \(d\). Por isso, a estimativa pontual deve ser acompanhada de uma medida de precisão.
Um intervalo de confiança de 95% representa a incerteza associada à estimação de \(\delta\). Embora seja comum falar em “intervalo de confiança de \(d\)”, rigorosamente o intervalo refere-se ao efeito populacional padronizado \(\delta\).
A construção desse intervalo não é trivial porque \(d\) depende simultaneamente da média e do desvio-padrão amostrais. Ambos variam entre amostras. Portanto, simplesmente dividir o intervalo de confiança da diferença de médias por \(s\) não representa completamente a incerteza associada à padronização.
Uma abordagem particularmente adequada utiliza a distribuição \(t\) não central. Para uma amostra, a estatística \(t\) possui parâmetro de não centralidade \(\lambda=\delta\sqrt{n}\).
O procedimento consiste em determinar um intervalo de confiança para \(\lambda\) e depois transformar seus limites para a escala de \(\delta\), dividindo-os por \(\sqrt{n}\).
Esse método decorre diretamente da distribuição amostral da estatística \(t\) e considera simultaneamente a incerteza associada à estimação da média e do desvio-padrão. Por isso, constitui uma alternativa analítica natural para a estimação intervalar do efeito padronizado.
A reamostragem fornece uma abordagem complementar. Em vez de especificar diretamente uma distribuição teórica para \(d\), são obtidas muitas amostras por reamostragem, com reposição, dos dados observados. Em cada amostra da reamostragem calcula-se novamente \(d\), produzindo uma aproximação empírica de sua distribuição amostral.
Essa distribuição pode ser utilizada para construir intervalos de confiança, por exemplo, pelos métodos percentil ou BCa.
No caso do \(d\) de Cohen para uma condição, o bootstrap é particularmente útil como análise de sensibilidade do intervalo obtido pela distribuição \(t\) não central. Se os dois procedimentos fornecerem limites semelhantes, há evidência empírica de que a conclusão não depende fortemente do método utilizado para construir o intervalo.
A reamostragem não demonstra matematicamente a validade do método da \(t\) não central. Sua função é complementar: o método da \(t\) não central fornece a solução analítica baseada no modelo probabilístico, enquanto a reamostragem permite verificar empiricamente a estabilidade dessa solução diante da distribuição observada dos dados.
Discrepâncias importantes entre os dois métodos constituem um sinal para investigar, por exemplo, tamanho amostral reduzido, assimetria, valores extremos ou outras características que possam afetar a distribuição amostral de \(d\).
O teste \(t\) pode também ser expresso no contexto do modelo linear geral (GLM). Como um teste \(t\) para um único parâmetro é equivalente a um teste \(F\) com um grau de liberdade no numerador, tem-se \(F=t^2\).
A proporção de variabilidade associada ao efeito pode então ser expressa por \(\eta^2=t^2/(t^2+\text{df})\), em que \(\text{df}=n-1\) no teste de uma condição.
Como \(t=d\sqrt{n}\), existe uma relação direta entre \(d\) e \(\eta^2\): \(\eta^2=nd^2/(nd^2+n-1)\).
Portanto, \(d\) e \(\eta^2\) não são medidas independentes de evidência. Para uma mesma amostra, ambas são transformações da mesma estatística \(t\), mas utilizam escalas diferentes.
O \(d\) expressa a diferença em unidades de desvio-padrão. Já \(\eta^2\) expressa o efeito em uma escala de proporção, limitada ao intervalo de 0 a 1.
A transformação inversa também é possível: \(|d|=\sqrt{\eta^2(n-1)/[n(1-\eta^2)]}\).
Consequentemente, conhecendo \(n\) e uma dessas medidas, pode-se obter exatamente a outra.
No GLM, a estatística \(t\) para um único parâmetro também pode ser transformada em uma medida na escala de correlação: \(|r|=|t|/\sqrt{t^2+\text{df}}\).
Como \(\eta^2=t^2/(t^2+\text{df})\), segue imediatamente que \(|r|=\sqrt{\eta^2}\).
Portanto, para um teste \(t\) associado a um único parâmetro do GLM, \(\eta^2\) é o quadrado da correlação parcial associada ao teste, e sua raiz quadrada fornece a magnitude dessa correlação.
Combinando essa expressão com \(t=d\sqrt{n}\), obtém-se \(|r|=|d|\sqrt{n/(nd^2+n-1)}\).
Assim, \(d\), \(\eta^2\) e \(|r|\) representam o mesmo contraste estatístico em escalas distintas:
É importante, entretanto, interpretar corretamente essa última quantidade. No teste de uma única condição contra \(\mu_0\), não existem duas variáveis observadas cuja correlação de Pearson esteja sendo calculada. Portanto, \(|r|\) não é uma correlação amostral convencional entre duas variáveis. Trata-se da correlação equivalente, ou correlação parcial implicada pela estatística \(t\) no GLM.
Quando interessa apenas a magnitude do efeito, utiliza-se \(|r|=\sqrt{\eta^2}\).
No teste de uma condição, as três medidas estão diretamente relacionadas:
\(d=t/\sqrt{n}\),
\(\eta^2=t^2/(t^2+n-1)\),
e
\(|r|=\sqrt{\eta^2}=|t|/\sqrt{t^2+n-1}\).
Essas relações mostram que não se trata de três testes diferentes. A informação inferencial fundamental é a mesma; o que muda é a escala utilizada para representar a magnitude do efeito.
Essa distinção é útil na interpretação. O \(d\) é particularmente natural quando se deseja expressar a diferença em unidades de desvio-padrão. A escala de \(\eta^2\) enfatiza a proporção associada ao efeito no GLM, enquanto \(|r|\) permite expressá-lo em uma escala correlacional.
Também existem intervalos baseados em aproximações para o erro-padrão de \(d\), utilizando quantis da distribuição normal ou da distribuição \(t\) central. Esses métodos não são equivalentes ao método baseado na \(t\) não central.
Em amostras grandes, os diferentes procedimentos tendem a fornecer resultados semelhantes. Em amostras pequenas ou quando o efeito é grande, as diferenças entre eles podem ser relevantes. Nesses casos, a comparação com um intervalo bootstrap é particularmente útil como análise de sensibilidade.
O \(d\) de Cohen apresenta pequeno viés em amostras finitas. Uma correção comum é o \(g\) de Hedges, definido por \(g=J(\nu)d\), em que \(\nu=n-1\) e \(J(\nu)\) é um fator de correção menor que 1.
À medida que o tamanho da amostra aumenta, \(J(\nu)\) tende a 1 e a diferença entre \(g\) e \(d\) torna-se pequena.
Para uma condição comparada a um valor de referência, a estimativa pontual é \(d=(\bar{x}-\mu_0)/s=t/\sqrt{n}\). Ela expressa a magnitude observada da diferença em unidades de desvio-padrão, enquanto o parâmetro populacional correspondente é \(\delta=(\mu-\mu_0)/\sigma\).
Para a estimação intervalar, a distribuição \(t\) não central fornece uma solução analítica diretamente relacionada à distribuição da estatística \(t\). O bootstrap constitui uma estratégia complementar importante para verificar empiricamente a robustez desse intervalo.
A mesma estatística \(t\) pode ainda ser expressa em outras escalas de tamanho de efeito. No GLM, \(\eta^2=t^2/(t^2+\text{df})\) e \(|r|=\sqrt{\eta^2}\). Para uma condição, como \(\text{df}=n-1\) e \(t=d\sqrt{n}\), \(d\), \(\eta^2\) e \(|r|\) são transformações exatas do mesmo resultado estatístico.
Portanto, essas medidas não fornecem evidências independentes; elas oferecem diferentes formas de expressar a magnitude do mesmo efeito.
bpm <- c(72, 74, 70, 70, 69, 71, 72, 71, 69, 74, 71, 71, 70, 73, 69, 68, 68,
71, 71, 72, 70, 69, 73, 69, 71, 70, 72, 73, 70, 72, 67, 72, 67, 68,
69, 72, 70, 70, 70, 71, 74, 67, 69, 71, 71, 73, 71, 71, 70, 71)
mu_pop <- 70
alfa <- 0.05
t_out <- t.test(bpm,
mu=mu_pop,
conf.level = 1-alfa,
alternative = "greater")
print(t_out, digits=5)
n <- length(bpm)
df <- t_out$parameter
t <- as.numeric(t_out$statistic)
d <- t/sqrt(n)
print(d)
dF <- (mean(bpm)-mu_pop)/sd(bpm)
print(dF)
d_boot <- function(dados, indices, mu0) {
x <- dados[indices]
(mean(x) - mu0) / sd(x)
}
set.seed(123)
B <- 1e5
b_d <- boot::boot(
data = bpm,
statistic = d_boot,
R = B,
mu0 = mu_pop
)
boot::boot.ci(
b_d,
conf = 1-alfa,
type = c("bca")
)
dC <- effsize::cohen.d(bpm~1,
mu=mu_pop,
noncentral=TRUE,
conf.level=1-alfa,
na.rm=TRUE)
print(dC)
for (metodo in c("nct", "t", "z")) {
cat("\nMétodo:", metodo, "\n")
print(
TOSTER::smd_calc(
x = bpm - mu_pop,
mu = 0,
alpha = alfa,
bias_correction = FALSE,
smd_ci = metodo,
output = "data.frame"
),
digits = 5
)
}
F <- t^2
eta2 <- F/(F+df)
cat("\tEta^2 = ",round(eta2,3) ,"\n",sep="")
r <- sqrt(eta2)
print(r)
rF <- d/(sqrt(d^2+(n-1)/n))
print(rF)O teste \(t\) de uma amostra compara a média populacional com \(\mu_0=70\), sob a alternativa \(H_1:\mu>70\). A amostra apresentou média \(\bar{x}=70.58\) e o teste resultou em \(t=2.31\), com \(\text{df}=49\) e \(p=0.013\).
Como \(p<0.05\), há evidência amostral significante de que a média populacional é superior a 70. O intervalo unilateral de 95% para a média foi \([70.159,+\infty)\), compatível com essa conclusão.
A magnitude padronizada da diferença foi \(d=0.32697\).
O código obtém esse valor de duas maneiras:
[1] -0.379827
[1] 0.3269731
Os dois resultados são idênticos porque, no teste \(t\) para uma condição, vale exatamente \(d=t/\sqrt{n}\). Portanto, a média observada encontra-se aproximadamente \(0.33\) desvio-padrão acima do valor de referência. Pela classificação convencional de Cohen, trata-se de um efeito pequeno.
O bootstrap BCa com 100000 reamostragens forneceu \(\text{IC}_{95\%}=[0.0323,;0.6166]\).
Esse intervalo estima empiricamente a incerteza de \(d\), recalculando a média e o desvio-padrão em cada amostra bootstrap. O limite inferior permanece pouco acima de zero, mas o intervalo é relativamente amplo: embora a estimativa pontual seja \(d=0.327\), os dados são compatíveis com efeitos populacionais desde muito pequenos até moderados.
O resultado é particularmente útil como análise de sensibilidade do método analítico baseado na distribuição \(t\) não central.
TOSTER::smd_calc(..., smd_ci="nct") forneceu \(d=0.32697\), com \(\text{IC}_{95\%}=[0.0408,;0.6100]\).
Esse resultado é muito próximo do bootstrap BCa, \([0.0323,;0.6166]\). A concordância entre os dois métodos é importante: o método da \(t\) não central parte de uma distribuição probabilística analítica, enquanto o bootstrap estima a variabilidade por reamostragem. A proximidade dos resultados sugere que a inferência sobre a magnitude do efeito é pouco dependente do método utilizado.
A documentação atual do TOSTER considera
"nct" seu método analítico padrão e recomenda bootstrap
quando a inferência sobre a diferença padronizada é central à
análise.
effsize::cohen.d()effsize::cohen.d(..., noncentral=TRUE) produziu
aproximadamente \(\text{IC}_{95\%}=[0.0412,;0.6162]\).
A estimativa pontual continua sendo \(d=0.32697\). O intervalo também é bastante
próximo do bootstrap e do TOSTER.
Há, contudo, uma pequena diferença de implementação. No código atual
de effsize, os limites obtidos pela distribuição não
central são transformados dividindo-se o parâmetro de não centralidade
por \(\sqrt{\text{df}}\), enquanto para
uma condição a relação teórica é \(\lambda=\delta\sqrt{n}\). Isso explica
parte da pequena diferença em relação ao TOSTER.
Além disso, no seu print() os rótulos
"upper" e "lower" apareceram invertidos.
Numericamente, o intervalo deve ser lido em ordem crescente como \([0.0412,;0.6162]\).
t central e normalO TOSTER produziu:
| Método | IC de 95% |
|---|---|
| \(t\) não central | \([0.0408,\;0.6100]\) |
| \(t\) central | \([-0.0087,\;0.6626]\) |
| Normal (\(z\)) | \([0.0016,\;0.6523]\) |
As três abordagens têm a mesma estimativa pontual, \(d=0.32697\), e o mesmo erro-padrão informado, \(SE=0.14515\). O que muda é a forma utilizada para construir o intervalo.
O método "nct" utiliza a distribuição \(t\) não central; "t" utiliza
uma aproximação baseada na distribuição \(t\) central; e "z" utiliza uma
aproximação normal. A própria documentação do TOSTER
considera "nct" mais apropriado na maioria das situações e
trata os demais como aproximações.
É instrutivo notar que os métodos aproximados são suficientemente
diferentes para alterar a inclusão de zero: o método t
central inclui zero, o normal praticamente toca zero e o método não
central mantém o limite inferior positivo. Isso mostra que, quando o
efeito está próximo do limiar de nulidade, o método de construção do
intervalo pode ter importância prática.
Não há contradição com o teste original. O teste apresentado por
t.test() é unilateral, \(H_1:\mu>70\), enquanto esses intervalos
de \(d\) são bilaterais de 95%.
Como um teste \(t\) para um único parâmetro é equivalente a um teste \(F\) com um grau de liberdade no numerador, \(F=t^2\).
A transformação \(\eta_p^2=t^2/(t^2+\text{df})\) produziu \(\eta_p^2=0.098\).
Isso significa que, na representação equivalente do teste dentro do GLM, aproximadamente 9.8% da variação associada ao teste corresponde ao efeito. Para uma condição isolada, entretanto, convém não interpretar literalmente esse valor como “percentual da variância explicado por uma variável preditora”, pois não existe aqui um preditor variável. Trata-se principalmente de uma transformação do mesmo efeito para a escala de \(\eta_p^2\).
Como \(r^2=\eta_p^2\) para um teste de um único parâmetro, \(|r|=\sqrt{\eta_p^2}=0.31363\).
Como o efeito é positivo, pode-se escrever \(r=0.31363\).
O cálculo alternativo
[1] 0.3136281
produz exatamente o mesmo resultado porque substitui \(t=d\sqrt{n}\) na expressão anterior.
Portanto, \(d=0.32697\), \(\eta_p^2=0.098\) e \(r=0.31363\)
não representam três efeitos independentes. São três escalas distintas para representar a magnitude do mesmo efeito estatístico.
A evidência amostral indica uma média populacional superior ao valor de referência (\(t=2.31\), \(p=0.013\), teste unilateral). A magnitude observada é pequena, \(d=0.327\).
Para a estimação intervalar de \(d\), os resultados mais relevantes são:
| Método | IC de 95% |
|---|---|
| Bootstrap BCa | \([0.0323,\;0.6166]\) |
| \(t\) não central | \([0.0408,\;0.6100]\) |
effsize NCT |
\([0.0412,\;0.6162]\) |
A forte concordância entre o bootstrap BCa e a distribuição \(t\) não central fornece uma boa verificação empírica da estabilidade do intervalo analítico. A estimativa pontual é pequena, mas sua precisão ainda permite uma faixa relativamente ampla de magnitudes populacionais.
As transformações \(\eta_p^2=0.098\) e \(r=0.314\) expressam esse mesmo efeito em escalas alternativas, não constituindo evidências estatísticas adicionais.
\(H_0\) é a hipótese nula (sempre abrange a igualdade).
\(H_1\) é a hipótese alternativa (complementar a \(H_0\)).
\(H_0\) pode ser não rejeitada ou rejeitada (a rejeição deve ser baseada em evidências obtidas a partir da amostra).
A decisão estatística sempre envolve possíveis erros:
|
NA POPULAÇÃO: Não sabemos se o efeito existe |
||
|
Se o efeito não existe |
Se o efeito existe |
|
|
sem evidência de efeito na amostra |
Corretamente não se rejeita \(H_0\) |
\(\beta\) |
|
com evidência de efeito na amostra |
\(\alpha\) |
Corretamente rejeita-se \(H_0\) \(poder = 1-\beta\) |
que são:
Não rejeitar \(H_0\) (não encontrar evidência para a existência de efeito com base na amostra) não é o mesmo que aceitar \(H_0\) (assumir a ausência de efeito na população). Para aceitar \(H_0\) com boa probabilidade de não cometer erro (supondo que não rejeitou \(H_0\) e o efeito populacional existe), \(\beta\) deve ser pequeno, mas há um cuidado fundamental: tem que ser o \(\beta\) estabelecido a priori (prospectivo), ao planejar o estudo. O \(\beta\) a posteriori (retrospectivo) que poderia ser visualizado nestes gráficos, pela sobreposição das curvas após o experimento ter sido realizado, não tem valor sobre a decisão.
O mesmo vale para o poder do teste, \(1-\beta\), complementar à probabilidade de erro do tipo II. Se \(1-\beta\) for estabelecido a priori e se, com a amostra, rejeitarmos \(H_0\), então a probabilidade de acerto ao afirmar que o efeito existe na população é o poder do teste.
A decisão sobre o teste depende da comparação entre a probabilidade de se observar uma diferença sob a hipótese nula, dada uma amostra de tamanho \(n\) e a probabilidade do erro do tipo I (\(\alpha\)) escolhida previamente:
| Entenda “acaso” como flutuação amostral: supondo que o efeito não exista na população, ocasionalmente uma amostra pode sair com valores compatíveis com a diferença, levando-nos a rejeitar \(H_0\) e cometer um erro do tipo I. Em outras palavras, o valor-\(p\) é a probabilidade de se observar os valores que vieram em determinada amostra supondo-se que o efeito populacional não existe (i.e. sob \(H_0\)). Portanto, se tal probabilidade for alta (\(p>\alpha\)), não apostamos na existência da diferença (os valores amostrais são aqueles esperados a partir de uma população que não exibe o efeito) e, assim, não rejeitamos \(H_0\). Por outro lado, se observar tais valores amostrais vindos de uma população que não tem o efeito é improvável (\(p < \alpha\)), apostamos que esta amostra não deve ter vindo de uma população que não tem efeito e rejeitamos \(H_0\); por exclusão de \(H_0\), aceitamos que há diferença na população que originou a amostra, com probabilidade \(p\) (de acordo com esta amostra) de estarmos enganados; nós decidimos aceitar qualquer probabilidade de engano se encontrássemos qualquer probabilidade abaixo do nivel de significância adotado, \(\alpha\). |
Para executar o teste t de Student, quando os dados individualizados não estão disponíveis, criamos o seguinte código:
É muito comum, em publicações, que somente tenhamos acesso às medidas-resumo (número de participantes, média, desvio-padrão e correlação).
Para executar os testes t relacionado e testes t de Welch, quando os dados individualizados não estão disponíveis, criamos os seguintes códigos:
Ao planejar você deve se perguntar:
Exemplificamos o planejamento de um estudo com o G*Power. Temos a informação de que homens brasileiros que vivem em área urbana têm estatura diferente dos que vivem em área rural (https://www.ibge.gov.br/). Suponha que planejemos conduzir um estudo para saber se esta diferença persiste em 2021. Queremos determinar o tamanho da amostra. Para o G*Power informaremos:
O G*Power calcula \(n=429\) participantes em cada grupo, totalizando 858 participantes.
Suponha que não possamos realizar este estudo. No máximo temos recursos para 50 participantes em cada grupo. O G*Power nos permite verificar, escolhendo \(\alpha\), \(\beta\) e o número possível de participantes, saber qual é o tamanho de efeito que seremos capazes de detectar:
O G*Power calcula \(d\) de Cohen = 0.59. Esta é uma medida em desvios-padrão da distância entre as médias populacionais que poderíamos detectar com este estudo. Temos que buscar, então, informação sobre o desvio-padrão da estatura em homens brasileiros na literatura.
Em 2012 o valor foi estimado em 8.6 cm (Figueroa et al., 2012): portanto, este estudo será capaz de detectar uma diferença de cerca de 5.08 cm. Caso não achemos possível que a diferença populacional seja igual ou superior a esta medida, não adianta levar o estudo adiante.
Não parece impossível: homens em área urbana eram 3.6 cm mais altos que os de área rural em 2009 (https://www.ibge.gov.br/).
Um terceiro exemplo é quando queremos encontrar o poder adequado (pelo menos 90%). Como a medida de estatura é simples, podemos buscar a detecção de efeitos muito pequenos. Imagine que optemos por adotar \(d=0.1\) (corresponde a uma diferença de 0.86 cm de acordo com nossa referência). Usaremos o \(\alpha=0.05\) tradicional. Tateando os tamanhos de amostra (artigos que estimam estatura em populações costumam ter amostras grandes), com 2000 indivíduos em cada grupo conseguimos alcançar poder de 93.5%. Assim, caso não rejeitemos a hipótese nula, poderemos afirmar com alguma segurança que a estatura dos brasileiros de área urbana e rural não diferem, em vez de termos dúvida sobre a insuficiência do tamanho de nossa amostra.
Portanto, com o G*Power, tendo quaisquer três medidas definidas (\(\alpha\), \(\beta\), \(d\) ou \(n\)), a quarta é a incógnita a ser resolvida.
Dancey C & Reidy J (2019) Estatística sem Matemática para Psicologia. 7a ed. Porto Alegre: PENSO.
Eisenhauer JG (2008) Degrees of freedom. Teaching Statistics 30(3): 75-8.
Elis P (2010) The essential guide to effect sizes. UK: Cambridge.
Figueiroa JN et al. (2012) Evolução intergeracional da estatura no Estado de Pernambuco, Brasil, entre 1945 e 2006. Cad Saúde Pública 28(7): 1285-96.
Sarno et al. (2013) Estimativa de consumo de sodio pela população brasileira 2008-9. Rev Saude Pública 47(3): 571-8.
Satterthwaite FE (1946) Approximate distribution of estimates of variance components. Biometrics Bulletin 2(6): 110-4.
Sawilowsky S (2009) New effect size rules of thumb. Journal of Modern Applied Statistical Methods 8(2): 467-74.
Spanos A (1998) Probability theory and statistical inference. UK: Cambridge.
Wonnacott T & Wonnacott R (1990) Introductory Statistics for Business and Economics. 4ª ed. NJ: Wiley.
Welch BL (1947) The generalization of ‘Student’s’ problem when several different population variances are involved. Biometrika 34(1/2): 28-35.