O Método Jackknife (ou canivete suíço) é uma técnica estatística de reamostragem não paramétrica introduzida por Maurice Quenouille (1956) e posteriormente expandida por John Tukey (1958). Tukey deu o nome de jackknife porque, assim como um canivete suíço, o método é uma ferramenta genérica, prática e pronta para uso em diversos problemas onde a teoria assintótica exata é difícil ou impossível de obter.
Suponha que queremos estimar um parâmetro \(\theta\) através de um estimador \(\hat{\theta} = T(X_1, X_2, \dots, X_n)\), baseado na amostra \(\boldsymbol{X} = (X_1, X_2, \dots, X_n)\).
Na prática da Inferência Estatística, obter a estimativa pontual \(\hat{\theta}\) é apenas o primeiro passo. Para avaliar a precisão e a confiabilidade de \(\hat{\theta}\), precisamos responder a perguntas importantes:
Qual é a variabilidade amostral ou erro-padrão de \(\hat{\theta}\)?
O estimador \(\hat{\theta}\) é viesado? Se sim, qual a magnitude do viés?
Quanto cada observação influencia o resultado?
Como obter essas quantidades quando a distribuição amostral de \(\hat{\theta}\) é desconhecida ou analiticamente intratável?
O Jackknife é uma das ferramentas clássicas utilizadas para responder a essas perguntas sem exigir suposições distribucionais rígidas.
Se recalcularmos o estimador \(n\) vezes, excluindo em cada etapa a \(i\)-ésima observação, obtemos \(n\) subestimativas denotadas por \(\hat{\theta}_{(-i)}\). Avaliando a variabilidade entre essas \(n\) estimativas parciais, conseguimos:
O Jackknife é um método de reamostragem.
A ideia fundamental é muito simples: retirar uma observação da amostra, recalcular a estatística e repetir o procedimento sistematicamente para todas as observações.
Por isso, o Jackknife tradicional também é chamado de: Delete-1 Jackknife ou Leave-One-Out Jackknife.
A pergunta central do Jackknife é: Como o estimador \(\hat{\theta}\) se comporta se removermos exatamente uma observação do conjunto de dados?
Suponha que queremos estimar a média de uma população com base em uma amostra \(X_1,\cdots,X_n\). Para isso, utilizamos o estimador \[\bar{X} = \dfrac{\sum_{i=1}^nX_i}{n}.\] Se uma observação é perdida, digamos, a \(j\)-ésima, podemos tomar o estimador \[\displaystyle \bar{X}_{(-j)} = \dfrac{\sum_{i=1, \;i\neq j}^nX_i}{n-1} = \dfrac{\sum_{i=1}^nX_i-X_j}{n-1}.\] Das equações acima, segue que \[X_j = \sum_{i=1}^nX_i - (n-1)\bar{X}_{(-j)} = n\bar{X}-(n-1)\bar{X}_{(-j)}.\] O estimador de Jackknife é baseado na generalização desta ideia para um estimador qualquer baseado numa amostra aleatória \(X_1,\cdots,X_n\).
Suponha que queremos estimar o parâmetro \(\theta\) de uma população, com base na amostra \(X_1,\cdots,X_n\), através do estimador \(\hat{\theta} = T(X_1,\cdots,X_n)\).
Dada uma amostra \(X_1, X_2, \dots, X_n\), definimos a \(i\)-ésima amostra Jackknife como o conjunto contendo \(n-1\) observações resultantes da remoção de \(X_j\):
\[ \boldsymbol{X}_{(-j)} = (X_1, X_2, \dots, X_{j-1}, X_{j+1}, \cdots, X_n). \]
A estimativa parcial (ou leave-one-out estimate) é dada por:
\[ \hat{\theta}_{(-j)} = T(\boldsymbol{X}_{(-j)}). \]
Para ilustrar a sensibilidade de um estimador em relação às observações, considere o vetor a seguir contendo um valor atípico (outlier):
\[ X = (10,\; 12,\; 13,\; 15,\; 50) \]
O valor 50 é bem maior que os demais; logo, vamos calcular a média ao longo de subamostras removendo cada observação de uma vez (leave-one-out).
x = c(10, 12, 13, 15, 50)
theta_hat = mean(x)
theta_menosi <- sapply(
1:length(x),
function(i) mean(x[-i])
)
data.frame(
observacao = 1:length(x),
valor_retirado = x,
media_menosi = theta_menosi,
diferenca = theta_menosi - theta_hat
)
## observacao valor_retirado media_menosi diferenca
## 1 1 10 22.50 2.50
## 2 2 12 22.00 2.00
## 3 3 13 21.75 1.75
## 4 4 15 21.25 1.25
## 5 5 50 12.50 -7.50
Podemos observar que retirar 50 produz uma mudança muito maior na média.
John Tukey definiu os pseudo-valores \(\widetilde{\theta}_i\) por:
\[\widetilde{\theta}_i = n \hat{\theta} - (n - 1) \hat{\theta}_{(-i)}, \quad i \in 1,...,n.\]
A média dos pseudo-valores corresponde exatamente ao estimador Jackknife com viés reduzido:
\[\boxed{\hat{\theta}_{jack} = \frac{1}{n}\sum_{i=1}^{n} \widetilde{\theta}_i = n\hat{\theta} - (n - 1)\bar{\theta}_{(\cdot)}}\]
onde \(\bar{\theta}_{(\cdot)}\) é a média das estimativas parciais
\[\bar{\theta}_{(\cdot)} = \frac{1}{n} \sum_{i=1}^{n} \hat{\theta}_{(-i)}.\]
Vamos verificar que o uso do estimador \(\hat{\theta}_{jack}\) realmente reduz o viés de estimação, quando comparado ao estimador \(\hat{\theta}\).
Em Estatística assintótica, o valor esperado do estimador \(\hat{\theta}\) baseado em \(n\) observações pode ser expandido em potências de \(1/n\):
\[\mathbb{E}[\hat{\theta}] = \theta + \frac{a_1}{n} + \frac{a_2}{n^2} + O\left(\frac{1}{n^3}\right) = \theta \color{blue}{+ O\left(\frac{1}{n}\right)};\] onde \(a_1,a_2,...\) são constantes independentes de \(n\).
O vício de \(\hat{\theta}\) é
\[\text{B}(\hat{\theta}) = \mathbb{E}[\hat{\theta}] - \theta = \frac{a_1}{n} + O\left(\frac{1}{n^2}\right).\]
Analogamente, para a estimativa parcial \(\hat{\theta}_{(-i)}\), calculada com \(n-1\) observações, temos:
\[\mathbb{E}[\hat{\theta}_{(-i)}] = \theta + \frac{a_1}{n-1} + \frac{a_2}{(n-1)^2} + O\left(\frac{1}{(n-1)^3}\right).\]
Consequentemente, a média das estimativas parciais satisfaz:
\[\mathbb{E}[\bar{\theta}_{(\cdot)}] = \mathbb{E}\left[\frac{1}{n} \sum_{i=1}^{n} \hat{\theta}_{(-i)}\right] = \frac{1}{n} \sum_{i=1}^{n} \mathbb{E}[\hat{\theta}_{(-i)}] = \mathbb{E}[\hat{\theta}_{(-i)}] = \theta + \frac{a_1}{n-1} + \frac{a_2}{(n-1)^2} + O\left(\frac{1}{(n-1)^3}\right),\] portanto, \[\begin{align*} \mathbb{E}[\hat{\theta}_{jack}] = \mathbb{E}[n\hat{\theta} - (n - 1)\bar{\theta}_{(\cdot)}] &= n\left[\theta + \frac{a_1}{n} + \frac{a_2}{n^2} + O\left(\frac{1}{n^3}\right)\right] - (n-1)\left[\theta + \frac{a_1}{(n-1)} + \frac{a_2}{(n-1)^2} + O\left(\frac{1}{(n-1)^3}\right)\right] \\ &= \left[n\theta + a_1 + \frac{a_2}{n} + O\left(\frac{1}{n^2}\right)\right] - \left[n\theta -\theta + a_1 + \frac{a_2}{n-1} + O\left(\frac{1}{(n-1)^2}\right)\right]\\ &= \theta - \frac{a_2}{n(n-1)} + O\left(\frac{1}{n^2}\right) + O\left(\frac{1}{(n-1)^2}\right) = \theta + \color{blue}{O\left(\frac{1}{n^2}\right)}. \end{align*}\]
Assim, o vício de \(\hat{\theta}_{jack}\) é
\[\text{B}(\hat{\theta}_{jack}) = \mathbb{E}[\hat{\theta}_{jack}] - \theta = O\left(\frac{1}{n^2}\right);\]
ou seja, o viés do estimador corrigido cai de ordem \(O(1/n)\) para \(O(1/n^2)\).
O vício estimado pelo Jackknife é definido por: \[\widehat{\text{B}}_{jack}(\hat{\theta}) = \hat{\theta} - \hat{\theta}_{jack} = (n - 1)\left(\bar{\theta}_{(\cdot)} - \hat{\theta}\right).\] Tukey tratou os pseudo-valores \(\widetilde{\theta}_i\) como se fossem uma amostra aleatória de estimativas independentes para \(\theta\), estimando a variância de Jackknife do estimador \(\hat{\theta}\) por \(S^2/n\), onde \(S^2\) é a variância amostral dos pseudo-valores: \[ \begin{aligned} \widehat{\text{Var}}_{jack}(\hat{\theta}) = \frac{S^2}{n} &= \frac{1}{n}\frac{1}{(n-1)} \sum_{i=1}^{n} \left(\widetilde{\theta}_i - \hat{\theta}_{jack}\right)^2 = \frac{1}{n}\frac{1}{n-1} \sum_{i=1}^{n} \left([n\hat{\theta}-(n-1)\hat{\theta}_{(-i)}] - [n\hat{\theta}-(n-1)\bar{\theta}_{(\cdot)}]\right)^2 \\ &= \frac{1}{n}\frac{1}{n-1} \sum_{i=1}^{n} \left(-(n-1)\hat{\theta}_{(-i)} + (n-1)\bar{\theta}_{(\cdot)}\right)^2 = \frac{1}{n}\frac{1}{n-1} \sum_{i=1}^{n} (n-1)^2\left(-\hat{\theta}_{(-i)} + \bar{\theta}_{(\cdot)}\right)^2 \\ &= \frac{n-1}{n} \sum_{i=1}^{n} \left(\bar{\theta}_{(\cdot)}-\hat{\theta}_{(-i)}\right)^2 \end{aligned} \]
O erro padrão Jackknife é simplesmente a raiz quadrada da variância: \[ \widehat{\text{SE}}_{jack}(\hat{\theta}) = \sqrt{\widehat{\text{Var}}_{jack}(\hat{\theta})}. \]
Estas estimativas podem ser utilizadas para estimar intervalos de confiança da forma \[IC_{100(1-\alpha)\%}(\theta) = [\;\hat{\theta}_{jack}-\epsilon\;,\;\hat{\theta}_{jack}+\epsilon\;], \qquad \text{com } \epsilon=\frac{S}{\sqrt{n}}t_{n-1;\alpha/2}.\]
Se as estimativas \(\hat{\theta}_{(1)}, \dots, \hat{\theta}_{(n)}\) forem muito semelhantes, então \(\widehat{Var}_{jack}(\hat{\theta})\) será pequena.
Se a retirada de algumas observações alterar fortemente o resultado, a variabilidade Jackknife será maior.
Portanto, \(\widehat{\text{SE}}_{jack}\) mede a sensibilidade da estimativa às remoções individuais e, sob as condições apropriadas, fornece uma estimativa da variabilidade amostral do estimador.
Considere que o estimador da variância seja dado por \[\hat{\sigma}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2.\]
Sabemos que este estimador tem vício \[\text{B}(\hat{\sigma}^2) = \mathbb{E}[\hat{\sigma}^2] -\sigma^2 = \frac{n-1}{n}\sigma^2 - \sigma^2 = -\frac{\sigma^2}{n}.\] Vamos aplicar o Jackknife para corrigir esse vício.
# Dados simulados de uma distribuição Normal(mu = 10, sigma^2 = 25)
set.seed(123)
n = 20
x = rnorm(n, mean = 10, sd = 5)
# Estimador com vício
theta_hat = sum((x - mean(x))^2) / n
# Estimativas Jackknife leave-one-out
theta_menosi = numeric(n)
for(i in 1:n) {
x_sub = x[-i]
theta_menosi[i] = sum((x_sub - mean(x_sub))^2) / (n - 1)
}
theta_bar = mean(theta_menosi)
# Estimador Corrigido
theta_jack = n*theta_hat-(n-1)*theta_bar
# Vício estimado
vies_jack = (n - 1) * (theta_bar - theta_hat)
#theta_jack = theta_hat - vies_jack
# Variância do Estimador
var_jack = ((n - 1) / n) * sum((theta_bar - theta_menosi)^2)
se_jack = sqrt(var_jack)
estimativas = data.frame(
estimativa = c("viesada","corrigida por Jackknife","variância amostral usual"),
valores = c(round(theta_hat, 4),round(theta_jack, 4),round(var(x), 4))
)
estimativas
## estimativa valores
## 1 viesada 22.4693
## 2 corrigida por Jackknife 23.6519
## 3 variância amostral usual 23.6519
outros_resultados = data.frame(
estimativa = c("viés","variância","erro padrão"),
valores = c(round(vies_jack, 4),round(var_jack, 4),round(se_jack, 4))
)
outros_resultados
## estimativa valores
## 1 viés -1.1826
## 2 variância 50.5540
## 3 erro padrão 7.1101
Mostre formalmente que para a média amostral \[\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i,\] o vício estimado pelo Jackknife é exatamente zero e o erro padrão do Jackknife é equivalente ao erro padrão clássico \(\frac{S}{\sqrt{n}}\).
Solução:
Seja \(X_1, X_2, \dots, X_n\) uma amostra aleatória de variáveis independentes e identicamente distribuídas (i.i.d.).
O estimador da média populacional baseado na amostra completa é a média amostral: \[\hat{\theta} = \bar{X} = \frac{1}{n} \sum_{i=1}^n X_i\]
Para a técnica Jackknife, definimos o estimador recalculado após remover a \(i\)-ésima observação (\(X_i\)) como \(\hat{\theta}_{(-i)}\): \[\hat{\theta}_{(-i)} = \bar{X}_{(-i)} = \frac{1}{n-1} \sum_{j \neq i}^n X_j = \frac{1}{n-1} \left( \sum_{j=1}^n X_j - X_i \right) = \frac{n\bar{X} - X_i}{n-1}.\]
A média das estimativas Jackknife é dada por: \[\bar{\theta}_{(\cdot)} = \frac{1}{n} \sum_{i=1}^n \hat{\theta}_{(-i)} = \frac{1}{n} \sum_{i=1}^n \left( \frac{n\bar{X} - X_i}{n-1} \right) = \frac{1}{n(n-1)} \left( \sum_{i=1}^n n\bar{X} - \sum_{i=1}^n X_i \right) = \frac{1}{n(n-1)} \left( n^2 \bar{X} - n\bar{X} \right) = \frac{n\bar{X}(n-1)}{n(n-1)} = \bar{X}.\]
Logo, vício estimado pelo Jackknife é definido formalmente por: \[\widehat{B}_{jack}(\hat{\theta}) = \hat{\theta} - \hat{\theta}_{jack} = (n - 1)\left(\bar{\theta}_{(\cdot)} - \hat{\theta}\right) = (n-1) \left(\bar{X} - \bar{X}\right) = 0.\]
\(\blacksquare\) O vício estimado pelo Jackknife para a média amostral é exatamente zero.
A variância estimada pelo Jackknife é definida por: \[\widehat{Var}_{jack}(\hat{\theta}) = \frac{n-1}{n} \sum_{i=1}^{n} \left(\bar{\theta}_{(\cdot)}-\hat{\theta}_{(-i)}\right)^2\]
Primeiro, simplificamos o termo da diferença \((\bar{\theta}_{(\cdot)}-\hat{\theta}_{(-i)})\): \[\bar{\theta}_{(\cdot)}-\hat{\theta}_{(-i)} = \bar{X} - \frac{n\bar{X} - X_i}{n-1} = \frac{(n-1)\bar{X} - n\bar{X} + X_i}{n-1} = \frac{X_i - \bar{X}}{n-1}\]
Substituindo esse termo na fórmula da variância Jackknife: \[\widehat{\text{Var}}_{\text{Jack}}(\hat{\theta}) = \frac{n-1}{n} \sum_{i=1}^n \left( \frac{X_i - \bar{X}}{n-1} \right)^2 = \frac{n-1}{n} \sum_{i=1}^n \frac{(X_i - \bar{X})^2}{(n-1)^2} = \frac{1}{n(n-1)} \sum_{i=1}^n (X_i - \bar{X})^2\]
Lembrando que a variância amostral corrigida é \(S^2 = \frac{1}{n-1} \sum_{i=1}^n (X_i - \bar{X})^2\), temos: \[\widehat{\text{Var}}_{jack}(\hat{\theta}) = \frac{S^2}{n}.\]
Tomando a raiz quadrada para encontrar o erro padrão: \[\widehat{\text{SE}}_{jack}(\hat{\theta}) =\sqrt{\widehat{\text{Var}}_{jack}(\hat{\theta})} = \sqrt{\frac{S^2}{n}} = \frac{S}{\sqrt{n}}.\]
\(\blacksquare\) O erro padrão do Jackknife é equivalente ao erro padrão clássico \(\frac{S}{\sqrt{n}}\).
O Jackknife apresenta várias vantagens, tais como
O Jackknife tradicional possui excelente comportamento para muitos estimadores regulares, tais como
média; variância; coeficientes de regressão; correlação; funções suaves de momentos.
Entretanto, o método Jackknife falha ou apresenta fraco desempenho quando o estatístico \(\hat{\theta}\) não é suave. Um estimador é dito suave quando pequenas alterações nos dados produzem pequenas alterações no estimador. São exemplos de estimadores não suaves:
máximo; mínimo; mediana; quantis; estatísticas baseadas em indicadores.
Nessas situações, a aproximação Jackknife pode ser menos confiável.
Exemplo de Falha: A Mediana amostral. A remoção de um único elemento pode alterar drasticamente o valor central ou não alterá-lo em nada, resultando em inconformidades na estimativa da variância.
Solução para Não-Suavidade: O método Delete-\(d\) Jackknife (onde são removidos blocos de tamanho \(d > 1\), com \(\sqrt{n} < d < n\)) ou o método Bootstrap.
Outras situações em que o método deve ser usado com cautela (não sendo aplicado mecanicamente):
QUENOUILLE, M. H. Notes on bias in estimation. Biometrika, v. 43, n. 3/4, p. 353-360, 1956.
TUKEY, J. W. Bias and confidence in not-quite large samples<;em>. The Annals of Mathematical Statistics, v. 29, n. 2, p. 614, 1958.
MANLY, B.F.J. Randomization, Bootstrap and Monte Carlo Methods in Biology<;em>. Texts in Statistical Science. 2. ed. Chapman&Hall, 1997.