En la investigación epidemiológica y clínica cuantitativa, la prueba de hipótesis nula (Null Hypothesis Significance Testing, NHST) constituye el paradigma estándar para evaluar si las diferencias o asociaciones observadas en una muestra son epidemiológicamente reales o mero producto del azar de muestreo (Cohen, 1988; Faul et al., 2007).
Al tomar una decisión inferencial sobre la hipótesis nula (\(H_0\)), existen cuatro escenarios posibles en la población de origen:
| Decisión Estadístico-Epidemiológica | \(H_0\) es Verdadera en la Población (No hay asociación) | \(H_1\) es Verdadera en la Población (Existe asociación real) |
|---|---|---|
| Rechazar \(H_0\) (Detectar efecto) | Error Tipo I (\(\alpha\)) Falso Positivo |
Decisión Correcta (\(1 - \beta\)) Potencia Estadística |
| No Rechazar \(H_0\) (No detectar) | Decisión Correcta (\(1 - \alpha\)) Nivel de Confianza |
Error Tipo II (\(\beta\)) Falso Negativo |
Como demostró Jacob Cohen (1988) en su obra seminal Statistical Power Analysis for the Behavioral Sciences, existe una interdependencia matemática rígida entre cuatro parámetros. Si se fija el valor de tres de ellos, el cuarto queda automáticamente determinado:
\[\text{Potencia } (1 - \beta) = f\left( \alpha,\, N,\, \text{Efecto } [ES],\, \text{Diseño/Distribución} \right)\]
▲ Tamaño Muestral (N)
│ ┌─────────────────────────────────┐
│ │ ▲ Potencia (1 - β) [80-90%] │
│ └─────────────────────────────────┘
│ ▲ ▲
│ │ │
│ ▼ Tamaño Efecto (ES) ┼─────────┼ ▼ Alfa (α) [0.05 -> 0.01]
└──────────────────────────────────────────────────────────►
En los estudios analíticos transversales (cross-sectional studies), la exposición y el evento/desenlace se miden de manera simultánea en una población definida en un punto único del tiempo (Manual de Metodología de la Investigación, 2024).
Aunque no permiten establecer causalidad temporal estricta, son esenciales para medir prevalencia, razones de prevalencia (\(PR\)), Odds Ratios de prevalencia (\(POR\)) y evaluar asociaciones multivariadas mediante regresión.
En el análisis de potencia a priori, la prueba de hipótesis bajo \(H_0\) sigue una distribución central (p. ej., \(t\) de Student, \(F\) de Snedecor, \(\chi^2\) central o \(Z\) normal). Sin embargo, bajo la hipótesis alternativa \(H_1\), la estadística de prueba sigue una distribución no central desplazada por un parámetro de no centralidad (\(\delta\) para pruebas \(t\) y \(Z\), \(\lambda\) para pruebas \(F\) y \(\chi^2\)) (Faul et al., 2007, 2009):
\[\delta = d \cdot \sqrt{\frac{n_1 \cdot n_2}{n_1 + n_2}}\]
\[\lambda = f^2 \cdot N\]
G*Power calcula con exactitud matemática la probabilidad bajo la densidad no central para determinar el \(N\) exacto sin recurrir a aproximaciones crudas.
Todo cálculo matemático puro de \(N\) obtenido mediante software debe ser ajustado en el protocolo de investigación por dos factores operativos fundamentales:
En encuestas transversales, una proporción de participantes rechazará responder o entregará cuestionarios incompletos. Si la tasa esperada de pérdida/no respuesta es \(k\) (expresada en fracción decimal, p. ej., 15% = 0.15):
\[N_{\text{ajustado}} = \frac{N_{\text{puro}}}{1 - k}\]
Si el muestreo no es aleatorio simple (MAS) sino por conglomerados o multietápico, se debe multiplicar el tamaño muestral por el Efecto de Diseño (\(DEFF\)), el cual compensa la homogeneidad intraconglomerado:
\[N_{\text{complejo}} = N_{\text{ajustado}} \times DEFF\]
GPower es un software de acceso libre desarrollado por la
Christian-Albrechts-Universität Kiel* (Alemania): *
Windows: Descargar el ejecutable .zip,
descomprimir e instalar GPowerSetup.exe. *
macOS: Descargar el archivo .dmg y
arrastrar a la carpeta Aplicaciones.
La pantalla principal de G*Power 3.1 se organiza en cinco módulos de control:
Exact: Pruebas exactas binomiales, Fisher,
correlaciones exactas.t tests: Diferencia de medias (2 grupos), prueba t para
correlación o regresión.F tests: ANOVA, MANOVA, Regresión Lineal Múltiple.Chi2 tests: Tablas de contingencia, bondad de
ajuste.z tests: Regresión logística, comparación de
proporciones Z.A continuación se presentan los escenarios analíticos más frecuentes en investigaciones transversales en ciencias de la salud, detallando los parámetros exactos a ingresar en G*Power y la simulación en R.
Escenario Epidemiológico: Un estudio transversal evalúa la asociación entre el consumo elevado de bebidas energizantes (Exposición) y la presencia de insomnio severo (Evento) en estudiantes universitarios. La literatura previa indica que la prevalencia de insomnio en no consumidores es del 20% (\(p_2 = 0.20\)) y se anticipa un Odds Ratio de \(2.0\) (\(p_1 \approx 0.333\)).
Exact (o
z tests)Proportions: Inequality, two independent groups (Unconditional)A priori: Compute required sample sizeTwo (Dos colas)0.33330.200.050.801 (Grupos
de igual tamaño)[Entrada en G*Power]
p1 = 0.3333 | p2 = 0.20 | alpha = 0.05 | Power = 0.80 | N2/N1 = 1.0
[Salida de G*Power]
Sample size group 1 = 187
Sample size group 2 = 187
Total sample size N = 374
# Simulación de comparación de 2 proporciones en R
h_effect <- 2 * asin(sqrt(0.3333)) - 2 * asin(sqrt(0.20)) # Cohen's h
res_prop <- pwr.2p.test(h = h_effect, sig.level = 0.05, power = 0.80, alternative = "two.sided")
print(res_prop)##
## Difference of proportion power calculation for binomial distribution (arcsine transformation)
##
## h = 0.3035935
## n = 170.3145
## sig.level = 0.05
## power = 0.8
## alternative = two.sided
##
## NOTE: same sample sizes
# Ajuste por 15% de pérdida esperada
n_puro <- ceiling(res_prop$n * 2)
n_ajustado <- ceiling(n_puro / (1 - 0.15))
cat("Tamaño muestral puro (total):", n_puro, "
Tamaño ajustado por 15% de pérdidas:", n_ajustado, "
")## Tamaño muestral puro (total): 341
## Tamaño ajustado por 15% de pérdidas: 402
Escenario Epidemiológico: Se desea evaluar la asociación entre la categoría de actividad física (Baja, Moderada, Alta) y la presencia de Síndrome Metabólico (Ausente, Pre-SM, Presente) en una tabla \(3 \times 3\).
Chi2 testsGoodness-of-fit tests: Contingency tablesA priori: Compute required sample size0.30 (Efecto intermedio
según Cohen, 1988)0.050.80Conversión desde \(V\) de Cramér: Si se reporta la \(V\) de Cramér de la literatura: \(w = V \cdot \sqrt{\min(r-1, c-1)} = V \cdot \sqrt{2}\).
# Verificación en R usando el paquete pwr
res_chisq <- pwr.chisq.test(w = 0.30, df = 4, sig.level = 0.05, power = 0.80)
print(res_chisq)##
## Chi squared power calculation
##
## w = 0.3
## N = 132.6143
## df = 4
## sig.level = 0.05
## power = 0.8
##
## NOTE: N is the number of observations
## Tamaño muestral necesario (N total): 133
Escenario Epidemiológico: Comparar los niveles promedio de proteina C reactiva (PCR en mg/L) entre pacientes con diagnóstico de hígado graso no alcohólico (Expuestos) y controles sanos (No expuestos) en un diseño transversal.
t testsMeans: Difference between two independent means (two groups)A priori: Compute required sample sizeTwo0.50 (Diferencia media
estandarizada moderada: \(d = \frac{\mu_1 -
\mu_2}{\sigma}\))0.050.801res_ttest <- pwr.t.test(d = 0.50, sig.level = 0.05, power = 0.80, type = "two.sample", alternative = "two.sided")
print(res_ttest)##
## Two-sample t test power calculation
##
## n = 63.76561
## d = 0.5
## sig.level = 0.05
## power = 0.8
## alternative = two.sided
##
## NOTE: n is number in *each* group
cat("Muestra necesaria por grupo:", ceiling(res_ttest$n), "| Muestra total:", ceiling(res_ttest$n * 2), "
")## Muestra necesaria por grupo: 64 | Muestra total: 128
Escenario Epidemiológico: Comparación de la puntuación continua de calidad de vida (SF-36) entre estudiantes de cuatro facultades distintas (Medicina, Odontología, Enfermería, Psicología).
F testsANOVA: Fixed effects, omnibus, one-wayA priori: Compute required sample size0.25 (Efecto medio de
Cohen)0.050.804##
## Balanced one-way analysis of variance power calculation
##
## k = 4
## n = 44.59927
## f = 0.25
## sig.level = 0.05
## power = 0.8
##
## NOTE: n is number in each group
## Muestra por grupo: 45 | Muestra total: 179
Escenario Epidemiológico: En un estudio transversal se evalúa la asociación entre el consumo de alimentos ultraprocesados (Exposición dicotómica \(X_1\)) y la presencia de hipertensión arterial (\(Y = 1\)), ajustando por variables de confusión como edad, sexo y tabaquismo mediante regresión logística.
z testsLogistic regressionA priori: Compute required sample sizeTwo1.8 (Razón de
probabilidades esperada para la exposición principal)0.15 (Prevalencia
basal del evento en no expuestos)0.050.800.20 (Varianza de la exposición explicada por las demás
covariables de confusión en el modelo)Binomial (o
Normal según el tipo de variable)0.30 (30% de prevalencia de la exposición)Nota Metodológica: El parámetro \(R^2 \text{ other } X\) penaliza el tamaño muestral debido a la colinealidad con otros confusores. A mayor colinealidad, mayor es el \(N\) necesario para detectar el efecto independiente del factor de riesgo.
Escenario Epidemiológico: Determinar los factores asociados a la presión arterial sistólica (variable continua \(Y\)) utilizando 5 covariables o predictores (\(X_1, X_2, \dots, X_5\)).
F testsLinear multiple regression: Fixed model, R² deviation from zeroA priori0.15 (Efecto
medio, donde \(f^2 = \frac{R^2}{1 -
R^2}\))0.050.805# f2 = R2 / (1 - R2). Si R2 = 0.13, f2 = 0.13 / 0.87 = 0.15
res_reg <- pwr.f2.test(u = 5, f2 = 0.15, sig.level = 0.05, power = 0.80)
print(res_reg)##
## Multiple regression power calculation
##
## u = 5
## v = 85.21369
## f2 = 0.15
## sig.level = 0.05
## power = 0.8
cat("Grados de libertad del error (v):", ceiling(res_reg$v), "
Tamaño muestral N total (v + u + 1):", ceiling(res_reg$v + 5 + 1), "
")## Grados de libertad del error (v): 86
## Tamaño muestral N total (v + u + 1): 92
Una buena práctica en el protocolo de investigación es presentar una curva de potencia (Power Plot) que muestre cómo varía el tamaño muestral requerido en función de diferentes niveles de potencia (\(80\%, 85\%, 90\%, 95\%\)) y distintos tamaños de efecto.
library(ggplot2)
# Crear dataset de simulación para t-test con d = 0.3, 0.5, 0.8
powers <- seq(0.50, 0.95, by = 0.01)
grid <- expand.grid(power = powers, d = c(0.2, 0.5, 0.8))
grid$n_group <- apply(grid, 1, function(row) {
pwr.t.test(d = row["d"], power = row["power"], sig.level = 0.05)$n
})
grid$N_total <- ceiling(grid$n_group * 2)
grid$Efecto <- factor(grid$d, labels = c("Pequeño (d=0.2)", "Medio (d=0.5)", "Grande (d=0.8)"))
ggplot(grid, aes(x = power, y = N_total, color = Efecto)) +
geom_line(size = 1.2) +
theme_minimal(base_size = 13) +
labs(
title = "Curva de Potencia: Tamaño Muestral vs. Potencia Estadística",
subtitle = "Prueba t de Student para 2 grupos independientes (alpha = 0.05)",
x = "Potencia Estadística (1 - beta)",
y = "Tamaño Muestral Total Requerido (N)",
color = "Tamaño del Efecto"
) +
scale_color_manual(values = c("#e74c3c", "#3498db", "#2ecc71")) +
geom_hline(yintercept = 128, linetype = "dashed", color = "gray50")La siguiente tabla resume los indicadores de tamaño de efecto y las familias correspondientes en G*Power para estudios transversales:
| Diseño / Prueba | Familia G*Power | Prueba Específica | Indicador de Efecto | Valor Pequeño | Valor Medio | Valor Grande |
|---|---|---|---|---|---|---|
| 2 Proporciones (\(2 \times 2\)) | Exact / z tests |
Proportions: 2 independent groups | \(h\) de Cohen / \(OR\) / \(PR\) | \(h = 0.20\) (\(OR \approx 1.5\)) | \(h = 0.50\) (\(OR \approx 2.5\)) | \(h = 0.80\) (\(OR \approx 4.0\)) |
| Tablas Contingencia (\(r \times c\)) | Chi2 tests |
Contingency tables | \(w\) de Cohen / \(V\) Cramér | \(w = 0.10\) | \(w = 0.30\) | \(w = 0.50\) |
| 2 Medias Continuas | t tests |
Means: 2 independent groups | \(d\) de Cohen | \(d = 0.20\) | \(d = 0.50\) | \(d = 0.80\) |
| \(>2\) Medias Continuas | F tests |
ANOVA: One-way | \(f\) de Cohen | \(f = 0.10\) | \(f = 0.25\) | \(f = 0.40\) |
| Regresión Logística | z tests |
Logistic regression | \(OR\) ajustado + \(R^2\) otros | \(OR = 1.3\) | \(OR = 1.8\) | \(OR = 2.5\) |
| Regresión Múltiple | F tests |
Linear regression: \(R^2\) deviation | \(f^2\) de Cohen | \(f^2 = 0.02\) | \(f^2 = 0.15\) | \(f^2 = 0.35\) |
De acuerdo con la directriz STROBE (ítem 10: Tamaño muestral) y las normas SAMPL, la justificación del tamaño muestral en el protocolo de investigación debe incluir todos los supuestos de cálculo:
Plantilla de Redacción para Protocolo / Manuscrito:
“El tamaño muestral se calculó a priori utilizando el software GPower (versión 3.1.9.7; Faul et al., 2007). Para evaluar la asociación entre [Variable de Exposición] y [Variable de Resultado], se asumió un contraste de [dos colas / una cola] con un nivel de significancia \(\alpha = 0.05\) y una potencia estadística \((1 - \beta) = 0.80\). Basándonos en estudios previos ([Cita de referencia]), se anticipó un [Odds Ratio / Diferencia de Medias / Tasa de Prevalencia] de [Valor], correspondiente a un tamaño de efecto [pequeño / medio / grande] de [d / w / f / OR = X]. El cálculo a priori determinó un tamaño mínimo de \(N = [X]\) participantes. Asumiendo una tasa estimada de no respuesta/pérdida del [K]%, el tamaño muestral final ajustado se fijó en \(N = [X_{ajustado}]\) participantes [si aplica: considerando un Efecto de Diseño DEFF = X por muestreo complejo, resultando en N_final = Y].”*