Hasta este punto ya conocemos la lógica general de una prueba de hipótesis: formular una hipótesis nula, plantear una hipótesis alternativa, fijar un nivel de significancia y utilizar información muestral para tomar una decisión.
Ahora vamos a responder cuatro preguntas que aparecen de manera recurrente en problemas reales:
El objetivo no es memorizar cuatro fórmulas distintas. El objetivo es aprender a reconocer el problema estadístico y seleccionar el procedimiento adecuado.
Idea central
Una prueba de hipótesis no demuestra que una afirmación sea verdadera o falsa de manera absoluta. Evalúa si los datos observados son suficientemente incompatibles con lo que plantea \(H_0\) como para rechazarla.
Antes de abrir R conviene responder tres preguntas.
¿Qué parámetro estoy estudiando?
Si estudio una media, conozco \(\sigma\)?
¿Qué afirma la hipótesis alternativa?
| Pregunta de investigación | Hipótesis alternativa | Tipo de prueba |
|---|---|---|
| ¿El parámetro disminuyó? | \(H_1:\theta<\theta_0\) | Cola izquierda |
| ¿El parámetro aumentó? | \(H_1:\theta>\theta_0\) | Cola derecha |
| ¿El parámetro cambió? | \(H_1:\theta\neq\theta_0\) | Dos colas |
La cola no se escoge después de mirar los
datos.
La dirección de la prueba se define a partir de la pregunta de
investigación y de \(H_1\).
Supongamos que queremos contrastar una afirmación acerca de una media poblacional:
\[ H_0:\mu=\mu_0 \]
y conocemos \(\sigma\).
Si \(H_0\) fuera verdadera, la distribución muestral de \(\bar X\) estaría centrada en \(\mu_0\) y tendría error estándar:
\[ SE_{\bar X}=\frac{\sigma}{\sqrt{n}} \]
Por ello podemos construir:
\[ Z= \frac{\bar X-\mu_0} {\sigma/\sqrt{n}} \]
El estadístico \(Z\) tiene una interpretación directa:
indica cuántos errores estándar separan la media observada del valor planteado por la hipótesis nula.
Una empresa de comercio electrónico tiene un estándar histórico de 48 horas para despachar un pedido. Después de automatizar parte del proceso logístico, la gerencia quiere saber si el tiempo promedio realmente disminuyó.
De registros históricos se conoce que la desviación estándar poblacional es de 6 horas. Se seleccionan aleatoriamente 64 pedidos procesados después de la mejora y se obtiene una media de 46.5 horas.
Se trabajará con:
\[ \alpha=0.05 \]
El parámetro es:
\[ \mu=\text{tiempo medio poblacional de despacho} \]
La pregunta es si el tiempo disminuyó, por tanto:
\[ H_0:\mu=48 \]
\[ H_1:\mu<48 \]
Es una prueba de cola izquierda.
\[ SE= \frac{6}{\sqrt{64}} = 0.75 \]
Esto significa que, si realmente \(\mu=48\), las medias obtenidas en muestras de 64 pedidos fluctuarían alrededor de 48 horas con una desviación estándar de aproximadamente 0.75 horas.
\[ Z= \frac{46.5-48}{0.75} = -2 \]
La media observada está dos errores estándar por debajo de lo que esperaríamos si \(H_0\) fuera verdadera.
mu0 <- 48
sigma <- 6
n <- 64
x_barra <- 46.5
alpha <- 0.05
SE <- sigma / sqrt(n)
z_obs <- (x_barra - mu0) / SE
z_critico <- qnorm(alpha)
p_valor <- pnorm(z_obs)
x_critico <- mu0 + z_critico * SE
c(
error_estandar = SE,
z_observado = z_obs,
z_critico = z_critico,
media_critica = x_critico,
p_valor = p_valor
)## error_estandar z_observado z_critico media_critica p_valor
## 0.75000000 -2.00000000 -1.64485363 46.76635978 0.02275013
La región crítica comienza en:
\[ z_{0.05}\approx -1.645 \]
Como:
\[ -2<-1.645 \]
el estadístico observado cae en la región de rechazo.
grafica_normal_prueba(
z_obs = z_obs,
alpha = alpha,
alternativa = "less",
titulo = "Tiempo promedio de despacho: prueba de cola izquierda"
)La zona sombreada representa resultados que serían suficientemente extremos para rechazar \(H_0\) utilizando \(\alpha=0.05\).
La línea azul muestra el resultado observado:
\[ Z=-2 \]
Como se encuentra dentro de la región crítica, rechazamos \(H_0\).
El valor-p es:
## [1] 0.02275013
Aproximadamente:
\[ p\text{-valor}=0.0228 \]
Como:
\[ 0.0228<0.05 \]
rechazamos \(H_0\).
Conclusión en contexto
Al nivel de significancia del 5 %, existe evidencia estadística suficiente para concluir que el tiempo medio de despacho después de la mejora tecnológica es inferior a 48 horas.
El valor-p no es la probabilidad de que \(H_0\) sea verdadera.
En este ejemplo significa:
suponiendo que el verdadero tiempo medio siga siendo 48 horas, la probabilidad de obtener una media muestral tan pequeña como 46.5 horas, o todavía menor, es aproximadamente 2.28 %.
Un valor tan pequeño hace que la muestra resulte poco compatible con \(H_0\).
En una prueba de hipótesis podemos razonar de dos maneras.
Método de región crítica
Se compara el estadístico observado con uno o más valores críticos.
Para una prueba de cola izquierda:
\[ \text{Rechazar }H_0 \quad\text{si}\quad Z<z_\alpha \]
Método del valor-p
Se calcula la probabilidad de observar un resultado igual o más extremo que el obtenido, suponiendo que \(H_0\) es verdadera.
\[ \text{Rechazar }H_0 \quad\text{si}\quad p\text{-valor}<\alpha \]
Ambos procedimientos deben llevar a la misma decisión.
Importante
“No rechazar \(H_0\)” no significa demostrar que \(H_0\) es verdadera. Significa que la muestra no produjo evidencia suficientemente fuerte para rechazarla con el nivel de significancia seleccionado.
Hasta ahora hemos controlado principalmente el error tipo I:
\[ \alpha= P(\text{rechazar }H_0\mid H_0\text{ verdadera}) \]
Pero existe otra posibilidad de error.
\[ \beta= P(\text{no rechazar }H_0\mid H_0\text{ falsa}) \]
La potencia de una prueba es:
\[ 1-\beta \]
y representa la probabilidad de detectar un cambio cuando dicho cambio realmente existe.
| Realidad | No rechazar \(H_0\) | Rechazar \(H_0\) |
|---|---|---|
| \(H_0\) verdadera | Decisión correcta | Error tipo I: \(\alpha\) |
| \(H_0\) falsa | Error tipo II: \(\beta\) | Decisión correcta: potencia \(1-\beta\) |
Nuestra regla fue rechazar \(H_0\) cuando:
\[ Z<-1.645 \]
En la escala original, esto equivale a rechazar \(H_0\) cuando la media muestral sea menor que:
\[ \bar x_c = 48+ (-1.645) \left( \frac{6}{\sqrt{64}} \right) \]
mu0 <- 48
sigma <- 6
n <- 64
alpha <- 0.05
SE <- sigma / sqrt(n)
z_critico <- qnorm(alpha)
x_critico <- mu0 + z_critico * SE
x_critico## [1] 46.76636
La frontera es aproximadamente:
\[ \bar x_c=46.766 \]
Ahora supongamos que la automatización sí funcionó y que la verdadera media poblacional pasó a ser:
\[ \mu_1=46.5 \]
La pregunta cambia:
Si la verdadera media fuera 46.5 horas, ¿cuál sería la probabilidad de que nuestra prueba detectara la reducción?
Esto es:
\[ P(\bar X<46.766\mid\mu=46.5) \]
mu1 <- 46.5
potencia <- pnorm(
x_critico,
mean = mu1,
sd = SE
)
beta <- 1 - potencia
c(
potencia = potencia,
beta = beta
)## potencia beta
## 0.63876 0.36124
La potencia es aproximadamente:
\[ 1-\beta=0.639 \]
Es decir, si la verdadera media hubiera bajado a 46.5 horas, esta prueba tendría cerca de 63.9 % de probabilidad de detectar la reducción.
La siguiente gráfica muestra la distribución de \(\bar X\) si \(H_0\) fuera verdadera y la distribución si la media real fuera 46.5.
se <- sigma / sqrt(n)
xx <- seq(44.5, 50.5, length.out = 2000)
dens_h0 <- dnorm(xx, mean = mu0, sd = se)
dens_h1 <- dnorm(xx, mean = mu1, sd = se)
plot(
xx, dens_h0,
type = "l",
lwd = 3,
xlab = "Media muestral de tiempo de despacho",
ylab = "Densidad",
main = "Distribución de la media bajo H0 y bajo una alternativa",
bty = "l",
ylim = c(0, max(dens_h0, dens_h1) * 1.10)
)
lines(xx, dens_h1, lwd = 3, lty = 2)
abline(v = x_critico, lty = 3, lwd = 2)
legend(
"topright",
legend = c(
expression(H[0]*": "*mu==48),
expression(H[1]*": "*mu==46.5),
"Frontera de rechazo"
),
lty = c(1, 2, 3),
lwd = c(3, 3, 2),
bty = "n"
)La frontera de rechazo no cambia. Lo que cambia es la ubicación de la distribución cuando la verdadera media se aleja de 48.
Cuanto más se aleja el valor real de lo planteado por \(H_0\), más fácil resulta detectar la diferencia.
La potencia no es un único número. Depende del valor que realmente tenga el parámetro.
Podemos calcularla para distintos valores posibles de \(\mu\).
mu_reales <- seq(44, 48.5, by = 0.02)
potencia_64 <- pnorm(
x_critico,
mean = mu_reales,
sd = sigma / sqrt(64)
)
n_grande <- 144
SE_grande <- sigma / sqrt(n_grande)
x_critico_grande <- mu0 +
qnorm(alpha) * SE_grande
potencia_144 <- pnorm(
x_critico_grande,
mean = mu_reales,
sd = SE_grande
)
plot(
mu_reales,
potencia_64,
type = "l",
lwd = 3,
ylim = c(0, 1),
xlab = expression("Media poblacional verdadera " * mu),
ylab = "Potencia",
main = "Curvas de potencia para dos tamaños de muestra",
bty = "l"
)
lines(
mu_reales,
potencia_144,
lwd = 3,
lty = 2
)
abline(
h = alpha,
lty = 3
)
abline(
v = mu0,
lty = 3
)
legend(
"topright",
legend = c("n = 64", "n = 144"),
lty = c(1, 2),
lwd = 3,
bty = "n"
)Observemos tres ideas.
Primera: cuando la verdadera media está muy cerca de 48, es difícil detectar el cambio.
Segunda: cuando la verdadera media se aleja de 48 en la dirección de \(H_1\), la potencia aumenta.
Tercera: aumentar el tamaño de muestra incrementa la capacidad de detectar diferencias reales.
Por ejemplo, si:
\[ \mu=46.5 \]
tenemos:
potencia_n64 <- pnorm(
x_critico,
mean = 46.5,
sd = sigma / sqrt(64)
)
potencia_n144 <- pnorm(
x_critico_grande,
mean = 46.5,
sd = sigma / sqrt(144)
)
c(
n_64 = potencia_n64,
n_144 = potencia_n144
)## n_64 n_144
## 0.6387600 0.9123145
Con \(n=64\), la potencia es aproximadamente 63.9 %.
Con \(n=144\), aumenta aproximadamente a 91.2 %.
Interpretación práctica
Una muestra mayor no sólo reduce el error estándar. También aumenta la capacidad de una prueba para detectar cambios reales.
Ahora cambia el parámetro.
Supongamos que cada individuo puede clasificarse en dos categorías:
El parámetro de interés es:
\[ p=\text{proporción poblacional} \]
y la estimación muestral es:
\[ \hat p=\frac{x}{n} \]
En términos exactos, el número de éxitos sigue una distribución binomial.
Sin embargo, cuando la muestra es suficientemente grande, la distribución de \(\hat p\) puede aproximarse mediante una distribución normal.
Bajo:
\[ H_0:p=p_0 \]
el error estándar es:
\[ SE_{\hat p} = \sqrt{ \frac{p_0(1-p_0)}{n} } \]
y el estadístico es:
\[ Z= \frac{\hat p-p_0} {\sqrt{p_0(1-p_0)/n}} \]
Para aplicar la aproximación normal verificamos:
\[ np_0\ge5 \]
y
\[ n(1-p_0)\ge5 \]
Cuidado
En el error estándar de una prueba de hipótesis para una proporción se utiliza \(p_0\), no \(\hat p\), porque estamos calculando la variabilidad que esperaríamos si \(H_0\) fuera verdadera.
Antes de una campaña comercial, el 35 % de los clientes utilizaba un servicio digital de la empresa.
Después de la campaña se seleccionan aleatoriamente 250 clientes y se encuentra que 105 utilizan el servicio.
La gerencia desea determinar si la proporción aumentó.
Trabajaremos con:
\[ \alpha=0.05 \]
\[ p_0=0.35 \]
\[ n=250 \]
\[ x=105 \]
La proporción muestral es:
\[ \hat p= \frac{105}{250} = 0.42 \]
Las hipótesis son:
\[ H_0:p=0.35 \]
\[ H_1:p>0.35 \]
Es una prueba de cola derecha.
## [1] 87.5
## [1] 162.5
Obtenemos:
\[ np_0=87.5 \]
y:
\[ n(1-p_0)=162.5 \]
Ambos valores superan ampliamente 5.
alpha <- 0.05
p_hat <- x / n
SE_p <- sqrt(
p0 * (1 - p0) / n
)
z_obs_p <- (p_hat - p0) / SE_p
z_critico_p <- qnorm(1 - alpha)
p_valor_p <- 1 - pnorm(z_obs_p)
c(
proporcion_muestral = p_hat,
error_estandar = SE_p,
z_observado = z_obs_p,
z_critico = z_critico_p,
p_valor = p_valor_p
)## proporcion_muestral error_estandar z_observado z_critico
## 0.42000000 0.03016621 2.32047740 1.64485363
## p_valor
## 0.01015753
El estadístico es aproximadamente:
\[ Z=2.320 \]
y el valor-p:
\[ p\text{-valor}\approx0.0102 \]
Como:
\[ 0.0102<0.05 \]
rechazamos \(H_0\).
grafica_normal_prueba(
z_obs = z_obs_p,
alpha = alpha,
alternativa = "greater",
titulo = "Adopción del servicio digital: prueba de cola derecha"
)La línea azul se encuentra dentro de la región crítica.
Conclusión en contexto
Al nivel de significancia del 5 %, existe evidencia estadística suficiente para concluir que la proporción de clientes que utiliza el servicio digital es superior al 35 %.
R también puede realizar una prueba para una proporción.
##
## 1-sample proportions test without continuity correction
##
## data: 105 out of 250, null probability 0.35
## X-squared = 5.3846, df = 1, p-value = 0.01016
## alternative hypothesis: true p is greater than 0.35
## 95 percent confidence interval:
## 0.3697802 1.0000000
## sample estimates:
## p
## 0.42
La opción:
permite obtener la aproximación normal sin corrección por continuidad, coherente con el desarrollo manual realizado anteriormente.
En muchos problemas reales conocemos:
\[ \bar x \]
y:
\[ s \]
pero no conocemos:
\[ \sigma \]
En ese caso estimamos el error estándar mediante:
\[ \widehat{SE}_{\bar X} = \frac{s}{\sqrt n} \]
y utilizamos:
\[ t= \frac{\bar X-\mu_0} {s/\sqrt n} \]
con:
\[ gl=n-1 \]
grados de libertad.
Cuando sustituimos \(\sigma\) por \(s\), introducimos incertidumbre adicional porque \(s\) también cambia de una muestra a otra.
La distribución \(t\):
xx <- seq(-4, 4, length.out = 1500)
plot(
xx,
dnorm(xx),
type = "l",
lwd = 3,
xlab = "Valor",
ylab = "Densidad",
main = "Normal estándar y distribuciones t",
bty = "l"
)
lines(xx, dt(xx, df = 5), lwd = 2, lty = 2)
lines(xx, dt(xx, df = 15), lwd = 2, lty = 3)
legend(
"topright",
legend = c("Normal", "t con 5 gl", "t con 15 gl"),
lty = c(1, 2, 3),
lwd = c(3, 2, 2),
bty = "n"
)Con pocos grados de libertad, la distribución \(t\) asigna mayor probabilidad a valores alejados del centro. Esto refleja la incertidumbre adicional producida por estimar \(\sigma\).
Una empresa implementó un programa de fidelización. Antes del programa, la gerencia utilizaba como referencia un gasto promedio mensual de $500 000 por cliente.
Después de implementar la estrategia se seleccionan aleatoriamente 16 clientes y se obtiene:
\[ \bar x=\$548\,000 \]
\[ s=\$72\,000 \]
La gerencia quiere determinar si el gasto promedio aumentó.
Trabajaremos con:
\[ \alpha=0.05 \]
\[ H_0:\mu=500000 \]
\[ H_1:\mu>500000 \]
Es una prueba de cola derecha.
Como \(\sigma\) es desconocida y utilizamos \(s\), trabajaremos con una distribución \(t\).
Los grados de libertad son:
\[ gl=n-1=15 \]
mu0 <- 500000
x_barra <- 548000
s <- 72000
n <- 16
alpha <- 0.05
gl <- n - 1
SE_t <- s / sqrt(n)
t_obs <- (x_barra - mu0) / SE_t
t_critico <- qt(
1 - alpha,
df = gl
)
p_valor_t <- 1 - pt(
t_obs,
df = gl
)
c(
grados_libertad = gl,
error_estandar = SE_t,
t_observado = t_obs,
t_critico = t_critico,
p_valor = p_valor_t
)## grados_libertad error_estandar t_observado t_critico p_valor
## 15.000000000 18000.000000000 2.666666667 1.753050356 0.008797577
Obtenemos aproximadamente:
\[ t=2.667 \]
El valor crítico es:
\[ t_{0.95,15}\approx1.753 \]
y:
\[ p\text{-valor}\approx0.0088 \]
grafica_t_prueba(
t_obs = t_obs,
gl = gl,
alpha = alpha,
alternativa = "greater",
titulo = "Gasto promedio mensual: prueba t de cola derecha"
)Como:
\[ 2.667>1.753 \]
el estadístico observado cae dentro de la región de rechazo.
Además:
\[ 0.0088<0.05 \]
por lo que nuevamente rechazamos \(H_0\).
Conclusión en contexto
Al nivel de significancia del 5 %, existe evidencia estadística suficiente para concluir que el gasto promedio mensual de los clientes después del programa de fidelización es superior a $500 000.
En una muestra de tamaño \(n\), las desviaciones respecto de la media cumplen:
\[ \sum_{i=1}^{n}(x_i-\bar x)=0 \]
Una vez conocidas \(n-1\) desviaciones, la última queda determinada por esta restricción.
Por ello, cuando estimamos la variabilidad mediante \(s\), utilizamos:
\[ gl=n-1 \]
No es simplemente una regla para memorizar: representa la cantidad de información independiente disponible para estimar la variabilidad.
| Situación | Parámetro | Información disponible | Estadístico |
|---|---|---|---|
| Media con \(\sigma\) conocida | \(\mu\) | \(\bar x,\mu_0,\sigma,n\) | \(\displaystyle Z=\frac{\bar x-\mu_0}{\sigma/\sqrt n}\) |
| Proporción | \(p\) | \(\hat p,p_0,n\) | \(\displaystyle Z=\frac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}\) |
| Media con \(\sigma\) desconocida | \(\mu\) | \(\bar x,\mu_0,s,n\) | \(\displaystyle t=\frac{\bar x-\mu_0}{s/\sqrt n}\) |
| Potencia | \(\mu\) u otro parámetro | valor alternativo específico | \(1-\beta\) |
Antes de calcular, pregúntese siempre:
Elegir la cola después de conocer el
resultado.
La dirección se define antes de analizar la muestra.
Decir que “se acepta \(H_0\)”.
Es preferible decir que no se rechaza \(H_0\). Ausencia de evidencia contra
\(H_0\) no equivale a demostrarla.
Confundir \(\sigma\) con
\(s\).
\(\sigma\) describe la población; \(s\) se calcula con una muestra.
Interpretar el valor-p como \(P(H_0\text{ es
verdadera})\).
El valor-p se calcula suponiendo que \(H_0\) es verdadera.
Usar \(\hat p\) en el error
estándar de la prueba para una proporción.
Bajo \(H_0\), el error estándar se
construye con \(p_0\).
Confundir significancia estadística con importancia
práctica.
Una diferencia puede ser estadísticamente detectable y, aun así, ser
demasiado pequeña para tener relevancia administrativa.
Una empresa conoce, por registros históricos, que la desviación estándar del tiempo de entrega es de 4 días. Se desea comprobar si el tiempo promedio disminuyó de 20 días.
¿Qué prueba corresponde?
Se estudia una media y se conoce \(\sigma\). Corresponde una prueba \(Z\) de cola izquierda:
\[ H_0:\mu=20 \]
\[ H_1:\mu<20 \]
Una entidad financiera quiere determinar si más del 12 % de sus clientes presenta mora.
¿Qué parámetro se estudia?
Se estudia una proporción poblacional:
\[ p \]
La hipótesis alternativa sería:
\[ H_1:p>0.12 \]
En una muestra de 18 establecimientos se obtiene un ingreso promedio de 42 millones y una desviación estándar muestral de 6 millones. No se conoce \(\sigma\).
¿Qué distribución corresponde?
Corresponde una distribución \(t\) con:
\[ gl=18-1=17 \]
Una prueba tiene una potencia de 0.88 para detectar que la media es 45 cuando \(H_0:\mu=50\).
¿Qué significa?
Si la verdadera media fuera 45, la prueba tendría aproximadamente 88 % de probabilidad de rechazar correctamente \(H_0\).
El error tipo II correspondiente sería:
\[ \beta=1-0.88=0.12 \]
Un centro de atención afirma que el tiempo medio de respuesta es de 12 minutos. Se conoce una desviación estándar poblacional de 3 minutos. Después de una reorganización se toma una muestra de 49 atenciones y se obtiene una media de 11 minutos.
Con \(\alpha=0.05\), determine si existe evidencia de que el tiempo promedio disminuyó.
Desarrolle:
Históricamente, el 18 % de los visitantes de una plataforma realiza una compra. Después de rediseñar el sitio, 104 de 500 visitantes realizaron una compra.
Con \(\alpha=0.05\), determine si la tasa de conversión aumentó.
Antes de realizar la prueba, verifique que la aproximación normal sea adecuada.
Una compañía considera que la facturación promedio por cliente es de $850 000. Se selecciona una muestra aleatoria de 20 clientes y se obtiene:
\[ \bar x=\$910\,000 \]
\[ s=\$140\,000 \]
Con \(\alpha=0.05\), determine si existe evidencia de que la facturación promedio es superior a $850 000.
Considere nuevamente el problema del tiempo de despacho:
\[ H_0:\mu=48 \]
\[ H_1:\mu<48 \]
con:
\[ \sigma=6 \]
y:
\[ \alpha=0.05 \]
Calcule la potencia para detectar una media verdadera de:
\[ \mu=46.5 \]
cuando:
\[ n=36,\quad n=64,\quad n=100,\quad n=144 \]
Construya una gráfica de potencia frente al tamaño de muestra e interprete el resultado.
Las pruebas trabajadas en esta clase pueden parecer diferentes, pero todas responden a la misma lógica:
\[ \text{afirmación sobre la población} \rightarrow \text{evidencia muestral} \rightarrow \text{variabilidad esperada} \rightarrow \text{estadístico de prueba} \rightarrow \text{valor-p} \rightarrow \text{decisión} \]
El cálculo es apenas una parte del procedimiento.
La competencia realmente importante es poder justificar:
Idea final
En inferencia estadística no basta con obtener un valor-p. El objetivo es transformar evidencia muestral en una decisión razonada sobre una población, reconociendo siempre que la decisión se toma bajo incertidumbre.
Levin, R. I. y Rubin, D. S. Estadística para administración y economía. Séptima edición. Pearson Educación. Capítulo 8: Prueba de hipótesis de una sola muestra.