Una empresa compra cada semana miles de envases a un proveedor. El contrato exige que el contenido promedio sea de 500 gramos. Revisar todos los envases sería costoso y retrasaría la operación, así que control de calidad selecciona una muestra.
La muestra arroja un promedio de 496 gramos.
¿El proveedor está incumpliendo o la diferencia puede explicarse por la variación natural de una muestra?
Esa pregunta resume el problema central de una prueba de hipótesis: tomar una decisión sobre una población usando información parcial.
La estadística no elimina la incertidumbre. Permite tomar decisiones reconociendo esa incertidumbre y controlando la probabilidad de equivocarse.
Al finalizar esta sección, el estudiante podrá:
Una muestra cambia de una selección a otra. Si se toman varias muestras aleatorias de la misma población, sus medias, proporciones y demás resultados no serán exactamente iguales. Esta variación recibe el nombre de error de muestreo y no implica necesariamente que el estudio esté mal hecho.
Considere una moneda equilibrada. La probabilidad de obtener cara es 0.5, pero eso no obliga a que en 10 lanzamientos aparezcan exactamente 5 caras. Podrían observarse 4, 6 o incluso 8 caras sin que la moneda esté alterada.
set.seed(410)
# Número de caras en 5.000 experimentos de 10 lanzamientos
caras <- rbinom(n = 5000, size = 10, prob = 0.5)
tabla <- table(caras)
barplot(tabla,
col = "#2374AB",
border = NA,
xlab = "Número de caras en 10 lanzamientos",
ylab = "Frecuencia",
main = "Una moneda equilibrada no siempre produce 5 caras")La simulación muestra que un resultado diferente de 5 no demuestra, por sí solo, que la moneda esté alterada. La pregunta correcta es:
¿La diferencia observada es razonable bajo la afirmación inicial o es demasiado grande para atribuirla al azar?
Esta misma lógica se aplica a ventas, tiempos de espera, costos, satisfacción de clientes, productividad y control de calidad.
Antes de formular una prueba, es necesario distinguir cuatro elementos:
| Concepto | Significado | Ejemplo empresarial |
|---|---|---|
| Población | Totalidad de unidades sobre las que se desea concluir | Todos los pedidos entregados durante el trimestre |
| Parámetro | Característica numérica de la población | Tiempo promedio real de entrega, \(\mu\) |
| Muestra | Subconjunto observado de la población | 80 pedidos seleccionados aleatoriamente |
| Estadístico | Valor calculado con la muestra | Tiempo promedio de los 80 pedidos, \(\bar{x}\) |
El parámetro normalmente es desconocido. El estadístico es observable y se utiliza como evidencia para evaluar una afirmación sobre el parámetro.
Las hipótesis se formulan con parámetros poblacionales, como \(\mu\) o \(p\). No deben formularse con resultados muestrales como \(\bar{x}\) o \(\hat p\).
Una hipótesis estadística es una afirmación verificable acerca de un parámetro o de una característica de una población.
Por ejemplo:
En toda prueba se enfrentan dos afirmaciones:
La igualdad se incluye en \(H_0\) porque el procedimiento necesita un valor específico de referencia para construir la distribución de los resultados muestrales.
Una facultad consumía en promedio 3.200 kWh mensuales. Después de instalar equipos más eficientes, desea determinar si el consumo promedio disminuyó.
El parámetro es \(\mu\), consumo promedio mensual después de la intervención.
\[H_0:\mu\geq 3200\] \[H_1:\mu<3200\]
La expresión “disminuyó” determina una prueba de cola izquierda. La afirmación que la institución desea respaldar se encuentra en \(H_1\).
Una tienda registraba un gasto promedio de 145.000 pesos por compra. La gerencia desea investigar si el comportamiento cambió, sin anticipar si aumentó o disminuyó.
\[H_0:\mu=145\,000\] \[H_1:\mu\neq145\,000\]
Como interesa cualquier cambio, la prueba es de dos colas.
La dirección se decide a partir de la pregunta de investigación, antes de examinar el resultado de la muestra.
| Lo que se desea demostrar | Hipótesis alternativa | Región donde aparecería la evidencia |
|---|---|---|
| Disminución | \(H_1:\mu<\mu_0\) | Cola izquierda |
| Aumento | \(H_1:\mu>\mu_0\) | Cola derecha |
| Cualquier cambio | \(H_1:\mu\neq\mu_0\) | Dos colas |
La misma estructura se utiliza con una proporción poblacional \(p\).
Una empresa promete entregar a tiempo al menos 92% de sus pedidos. Auditoría sospecha que la proporción real es inferior.
El parámetro es \(p\), proporción poblacional de pedidos entregados a tiempo.
\[H_0:p\geq0.92\] \[H_1:p<0.92\]
Es una prueba de cola izquierda. En los cálculos posteriores se utilizará como valor de referencia la frontera \(p_0=0.92\).
Una prueba estadística es un procedimiento que utiliza una muestra para decidir si existe evidencia suficiente para rechazar una afirmación sobre la población.
No se trata de demostrar una hipótesis con certeza absoluta. Se analiza qué tan compatible es el resultado muestral con \(H_0\).
El estadístico de prueba mide la distancia entre el resultado observado y el valor planteado en \(H_0\), utilizando como unidad el error estándar:
\[ \text{Estadístico de prueba}= \frac{\text{resultado observado}-\text{valor planteado en }H_0} {\text{error estándar}}. \]
Un resultado cercano a cero es compatible con \(H_0\). Un resultado muy alejado de cero puede constituir evidencia en su contra. La dirección considerada “extrema” depende de \(H_1\).
En ambos enfoques la conclusión debe ser la misma.
Si el valor \(p\leq\alpha\), se rechaza \(H_0\). Si el valor \(p>\alpha\), no se rechaza \(H_0\).
El valor \(p\) no es la probabilidad de que \(H_0\) sea verdadera. Es una probabilidad calculada suponiendo que \(H_0\) es verdadera.
Siguiendo la secuencia de Levin y Rubin, el proceso puede resumirse en cinco pasos:
En esta sección interesa comprender la lógica de los pasos. En las siguientes secciones se estudiarán las fórmulas y distribuciones para medias y proporciones.
En una distribución normal estándar, la mayor parte de los resultados se concentra alrededor de cero. Por eso, expresar una diferencia en errores estándar permite juzgar si es habitual o poco probable bajo \(H_0\).
Una organización decide rechazar una afirmación cuando el resultado se encuentra a más de 1.75 errores estándar, en cualquier dirección. Si \(H_0\) es verdadera, ¿cuál es la probabilidad de rechazarla?
## [1] 0.08011831
La probabilidad total en las dos colas es aproximadamente 0.0801. Por tanto, este criterio implica un riesgo de error tipo I cercano a 8.01%.
¿Cuántos errores estándar deben dejarse alrededor del valor planteado para conservar 98% de probabilidad en la región central?
## [1] 2.326348
Debe utilizarse aproximadamente \(\pm2.326\) errores estándar. El 2% restante queda dividido en dos colas de 1% cada una.
Una empresa sostiene que sus clientes esperan en promedio 20 minutos. En una muestra se obtiene un promedio de 24 minutos.
¿Cuatro minutos bastan para rechazar la afirmación?
No es posible decidir únicamente con la diferencia de cuatro minutos. También se necesita conocer la variabilidad y el tamaño de la muestra.
Una diferencia debe juzgarse en relación con su error estándar, no solamente en sus unidades originales.
La realidad poblacional es desconocida para quien toma la decisión, pero conceptualmente pueden ocurrir cuatro resultados:
| Realidad | No se rechaza \(H_0\) | Se rechaza \(H_0\) |
|---|---|---|
| \(H_0\) es verdadera | Decisión correcta | Error tipo I |
| \(H_0\) es falsa | Error tipo II | Decisión correcta |
Se comete un error tipo I cuando se rechaza una hipótesis nula que en realidad es verdadera.
\[P(\text{error tipo I})=\alpha\]
Ejemplos:
Se comete un error tipo II cuando no se rechaza una hipótesis nula que en realidad es falsa.
\[P(\text{error tipo II})=\beta\]
Ejemplos:
La potencia es la probabilidad de detectar un cambio cuando ese cambio realmente existe:
\[\text{Potencia}=1-\beta\]
Una prueba con poca potencia puede no detectar diferencias importantes. Aumentar el tamaño de la muestra suele incrementar la potencia.
El nivel de significancia \(\alpha\) es la probabilidad máxima de error tipo I que se decide tolerar. Valores habituales son 0.10, 0.05 y 0.01, pero no existe un valor universalmente correcto.
La elección depende de las consecuencias:
Con un tamaño de muestra fijo, reducir \(\alpha\) suele aumentar \(\beta\). No se pueden hacer desaparecer ambos riesgos por decreto; para reducirlos simultáneamente suele ser necesario aumentar la información disponible.
Una entidad financiera utiliza una prueba para detectar si la tasa de mora superó el límite aceptable. Se plantea:
\[H_0:p\leq p_0 \qquad H_1:p>p_0\]
Error tipo I: concluir que la mora superó el límite cuando en realidad no lo hizo. La entidad podría endurecer innecesariamente la aprobación de créditos y perder clientes.
Error tipo II: no detectar que la mora realmente superó el límite. La entidad mantendría una política riesgosa y podría aumentar sus pérdidas.
La elección de \(\alpha\) no debe hacerse por costumbre. Debe considerar cuál error produce consecuencias más graves y si el tamaño de muestra permite mantener una potencia adecuada.
Suponga que \(H_0\) es verdadera y que una variable tiene media 100 y desviación estándar 15. Se toman repetidamente muestras de 36 observaciones. En una prueba de dos colas con \(\alpha=0.05\), se rechaza \(H_0\) cuando el promedio queda a más de 1.96 errores estándar de 100.
set.seed(410)
mu0 <- 100
sigma <- 15
n <- 36
repeticiones <- 10000
medias <- replicate(
repeticiones,
mean(rnorm(n, mean = mu0, sd = sigma))
)
z <- (medias - mu0) / (sigma / sqrt(n))
rechazo <- abs(z) > 1.96
mean(rechazo)## [1] 0.0475
El resultado será cercano a 0.05. Es decir, aunque \(H_0\) es verdadera en todas las simulaciones, aproximadamente 5% de las muestras conducen a rechazarla. Eso es el error tipo I en acción: no es un fallo del programa, es el riesgo definido por la prueba.
colores <- ifelse(rechazo, "#F28E2B", "#2374AB")
plot(z[1:500],
pch = 19,
col = colores[1:500],
xlab = "Muestra simulada",
ylab = "Estadístico Z",
main = "Algunas muestras llevan a rechazar una H0 verdadera")
abline(h = c(-1.96, 1.96), lty = 2, lwd = 2, col = "#B22222")
legend("topright",
legend = c("No se rechaza H0", "Error tipo I"),
col = c("#2374AB", "#F28E2B"),
pch = 19,
bty = "n")Una conclusión completa contiene tres elementos:
Con un nivel de significancia de 5%, existe evidencia estadística suficiente para concluir que el tiempo promedio de atención disminuyó.
Con un nivel de significancia de 5%, la muestra no aporta evidencia suficiente para concluir que el tiempo promedio de atención disminuyó.
No se debe escribir “se comprobó que \(H_0\) es verdadera”. Tampoco “se acepta definitivamente \(H_0\)”. Una muestra puede no detectar un cambio que realmente existe.
Una organización afirma que sus empleados necesitan en promedio 18 horas para completar una capacitación. Un nuevo diseño busca reducir ese tiempo.
Parámetro: \(\mu\), tiempo promedio con el nuevo diseño.
\[H_0:\mu\geq18 \qquad H_1:\mu<18\]
La prueba es de cola izquierda. Un error tipo I sería concluir que el nuevo diseño reduce el tiempo cuando realmente no lo hace. Un error tipo II sería no detectar una reducción real.
La participación histórica de una marca es 30%. La empresa desea saber si la participación cambió después de una campaña.
Parámetro: \(p\), proporción poblacional que prefiere la marca después de la campaña.
\[H_0:p=0.30 \qquad H_1:p\neq0.30\]
Es una prueba de dos colas, porque tanto un aumento como una disminución contradicen la estabilidad planteada en \(H_0\).
Una empresa considera aceptable que máximo 2% de las facturas presenten errores. Auditoría busca evidencia de que la tasa real es mayor.
\[H_0:p\leq0.02 \qquad H_1:p>0.02\]
Error tipo I: concluir que el proceso excede el límite cuando realmente cumple. Error tipo II: no detectar que la tasa de errores supera 2%.
Para auditoría, el error tipo II puede ser especialmente costoso porque permitiría que continúe un proceso defectuoso. Sin embargo, esta consecuencia no autoriza a escoger \(\alpha\) después de ver los datos.
Una prueba rechaza \(H_0\) con \(\alpha=0.05\).
La conclusión indica que el resultado observado sería poco compatible con \(H_0\). Aun así, existe riesgo de error tipo I. El valor 0.05 no significa que haya 95% de probabilidad de que \(H_1\) sea verdadera.
En cada situación, identifique el parámetro, formule \(H_0\) y \(H_1\), determine el tipo de prueba y explique los errores tipo I y II cuando corresponda.
1. Incertidumbre. Explique por qué dos muestras aleatorias tomadas de la misma población pueden conducir a resultados diferentes. ¿Por qué esto obliga a hablar de probabilidad al tomar decisiones?
2. Moneda y dado. Describa cómo evaluaría, mediante observaciones repetidas, si una moneda está equilibrada y si un dado es justo. ¿Qué resultados le parecerían incompatibles con esas afirmaciones?
3. Evidencia muestral. ¿Qué significa rechazar una hipótesis sobre una población utilizando únicamente una muestra? ¿La decisión garantiza que la hipótesis es falsa?
4. Variabilidad. Dos empresas observan una diferencia de 5 unidades entre una media muestral y el valor esperado. En la empresa A la variable casi no cambia; en la empresa B es muy variable. ¿La evidencia tiene la misma fuerza? Justifique.
5. Servicio al cliente. Una compañía afirma que el tiempo promedio de respuesta no supera 6 horas. Los clientes sostienen que tarda más. Formule las hipótesis y determine la dirección de la prueba.
6. Ventas. Las ventas semanales promedio eran de 48 millones de pesos. La gerencia desea determinar si una nueva estrategia las aumentó. Formule las hipótesis y explique un error tipo I y uno tipo II.
7. Satisfacción. Una institución reporta que 80% de sus usuarios está satisfecho. Un equipo independiente desea saber si la proporción es diferente. Formule las hipótesis e identifique el tipo de prueba.
8. Control de calidad. Un lote se rechaza cuando existe evidencia de que su resistencia promedio está por debajo del mínimo requerido. Explique cuál error perjudica al proveedor y cuál puede perjudicar a los clientes.
9. Nivel de significancia. ¿Por qué no debe utilizarse automáticamente el mismo valor de \(\alpha\) en todas las decisiones? Proponga una situación en la que un error tipo I sea más grave y otra en la que sea más grave un error tipo II.
10. Lenguaje de conclusión. Corrija esta afirmación: “Como el valor \(p\) fue 0.18, se demostró que la hipótesis nula tiene 82% de probabilidad de ser verdadera”.
Levin, R. I. y Rubin, D. S. Estadística para administración y economía. Capítulo 8: “Prueba de hipótesis: prueba de una sola muestra”, especialmente las secciones 8.1 a 8.3. Los ejemplos y problemas de esta página son desarrollos originales adaptados al contexto de ciencias administrativas.