Antes de comenzar: una decisión con información incompleta

Una empresa compra cada semana miles de envases a un proveedor. El contrato exige que el contenido promedio sea de 500 gramos. Revisar todos los envases sería costoso y retrasaría la operación, así que control de calidad selecciona una muestra.

La muestra arroja un promedio de 496 gramos.

¿El proveedor está incumpliendo o la diferencia puede explicarse por la variación natural de una muestra?

Esa pregunta resume el problema central de una prueba de hipótesis: tomar una decisión sobre una población usando información parcial.

La estadística no elimina la incertidumbre. Permite tomar decisiones reconociendo esa incertidumbre y controlando la probabilidad de equivocarse.

Propósito de aprendizaje

Al finalizar esta sección, el estudiante podrá:

  • explicar por qué una decisión estadística nunca está completamente libre de error;
  • diferenciar población, parámetro, muestra y estadístico;
  • formular una hipótesis nula y una hipótesis alternativa;
  • distinguir pruebas de cola izquierda, cola derecha y dos colas;
  • interpretar los errores tipo I y tipo II en situaciones administrativas;
  • explicar el significado del nivel de significancia y la potencia de una prueba;
  • redactar correctamente la conclusión de una prueba de hipótesis.

¿Por qué debemos manejar la incertidumbre?

Una muestra cambia de una selección a otra. Si se toman varias muestras aleatorias de la misma población, sus medias, proporciones y demás resultados no serán exactamente iguales. Esta variación recibe el nombre de error de muestreo y no implica necesariamente que el estudio esté mal hecho.

Considere una moneda equilibrada. La probabilidad de obtener cara es 0.5, pero eso no obliga a que en 10 lanzamientos aparezcan exactamente 5 caras. Podrían observarse 4, 6 o incluso 8 caras sin que la moneda esté alterada.

set.seed(410)

# Número de caras en 5.000 experimentos de 10 lanzamientos
caras <- rbinom(n = 5000, size = 10, prob = 0.5)

tabla <- table(caras)
barplot(tabla,
        col = "#2374AB",
        border = NA,
        xlab = "Número de caras en 10 lanzamientos",
        ylab = "Frecuencia",
        main = "Una moneda equilibrada no siempre produce 5 caras")

La simulación muestra que un resultado diferente de 5 no demuestra, por sí solo, que la moneda esté alterada. La pregunta correcta es:

¿La diferencia observada es razonable bajo la afirmación inicial o es demasiado grande para atribuirla al azar?

Esta misma lógica se aplica a ventas, tiempos de espera, costos, satisfacción de clientes, productividad y control de calidad.

Población, parámetro, muestra y estadístico

Antes de formular una prueba, es necesario distinguir cuatro elementos:

Concepto Significado Ejemplo empresarial
Población Totalidad de unidades sobre las que se desea concluir Todos los pedidos entregados durante el trimestre
Parámetro Característica numérica de la población Tiempo promedio real de entrega, \(\mu\)
Muestra Subconjunto observado de la población 80 pedidos seleccionados aleatoriamente
Estadístico Valor calculado con la muestra Tiempo promedio de los 80 pedidos, \(\bar{x}\)

El parámetro normalmente es desconocido. El estadístico es observable y se utiliza como evidencia para evaluar una afirmación sobre el parámetro.

Las hipótesis se formulan con parámetros poblacionales, como \(\mu\) o \(p\). No deben formularse con resultados muestrales como \(\bar{x}\) o \(\hat p\).

¿Qué es una hipótesis estadística?

Una hipótesis estadística es una afirmación verificable acerca de un parámetro o de una característica de una población.

Por ejemplo:

  • el tiempo promedio de atención es de 12 minutos;
  • la proporción de clientes satisfechos es al menos 85%;
  • el costo promedio disminuyó después de implementar un nuevo proceso;
  • la venta media cambió respecto al año anterior.

En toda prueba se enfrentan dos afirmaciones:

  • Hipótesis nula (\(H_0\)): representa la situación de referencia, el estándar vigente o la ausencia del cambio que se desea demostrar.
  • Hipótesis alternativa (\(H_1\)): representa el cambio, diferencia o efecto que se busca respaldar con la muestra.

La igualdad se incluye en \(H_0\) porque el procedimiento necesita un valor específico de referencia para construir la distribución de los resultados muestrales.

Ejemplo resuelto 1. Reducción del consumo de energía

Una facultad consumía en promedio 3.200 kWh mensuales. Después de instalar equipos más eficientes, desea determinar si el consumo promedio disminuyó.

El parámetro es \(\mu\), consumo promedio mensual después de la intervención.

\[H_0:\mu\geq 3200\] \[H_1:\mu<3200\]

La expresión “disminuyó” determina una prueba de cola izquierda. La afirmación que la institución desea respaldar se encuentra en \(H_1\).

Ejemplo resuelto 2. Cambio en el gasto por cliente

Una tienda registraba un gasto promedio de 145.000 pesos por compra. La gerencia desea investigar si el comportamiento cambió, sin anticipar si aumentó o disminuyó.

\[H_0:\mu=145\,000\] \[H_1:\mu\neq145\,000\]

Como interesa cualquier cambio, la prueba es de dos colas.

Hipótesis alternativa y dirección de la prueba

La dirección se decide a partir de la pregunta de investigación, antes de examinar el resultado de la muestra.

Lo que se desea demostrar Hipótesis alternativa Región donde aparecería la evidencia
Disminución \(H_1:\mu<\mu_0\) Cola izquierda
Aumento \(H_1:\mu>\mu_0\) Cola derecha
Cualquier cambio \(H_1:\mu\neq\mu_0\) Dos colas

La misma estructura se utiliza con una proporción poblacional \(p\).

Ejemplo resuelto 3. Cumplimiento de entregas

Una empresa promete entregar a tiempo al menos 92% de sus pedidos. Auditoría sospecha que la proporción real es inferior.

El parámetro es \(p\), proporción poblacional de pedidos entregados a tiempo.

\[H_0:p\geq0.92\] \[H_1:p<0.92\]

Es una prueba de cola izquierda. En los cálculos posteriores se utilizará como valor de referencia la frontera \(p_0=0.92\).

¿Qué es una prueba estadística?

Una prueba estadística es un procedimiento que utiliza una muestra para decidir si existe evidencia suficiente para rechazar una afirmación sobre la población.

No se trata de demostrar una hipótesis con certeza absoluta. Se analiza qué tan compatible es el resultado muestral con \(H_0\).

El estadístico de prueba mide la distancia entre el resultado observado y el valor planteado en \(H_0\), utilizando como unidad el error estándar:

\[ \text{Estadístico de prueba}= \frac{\text{resultado observado}-\text{valor planteado en }H_0} {\text{error estándar}}. \]

Un resultado cercano a cero es compatible con \(H_0\). Un resultado muy alejado de cero puede constituir evidencia en su contra. La dirección considerada “extrema” depende de \(H_1\).

Dos formas equivalentes de tomar la decisión

  • Enfoque del valor crítico: se compara el estadístico observado con una frontera que separa la región de no rechazo de la región de rechazo.
  • Enfoque del valor \(p\): se compara la probabilidad de obtener un resultado tan extremo o más extremo que el observado con el nivel de significancia \(\alpha\).

En ambos enfoques la conclusión debe ser la misma.

Si el valor \(p\leq\alpha\), se rechaza \(H_0\). Si el valor \(p>\alpha\), no se rechaza \(H_0\).

El valor \(p\) no es la probabilidad de que \(H_0\) sea verdadera. Es una probabilidad calculada suponiendo que \(H_0\) es verdadera.

El proceso de prueba de hipótesis

Siguiendo la secuencia de Levin y Rubin, el proceso puede resumirse en cinco pasos:

  1. Formular \(H_0\) y \(H_1\), identificar las colas y fijar \(\alpha\).
  2. Seleccionar la distribución estadística apropiada y determinar los valores críticos.
  3. Calcular el error estándar y el estadístico de prueba.
  4. Representar la distribución y ubicar el resultado observado.
  5. Tomar la decisión y escribir una conclusión dentro del contexto.

En esta sección interesa comprender la lógica de los pasos. En las siguientes secciones se estudiarán las fórmulas y distribuciones para medias y proporciones.

Errores estándar y resultados poco probables

En una distribución normal estándar, la mayor parte de los resultados se concentra alrededor de cero. Por eso, expresar una diferencia en errores estándar permite juzgar si es habitual o poco probable bajo \(H_0\).

Ejemplo resuelto 5. Criterio de 1.75 errores estándar

Una organización decide rechazar una afirmación cuando el resultado se encuentra a más de 1.75 errores estándar, en cualquier dirección. Si \(H_0\) es verdadera, ¿cuál es la probabilidad de rechazarla?

alpha_175 <- 2 * pnorm(-1.75)
alpha_175
## [1] 0.08011831

La probabilidad total en las dos colas es aproximadamente 0.0801. Por tanto, este criterio implica un riesgo de error tipo I cercano a 8.01%.

Ejemplo resuelto 6. Región central de 98%

¿Cuántos errores estándar deben dejarse alrededor del valor planteado para conservar 98% de probabilidad en la región central?

z_98 <- qnorm(1 - 0.02 / 2)
z_98
## [1] 2.326348

Debe utilizarse aproximadamente \(\pm2.326\) errores estándar. El 2% restante queda dividido en dos colas de 1% cada una.

Ejemplo resuelto 4. Una diferencia grande no siempre prueba un cambio

Una empresa sostiene que sus clientes esperan en promedio 20 minutos. En una muestra se obtiene un promedio de 24 minutos.

¿Cuatro minutos bastan para rechazar la afirmación?

No es posible decidir únicamente con la diferencia de cuatro minutos. También se necesita conocer la variabilidad y el tamaño de la muestra.

  • Si los tiempos suelen variar muy poco y la muestra es grande, cuatro minutos pueden ser una diferencia difícil de explicar por azar.
  • Si los tiempos son muy variables o la muestra es pequeña, la misma diferencia puede ser razonable por error de muestreo.

Una diferencia debe juzgarse en relación con su error estándar, no solamente en sus unidades originales.

Las cuatro decisiones posibles

La realidad poblacional es desconocida para quien toma la decisión, pero conceptualmente pueden ocurrir cuatro resultados:

Realidad No se rechaza \(H_0\) Se rechaza \(H_0\)
\(H_0\) es verdadera Decisión correcta Error tipo I
\(H_0\) es falsa Error tipo II Decisión correcta

Error tipo I

Se comete un error tipo I cuando se rechaza una hipótesis nula que en realidad es verdadera.

\[P(\text{error tipo I})=\alpha\]

Ejemplos:

  • concluir que una campaña aumentó las ventas cuando realmente no produjo cambios;
  • sancionar a un proveedor que sí cumple el estándar;
  • retirar un producto cuyo contenido promedio sí satisface la norma.

Error tipo II

Se comete un error tipo II cuando no se rechaza una hipótesis nula que en realidad es falsa.

\[P(\text{error tipo II})=\beta\]

Ejemplos:

  • concluir que no hay aumento en la morosidad cuando realmente sí lo hay;
  • mantener un proceso que está produciendo por debajo del estándar;
  • no detectar que la satisfacción de los clientes disminuyó.

Potencia

La potencia es la probabilidad de detectar un cambio cuando ese cambio realmente existe:

\[\text{Potencia}=1-\beta\]

Una prueba con poca potencia puede no detectar diferencias importantes. Aumentar el tamaño de la muestra suele incrementar la potencia.

El nivel de significancia

El nivel de significancia \(\alpha\) es la probabilidad máxima de error tipo I que se decide tolerar. Valores habituales son 0.10, 0.05 y 0.01, pero no existe un valor universalmente correcto.

La elección depende de las consecuencias:

  • Si un error tipo I es muy costoso, conviene utilizar un \(\alpha\) menor.
  • Si no detectar un problema real es más grave, puede ser necesario aumentar la sensibilidad de la prueba, mejorar el tamaño muestral o revisar el equilibrio entre \(\alpha\) y \(\beta\).

Con un tamaño de muestra fijo, reducir \(\alpha\) suele aumentar \(\beta\). No se pueden hacer desaparecer ambos riesgos por decreto; para reducirlos simultáneamente suele ser necesario aumentar la información disponible.

Ejemplo resuelto 7. ¿Cuál error preocupa más?

Una entidad financiera utiliza una prueba para detectar si la tasa de mora superó el límite aceptable. Se plantea:

\[H_0:p\leq p_0 \qquad H_1:p>p_0\]

Error tipo I: concluir que la mora superó el límite cuando en realidad no lo hizo. La entidad podría endurecer innecesariamente la aprobación de créditos y perder clientes.

Error tipo II: no detectar que la mora realmente superó el límite. La entidad mantendría una política riesgosa y podría aumentar sus pérdidas.

La elección de \(\alpha\) no debe hacerse por costumbre. Debe considerar cuál error produce consecuencias más graves y si el tamaño de muestra permite mantener una potencia adecuada.

Una simulación del error tipo I

Suponga que \(H_0\) es verdadera y que una variable tiene media 100 y desviación estándar 15. Se toman repetidamente muestras de 36 observaciones. En una prueba de dos colas con \(\alpha=0.05\), se rechaza \(H_0\) cuando el promedio queda a más de 1.96 errores estándar de 100.

set.seed(410)

mu0 <- 100
sigma <- 15
n <- 36
repeticiones <- 10000

medias <- replicate(
  repeticiones,
  mean(rnorm(n, mean = mu0, sd = sigma))
)

z <- (medias - mu0) / (sigma / sqrt(n))
rechazo <- abs(z) > 1.96

mean(rechazo)
## [1] 0.0475

El resultado será cercano a 0.05. Es decir, aunque \(H_0\) es verdadera en todas las simulaciones, aproximadamente 5% de las muestras conducen a rechazarla. Eso es el error tipo I en acción: no es un fallo del programa, es el riesgo definido por la prueba.

colores <- ifelse(rechazo, "#F28E2B", "#2374AB")

plot(z[1:500],
     pch = 19,
     col = colores[1:500],
     xlab = "Muestra simulada",
     ylab = "Estadístico Z",
     main = "Algunas muestras llevan a rechazar una H0 verdadera")
abline(h = c(-1.96, 1.96), lty = 2, lwd = 2, col = "#B22222")
legend("topright",
       legend = c("No se rechaza H0", "Error tipo I"),
       col = c("#2374AB", "#F28E2B"),
       pch = 19,
       bty = "n")

Cómo redactar la conclusión

Una conclusión completa contiene tres elementos:

  1. el nivel de significancia utilizado;
  2. la decisión estadística;
  3. la interpretación dentro del problema.

Si se rechaza la hipótesis nula

Con un nivel de significancia de 5%, existe evidencia estadística suficiente para concluir que el tiempo promedio de atención disminuyó.

Si no se rechaza la hipótesis nula

Con un nivel de significancia de 5%, la muestra no aporta evidencia suficiente para concluir que el tiempo promedio de atención disminuyó.

No se debe escribir “se comprobó que \(H_0\) es verdadera”. Tampoco “se acepta definitivamente \(H_0\)”. Una muestra puede no detectar un cambio que realmente existe.

Problemas resueltos de formulación e interpretación

Problema resuelto 1. Tiempo de capacitación

Una organización afirma que sus empleados necesitan en promedio 18 horas para completar una capacitación. Un nuevo diseño busca reducir ese tiempo.

Parámetro: \(\mu\), tiempo promedio con el nuevo diseño.

\[H_0:\mu\geq18 \qquad H_1:\mu<18\]

La prueba es de cola izquierda. Un error tipo I sería concluir que el nuevo diseño reduce el tiempo cuando realmente no lo hace. Un error tipo II sería no detectar una reducción real.

Problema resuelto 2. Preferencia por una marca

La participación histórica de una marca es 30%. La empresa desea saber si la participación cambió después de una campaña.

Parámetro: \(p\), proporción poblacional que prefiere la marca después de la campaña.

\[H_0:p=0.30 \qquad H_1:p\neq0.30\]

Es una prueba de dos colas, porque tanto un aumento como una disminución contradicen la estabilidad planteada en \(H_0\).

Problema resuelto 3. Exactitud de facturación

Una empresa considera aceptable que máximo 2% de las facturas presenten errores. Auditoría busca evidencia de que la tasa real es mayor.

\[H_0:p\leq0.02 \qquad H_1:p>0.02\]

Error tipo I: concluir que el proceso excede el límite cuando realmente cumple. Error tipo II: no detectar que la tasa de errores supera 2%.

Para auditoría, el error tipo II puede ser especialmente costoso porque permitiría que continúe un proceso defectuoso. Sin embargo, esta consecuencia no autoriza a escoger \(\alpha\) después de ver los datos.

Problema resuelto 4. Rechazar no significa certeza

Una prueba rechaza \(H_0\) con \(\alpha=0.05\).

La conclusión indica que el resultado observado sería poco compatible con \(H_0\). Aun así, existe riesgo de error tipo I. El valor 0.05 no significa que haya 95% de probabilidad de que \(H_1\) sea verdadera.

Problemas para resolver

En cada situación, identifique el parámetro, formule \(H_0\) y \(H_1\), determine el tipo de prueba y explique los errores tipo I y II cuando corresponda.

1. Incertidumbre. Explique por qué dos muestras aleatorias tomadas de la misma población pueden conducir a resultados diferentes. ¿Por qué esto obliga a hablar de probabilidad al tomar decisiones?

2. Moneda y dado. Describa cómo evaluaría, mediante observaciones repetidas, si una moneda está equilibrada y si un dado es justo. ¿Qué resultados le parecerían incompatibles con esas afirmaciones?

3. Evidencia muestral. ¿Qué significa rechazar una hipótesis sobre una población utilizando únicamente una muestra? ¿La decisión garantiza que la hipótesis es falsa?

4. Variabilidad. Dos empresas observan una diferencia de 5 unidades entre una media muestral y el valor esperado. En la empresa A la variable casi no cambia; en la empresa B es muy variable. ¿La evidencia tiene la misma fuerza? Justifique.

5. Servicio al cliente. Una compañía afirma que el tiempo promedio de respuesta no supera 6 horas. Los clientes sostienen que tarda más. Formule las hipótesis y determine la dirección de la prueba.

6. Ventas. Las ventas semanales promedio eran de 48 millones de pesos. La gerencia desea determinar si una nueva estrategia las aumentó. Formule las hipótesis y explique un error tipo I y uno tipo II.

7. Satisfacción. Una institución reporta que 80% de sus usuarios está satisfecho. Un equipo independiente desea saber si la proporción es diferente. Formule las hipótesis e identifique el tipo de prueba.

8. Control de calidad. Un lote se rechaza cuando existe evidencia de que su resistencia promedio está por debajo del mínimo requerido. Explique cuál error perjudica al proveedor y cuál puede perjudicar a los clientes.

9. Nivel de significancia. ¿Por qué no debe utilizarse automáticamente el mismo valor de \(\alpha\) en todas las decisiones? Proponga una situación en la que un error tipo I sea más grave y otra en la que sea más grave un error tipo II.

10. Lenguaje de conclusión. Corrija esta afirmación: “Como el valor \(p\) fue 0.18, se demostró que la hipótesis nula tiene 82% de probabilidad de ser verdadera”.

Síntesis de la sección

  • Una muestra proporciona evidencia, no certeza absoluta.
  • La prueba contrasta una afirmación de referencia, \(H_0\), con una alternativa, \(H_1\).
  • La dirección de \(H_1\) determina las colas de la prueba.
  • Rechazar una \(H_0\) verdadera constituye un error tipo I, cuya probabilidad es \(\alpha\).
  • No rechazar una \(H_0\) falsa constituye un error tipo II, cuya probabilidad es \(\beta\).
  • La potencia \(1-\beta\) mide la capacidad de detectar un cambio real.
  • Las consecuencias administrativas deben considerarse al escoger \(\alpha\) y planear el tamaño de la muestra.
  • La conclusión correcta es “rechazar” o “no rechazar”; nunca afirmar que una hipótesis quedó demostrada de manera absoluta.

Fuente principal

Levin, R. I. y Rubin, D. S. Estadística para administración y economía. Capítulo 8: “Prueba de hipótesis: prueba de una sola muestra”, especialmente las secciones 8.1 a 8.3. Los ejemplos y problemas de esta página son desarrollos originales adaptados al contexto de ciencias administrativas.