2. Estimación por intervalo

En el capítulo anterior aprendimos a seleccionar muestras, construir estimadores y estudiar sus distribuciones de muestreo. Ahora damos el paso natural de la estimación puntual a la estimación por intervalo.

Suponga que una empresa desea conocer el gasto promedio mensual de sus clientes. Una muestra produce una media de \(\$186.400\). ¿Debemos afirmar que la media de todos los clientes es exactamente \(\$186.400\)?

No. La media muestral cambia de una muestra a otra. Por eso resulta más razonable acompañar la estimación con un rango que refleje esa incertidumbre.

Idea central: un intervalo de confianza combina una estimación puntual con un margen de error.

\[ \text{Estimación por intervalo} = \text{Estimador puntual}\pm\text{Margen de error} \]

En términos generales:

\[ \boxed{\text{Estimador}\pm(\text{valor crítico})(\text{error estándar})} \]

Antes de calcular: ¿qué significa 95% de confianza?

Un nivel de confianza del 95% describe el procedimiento de construcción del intervalo. Si repitiéramos el muestreo muchas veces y construyéramos un intervalo de la misma manera en cada muestra, aproximadamente el 95% de esos intervalos contendría al verdadero parámetro poblacional.

Una vez construido un intervalo concreto, el parámetro poblacional es fijo: el intervalo lo contiene o no lo contiene.

Nivel de confianza y valor crítico

Si el nivel de confianza es \(1-\alpha\), queda una probabilidad total \(\alpha\) fuera del intervalo, repartida entre las dos colas.

Nivel de confianza \(\alpha\) \(z_{\alpha/2}\) aproximado
90% 0.10 1.645
95% 0.05 1.960
99% 0.01 2.576
niveles <- c(0.90, 0.95, 0.99)
z_critico <- qnorm(1 - (1 - niveles) / 2)

data.frame(
  confianza = paste0(niveles * 100, "%"),
  z_critico = round(z_critico, 3)
)
##   confianza z_critico
## 1       90%     1.645
## 2       95%     1.960
## 3       99%     2.576

La relación es importante: mayor confianza implica un intervalo más amplio, si todo lo demás permanece constante.


2.1 Estimación de la media poblacional cuando se conoce la varianza poblacional

Queremos estimar la media poblacional \(\mu\). Si conocemos la desviación estándar poblacional \(\sigma\), usamos la distribución normal estándar.

El error estándar de la media es:

\[ SE(\bar X)=\frac{\sigma}{\sqrt{n}} \]

Por tanto, el intervalo de confianza es:

\[ \boxed{ \bar{x}\pm z_{\alpha/2}\frac{\sigma}{\sqrt{n}} } \]

donde:

  • \(\bar{x}\): media de la muestra;
  • \(\sigma\): desviación estándar poblacional;
  • \(n\): tamaño de la muestra;
  • \(z_{\alpha/2}\): valor crítico asociado al nivel de confianza.

Nota: conocer realmente \(\sigma\) no es lo más habitual. Este caso es razonable, por ejemplo, cuando un proceso empresarial lleva suficiente tiempo siendo monitoreado y su variabilidad histórica puede considerarse conocida.

Ejemplo aplicado: tiempos de despacho

Una empresa de comercio electrónico controla históricamente el tiempo requerido para preparar un pedido. La desviación estándar poblacional se considera estable en \(\sigma=18\) minutos. En una muestra aleatoria de 64 pedidos se observa un tiempo promedio de \(\bar{x}=132\) minutos.

Construya un intervalo de confianza del 95% para el tiempo promedio poblacional de preparación.

Paso 1. Identificar la información

\[ \bar{x}=132,\qquad \sigma=18,\qquad n=64,\qquad 1-\alpha=0.95 \]

Para 95% de confianza:

\[ z_{\alpha/2}=1.96 \]

Paso 2. Calcular el error estándar

\[ SE=\frac{18}{\sqrt{64}}=2.25 \]

Paso 3. Calcular el margen de error

\[ E=1.96(2.25)=4.41 \]

Paso 4. Construir el intervalo

\[ 132\pm4.41 \]

\[ \boxed{127.59<\mu<136.41} \]

Interpretación

Con el procedimiento utilizado, tenemos un 95% de confianza en que el tiempo promedio poblacional de preparación de los pedidos se encuentra entre 127.59 y 136.41 minutos.

En términos de gestión, el intervalo comunica algo que la estimación puntual no muestra: no solo estimamos el tiempo promedio en 132 minutos, sino también la precisión con la que lo estamos estimando.

x_bar <- 132
sigma <- 18
n <- 64
confianza <- 0.95

alpha <- 1 - confianza
z <- qnorm(1 - alpha / 2)
error_estandar <- sigma / sqrt(n)
margen_error <- z * error_estandar

LI <- x_bar - margen_error
LS <- x_bar + margen_error

round(c(
  media_muestral = x_bar,
  error_estandar = error_estandar,
  margen_error = margen_error,
  limite_inferior = LI,
  limite_superior = LS
), 2)
##  media_muestral  error_estandar    margen_error limite_inferior limite_superior 
##          132.00            2.25            4.41          127.59          136.41

¿Qué hace más estrecho el intervalo?

Observe la fórmula del margen de error:

\[ E=z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \]

El intervalo será más preciso cuando:

  1. aumenta el tamaño de muestra \(n\);
  2. disminuye la variabilidad \(\sigma\);
  3. se utiliza un nivel de confianza menor.

La tercera posibilidad tiene un costo: ganar precisión reduciendo el nivel de confianza significa aceptar un procedimiento con menor cobertura.

Exploración en R: efecto de \(n\)

n_sim <- c(25, 50, 100, 200, 400)
E_sim <- qnorm(0.975) * 18 / sqrt(n_sim)

plot(
  n_sim, E_sim,
  type = "b", pch = 19,
  col = "#1565C0",
  xlab = "Tamaño de muestra",
  ylab = "Margen de error (minutos)",
  main = "Más información, menor margen de error"
)
grid()

Duplicar el tamaño de la muestra no divide el error por dos. Como \(n\) aparece dentro de una raíz cuadrada, para reducir aproximadamente a la mitad el margen de error necesitamos multiplicar \(n\) por cuatro.


2.2 Estimación por intervalo de la media poblacional cuando no se conoce la varianza poblacional

En la práctica, normalmente desconocemos tanto \(\mu\) como \(\sigma\). Entonces reemplazamos \(\sigma\) por la desviación estándar muestral \(s\).

Pero ese reemplazo introduce incertidumbre adicional. Por eso utilizamos la distribución t de Student:

\[ \boxed{ \bar{x}\pm t_{\alpha/2,\,n-1}\frac{s}{\sqrt{n}} } \]

Los grados de libertad son:

\[ gl=n-1 \]

¿Por qué aparece la distribución t?

La distribución \(t\) es parecida a la normal estándar, pero posee colas más amplias. Para muestras pequeñas, reconoce la incertidumbre adicional producida por estimar \(\sigma\) mediante \(s\).

A medida que \(n\) aumenta, la distribución \(t\) se aproxima a la normal estándar.

x <- seq(-4, 4, length.out = 500)

plot(
  x, dnorm(x), type = "l", lwd = 3,
  col = "#1565C0",
  xlab = "Valor", ylab = "Densidad",
  main = "Normal estándar y distribución t"
)
lines(x, dt(x, df = 5), lwd = 2, col = "#E65100", lty = 2)
lines(x, dt(x, df = 30), lwd = 2, col = "#2E7D32", lty = 3)
legend(
  "topright",
  legend = c("Normal", "t, gl = 5", "t, gl = 30"),
  col = c("#1565C0", "#E65100", "#2E7D32"),
  lty = c(1, 2, 3), lwd = c(3, 2, 2), bty = "n"
)

Ejemplo aplicado: valor de compra

Una tienda desea estimar el valor promedio de compra de sus clientes durante una campaña. Selecciona aleatoriamente 20 transacciones y obtiene:

\[ \bar{x}=\$84.500,\qquad s=\$16.200 \]

Suponiendo que la variable puede modelarse razonablemente con una distribución aproximadamente normal y que las observaciones son independientes, construya un intervalo de confianza del 95% para \(\mu\).

Paso 1. Grados de libertad y valor crítico

\[ gl=20-1=19 \]

qt(0.975, df = 19)
## [1] 2.093024

El valor crítico es aproximadamente:

\[ t_{0.025,19}=2.093 \]

Paso 2. Error estándar

\[ SE=\frac{16.200}{\sqrt{20}}\approx3.622,43 \]

Paso 3. Margen de error

\[ E=2.093(3.622,43)\approx7.581,74 \]

Paso 4. Intervalo

\[ 84.500\pm7.581,74 \]

\[ \boxed{\$76.918,26<\mu<\$92.081,74} \]

Solución en R con datos resumidos

x_bar <- 84500
s <- 16200
n <- 20
confianza <- 0.95

alpha <- 1 - confianza
gl <- n - 1
t_critico <- qt(1 - alpha / 2, df = gl)
SE <- s / sqrt(n)
E <- t_critico * SE

round(c(
  t_critico = t_critico,
  error_estandar = SE,
  margen_error = E,
  limite_inferior = x_bar - E,
  limite_superior = x_bar + E
), 2)
##       t_critico  error_estandar    margen_error limite_inferior limite_superior 
##            2.09         3622.43         7581.83        76918.17        92081.83

Si tenemos los datos individuales

Cuando disponemos del vector de observaciones, R hace el cálculo directamente con t.test():

compras <- c(
  61200, 73300, 90500, 82100, 77600,
  101400, 95300, 68700, 86200, 81400,
  107500, 75600, 92300, 84500, 79800,
  88400, 70900, 97600, 83500, 89400
)

t.test(compras, conf.level = 0.95)$conf.int
## [1] 78981.18 89738.82
## attr(,"conf.level")
## [1] 0.95

Regla de decisión: ¿z o t?

Situación Distribución Error estándar
Estimar \(\mu\) y \(\sigma\) es conocida Normal \(z\) \(\sigma/\sqrt{n}\)
Estimar \(\mu\) y \(\sigma\) es desconocida \(t\) de Student \(s/\sqrt{n}\)

La elección entre \(z\) y \(t\) depende de si la desviación estándar poblacional es conocida, no simplemente de memorizar la regla “muestra grande o pequeña”.


2.3 Estimación por intervalo para una proporción poblacional

Ahora la variable de interés tiene dos posibles resultados: compra/no compra, renueva/no renueva, cumple/no cumple, recomienda/no recomienda, etc.

La proporción muestral es:

\[ \hat p=\frac{x}{n} \]

donde \(x\) es el número de observaciones que presentan la característica de interés.

Para muestras suficientemente grandes, la distribución muestral de \(\hat p\) puede aproximarse por una normal, con error estándar estimado:

\[ SE(\hat p)=\sqrt{\frac{\hat p(1-\hat p)}{n}} \]

Por ello:

\[ \boxed{ \hat p\pm z_{\alpha/2} \sqrt{\frac{\hat p(1-\hat p)}{n}} } \]

Ejemplo aplicado: intención de recompra

Una empresa encuesta aleatoriamente a 400 clientes. De ellos, 268 indican que volverían a comprar durante los próximos tres meses. Estime con 95% de confianza la proporción poblacional de clientes con intención de recompra.

Paso 1. Proporción muestral

\[ \hat p=\frac{268}{400}=0.67 \]

Paso 2. Verificar la aproximación normal

Una comprobación práctica usual es que exista un número suficiente de éxitos y fracasos:

\[ n\hat p=400(0.67)=268 \]

\[ n(1-\hat p)=400(0.33)=132 \]

Ambos valores son suficientemente grandes para utilizar la aproximación normal.

Paso 3. Error estándar

\[ SE=\sqrt{\frac{0.67(0.33)}{400}}\approx0.02351 \]

Paso 4. Margen de error

\[ E=1.96(0.02351)\approx0.0461 \]

Paso 5. Intervalo

\[ 0.67\pm0.0461 \]

\[ \boxed{0.6239<p<0.7161} \]

En porcentaje, el intervalo es aproximadamente:

\[ \boxed{62.39\%<p<71.61\%} \]

Interpretación de negocio

Con un 95% de confianza, estimamos que entre 62.39% y 71.61% de la población de clientes manifiesta intención de recompra. Para tomar decisiones comerciales, este rango es más informativo que afirmar simplemente que “el 67% volvería a comprar”.

x <- 268
n <- 400
confianza <- 0.95

p_hat <- x / n
z <- qnorm(1 - (1 - confianza) / 2)
SE <- sqrt(p_hat * (1 - p_hat) / n)
E <- z * SE

round(c(
  proporcion = p_hat,
  error_estandar = SE,
  margen_error = E,
  limite_inferior = p_hat - E,
  limite_superior = p_hat + E
), 4)
##      proporcion  error_estandar    margen_error limite_inferior limite_superior 
##          0.6700          0.0235          0.0461          0.6239          0.7161

Importante: la fórmula anterior es el intervalo normal o de Wald, útil para comprender el procedimiento. Con muestras pequeñas o proporciones muy próximas a 0 o 1, esta aproximación puede funcionar mal y conviene utilizar otros métodos.


2.4 Determinación del tamaño de muestra

Hasta ahora el tamaño de muestra \(n\) estaba dado. En muchos estudios ocurre lo contrario: antes de recolectar los datos debemos decidir cuántas observaciones necesitamos.

La pregunta cambia:

¿Qué tamaño de muestra permite estimar el parámetro con un nivel de confianza y un margen de error previamente definidos?

Esta decisión conecta tres elementos:

  • confianza: qué cobertura queremos;
  • precisión: qué margen de error estamos dispuestos a aceptar;
  • recursos: cuánto cuesta obtener información adicional.

Tamaño de muestra para estimar una media

Partimos del margen de error:

\[ E=z_{\alpha/2}\frac{\sigma}{\sqrt n} \]

Despejando \(n\):

\[ \boxed{ n=\left(\frac{z_{\alpha/2}\sigma}{E}\right)^2 } \]

Como no podemos observar una fracción de individuo, cliente, factura o empresa, el tamaño calculado debe redondearse siempre hacia arriba.

Ejemplo: duración de una llamada de servicio

Un centro de atención desea estimar la duración promedio de sus llamadas con 95% de confianza y un margen de error máximo de 0.5 minutos. Estudios históricos indican una desviación estándar cercana a 4.2 minutos.

\[ n=\left(\frac{1.96(4.2)}{0.5}\right)^2 \]

z <- qnorm(0.975)
sigma <- 4.2
E <- 0.5

n_media <- (z * sigma / E)^2
c(n_calculado = n_media, n_requerido = ceiling(n_media))
## n_calculado n_requerido 
##    271.0533    272.0000

Se requieren 272 llamadas como mínimo.

Tamaño de muestra para estimar una proporción

Para una proporción:

\[ E=z_{\alpha/2}\sqrt{\frac{p(1-p)}{n}} \]

Despejando:

\[ \boxed{ n=\frac{z_{\alpha/2}^2p(1-p)}{E^2} } \]

Pero aparece un problema interesante: estamos calculando el tamaño de la muestra antes de observar \(\hat p\). Entonces, ¿qué valor de \(p\) utilizamos?

Tenemos dos posibilidades:

  1. usar una proporción estimada a partir de un estudio previo o una prueba piloto;
  2. si no existe información previa, usar \(p=0.5\).

El valor \(p=0.5\) maximiza \(p(1-p)\) y, por tanto, produce el tamaño de muestra más conservador.

Ejemplo: encuesta de satisfacción

Una empresa desea estimar la proporción de clientes satisfechos con 95% de confianza y un margen de error máximo de 3 puntos porcentuales. No cuenta con una estimación previa de la proporción.

Entonces:

\[ p=0.5,\qquad q=0.5,\qquad E=0.03 \]

\[ n=\frac{(1.96)^2(0.5)(0.5)}{(0.03)^2} \]

z <- qnorm(0.975)
p <- 0.50
E <- 0.03

n_prop <- z^2 * p * (1 - p) / E^2
c(n_calculado = n_prop, n_requerido = ceiling(n_prop))
## n_calculado n_requerido 
##    1067.072    1068.000

Se necesitan 1.068 clientes como mínimo.

¿Qué ocurre si aceptamos otro margen de error?

errores <- seq(0.01, 0.10, by = 0.005)
n_requerido <- ceiling(
  qnorm(0.975)^2 * 0.5 * 0.5 / errores^2
)

plot(
  errores * 100, n_requerido,
  type = "l", lwd = 3,
  col = "#1565C0",
  xlab = "Margen de error (puntos porcentuales)",
  ylab = "Tamaño de muestra requerido",
  main = "Precisión y tamaño de muestra"
)
grid()

El mensaje para la toma de decisiones es directo: exigir más precisión puede ser costoso. Reducir el margen de error a la mitad requiere aproximadamente cuatro veces el tamaño de muestra, si los demás elementos permanecen constantes.

Corrección por población finita

Las fórmulas anteriores son apropiadas cuando la población es muy grande frente a la muestra. Si la población es finita y el tamaño calculado representa una fracción importante de ella, puede aplicarse la corrección:

\[ \boxed{ n=\frac{n_0}{1+\frac{n_0-1}{N}} } \]

donde \(n_0\) es el tamaño inicialmente calculado para una población grande y \(N\) es el tamaño de la población.

Ejemplo breve

Si el cálculo inicial indica \(n_0=384.16\), pero la población tiene solamente \(N=1.200\) unidades:

n0 <- 384.16
N <- 1200

n_ajustado <- n0 / (1 + (n0 - 1) / N)
ceiling(n_ajustado)
## [1] 292

La corrección reduce el tamaño necesario porque estamos muestreando una parte considerable de una población pequeña y conocida.


Ruta rápida para escoger el intervalo

Antes de tocar una fórmula, haga estas preguntas:

  1. ¿Qué parámetro quiero estimar? ¿Una media \(\mu\) o una proporción \(p\)?
  2. Si es una media, conozco \(\sigma\) poblacional? Si sí, use \(z\); si no, use \(t\) y \(s\).
  3. ¿Qué nivel de confianza necesito? Esto determina el valor crítico.
  4. ¿Tengo una muestra aleatoria/representativa y observaciones independientes? Un cálculo correcto no corrige un mal diseño muestral.
  5. ¿Las condiciones de aproximación son razonables? Revise especialmente muestras pequeñas y proporciones extremas.
Objetivo Caso Intervalo
Media \(\mu\) \(\sigma\) conocida \(\bar{x}\pm z_{\alpha/2}\frac{\sigma}{\sqrt n}\)
Media \(\mu\) \(\sigma\) desconocida \(\bar{x}\pm t_{\alpha/2,n-1}\frac{s}{\sqrt n}\)
Proporción \(p\) muestra suficientemente grande \(\hat p\pm z_{\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}\)

Taller de aplicación

Ejercicio 1. Media con \(\sigma\) conocida

Una empresa de mensajería conoce por registros históricos que la desviación estándar del peso de sus paquetes es de 1.8 kg. Una muestra aleatoria de 100 paquetes presenta un peso promedio de 7.4 kg.

  1. Construya un intervalo de confianza del 95% para el peso promedio poblacional.
  2. Calcule el margen de error.
  3. Interprete el intervalo en el contexto de la empresa.
  4. Sin hacer el cálculo completo, explique qué ocurriría con el ancho del intervalo si la muestra aumentara a 400 paquetes.

Ejercicio 2. Media con \(\sigma\) desconocida

Una empresa registra el tiempo, en minutos, que tardan 15 clientes en completar un proceso digital:

tiempos <- c(
  11.8, 13.2, 12.5, 14.1, 10.9,
  12.7, 13.6, 11.5, 15.0, 12.1,
  13.0, 14.4, 11.9, 12.8, 13.5
)
  1. Calcule \(\bar{x}\) y \(s\).
  2. Construya un intervalo de confianza del 95% para \(\mu\).
  3. Identifique los grados de libertad.
  4. Resuelva nuevamente el ejercicio usando t.test().
  5. Interprete el resultado desde la perspectiva de la gestión del proceso.

Ejercicio 3. Proporción poblacional

En una encuesta realizada a 600 usuarios, 486 calificaron favorablemente una nueva funcionalidad de una aplicación.

  1. Estime puntualmente la proporción de usuarios favorables.
  2. Verifique si resulta razonable utilizar la aproximación normal.
  3. Construya un intervalo de confianza del 99%.
  4. Interprete el intervalo en términos porcentuales.
  5. Compare conceptualmente su amplitud con la de un intervalo del 95%.

Ejercicio 4. Diseño del tamaño de muestra

Una compañía quiere estimar la proporción de clientes que recomendarían su servicio.

  1. Determine el tamaño mínimo de muestra para un nivel de confianza del 95% y un margen de error de 4 puntos porcentuales, suponiendo que no hay información previa sobre \(p\).
  2. Repita el cálculo si un estudio piloto sugiere que \(p=0.72\).
  3. Explique por qué los tamaños obtenidos son diferentes.
  4. Si la compañía exige un margen de error de 2 puntos porcentuales, ¿qué sucede con el tamaño requerido?

Cierre

La estimación por intervalo introduce una idea fundamental de la inferencia estadística: una estimación sin una medida de incertidumbre está incompleta.

En este capítulo vimos cuatro decisiones esenciales:

  • estimar \(\mu\) con \(z\) cuando \(\sigma\) es conocida;
  • estimar \(\mu\) con \(t\) cuando \(\sigma\) es desconocida;
  • estimar una proporción poblacional \(p\);
  • diseñar el tamaño de muestra a partir de la confianza y la precisión requeridas.

El siguiente paso será utilizar estas mismas distribuciones y errores estándar para pasar de estimar parámetros a evaluar afirmaciones sobre ellos mediante pruebas de hipótesis.

Referencia base

Material elaborado con base conceptual en el capítulo 7 de Estadística para administración y economía, de Richard I. Levin y colaboradores, y organizado de acuerdo con los contenidos del microcurrículo del curso de Estadística Inferencial.