Cuando una organización necesita información para tomar decisiones, surge una pregunta aparentemente sencilla:
¿Debemos estudiar a todos los elementos de la población o basta con analizar una parte de ellos?
En principio, podría pensarse que estudiar a toda la población es la mejor alternativa. Si se desea conocer la opinión de todos los clientes de una empresa, el comportamiento de todos sus empleados o la calidad de toda la producción, parecería lógico observar cada uno de los elementos involucrados.
Sin embargo, en la práctica, estudiar a toda la población no siempre es posible ni conveniente. En muchos casos, realizar una enumeración completa o censo puede ser demasiado costoso, lento, complejo o incluso destructivo.
Por esta razón surge el muestreo, una de las herramientas fundamentales de la Estadística Inferencial.
El muestreo consiste en seleccionar una parte de la población con el propósito de obtener información que permita describir o inferir las características del conjunto completo.
La idea puede parecer arriesgada al principio:
¿Cómo es posible conocer las características de miles o millones de elementos observando solamente una parte de ellos?
La respuesta depende de la forma como se seleccione la muestra.
Una muestra no debe escogerse únicamente por comodidad. Para que los resultados puedan utilizarse con confianza, la muestra debe representar adecuadamente las características relevantes de la población.
Cuando la selección se realiza mediante un procedimiento apropiado, una muestra relativamente pequeña puede proporcionar información suficientemente precisa para apoyar la toma de decisiones.
Un censo consiste en observar, medir o consultar a todos los elementos que conforman una población.
Una muestra corresponde a una parte de la población seleccionada para su estudio.
La diferencia principal puede resumirse de la siguiente manera:
| Característica | Censo | Muestra |
|---|---|---|
| Elementos estudiados | Toda la población | Una parte de la población |
| Costo | Generalmente alto | Generalmente menor |
| Tiempo requerido | Alto | Menor |
| Organización | Compleja | Más manejable |
| Error muestral | No existe | Puede existir |
| Error de medición | Puede existir | Puede existir |
| Aplicación en pruebas destructivas | No recomendable | Apropiada |
| Posibilidad de repetición | Limitada | Mayor |
Un censo elimina el error que aparece por observar solamente una parte de la población. Sin embargo, no elimina otros errores como:
Por tanto, estudiar toda la población no garantiza automáticamente un resultado perfecto.
Las organizaciones recurren al muestreo por diferentes razones.
Estudiar toda la población puede exigir una inversión considerable en:
Una muestra permite concentrar los recursos en un grupo más pequeño y controlar mejor la calidad del proceso.
En muchas decisiones administrativas, la información debe obtenerse rápidamente.
Una empresa que necesita ajustar el precio de un producto no puede esperar varios meses para conocer la opinión de todos sus clientes.
Una muestra permite obtener resultados en un tiempo compatible con la decisión que debe tomarse.
Algunas poblaciones están distribuidas en diferentes ciudades, sucursales, regiones o canales.
Localizar y contactar a todos sus elementos puede resultar logísticamente muy complejo.
En ciertos procesos de control de calidad, la medición destruye el objeto analizado.
Por ejemplo:
En estas situaciones, analizar toda la población significaría destruir toda la producción.
Algunos procesos generan nuevas observaciones permanentemente:
En estos casos, la población puede considerarse conceptualmente infinita y un censo resulta imposible.
Una empresa produce diariamente 48.000 envases de yogur. Cada envase debe contener un peso neto de 200 gramos.
El departamento de calidad desea verificar si la máquina llenadora está funcionando correctamente.
Una posibilidad sería pesar los 48.000 envases producidos durante el día. Sin embargo, esta alternativa presenta varios inconvenientes:
Por esta razón, la empresa decide seleccionar 300 envases distribuidos a lo largo de la jornada.
Sobre esta muestra se calculan:
En este estudio:
La empresa no necesita conocer individualmente el peso de cada envase. Su verdadero interés consiste en responder preguntas como:
La información obtenida en la muestra permite tomar decisiones sobre toda la producción.
Suponga que los 300 envases se seleccionan únicamente durante los primeros diez minutos de producción.
¿Considera que la muestra representaría adecuadamente toda la jornada?
Probablemente no. La máquina puede cambiar su comportamiento durante el día debido a:
Por esta razón, además del tamaño de la muestra, es importante considerar cómo y cuándo se seleccionan los elementos.
Una universidad tiene 21.500 estudiantes matriculados y desea conocer su nivel de satisfacción con los servicios institucionales.
La administración considera inicialmente enviar una encuesta a todos los estudiantes.
Suponga que responder el cuestionario requiere aproximadamente 12 minutos.
El tiempo total solicitado a los estudiantes sería:
\[ 21.500 \times 12 = 258.000 \text{ minutos} \]
Al convertir este resultado a horas:
\[ \frac{258.000}{60}=4.300 \text{ horas} \]
Esto significa que, en conjunto, los estudiantes dedicarían 4.300 horas a responder el cuestionario.
Además, la universidad tendría que asumir actividades como:
Después de evaluar estas condiciones, la universidad decide seleccionar una muestra de 1.000 estudiantes.
En este caso:
\[ \frac{1.000}{21.500}\times100=4,65\% \]
La muestra representa aproximadamente el 4,65 % de la población estudiantil.
Sin embargo, este porcentaje por sí solo no garantiza que la muestra sea adecuada.
La universidad debe procurar que estén representados:
Si la muestra se seleccionara únicamente entre estudiantes presenciales de primer semestre, los resultados no representarían adecuadamente a toda la universidad.
El objetivo del muestreo no es estudiar menos personas por simple comodidad.
El verdadero propósito es obtener información confiable utilizando de manera eficiente los recursos disponibles.
Una buena muestra debe equilibrar:
Los ejemplos anteriores muestran que el muestreo es necesario cuando estudiar toda la población resulta:
La relación general puede representarse así:
POBLACIÓN
│
│ Selección de una parte
▼
MUESTRA
│
│ Recolección y análisis
▼
ESTADÍSTICAS MUESTRALES
│
│ Inferencia
▼
CONCLUSIONES SOBRE LA POBLACIÓN
La calidad de las conclusiones depende de la calidad de la muestra.
Una muestra grande mal seleccionada puede producir peores resultados que una muestra pequeña correctamente diseñada.
Una empresa de telefonía móvil posee 850.000 clientes activos y desea estimar el porcentaje de usuarios satisfechos con su servicio de internet.
Responda:
Una fábrica produce diariamente 95.000 botellas de agua.
El laboratorio de calidad propone analizar 450 botellas seleccionadas durante la jornada.
Responda:
Una empresa de comercio electrónico desea estimar el tiempo promedio de entrega de los pedidos realizados durante el último semestre.
La empresa decide analizar una muestra de órdenes de compra.
Responda:
Hasta este punto hemos establecido que una muestra es una parte de la población seleccionada con el propósito de obtener información sobre el conjunto completo.
Sin embargo, seleccionar una parte de la población no garantiza que se haya construido una buena muestra.
Suponga que una empresa desea conocer la satisfacción de sus clientes y decide entrevistar a las primeras 300 personas que ingresen a una de sus sucursales un lunes en la mañana. Aunque se obtendrán 300 respuestas, el procedimiento presenta limitaciones importantes:
Existe una muestra, pero no se conoce con claridad la oportunidad que tenía cada integrante de la población de formar parte de ella.
El problema no consiste únicamente en cuántas personas fueron entrevistadas. El verdadero problema está en cómo fueron seleccionadas.
El muestreo aleatorio, también denominado muestreo probabilístico, busca resolver esta dificultad mediante procedimientos de selección basados en el azar.
En una muestra probabilística se conocen, o al menos pueden calcularse, las probabilidades de inclusión de los elementos de la población. Esto permite evaluar de manera objetiva el proceso de selección y construir inferencias sobre la población.
El muestreo probabilístico es un conjunto de procedimientos en los cuales la selección de las unidades se realiza mediante un mecanismo aleatorio conocido.
Para que un diseño pueda considerarse probabilístico, debe cumplir al menos las siguientes condiciones:
Si representamos mediante \(\pi_i\) la probabilidad de que la unidad \(i\) sea incluida en la muestra, podemos escribir:
\[ \pi_i=P(i\in s) \]
donde:
La probabilidad de inclusión no necesariamente debe ser igual para todos los elementos.
En el muestreo aleatorio simple, todos tienen la misma probabilidad. En otros diseños, como el muestreo estratificado no proporcional, ciertos grupos pueden seleccionarse con mayor intensidad. Lo fundamental es que las probabilidades sean conocidas y que el procedimiento pueda explicarse y reproducirse.
En el lenguaje cotidiano, la expresión “escoger al azar” se utiliza a veces para describir una elección espontánea:
“Tomé algunos registros al azar de la base”.
Esta afirmación no demuestra que se haya aplicado un procedimiento aleatorio.
Por ejemplo, no existe verdadera aleatoriedad cuando se seleccionan:
La selección aleatoria exige un mecanismo verificable, como:
El azar estadístico no consiste en seleccionar sin pensar. Consiste en aplicar una regla de selección en la cual la decisión no depende de las preferencias del investigador.
Conocer las probabilidades de inclusión permite establecer la relación entre la muestra observada y la población.
Cuando estas probabilidades son conocidas, es posible:
En cambio, cuando una persona se incluye por facilidad, voluntad o decisión subjetiva, no puede determinarse con precisión qué parte de la población representa.
La probabilidad de inclusión indica qué oportunidad tiene una unidad de ser seleccionada.
La ponderación muestral expresa cuántos elementos de la población representa aproximadamente cada unidad seleccionada.
La ponderación básica se define como:
\[ w_i=\frac{1}{\pi_i} \]
donde:
Una empresa tiene 10.000 clientes y selecciona 500 mediante un procedimiento en el cual todos tienen la misma probabilidad.
La probabilidad de inclusión es:
\[ \pi_i=\frac{500}{10.000}=0,05 \]
Cada cliente tiene una probabilidad del 5 % de ser seleccionado.
La ponderación es:
\[ w_i=\frac{1}{0,05}=20 \]
Cada persona seleccionada representa aproximadamente 20 clientes de la población.
Esto no significa que cada entrevistado sea idéntico a otros 19 clientes. Significa que, bajo el diseño utilizado, su participación tiene un peso equivalente a 20 unidades poblacionales.
Los principales métodos son:
| Método | Forma de selección | Aplicación frecuente |
|---|---|---|
| Aleatorio simple | Selección directa de unidades de toda la población | Bases completas y poblaciones relativamente homogéneas |
| Sistemático | Inicio aleatorio y selección cada cierto intervalo | Listados ordenados y procesos productivos |
| Estratificado | División en estratos y selección dentro de todos ellos | Poblaciones con grupos diferenciados |
| Conglomerados | Selección de algunos grupos naturales | Poblaciones dispersas geográficamente |
Los cuatro métodos incorporan mecanismos aleatorios. Sin embargo, el muestreo aleatorio simple ocupa un lugar especial porque constituye la base conceptual de muchos procedimientos de inferencia estadística.
El muestreo aleatorio simple, abreviado frecuentemente como MAS, es un procedimiento en el que todas las muestras posibles de tamaño \(n\) tienen la misma probabilidad de ser seleccionadas.
Esta definición contiene dos propiedades relacionadas, pero diferentes:
La segunda propiedad es más exigente.
Que todos los elementos tengan la misma probabilidad individual no garantiza siempre que todas las combinaciones posibles puedan aparecer. Esta diferencia será importante cuando se estudie el muestreo sistemático.
Utilizaremos:
\[ N=\text{tamaño de la población} \]
\[ n=\text{tamaño de la muestra} \]
Si el muestreo aleatorio simple se realiza sin reemplazo, la probabilidad de inclusión de cualquier elemento es:
\[ \pi_i=\frac{n}{N} \]
La fracción de muestreo es:
\[ f=\frac{n}{N} \]
En un muestreo aleatorio simple con probabilidades iguales:
\[ \pi_i=f \]
Cuando se seleccionan \(n\) unidades de una población de tamaño \(N\), sin reemplazo y sin considerar el orden, el número de muestras posibles es:
\[ \binom{N}{n} = \frac{N!}{n!(N-n)!} \]
Esta expresión se conoce como coeficiente binomial.
En un muestreo aleatorio simple, cada una de esas muestras debe tener probabilidad:
\[ P(s)=\frac{1}{\binom{N}{n}} \]
Un seminario está conformado por cuatro estudiantes:
\[ A,\ B,\ C,\ D \]
El docente desea seleccionar dos estudiantes para entrevistarlos.
La población tiene tamaño:
\[ N=4 \]
La muestra tendrá tamaño:
\[ n=2 \]
El número de muestras posibles es:
\[ \binom{4}{2} = \frac{4!}{2!(4-2)!} \]
Como:
\[ 4!=4\times3\times2\times1=24 \]
\[ 2!=2\times1=2 \]
entonces:
\[ \binom{4}{2} = \frac{24}{2\times2} = 6 \]
Las seis muestras posibles son:
\[ AB,\ AC,\ AD,\ BC,\ BD,\ CD \]
Si el procedimiento es verdaderamente aleatorio simple, todas deben tener la misma probabilidad:
\[ P(AB)=P(AC)=P(AD)=P(BC)=P(BD)=P(CD)=\frac{1}{6} \]
La tabla resume el espacio muestral:
| Muestra | Probabilidad |
|---|---|
| \(AB\) | \(1/6\) |
| \(AC\) | \(1/6\) |
| \(AD\) | \(1/6\) |
| \(BC\) | \(1/6\) |
| \(BD\) | \(1/6\) |
| \(CD\) | \(1/6\) |
El estudiante \(A\) aparece en tres muestras:
\[ AB,\ AC,\ AD \]
Por tanto:
\[ P(A\in s) = P(AB)+P(AC)+P(AD) \]
\[ P(A\in s) = \frac{1}{6} + \frac{1}{6} + \frac{1}{6} = \frac{3}{6} = \frac{1}{2} \]
También puede calcularse mediante:
\[ \pi_A=\frac{n}{N} \]
\[ \pi_A=\frac{2}{4}=\frac{1}{2} \]
El mismo resultado se obtiene para los demás estudiantes.
| Estudiante | Muestras en las que aparece | Probabilidad de inclusión |
|---|---|---|
| A | AB, AC, AD | \(3/6=1/2\) |
| B | AB, BC, BD | \(3/6=1/2\) |
| C | AC, BC, CD | \(3/6=1/2\) |
| D | AD, BD, CD | \(3/6=1/2\) |
Todos tienen la misma oportunidad de inclusión.
Podemos construir todas las combinaciones posibles con la función
combn().
estudiantes <- c("A", "B", "C", "D")
muestras_posibles <- combn(
estudiantes,
m = 2,
simplify = FALSE
)
muestras_posibles## [[1]]
## [1] "A" "B"
##
## [[2]]
## [1] "A" "C"
##
## [[3]]
## [1] "A" "D"
##
## [[4]]
## [1] "B" "C"
##
## [[5]]
## [1] "B" "D"
##
## [[6]]
## [1] "C" "D"
Podemos convertir las combinaciones en texto:
## [1] "AB" "AC" "AD" "BC" "BD" "CD"
Número total de muestras:
## [1] 6
También puede verificarse mediante:
## [1] 6
Si repetimos el procedimiento muchas veces, cada muestra debería aparecer aproximadamente con la misma frecuencia.
set.seed(2026)
selecciones <- replicate(
12000,
paste(
sort(sample(estudiantes, size = 2, replace = FALSE)),
collapse = ""
)
)
frecuencias <- table(selecciones)
frecuencias## selecciones
## AB AC AD BC BD CD
## 2038 1996 2042 1973 2005 1946
Proporciones observadas:
## selecciones
## AB AC AD BC BD CD
## 0.1698333 0.1663333 0.1701667 0.1644167 0.1670833 0.1621667
Cada proporción debería estar cerca de:
\[ \frac{1}{6}\approx0,1667 \]
No serán exactamente iguales porque se trata de una simulación finita. Sin embargo, al aumentar el número de repeticiones, las frecuencias relativas tienden a aproximarse a la probabilidad teórica.
Una empresa registró 12.000 facturas durante el trimestre. El equipo de auditoría desea seleccionar 300 para verificar:
La población es:
Las 12.000 facturas registradas durante el trimestre.
La unidad de análisis es:
Cada factura.
Los tamaños son:
\[ N=12.000 \]
\[ n=300 \]
La probabilidad de inclusión es:
\[ \pi_i=\frac{300}{12.000}=0,025 \]
Cada factura tiene una probabilidad de 2,5 % de ser seleccionada.
La ponderación es:
\[ w_i=\frac{1}{0,025}=40 \]
Cada factura seleccionada representa aproximadamente 40 facturas del trimestre.
set.seed(320)
facturas <- data.frame(
id_factura = sprintf("FAC-%05d", 1:12000),
sede = sample(
c("Bogotá", "Medellín", "Cali", "Barranquilla"),
size = 12000,
replace = TRUE,
prob = c(0.45, 0.22, 0.20, 0.13)
),
valor = round(
rlnorm(
12000,
meanlog = log(650000),
sdlog = 0.80
)
),
tiene_error = rbinom(
12000,
size = 1,
prob = 0.06
)
)
head(facturas)Seleccionamos 300 facturas sin reemplazo:
set.seed(725)
indices_seleccionados <- sample(
seq_len(nrow(facturas)),
size = 300,
replace = FALSE
)
muestra_facturas <- facturas[
indices_seleccionados,
]
head(muestra_facturas)Verificamos el tamaño:
## [1] 300
Valor promedio de las facturas seleccionadas:
## [1] 867040.2
Proporción de facturas con error:
## [1] 0.08666667
Si se desea expresar como porcentaje:
## [1] 8.666667
La media muestral estima el valor promedio poblacional y la proporción muestral estima el porcentaje poblacional de facturas con errores.
En una situación real, los valores poblacionales serían desconocidos. En la simulación podemos compararlos:
comparacion <- data.frame(
Medida = c(
"Valor promedio",
"Proporción con error"
),
Poblacion = c(
mean(facturas$valor),
mean(facturas$tiene_error)
),
Muestra = c(
mean(muestra_facturas$valor),
mean(muestra_facturas$tiene_error)
)
)
comparacionLa muestra no tiene que producir exactamente el mismo resultado que la población. La diferencia es consecuencia natural del muestreo.
Una población es finita cuando tiene un número determinado o potencialmente enumerado de elementos.
Ejemplos:
En una población finita existe un valor definido de \(N\).
Una población se considera infinita cuando no es posible enumerar todos sus elementos o cuando el proceso continúa generando observaciones.
Ejemplos:
No siempre se trata de infinito en un sentido físico estricto. En la práctica, también se usa esta aproximación para poblaciones tan grandes o dinámicas que no pueden enumerarse razonablemente.
Un banco desea estudiar el tiempo de espera de los clientes.
Durante los próximos años continuarán llegando nuevas personas. No existe una lista definitiva de todos los tiempos de espera que llegarán a observarse.
Por ello, la población puede conceptualizarse como:
Todos los tiempos de espera que puede generar el sistema bajo determinadas condiciones operativas.
El banco selecciona una muestra de clientes durante un periodo y utiliza sus tiempos para aprender sobre el funcionamiento del proceso.
| Característica | Población finita | Población infinita |
|---|---|---|
| Tamaño | Definido como \(N\) | No se fija o no puede enumerarse |
| Marco muestral | Puede construirse | Frecuentemente no existe como lista completa |
| Ejemplo | Facturas del año | Llamadas futuras |
| Reemplazo | Puede modificar probabilidades | El efecto suele ser despreciable |
| Corrección por población finita | Puede ser necesaria | No se utiliza |
En el muestreo sin reemplazo, una unidad seleccionada no vuelve a estar disponible para las selecciones siguientes.
Una factura no debería aparecer dos veces en la misma muestra de auditoría. Un empleado seleccionado para una encuesta no necesita ser seleccionado nuevamente en esa misma muestra.
En R:
## [1] 9 7 8 6 3
Los valores no se repiten.
En el muestreo con reemplazo, después de seleccionar una unidad, esta vuelve a incorporarse antes de la siguiente extracción.
Por ello, una misma unidad puede aparecer más de una vez.
## [1] 9 10 7 8 6
Es posible observar repeticiones.
Con selección sin reemplazo y muestras de tamaño 2, las combinaciones son:
\[ AB,\ AC,\ AD,\ BC,\ BD,\ CD \]
No son posibles:
\[ AA,\ BB,\ CC,\ DD \]
Con reemplazo sí serían posibles selecciones como:
\[ AA,\ AB,\ AC,\ AD,\ BA,\ BB,\ldots \]
Además, si se considera el orden, \(AB\) y \(BA\) serían resultados diferentes del procedimiento de extracción.
Si se selecciona un estudiante de una población de cuatro:
\[ P(A)=\frac{1}{4} \]
Con reemplazo, la probabilidad de seleccionar a \(A\) dos veces es:
\[ P(AA) = P(A)\times P(A) \]
\[ P(AA) = \frac{1}{4}\times\frac{1}{4} = \frac{1}{16} \]
La probabilidad de seleccionar primero \(A\) y luego \(B\) es:
\[ P(AB) = \frac{1}{4}\times\frac{1}{4} = \frac{1}{16} \]
Cada secuencia ordenada de dos selecciones tiene probabilidad \(1/16\).
En encuestas y auditorías sobre poblaciones finitas suele utilizarse muestreo sin reemplazo, porque no tiene sentido entrevistar o revisar repetidamente la misma unidad.
El muestreo con reemplazo es importante en:
Antes de utilizar un generador aleatorio debe revisarse el marco.
El procedimiento recomendado es:
Un programa puede seleccionar perfectamente al azar dentro de una base defectuosa. Aleatorizar basura produce basura con certificado matemático.
Para poblaciones pequeñas pueden escribirse los identificadores en papeletas iguales, mezclarlas y extraer la cantidad requerida.
El método solo es válido si:
La dificultad aumenta rápidamente con poblaciones grandes.
Antes del uso extendido de computadores, se utilizaban tablas de dígitos aleatorios.
El procedimiento general consiste en:
Una empresa tiene 100 empleados identificados del 00 al 99 y desea seleccionar 10.
Suponga que la secuencia aleatoria comienza así:
\[ 15,\ 09,\ 41,\ 74,\ 00,\ 72,\ 67,\ 55,\ 71,\ 35 \]
La muestra sería:
| Orden | Código |
|---|---|
| 1 | 15 |
| 2 | 09 |
| 3 | 41 |
| 4 | 74 |
| 5 | 00 |
| 6 | 72 |
| 7 | 67 |
| 8 | 55 |
| 9 | 71 |
| 10 | 35 |
La regla de lectura debe definirse antes de observar qué empleados corresponden a los números. De lo contrario, podría introducirse selección subjetiva.
Para seleccionar una muestra aleatoria simple de identificadores:
set.seed(2026)
empleados_seleccionados <- sample(
1:100,
size = 10,
replace = FALSE
)
empleados_seleccionados## [1] 93 97 38 45 91 36 48 5 31 44
La instrucción set.seed() permite reproducir la
selección.
Si otra persona utiliza la misma semilla y el mismo código, obtendrá la misma muestra.
Los generadores utilizados por el computador producen secuencias pseudoaleatorias. Estas tienen propiedades adecuadas para el análisis estadístico, pero se generan mediante algoritmos.
La semilla fija el punto inicial de la secuencia.
## [1] 7 15 18 9 19
Si se vuelve a ejecutar desde la misma semilla:
## [1] 7 15 18 9 19
se obtiene el mismo resultado.
Esto es útil para:
Suponga una base de empleados:
set.seed(2026)
empleados <- data.frame(
id = sprintf("EMP-%04d", 1:2000),
sede = sample(
c("Bogotá", "Medellín", "Cali"),
size = 2000,
replace = TRUE,
prob = c(0.50, 0.30, 0.20)
),
salario = round(
rnorm(
2000,
mean = 3200000,
sd = 750000
)
),
antiguedad = round(
rexp(
2000,
rate = 1/5
),
1
)
)
head(empleados)Selección de 150 empleados:
set.seed(742)
indices <- sample(
seq_len(nrow(empleados)),
size = 150,
replace = FALSE
)
muestra_empleados <- empleados[
indices,
]
head(muestra_empleados)Verificación:
## [1] 150
## [1] 150
Ambos valores deben ser 150.
Una compañía tiene 3.200 trabajadores y desea estimar la satisfacción laboral media mediante una muestra aleatoria simple de 200.
Población:
Todos los 3.200 trabajadores activos en la fecha del estudio.
Unidad de análisis:
Cada trabajador.
Marco muestral:
Base actualizada de trabajadores con identificador único.
Tamaños:
\[ N=3.200 \]
\[ n=200 \]
\[ \pi_i=\frac{n}{N} \]
\[ \pi_i=\frac{200}{3.200}=0,0625 \]
Cada trabajador tiene una probabilidad de 6,25 % de ser seleccionado.
\[ w_i=\frac{1}{0,0625}=16 \]
Cada trabajador seleccionado representa aproximadamente 16 trabajadores.
\[ f=\frac{200}{3.200}=0,0625 \]
La muestra representa 6,25 % de la población.
set.seed(850)
trabajadores <- data.frame(
id = sprintf("TR-%04d", 1:3200),
satisfaccion = sample(
1:10,
size = 3200,
replace = TRUE,
prob = c(
0.02, 0.03, 0.05, 0.08, 0.12,
0.16, 0.20, 0.17, 0.11, 0.06
)
),
modalidad = sample(
c("Presencial", "Híbrida", "Remota"),
size = 3200,
replace = TRUE,
prob = c(0.55, 0.30, 0.15)
)
)
set.seed(400)
muestra_trabajadores <- trabajadores[
sample(
seq_len(nrow(trabajadores)),
size = 200,
replace = FALSE
),
]
head(muestra_trabajadores)## [1] 6.505
Interpretación sugerida:
La satisfacción media observada en la muestra fue de 6.5 puntos sobre 10. Este valor constituye una estimación puntual de la satisfacción media de los 3.200 trabajadores.
Suponga que se considera satisfecho a un trabajador con puntuación igual o superior a 8.
muestra_trabajadores$satisfecho <- ifelse(
muestra_trabajadores$satisfaccion >= 8,
1,
0
)
proporcion_satisfechos <- mean(
muestra_trabajadores$satisfecho
)
proporcion_satisfechos## [1] 0.395
Porcentaje:
## [1] 39.5
Interpretación:
En la muestra, 39.5 % de los trabajadores obtuvo una calificación de satisfacción igual o superior a 8. Esta proporción muestral estima el porcentaje poblacional de trabajadores satisfechos.
No necesariamente.
El muestreo aleatorio simple ofrece la misma probabilidad individual, pero no obliga a obtener cantidades específicas de trabajadores presenciales, híbridos y remotos.
Podemos revisar la composición:
##
## Híbrida Presencial Remota
## 0.25 0.58 0.17
Y compararla con la población:
data.frame(
Poblacion = prop.table(
table(trabajadores$modalidad)
),
Muestra = prop.table(
table(muestra_trabajadores$modalidad)
)
)Las proporciones serán parecidas, pero no necesariamente idénticas.
Cuando resulta indispensable garantizar cantidades mínimas por modalidad, podría convenir un muestreo estratificado.
Cada elemento tiene la misma probabilidad de inclusión.
El investigador no elige manualmente quién entra.
Permite calcular errores estándar, intervalos de confianza y otras medidas inferenciales.
Es uno de los diseños más sencillos de explicar.
Puede aplicarse con programas como R, Excel o software estadístico.
La selección puede documentarse mediante semilla, fecha, código y versión de la base.
Si la base no contiene todos los elementos, la selección no cubrirá la población objetivo.
Una muestra aleatoria podría seleccionar unidades ubicadas en muchas regiones.
Un grupo minoritario podría quedar con pocos casos o incluso no aparecer.
Si ya se conoce que existen grupos muy diferentes, la estratificación puede ser más eficiente.
La muestra inicial puede ser aleatoria, pero la muestra final de respondientes puede dejar de serlo.
Suponga que una empresa selecciona aleatoriamente 1.000 clientes. Sin embargo:
Si la no respuesta ocurre completamente al azar, el problema podría limitarse a una reducción de tamaño.
Pero si responden principalmente los clientes más satisfechos, el resultado final estará sesgado.
La aleatoriedad del sorteo inicial no corrige automáticamente:
Una muestra aleatoria no es una varita mágica. El diseño puede comenzar bien y arruinarse durante la ejecución.
Una universidad tiene 5.000 estudiantes y desea seleccionar 250 mediante muestreo aleatorio simple.
Responda:
Un comité está integrado por cinco personas:
\[ A,\ B,\ C,\ D,\ E \]
Se seleccionarán dos para asistir a una reunión.
Responda:
Un banco tiene 18.000 créditos activos y desea revisar 360 mediante muestreo aleatorio simple.
Responda:
Se tiene una población formada por:
\[ A,\ B,\ C \]
Se seleccionan dos unidades con reemplazo y se considera el orden.
Responda:
Hasta ahora hemos estudiado cómo seleccionar una muestra de una población. Sin embargo, obtener una muestra adecuada no es suficiente cuando el objetivo consiste en comparar tratamientos, evaluar cambios o determinar si una intervención produce un efecto.
En estas situaciones no basta con observar lo que ocurre. Es necesario planear cuidadosamente las condiciones bajo las cuales se obtendrán los datos.
El diseño de experimentos es el proceso mediante el cual se organiza una investigación para estudiar el efecto de una o más variables sobre una respuesta de interés.
La idea central es sencilla:
Un buen experimento debe permitir distinguir el efecto real del tratamiento de las variaciones producidas por otros factores.
Por ejemplo, una empresa puede desear saber si una nueva estrategia de capacitación mejora la productividad de sus trabajadores. Si simplemente compara a quienes recibieron la capacitación con quienes no la recibieron, podría encontrar diferencias. Sin embargo, estas diferencias también podrían explicarse por:
Por esta razón, el experimento debe diseñarse de manera que el efecto de la capacitación pueda separarse de otras posibles explicaciones.
Un experimento es una actividad planificada en la cual se modifican deliberadamente una o más condiciones para observar su efecto sobre una variable de respuesta.
En un experimento aparecen varios elementos fundamentales:
En un estudio observacional, el investigador registra lo que ocurre sin intervenir directamente.
En un experimento, el investigador asigna o modifica condiciones.
| Característica | Estudio observacional | Experimento |
|---|---|---|
| Intervención | No | Sí |
| Asignación de tratamientos | No controlada | Controlada |
| Capacidad para estudiar causalidad | Limitada | Mayor |
| Ejemplo | Observar hábitos de compra | Cambiar el precio de un producto |
| Riesgo de confusión | Alto | Puede reducirse con diseño |
Una empresa observa que los empleados que realizaron un curso voluntario tienen mayor productividad.
Este resultado no demuestra que el curso haya causado la mejora, porque quienes se inscribieron podrían ser más motivados desde el inicio.
Si la empresa asigna aleatoriamente a los trabajadores a dos grupos:
entonces la comparación tendría un fundamento más fuerte para evaluar causalidad.
Todo experimento debe comenzar con una pregunta clara.
Ejemplo impreciso:
Queremos estudiar dos baterías.
Ejemplo preciso:
Queremos determinar si la batería A tiene un mayor tiempo promedio de funcionamiento que la batería B bajo condiciones comparables.
El objetivo debe indicar:
La unidad experimental es el elemento más pequeño al que se aplica un tratamiento de manera independiente.
Ejemplos:
| Experimento | Unidad experimental |
|---|---|
| Comparación de baterías | Cada batería |
| Evaluación de una capacitación | Cada trabajador |
| Comparación de fertilizantes | Cada parcela |
| Evaluación de un empaque | Cada consumidor |
| Comparación de métodos de enseñanza | Cada estudiante o cada curso |
| Prueba de publicidad | Cada ciudad o segmento |
La unidad experimental no siempre coincide con la unidad de análisis.
Por ejemplo, si una estrategia educativa se aplica a un curso completo, el curso puede ser la unidad experimental, aunque se midan resultados individuales de los estudiantes.
Un factor es una variable que el investigador manipula o controla para evaluar su efecto.
Ejemplos:
Los niveles son las categorías o valores específicos de un factor.
Ejemplo:
Factor:
Tipo de batería.
Niveles:
Otro ejemplo:
Factor:
Temperatura.
Niveles:
Un tratamiento es una condición experimental específica.
Cuando existe un solo factor, cada nivel puede considerarse un tratamiento.
Cuando existen varios factores, un tratamiento corresponde a una combinación de niveles.
Factores:
Tratamientos:
La variable de respuesta es la característica que se mide para evaluar el efecto de los tratamientos.
Debe estar definida de manera:
Si una empresa desea comparar dos baterías, podría medir:
No sería suficiente hablar de “mejor desempeño” sin especificar cómo se medirá.
Son variables que podrían afectar la respuesta y que deben mantenerse constantes, registrarse o incorporarse en el diseño.
Ejemplo en una prueba de baterías:
Si estas variables cambian entre tratamientos, podrían confundirse con el efecto de la batería.
El primer paso consiste en formular el problema.
Ejemplo:
¿La batería A presenta mayor duración promedio que la batería B bajo condiciones comparables?
Esta formulación es mejor que preguntar simplemente:
¿Cuál batería es mejor?
La palabra “mejor” puede significar:
Suponga que se decide medir:
\[ Y=\text{tiempo, en minutos, hasta que la batería se agota} \]
La variable debe medirse de la misma forma para todas las unidades.
Se compararán:
La empresa debe decidir cuántas baterías probar.
Una muestra muy pequeña puede producir resultados inestables.
Una muestra excesivamente grande puede aumentar el costo sin aportar beneficios proporcionales.
Suponga que se eligen:
\[ n_A=10 \]
\[ n_B=10 \]
En total:
\[ n=20 \]
Para que la comparación sea válida, se deben mantener condiciones similares:
La aleatorización consiste en asignar los tratamientos o el orden de ejecución mediante un procedimiento aleatorio.
Esto evita que factores no controlados queden asociados sistemáticamente con un tratamiento.
Suponga que se prueban primero todas las baterías A y luego todas las B.
Si la temperatura cambia durante el día, el efecto de la temperatura puede confundirse con el tipo de batería.
Una mejor estrategia sería aleatorizar el orden de las 20 pruebas.
set.seed(2026)
tratamientos <- rep(
c("A", "B"),
each = 10
)
orden_pruebas <- sample(
tratamientos,
size = 20,
replace = FALSE
)
orden_pruebas## [1] "A" "A" "B" "B" "B" "B" "A" "A" "B" "A" "A" "A" "A" "A" "B" "B" "B" "B" "A"
## [20] "B"
Durante la ejecución deben registrarse:
Un experimento puede estar bien diseñado en el papel y mal ejecutado en la práctica. Por eso, la documentación es esencial.
El análisis busca responder si las diferencias observadas pueden atribuirse al tratamiento o si podrían explicarse por variación aleatoria.
En etapas posteriores del curso, esta comparación puede realizarse mediante:
La conclusión debe responder la pregunta original.
No basta con decir:
Hubo diferencias.
Conviene indicar:
Una empresa desea comparar su batería A con una batería competidora B.
Determinar si la batería A presenta mayor duración promedio que la batería B.
\[ Y=\text{tiempo en minutos hasta el agotamiento} \]
\[ \text{Tipo de batería} \]
Cada batería probada.
Se seleccionan 10 baterías de cada tipo.
\[ n_A=10 \]
\[ n_B=10 \]
set.seed(100)
baterias <- data.frame(
tipo = rep(c("A", "B"), each = 10),
duracion = c(
round(rnorm(10, mean = 128, sd = 8), 1),
round(rnorm(10, mean = 116, sd = 9), 1)
)
)
bateriasboxplot(
duracion ~ tipo,
data = baterias,
xlab = "Tipo de batería",
ylab = "Duración en minutos",
main = "Comparación de duración"
)Si la media de A es mayor que la de B, existe evidencia descriptiva de una diferencia.
Sin embargo, todavía debe analizarse si:
La aleatorización reduce el riesgo de que factores no controlados favorezcan sistemáticamente un tratamiento.
Ejemplo:
Si un operador más experimentado prueba siempre la batería A y un operador nuevo prueba siempre la B, el efecto del operador se confunde con el efecto de la batería.
La asignación aleatoria ayuda a distribuir estos factores.
La repetición consiste en aplicar cada tratamiento a varias unidades experimentales.
Probar una sola batería A y una sola B sería insuficiente.
La repetición permite:
El control local consiste en reducir la variabilidad usando:
Una variable de confusión es una variable que afecta la respuesta y está relacionada con el tratamiento.
Una empresa compara dos métodos de capacitación:
Si el turno influye en el desempeño, no será posible saber si la diferencia se debe al método o al horario.
El tratamiento y el turno están confundidos.
En un diseño completamente aleatorizado, las unidades experimentales se asignan al azar a los tratamientos.
Una empresa tiene 40 trabajadores y desea comparar dos métodos de capacitación.
Se asignan aleatoriamente:
set.seed(77)
trabajadores <- paste0("T", 1:40)
asignacion <- sample(
rep(c("Método A", "Método B"), each = 20)
)
diseño <- data.frame(
trabajador = trabajadores,
tratamiento = asignacion
)
head(diseño, 10)Un bloque es un grupo de unidades similares respecto a una variable importante.
El objetivo es comparar tratamientos dentro de grupos relativamente homogéneos.
Una empresa desea comparar dos métodos de capacitación, pero reconoce que la antigüedad influye en el desempeño.
Puede crear bloques:
Dentro de cada bloque, asigna aleatoriamente los métodos.
Esto permite separar:
set.seed(88)
empleados <- data.frame(
id = paste0("E", 1:30),
bloque = rep(
c("Baja antigüedad", "Media antigüedad", "Alta antigüedad"),
each = 10
)
)
empleados$tratamiento <- unlist(
lapply(
split(empleados, empleados$bloque),
function(x) {
sample(rep(c("A", "B"), each = 5))
}
)
)
empleadosUn experimento factorial estudia simultáneamente dos o más factores.
La principal ventaja es que permite analizar:
Existe interacción cuando el efecto de un factor depende del nivel de otro.
Una campaña publicitaria puede funcionar bien en redes sociales para jóvenes, pero no para adultos mayores.
El efecto del canal depende del grupo de edad.
Se estudian cuatro factores:
Cada factor tiene dos niveles.
| Factor | Nivel 1 | Nivel 2 |
|---|---|---|
| Batería | A | B |
| Temperatura | Caliente | Fría |
| Motor | Nuevo | Viejo |
| Cable | Bueno | Desgastado |
El número total de combinaciones es:
\[ 2\times2\times2\times2=16 \]
diseño_factorial <- expand.grid(
bateria = c("A", "B"),
temperatura = c("Caliente", "Fría"),
motor = c("Nuevo", "Viejo"),
cable = c("Bueno", "Desgastado")
)
diseño_factorialset.seed(900)
diseño_factorial$orden <- sample(
seq_len(nrow(diseño_factorial))
)
diseño_factorial <- diseño_factorial[
order(diseño_factorial$orden),
]
diseño_factorialSi las pruebas se ejecutan siempre en el mismo orden, cambios temporales pueden afectar los resultados:
La aleatorización distribuye estos efectos de forma más equilibrada.
El número de tratamientos en un diseño factorial completo es el producto del número de niveles de cada factor.
Si se tienen:
entonces:
\[ 2\times5\times4\times3=120 \]
tratamientos.
Si cada tratamiento se repite tres veces:
\[ 120\times3=360 \]
pruebas.
Este crecimiento puede hacer costoso el experimento.
Incluye todas las combinaciones posibles.
Ventajas:
Limitaciones:
Utiliza solo una parte cuidadosamente seleccionada de las combinaciones.
Ventajas:
Limitaciones:
El cuadrado latino es un diseño que permite estudiar un tratamiento controlando simultáneamente dos fuentes de variación.
Se utiliza cuando:
Una empresa desea probar cuatro empaques en cuatro ciudades y cuatro periodos publicitarios.
En lugar de realizar:
\[ 4\times4\times4=64 \]
combinaciones, puede organizar un cuadrado latino de 16 pruebas.
Un ejemplo de estructura es:
| Ciudad / Periodo | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| A | I | II | III | IV |
| B | II | III | IV | I |
| C | III | IV | I | II |
| D | IV | I | II | III |
Cada tratamiento aparece una vez en cada fila y una vez en cada columna.
Una empresa desea evaluar dos mensajes publicitarios:
La variable de respuesta será:
\[ Y=\text{porcentaje de clientes que hacen clic} \]
La empresa reconoce que el dispositivo puede influir:
Factores:
Combinaciones:
| Mensaje | Dispositivo |
|---|---|
| A | Móvil |
| A | Computador |
| B | Móvil |
| B | Computador |
Número de combinaciones:
\[ 2\times2=4 \]
set.seed(456)
publicidad <- expand.grid(
mensaje = c("A", "B"),
dispositivo = c("Móvil", "Computador"),
repeticion = 1:20
)
publicidad$clic <- rbinom(
nrow(publicidad),
size = 1,
prob = ifelse(
publicidad$mensaje == "A" &
publicidad$dispositivo == "Móvil",
0.18,
ifelse(
publicidad$mensaje == "A" &
publicidad$dispositivo == "Computador",
0.10,
ifelse(
publicidad$mensaje == "B" &
publicidad$dispositivo == "Móvil",
0.12,
0.14
)
)
)
)
head(publicidad)Cuando una empresa afirma:
“Nuestro producto fue superior en pruebas científicas”.
Conviene preguntar:
Una prueba estadística sofisticada no corrige un experimento mal diseñado.
El análisis no puede rescatar datos producidos por un diseño defectuoso.
Una empresa desea comparar dos métodos de capacitación para sus vendedores.
Responda:
Una empresa quiere comparar tres diseños de empaque para un nuevo producto.
La variable de respuesta será la intención de compra.
Responda:
Una empresa desea estudiar:
Responda:
Hasta este punto hemos estudiado cómo seleccionar una muestra de una población. Sin embargo, seleccionar una muestra es apenas el comienzo del proceso inferencial.
Una vez obtenida la muestra, se calculan estadísticas como:
Estas estadísticas se utilizan para aproximar características desconocidas de la población.
Pero aparece una dificultad fundamental:
Si seleccionamos una muestra diferente de la misma población, probablemente obtendremos un resultado diferente.
Suponga que una universidad desea estimar la estatura promedio de sus estudiantes. Si selecciona una muestra aleatoria de 30 estudiantes, podría obtener:
\[ \bar{x}_1=168,4\text{ cm} \]
Si selecciona una segunda muestra del mismo tamaño:
\[ \bar{x}_2=170,1\text{ cm} \]
En una tercera muestra:
\[ \bar{x}_3=167,8\text{ cm} \]
Las tres muestras provienen de la misma población y fueron seleccionadas mediante el mismo procedimiento. Sin embargo, sus medias no son iguales.
Esto no significa necesariamente que alguna muestra esté mal seleccionada.
La diferencia aparece porque cada muestra contiene una combinación distinta de estudiantes.
A este fenómeno se le denomina variabilidad muestral.
Cuando se seleccionan muestras diferentes de una misma población, las estadísticas calculadas cambian de una muestra a otra.
Pueden variar:
Esta variación no es un error de digitación ni una falla del investigador. Es una consecuencia natural de trabajar con una parte de la población.
Una empresa tiene 10.000 clientes. La satisfacción promedio real de toda la población es:
\[ \mu=75 \]
Se seleccionan cinco muestras aleatorias de 100 clientes.
Los resultados podrían ser:
| Muestra | Media de satisfacción |
|---|---|
| 1 | 74,2 |
| 2 | 76,1 |
| 3 | 73,8 |
| 4 | 75,5 |
| 5 | 74,9 |
Ninguna de las medias coincide exactamente con la media poblacional.
Sin embargo, todas están relativamente cerca.
La pregunta estadística ya no es únicamente:
¿Cuál fue la media de una muestra?
Ahora también interesa responder:
¿Cómo se comportan las medias de todas las muestras posibles?
La respuesta conduce al concepto de distribución de muestreo.
Una distribución de muestreo es la distribución de probabilidad de una estadística calculada a partir de todas las muestras posibles de un mismo tamaño tomadas de una población.
La estadística puede ser:
Por tanto, pueden existir:
La expresión distribución de muestreo no se refiere a la distribución de los datos de una sola muestra.
Se refiere a la distribución de una estadística obtenida al repetir muchas veces el proceso de selección.
En este tema aparecen tres distribuciones diferentes:
Describe los valores de todos los elementos de la población.
Por ejemplo, una empresa tiene 20.000 trabajadores y registra sus salarios.
La distribución poblacional muestra:
Su media es el parámetro:
\[ \mu \]
y su desviación estándar es:
\[ \sigma \]
Describe los valores observados en una muestra particular.
Si se seleccionan 200 trabajadores, la distribución muestral muestra los salarios de esos 200 casos.
Su media es:
\[ \bar{x} \]
y su desviación estándar es:
\[ s \]
Una muestra distinta produciría otra distribución.
Describe los valores de una estadística obtenida en muchas muestras.
Si se toman 5.000 muestras de 200 trabajadores y se calcula la media salarial de cada una, se obtienen:
\[ \bar{x}_1,\bar{x}_2,\bar{x}_3,\ldots,\bar{x}_{5000} \]
La distribución formada por esas 5.000 medias es una distribución de muestreo de la media.
| Distribución | Elementos que contiene | Medida central |
|---|---|---|
| Población | Valores de todas las unidades | \(\mu\) |
| Muestra | Valores de las unidades seleccionadas | \(\bar{x}\) |
| Distribución de muestreo | Estadísticas de muchas muestras | \(\mu_{\bar{x}}\) |
La distribución de muestreo no contiene personas, productos ni facturas. Contiene estadísticas calculadas a partir de muestras.
Suponga una población pequeña formada por cinco valores:
\[ 2,\ 4,\ 6,\ 8,\ 10 \]
La media poblacional es:
\[ \mu= \frac{2+4+6+8+10}{5} \]
\[ \mu=6 \]
Se seleccionan muestras de tamaño 2 sin reemplazo.
Las muestras posibles son:
\[ (2,4),\ (2,6),\ (2,8),\ (2,10), \]
\[ (4,6),\ (4,8),\ (4,10), \]
\[ (6,8),\ (6,10),\ (8,10) \]
El número de muestras es:
\[ \binom{5}{2}=10 \]
Calculamos la media de cada muestra.
| Muestra | Media |
|---|---|
| \((2,4)\) | 3 |
| \((2,6)\) | 4 |
| \((2,8)\) | 5 |
| \((2,10)\) | 6 |
| \((4,6)\) | 5 |
| \((4,8)\) | 6 |
| \((4,10)\) | 7 |
| \((6,8)\) | 7 |
| \((6,10)\) | 8 |
| \((8,10)\) | 9 |
La distribución de muestreo de la media está formada por:
\[ 3,\ 4,\ 5,\ 6,\ 5,\ 6,\ 7,\ 7,\ 8,\ 9 \]
Observe que algunos valores aparecen más de una vez.
La distribución de frecuencias es:
| Media muestral | Frecuencia | Probabilidad |
|---|---|---|
| 3 | 1 | 0,10 |
| 4 | 1 | 0,10 |
| 5 | 2 | 0,20 |
| 6 | 2 | 0,20 |
| 7 | 2 | 0,20 |
| 8 | 1 | 0,10 |
| 9 | 1 | 0,10 |
Calculamos el promedio de las diez medias:
\[ \mu_{\bar{x}} = \frac{ 3+4+5+6+5+6+7+7+8+9 }{10} \]
\[ \mu_{\bar{x}}=6 \]
La media de la distribución de muestreo coincide con la media poblacional:
\[ \mu_{\bar{x}}=\mu \]
Este resultado es fundamental.
Indica que, en promedio, la media muestral apunta correctamente hacia la media poblacional.
## [1] 6
Generamos todas las muestras posibles de tamaño 2:
## [,1] [,2] [,3] [,4] [,5] [,6] [,7] [,8] [,9] [,10]
## [1,] 2 2 2 2 4 4 4 6 6 8
## [2,] 4 6 8 10 6 8 10 8 10 10
Calculamos la media de cada muestra:
## [1] 3 4 5 6 5 6 7 7 8 9
Construimos una tabla:
tabla_medias <- data.frame(
muestra = apply(
muestras,
2,
function(x) paste(x, collapse = ", ")
),
media = medias_muestrales
)
tabla_mediasComparamos la media poblacional con la media de las medias:
## media_poblacional media_distribucion_muestral
## 6 6
barplot(
table(medias_muestrales) / length(medias_muestrales),
xlab = "Media muestral",
ylab = "Probabilidad",
main = "Distribución de muestreo de la media"
)La gráfica no representa los valores individuales de la población.
Representa las medias que pueden obtenerse al seleccionar muestras de tamaño 2.
La distribución de muestreo de la media es la distribución de probabilidad de todas las medias posibles calculadas a partir de muestras de tamaño \(n\).
Se representa mediante:
\[ \bar{X} \]
La letra mayúscula recuerda que antes de seleccionar la muestra, la media muestral es una variable aleatoria.
Después de observar una muestra específica, se obtiene un valor:
\[ \bar{x} \]
La media de todas las medias muestrales es:
\[ \mu_{\bar{X}}=\mu \]
Esto significa que la media muestral es un estimador insesgado de la media poblacional.
No quiere decir que cada muestra produzca exactamente \(\mu\).
Significa que, si el proceso se repitiera muchas veces, las medias muestrales quedarían centradas alrededor de \(\mu\).
Una empresa tiene una satisfacción poblacional promedio de:
\[ \mu=78 \]
Al seleccionar diferentes muestras podrían obtenerse:
\[ 76,9,\ 78,8,\ 77,4,\ 79,2,\ 78,1 \]
Las medias varían, pero tienden a ubicarse alrededor de 78.
No debe esperarse que una muestra particular produzca exactamente el parámetro poblacional.
La misma lógica se aplica a las proporciones.
Suponga que en una población el 30 % de los clientes presenta mora:
\[ p=0,30 \]
Se seleccionan muchas muestras de 100 clientes y se calcula en cada una:
\[ \hat{p} = \frac{\text{Número de clientes con mora}}{100} \]
Podrían obtenerse proporciones como:
\[ 0,27,\ 0,31,\ 0,35,\ 0,29,\ 0,32 \]
La distribución de esas proporciones constituye la distribución de muestreo de la proporción.
Su media es:
\[ \mu_{\hat{p}}=p \]
En promedio, la proporción muestral apunta hacia la proporción poblacional.
Una fábrica sabe que 8 % de su producción presenta defectos:
\[ p=0,08 \]
Se seleccionan muestras de 200 productos.
En diferentes muestras podrían observarse:
| Muestra | Productos defectuosos | Proporción |
|---|---|---|
| 1 | 14 | 0,070 |
| 2 | 19 | 0,095 |
| 3 | 17 | 0,085 |
| 4 | 12 | 0,060 |
| 5 | 18 | 0,090 |
Las proporciones son distintas aunque provienen de la misma población.
Suponga una población de 50.000 clientes con satisfacción promedio cercana a 75.
set.seed(2026)
poblacion_satisfaccion <- rnorm(
50000,
mean = 75,
sd = 12
)
mean(poblacion_satisfaccion)## [1] 75.0309
## [1] 12.03601
Seleccionamos una muestra de 100 clientes:
set.seed(10)
muestra_1 <- sample(
poblacion_satisfaccion,
size = 100,
replace = FALSE
)
mean(muestra_1)## [1] 73.94121
Una segunda muestra:
set.seed(20)
muestra_2 <- sample(
poblacion_satisfaccion,
size = 100,
replace = FALSE
)
mean(muestra_2)## [1] 73.94909
Una tercera:
set.seed(30)
muestra_3 <- sample(
poblacion_satisfaccion,
size = 100,
replace = FALSE
)
mean(muestra_3)## [1] 73.90224
Las medias son diferentes.
Seleccionamos 5.000 muestras de tamaño 100 y calculamos sus medias.
set.seed(400)
medias_simuladas <- replicate(
5000,
mean(
sample(
poblacion_satisfaccion,
size = 100,
replace = FALSE
)
)
)
head(medias_simuladas)## [1] 75.69016 73.97091 74.82124 74.80050 76.26857 75.52653
## media_poblacional media_de_medias
## 75.03090 75.06375
Los dos valores deberían ser muy cercanos.
hist(
medias_simuladas,
breaks = 35,
xlab = "Media muestral",
ylab = "Frecuencia",
main = "Distribución de muestreo de la media"
)
abline(
v = mean(poblacion_satisfaccion),
lwd = 2,
lty = 2
)La línea vertical representa la media poblacional.
La mayoría de las medias muestrales se concentra alrededor de ese valor.
La distribución de muestreo tiene su propia desviación estándar.
La desviación estándar de una distribución de muestreo recibe el nombre de error estándar.
Para la media se denomina:
Error estándar de la media.
Para la proporción:
Error estándar de la proporción.
El error estándar mide cuánto varía una estadística entre diferentes muestras.
La desviación estándar describe la variabilidad de las observaciones individuales.
El error estándar describe la variabilidad de una estadística entre muestras.
| Medida | ¿Qué variabilidad describe? |
|---|---|
| Desviación estándar | Diferencias entre individuos |
| Error estándar | Diferencias entre estadísticas muestrales |
Suponga que los salarios de una empresa presentan gran variabilidad:
La desviación estándar poblacional puede ser grande.
Sin embargo, si se seleccionan muestras grandes, las medias de esas muestras pueden ser relativamente estables.
Por tanto:
Cuando se toma una muestra aleatoria de una población con desviación estándar \(\sigma\), el error estándar de la media es:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
donde:
El error estándar indica qué tanto tienden a variar las medias muestrales alrededor de la media poblacional.
Un error estándar pequeño significa que las medias de diferentes muestras suelen estar cerca unas de otras.
Un error estándar grande indica mayor variabilidad entre muestras.
Una población tiene:
\[ \mu=80 \]
\[ \sigma=15 \]
Se seleccionan muestras de tamaño:
\[ n=100 \]
El error estándar es:
\[ \sigma_{\bar{X}} = \frac{15}{\sqrt{100}} \]
\[ \sigma_{\bar{X}} = \frac{15}{10} \]
\[ \sigma_{\bar{X}}=1,5 \]
Esto significa que las medias de muestras de tamaño 100 presentan una desviación estándar de 1,5 unidades alrededor de la media poblacional.
No significa que cada observación se encuentre a 1,5 puntos de la media.
Se refiere a la variabilidad de las medias.
Mantengamos:
\[ \sigma=15 \]
\[ \sigma_{\bar{X}} = \frac{15}{\sqrt{25}} = 3 \]
\[ \sigma_{\bar{X}} = \frac{15}{\sqrt{100}} = 1,5 \]
\[ \sigma_{\bar{X}} = \frac{15}{\sqrt{400}} = 0,75 \]
| Tamaño de muestra | Error estándar |
|---|---|
| 25 | 3,00 |
| 100 | 1,50 |
| 400 | 0,75 |
A medida que aumenta el tamaño de la muestra, el error estándar disminuye.
Para reducir el error estándar a la mitad, no basta con duplicar el tamaño de la muestra.
Como:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
para reducir el error a la mitad debe multiplicarse \(n\) por cuatro.
Ejemplo:
\[ n=100 \Rightarrow \sigma_{\bar{X}}=1,5 \]
Para obtener:
\[ \sigma_{\bar{X}}=0,75 \]
se necesita:
\[ n=400 \]
Esto muestra que existe un rendimiento decreciente al aumentar la muestra.
Usaremos la misma población y compararemos muestras de tamaños:
\[ n=10,\ 30,\ 100,\ 500 \]
set.seed(600)
tamanos <- c(10, 30, 100, 500)
resultados_error <- data.frame(
n = tamanos,
error_estandar_simulado = sapply(
tamanos,
function(n) {
medias <- replicate(
3000,
mean(
sample(
poblacion_satisfaccion,
size = n,
replace = FALSE
)
)
)
sd(medias)
}
)
)
resultados_errorTambién calculamos el valor teórico:
sigma_poblacion <- sd(
poblacion_satisfaccion
)
resultados_error$error_estandar_teorico <-
sigma_poblacion / sqrt(resultados_error$n)
resultados_errorLos valores simulados y teóricos deberían ser cercanos.
Para una proporción poblacional \(p\), el error estándar de la proporción muestral es:
\[ \sigma_{\hat{p}} = \sqrt{ \frac{p(1-p)}{n} } \]
donde:
Una empresa sabe que 40 % de sus clientes utiliza la aplicación móvil:
\[ p=0,40 \]
Se seleccionan muestras de:
\[ n=200 \]
El error estándar es:
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,40(1-0,40)}{200} } \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,40(0,60)}{200} } \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,24}{200} } \]
\[ \sigma_{\hat{p}} = \sqrt{0,0012} \]
\[ \sigma_{\hat{p}} \approx0,0346 \]
En términos porcentuales:
\[ 0,0346\times100=3,46\% \]
Las proporciones de diferentes muestras de 200 clientes tienden a variar aproximadamente 3,46 puntos porcentuales alrededor de \(p=0,40\).
Estos conceptos están relacionados, pero no son idénticos.
El error de muestreo de una muestra particular puede expresarse como:
\[ \bar{x}-\mu \]
para una media, o:
\[ \hat{p}-p \]
para una proporción.
El error estándar describe la variabilidad típica de esos errores entre muchas muestras.
Suponga:
\[ \mu=80 \]
y una muestra produce:
\[ \bar{x}=82 \]
El error de muestreo es:
\[ \bar{x}-\mu = 82-80 = 2 \]
Si el error estándar es 1,5, la media observada se encuentra:
\[ \frac{2}{1,5}=1,33 \]
errores estándar por encima de la media poblacional.
Suponga que una máquina llena botellas con:
\[ \mu=125\text{ gramos} \]
y una muestra produce:
\[ \bar{x}=130\text{ gramos} \]
No puede concluirse inmediatamente que la muestra no es representativa.
Las medias muestrales varían.
Para evaluar si 130 es un resultado inusual se necesita conocer:
La simple diferencia entre 125 y 130 no basta.
Una empresa de comercio electrónico procesa 100.000 pedidos.
El tiempo promedio poblacional de entrega es:
\[ \mu=4,8\text{ días} \]
La desviación estándar es:
\[ \sigma=2,4\text{ días} \]
Se seleccionan muestras de:
\[ n=144 \]
\[ \sigma_{\bar{X}} = \frac{2,4}{\sqrt{144}} \]
\[ \sigma_{\bar{X}} = \frac{2,4}{12} \]
\[ \sigma_{\bar{X}}=0,2 \]
Las medias muestrales tienden a variar alrededor de 4,8 días con una desviación estándar de 0,2 días.
Suponga que una muestra produce:
\[ \bar{x}=5,1 \]
La diferencia es:
\[ 5,1-4,8=0,3 \]
En unidades de error estándar:
\[ \frac{0,3}{0,2}=1,5 \]
La media muestral se encuentra 1,5 errores estándar por encima de la media poblacional.
Este resultado no parece extraordinariamente lejano.
Una empresa tiene una proporción poblacional de clientes satisfechos de:
\[ p=0,72 \]
Se seleccionan muestras de:
\[ n=400 \]
El error estándar es:
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,72(0,28)}{400} } \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,2016}{400} } \]
\[ \sigma_{\hat{p}} = \sqrt{0,000504} \]
\[ \sigma_{\hat{p}} \approx0,02245 \]
En porcentaje:
\[ 2,245\% \]
La proporción de clientes satisfechos variará normalmente alrededor de 72 %, con una desviación estándar aproximada de 2,25 puntos porcentuales.
Las distribuciones de muestreo permiten:
Sin este concepto no sería posible avanzar hacia la inferencia estadística.
La inferencia no depende únicamente del valor observado. También depende de cuánto podría variar ese valor si se repitiera el muestreo.
La distribución de muestreo de la media contiene medias, no observaciones individuales.
Una muestra aleatoria normalmente produce diferencias.
El error estándar describe variabilidad aleatoria, no descuido.
La primera describe individuos; el segundo describe estadísticas.
Para reducirlo a la mitad se necesita cuadruplicar el tamaño.
Una diferencia puede deberse únicamente a variabilidad muestral.
Considere la población:
\[ 1,\ 3,\ 5,\ 7 \]
Se seleccionan muestras de tamaño 2 sin reemplazo.
Responda:
Un banco tiene tiempos de atención con:
\[ \mu=18\text{ minutos} \]
\[ \sigma=6\text{ minutos} \]
Se seleccionan muestras de tamaño:
\[ n=36 \]
Responda:
La proporción poblacional de clientes con mora es:
\[ p=0,25 \]
Se seleccionan muestras de:
\[ n=300 \]
Responda:
Una población tiene:
\[ \sigma=20 \]
Calcule el error estándar para:
\[ n=25,\quad n=100,\quad n=400 \]
Responda:
En la sección anterior introdujimos la idea de distribución de muestreo y observamos que una estadística, como la media o la proporción, cambia de una muestra a otra.
Ahora profundizaremos en este concepto para utilizarlo de manera operativa.
El objetivo es responder preguntas como:
La distribución de muestreo constituye el puente entre los datos observados en una muestra y las conclusiones que se formulan sobre una población.
Suponga que una empresa industrial utiliza miles de filtros en su sistema de control ambiental.
La variable de interés es:
\[ X=\text{horas de funcionamiento antes de que un filtro se obstruya} \]
La población está formada por todos los filtros que podrían utilizarse bajo las mismas condiciones operativas.
Esta población tiene:
\[ \mu=\text{media poblacional de duración} \]
\[ \sigma=\text{desviación estándar poblacional} \]
Si se selecciona una muestra de diez filtros, se obtiene una distribución muestral con:
\[ \bar{x}_1=\text{media de la primera muestra} \]
\[ s_1=\text{desviación estándar de la primera muestra} \]
Si se selecciona una segunda muestra:
\[ \bar{x}_2,\quad s_2 \]
Y una tercera:
\[ \bar{x}_3,\quad s_3 \]
Cada muestra contiene filtros diferentes. Por ello, las medias y desviaciones estándar no tienen que coincidir.
Si fuera posible seleccionar todas las muestras de tamaño diez y calcular la media de cada una, se obtendría:
\[ \bar{x}_1,\bar{x}_2,\bar{x}_3,\ldots \]
La distribución formada por estas medias es la distribución de muestreo de la media.
Esta distribución tiene:
\[ \mu_{\bar{X}} = \text{media de todas las medias muestrales} \]
y
\[ \sigma_{\bar{X}} = \text{desviación estándar de todas las medias muestrales} \]
La cantidad \(\sigma_{\bar{X}}\) recibe el nombre de error estándar de la media.
Es importante distinguir tres niveles.
Contiene los valores de todas las unidades.
Ejemplo:
\[ X_1,X_2,\ldots,X_N \]
Tiene:
\[ \mu,\quad \sigma \]
Contiene los valores de las unidades seleccionadas.
Ejemplo:
\[ x_1,x_2,\ldots,x_n \]
Tiene:
\[ \bar{x},\quad s \]
Contiene las estadísticas obtenidas en todas las muestras posibles.
Ejemplo:
\[ \bar{x}_1,\bar{x}_2,\ldots \]
Tiene:
\[ \mu_{\bar{X}},\quad \sigma_{\bar{X}} \]
La siguiente tabla resume la diferencia:
| Nivel | Elementos | Media | Desviación estándar |
|---|---|---|---|
| Población | Observaciones poblacionales | \(\mu\) | \(\sigma\) |
| Muestra | Observaciones seleccionadas | \(\bar{x}\) | \(s\) |
| Distribución de muestreo | Estadísticas de muchas muestras | \(\mu_{\bar{X}}\) | \(\sigma_{\bar{X}}\) |
La distribución de muestreo de la media no contiene personas, productos o facturas. Contiene medias calculadas a partir de muestras.
La distribución de muestreo de la media presenta dos propiedades fundamentales.
La media de todas las medias muestrales es igual a la media poblacional:
\[ \mu_{\bar{X}}=\mu \]
Esto significa que la media muestral es un estimador insesgado de la media poblacional.
No significa que cada muestra produzca exactamente el valor de \(\mu\).
Significa que, si se repitiera el muestreo muchas veces, las medias quedarían centradas alrededor del parámetro poblacional.
Para una población muy grande o conceptualmente infinita:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
donde:
Esta relación muestra que el error estándar disminuye cuando aumenta el tamaño de la muestra.
El error estándar mide cuánto varían las medias muestrales de una muestra a otra.
Un error estándar pequeño indica que las medias muestrales están muy concentradas alrededor de \(\mu\).
Un error estándar grande indica que las medias muestrales presentan mayor dispersión.
La desviación estándar poblacional mide variación entre individuos.
El error estándar mide variación entre medias.
Un banco sabe que los saldos de sus cuentas de ahorro tienen:
\[ \mu=\$2.000 \]
\[ \sigma=\$600 \]
Se seleccionan muestras de:
\[ n=100 \]
\[ \mu_{\bar{X}}=\mu \]
\[ \mu_{\bar{X}}=\$2.000 \]
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
\[ \sigma_{\bar{X}} = \frac{600}{\sqrt{100}} \]
\[ \sigma_{\bar{X}} = \frac{600}{10} \]
\[ \sigma_{\bar{X}}=\$60 \]
Las medias de muestras de 100 cuentas se distribuyen alrededor de $2.000 con una desviación estándar de $60.
Cuando la distribución de muestreo es normal, una media muestral puede transformarse en un valor \(z\):
\[ z = \frac{\bar{x}-\mu} {\sigma_{\bar{X}}} \]
Como:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
también puede escribirse:
\[ z = \frac{\bar{x}-\mu} {\sigma/\sqrt{n}} \]
El valor \(z\) indica cuántos errores estándar se encuentra la media muestral por encima o por debajo de la media poblacional.
Continuemos con:
\[ \mu=\$2.000 \]
\[ \sigma=\$600 \]
\[ n=100 \]
Deseamos calcular:
\[ P(1.900<\bar{X}<2.050) \]
Ya sabemos que:
\[ \sigma_{\bar{X}}=60 \]
\[ z_1 = \frac{1.900-2.000}{60} \]
\[ z_1 = \frac{-100}{60} \]
\[ z_1=-1,67 \]
\[ z_2 = \frac{2.050-2.000}{60} \]
\[ z_2 = \frac{50}{60} \]
\[ z_2=0,83 \]
Por tanto:
\[ P(1.900<\bar{X}<2.050) = P(-1,67<Z<0,83) \]
En R:
## [1] 0.7492709
El resultado es aproximadamente:
\[ 0,749 \]
Interpretación:
Existe aproximadamente 74,9 % de probabilidad de que la media de una muestra de 100 cuentas esté entre $1.900 y $2.050.
Cuando la población tiene distribución normal:
\[ X\sim N(\mu,\sigma) \]
la distribución de muestreo de la media también es normal para cualquier tamaño de muestra:
\[ \bar{X} \sim N \left( \mu, \frac{\sigma^2}{n} \right) \]
Esta propiedad no requiere que \(n\) sea grande.
Si la población original es normal, la distribución de las medias también lo es.
El rendimiento anual de una inversión sigue una distribución normal con:
\[ \mu=\$7.500 \]
\[ \sigma=\$3.300 \]
Se consideran muestras de:
\[ n=1.800 \]
Deseamos calcular:
\[ P(\bar{X}>7.700) \]
\[ \sigma_{\bar{X}} = \frac{3.300}{\sqrt{1.800}} \]
## [1] 77.78175
El error estándar es aproximadamente:
\[ 77,78 \]
\[ z = \frac{7.700-7.500}{77,78} \]
\[ z\approx2,57 \]
Suponga una población con:
\[ \mu=100 \]
\[ \sigma=25 \]
Calculemos el error estándar para distintos tamaños.
\[ \sigma_{\bar{X}} = \frac{25}{\sqrt{5}} \approx11,18 \]
\[ \sigma_{\bar{X}} = \frac{25}{\sqrt{20}} \approx5,59 \]
\[ \sigma_{\bar{X}} = \frac{25}{\sqrt{100}} = 2,5 \]
| Tamaño | Error estándar |
|---|---|
| 5 | 11,18 |
| 20 | 5,59 |
| 100 | 2,50 |
A medida que \(n\) aumenta, la distribución de muestreo se concentra alrededor de \(\mu\).
mu <- 100
sigma <- 25
x <- seq(50, 150, length.out = 500)
plot(
x,
dnorm(x, mean = mu, sd = sigma),
type = "l",
lwd = 2,
xlab = "Valor",
ylab = "Densidad",
main = "Población y distribuciones muestrales"
)
lines(
x,
dnorm(x, mean = mu, sd = sigma / sqrt(5)),
lwd = 2,
lty = 2
)
lines(
x,
dnorm(x, mean = mu, sd = sigma / sqrt(20)),
lwd = 2,
lty = 3
)
lines(
x,
dnorm(x, mean = mu, sd = sigma / sqrt(100)),
lwd = 2,
lty = 4
)
legend(
"topright",
legend = c(
"Población",
"n = 5",
"n = 20",
"n = 100"
),
lty = c(1, 2, 3, 4),
lwd = 2,
bty = "n"
)Las curvas correspondientes a muestras grandes son más estrechas.
En la práctica, muchas variables no tienen distribución normal.
Ejemplos:
Estas variables pueden ser:
La pregunta importante es:
¿Qué forma tiene la distribución de muestreo de la media cuando la población no es normal?
La respuesta conduce al Teorema Central del Límite.
Considere la población:
\[ 3,\ 3,\ 7,\ 9,\ 14 \]
La media poblacional es:
\[ \mu = \frac{3+3+7+9+14}{5} \]
\[ \mu = \frac{36}{5} \]
\[ \mu=7,2 \]
Se seleccionan muestras de tamaño 3 sin reemplazo.
El número de muestras es:
\[ \binom{5}{3}=10 \]
Las muestras posibles son:
| Muestra | Valores | Media |
|---|---|---|
| 1 | 3, 3, 7 | 4,33 |
| 2 | 3, 3, 9 | 5,00 |
| 3 | 3, 3, 14 | 6,67 |
| 4 | 3, 7, 9 | 6,33 |
| 5 | 3, 7, 14 | 8,00 |
| 6 | 3, 9, 14 | 8,67 |
| 7 | 3, 7, 9 | 6,33 |
| 8 | 3, 7, 14 | 8,00 |
| 9 | 3, 9, 14 | 8,67 |
| 10 | 7, 9, 14 | 10,00 |
La media de las medias muestrales es:
\[ \mu_{\bar{X}}=7,2 \]
Aunque la población no es normal, la distribución de muestreo sigue centrada en \(\mu\).
poblacion <- c(3, 3, 7, 9, 14)
media_poblacional <- mean(poblacion)
muestras <- combn(
poblacion,
m = 3
)
medias <- apply(
muestras,
2,
mean
)
media_poblacional## [1] 7.2
## [1] 4.333333 5.000000 6.666667 6.333333 8.000000 8.666667 6.333333
## [8] 8.000000 8.666667 10.000000
## [1] 7.2
El Teorema Central del Límite establece que, bajo condiciones generales, la distribución de muestreo de la media se aproxima a una distribución normal cuando aumenta el tamaño de la muestra, aunque la población original no sea normal.
Simbólicamente:
\[ \bar{X} \approx N \left( \mu, \frac{\sigma^2}{n} \right) \]
para un tamaño de muestra suficientemente grande.
El teorema implica que:
\[ \mu_{\bar{X}}=\mu \]
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
La distribución de \(\bar{X}\) se aproxima a la normal cuando \(n\) aumenta.
Es posible calcular probabilidades sobre medias muestrales sin conocer exactamente la forma de la población.
En cursos introductorios suele utilizarse:
\[ n\geq30 \]
como criterio práctico para aplicar la aproximación normal.
Sin embargo, esta regla no debe interpretarse como una frontera absoluta.
El número 30 no es un hechizo estadístico. Es una regla práctica, no una garantía universal.
Construiremos una población muy asimétrica mediante una distribución exponencial.
## [1] 9.981482
## [1] 9.982577
La distribución presenta una cola larga hacia la derecha.
set.seed(500)
medias_n2 <- replicate(
5000,
mean(
sample(
poblacion_asimetrica,
size = 2,
replace = TRUE
)
)
)
medias_n5 <- replicate(
5000,
mean(
sample(
poblacion_asimetrica,
size = 5,
replace = TRUE
)
)
)
medias_n30 <- replicate(
5000,
mean(
sample(
poblacion_asimetrica,
size = 30,
replace = TRUE
)
)
)
medias_n100 <- replicate(
5000,
mean(
sample(
poblacion_asimetrica,
size = 100,
replace = TRUE
)
)
)par(mfrow = c(2, 2))
hist(
medias_n2,
breaks = 35,
main = "n = 2",
xlab = "Media muestral"
)
hist(
medias_n5,
breaks = 35,
main = "n = 5",
xlab = "Media muestral"
)
hist(
medias_n30,
breaks = 35,
main = "n = 30",
xlab = "Media muestral"
)
hist(
medias_n100,
breaks = 35,
main = "n = 100",
xlab = "Media muestral"
)A medida que aumenta \(n\):
La distribución de ingresos anuales de los cajeros de un banco es asimétrica y tiene:
\[ \mu=\$19.000 \]
\[ \sigma=\$2.000 \]
Se seleccionan:
\[ n=30 \]
cajeros.
Deseamos calcular:
\[ P(\bar{X}>19.750) \]
Aunque la población no es normal, utilizaremos el Teorema Central del Límite.
\[ \sigma_{\bar{X}} = \frac{2.000}{\sqrt{30}} \]
## [1] 365.1484
\[ \sigma_{\bar{X}} \approx365,15 \]
\[ z = \frac{19.750-19.000}{365,15} \]
\[ z = \frac{750}{365,15} \]
\[ z\approx2,05 \]
\[ P(\bar{X}>19.750) = P(Z>2,05) \]
## [1] 0.0199898
El resultado es aproximadamente:
\[ 0,020 \]
Interpretación:
Existe cerca de 2 % de probabilidad de obtener una media superior a $19.750 en una muestra aleatoria de 30 cajeros, si la media poblacional es $19.000.
Para calcular probabilidades con medias muestrales se recomienda seguir cinco pasos.
\[ \mu,\quad \sigma,\quad n \]
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
Por ejemplo:
\[ P(\bar{X}>a) \]
\[ P(\bar{X}<a) \]
\[ P(a<\bar{X}<b) \]
\[ z = \frac{\bar{x}-\mu} {\sigma/\sqrt{n}} \]
Una máquina produce piezas con:
\[ \mu=50 \]
\[ \sigma=8 \]
Se seleccionan muestras de:
\[ n=64 \]
Calcule:
\[ P(\bar{X}<48) \]
\[ \sigma_{\bar{X}} = \frac{8}{\sqrt{64}} = 1 \]
\[ z = \frac{48-50}{1} = -2 \]
Una población tiene:
\[ \mu=98,6 \]
\[ \sigma=17,2 \]
Se toma una muestra de:
\[ n=25 \]
Calcule:
\[ P(92<\bar{X}<102) \]
\[ \sigma_{\bar{X}} = \frac{17,2}{\sqrt{25}} \]
\[ \sigma_{\bar{X}} = 3,44 \]
\[ z_1 = \frac{92-98,6}{3,44} \approx-1,92 \]
\[ z_2 = \frac{102-98,6}{3,44} \approx0,99 \]
No debe confundirse:
\[ P(X>a) \]
con:
\[ P(\bar{X}>a) \]
Para una observación individual se utiliza:
\[ \sigma \]
Para una media muestral se utiliza:
\[ \frac{\sigma}{\sqrt{n}} \]
El costo de un apartamento tiene:
\[ \mu=\$62.000 \]
\[ \sigma=\$4.200 \]
\[ P(X\geq65.000) \]
## [1] 0.2375253
\[ P(\bar{X}\geq65.000) \]
El error estándar es:
\[ \frac{4200}{\sqrt{2}} \]
## [1] 0.1562111
La segunda probabilidad es menor porque las medias muestrales tienen menos variabilidad.
En algunos problemas interesa la suma total en lugar del promedio.
Si:
\[ T=\sum_{i=1}^{n}X_i \]
entonces:
\[ E(T)=n\mu \]
y
\[ \sigma_T=\sigma\sqrt{n} \]
En cambio, para la media:
\[ E(\bar{X})=\mu \]
y
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
Un transbordador transporta 25 pasajeros.
El peso de cada pasajero sigue una distribución normal con:
\[ \mu=168\text{ libras} \]
\[ \sigma^2=361 \]
Por tanto:
\[ \sigma=19 \]
El peso total es:
\[ T=\sum_{i=1}^{25}X_i \]
\[ \mu_T = 25(168) \]
\[ \mu_T=4.200 \]
\[ \sigma_T = 19\sqrt{25} \]
\[ \sigma_T=95 \]
Deseamos:
\[ P(T>4.250) \]
\[ z = \frac{4.250-4.200}{95} \]
\[ z\approx0,526 \]
La fórmula:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
se utiliza cuando:
Cuando se muestrea sin reemplazo desde una población finita y la muestra representa una proporción importante de ella, se utiliza la corrección:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \sqrt{ \frac{N-n}{N-1} } \]
El factor:
\[ \sqrt{ \frac{N-n}{N-1} } \]
se denomina factor de corrección por población finita.
Una regla práctica es aplicarla cuando:
\[ \frac{n}{N}>0,05 \]
es decir, cuando la muestra supera aproximadamente 5 % de la población.
Una empresa tiene:
\[ N=500 \]
trabajadores.
Se seleccionan:
\[ n=100 \]
La desviación estándar poblacional es:
\[ \sigma=12 \]
\[ \sigma_{\bar{X}} = \frac{12}{\sqrt{100}} = 1,2 \]
Una entidad financiera sabe que el saldo mensual de sus clientes tiene:
\[ \mu=\$112 \]
\[ \sigma=\$56 \]
Se seleccionan:
\[ n=50 \]
cuentas.
Calcule:
\[ P(\bar{X}<100) \]
y
\[ P(100<\bar{X}<130) \]
\[ \sigma_{\bar{X}} = \frac{56}{\sqrt{50}} \]
## [1] 7.919596
\[ \sigma_{\bar{X}} \approx7,92 \]
\[ z = \frac{100-112}{7,92} \]
\[ z\approx-1,52 \]
## [1] 0.06485723
## [1] 0.923625
La primera probabilidad indica qué tan frecuente sería obtener una media inferior a $100 en muestras de 50 cuentas.
La segunda indica qué proporción de medias muestrales estaría entre $100 y $130.
Cuando la variable es una media muestral, debe utilizarse el error estándar.
\[ P(X>a) \]
y
\[ P(\bar{X}>a) \]
son problemas diferentes.
Una población extremadamente asimétrica o con valores extremos puede necesitar muestras mayores.
El error estándar es una medida de variabilidad aleatoria.
El Teorema Central del Límite corrige la forma de la distribución de medias, no un mal diseño de selección.
La igualdad se cumple en promedio, no en cada muestra.
Los saldos de cuentas tienen:
\[ \mu=\$2.400 \]
\[ \sigma=\$720 \]
Se seleccionan muestras de:
\[ n=144 \]
Responda:
Una empresa tiene tiempos de entrega con:
\[ \mu=5,2\text{ días} \]
\[ \sigma=2,1\text{ días} \]
Se seleccionan:
\[ n=49 \]
pedidos.
Responda:
El monto de compra de los clientes es fuertemente asimétrico, con:
\[ \mu=\$180.000 \]
\[ \sigma=\$90.000 \]
Se seleccionan:
\[ n=64 \]
clientes.
Responda:
El peso de un pasajero tiene:
\[ \mu=72\text{ kg} \]
\[ \sigma=11\text{ kg} \]
Un ascensor transporta 12 personas.
Responda:
A continuación se presentan las soluciones desarrolladas paso a paso. El propósito no es únicamente identificar la respuesta correcta, sino comprender cómo se define la población, cómo se reconoce la unidad de análisis y qué criterios deben considerarse al decidir entre un censo y una muestra.
Una empresa de telefonía móvil posee 850.000 clientes activos y desea estimar el porcentaje de usuarios satisfechos con su servicio de internet.
La población está formada por:
Los 850.000 clientes activos de la empresa de telefonía móvil.
La población corresponde al conjunto completo sobre el cual la empresa desea obtener información.
En este caso, la organización no desea conocer únicamente la opinión de algunos clientes. Su interés real es estimar el nivel de satisfacción de todos los usuarios activos.
Por tanto:
\[ N=850.000 \]
donde \(N\) representa el tamaño de la población.
La unidad de análisis es:
Cada cliente activo de la empresa.
Cada cliente constituye una unidad porque sobre él se desea registrar información relacionada con su nivel de satisfacción.
Por ejemplo, para cada cliente podrían medirse variables como:
Es importante no confundir la unidad de análisis con el servicio de internet. El servicio es el objeto evaluado, pero quien proporciona la información es cada cliente.
En este caso, no parece conveniente realizar un censo.
Un censo implicaría intentar contactar a los 850.000 clientes activos. Aunque técnicamente podría enviarse una invitación masiva, obtener y procesar información válida de toda la población sería muy complejo.
El problema puede analizarse desde varios puntos de vista.
Suponga que cada encuesta necesita solamente cinco minutos.
El tiempo total de respuesta sería:
\[ 850.000\times5=4.250.000\text{ minutos} \]
Al convertir a horas:
\[ \frac{4.250.000}{60}=70.833,33\text{ horas} \]
Esto representa una cantidad enorme de tiempo acumulado entre los participantes.
La empresa tendría que asumir costos asociados con:
Aunque la empresa intente contactar a todos los clientes, no todos responderán.
Algunas personas:
Por tanto, una invitación censal no garantiza una respuesta censal.
Si el proceso tarda demasiado, los resultados pueden llegar cuando las condiciones del servicio ya hayan cambiado.
Por estas razones, una muestra correctamente seleccionada sería una alternativa más eficiente.
Entre las principales dificultades se encuentran las siguientes.
Contactar a 850.000 clientes requiere una inversión considerable en medios de comunicación, personal y procesamiento.
El periodo de recolección podría extenderse demasiado y retrasar la toma de decisiones.
No todos los clientes tendrán teléfono o correo actualizado.
Una parte importante de los clientes podría negarse a participar o abandonar la encuesta.
Un cliente podría responder más de una vez si no se controla correctamente el acceso al cuestionario.
Una encuesta masiva puede generar respuestas apresuradas, incompletas o poco reflexivas.
La depuración y análisis de cientos de miles de registros demandaría gran capacidad técnica.
Mientras se completa el estudio, algunos clientes podrían cambiar de plan, cancelar el servicio o modificar su percepción.
Una muestra bien diseñada ofrecería varias ventajas.
La empresa puede concentrar sus recursos en un número menor de clientes.
La información puede obtenerse en un periodo más corto.
Es posible supervisar mejor la recolección, validar respuestas y corregir inconsistencias.
La encuesta puede incluir preguntas más completas sin sobrecargar el proceso.
La empresa puede realizar estudios periódicos para comparar la satisfacción a lo largo del tiempo.
Una base más manejable facilita la depuración, visualización e interpretación de los resultados.
La muestra debería reflejar la diversidad de la población.
Entre los grupos que podrían considerarse se encuentran:
La selección de estos grupos depende de la pregunta específica de investigación.
Por ejemplo, si la empresa sospecha que la satisfacción varía según la ciudad, deberá garantizar representación suficiente de las distintas regiones.
La empresa no necesita entrevistar a los 850.000 clientes para estimar el nivel de satisfacción.
Necesita una muestra que:
Una fábrica produce diariamente 95.000 botellas de agua y el laboratorio selecciona 450 botellas para verificar la calidad.
La población está formada por:
Las 95.000 botellas producidas durante la jornada.
Por tanto:
\[ N=95.000 \]
Es importante incluir el periodo en la definición.
No basta con decir “todas las botellas de la empresa”, porque la producción puede cambiar entre días, turnos o lotes.
Una definición más precisa sería:
Todas las botellas de agua fabricadas por la planta durante la jornada evaluada.
La muestra está formada por:
Las 450 botellas seleccionadas para el análisis de calidad.
Por tanto:
\[ n=450 \]
Estas botellas son las unidades que serán medidas directamente.
La unidad de análisis es:
Cada botella producida.
Sobre cada botella pueden medirse variables como:
Analizar toda la producción podría ser innecesario y costoso.
Cada botella requeriría tiempo, equipos y personal.
Una revisión total podría ralentizar la línea de producción.
Algunas evaluaciones pueden requerir abrir la botella, perforar el envase o realizar análisis microbiológicos.
Las botellas sometidas a estas pruebas no podrían venderse.
Esperar la inspección de las 95.000 unidades podría impedir que el producto saliera a tiempo.
Si el proceso funciona de manera estable, revisar cada unidad aportaría poca información adicional frente al costo involucrado.
La muestra podría no representar toda la producción.
El comportamiento de la máquina puede cambiar durante el día debido a:
Si todas las botellas se toman al inicio, el estudio describirá principalmente las condiciones iniciales de producción.
Podría ocurrir que:
Este sería un problema de selección.
Una estrategia más adecuada sería distribuir las 450 botellas durante toda la jornada.
Suponga que la producción se realiza durante nueve horas.
Podrían seleccionarse:
\[ \frac{450}{9}=50 \]
botellas por hora.
Otra alternativa sería seleccionar una botella cada cierto número de unidades.
El intervalo sistemático sería:
\[ k=\frac{N}{n} \]
\[ k=\frac{95.000}{450}\approx211,11 \]
Esto significa que podría seleccionarse aproximadamente una botella cada 211 unidades, después de escoger un punto de inicio aleatorio.
Por ejemplo, si el inicio aleatorio fuera la botella 83, la selección seguiría aproximadamente así:
\[ 83,\ 294,\ 505,\ 716,\ldots \]
De esta manera, la muestra quedaría distribuida a lo largo de toda la producción.
Una propuesta más completa podría combinar:
Por ejemplo:
| Turno | Botellas seleccionadas |
|---|---|
| Mañana | 150 |
| Tarde | 150 |
| Noche | 150 |
| Total | 450 |
Dentro de cada turno, las botellas podrían seleccionarse sistemáticamente.
El tamaño de la muestra no es el único aspecto importante.
Las 450 botellas deben estar distribuidas de manera que representen:
Una empresa desea estimar el tiempo promedio de entrega de los pedidos realizados durante el último semestre.
La población está formada por:
Todos los pedidos realizados durante el último semestre que cumplen los criterios definidos por la empresa.
La definición debe precisar si se incluyen:
Una definición posible sería:
Todos los pedidos físicos despachados y entregados por la empresa durante el último semestre.
Esta definición evita mezclar pedidos que no son comparables.
La unidad de análisis es:
Cada pedido realizado.
Cada pedido constituye una observación independiente dentro de la base, siempre que la empresa defina adecuadamente sus criterios.
La variable principal es el tiempo de entrega.
Puede definirse como:
\[ \text{Tiempo de entrega} = \text{Fecha y hora de entrega} - \text{Fecha y hora de confirmación} \]
Sin embargo, la empresa debe decidir desde qué momento comienza el conteo.
Posibles puntos de inicio:
La definición debe ser consistente para todos los registros.
La unidad de medida podría ser:
La empresa podría tener cientos de miles o millones de pedidos.
Revisar todos puede resultar innecesario cuando:
Una muestra permite:
La muestra debería representar la diversidad de pedidos.
Debería incluir:
También debería evitar seleccionar únicamente pedidos fáciles de analizar.
Se produciría un sesgo de cobertura o selección geográfica.
Los tiempos de entrega pueden depender de:
Si solo se analiza Bogotá, por ejemplo, los resultados no necesariamente representarían pedidos enviados a municipios pequeños o zonas rurales.
La empresa podría obtener una media válida para esa ciudad, pero no para toda su operación.
La muestra estaría sesgada porque excluiría precisamente los pedidos con problemas.
El promedio calculado sería artificialmente bajo.
Suponga que existen cinco tiempos de entrega:
\[ 2,\ 3,\ 3,\ 5,\ 12 \]
El promedio real es:
\[ \bar{x} = \frac{2+3+3+5+12}{5} = 5 \]
Si se excluye el pedido tardío de 12 días:
\[ \bar{x} = \frac{2+3+3+5}{4} = 3,25 \]
La estimación disminuiría de 5 a 3,25 días.
La empresa podría concluir erróneamente que su proceso funciona mejor de lo que realmente funciona.
Además, no podría identificar:
Una estrategia adecuada podría ser un muestreo estratificado.
Posibles estratos:
Dentro de cada estrato se seleccionarían pedidos aleatoriamente.
La muestra debe incluir tanto pedidos rápidos como tardíos.
Excluir los casos problemáticos transforma el estudio en una descripción parcial y optimista de la operación.
El objetivo no es producir un buen indicador, sino obtener un indicador que refleje la realidad.
La universidad tiene 5.000 estudiantes y desea seleccionar 250.
\[ N=5.000 \]
\[ n=250 \]
\[ \pi_i=\frac{n}{N} \]
\[ \pi_i=\frac{250}{5.000}=0,05 \]
Cada estudiante tiene una probabilidad de 5 % de formar parte de la muestra.
\[ w_i=\frac{1}{\pi_i} \]
\[ w_i=\frac{1}{0,05}=20 \]
Cada estudiante seleccionado representa aproximadamente 20 estudiantes de la población.
No.
El muestreo aleatorio simple garantiza igualdad de probabilidad individual, pero no fija cantidades específicas por facultad.
Es posible que una facultad grande tenga muchos seleccionados y una facultad pequeña tenga pocos.
Si se requiere garantizar representación de todas las facultades, debería considerarse muestreo estratificado.
La población está formada por cinco personas y se seleccionan dos.
\[ N=5 \]
\[ n=2 \]
\[ \binom{5}{2} = \frac{5!}{2!3!} \]
\[ \binom{5}{2}=10 \]
\[ AB,\ AC,\ AD,\ AE,\ BC,\ BD,\ BE,\ CD,\ CE,\ DE \]
\[ P(s)=\frac{1}{10} \]
Cada persona aparece en cuatro muestras.
Por ejemplo, \(A\) aparece en:
\[ AB,\ AC,\ AD,\ AE \]
Entonces:
\[ P(A\in s)=\frac{4}{10}=0,4 \]
Mediante la fórmula:
\[ \pi_i=\frac{n}{N} \]
\[ \pi_i=\frac{2}{5}=0,4 \]
Todos los integrantes tienen 40 % de probabilidad de inclusión.
La población está formada por:
Los 18.000 créditos activos del banco en la fecha definida para el estudio.
Cada crédito activo.
\[ \pi_i=\frac{360}{18.000} \]
\[ \pi_i=0,02 \]
Cada crédito tiene 2 % de probabilidad de ser seleccionado.
\[ w_i=\frac{1}{0,02}=50 \]
Cada crédito seleccionado representa aproximadamente 50 créditos.
Porque el orden de la base podría estar relacionado con:
Los primeros 360 podrían compartir características que no representan al conjunto completo.
Además, no existiría un mecanismo aleatorio.
Antes de seleccionar deben revisarse, por ejemplo:
La población es:
\[ A,\ B,\ C \]
Se seleccionan dos unidades con reemplazo y se considera el orden.
\[ AA,\ AB,\ AC,\ BA,\ BB,\ BC,\ CA,\ CB,\ CC \]
Existen:
\[ 3\times3=9 \]
resultados posibles.
Cada selección tiene probabilidad \(1/3\).
Por independencia:
\[ P(AA)=\frac{1}{3}\times\frac{1}{3}=\frac{1}{9} \]
Lo mismo ocurre con cada secuencia.
\[ P(AA)=\frac{1}{9} \]
Los resultados favorables son:
\[ AB,\ AC,\ BA,\ BC,\ CA,\ CB \]
Hay seis resultados favorables de nueve posibles.
\[ P(\text{diferentes})=\frac{6}{9} \]
\[ P(\text{diferentes})=\frac{2}{3} \]
También puede calcularse mediante el complemento:
\[ P(\text{diferentes}) = 1-P(\text{iguales}) \]
Los resultados iguales son:
\[ AA,\ BB,\ CC \]
\[ P(\text{iguales})=\frac{3}{9}=\frac{1}{3} \]
Por tanto:
\[ P(\text{diferentes}) = 1-\frac{1}{3} = \frac{2}{3} \]
Cada vendedor puede ser una unidad experimental, siempre que el tratamiento se asigne individualmente.
Si la capacitación se aplica por equipos completos, la unidad experimental sería cada equipo.
El factor es:
Método de capacitación.
Podría utilizarse:
Una opción precisa sería:
\[ Y=\text{porcentaje de cumplimiento de la meta mensual} \]
Se puede construir una lista de vendedores elegibles y asignar aleatoriamente la mitad a cada método.
set.seed(1000)
vendedores <- paste0("V", 1:40)
tratamiento <- sample(
rep(c("A", "B"), each = 20)
)
data.frame(
vendedor = vendedores,
metodo = tratamiento
)La experiencia quedaría confundida con el método.
Si los nuevos tienen menor desempeño, podría concluirse erróneamente que A es peor.
Diseño de empaque.
Intención de compra.
Puede medirse como:
Cada consumidor al que se presenta un empaque.
Una sola persona puede tener preferencias particulares.
La repetición permite:
Los empaques pueden asignarse aleatoriamente a los consumidores.
También debe aleatorizarse el orden de presentación si una misma persona observa varios empaques.
Existen tres factores:
Precio:
\[ 2 \]
Publicidad:
\[ 3 \]
Canal:
\[ 2 \]
\[ 2\times3\times2=12 \]
Se requieren 12 combinaciones en un factorial completo.
Si cada combinación se repite cinco veces:
\[ 12\times5=60 \]
Se requieren 60 observaciones.
Podrían estudiarse:
Por ejemplo, una publicidad puede funcionar bien en línea, pero no en tiendas físicas. Eso sería una interacción entre publicidad y canal.
La población es:
\[ 1,\ 3,\ 5,\ 7 \]
\[ \mu= \frac{1+3+5+7}{4} \]
\[ \mu=\frac{16}{4}=4 \]
Como:
\[ N=4 \]
\[ n=2 \]
el número de muestras es:
\[ \binom{4}{2}=6 \]
Las muestras son:
\[ (1,3),\ (1,5),\ (1,7),\ (3,5),\ (3,7),\ (5,7) \]
\[ \bar{x}_{(1,3)}=\frac{1+3}{2}=2 \]
\[ \bar{x}_{(1,5)}=\frac{1+5}{2}=3 \]
\[ \bar{x}_{(1,7)}=\frac{1+7}{2}=4 \]
\[ \bar{x}_{(3,5)}=\frac{3+5}{2}=4 \]
\[ \bar{x}_{(3,7)}=\frac{3+7}{2}=5 \]
\[ \bar{x}_{(5,7)}=\frac{5+7}{2}=6 \]
La distribución de muestreo es:
\[ 2,\ 3,\ 4,\ 4,\ 5,\ 6 \]
\[ \mu_{\bar{x}} = \frac{2+3+4+4+5+6}{6} \]
\[ \mu_{\bar{x}} = \frac{24}{6} = 4 \]
Por tanto:
\[ \mu_{\bar{x}}=\mu=4 \]
La distribución de muestreo está centrada en la media poblacional.
Se tiene:
\[ \mu=18 \]
\[ \sigma=6 \]
\[ n=36 \]
\[ \mu_{\bar{X}}=\mu \]
\[ \mu_{\bar{X}}=18 \]
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
\[ \sigma_{\bar{X}} = \frac{6}{\sqrt{36}} \]
\[ \sigma_{\bar{X}} = \frac{6}{6} = 1 \]
Las medias de muestras de 36 clientes tienden a variar alrededor de 18 minutos con una desviación estándar de 1 minuto.
Si:
\[ \bar{x}=20 \]
entonces:
\[ \bar{x}-\mu = 20-18 = 2 \]
La muestra sobreestima la media poblacional en 2 minutos.
\[ \frac{\bar{x}-\mu} {\sigma_{\bar{X}}} = \frac{2}{1} = 2 \]
La media observada está dos errores estándar por encima de la media poblacional.
Se tiene:
\[ p=0,25 \]
\[ n=300 \]
\[ \mu_{\hat{p}}=p \]
\[ \mu_{\hat{p}}=0,25 \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{p(1-p)}{n} } \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,25(0,75)}{300} } \]
\[ \sigma_{\hat{p}} = \sqrt{ \frac{0,1875}{300} } \]
\[ \sigma_{\hat{p}} = \sqrt{0,000625} \]
\[ \sigma_{\hat{p}}=0,025 \]
En porcentaje:
\[ 0,025\times100=2,5\% \]
Si:
\[ \hat{p}=0,29 \]
entonces:
\[ \hat{p}-p = 0,29-0,25 = 0,04 \]
La muestra sobreestima la proporción poblacional en 0,04, es decir, cuatro puntos porcentuales.
No.
La proporción muestral varía entre muestras. No se espera que cada muestra produzca exactamente 0,25.
Se tiene:
\[ \sigma=20 \]
\[ \sigma_{\bar{X}} = \frac{20}{\sqrt{25}} = \frac{20}{5} = 4 \]
\[ \sigma_{\bar{X}} = \frac{20}{\sqrt{100}} = \frac{20}{10} = 2 \]
\[ \sigma_{\bar{X}} = \frac{20}{\sqrt{400}} = \frac{20}{20} = 1 \]
| \(n\) | Error estándar |
|---|---|
| 25 | 4 |
| 100 | 2 |
| 400 | 1 |
El error estándar disminuye a medida que aumenta \(n\).
La muestra de 400 observaciones produce la mayor precisión.
Para reducir el error estándar a la mitad, el tamaño muestral debe multiplicarse por cuatro.
Se tiene:
\[ \mu=2.400 \]
\[ \sigma=720 \]
\[ n=144 \]
\[ \mu_{\bar{X}}=\mu \]
\[ \mu_{\bar{X}}=2.400 \]
\[ \sigma_{\bar{X}} = \frac{720}{\sqrt{144}} \]
\[ \sigma_{\bar{X}} = \frac{720}{12} \]
\[ \sigma_{\bar{X}}=60 \]
\[ z = \frac{2.520-2.400}{60} \]
\[ z=2 \]
\[ P(\bar{X}>2.520) = P(Z>2) \]
## [1] 0.02275013
\[ P(\bar{X}>2.520) \approx0,0228 \]
\[ z_1 = \frac{2.300-2.400}{60} = -1,67 \]
\[ z_2 = \frac{2.500-2.400}{60} = 1,67 \]
## [1] 0.9044193
Interpretación:
La mayoría de las medias de muestras de 144 cuentas se encontrará relativamente cerca de $2.400.
Se tiene:
\[ \mu=5,2 \]
\[ \sigma=2,1 \]
\[ n=49 \]
\[ \sigma_{\bar{X}} = \frac{2,1}{\sqrt{49}} \]
\[ \sigma_{\bar{X}} = \frac{2,1}{7} \]
\[ \sigma_{\bar{X}}=0,3 \]
\[ z = \frac{4,8-5,2}{0,3} \]
\[ z=-1,33 \]
## [1] 0.09121122
\[ z = \frac{5,8-5,2}{0,3} \]
\[ z=2 \]
## [1] 0.02275013
## [1] 0.6826895
\[ \sigma_{\bar{X}} = \frac{2,1}{\sqrt{196}} \]
\[ \sigma_{\bar{X}} = \frac{2,1}{14} \]
\[ \sigma_{\bar{X}}=0,15 \]
El error estándar se reduce a la mitad porque el tamaño se cuadruplicó.
Las medias se concentrarán más cerca de 5,2.
Se tiene:
\[ \mu=180.000 \]
\[ \sigma=90.000 \]
\[ n=64 \]
Aunque la población es asimétrica, el tamaño:
\[ n=64 \]
es suficientemente grande para utilizar el Teorema Central del Límite como aproximación, siempre que no existan valores extremos extraordinariamente dominantes.
\[ \sigma_{\bar{X}} = \frac{90.000}{\sqrt{64}} \]
\[ \sigma_{\bar{X}} = \frac{90.000}{8} \]
\[ \sigma_{\bar{X}}=11.250 \]
\[ z = \frac{200.000-180.000}{11.250} \]
\[ z\approx1,78 \]
## [1] 0.03772018
El teorema permite aproximar la distribución de las medias muestrales mediante una normal, aunque los montos individuales sean asimétricos.
No.
La población original conserva su forma.
Lo que se aproxima a la normal es la distribución de las medias muestrales.
Se tiene:
\[ \mu=72 \]
\[ \sigma=11 \]
\[ n=12 \]
\[ \mu_T=n\mu \]
\[ \mu_T=12(72) \]
\[ \mu_T=864\text{ kg} \]
\[ \sigma_T=\sigma\sqrt{n} \]
\[ \sigma_T=11\sqrt{12} \]
## [1] 38.10512
\[ \sigma_T\approx38,11\text{ kg} \]
\[ z = \frac{900-864}{38,11} \]
\[ z\approx0,94 \]
## [1] 0.172392
Porque el problema pregunta por la suma total, no por la media.
Para una suma:
\[ \sigma_T=\sigma\sqrt{n} \]
Para una media:
\[ \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]
\[ \mu_{\bar{X}}=\mu \]
\[ \mu_{\bar{X}}=72\text{ kg} \]