_______________________________________________________________________________________________________
En las ciencias agrarias y biológicas, muchas decisiones se sustentan en información obtenida a partir de muestras, ya que estudiar la totalidad de una población suele ser costoso, demandar demasiado tiempo o resultar impracticable. En este contexto, la estadística inferencial permite utilizar los datos muestrales para estimar parámetros poblacionales, como la media y la varianza, y cuantificar la incertidumbre asociada a dichas estimaciones mediante intervalos de confianza.
En este trabajo práctico se abordarán la estimación puntual, la construcción e interpretación de intervalos de confianza y la determinación del tamaño muestral requerido de acuerdo con el nivel de confianza y el error máximo permitido. Estos procedimientos se aplicarán a situaciones propias de las ciencias agrarias, prestando especial atención a la selección del método estadístico adecuado y a la interpretación de los resultados en su contexto.
El análisis se complementará con el uso del software R, que facilita el procesamiento de datos, la elaboración de gráficos y la reproducción de los cálculos estadísticos. De este modo, se busca integrar los fundamentos teóricos con su aplicación práctica y fortalecer la capacidad para tomar decisiones fundamentadas en evidencia cuantitativa.
Un parámetro es una medida numérica que describe una característica de una población, como la media \((\mu)\), la varianza \((\sigma^2)\), la desviación estándar \((\sigma)\) o una proporción \((p)\). Generalmente, estos parámetros son desconocidos y deben estimarse utilizando la información obtenida de una muestra.
Un estimador es una medida calculada a partir de los datos muestrales que se utiliza para aproximar el valor de un parámetro poblacional. Se representa mediante el símbolo del parámetro acompañado por un acento circunflejo:
\([\widehat{\theta}]\)
El valor numérico obtenido al aplicar el estimador a una muestra particular se denomina estimación puntual.
| Parámetro poblacional | Estimador puntual |
|---|---|
| Media poblacional \((\mu)\) | Media muestral: \((\displaystyle \bar{x}=\frac{\sum_{i=1}^{n}x_i}{n})\) |
| Varianza poblacional \((\sigma^2)\) | Varianza muestral: \((\displaystyle s^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1})\) |
| Desviación estándar poblacional \((\sigma)\) | Desviación estándar muestral: \((\displaystyle s=\sqrt{s^2})\) |
| Proporción poblacional \((p)\) | Proporción muestral: \((\displaystyle \widehat{p}=\frac{x}{n})\) |
Donde (x) representa el número de individuos que presentan la característica de interés y (n) es el tamaño de la muestra.
La estimación puntual proporciona un único valor como aproximación del parámetro poblacional, pero no informa sobre su precisión ni sobre la incertidumbre asociada al proceso de muestreo. Dos muestras pueden producir la misma estimación puntual y, sin embargo, presentar diferente precisión debido a diferencias en su tamaño o variabilidad.
Por esta razón, la estimación puntual suele complementarse con un intervalo de confianza, que proporciona un rango de valores plausibles para el parámetro poblacional
La estimación por intervalos consiste en determinar, a partir de los datos muestrales, un rango de valores dentro del cual se espera encontrar el verdadero valor del parámetro poblacional. Este rango se denomina intervalo de confianza y está formado por un límite inferior y un límite superior
Caso 1. Intervalo de confianza para la media poblacional con varianza conocida
\[P \left( \bar{x} - Z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}, ≤μ<; \bar{x} + Z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \right)=1-α\]
Donde:
𝜇: media poblacional.
𝑥¯: media muestral.
𝑍(α/2): es el valor crítico de la distribución Normal Estándar.
σ: es la desviación estándar poblacional.
𝑛: es el tamaño de la muestra.
Caso 2. Intervalo de confianza para la media poblacional con varianza desconocida
\[P\left( \bar{x} - t_{\alpha/2,\,n-1} \cdot \frac{s}{\sqrt{n}}, ≤μ<; \bar{x} + t_{\alpha/2,\,n-1} \cdot \frac{s}{\sqrt{n}} \right)=1-α\]
Donde:
𝜇: media poblacional.
𝑥¯: media muestral
𝑡(α/2): valor crítico de la distribución 𝑡.
𝑆: desviación estándar muestral.
𝑛: tamaño de la muestra.
Caso 3. Intervalo de confianza para la varianza poblacional
\[P\left( \frac{(n-1)s^2}{\chi^2_{(\alpha/2,\,n-1)}}, ≤μ<; \frac{(n-1)s^2}{\chi^2_{(1-\alpha/2,\,n-1)}} \right)=1-α\]
Donde:
𝜒2: valor crítico de la distribución Chi-Cuadrado.
σ2: varianza poblacional.
𝑆2: varianza muestral
𝑛: tamaño de la muestra.
La amplitud del intervalo de confianza no debe confundirse con el rango de los datos muestrales. El rango se calcula como la diferencia entre el valor máximo y el mínimo observados, mientras que la amplitud representa la distancia entre los límites del intervalo de confianza.
El nivel de confianza, representado por \((1-\alpha)\), indica la confiabilidad del procedimiento utilizado para construir el intervalo. Los niveles de confianza más utilizados son 90%, 95% y 99%.
El valor \((\alpha)\) representa el nivel de significación o la probabilidad de que el procedimiento no incluya al verdadero parámetro poblacional.
La amplitud de un intervalo de confianza depende principalmente de los siguientes factores:
Nivel de confianza: al aumentar el nivel de confianza, aumenta el valor crítico y el intervalo se hace más amplio.
Tamaño de la muestra: al aumentar el tamaño muestral, disminuye el error estándar y el intervalo se hace más estrecho.
Variabilidad de los datos: cuanto mayor sea la desviación estándar, mayor será el error estándar y más amplio será el intervalo.
Método de estimación: la distribución utilizada para obtener el valor crítico depende del parámetro que se desea estimar, de la información disponible y de los supuestos estadísticos.
El número mínimo de observaciones necesarias para estimar la media poblacional con un nivel de confianza y un margen de error previamente establecidos.
Para un intervalo de confianza bilateral, el margen de error está dado por:
\(E=Z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\)
Al despejar (n), se obtiene la expresión para calcular el tamaño muestral:
\[n = \left( \frac{Z_{1-\alpha/2} \cdot \sigma}{E} \right)^2\]
Donde:
𝑛: es el tamaño de la muestra requerido.
\(𝑍(1−𝛼/2)\): es el valor crítico z correspondiente al nivel de confianza \((1−𝛼/2)\)
\((\sigma)\): es la desviación estándar poblacional.
E: es el Error maximo permitido.
El error máximo permitido (E) representa la distancia máxima aceptada entre la media muestral y la media poblacional. También corresponde a la mitad de la amplitud total del intervalo de confianza:
\(E=\frac{A}{2}\)
En algunas situaciones, la precisión deseada se expresa mediante la amplitud total del intervalo de confianza, en lugar de establecer directamente un error máximo permitido.
Para un intervalo bilateral, la amplitud (A) corresponde a la diferencia entre el límite superior y el límite inferior:
\(A=Ls-Li\)
Como el margen de error (E) representa la mitad de la amplitud:
\(A=2E\)
\(E=\frac{A}{2}\)
El margen de error para estimar una media poblacional es:
\(E=Z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\)
Al reemplazar (E) por (A/2) y despejar (n), se obtiene:
\[n = \left( \frac{2 \cdot Z_{1-\alpha/2} \cdot \sigma}{a} \right)^2\] Donde:
𝑛: es el tamaño de la muestra requerido.
𝑍(1−𝛼2): es el valor crítico z correspondiente al nivel de confianza 1−𝛼2.
𝜎: es la desviación estándar poblacional.
𝑎: es la amplitud (o rango) de tu muestra.
Ejercicio 1. El rendimiento de soja, expresado en quintales por hectárea (qq/ha), se distribuye normalmente con media poblacional \(\mu\) desconocida. Para estimar el rendimiento promedio obtenido con la aplicación de un inoculante, se seleccionó una muestra aleatoria de 40 parcelas y se obtuvo un rendimiento promedio de 38 qq/ha.A partir de estudios anteriores, se conoce que la varianza poblacional es: \(\sigma^2=16 qq/ha\)
Indique cuál es la estimación puntual de la media poblacional y construya los intervalos de confianza del 95% y del 99% para \(\mu\). Interprete los resultados y compare las amplitudes de ambos intervalos.
Suponga que se hubiera seleccionado una muestra de 100 parcelas y se hubiera obtenido el mismo rendimiento promedio de 38 qq/ha, manteniéndose la varianza poblacional en \((\sigma^2=16 qq/ha)\). Construya el intervalo de confianza del 95% y compárelo con el intervalo del 95% obtenido en el punto anterior. Explique el efecto del aumento del tamaño muestral sobre la precisión de la estimación.
Considere nuevamente una muestra de 40 parcelas y un promedio de 38 qq/ha, pero suponga que la desviación estándar poblacional fuera de 7 qq/ha. Construya el intervalo de confianza del 95% y compárelo con el correspondiente intervalo del punto 1. Explique cómo influye el aumento de la variabilidad en la amplitud y en la precisión del intervalo.
Ejercicio 2. Se quiere diseñar el tamaño de una muestra para estimar μ en una población normal con desviación estándar igual a 13.
Responder:
¿Cuál debería ser el tamaño mínimo de la muestra para asegurar una amplitud de 9 unidades para el intervalo de confianza al 90%?
¿Qué sucede si la confianza cambia al 99%?
Ejercicio 3.En un establecimiento agrícola se realizó un control de calidad para evaluar la presencia de residuos de insecticida en frutos de tomate destinados al consumo fresco. Para ello, se seleccionó aleatoriamente una muestra de 30 lotes de producción y se determinó la concentración de residuos en cada uno.
Las normas de inocuidad alimentaria establecen que, si la concentración de residuos es igual o superior a 0,50 ppm, el producto puede representar un riesgo para la salud humana. Los valores observados, expresados en partes por millón (ppm), son los siguientes:
| 0,44 | 0,77 | 0,28 | 0,41 | 0,74 | 0,74 | 0,34 | 0,22 | 0,33 | 0,34 |
| 0,42 | 0,17 | 0,22 | 0,23 | 0,35 | 0,48 | 0,42 | 0,59 | 0,21 | 0,48 |
| 0,67 | 0,66 | 0,34 | 0,37 | 0,34 | 0,52 | 0,32 | 0,33 | 0,27 | 0,32 |
Responder:
Identifique:
La población de interés;
La muestra;
La unidad de observación;
La variable estudiada.
Clasifique la variable
Construya, utilizando ggplot2, un gráfico de cajas y
bigotes para la concentración de residuos. Describa la posición central,
la dispersión, la forma de la distribución y la posible presencia de
valores atípicos.
Calcule las principales medidas de resumen: tamaño de la muestra, media, mediana, desviación estándar, varianza, mínimo, primer cuartil, tercer cuartil, máximo, rango intercuartílico y coeficiente de variación. Interprete los resultados en el contexto del problema.
Considerando que la varianza poblacional es desconocida y utilizando un nivel de significación de \(\alpha=0,10\):
indique la estimación puntual de la media poblacional;
construya un intervalo de confianza bilateral del 90% para la concentración media de residuos
Elabore un intervalo de confianza para la media utilizando α = 0,10. Sacar conclusiones
Ejercicio 4. Se desea establecer el contenido vitamínico de un alimento balanceado para pollos. Se toma una muestra de 49 bolsas y se encuentra que el contenido promedio de vitaminas por cada 100 grs. es de 12 mg. y que la desviación estándar es de 2 mg. Encontrar el intervalo de confianza del 95% para el verdadero promedio del contenido de vitaminas.
Ejercicio 5. Se desea estimar el rendimiento promedio de trigo en un departamento del sur de Córdoba. Para ello, se seleccionaron campos pertenecientes a diferentes productores mediante un muestreo aleatorio simple.
Se conoce por experiencias anteriores que \(\sigma=0,8 qq/ha\) y \(\mu=32 qq/ha\).
El promedio histórico se utilizará únicamente como valor de referencia para establecer la precisión deseada. Se pretende construir un intervalo de confianza bilateral del 95% cuya amplitud total no sea mayor que el 2,5% del rendimiento promedio histórico.
Responder:
Calcule la amplitud total máxima permitida, expresada en qq/ha.
Determine el margen de error máximo correspondiente a dicha amplitud.
¿Qué número de campos se deben evaluar para estimar la media de rendimiento con una confianza del 95%, si la amplitud del intervalo no debe ser mayor que el 2.5% del promedio histórico?
Si la varianza de la distribución aumenta a σ =1.5, ¿aumenta o disminuye el tamaño muestral necesario para mantener la misma amplitud? Concluya.
Ejercicio 6. El espárrago es una planta perenne cuyo cultivo comercial puede tener una duración de 15 años y su implantación es costosa. Dada la extensión del sistema radicular, la profundidad del suelo es fundamental, considerándose indispensable contar con un promedio mínimo de 80 cm de sustrato permeable. Se realizan 14 determinaciones de la profundidad del sustrato permeable (en cm) en puntos tomados al azar en dos campos (A y B).
Los resultados fueron los siguientes:
| A | B |
|---|---|
| 72 | 78 |
| 78 | 82 |
| 86 | 68 |
| 78 | 68 |
| 90 | 74 |
| 104 | 81 |
| 76 | 85 |
| 70 | 73 |
| 83 | 75 |
| 75 | 89 |
| 90 | 100 |
| 81 | 91 |
| 85 | 82 |
| 72 | 75 |
Responder:
Construya los intervalos de confianza al 95% y determine si estos campos son aptos para el cultivo.
Ejercicio 7. Una empresa dedicada a la comercialización de semillas desea estimar la altura promedio de un sorgo forrajero que ha desarrollado. Para ello toma una muestra de 50 plantas y se calcula la media de la altura, la que resulta ser 130 cm. Se sabe por experiencias anteriores que la desviación estándar es 22 cm. Construir los intervalos de confianza para μ con una confianza del 95 % y 99 % respectivamente. Comparar ambos intervalos y concluir.
Ejercicio 8. Una empresa semillera desea comparar el rendimiento de dos híbridos de sorgo granífero cultivados bajo condiciones de riego suplementario. Para ello, se seleccionaron aleatoriamente parcelas sembradas con los híbridos “Nueva GR80” y “Overa”, registrándose el rendimiento de cada parcela en quintales por hectárea (qq/ha).
El objetivo es determinar si existen diferencias significativas en el rendimiento promedio entre ambos híbridos.
Los datos obtenidos fueron los siguientes:
Hibrido Nueva GR80:
110; 112; 135; 140; 128; 132; 123; 125; 140; 142; 151; 113; 142; 123; 118; 143; 138; 135; 140; 135; 112; 128; 152; 136; 152; 139; 142; 129; 150; 135; 119; 128; 123; 142; 138; 145; 136; 147; 141; 137.
Hibrido Overa:
115; 158; 139; 143; 151; 152; 148; 139; 153; 125; 136; 129; 146; 136; 140; 150; 140; 139; 128; 129; 125; 130; 140; 149; 150; 139; 142; 138; 129; 126; 137; 148; 146; 150; 158; 153; 119; 139; 154; 139; 151; 154; 139; 132.
A partir de los datos obtenidos, realice un análisis de estadística descriptiva para cada híbrido y construya un intervalo de confianza del 95% para el rendimiento promedio de cada uno. Finalmente, interprete los resultados y compare el comportamiento productivo de ambos materiales.