La estadística descriptiva es la rama de la estadística que se encarga de recolectar, organizar, analizar y presentar un conjunto de datos para describir sus características principales. Su objetivo no es sacar conclusiones más allá de los datos, sino resumir y mostrar cómo se agrupan o dispersan en torno a un valor central. Para un ingeniero agrícola, esta es la radiografía inicial de cualquier fenómeno: la variabilidad del rendimiento de un cultivo, la distribución de nutrientes en el suelo o la respuesta a un sistema de riego.
En el entorno de R, esta fase se convierte en una poderosa herramienta de diagnóstico previo a cualquier modelado o toma de decisiones.
La estadística descriptiva se compone de dos grandes grupos de medidas, complementadas con herramientas gráficas. Cada una tiene una interpretación clave en el contexto agrícola.
Estas medidas indican el centro o punto de equilibrio de los datos.
mean()): Es el promedio
aritmético. Representa el “centro de gravedad” de los datos.
median()): Es el valor que
divide al conjunto de datos ordenados en dos partes iguales.
Muestran cuánto se alejan los datos entre sí. “Una menor dispersión indica mayor uniformidad y estabilidad en los resultados”.
range(),
max() - min()): Diferencia entre el valor máximo y
el mínimo.
var()): Promedio de las
desviaciones al cuadrado con respecto a la media.
sd()): Es la raíz
cuadrada de la varianza. Se expresa en las mismas unidades que los datos
originales, facilitando la interpretación.
quantile(),
IQR()): Dividen los datos en partes iguales (ej.
cuartiles en 4 grupos del 25%). El Rango Intercuartílico
(IQR) es la diferencia entre el cuartil superior e inferior.
skewness() de
library(e1071)): Mide la simetría de la
distribución.
kurtosis() de
library(e1071)): Mide el “pico” de la distribución
(qué tan concentrados están los datos en el centro).
La función summary() en R es el punto de partida
estándar para obtener un resumen rápido de todas estas medidas.
# Ejemplo con datos de suelos (Dataset 'Soils' de la librería carData)
if(!require(carData)) install.packages("carData")
library(carData)
# Carga del dataset
data("Soils")
# Radiografía completa de las variables numéricas
summary(Soils)
Interpretación para el Ingeniero (Basado en el análisis exploratorio):
str(Soils) te mostrará
qué variables son numéricas (num) y cuáles son categóricas
(Factor). No tiene sentido calcular la media de una
variable como ‘Block’ (bloque) o ‘Contour’ (contorno) aunque aparezcan
codificadas como números, ya que representan categorías de
terreno, no magnitudes medibles.summary, si ves que la Mean (media) y la
Median (mediana) del pH son muy diferentes, o que el valor
Max (máximo) es físicamente imposible (ej. pH 16.2), el
ingeniero debe tratar ese dato como un error de medición o un outlier
antes de continuar.| Medida | Ecuación (Muestral) | Interpretación en Ingeniería Agrícola |
|---|---|---|
| Media | \(\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i\) | El rendimiento “esperado” de un cultivo en condiciones promedio. Es la base para calcular dosis de riego o fertilización. |
| Varianza | \(s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}\) | Mide la inestabilidad del sistema. Una varianza alta en la humedad del suelo indica que el riego no está siendo uniforme. |
| Desv. Estándar | \(s = \sqrt{s^2}\) | La “incertidumbre” del dato. Si el tamaño de fruto es $ {x} s$, podemos predecir el calibre de la cosecha. |
| CV | \(CV = \frac{s}{\bar{x}} \times 100\) | La herramienta para comparar. Permite decidir si invertir en reducir la variabilidad de la fertilidad del suelo (CV bajo) es más crítico que la variabilidad en la topografía (CV alto). |
La estadística descriptiva en R es el primer filtro de calidad de tus datos. Antes de hacer modelos complejos, debes:
summary() para conocer la
distribución de cada variable.boxplot() para visualizar
outliers[2] y hist() para ver la forma de la
distribución.Este proceso te protege de tomar decisiones de manejo basadas en promedios engañosos o datos erróneos, asegurando que la ingeniería se base en evidencia sólida.