La estadística descriptiva en R aplicada a la ingeniería agrícola es la rama de la estadística que se encarga de recolectar, organizar, resumir, analizar y visualizar datos provenientes de sistemas agropecuarios (suelos, cultivos, riego, clima, rendimientos, etc.) utilizando el lenguaje de programación R.
En lugar de hacer suposiciones sobre toda una población (lo que hace la estadística inferencial), la descriptiva simplemente cuenta la historia de la muestra que se ha medido. En ingeniería agrícola, R es especialmente útil por su capacidad para manejar grandes volúmenes de datos geoespaciales, sensores agronómicos, ensayos de campo y variables climatológicas.
En el contexto agronómico, la estadística descriptiva se divide en cuatro grandes bloques:
Indican el punto “centro” o el valor más representativo de un conjunto de datos (por ejemplo, el rendimiento promedio de toneladas de maíz por hectárea).
Indican qué tan alejados o dispersos están los datos respecto al centro. En agronomía esto es crítico: dos fertilizantes pueden dar el mismo promedio de cosecha, pero uno puede tener mucha más variación que el otro.
Representación gráfica que permite a los ingenieros detectar patrones rápidamente (distribución de lluvias, variación de pH en un plano, etc.).
A continuación se detallan las métricas fundamentales, su expresión matemática, qué significan en el campo y cómo se calculan en R.
Es el promedio de todas las observaciones.
\[\bar{x} = \frac{\sum_{i=1}^{n} x_i}{n}\]
mean(datos$riego, na.rm = TRUE)Es el valor central que divide la muestra ordenada en dos partes iguales (50% por encima, 50% por debajo).
median(datos$precipitacion, na.rm = TRUE)Mide el promedio de las desviaciones al cuadrado de los datos respecto a su media.
\[s^2 = \frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n - 1}\]
var(datos$materia_organica)Es la raíz cuadrada de la varianza.
\[s = \sqrt{s^2} = \sqrt{\frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n - 1}}\]
sd(datos$altura_planta)Es la relación entre la desviación estándar y la media, expresada en porcentaje.
\[CV = \left( \frac{s}{\bar{x}} \right) \times 100\]
Significado agrícola: Permite comparar la variabilidad entre distintas variables o ensayos (ej. comparar si es más variable el rendimiento en kg/ha o el número de frutos por árbol). En agronomía:
\(CV < 10\%\): Homogeneidad alta.
\(CV > 20\%-30\%\): Alta variabilidad en campo (frecuente en propiedades físicas del suelo).
En R:
(sd(x) / mean(x)) * 100
Mide la precisión con la que la media muestral estima la media verdadera de la población.
\[SE = \frac{s}{\sqrt{n}}\]
sd(x) / sqrt(length(x))Imagina un ensayo donde se midió la humedad del suelo (%) en 10 puntos de un lote agrícola bajo un sistema de riego por goteo:
# 1. Crear vector de datos de humedad (%)
humedad <- c(22.1, 24.5, 23.0, 21.8, 25.2, 22.9, 23.4, 31.0, 22.5, 23.1)
# 2. Resumen rápido de medidas de posición y tendencia central
summary(humedad)
# 3. Métricas descriptivas avanzadas
media <- mean(humedad)
desv_est <- sd(humedad)
cv <- (desv_est / media) * 100
cat("Media:", round(media, 2), "%\n")
cat("Desviación Estándar:", round(desv_est, 2), "%\n")
cat("Coeficiente de Variación:", round(cv, 2), "%\n")
# 4. Gráfico para análisis descriptivo visual
boxplot(humedad,
main = "Distribución de Humedad del Suelo",
ylab = "Humedad (%)",
col = "lightgreen")
Interpretación del ejemplo: El valor de
31.0%genera un estiramiento en la media. Elboxplotdetectará ese dato atípico (outlier), alertando al ingeniero agrícola sobre un posible problema en un gotero del sistema de riego (fuga o sobre-riego en ese punto).