La estadística descriptiva en R aplicada a la ingeniería agrícola es la rama de la estadística que se encarga de recolectar, organizar, resumir, analizar y visualizar datos provenientes de sistemas agropecuarios (suelos, cultivos, riego, clima, rendimientos, etc.) utilizando el lenguaje de programación R.

En lugar de hacer suposiciones sobre toda una población (lo que hace la estadística inferencial), la descriptiva simplemente cuenta la historia de la muestra que se ha medido. En ingeniería agrícola, R es especialmente útil por su capacidad para manejar grandes volúmenes de datos geoespaciales, sensores agronómicos, ensayos de campo y variables climatológicas.


1. Partes Principales de la Estadística Descriptiva

En el contexto agronómico, la estadística descriptiva se divide en cuatro grandes bloques:

A. Medidas de Tendencia Central

Indican el punto “centro” o el valor más representativo de un conjunto de datos (por ejemplo, el rendimiento promedio de toneladas de maíz por hectárea).

B. Medidas de Dispersión o Variabilidad

Indican qué tan alejados o dispersos están los datos respecto al centro. En agronomía esto es crítico: dos fertilizantes pueden dar el mismo promedio de cosecha, pero uno puede tener mucha más variación que el otro.

C. Medidas de Forma y Posición

  • Posición (Percentiles/Cuartiles): Dividen los datos en partes iguales (ej. identificar el 25% de los suelos con menor humedad).
  • Forma (Asimetría y Curtosis): Muestran si los datos se distribuyen de forma simétrica o si hay sesgos (ej. una plaga que afecta gravemente solo a una pequeña zona de la parcela).

D. Visualización de Datos

Representación gráfica que permite a los ingenieros detectar patrones rápidamente (distribución de lluvias, variación de pH en un plano, etc.).


2. Ecuaciones, Significados y Comandos en R

A continuación se detallan las métricas fundamentales, su expresión matemática, qué significan en el campo y cómo se calculan en R.

1. Media Aritmética (\(\bar{x}\))

Es el promedio de todas las observaciones.

  • Ecuación:

\[\bar{x} = \frac{\sum_{i=1}^{n} x_i}{n}\]

  • Significado agrícola: Representa la respuesta media esperada de una variable (ej. promedio de \(L/m^2\) de agua de riego aplicada por semana).
  • En R: mean(datos$riego, na.rm = TRUE)

2. Mediana (\(\tilde{x}\))

Es el valor central que divide la muestra ordenada en dos partes iguales (50% por encima, 50% por debajo).

  • Significado agrícola: Muy útil cuando hay valores extremos (“outliers”), como picos inusuales de precipitaciones por un huracán que distorsionarían la media.
  • En R: median(datos$precipitacion, na.rm = TRUE)

3. Varianza Muestral (\(s^2\))

Mide el promedio de las desviaciones al cuadrado de los datos respecto a su media.

  • Ecuación:

\[s^2 = \frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n - 1}\]

  • Significado agrícola: Mide la variabilidad total de una variable (ej. heterogeneidad del contenido de materia orgánica en una parcela).
  • En R: var(datos$materia_organica)

4. Desviación Estándar (\(s\))

Es la raíz cuadrada de la varianza.

  • Ecuación:

\[s = \sqrt{s^2} = \sqrt{\frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n - 1}}\]

  • Significado agrícola: Mide la dispersión en las mismas unidades que la variable original. Si la altura promedio de una planta es \(1.2\text{ m}\) con \(s = 0.1\text{ m}\), indica que la mayoría de las plantas miden entre \(1.1\text{ m}\) y \(1.3\text{ m}\).
  • En R: sd(datos$altura_planta)

5. Coeficiente de Variación (\(CV\))

Es la relación entre la desviación estándar y la media, expresada en porcentaje.

  • Ecuación:

\[CV = \left( \frac{s}{\bar{x}} \right) \times 100\]

  • Significado agrícola: Permite comparar la variabilidad entre distintas variables o ensayos (ej. comparar si es más variable el rendimiento en kg/ha o el número de frutos por árbol). En agronomía:

  • \(CV < 10\%\): Homogeneidad alta.

  • \(CV > 20\%-30\%\): Alta variabilidad en campo (frecuente en propiedades físicas del suelo).

  • En R: (sd(x) / mean(x)) * 100

6. Error Estándar de la Media (\(SE\))

Mide la precisión con la que la media muestral estima la media verdadera de la población.

  • Ecuación:

\[SE = \frac{s}{\sqrt{n}}\]

  • Significado agrícola: Indica qué tanto variaría el promedio si volviéramos a tomar muestras en el mismo lote bajo las mismas condiciones.
  • En R: sd(x) / sqrt(length(x))

3. Ejemplo Práctico en R para Ingeniería Agrícola

Imagina un ensayo donde se midió la humedad del suelo (%) en 10 puntos de un lote agrícola bajo un sistema de riego por goteo:

# 1. Crear vector de datos de humedad (%)
humedad <- c(22.1, 24.5, 23.0, 21.8, 25.2, 22.9, 23.4, 31.0, 22.5, 23.1)

# 2. Resumen rápido de medidas de posición y tendencia central
summary(humedad)

# 3. Métricas descriptivas avanzadas
media     <- mean(humedad)
desv_est  <- sd(humedad)
cv        <- (desv_est / media) * 100

cat("Media:", round(media, 2), "%\n")
cat("Desviación Estándar:", round(desv_est, 2), "%\n")
cat("Coeficiente de Variación:", round(cv, 2), "%\n")

# 4. Gráfico para análisis descriptivo visual
boxplot(humedad, 
        main = "Distribución de Humedad del Suelo",
        ylab = "Humedad (%)",
        col = "lightgreen")

Interpretación del ejemplo: El valor de 31.0% genera un estiramiento en la media. El boxplot detectará ese dato atípico (outlier), alertando al ingeniero agrícola sobre un posible problema en un gotero del sistema de riego (fuga o sobre-riego en ese punto).