Estadística Descriptiva en R para Ingeniería Agrícola

La estadística descriptiva es la rama de la estadística que se encarga de recolectar, organizar, analizar y presentar un conjunto de datos para describir sus características principales. Su objetivo no es sacar conclusiones más allá de los datos, sino resumir y mostrar cómo se agrupan o dispersan en torno a un valor central. Para un ingeniero agrícola, esta es la radiografía inicial de cualquier fenómeno: la variabilidad del rendimiento de un cultivo, la distribución de nutrientes en el suelo o la respuesta a un sistema de riego.

En el entorno de R, esta fase se convierte en una poderosa herramienta de diagnóstico previo a cualquier modelado o toma de decisiones.

Partes Fundamentales y su Aplicación en Ingeniería Agrícola

La estadística descriptiva se compone de dos grandes grupos de medidas, complementadas con herramientas gráficas. Cada una tiene una interpretación clave en el contexto agrícola.

1. Medidas de Tendencia Central: El “Valor Típico”

Estas medidas indican el centro o punto de equilibrio de los datos.

  • Media (mean()): Es el promedio aritmético. Representa el “centro de gravedad” de los datos.
    • Interpretación en IA: El rendimiento promedio (kg/ha) de una parcela.
    • Precaución: Es sensible a valores extremos (outliers). Por ejemplo, si se mide el pH del suelo, un dato erróneo de 16.2 elevaría la media de manera artificial, ocultando el valor real de 6.8. Aquí, la media es útil solo si los datos son homogéneos.
  • Mediana (median()): Es el valor que divide al conjunto de datos ordenados en dos partes iguales.
    • Interpretación en IA: Es más robusta que la media. Ideal para analizar la concentración de un nutriente como el Nitrógeno en el suelo, donde la presencia de algunos valores extremadamente altos (por contaminación localizada) no debe sesgar la percepción general del terreno.

2. Medidas de Dispersión: La “Confiabilidad”

Muestran cuánto se alejan los datos entre sí. “Una menor dispersión indica mayor uniformidad y estabilidad en los resultados”.

  • Rango (range(), max() - min()): Diferencia entre el valor máximo y el mínimo.
    • Interpretación en IA: Útil para un primer vistazo, pero muy sensible a outliers. Si en un campo de riego la humedad mínima es 10% y la máxima es 90%, el rango es 80%, indicando una posible falta de uniformidad en el sistema.
  • Varianza (var()): Promedio de las desviaciones al cuadrado con respecto a la media.
    • Interpretación en IA: Mide la variabilidad total. En la producción de semillas, una varianza alta en el tamaño del grano indica un lote poco uniforme.
  • Desviación Estándar (sd()): Es la raíz cuadrada de la varianza. Se expresa en las mismas unidades que los datos originales, facilitando la interpretación.
    • Interpretación en IA: Si el rendimiento promedio de maíz es de 8.000 kg/ha y la desviación estándar es de 500 kg/ha, la mayoría de las parcelas rinden entre 7.500 y 8.500 kg/ha. Este es un indicador clave de precisión experimental.
  • Coeficiente de Variación (CV): Es la desviación estándar dividida por la media (expresada en porcentaje).
    • Interpretación en IA: Es la medida más valiosa para comparar dispersión entre variables con distintas unidades. Permite preguntar: ¿Hay más variabilidad en el rendimiento del grano (kg) o en la altura de la planta (cm)? En experimentos agronómicos, un CV bajo (<15%) suele indicar alta precisión en el manejo experimental.

3. Medidas de Forma y Asociación

  • Cuantiles y Cuartiles (quantile(), IQR()): Dividen los datos en partes iguales (ej. cuartiles en 4 grupos del 25%). El Rango Intercuartílico (IQR) es la diferencia entre el cuartil superior e inferior.
    • Interpretación en IA: El IQR es la mejor medida de dispersión cuando hay outliers. Sirve para definir umbrales de fertilidad: ¿El 25% de los suelos con mayor contenido de fósforo están por encima de qué valor?
  • Sesgo (skewness() de library(e1071)): Mide la simetría de la distribución.
    • Interpretación en IA: Un sesgo positivo indica que la mayoría de los datos están hacia la izquierda (valores bajos) con una “cola” hacia la derecha. En el análisis de lluvias, un sesgo positivo es común: la mayoría de los días llueve poco, y pocos días llueve torrencialmente.
  • Curtosis (kurtosis() de library(e1071)): Mide el “pico” de la distribución (qué tan concentrados están los datos en el centro).
    • Interpretación en IA: Una curtosis positiva (leptocúrtica) significa datos muy concentrados alrededor de la media. Por ejemplo, si la resistencia a la tracción de un material de invernadero está muy concentrada en un valor, es un material confiable.

Implementación Práctica en R: Código y Diagnóstico

La función summary() en R es el punto de partida estándar para obtener un resumen rápido de todas estas medidas.

# Ejemplo con datos de suelos (Dataset 'Soils' de la librería carData)
if(!require(carData)) install.packages("carData")
library(carData)

# Carga del dataset
data("Soils")

# Radiografía completa de las variables numéricas
summary(Soils)

Interpretación para el Ingeniero (Basado en el análisis exploratorio):

  1. Tipos de Datos: str(Soils) te mostrará qué variables son numéricas (num) y cuáles son categóricas (Factor). No tiene sentido calcular la media de una variable como ‘Block’ (bloque) o ‘Contour’ (contorno) aunque aparezcan codificadas como números, ya que representan categorías de terreno, no magnitudes medibles.
  2. Detección de Outliers: Al observar el summary, si ves que la Mean (media) y la Median (mediana) del pH son muy diferentes, o que el valor Max (máximo) es físicamente imposible (ej. pH 16.2), el ingeniero debe tratar ese dato como un error de medición o un outlier antes de continuar.

Ecuaciones Clave y su Sentido en Campo

Medida Ecuación (Muestral) Interpretación en Ingeniería Agrícola
Media \(\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i\) El rendimiento “esperado” de un cultivo en condiciones promedio. Es la base para calcular dosis de riego o fertilización.
Varianza \(s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}\) Mide la inestabilidad del sistema. Una varianza alta en la humedad del suelo indica que el riego no está siendo uniforme.
Desv. Estándar \(s = \sqrt{s^2}\) La “incertidumbre” del dato. Si el tamaño de fruto es $ {x} s$, podemos predecir el calibre de la cosecha.
CV \(CV = \frac{s}{\bar{x}} \times 100\) La herramienta para comparar. Permite decidir si invertir en reducir la variabilidad de la fertilidad del suelo (CV bajo) es más crítico que la variabilidad en la topografía (CV alto).

Resumen para el Ingeniero Agrícola

La estadística descriptiva en R es el primer filtro de calidad de tus datos. Antes de hacer modelos complejos, debes:

  1. Calcular summary() para conocer la distribución de cada variable.
  2. Graficar con boxplot() para visualizar outliers[2] y hist() para ver la forma de la distribución.
  3. Interpretar críticamente la relación entre media y mediana (simetría) y el valor del CV (precisión).

Este proceso te protege de tomar decisiones de manejo basadas en promedios engañosos o datos erróneos, asegurando que la ingeniería se base en evidencia sólida.