La estadística descriptiva es la primera etapa fundamental en cualquier análisis de datos. Para un ingeniero agrícola, es la herramienta que permite transformar una tabla de números, como los resultados de un análisis de suelo o el rendimiento de un cultivo, en información comprensible que guía la toma de decisiones.

El Rol de R en la Ingeniería Agrícola

R es un lenguaje de programación y un entorno de software libre especializado en estadística y gráficos. En el contexto de la ingeniería agrícola, se utiliza para:

Componentes Principales de la Estadística Descriptiva en R

El objetivo de la estadística descriptiva es resumir y visualizar los datos . Se compone de dos grandes grupos de medidas, todas ellas fácilmente calculables en R.

1. Medidas de Tendencia Central

Indican el valor central o “típico” alrededor del cual se agrupan los datos.

Medida Descripción para Ingeniería Agrícola Ecuación en R
Media El promedio aritmético. Útil para conocer el rendimiento promedio de un cultivo o el contenido medio de nutrientes en un suelo. Es sensible a valores atípicos (outliers) que pueden ser errores de medición . mean(datos)
Mediana El valor central cuando los datos se ordenan. Es una medida más robusta que la media, ya que no se ve afectada por valores extremos. Si la mediana y la media de un nutriente difieren mucho, es señal de que hay datos atípicos que deben revisarse . median(datos)

2. Medidas de Dispersión (o Variabilidad)

Muestran qué tan homogéneos o heterogéneos son los datos. En agricultura, una baja variabilidad en la producción de una parcela es sinónimo de uniformidad.

Medida Descripción para Ingeniería Agrícola Ecuación en R
Varianza Mide la dispersión promedio de los datos respecto a la media, pero en unidades al cuadrado. Su interpretación directa es menos intuitiva. var(datos)
Desviación Estándar Es la raíz cuadrada de la varianza. Se expresa en las mismas unidades que los datos (ej. kg/ha, ppm), lo que facilita su interpretación. Por ejemplo, una desviación estándar alta en el peso de la fruta indica falta de uniformidad . sd(datos)
Coeficiente de Variación (CV) Es la desviación estándar dividida por la media (multiplicado por 100 para obtener un porcentaje). Es adimensional, lo que permite comparar la variabilidad de variables con diferentes unidades o escalas, como comparar la variabilidad del pH y la del contenido de nitrógeno en el mismo suelo . (sd(datos)/mean(datos)) * 100
Rango Intercuartílico (IQR) Mide la dispersión del 50% central de los datos (entre el cuartil 1 y el cuartil 3). Es robusto a valores atípicos y se usa en gráficos de caja. IQR(datos)

Ejemplos Prácticos en R

Un análisis típico comienza con un resumen rápido y completo de todas las variables.

Resumen General con summary()

La función summary() proporciona un resumen que incluye el mínimo, máximo, media, mediana y cuartiles para las variables numéricas, lo que da una visión general del dataset.

# Cargar datos de ejemplo (similar al dataset 'Soils' para suelos)
library(carData)
data("Soils")

# Obtener un resumen estadístico de todos los datos
summary(Soils)

Cálculo de Medidas Específicas

Una vez identificada una variable de interés, como el pH del suelo, se pueden calcular sus medidas específicas .

# Calcular la media del pH
mean(Soils$pH)

# Calcular la desviación estándar del pH
sd(Soils$pH)

Análisis por Grupos con tapply()

Es muy común querer comparar el rendimiento o las propiedades del suelo entre diferentes tratamientos o regiones. La función tapply() aplica un cálculo a un grupo de datos definido por una categoría .

# Calcular la media de pH para cada tipo de 'Contour' (curva de nivel)
tapply(Soils$pH, Soils$Contour, mean)

Conclusión

En la ingeniería agrícola, la estadística descriptiva con R es más que un simple cálculo. Es una radiografía de los datos que permite :