La estadística descriptiva en R aplicada a la ingeniería agrícola es el conjunto de métodos usados para resumir, organizar, visualizar e interpretar datos agrícolas mediante el software R. Su objetivo no es predecir ni probar hipótesis todavía, sino describir el comportamiento de los datos de campo, riego, suelos, clima, maquinaria o producción.

En ingeniería agrícola se usa para responder preguntas como:

  • ¿Cuál es el rendimiento promedio de un cultivo?
  • ¿Qué tan variable es la humedad del suelo en un lote?
  • ¿Existen valores atípicos en lecturas de sensores?
  • ¿Cómo se distribuye la precipitación histórica?
  • ¿Qué relación hay entre pH del suelo y rendimiento?
  • ¿Un sistema de riego tiene aplicación uniforme?

1. Partes de la estadística descriptiva aplicada a ingeniería agrícola

La estadística descriptiva generalmente se divide en varias partes:

1.1. Datos y estructura

En R, los datos agrícolas suelen organizarse en una tabla o data.frame, donde cada fila es una observación y cada columna es una variable.

Ejemplo:

parcela cultivo rendimiento_ton_ha humedad_suelo pH
1 maíz 9.8 21.5 6.2
2 maíz 8.9 19.8 5.9
3 maíz 10.3 23.4 6.5

En R:

datos <- data.frame(
  parcela = 1:3,
  cultivo = c("maíz", "maíz", "maíz"),
  rendimiento_ton_ha = c(9.8, 8.9, 10.3),
  humedad_suelo = c(21.5, 19.8, 23.4),
  pH = c(6.2, 5.9, 6.5)
)

1.2. Medidas de tendencia central

Describen el valor típico o central de los datos.

Las principales son:

  • Media o promedio
  • Mediana
  • Moda

En agricultura sirven para estimar valores representativos, como rendimiento promedio, pH medio, humedad media o caudal medio.


1.3. Medidas de dispersión

Indican qué tan separados están los datos entre sí.

Las principales son:

  • Rango
  • Varianza
  • Desviación estándar
  • Coeficiente de variación
  • Rango intercuartílico

En ingeniería agrícola son muy importantes porque los sistemas naturales son variables. Por ejemplo, no basta con saber que un lote rinde 8 t/ha en promedio; también importa si todas las parcelas rinden parecido o si hay zonas de alto y bajo rendimiento.


1.4. Medidas de posición

Indican el valor por debajo del cual se encuentra un porcentaje de los datos.

Las principales son:

  • Cuartiles
  • Percentiles
  • Deciles

Se usan mucho para analizar humedad del suelo, precipitación, niveles de nutrientes, temperaturas extremas o caudales de diseño.


1.5. Medidas de forma

Describen la forma de la distribución de los datos.

Las principales son:

  • Asimetría
  • Curtosis

Sirven para saber si los datos son simétricos, si están sesgados hacia valores bajos o altos, o si hay eventos extremos, como lluvias muy intensas.


1.6. Visualización gráfica

En R, la estadística descriptiva se complementa con gráficos.

Los más usados en ingeniería agrícola son:

  • Histogramas
  • Diagramas de caja o boxplots
  • Gráficos de dispersión
  • Series de tiempo
  • Mapas de calor o mapas de rendimiento

Paquetes importantes:

library(ggplot2)
library(dplyr)

2. Ecuaciones principales y su significado en ingeniería agrícola

A continuación se presentan las ecuaciones más importantes, su interpretación agrícola y su función equivalente en R.


2.1. Media aritmética poblacional

\[ \mu = \frac{1}{N} \sum_{i=1}^{N} x_i \]

Donde:

  • \(\mu\) = media poblacional
  • \(N\) = número total de datos de la población
  • \(x_i\) = cada observación

Significado agrícola

Representa el valor promedio de toda una población de datos. Por ejemplo, el rendimiento promedio de todas las parcelas de una región.

En R

Si se tiene toda la población:

mu <- mean(x)

2.2. Media aritmética muestral

\[ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i \]

Donde:

  • \(\bar{x}\) = media muestral
  • \(n\) = tamaño de la muestra
  • \(x_i\) = cada dato observado

Significado agrícola

Es el promedio calculado a partir de una muestra de campo. Por ejemplo, si se midió rendimiento en 30 puntos de un lote de 100 hectáreas, la media muestral estima el rendimiento promedio del lote.

En R

media <- mean(rendimiento)

2.3. Media ponderada

\[ \bar{x}_w = \frac{\sum_{i=1}^{n} w_i x_i}{\sum_{i=1}^{n} w_i} \]

Donde:

  • \(w_i\) = peso de cada observación
  • \(x_i\) = valor observado

Significado agrícola

Se usa cuando las observaciones no tienen la misma importancia. Por ejemplo:

  • Rendimiento promedio ponderado por área.
  • Humedad promedio ponderada por superficie de cada lote.
  • Análisis de sensores con diferente representatividad espacial.

En R

media_ponderada <- weighted.mean(x, w)

Ejemplo:

rendimiento <- c(8, 10, 12)
area <- c(2, 5, 3)

rendimiento_promedio_ponderado <- weighted.mean(rendimiento, area)
rendimiento_promedio_ponderado

2.4. Mediana

La mediana es el valor central de los datos ordenados.

Si \(n\) es impar:

\[ Me = x_{\left(\frac{n+1}{2}\right)} \]

Si \(n\) es par:

\[ Me = \frac{x_{\left(\frac{n}{2}\right)} + x_{\left(\frac{n}{2}+1\right)}}{2} \]

Significado agrícola

La mediana es útil cuando hay valores extremos o atípicos. Por ejemplo, si una parcela tiene rendimiento muy alto por un error de sensor o una condición especial, la mediana puede representar mejor el comportamiento típico del lote.

En R

mediana <- median(rendimiento)

2.5. Moda

La moda es el valor que más se repite.

\[ Mo = \text{valor con mayor frecuencia} \]

Significado agrícola

Es más útil en variables categóricas o discretas, por ejemplo:

  • Tipo de suelo más frecuente.
  • Cultivo predominante.
  • Nivel de fertilización más común.
  • Estado de humedad más frecuente clasificado por rangos.

En R

Para variables categóricas:

tabla <- table(tipo_suelo)
moda <- names(tabla)[which.max(tabla)]

2.6. Rango

\[ R = x_{máx} - x_{mín} \]

Donde:

  • \(x_{máx}\) = valor máximo
  • \(x_{mín}\) = valor mínimo

Significado agrícola

Indica la amplitud total de los datos. Por ejemplo:

  • Diferencia entre la temperatura máxima y mínima.
  • Rango de humedad del suelo durante el día.
  • Variación entre el mayor y menor rendimiento medido.

En R

rango <- max(x) - min(x)

O también:

range(x)
diff(range(x))

2.7. Varianza poblacional

\[ \sigma^2 = \frac{1}{N} \sum_{i=1}^{N} (x_i - \mu)^2 \]

Donde:

  • \(\sigma^2\) = varianza poblacional
  • \(\mu\) = media poblacional

Significado agrícola

Mide qué tan dispersos están los datos respecto al promedio. En suelos, por ejemplo, una varianza alta en conductividad eléctrica puede indicar fuerte variabilidad espacial de sales.


2.8. Varianza muestral

\[ s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2 \]

Donde:

  • \(s^2\) = varianza muestral
  • \(n-1\) = corrección de Bessel
  • \(\bar{x}\) = media muestral

Significado agrícola

Se usa cuando los datos provienen de una muestra, como ocurre casi siempre en trabajos de campo. Permite cuantificar la variabilidad de una variable agrícola.

En R

varianza <- var(rendimiento)

2.9. Desviación estándar poblacional

\[ \sigma = \sqrt{\sigma^2} \]

Significado agrícola

Expresa la dispersión en las mismas unidades de los datos. Por ejemplo, si el rendimiento se mide en toneladas por hectárea, la desviación estándar también se expresa en toneladas por hectárea.


2.10. Desviación estándar muestral

\[ s = \sqrt{s^2} \]

Significado agrícola

Indica cuánto se alejan, en promedio, los datos respecto a la media. Por ejemplo, si el rendimiento promedio es 9 t/ha y la desviación estándar es 1.5 t/ha, hay una variabilidad moderada en el lote.

En R

desviacion <- sd(rendimiento)

2.11. Coeficiente de variación

\[ CV = \frac{s}{\bar{x}} \times 100 \]

Donde:

  • \(CV\) = coeficiente de variación en porcentaje
  • \(s\) = desviación estándar
  • \(\bar{x}\) = media

Significado agrícola

Es una medida relativa de variabilidad. Permite comparar variables con distintas unidades o escalas.

Ejemplos:

  • Comparar variabilidad de rendimiento entre dos cultivos.
  • Evaluar uniformidad de riego.
  • Analizar homogeneidad de un lote experimental.
  • Identificar si la humedad del suelo es más variable que el pH.

En R

cv <- sd(rendimiento) / mean(rendimiento) * 100

2.12. Cuartiles

Los cuartiles dividen los datos ordenados en cuatro partes iguales.

\[ Q_1 = \text{percentil 25} \]

\[ Q_2 = \text{percentil 50} = \text{mediana} \]

\[ Q_3 = \text{percentil 75} \]

Significado agrícola

  • \(Q_1\): el 25% de los datos está por debajo de ese valor.
  • \(Q_2\): el 50% de los datos está por debajo de ese valor.
  • \(Q_3\): el 75% de los datos está por debajo de ese valor.

Por ejemplo, en humedad del suelo:

  • \(Q_1\) puede representar zonas más secas.
  • \(Q_3\) puede representar zonas más húmedas.

En R

quantile(humedad, probs = c(0.25, 0.50, 0.75))

O con dplyr:

library(dplyr)

resumen <- datos %>%
  summarise(
    Q1 = quantile(humedad_suelo, 0.25),
    Q2 = quantile(humedad_suelo, 0.50),
    Q3 = quantile(humedad_suelo, 0.75)
  )

2.13. Percentiles

\[ P_k = \text{valor por debajo del cual se encuentra el } k\% \text{ de los datos} \]

Significado agrícola

Se usan para diseño hidráulico, climatología y manejo de riego.

Ejemplos:

  • \(P_{95}\) de precipitación diaria para estimar eventos extremos.
  • \(P_{10}\) de humedad del suelo para identificar zonas críticas secas.
  • \(P_{90}\) de caudal para dimensionar obras de drenaje.

En R

quantile(precipitacion, probs = c(0.90, 0.95, 0.99))

2.14. Rango intercuartílico

\[ IQR = Q_3 - Q_1 \]

Donde:

  • \(IQR\) = rango intercuartílico
  • \(Q_1\) = primer cuartil
  • \(Q_3\) = tercer cuartil

Significado agrícola

Mide la dispersión del 50% central de los datos. Es más robusto que el rango porque no depende de valores extremos.

Se usa para detectar valores atípicos en sensores, estaciones meteorológicas, análisis de suelo o mapas de rendimiento.

En R

IQR(humedad_suelo)

2.15. Error estándar de la media

\[ SE_{\bar{x}} = \frac{s}{\sqrt{n}} \]

Donde:

  • \(SE_{\bar{x}}\) = error estándar de la media
  • \(s\) = desviación estándar muestral
  • \(n\) = tamaño de muestra

Significado agrícola

Indica qué tan precisa es la estimación de la media muestral. Por ejemplo, si se quiere estimar el rendimiento promedio de un lote, un error estándar pequeño indica mayor confianza en ese promedio.

En R

se <- sd(rendimiento) / sqrt(length(rendimiento))

2.16. Asimetría

Una forma común de calcularla es:

\[ g_1 = \frac{\frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^3}{s^3} \]

Donde:

  • \(g_1\) = coeficiente de asimetría
  • \(s\) = desviación estándar

Interpretación

  • Si \(g_1 = 0\): distribución simétrica.
  • Si \(g_1 > 0\): asimetría positiva, cola hacia la derecha.
  • Si \(g_1 < 0\): asimetría negativa, cola hacia la izquierda.

Significado agrícola

Por ejemplo, si la precipitación tiene asimetría positiva, significa que hay pocos días con lluvias muy altas y muchos días con lluvias bajas o moderadas.

Esto es importante para:

  • Diseño de drenaje.
  • Manejo de riego suplementario.
  • Evaluación de riesgo de inundación.
  • Análisis de eventos climáticos extremos.

En R

# install.packages("moments")
library(moments)

asimetria <- skewness(precipitacion)

2.17. Curtosis

Una forma común es:

\[ g_2 = \frac{\frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^4}{s^4} - 3 \]

Donde:

  • \(g_2\) = curtosis
  • El \(-3\) se usa para comparar con la distribución normal

Interpretación

  • \(g_2 = 0\): colas similares a una distribución normal.
  • \(g_2 > 0\): colas pesadas, más eventos extremos.
  • \(g_2 < 0\): colas ligeras, menos eventos extremos.

Significado agrícola

Si la temperatura máxima tiene curtosis alta, puede haber días con picos de calor extremos, importantes para estrés térmico en cultivos.

En R

library(moments)

curtosis <- kurtosis(temperatura_maxima)

2.18. Covarianza muestral

\[ s_{xy} = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y}) \]

Donde:

  • \(s_{xy}\) = covarianza entre \(x\) e \(y\)
  • \(\bar{x}\) = media de \(x\)
  • \(\bar{y}\) = media de \(y\)

Significado agrícola

Indica si dos variables tienden a moverse juntas.

Ejemplo:

  • Si la humedad del suelo aumenta y el rendimiento también aumenta, la covarianza puede ser positiva.
  • Si la salinidad aumenta y el rendimiento disminuye, la covarianza puede ser negativa.

En R

cov(humedad_suelo, rendimiento)

2.19. Correlación de Pearson

\[ r = \frac{\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})} {\sqrt{\sum_{i=1}^{n} (x_i - \bar{x})^2} \sqrt{\sum_{i=1}^{n} (y_i - \bar{y})^2}} \]

También puede expresarse como:

\[ r = \frac{s_{xy}}{s_x s_y} \]

Donde:

  • \(r\) = coeficiente de correlación
  • \(s_{xy}\) = covarianza
  • \(s_x\) = desviación estándar de \(x\)
  • \(s_y\) = desviación estándar de \(y\)

Interpretación

  • \(r = 1\): correlación lineal positiva perfecta.
  • \(r = -1\): correlación lineal negativa perfecta.
  • \(r = 0\): no hay correlación lineal.

Significado agrícola

Permite explorar relaciones entre variables:

  • Humedad del suelo y rendimiento.
  • Fósforo disponible y crecimiento.
  • Temperatura y evapotranspiración.
  • Conductividad eléctrica y salinidad.

Importante: correlación no implica causalidad.

En R

cor(humedad_suelo, rendimiento)

3. Resumen de ecuaciones, significado y función en R

Medida Ecuación Significado agrícola Función en R
Media muestral \(\bar{x} = \frac{1}{n}\sum x_i\) Valor promedio de una variable mean()
Media ponderada \(\bar{x}_w = \frac{\sum w_i x_i}{\sum w_i}\) Promedio considerando pesos, como área weighted.mean()
Mediana Valor central ordenado Valor representativo robusto median()
Rango \(R = x_{máx} - x_{mín}\) Amplitud total de los datos max() - min()
Varianza muestral \(s^2 = \frac{\sum (x_i-\bar{x})^2}{n-1}\) Variabilidad promedio al cuadrado var()
Desviación estándar \(s = \sqrt{s^2}\) Dispersión en unidades originales sd()
Coeficiente de variación \(CV = \frac{s}{\bar{x}} \times 100\) Variabilidad relativa sd(x)/mean(x)*100
Cuartiles \(Q_1, Q_2, Q_3\) Dividen los datos en cuatro partes quantile()
Rango intercuartílico \(IQR = Q_3 - Q_1\) Dispersión del 50% central IQR()
Error estándar \(SE = s/\sqrt{n}\) Precisión de la media sd(x)/sqrt(length(x))
Asimetría \(g_1\) Indica sesgo de la distribución moments::skewness()
Curtosis \(g_2\) Indica presencia de eventos extremos moments::kurtosis()
Covarianza \(s_{xy}\) Dirección de relación entre variables cov()
Correlación \(r\) Fuerza y dirección lineal cor()

4. Ejemplo aplicado en R para ingeniería agrícola

Supongamos que se tienen datos de rendimiento, humedad del suelo y pH en varias parcelas.

# Cargar librerías
library(dplyr)
library(ggplot2)

# Datos de ejemplo
set.seed(123)

datos_agricolas <- data.frame(
  parcela = 1:60,
  rendimiento = rnorm(60, mean = 8.5, sd = 1.4),
  humedad_suelo = rnorm(60, mean = 23, sd = 5),
  pH = rnorm(60, mean = 6.2, sd = 0.5)
)

# Ver primeras filas
head(datos_agricolas)

4.1. Resumen descriptivo rápido

summary(datos_agricolas)

Esto entrega:

  • Mínimo
  • Primer cuartil
  • Mediana
  • Media
  • Tercer cuartil
  • Máximo

4.2. Cálculo de principales estadísticos

resumen <- datos_agricolas %>%
  summarise(
    rendimiento_media = mean(rendimiento),
    rendimiento_mediana = median(rendimiento),
    rendimiento_sd = sd(rendimiento),
    rendimiento_varianza = var(rendimiento),
    rendimiento_cv = sd(rendimiento) / mean(rendimiento) * 100,
    humedad_media = mean(humedad_suelo),
    humedad_sd = sd(humedad_suelo),
    humedad_Q1 = quantile(humedad_suelo, 0.25),
    humedad_Q3 = quantile(humedad_suelo, 0.75),
    humedad_IQR = IQR(humedad_suelo),
    pH_media = mean(pH),
    pH_sd = sd(pH)
  )

resumen

4.3. Histograma del rendimiento

ggplot(datos_agricolas, aes(x = rendimiento)) +
  geom_histogram(binwidth = 0.5, fill = "darkgreen", color = "black") +
  geom_vline(aes(xintercept = mean(rendimiento)),
             color = "red", linetype = "dashed", linewidth = 1) +
  labs(
    title = "Distribución del rendimiento",
    x = "Rendimiento (t/ha)",
    y = "Frecuencia"
  ) +
  theme_minimal()

La línea roja representa la media. El histograma permite observar si los rendimientos se concentran alrededor del promedio o si hay mucha variabilidad.


4.4. Boxplot de humedad del suelo

ggplot(datos_agricolas, aes(y = humedad_suelo)) +
  geom_boxplot(fill = "steelblue") +
  labs(
    title = "Distribución de humedad del suelo",
    y = "Humedad del suelo (%)"
  ) +
  theme_minimal()

El boxplot muestra:

  • Mediana
  • Cuartiles
  • Rango intercuartílico
  • Posibles valores atípicos

4.5. Relación entre humedad y rendimiento

ggplot(datos_agricolas, aes(x = humedad_suelo, y = rendimiento)) +
  geom_point(color = "darkgreen") +
  geom_smooth(method = "lm", color = "blue", se = TRUE) +
  labs(
    title = "Humedad del suelo vs rendimiento",
    x = "Humedad del suelo (%)",
    y = "Rendimiento (t/ha)"
  ) +
  theme_minimal()

Y la correlación:

cor(datos_agricolas$humedad_suelo, datos_agricolas$rendimiento)

5. Interpretación agrícola de los resultados

Cuando se aplica estadística descriptiva en R, el ingeniero agrícola no solo debe obtener números, sino interpretarlos.

Por ejemplo:

Si el rendimiento promedio es alto pero la desviación estándar también es alta

Significa que hay zonas de muy buen rendimiento y zonas de bajo rendimiento. Esto puede indicar:

  • Variabilidad espacial del suelo.
  • Problemas de drenaje.
  • Deficiencia localizada de nutrientes.
  • Fallas en la uniformidad del riego.
  • Compactación en algunas zonas.

Si el coeficiente de variación es bajo

Indica que los datos son relativamente homogéneos.

Por ejemplo:

  • Un lote con rendimiento uniforme.
  • Un sistema de riego con buena uniformidad.
  • Un suelo con condiciones relativamente estables.

Si el coeficiente de variación es alto

Indica alta variabilidad. Puede ser útil para:

  • Dividir el lote en zonas de manejo.
  • Aplicar riego variable.
  • Realizar fertilización variable.
  • Investigar factores limitantes.

Si hay valores atípicos

Pueden deberse a:

  • Errores de sensores.
  • Errores de digitación.
  • Condiciones especiales de una parcela.
  • Eventos climáticos extremos.
  • Zonas con encharcamiento o salinidad.

En ingeniería agrícola, antes de eliminar un dato atípico, debe verificarse si es un error o una condición real del sistema.


6. Ejemplo con datos de riego

Supongamos que se mide la lámina aplicada por un sistema de riego en varios puntos.

lamina_riego <- c(18.2, 19.1, 20.5, 17.8, 18.9, 19.4, 21.0, 18.5)

media_lamina <- mean(lamina_riego)
sd_lamina <- sd(lamina_riego)
cv_lamina <- sd_lamina / media_lamina * 100

media_lamina
sd_lamina
cv_lamina

Si la media es 19.2 mm y el CV es bajo, el sistema puede tener buena uniformidad. Si el CV es alto, puede haber problemas en emisores, presión, diseño o mantenimiento.


7. Ejemplo con datos climáticos

Para precipitación histórica:

precipitacion <- c(0, 2, 5, 0, 12, 30, 45, 3, 1, 0, 8, 20)

media <- mean(precipitacion)
mediana <- median(precipitacion)
desviacion <- sd(precipitacion)
rango <- max(precipitacion) - min(precipitacion)

media
mediana
desviacion
rango

Si la media es mucho mayor que la mediana, puede haber pocos días con lluvias muy altas. Eso genera asimetría positiva.

En R:

library(moments)

skewness(precipitacion)

8. Funciones básicas de R para estadística descriptiva

Función Utilidad
mean() Media
median() Mediana
var() Varianza
sd() Desviación estándar
quantile() Cuartiles o percentiles
IQR() Rango intercuartílico
summary() Resumen general
range() Mínimo y máximo
cor() Correlación
cov() Covarianza
table() Frecuencias
hist() Histograma básico
boxplot() Diagrama de caja básico
ggplot() Gráficos avanzados

9. Paquetes útiles en R para ingeniería agrícola

Paquete Uso
dplyr Manipulación de datos
ggplot2 Gráficos
tidyr Ordenar datos
skimr Resúmenes descriptivos rápidos
moments Asimetría y curtosis
psych Estadísticos descriptivos amplios
lubridate Manejo de fechas y horas
sf Datos espaciales
raster o terra Datos ráster, por ejemplo imágenes satelitales

Ejemplo con skimr:

# install.packages("skimr")
library(skimr)

skim(datos_agricolas)

10. Conclusión

La estadística descriptiva en R aplicada a la ingeniería agrícola permite transformar datos de campo en información técnica útil. Sus partes principales son:

  1. Datos y organización.
  2. Medidas de tendencia central.
  3. Medidas de dispersión.
  4. Medidas de posición.
  5. Medidas de forma.
  6. Visualización gráfica.
  7. Interpretación agronómica e ingenieril.

Las ecuaciones más importantes son:

\[ \bar{x} = \frac{1}{n}\sum_{i=1}^{n}x_i \]

\[ s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^2 \]

\[ s = \sqrt{s^2} \]

\[ CV = \frac{s}{\bar{x}} \times 100 \]

\[ IQR = Q_3 - Q_1 \]

\[ r = \frac{s_{xy}}{s_x s_y} \]

Estas ecuaciones ayudan al ingeniero agrícola a comprender el comportamiento de variables como rendimiento, humedad, pH, salinidad, precipitación, temperatura, caudal, uniformidad de riego y eficiencia de maquinaria.