1. ¿Qué es la estadística descriptiva en R aplicada a la ingeniería agrícola?

La estadística descriptiva en R aplicada a la ingeniería agrícola es el uso de funciones, códigos y gráficos del lenguaje R para organizar, resumir, visualizar e interpretar datos provenientes de sistemas agrícolas, tales como:

  • Rendimiento de cultivos en kg/ha o ton/ha.
  • Humedad del suelo.
  • pH, conductividad eléctrica, materia orgánica.
  • Lámina de riego aplicada.
  • Caudal de emisores o aspersores.
  • Temperatura, lluvia y evapotranspiración.
  • Número de plantas, frutos, semillas o plagas.
  • Consumo de combustible de maquinaria agrícola.
  • Índices de vegetación como NDVI.
  • Tamaño, peso o calidad de frutos en postcosecha.

Su objetivo principal no es predecir ni probar hipótesis, sino describir lo que ocurre en el campo para que el ingeniero agrícola pueda tomar decisiones técnicas.

Por ejemplo:

  • ¿Cuál es el rendimiento promedio de un lote?
  • ¿Qué tan uniforme es el riego?
  • ¿Hay parcelas con valores atípicos de pH?
  • ¿Qué tratamiento tiene mayor variabilidad?
  • ¿Existe relación entre NDVI y rendimiento?
  • ¿Dónde conviene aplicar fertilización de tasa variable?

R permite hacer esto mediante funciones como mean(), median(), sd(), var(), quantile(), summary(), table(), cor() y gráficos con ggplot2().


2. Partes de un análisis descriptivo en ingeniería agrícola

Un análisis descriptivo normalmente incluye las siguientes partes.

2.1. Definición de la unidad de estudio

En agricultura, la unidad de análisis puede ser:

  • Una planta.
  • Un surco.
  • Una parcela experimental.
  • Un lote productivo.
  • Un sensor de humedad.
  • Un aspersor.
  • Un día climático.
  • Una cosechadora.
  • Una zona de manejo.

Ejemplo:

Si se evalúa rendimiento de maíz, la unidad puede ser una parcela de 10 m² o una hectárea.


2.2. Tipo de variables

Las variables pueden ser:

Tipo de variable Ejemplo agrícola
Cuantitativa continua Rendimiento, pH, humedad, lámina de riego
Cuantitativa discreta Número de frutos por planta, número de semillas
Categórica Tipo de suelo, variedad, tratamiento de riego
Ordinal Nivel de severidad de una plaga: baja, media, alta

En R, estas variables pueden almacenarse como:

numeric()   # variables numéricas
integer()   # enteros
factor()    # categorías
character() # texto
Date()      # fechas

2.3. Organización de los datos

Los datos normalmente se organizan en una tabla donde cada fila es una observación y cada columna es una variable.

Ejemplo:

lote tratamiento rendimiento_ton_ha humedad_suelo pH NDVI
P1 Riego A 10.2 22.5 6.1 0.72
P2 Riego B 9.6 20.1 5.8 0.68
P3 Riego A 11.1 24.3 6.3 0.78

En R, esto puede ser un data.frame o un tibble.


2.4. Tablas de frecuencia

Sirven para variables categóricas o discretas.

Ejemplo:

  • Número de lotes por tipo de suelo.
  • Frecuencia de variedades sembradas.
  • Cantidad de parcelas con presencia de plaga.

En R:

table(datos$suelo)
prop.table(table(datos$suelo)) * 100

2.5. Medidas de resumen

Incluyen:

  • Medidas de tendencia central: media, mediana, moda.
  • Medidas de dispersión: varianza, desviación estándar, rango, CV.
  • Medidas de posición: cuartiles, percentiles.
  • Medidas de forma: asimetría, curtosis.
  • Medidas de asociación: covarianza, correlación.

2.6. Visualización

Los gráficos permiten detectar patrones, errores y valores atípicos.

Gráficos comunes en ingeniería agrícola:

Gráfico Uso agrícola
Histograma Distribución de rendimientos o tamaño de frutos
Boxplot Comparar tratamientos o detectar lotes atípicos
Diagrama de dispersión Relación entre NDVI y rendimiento
Gráfico de barras Frecuencia de tipos de suelo o plagas
Mapa de calor Variables climáticas por día

En R:

library(ggplot2)

ggplot(datos, aes(x = rendimiento_ton_ha)) +
  geom_histogram(binwidth = 0.25, fill = "green", color = "black") +
  labs(title = "Distribución del rendimiento",
       x = "Rendimiento (ton/ha)",
       y = "Frecuencia")

3. Principales ecuaciones y su interpretación en ingeniería agrícola

A continuación se presentan las ecuaciones más usadas en estadística descriptiva, su función en R y su interpretación agrícola.


4. Frecuencias

4.1. Frecuencia absoluta

Sea una variable categórica o discreta, la frecuencia absoluta de una categoría es:

\[ n_i = \text{número de observaciones en la categoría } i \]

Ejemplo:

Número de parcelas con pH ácido.


4.2. Frecuencia relativa

\[ f_i = \frac{n_i}{n} \]

donde:

  • \(n_i\) = frecuencia de la categoría \(i\)
  • \(n\) = número total de observaciones

4.3. Frecuencia porcentual

\[ \%_i = 100 \cdot \frac{n_i}{n} \]

Interpretación en ingeniería agrícola

Si de 100 parcelas, 35 tienen pH menor a 5.5:

\[ \% = \frac{35}{100} \cdot 100 = 35\% \]

Esto indica que el 35% del área muestreada tiene acidez elevada, lo cual puede justificar una estrategia de encalado variable.

En R:

table(datos$pH_acido)
prop.table(table(datos$pH_acido)) * 100

5. Medidas de tendencia central

Las medidas de tendencia central indican cuál es el valor típico o central de los datos.


5.1. Media aritmética

La media muestral se calcula como:

\[ \bar{x} = \frac{1}{n}\sum_{i=1}^{n}x_i \]

donde:

  • \(x_i\) = valor de la observación \(i\)
  • \(n\) = número total de observaciones
  • \(\bar{x}\) = promedio

En R:

media <- mean(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

Si el rendimiento promedio de maíz es:

\[ \bar{x} = 9.8 \text{ ton/ha} \]

El ingeniero puede usar este valor para:

  • Estimar producción total.
  • Planificar cosecha.
  • Dimensionar almacenamiento.
  • Calcular dosis promedio de fertilización.
  • Comparar tratamientos.

Pero debe tener cuidado: la media es sensible a valores extremos.

Por ejemplo, si un lote tiene una zona inundada con rendimiento muy bajo, el promedio puede disminuir demasiado y no representar bien la mayor parte del campo.


5.2. Mediana

Primero se ordenan los datos:

\[ x_{(1)} \leq x_{(2)} \leq \cdots \leq x_{(n)} \]

La mediana se define como:

\[ \tilde{x} = \begin{cases} x_{((n+1)/2)}, & \text{si } n \text{ es impar} \\ \frac{x_{(n/2)} + x_{(n/2+1)}}{2}, & \text{si } n \text{ es par} \end{cases} \]

En R:

mediana <- median(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

La mediana indica el valor central de los datos.

Si:

\[ \text{Media} = 8.2 \text{ ton/ha} \]

pero:

\[ \text{Mediana} = 9.6 \text{ ton/ha} \]

Esto puede indicar que hay pocas parcelas con rendimientos muy bajos, quizás por encharcamiento, plagas o compactación.

La mediana es más robusta que la media cuando hay valores atípicos.

En agricultura, esto es útil cuando:

  • Hay lotes muy heterogéneos.
  • Existen fallas localizadas de riego.
  • Hay zonas con plagas severas.
  • Algunos sensores entregan datos erróneos.

5.3. Moda

La moda es el valor o categoría más frecuente.

\[ Mo = x_i \quad \text{tal que} \quad f_i \text{ es máxima} \]

Para variables continuas, en lugar de un valor exacto, se suele usar un intervalo o clase modal.

En R, para variables categóricas:

tabla <- table(datos$variedad)
tabla[tabla == max(tabla)]

Interpretación en ingeniería agrícola

Si la variedad más frecuente es:

\[ Mo = \text{Variedad B} \]

Esto puede indicar preferencia de siembra, disponibilidad de semilla o mejor adaptación.

En postcosecha, la moda del tamaño de fruto sirve para:

  • Calibrar maquinaria de empaque.
  • Definir categorías comerciales.
  • Planificar selección automática.

6. Medidas de dispersión

Las medidas de dispersión indican qué tan variados están los datos. En ingeniería agrícola son muy importantes porque la variabilidad puede representar:

  • Heterogeneidad del suelo.
  • Mala uniformidad de riego.
  • Problemas de fertilización.
  • Fallas en maquinaria.
  • Zonas con plagas.
  • Diferencias de manejo.

6.1. Rango

\[ R = x_{\max} - x_{\min} \]

En R:

rango <- max(datos$rendimiento_ton_ha, na.rm = TRUE) -
         min(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

Si el rendimiento mínimo es 5 ton/ha y el máximo es 12 ton/ha:

\[ R = 12 - 5 = 7 \text{ ton/ha} \]

Esto indica una diferencia amplia entre las mejores y peores zonas del lote.

Puede servir para identificar:

  • Zonas de manejo diferenciado.
  • Áreas con limitaciones de suelo.
  • Problemas de drenaje.
  • Necesidad de agricultura de precisión.

6.2. Varianza muestral

La varianza muestral se calcula como:

\[ s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2 \]

donde:

  • \(s^2\) = varianza muestral
  • \(x_i\) = observación \(i\)
  • \(\bar{x}\) = media muestral
  • \(n\) = número de observaciones

En R:

varianza <- var(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

La varianza mide la dispersión de los datos respecto al promedio.

Una varianza alta en rendimiento puede indicar:

  • Suelo heterogéneo.
  • Riego desigual.
  • Diferencias de fertilidad.
  • Presencia de plagas en zonas específicas.
  • Errores de siembra o cosecha.

La desventaja es que la varianza está en unidades al cuadrado.

Por ejemplo, si la variable es rendimiento en ton/ha:

\[ s^2 \text{ está en } \left(\text{ton/ha}\right)^2 \]

Por eso suele usarse más la desviación estándar.


6.3. Desviación estándar

\[ s = \sqrt{s^2} \]

En R:

desviacion <- sd(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

La desviación estándar indica qué tan alejados están, en promedio, los datos respecto a la media.

Si:

\[ \bar{x} = 10 \text{ ton/ha} \]

y:

\[ s = 0.5 \text{ ton/ha} \]

El lote es relativamente uniforme.

Pero si:

\[ \bar{x} = 10 \text{ ton/ha} \]

y:

\[ s = 2.8 \text{ ton/ha} \]

El lote es muy variable.

En ingeniería agrícola, una desviación estándar alta puede indicar:

  • Baja uniformidad de riego.
  • Mala distribución de fertilizante.
  • Heterogeneidad de suelo.
  • Problemas de calibración de maquinaria.
  • Zonas con estrés hídrico o nutricional.

6.4. Coeficiente de variación

\[ CV = \frac{s}{\bar{x}} \cdot 100\% \]

En R:

cv <- sd(datos$rendimiento_ton_ha, na.rm = TRUE) /
      mean(datos$rendimiento_ton_ha, na.rm = TRUE) * 100

Interpretación en ingeniería agrícola

El coeficiente de variación expresa la variabilidad en porcentaje.

Es muy útil porque permite comparar variables con distintas unidades o diferentes promedios.

Ejemplo:

Tratamiento Media ton/ha Desviación estándar CV
Riego A 10.0 0.8 8%
Riego B 12.0 1.8 15%

Aunque Riego B tiene mayor rendimiento promedio, también tiene mayor variabilidad.

Interpretación:

  • CV bajo: mayor uniformidad.
  • CV alto: mayor heterogeneidad.

En ensayos agrícolas, un CV demasiado alto puede indicar:

  • Mal diseño experimental.
  • Alta variabilidad natural del terreno.
  • Errores de medición.
  • Manejo no uniforme.

El valor aceptable depende del cultivo, la variable y el tipo de ensayo.


7. Medidas de posición

Las medidas de posición dividen los datos en partes porcentuales.


7.1. Cuartiles

Los cuartiles dividen los datos en cuatro partes iguales.

\[ Q_1 = \text{percentil 25} \]

\[ Q_2 = \text{percentil 50} = \text{mediana} \]

\[ Q_3 = \text{percentil 75} \]

En R:

quantile(datos$rendimiento_ton_ha, probs = c(0.25, 0.50, 0.75), na.rm = TRUE)

Interpretación en ingeniería agrícola

Si el rendimiento tiene:

\[ Q_1 = 7.8 \text{ ton/ha} \]

\[ Q_2 = 9.5 \text{ ton/ha} \]

\[ Q_3 = 11.2 \text{ ton/ha} \]

Esto significa que:

  • El 25% de las parcelas produce menos de 7.8 ton/ha.
  • El 50% produce menos de 9.5 ton/ha.
  • El 75% produce menos de 11.2 ton/ha.

El ingeniero puede priorizar el 25% inferior para:

  • Muestreo de suelo.
  • Revisión de drenaje.
  • Corrección de pH.
  • Fertilización variable.
  • Evaluación de plagas.

7.2. Rango intercuartílico

\[ IQR = Q_3 - Q_1 \]

En R:

IQR(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

El IQR representa la dispersión del 50% central de los datos.

Es más robusto que el rango total porque no se ve tan afectado por valores extremos.

Un IQR alto indica que la mitad central de los datos también es heterogénea.


7.3. Detección de valores atípicos con IQR

Una regla común es:

\[ x_i < Q_1 - 1.5 \cdot IQR \]

o

\[ x_i > Q_3 + 1.5 \cdot IQR \]

En R:

q <- quantile(datos$rendimiento_ton_ha, probs = c(0.25, 0.75), na.rm = TRUE)
iqr <- IQR(datos$rendimiento_ton_ha, na.rm = TRUE)

limite_inferior <- q[1] - 1.5 * iqr
limite_superior <- q[2] + 1.5 * iqr

atipicos <- datos$rendimiento_ton_ha < limite_inferior |
            datos$rendimiento_ton_ha > limite_superior

datos[atipicos, ]

Interpretación en ingeniería agrícola

Los valores atípicos pueden ser:

  • Errores de sensor.
  • Parcelas con encharcamiento.
  • Zonas con compactación.
  • Daño por plagas.
  • Fallas de siembra.
  • Errores de cosechadora.
  • Zonas con fertilización excesiva o deficiente.

No siempre deben eliminarse. Primero deben investigarse.


7.4. Percentiles

El percentil \(p\) es el valor debajo del cual se encuentra aproximadamente el \(p\%\) de los datos.

En R:

quantile(datos$lluvia_mm, probs = c(0.90, 0.95, 0.99), na.rm = TRUE)

Interpretación en ingeniería agrícola

Ejemplos:

  • El percentil 95 de lluvia puede usarse para diseño de drenaje agrícola.
  • El percentil 90 de temperatura puede ayudar a evaluar estrés térmico.
  • El percentil 75 de rendimiento puede usarse para identificar zonas de alto potencial.
  • El percentil 10 de humedad del suelo puede indicar momentos críticos de riego.

8. Estandarización de datos: puntaje Z

El puntaje Z indica cuántas desviaciones estándar está una observación respecto a la media.

\[ z_i = \frac{x_i - \bar{x}}{s} \]

En R:

z <- (datos$rendimiento_ton_ha - mean(datos$rendimiento_ton_ha, na.rm = TRUE)) /
     sd(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

Si una parcela tiene:

\[ z = -2.1 \]

Significa que su rendimiento está 2.1 desviaciones estándar por debajo del promedio.

Esto puede indicar una zona problema.

En agricultura de precisión, los puntajes Z sirven para:

  • Detectar lotes atípicos.
  • Identificar zonas de bajo rendimiento.
  • Priorizar muestreos.
  • Comparar variables con distintas unidades.
  • Generar mapas de anomalías.

9. Medidas de forma

Las medidas de forma indican cómo se distribuyen los datos alrededor de la media.


9.1. Asimetría

Una forma común de calcularla es:

\[ g_1 = \frac{ \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^3 }{ \left[ \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2 \right]^{3/2} } \]

En R se puede usar con paquetes como moments o e1071:

# install.packages("moments")
library(moments)

skewness(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

Si la asimetría es:

  • \(g_1 = 0\): distribución aproximadamente simétrica.
  • \(g_1 > 0\): cola hacia la derecha.
  • \(g_1 < 0\): cola hacia la izquierda.

Ejemplo:

Si el rendimiento tiene asimetría negativa, puede significar que la mayoría de las parcelas rinde bien, pero hay pocas parcelas con rendimiento muy bajo.

Esto puede deberse a:

  • Zonas inundadas.
  • Plagas localizadas.
  • Suelos salinos.
  • Fallas de maquinaria.

Si la asimetría es positiva, puede haber pocas parcelas con rendimientos excepcionalmente altos.


9.2. Curtosis

Una forma de curtosis excesiva es:

\[ g_2 = \frac{ \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^4 }{ \left[ \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2 \right]^2 } - 3 \]

En R:

library(moments)

kurtosis(datos$rendimiento_ton_ha, na.rm = TRUE)

Interpretación en ingeniería agrícola

La curtosis describe qué tan pesadas son las colas de la distribución.

Si hay curtosis alta, pueden existir valores extremos, por ejemplo:

  • Parcelas con rendimiento anormalmente bajo.
  • Sensores con lecturas extremas.
  • Zonas con estrés severo.

Esto es útil para detectar situaciones que no se observan solo con la media.


10. Medidas de asociación entre variables

En ingeniería agrícola muchas decisiones requieren analizar dos o más variables juntas.

Por ejemplo:

  • ¿A mayor NDVI, mayor rendimiento?
  • ¿A mayor salinidad, menor rendimiento?
  • ¿La humedad del suelo está relacionada con el rendimiento?
  • ¿El pH influye en la disponibilidad de nutrientes?

10.1. Covarianza muestral

\[ s_{xy} = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y}) \]

En R:

cov(datos$NDVI, datos$rendimiento_ton_ha, use = "complete.obs")

Interpretación en ingeniería agrícola

La covarianza indica la dirección de la relación entre dos variables.

  • Covarianza positiva: cuando una variable aumenta, la otra también tiende a aumentar.
  • Covarianza negativa: cuando una variable aumenta, la otra tiende a disminuir.

Ejemplo:

Si NDVI y rendimiento tienen covarianza positiva:

\[ s_{xy} > 0 \]

Entonces, a mayor NDVI, tiende a haber mayor rendimiento.

La desventaja es que depende de las unidades de las variables.


10.2. Correlación de Pearson

\[ r = \frac{ s_{xy} }{ s_x s_y } \]

También puede escribirse como:

\[ r = \frac{ \sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y}) }{ \sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2} \sqrt{\sum_{i=1}^{n}(y_i - \bar{y})^2} } \]

En R:

cor(datos$NDVI, datos$rendimiento_ton_ha, use = "complete.obs")

Interpretación en ingeniería agrícola

El coeficiente de correlación \(r\) varía entre -1 y 1.

Valor de \(r\) Interpretación
Cercano a +1 Relación positiva fuerte
Cercano a -1 Relación negativa fuerte
Cercano a 0 Relación lineal débil

Ejemplos:

  • Si \(r = 0.85\) entre NDVI y rendimiento, hay una relación positiva fuerte.
  • Si \(r = -0.70\) entre conductividad eléctrica y rendimiento, puede indicar que mayor salinidad se asocia con menor rendimiento.
  • Si \(r = 0.10\) entre pH y rendimiento, la relación lineal es débil.

Importante:

Correlación no implica causalidad.

Una correlación entre NDVI y rendimiento puede estar influenciada por agua, fertilidad, tipo de suelo, variedad o manejo.


10.3. Coeficiente de determinación

\[ r^2 = r \cdot r \]

En R:

r <- cor(datos$NDVI, datos$rendimiento_ton_ha, use = "complete.obs")
r2 <- r^2

Interpretación en ingeniería agrícola

Si:

\[ r = 0.80 \]

Entonces:

\[ r^2 = 0.64 \]

Esto significa que el 64% de la variabilidad del rendimiento puede explicarse linealmente por la variabilidad del NDVI, en términos descriptivos.

No significa necesariamente causa-efecto, pero sí indica una asociación útil para monitoreo o agricultura de precisión.


11. Índice aplicado a riego: coeficiente de uniformidad

Además de los estadísticos clásicos, en ingeniería agrícola se usan índices derivados de la estadística descriptiva.

Un ejemplo es el coeficiente de uniformidad de Christiansen, usado para evaluar uniformidad de riego.

\[ CU = 100 \left( 1 - \frac{ \sum_{i=1}^{n}|x_i - \bar{x}| }{ n\bar{x} } \right) \]

donde:

  • \(x_i\) = lámina o caudal medido en el punto \(i\)
  • \(\bar{x}\) = media de las mediciones
  • \(n\) = número de mediciones

En R:

CU <- function(x) {
  x <- x[!is.na(x)]
  100 * (1 - sum(abs(x - mean(x))) / (length(x) * mean(x)))
}

CU(datos$lamina_riego_mm)

Interpretación en ingeniería agrícola

Si el CU es alto, el sistema de riego aplica el agua de forma más uniforme.

Si el CU es bajo, puede haber:

  • Emisores tapados.
  • Presión desigual.
  • Diseño deficiente.
  • Pérdidas de carga.
  • Mala calibración.

Este índice es muy útil en riego por aspersión, goteo y microaspersión.


12. Ejemplo completo en R

A continuación, un ejemplo simulado de un ensayo agrícola.

# Cargar paquetes
library(tidyverse)
library(skimr)

# Simular datos agrícolas
set.seed(2026)

n <- 100

riego <- sample(c("Goteo", "Aspersión"), n, replace = TRUE)

rendimiento <- ifelse(
  riego == "Goteo",
  rnorm(n, mean = 12.5, sd = 0.9),
  rnorm(n, mean = 11.0, sd = 1.8)
)

humedad_suelo <- 15 + 0.5 * rendimiento + rnorm(n, 0, 2)

pH <- rnorm(n, mean = 6.2, sd = 0.4)

NDVI <- 0.25 + 0.04 * rendimiento + rnorm(n, 0, 0.03)

datos <- data.frame(
  lote = paste0("P", 1:n),
  riego = riego,
  rendimiento_ton_ha = rendimiento,
  humedad_suelo_pct = humedad_suelo,
  pH = pH,
  NDVI = NDVI
)

# Ver primeras filas
head(datos)

13. Resumen descriptivo rápido en R

# Resumen base
summary(datos)

# Resumen más completo
skim(datos)

La función summary() muestra:

  • Mínimo.
  • Cuartil 1.
  • Mediana.
  • Media.
  • Cuartil 3.
  • Máximo.
  • Número de valores perdidos.

La función skim() del paquete skimr muestra un resumen más detallado, incluyendo desviación estándar, histograma y valores faltantes.


14. Cálculo manual de estadísticos en R

x <- datos$rendimiento_ton_ha

n <- length(x)

media <- sum(x, na.rm = TRUE) / n

varianza <- sum((x - media)^2, na.rm = TRUE) / (n - 1)

desviacion <- sqrt(varianza)

cv <- desviacion / media * 100

rango <- max(x, na.rm = TRUE) - min(x, na.rm = TRUE)

cuartiles <- quantile(x, probs = c(0.25, 0.50, 0.75), na.rm = TRUE)

iqr <- IQR(x, na.rm = TRUE)

media
varianza
desviacion
cv
rango
cuartiles
iqr

Interpretación

Si el resultado fuera, por ejemplo:

media = 11.8
desviacion = 1.4
cv = 11.9%

Podría interpretarse así:

  • El rendimiento promedio del lote es 11.8 ton/ha.
  • Las parcelas se desvían, en promedio, 1.4 ton/ha respecto al promedio.
  • La variabilidad relativa es 11.9%.
  • Si se compara con otro tratamiento, se debe revisar si el CV es mayor o menor.

15. Estadística descriptiva por tratamiento

En ingeniería agrícola es común comparar tratamientos.

Por ejemplo:

  • Riego por goteo vs aspersión.
  • Fertilización convencional vs fertilización variable.
  • Siembra directa vs labranza convencional.
  • Variedad A vs variedad B.

En R:

resumen <- datos %>%
  group_by(riego) %>%
  summarise(
    n = n(),
    media = mean(rendimiento_ton_ha, na.rm = TRUE),
    mediana = median(rendimiento_ton_ha, na.rm = TRUE),
    desviacion = sd(rendimiento_ton_ha, na.rm = TRUE),
    CV = desviacion / media * 100,
    minimo = min(rendimiento_ton_ha, na.rm = TRUE),
    maximo = max(rendimiento_ton_ha, na.rm = TRUE),
    Q1 = quantile(rendimiento_ton_ha, 0.25, na.rm = TRUE),
    Q3 = quantile(rendimiento_ton_ha, 0.75, na.rm = TRUE),
    IQR = IQR(rendimiento_ton_ha, na.rm = TRUE)
  )

resumen

Interpretación

Si el sistema de goteo tiene:

  • Mayor media.
  • Menor desviación estándar.
  • Menor CV.

Entonces puede interpretarse como:

El riego por goteo produjo mayor rendimiento promedio y mayor uniformidad que la aspersión.

Si, por el contrario, un tratamiento tiene mayor promedio pero mayor CV, significa que puede ser más productivo en promedio, pero menos estable.


16. Gráficos descriptivos en R con interpretación agrícola

16.1. Histograma del rendimiento

ggplot(datos, aes(x = rendimiento_ton_ha)) +
  geom_histogram(binwidth = 0.5,
                 fill = "darkgreen",
                 color = "black") +
  geom_vline(aes(xintercept = mean(rendimiento_ton_ha)),
             color = "blue",
             linewidth = 1) +
  geom_vline(aes(xintercept = median(rendimiento_ton_ha)),
             color = "red",
             linewidth = 1) +
  labs(
    title = "Distribución del rendimiento",
    x = "Rendimiento (ton/ha)",
    y = "Frecuencia"
  ) +
  theme_minimal()

Interpretación

El histograma permite ver:

  • Si el rendimiento se concentra alrededor de un valor.
  • Si hay dos grupos de parcelas.
  • Si hay sesgo hacia rendimientos bajos o altos.

Si aparecen dos picos, puede haber dos zonas de manejo diferentes.

Por ejemplo:

  • Zona con buen drenaje.
  • Zona con compactación.

16.2. Boxplot por tratamiento

ggplot(datos, aes(x = riego,
                  y = rendimiento_ton_ha,
                  fill = riego)) +
  geom_boxplot(alpha = 0.7) +
  labs(
    title = "Rendimiento según sistema de riego",
    x = "Sistema de riego",
    y = "Rendimiento (ton/ha)"
  ) +
  theme_minimal() +
  theme(legend.position = "none")

Interpretación

El boxplot permite comparar:

  • Mediana.
  • Rango intercuartílico.
  • Valores atípicos.
  • Simetría de la distribución.

Si el boxplot de goteo está más arriba y es más angosto, puede indicar:

  • Mayor rendimiento.
  • Menor variabilidad.
  • Mejor uniformidad.

Si aspersión tiene muchos puntos atípicos bajos, puede indicar fallas de uniformidad.


16.3. Diagrama de dispersión NDVI vs rendimiento

ggplot(datos, aes(x = NDVI, y = rendimiento_ton_ha)) +
  geom_point(color = "darkgreen") +
  geom_smooth(method = "lm", se = FALSE, color = "blue") +
  labs(
    title = "Relación entre NDVI y rendimiento",
    x = "NDVI",
    y = "Rendimiento (ton/ha)"
  ) +
  theme_minimal()

Interpretación

Si la nube de puntos muestra tendencia positiva:

  • Mayor NDVI se asocia con mayor rendimiento.
  • Puede usarse para monitoreo con drones o satélites.
  • Puede ayudar a definir zonas de manejo.

Pero se debe recordar:

Una correlación observada no demuestra causalidad.


17. Correlaciones entre variables agrícolas

cor(datos[, c("rendimiento_ton_ha",
              "humedad_suelo_pct",
              "pH",
              "NDVI")],
    use = "complete.obs")

Interpretación

Una matriz de correlación puede mostrar, por ejemplo:

Variable Rendimiento
NDVI +0.80
Humedad del suelo +0.55
pH +0.10

Interpretación:

  • NDVI y rendimiento tienen asociación positiva fuerte.
  • Humedad del suelo y rendimiento tienen asociación moderada.
  • pH y rendimiento tienen asociación débil en ese conjunto de datos.

En ingeniería agrícola, esto puede orientar decisiones como:

  • Priorizar sensores de vegetación.
  • Mejorar programación de riego.
  • Investigar si el pH realmente limita el rendimiento.
  • No corregir pH si no hay evidencia técnica suficiente.

18. Tabla resumen de ecuaciones e interpretación agrícola

Medida Ecuación Función R Interpretación agrícola
Media \(\bar{x}=\frac{1}{n}\sum x_i\) mean() Rendimiento promedio, dosis promedio, consumo promedio
Mediana Valor central ordenado median() Valor robusto frente a parcelas atípicas
Moda Valor más frecuente table() Categoría o valor más común
Varianza \(s^2=\frac{\sum(x_i-\bar{x})^2}{n-1}\) var() Variabilidad del lote o tratamiento
Desviación estándar \(s=\sqrt{s^2}\) sd() Uniformidad de rendimiento, riego o suelo
CV \(CV=\frac{s}{\bar{x}}100\) sd()/mean()*100 Comparar variabilidad entre tratamientos
Rango \(R=x_{\max}-x_{\min}\) max() - min() Amplitud total de la variable
Cuartiles \(Q_1, Q_2, Q_3\) quantile() Zonas bajas, medias y altas
IQR \(IQR=Q_3-Q_1\) IQR() Variabilidad del 50% central
Z-score \(z_i=\frac{x_i-\bar{x}}{s}\) (x-mean(x))/sd(x) Detectar parcelas anómalas
Asimetría Tercer momento estandarizado moments::skewness() Sesgo hacia valores altos o bajos
Covarianza \(s_{xy}\) cov() Dirección de relación entre variables
Correlación \(r=\frac{s_{xy}}{s_x s_y}\) cor() Fuerza de asociación lineal
\(r^2\) \(r^2\) cor()^2 Proporción de variabilidad asociada
CU \(100(1-\frac{\sum|x_i-\bar{x}|}{n\bar{x}})\) Función propia Uniformidad de riego

19. Ejemplos de interpretación por área de la ingeniería agrícola

19.1. Suelos

Variables:

  • pH.
  • Conductividad eléctrica.
  • Materia orgánica.
  • Fósforo disponible.
  • Potasio.
  • Textura.

Estadísticos útiles:

  • Media: fertilidad promedio.
  • Desviación estándar: heterogeneidad del suelo.
  • Cuartiles: zonas bajas y altas.
  • Boxplot: comparación por lote.

Interpretación:

Si el pH tiene media 5.4 y desviación estándar 0.3, el lote es ácido y relativamente homogéneo. Puede recomendarse encalado.

Si la conductividad eléctrica tiene valores atípicos altos, puede haber zonas salinas.


19.2. Riego

Variables:

  • Lámina aplicada.
  • Caudal de emisores.
  • Presión.
  • Humedad del suelo.
  • Uniformidad.

Estadísticos útiles:

  • Media: lámina promedio aplicada.
  • Desviación estándar: variabilidad de aplicación.
  • CV: variabilidad relativa.
  • CU: uniformidad de riego.
  • Boxplot: comparación entre laterales o sectores.

Interpretación:

Si el CV de caudales es alto, el sistema puede tener emisores tapados o presión desigual.

Si la humedad del suelo tiene media adecuada pero alta desviación, el riego puede estar mal distribuido.


19.3. Rendimiento y agricultura de precisión

Variables:

  • Rendimiento por hectárea.
  • NDVI.
  • Conductividad eléctrica aparente.
  • Elevación.
  • Dosis de fertilizante.

Estadísticos útiles:

  • Media y mediana.
  • Cuartiles.
  • Z-score.
  • Correlación.
  • Histogramas.
  • Mapas de distribución.

Interpretación:

Si el rendimiento tiene dos grupos claros, pueden existir dos zonas de manejo.

Si NDVI correlaciona positivamente con rendimiento, puede usarse para monitoreo remoto.

Si las parcelas con \(z < -2\) se concentran en una zona, puede haber un problema localizado de drenaje o compactación.


19.4. Maquinaria agrícola

Variables:

  • Consumo de combustible.
  • Capacidad de campo.
  • Profundidad de labranza.
  • Espaciado entre semillas.
  • Patinaje.

Estadísticos útiles:

  • Media: desempeño promedio.
  • Desviación estándar: estabilidad de la máquina.
  • CV: calidad de operación.
  • Boxplot: comparación entre velocidades o configuraciones.

Interpretación:

Si la profundidad de labranza tiene alta desviación, la máquina puede estar mal regulada o trabajando en condiciones heterogéneas.

Si el espaciamiento entre semillas tiene CV alto, puede haber problemas de siembra.


19.5. Postcosecha

Variables:

  • Peso de frutos.
  • Diámetro.
  • Firmeza.
  • Grados Brix.
  • Porcentaje de daño.

Estadísticos útiles:

  • Media y moda.
  • Frecuencias.
  • Histogramas.
  • Cuartiles.

Interpretación:

Si la distribución de tamaños es muy amplia, se requiere calibración.

Si la moda está en una categoría comercial deseable, el proceso es adecuado.

Si hay alta variabilidad en firmeza, puede haber madurez desigual.


20. Recomendaciones prácticas al usar estadística descriptiva en R

  1. Siempre revisar valores faltantes
sum(is.na(datos$rendimiento_ton_ha))
  1. Usar na.rm = TRUE si hay datos perdidos
mean(datos$rendimiento_ton_ha, na.rm = TRUE)
  1. No interpretar la media sin ver la distribución

La media puede engañar si hay valores atípicos.

  1. Comparar media, mediana y desviación juntas
summary(datos$rendimiento_ton_ha)
  1. Graficar antes de concluir
ggplot(datos, aes(x = rendimiento_ton_ha)) +
  geom_histogram()
  1. Analizar los valores atípicos antes de eliminarlos

Pueden ser errores, pero también pueden indicar problemas reales del lote.

  1. Agrupar por tratamiento, lote o zona
datos %>%
  group_by(riego) %>%
  summarise(media = mean(rendimiento_ton_ha, na.rm = TRUE))
  1. No confundir correlación con causalidad

Una correlación alta entre NDVI y rendimiento no significa automáticamente que el NDVI cause mayor rendimiento.


21. Conclusión

La estadística descriptiva en R aplicada a la ingeniería agrícola permite transformar datos de campo en información útil para la toma de decisiones.

Sus partes principales son:

  1. Datos agrícolas.
  2. Variables.
  3. Tablas de frecuencia.
  4. Medidas de tendencia central.
  5. Medidas de dispersión.
  6. Medidas de posición.
  7. Medidas de forma.
  8. Medidas de asociación.
  9. Gráficos.
  10. Interpretación agronómica y técnica.

Las ecuaciones más importantes son:

\[ \bar{x} = \frac{1}{n}\sum_{i=1}^{n}x_i \]

\[ s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2 \]

\[ s = \sqrt{s^2} \]

\[ CV = \frac{s}{\bar{x}} \cdot 100\% \]

\[ IQR = Q_3 - Q_1 \]

\[ z_i = \frac{x_i - \bar{x}}{s} \]

\[ r = \frac{s_{xy}}{s_x s_y} \]

En ingeniería agrícola, estas ecuaciones sirven para evaluar:

  • Rendimiento.
  • Uniformidad de riego.
  • Variabilidad del suelo.
  • Calidad de maquinaria.
  • Comportamiento de cultivos.
  • Zonas de manejo.
  • Valores atípicos.
  • Relaciones entre variables productivas.

En resumen, la estadística descriptiva en R no solo resume números, sino que ayuda al ingeniero agrícola a entender el comportamiento del sistema productivo y a tomar decisiones más técnicas, eficientes y basadas en datos.