Punto 1: Datos biodiversidad

En 52 parcelas distribuidas en cuatro tipos de hábitat (Bosque primario, Bosque secundario, Sistema silvopastoril y Potrero) se registró la riqueza de especies, el índice de diversidad de Shannon y la altitud sobre el nivel del mar. El objetivo es describir el comportamiento de estas variables, explorar su relación con el tipo de hábitat y la altitud, y evaluar mediante un Análisis de Varianza (ANOVA) si el índice de Shannon difiere significativamente entre los tipos de hábitat.

Analisis Exploratorio Univariado

library(ggplot2)
library(dplyr)
library(knitr)

load("~/Cuarto semestre/Diseño de Experimentos/Taller 1/Recursos/Biodiversidad.RData")
df_bio <- BD_biodiversidad

# Tabla de medidas univariables
vars_bio <- c("Riqueza", "Shannon", "Altitud")

tabla_univariado_bio <- sapply(df_bio[, vars_bio], function(x) {
  c(
    Media = mean(x, na.rm = TRUE),
    Mediana = median(x, na.rm = TRUE),
    `Desv. Est.` = sd(x, na.rm = TRUE),
    Mínimo = min(x, na.rm = TRUE),
    Máximo = max(x, na.rm = TRUE),
    `CV (%)` = (sd(x, na.rm = TRUE) / mean(x, na.rm = TRUE)) * 100
  )
})


tabla_univariado_bio <- as.data.frame(t(tabla_univariado_bio))
tabla_univariado_bio <- tibble::rownames_to_column(tabla_univariado_bio, var = "Variable")
tabla_univariado_bio <- tabla_univariado_bio %>% mutate(across(where(is.numeric), ~ round(., 2)))


kable(tabla_univariado_bio, caption = "Tabla 1. Medidas descriptivas univariadas (N = 52).")
Tabla 1. Medidas descriptivas univariadas (N = 52).
Variable Media Mediana Desv. Est. Mínimo Máximo CV (%)
Riqueza 9.73 9.50 4.37 2.00 21.00 44.92
Shannon 1.76 1.85 0.61 0.67 2.98 34.44
Altitud 1243.89 1254.80 172.71 950.90 1600.80 13.88

Gráficos de Distribución

A continuación se presentan los gráficos de distribución para cada variable con separación entre barras:

# Gráfico de Riqueza de Especies
ggplot(df_bio, aes(x = factor(cut(Riqueza, breaks = 6)))) +
  geom_bar(fill = "#2b5c8f", color = "black", width = 0.6) +
  theme_minimal() +
  labs(title = "Distribución de Riqueza", x = "Riqueza", y = "Frecuencia") +
  theme(axis.text.x = element_text(angle = 30, hjust = 1))

# Gráfico de Índice de Shannon
ggplot(df_bio, aes(x = factor(cut(Shannon, breaks = 6)))) +
  geom_bar(fill = "#2e8b57", color = "black", width = 0.6) +
  theme_minimal() +
  labs(title = "Distribución de Índice de Shannon", x = "Índice de Shannon", y = "Frecuencia") +
  theme(axis.text.x = element_text(angle = 30, hjust = 1))

# Gráfico de Altitud
ggplot(df_bio, aes(x = factor(cut(Altitud, breaks = 6)))) +
  geom_bar(fill = "#d95f02", color = "black", width = 0.6) +
  theme_minimal() +
  labs(title = "Distribución de Altitud", x = "Altitud", y = "Frecuencia") +
  theme(axis.text.x = element_text(angle = 30, hjust = 1))

Interpretación del Análisis Univariado:

Riqueza de especies: presenta una media de 9.73, una mediana de 9.5 y una desviación estándar de 4.37, con valores entre 2 y 21 especies por parcela. El coeficiente de variación es de 44.92%, lo que indica una variabilidad alta entre parcelas, coherente con la existencia de hábitats muy distintos (desde bosques con alta riqueza hasta potreros con riqueza baja).

Índice de Shannon: registra una media de 1.76, una mediana de 1.85 y una desviación estándar de 0.61, con valores entre 0.67 y 2.98. Su CV es de 34.44%, una variabilidad moderada-alta, también asociada a las diferencias entre tipos de hábitat.

Altitud: presenta una media de 1243.89 m s.n.m., una mediana de 1254.8 y una desviación estándar de 172.71, con un rango entre 950.9 y 1600.8 m. Su coeficiente de variación es de apenas 13.88%, el más bajo de las tres variables, lo que refleja que las parcelas muestreadas se ubican en un rango altitudinal relativamente homogéneo.

Análisis exploratorio bivariado

library(ggplot2)

# Comparación de Riqueza de Especies por Tipo de Hábitat
ggplot(BD_biodiversidad, aes(x = Habitat, y = Riqueza, fill = Habitat)) +
  stat_boxplot(geom = "errorbar", width = 0.2) + 
  geom_boxplot(alpha = 0.7, outlier.color = "red", outlier.shape = 16) +
  labs(
    title = "Comparación de la Riqueza de Especies por Tipo de Hábitat",
    x = "Tipo de Hábitat",
    y = "Riqueza de Especies"
  ) +
  theme_minimal() +
  theme(legend.position = "none")

# Comparación de Diversidad de Shannon por Tipo de Hábitat
ggplot(BD_biodiversidad, aes(x = Habitat, y = Shannon, fill = Habitat)) +
  stat_boxplot(geom = "errorbar", width = 0.2) +
  geom_boxplot(alpha = 0.7, outlier.color = "red", outlier.shape = 16) +
  labs(
    title = "Comparación de la Diversidad de Shannon por Tipo de Hábitat",
    x = "Tipo de Hábitat",
    y = "Índice de Shannon (H')"
  ) +
  theme_minimal() +
  theme(legend.position = "none")

##Relación entre Altitud y Diversidad de Shannon
ggplot(BD_biodiversidad, aes(x = Altitud, y = Shannon)) +
  geom_point(color = "#2E8B57", size = 3, alpha = 0.8) +
  geom_smooth(method = "lm", se = TRUE, color = "black", linetype = "dashed") +
  labs(
    title = "Relación entre Altitud y Diversidad de Shannon",
    x = "Altitud (m s.n.m.)",
    y = "Índice de Shannon (H')"
  ) +
  theme_minimal()

Interpretación del Análisis Bivariado:

Al comparar la riqueza de especies entre hábitats, se ve un cambio claro de mayor a menor intervención humana: Bosque primario presenta la mayor riqueza media (14.77), seguido de Bosque secundario (11.08), Sistema silvopastoril (8.08) y, con la riqueza más baja, Potrero (5.00). El mismo patrón se repite para el índice de Shannon: Bosque primario (2.47), Bosque secundario (1.97), Sistema silvopastoril (1.60) y Potrero (1.00), lo que sugiere que a medida que el hábitat se aleja de su estado natural (de bosque primario a potrero), tanto la riqueza como la diversidad de especies disminuyen.

Respecto a la relación entre Altitud y el índice de Shannon, el diagrama de dispersión muestra una tendencia positiva: a mayor altitud, mayor diversidad de Shannon, con un coeficiente de correlación de Pearson r = 0.752, que indica una relación lineal entre ambas variables. Esto se relaciona con lo observado por hábitat, ya que los bosques (con mayor diversidad) tienden a ubicarse en las zonas de mayor altitud del muestreo, mientras que los potreros ocupan los espacios más bajos.

ANOVA de una vía, verificación de supuestos y prueba LSD

Se analiza si existen diferencias significativas en el índice de diversidad de Shannon entre los diferentes tipos de Habitat mediante un Análisis de Varianza (ANOVA).

library(agricolae)
library(knitr)

# Modelo ANOVA
modelo_anova <- aov(Shannon ~ Habitat, data = BD_biodiversidad)
summary_aov <- summary(modelo_anova)[[1]]

# Tabla ANOVA
tabla_anova <- data.frame(
  `Fuente de Variación` = c("Tipo de Hábitat", "Residuales"),
  `GL` = summary_aov$Df,
  `Suma Cuadrados` = round(summary_aov$`Sum Sq`, 2),
  `Cuadrado Medio` = round(summary_aov$`Mean Sq`, 2),
  `F Calculado` = c(round(summary_aov$`F value`[1], 2), "-"),
  `Valor p` = c(format.pval(summary_aov$`Pr(>F)`[1], digits = 3), "-"),
  check.names = FALSE
)

### Supuestos
residuos <- residuals(modelo_anova)
shapiro_test <- shapiro.test(residuos)
bartlett_test <- bartlett.test(Shannon ~ Habitat, data = BD_biodiversidad)

tabla_supuestos <- data.frame(
  `Supuesto Evaluado` = c("Normalidad (Shapiro-Wilk)", "Homocedasticidad (Bartlett)"),
  `Estadístico` = round(c(shapiro_test$statistic, bartlett_test$statistic), 3),
  `Valor p` = round(c(shapiro_test$p.value, bartlett_test$p.value), 4),
  `Conclusión` = c(
    ifelse(shapiro_test$p.value > 0.05, "Cumple supuesto (p > 0.05)", "No cumple"),
    ifelse(bartlett_test$p.value > 0.05, "Cumple supuesto (p > 0.05)", "No cumple")
  ),
  check.names = FALSE
)

#Prueba LSD de Fisher
lsd_res <- LSD.test(modelo_anova, "Habitat", p.adj = "none")
tabla_lsd <- data.frame(
  `Tipo de Hábitat` = rownames(lsd_res$groups),
  `Shannon Promedio` = round(lsd_res$groups$Shannon, 2),
  `Grupo Significación` = lsd_res$groups$groups,
  check.names = FALSE
)

1. Tabla del Análisis de Varianza (ANOVA)

kable(tabla_anova, align = "c")
Fuente de Variación GL Suma Cuadrados Cuadrado Medio F Calculado Valor p
Tipo de Hábitat 3 14.86 4.95 60.61 2.38e-16
Residuales 48 3.92 0.08 - -

2. Verificación de Supuestos Estadísticos

kable(tabla_supuestos, align = "c")
Supuesto Evaluado Estadístico Valor p Conclusión
W Normalidad (Shapiro-Wilk) 0.978 0.4625 Cumple supuesto (p > 0.05)
Bartlett’s K-squared Homocedasticidad (Bartlett) 4.111 0.2497 Cumple supuesto (p > 0.05)
par(mfrow = c(1, 2))
plot(modelo_anova, which = 1, main = "Homocedasticidad", caption = "")
plot(modelo_anova, which = 2, main = "Normalidad (Q-Q Plot)", caption = "")

par(mfrow = c(1, 1))

3. Prueba de Comparación Múltiple (LSD de Fisher)

kable(tabla_lsd, align = "c")
Tipo de Hábitat Shannon Promedio Grupo Significación
Bosque primario 2.47 a
Bosque secundario 1.97 b
Sistema silvopastoril 1.60 c
Potrero 1.00 d

Interpretación de Resultados

Evaluación del Análisis de Varianza (ANOVA): La fuente de variación Tipo de Hábitat registró una Suma de Cuadrados de 14.86 con 3 grados de libertad, un Cuadrado Medio de 4.95, frente a un Cuadrado Medio residual de 0.08 (48 grados de libertad). El estadístico F calculado fue de 60.61, con un valor p < 0.001. Dado que el valor p es considerablemente inferior a 0.05, se rechaza la hipótesis nula de igualdad de medias, concluyendo que el tipo de hábitat tiene un efecto altamente significativo sobre el índice de diversidad de Shannon.

Diagnóstico de Supuestos Estadísticos del Modelo:

Normalidad: la prueba de Shapiro-Wilk arrojó un estadístico W = 0.979 con un valor p = 0.4625. Como p > 0.05, no se rechaza la hipótesis de normalidad, concluyendo que los residuales del modelo se distribuyen normalmente. Esto se confirma visualmente en el gráfico Q-Q, donde los puntos se ajustan de forma cercana a la línea teórica.

Homocedasticidad: la prueba de Bartlett arrojó un estadístico K² = 4.111 con un valor p = 0.2497. Como p > 0.05, no se rechaza la hipótesis de igualdad de varianzas entre los grupos, por lo que se cumple el supuesto de homocedasticidad, lo cual también es coherente con la dispersión relativamente uniforme observada en el gráfico de Residuales vs. Ajustados.

Comparación Múltiple de Medias (Prueba LSD de Fisher): Al cumplirse los supuestos y ser significativo el ANOVA, se aplicó la prueba LSD de Fisher (α = 0.05), obteniéndose cuatro grupos de significación, uno por cada hábitat:

Bosque primario: presentó el mayor índice de Shannon promedio, 2.47, ubicándose en el grupo a.

Bosque secundario: alcanzó un valor promedio de 1.97, clasificándose en el grupo b.

Sistema silvopastoril: registró un promedio de 1.60, formando el grupo c.

Potrero: presentó el menor índice de Shannon promedio, 1.00, formando el grupo d.

Al obtener los cuatro hábitats letras distintas, se concluye que todos difieren estadísticamente entre sí en su diversidad de Shannon, evidenciándose un gradiente descendente de diversidad a medida que el hábitat pasa de bosque primario a potrero, es decir, a medida que aumenta la intervención humana sobre el ecosistema.

¿Por qué se eligieron estas pruebas?

Prueba de Shapiro-Wilk (normalidad): se aplicó sobre los residuales del modelo (y no sobre la variable Shannon directamente) porque el supuesto de normalidad del ANOVA es sobre los errores del modelo, no sobre la variable de respuesta en bruto. Shapiro-Wilk se eligió por ser una de las pruebas más potentes para detectar desviaciones de la normalidad en muestras pequeñas o moderadas (aquí n = 52, con 13 datos por grupo), superando en potencia a alternativas como Kolmogorov-Smirnov en este rango de tamaño muestral.

Prueba de Bartlett (homocedasticidad): se usó para verificar que la varianza del índice de Shannon fuera similar entre los cuatro hábitats, supuesto necesario para que los errores estándar y el estadístico F del ANOVA sean válidos. Bartlett es la prueba clásica recomendada para este supuesto cuando ya se verificó que los datos (residuales) son razonablemente normales, como ocurrió aquí (Shapiro p = 0.4625); en caso de no cumplirse la normalidad, hubiera sido más apropiado usar la prueba de Levene, que es más robusta a desviaciones de la normalidad pero menos potente cuando esta sí se cumple.

Prueba LSD de Fisher (comparación múltiple): al ser significativo el ANOVA (p < 0.001), se sabe que existe al menos una diferencia entre los hábitats, pero no cuál o cuáles pares difieren entre sí; para eso se requiere una prueba de comparación múltiple post-hoc. Se eligió LSD de Fisher porque, al haber solo cuatro grupos y haberse cumplido tanto la normalidad como la homocedasticidad, es una prueba adecuada, sencilla de interpretar y con buena potencia estadística para detectar diferencias reales entre pares de medias; su principal limitación es que no ajusta el nivel de significancia por el número de comparaciones realizadas (a diferencia de pruebas más conservadoras como Tukey o Bonferroni), por lo que es recomendable únicamente después de confirmar un resultado global significativo en el ANOVA, tal como se hizo en este caso.