Variable Original: CH4 total emissions (tons) by state

Nombre Variable: EMIS_CH4

Tipo: Cuantitativa Continua

0.- Carga de Librerías

library(dplyr)
library(gt)
library(e1071)

1.- Carga de Datos

datos <- read.csv("~/Estudio/TERCER SEMESTRE/Estadistica/Dataset.csv",
                   sep = ";", stringsAsFactors = FALSE)

2.- Selección de variable

NOTA: CH4 requiere corrección DOBLE (punto = separador de miles, coma = decimal), igual que NOx.

EMIS_CH4 <- as.numeric(gsub(",", ".", gsub("\\.", "", datos$CH4.total.emissions..tons..by.state)))
## Warning: NAs introducidos por coerción
EMIS_CH4 <- EMIS_CH4[!is.na(EMIS_CH4)]
n <- length(EMIS_CH4)

3.- Frecuencia

min_ch4 <- min(EMIS_CH4)
max_ch4 <- max(EMIS_CH4)
R <- max_ch4 - min_ch4

# Número de intervalos mediante la Regla de Sturges
k_detallado <- ceiling(1 + 3.322 * log10(n))

# Amplitud de clase
A <- round(R / k_detallado, 0)

cat("Número de intervalos (k):", k_detallado, "\n")
## Número de intervalos (k): 12
# Generación de límites de intervalo
Li <- seq(from = min_ch4, to = max_ch4 - A, by = A)
Ls <- c(seq(from = min_ch4 + A, to = max_ch4 - A, by = A), max_ch4)

# Marcas de clase (MC)
MC <- round((Li + Ls) / 2, 0)

# Frecuencias absolutas (ni)
ni <- numeric(length(Li))
for (i in 1:length(Li)) {
  if (i < length(Li)) {
    # Intervalo abierto por la derecha: [Li, Ls)
    ni[i] <- sum(EMIS_CH4 >= Li[i] & EMIS_CH4 < Ls[i])
  } else {
    # Último intervalo cerrado: [Li, Ls]
    ni[i] <- sum(EMIS_CH4 >= Li[i] & EMIS_CH4 <= Ls[i])
  }
}

# Frecuencias relativas y acumuladas
hi <- (ni / n) * 100
Ni_asc  <- cumsum(ni)
Ni_desc <- rev(cumsum(rev(ni)))
Hi_asc  <- cumsum(hi)
Hi_desc <- rev(cumsum(rev(hi)))

# Formatear la columna Intervalo
Intervalo <- paste0("[", round(Li, 0), " - ", round(Ls, 0), ")")
Intervalo[length(Intervalo)] <- paste0("[", round(Li[length(Li)], 0), " - ",
                                        round(Ls[length(Ls)], 0), "]")

# Vector completo de breaks (incluye el límite superior del último
# intervalo) para usar directamente en hist()
breaks_hist <- c(Li, max_ch4)

4.- Tabla de distribución de frecuencia

Tabla con regla de Sturges

TDF_ch4 <- data.frame(
  Intervalo = Intervalo,
  MC = MC,
  ni = ni,
  hi = round(hi, 2),
  Ni_ascendente = Ni_asc,
  Ni_descendente = Ni_desc,
  Hi_ascendente = round(Hi_asc, 2),
  Hi_descendente = round(Hi_desc, 2)
)

totales <- data.frame(
  Intervalo = "Totales", MC = "-", ni = sum(ni), hi = round(sum(hi), 2),
  Ni_ascendente = "-", Ni_descendente = "-",
  Hi_ascendente = "-", Hi_descendente = "-"
)

TDF_ch4_completa <- rbind(TDF_ch4, totales)

TDF_ch4_completa %>%
  gt() %>%
  tab_header(
    title    = md("Tabla Nro. 1"),
    subtitle = md("Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4) para el análisis de la actividad minera y emisión de gases en Estados Unidos.")
  ) %>%
  cols_align(align = "center", columns = everything()) %>%
  tab_style(
    style = cell_text(weight = "bold"),
    locations = cells_body(rows = Intervalo == "Totales")
  ) %>%
  tab_source_note(source_note = md("Autor: Luis Cruz"))
Tabla Nro. 1
Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4) para el análisis de la actividad minera y emisión de gases en Estados Unidos.
Intervalo MC ni hi Ni_ascendente Ni_descendente Hi_ascendente Hi_descendente
[6055498 - 644285560) 325170529 326 31.41 326 1038 31.41 100
[644285560 - 1282515622) 963400591 25 2.41 351 712 33.82 68.59
[1282515622 - 1920745684) 1601630653 0 0.00 351 687 33.82 66.18
[1920745684 - 2558975746) 2239860715 44 4.24 395 687 38.05 66.18
[2558975746 - 3197205808) 2878090777 154 14.84 549 643 52.89 61.95
[3197205808 - 3835435870) 3516320839 47 4.53 596 489 57.42 47.11
[3835435870 - 4473665932) 4154550901 0 0.00 596 442 57.42 42.58
[4473665932 - 5111895994) 4792780963 31 2.99 627 442 60.4 42.58
[5111895994 - 5750126056) 5431011025 0 0.00 627 411 60.4 39.6
[5750126056 - 6388356118) 6069241087 0 0.00 627 411 60.4 39.6
[6388356118 - 7026586180) 6707471149 0 0.00 627 411 60.4 39.6
[7026586180 - 7664816242] 7345701211 411 39.60 1038 411 100 39.6
Totales - 1038 100.00 - - - -
Autor: Luis Cruz

Tabla de intervalos reducidos

brks2 <- pretty(EMIS_CH4, n = 10)
Li2   <- brks2[-length(brks2)]
Ls2   <- brks2[-1]
MC2   <- (Li2 + Ls2) / 2

ni2 <- numeric(length(Li2))
for (i in 1:length(Li2)) {
  if (i < length(Li2)) {
    ni2[i] <- sum(EMIS_CH4 >= Li2[i] & EMIS_CH4 < Ls2[i])
  } else {
    ni2[i] <- sum(EMIS_CH4 >= Li2[i] & EMIS_CH4 <= Ls2[i])
  }
}

hi2      <- (ni2 / n) * 100
Ni2_asc  <- cumsum(ni2)
Ni2_desc <- rev(cumsum(rev(ni2)))
Hi2_asc  <- cumsum(hi2)
Hi2_desc <- rev(cumsum(rev(hi2)))

Intervalo2 <- paste0("[", format(round(Li2, 0), big.mark = ","), " - ",
                          format(round(Ls2, 0), big.mark = ","), ")")
Intervalo2[length(Intervalo2)] <- paste0(
  "[", format(round(Li2[length(Li2)], 0), big.mark = ","), " - ",
       format(round(Ls2[length(Ls2)], 0), big.mark = ","), "]")

TDF_ch4_10 <- data.frame(
  Intervalo = Intervalo2,
  MC = round(MC2, 0),
  ni = ni2,
  hi = round(hi2, 2),
  Ni_ascendente = Ni2_asc,
  Ni_descendente = Ni2_desc,
  Hi_ascendente = round(Hi2_asc, 2),
  Hi_descendente = round(Hi2_desc, 2)
)

totales2 <- data.frame(
  Intervalo = "Totales", MC = "-", ni = sum(ni2), hi = round(sum(hi2), 2),
  Ni_ascendente = "-", Ni_descendente = "-",
  Hi_ascendente = "-", Hi_descendente = "-"
)

TDF_ch4_10_completa <- rbind(TDF_ch4_10, totales2)

TDF_ch4_10_completa %>%
  gt() %>%
  tab_header(
    title    = md("Tabla Nro. 2"),
    subtitle = md("Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4), intervalos reducidos.")
  ) %>%
  cols_align(align = "center", columns = everything()) %>%
  tab_style(
    style = cell_text(weight = "bold"),
    locations = cells_body(rows = Intervalo == "Totales")
  ) %>%
  tab_source_note(source_note = md("Autor: Luis Cruz"))
Tabla Nro. 2
Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4), intervalos reducidos.
Intervalo MC ni hi Ni_ascendente Ni_descendente Hi_ascendente Hi_descendente
[0e+00 - 1e+09) 5e+08 333 32.08 333 1038 32.08 100
[1e+09 - 2e+09) 1.5e+09 18 1.73 351 705 33.82 67.92
[2e+09 - 3e+09) 2.5e+09 44 4.24 395 687 38.05 66.18
[3e+09 - 4e+09) 3.5e+09 201 19.36 596 643 57.42 61.95
[4e+09 - 5e+09) 4.5e+09 31 2.99 627 442 60.4 42.58
[5e+09 - 6e+09) 5.5e+09 0 0.00 627 411 60.4 39.6
[6e+09 - 7e+09) 6.5e+09 0 0.00 627 411 60.4 39.6
[7e+09 - 8e+09] 7.5e+09 411 39.60 1038 411 100 39.6
Totales - 1038 100.00 - - - -
Autor: Luis Cruz

5.- Gráficos de distribución de frecuencia

Histogramas de cantidad

Histograma general

par(mar = c(5, 5, 4, 2))
hist(EMIS_CH4, breaks = breaks_hist,
     main = "Gráfica Nro. 1\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
     xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
     col = "#70AD47", border = "white",
     cex.main = 0.9)

Histograma con relación al todo

par(mar = c(5, 5, 4, 2))
hist(EMIS_CH4, breaks = breaks_hist,
     main = "Gráfica Nro. 2\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
     xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
     col = "#70AD47", border = "white",
     ylim = c(0, n),
     cex.main = 0.9)

Histogramas Porcentuales

Histograma porcentual general

par(mar = c(5, 5, 4, 2))
barplot(hi2,
        names.arg = round(MC2, 0),
        main = "Gráfica Nro. 3\nDistribución porcentual de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
        xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
        col = "#C5E0A8", border = "black",
        las = 2, cex.names = 0.7,
        ylim = c(0, max(hi2) + 5))

Histograma porcentual con relación al todo

par(mar = c(5, 5, 4, 2))
barplot(hi2,
        names.arg = round(MC2, 0),
        main = "Gráfica Nro. 4\nDistribución porcentual de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
        xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
        col = "#C5E0A8", border = "black",
        las = 2, cex.names = 0.7,
        ylim = c(0, 100))

Diagrama de caja y bigotes

options(scipen = 999)
boxplot(EMIS_CH4,
        horizontal = TRUE,
        main = "Gráfica Nro. 5\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
        xlab = "Emisiones de CH4 (toneladas)",
        col = "#C5E0A8",
        border = "#375623",
        pch = 1)

Diagrama de Ojivas

par(mar = c(5, 5, 4, 2))
plot(MC2, Ni2_asc,
     type = "b", pch = 16, lwd = 2, col = "#70AD47",
     main = "Gráfica Nro. 6\nOjiva ascendente y descendente de\nEMIS_CH4",
     xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
     ylim = c(0, n))
lines(MC2, Ni2_desc, type = "b", pch = 16, lwd = 1, col = "black")
legend("right", legend = c("Ascendente","Descendente"),
       col = c("#70AD47","black"), lwd = 2, pch = 16, bty = "n", cex = 0.8)
grid()
box()

par(mar = c(5, 5, 4, 2))
plot(MC2, Hi2_asc,
     type = "b", pch = 16, lwd = 2, col = "#70AD47",
     main = "Gráfica Nro. 7\nOjiva porcentual ascendente y descendente de\nEMIS_CH4",
     xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
     ylim = c(0, 100))
lines(MC2, Hi2_desc, type = "b", pch = 16, lwd = 1, col = "black")
legend("right", legend = c("Ascendente","Descendente"),
       col = c("#70AD47","black"), lwd = 2, pch = 16, bty = "n", cex = 0.8)
grid()
box()

6.- Indicadores Estadísticos

X  <- mean(EMIS_CH4)
Me <- median(EMIS_CH4)

# Moda: marca de clase del intervalo con mayor ni (tabla reducida)
moda_idx <- which.max(ni2)
Mo <- round(MC2[moda_idx], 0)

desv <- sd(EMIS_CH4)
V    <- var(EMIS_CH4)
CV   <- round((desv / X) * 100, 2)

As <- skewness(EMIS_CH4, type = 2)
K  <- kurtosis(EMIS_CH4, type = 2)

# Outliers (regla de Tukey, 1.5*IQR) — se usan en la conclusión
q1 <- quantile(EMIS_CH4, 0.25)
q3 <- quantile(EMIS_CH4, 0.75)
iqr_val <- q3 - q1
lim_inf <- q1 - 1.5 * iqr_val
lim_sup <- q3 + 1.5 * iqr_val
outliers <- EMIS_CH4[EMIS_CH4 < lim_inf | EMIS_CH4 > lim_sup]
n_outliers <- length(outliers)
porc_outliers <- round(n_outliers / n * 100, 2)

Tabla_indicadores <- data.frame(
  Variable = "EMIS_CH4",
  Rango    = paste0("[", round(min_ch4, 0), " - ", round(max_ch4, 0), "]"),
  Media    = round(X, 0),
  Mediana  = round(Me, 0),
  Moda     = Mo,
  DesvEst  = round(desv, 0),
  CV       = CV,
  Asimetria = round(As, 4),
  Curtosis  = round(K, 4)
)

Tabla_indicadores %>%
  gt() %>%
  cols_label(
    Variable = "Variable", Rango = "Rango",
    Media = "Media (X)", Mediana = "Mediana (Me)", Moda = "Moda (Mo)",
    DesvEst = "Desv. Est. (sd)", CV = "CV (%)",
    Asimetria = "Asimetría (As)", Curtosis = "Curtosis (K)"
  ) %>%
  tab_header(
    title    = md("Tabla Nro. 3"),
    subtitle = md("Indicadores Estadísticos de EMIS_CH4 para el análisis de la actividad minera y emisión de gases en Estados Unidos.")
  ) %>%
  tab_spanner(label = "Tendencia Central", columns = c(Media, Mediana, Moda)) %>%
  tab_spanner(label = "Dispersión", columns = c(DesvEst, CV)) %>%
  tab_spanner(label = "Forma", columns = c(Asimetria, Curtosis)) %>%
  cols_align(align = "center", columns = everything()) %>%
  tab_source_note(source_note = md("Autor: Luis Cruz"))
Tabla Nro. 3
Indicadores Estadísticos de EMIS_CH4 para el análisis de la actividad minera y emisión de gases en Estados Unidos.
Variable Rango
Tendencia Central
Dispersión
Forma
Media (X) Mediana (Me) Moda (Mo) Desv. Est. (sd) CV (%) Asimetría (As) Curtosis (K)
EMIS_CH4 [6055498 - 7664816242] 3979431764 3003562806 7500000000 3184210998 80.02 0.1 -1.7055
Autor: Luis Cruz

7.- Conclusión

En conclusión:

La variable EMIS_CH4 fluctúa entre un mínimo de 6055498 y un máximo de 7664816242 toneladas, con una media de 3979431764 y una desviación estándar de 3184210998. Debido a un coeficiente de variación del 80.02%, se concluye que es un conjunto de valores altamente heterogéneo entre estados, con una distribución de asimetría positiva (0.1). Se han detectado 0 valores atípicos (0% del total), correspondientes principalmente a estados con mayor densidad de minas de carbón subterráneas.