Variable Original:
CH4 total emissions (tons) by state
Nombre Variable: EMIS_CH4
library(dplyr)
library(gt)
library(e1071)
datos <- read.csv("~/Estudio/TERCER SEMESTRE/Estadistica/Dataset.csv",
sep = ";", stringsAsFactors = FALSE)
NOTA: CH4 requiere corrección DOBLE (punto = separador de miles, coma = decimal), igual que NOx.
EMIS_CH4 <- as.numeric(gsub(",", ".", gsub("\\.", "", datos$CH4.total.emissions..tons..by.state)))
## Warning: NAs introducidos por coerción
EMIS_CH4 <- EMIS_CH4[!is.na(EMIS_CH4)]
n <- length(EMIS_CH4)
min_ch4 <- min(EMIS_CH4)
max_ch4 <- max(EMIS_CH4)
R <- max_ch4 - min_ch4
# Número de intervalos mediante la Regla de Sturges
k_detallado <- ceiling(1 + 3.322 * log10(n))
# Amplitud de clase
A <- round(R / k_detallado, 0)
cat("Número de intervalos (k):", k_detallado, "\n")
## Número de intervalos (k): 12
# Generación de límites de intervalo
Li <- seq(from = min_ch4, to = max_ch4 - A, by = A)
Ls <- c(seq(from = min_ch4 + A, to = max_ch4 - A, by = A), max_ch4)
# Marcas de clase (MC)
MC <- round((Li + Ls) / 2, 0)
# Frecuencias absolutas (ni)
ni <- numeric(length(Li))
for (i in 1:length(Li)) {
if (i < length(Li)) {
# Intervalo abierto por la derecha: [Li, Ls)
ni[i] <- sum(EMIS_CH4 >= Li[i] & EMIS_CH4 < Ls[i])
} else {
# Último intervalo cerrado: [Li, Ls]
ni[i] <- sum(EMIS_CH4 >= Li[i] & EMIS_CH4 <= Ls[i])
}
}
# Frecuencias relativas y acumuladas
hi <- (ni / n) * 100
Ni_asc <- cumsum(ni)
Ni_desc <- rev(cumsum(rev(ni)))
Hi_asc <- cumsum(hi)
Hi_desc <- rev(cumsum(rev(hi)))
# Formatear la columna Intervalo
Intervalo <- paste0("[", round(Li, 0), " - ", round(Ls, 0), ")")
Intervalo[length(Intervalo)] <- paste0("[", round(Li[length(Li)], 0), " - ",
round(Ls[length(Ls)], 0), "]")
# Vector completo de breaks (incluye el límite superior del último
# intervalo) para usar directamente en hist()
breaks_hist <- c(Li, max_ch4)
TDF_ch4 <- data.frame(
Intervalo = Intervalo,
MC = MC,
ni = ni,
hi = round(hi, 2),
Ni_ascendente = Ni_asc,
Ni_descendente = Ni_desc,
Hi_ascendente = round(Hi_asc, 2),
Hi_descendente = round(Hi_desc, 2)
)
totales <- data.frame(
Intervalo = "Totales", MC = "-", ni = sum(ni), hi = round(sum(hi), 2),
Ni_ascendente = "-", Ni_descendente = "-",
Hi_ascendente = "-", Hi_descendente = "-"
)
TDF_ch4_completa <- rbind(TDF_ch4, totales)
TDF_ch4_completa %>%
gt() %>%
tab_header(
title = md("Tabla Nro. 1"),
subtitle = md("Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4) para el análisis de la actividad minera y emisión de gases en Estados Unidos.")
) %>%
cols_align(align = "center", columns = everything()) %>%
tab_style(
style = cell_text(weight = "bold"),
locations = cells_body(rows = Intervalo == "Totales")
) %>%
tab_source_note(source_note = md("Autor: Luis Cruz"))
| Tabla Nro. 1 | |||||||
| Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4) para el análisis de la actividad minera y emisión de gases en Estados Unidos. | |||||||
| Intervalo | MC | ni | hi | Ni_ascendente | Ni_descendente | Hi_ascendente | Hi_descendente |
|---|---|---|---|---|---|---|---|
| [6055498 - 644285560) | 325170529 | 326 | 31.41 | 326 | 1038 | 31.41 | 100 |
| [644285560 - 1282515622) | 963400591 | 25 | 2.41 | 351 | 712 | 33.82 | 68.59 |
| [1282515622 - 1920745684) | 1601630653 | 0 | 0.00 | 351 | 687 | 33.82 | 66.18 |
| [1920745684 - 2558975746) | 2239860715 | 44 | 4.24 | 395 | 687 | 38.05 | 66.18 |
| [2558975746 - 3197205808) | 2878090777 | 154 | 14.84 | 549 | 643 | 52.89 | 61.95 |
| [3197205808 - 3835435870) | 3516320839 | 47 | 4.53 | 596 | 489 | 57.42 | 47.11 |
| [3835435870 - 4473665932) | 4154550901 | 0 | 0.00 | 596 | 442 | 57.42 | 42.58 |
| [4473665932 - 5111895994) | 4792780963 | 31 | 2.99 | 627 | 442 | 60.4 | 42.58 |
| [5111895994 - 5750126056) | 5431011025 | 0 | 0.00 | 627 | 411 | 60.4 | 39.6 |
| [5750126056 - 6388356118) | 6069241087 | 0 | 0.00 | 627 | 411 | 60.4 | 39.6 |
| [6388356118 - 7026586180) | 6707471149 | 0 | 0.00 | 627 | 411 | 60.4 | 39.6 |
| [7026586180 - 7664816242] | 7345701211 | 411 | 39.60 | 1038 | 411 | 100 | 39.6 |
| Totales | - | 1038 | 100.00 | - | - | - | - |
| Autor: Luis Cruz | |||||||
brks2 <- pretty(EMIS_CH4, n = 10)
Li2 <- brks2[-length(brks2)]
Ls2 <- brks2[-1]
MC2 <- (Li2 + Ls2) / 2
ni2 <- numeric(length(Li2))
for (i in 1:length(Li2)) {
if (i < length(Li2)) {
ni2[i] <- sum(EMIS_CH4 >= Li2[i] & EMIS_CH4 < Ls2[i])
} else {
ni2[i] <- sum(EMIS_CH4 >= Li2[i] & EMIS_CH4 <= Ls2[i])
}
}
hi2 <- (ni2 / n) * 100
Ni2_asc <- cumsum(ni2)
Ni2_desc <- rev(cumsum(rev(ni2)))
Hi2_asc <- cumsum(hi2)
Hi2_desc <- rev(cumsum(rev(hi2)))
Intervalo2 <- paste0("[", format(round(Li2, 0), big.mark = ","), " - ",
format(round(Ls2, 0), big.mark = ","), ")")
Intervalo2[length(Intervalo2)] <- paste0(
"[", format(round(Li2[length(Li2)], 0), big.mark = ","), " - ",
format(round(Ls2[length(Ls2)], 0), big.mark = ","), "]")
TDF_ch4_10 <- data.frame(
Intervalo = Intervalo2,
MC = round(MC2, 0),
ni = ni2,
hi = round(hi2, 2),
Ni_ascendente = Ni2_asc,
Ni_descendente = Ni2_desc,
Hi_ascendente = round(Hi2_asc, 2),
Hi_descendente = round(Hi2_desc, 2)
)
totales2 <- data.frame(
Intervalo = "Totales", MC = "-", ni = sum(ni2), hi = round(sum(hi2), 2),
Ni_ascendente = "-", Ni_descendente = "-",
Hi_ascendente = "-", Hi_descendente = "-"
)
TDF_ch4_10_completa <- rbind(TDF_ch4_10, totales2)
TDF_ch4_10_completa %>%
gt() %>%
tab_header(
title = md("Tabla Nro. 2"),
subtitle = md("Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4), intervalos reducidos.")
) %>%
cols_align(align = "center", columns = everything()) %>%
tab_style(
style = cell_text(weight = "bold"),
locations = cells_body(rows = Intervalo == "Totales")
) %>%
tab_source_note(source_note = md("Autor: Luis Cruz"))
| Tabla Nro. 2 | |||||||
| Distribución de frecuencia de Emisiones de CH4 (EMIS_CH4), intervalos reducidos. | |||||||
| Intervalo | MC | ni | hi | Ni_ascendente | Ni_descendente | Hi_ascendente | Hi_descendente |
|---|---|---|---|---|---|---|---|
| [0e+00 - 1e+09) | 5e+08 | 333 | 32.08 | 333 | 1038 | 32.08 | 100 |
| [1e+09 - 2e+09) | 1.5e+09 | 18 | 1.73 | 351 | 705 | 33.82 | 67.92 |
| [2e+09 - 3e+09) | 2.5e+09 | 44 | 4.24 | 395 | 687 | 38.05 | 66.18 |
| [3e+09 - 4e+09) | 3.5e+09 | 201 | 19.36 | 596 | 643 | 57.42 | 61.95 |
| [4e+09 - 5e+09) | 4.5e+09 | 31 | 2.99 | 627 | 442 | 60.4 | 42.58 |
| [5e+09 - 6e+09) | 5.5e+09 | 0 | 0.00 | 627 | 411 | 60.4 | 39.6 |
| [6e+09 - 7e+09) | 6.5e+09 | 0 | 0.00 | 627 | 411 | 60.4 | 39.6 |
| [7e+09 - 8e+09] | 7.5e+09 | 411 | 39.60 | 1038 | 411 | 100 | 39.6 |
| Totales | - | 1038 | 100.00 | - | - | - | - |
| Autor: Luis Cruz | |||||||
Histograma general
par(mar = c(5, 5, 4, 2))
hist(EMIS_CH4, breaks = breaks_hist,
main = "Gráfica Nro. 1\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
col = "#70AD47", border = "white",
cex.main = 0.9)
Histograma con relación al todo
par(mar = c(5, 5, 4, 2))
hist(EMIS_CH4, breaks = breaks_hist,
main = "Gráfica Nro. 2\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
col = "#70AD47", border = "white",
ylim = c(0, n),
cex.main = 0.9)
Histograma porcentual general
par(mar = c(5, 5, 4, 2))
barplot(hi2,
names.arg = round(MC2, 0),
main = "Gráfica Nro. 3\nDistribución porcentual de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
col = "#C5E0A8", border = "black",
las = 2, cex.names = 0.7,
ylim = c(0, max(hi2) + 5))
Histograma porcentual con relación al todo
par(mar = c(5, 5, 4, 2))
barplot(hi2,
names.arg = round(MC2, 0),
main = "Gráfica Nro. 4\nDistribución porcentual de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
col = "#C5E0A8", border = "black",
las = 2, cex.names = 0.7,
ylim = c(0, 100))
options(scipen = 999)
boxplot(EMIS_CH4,
horizontal = TRUE,
main = "Gráfica Nro. 5\nDistribución de EMIS_CH4 en instalaciones\nmineras de Estados Unidos",
xlab = "Emisiones de CH4 (toneladas)",
col = "#C5E0A8",
border = "#375623",
pch = 1)
par(mar = c(5, 5, 4, 2))
plot(MC2, Ni2_asc,
type = "b", pch = 16, lwd = 2, col = "#70AD47",
main = "Gráfica Nro. 6\nOjiva ascendente y descendente de\nEMIS_CH4",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Cantidad",
ylim = c(0, n))
lines(MC2, Ni2_desc, type = "b", pch = 16, lwd = 1, col = "black")
legend("right", legend = c("Ascendente","Descendente"),
col = c("#70AD47","black"), lwd = 2, pch = 16, bty = "n", cex = 0.8)
grid()
box()
par(mar = c(5, 5, 4, 2))
plot(MC2, Hi2_asc,
type = "b", pch = 16, lwd = 2, col = "#70AD47",
main = "Gráfica Nro. 7\nOjiva porcentual ascendente y descendente de\nEMIS_CH4",
xlab = "Emisiones de CH4 (toneladas)", ylab = "Porcentaje (%)",
ylim = c(0, 100))
lines(MC2, Hi2_desc, type = "b", pch = 16, lwd = 1, col = "black")
legend("right", legend = c("Ascendente","Descendente"),
col = c("#70AD47","black"), lwd = 2, pch = 16, bty = "n", cex = 0.8)
grid()
box()
X <- mean(EMIS_CH4)
Me <- median(EMIS_CH4)
# Moda: marca de clase del intervalo con mayor ni (tabla reducida)
moda_idx <- which.max(ni2)
Mo <- round(MC2[moda_idx], 0)
desv <- sd(EMIS_CH4)
V <- var(EMIS_CH4)
CV <- round((desv / X) * 100, 2)
As <- skewness(EMIS_CH4, type = 2)
K <- kurtosis(EMIS_CH4, type = 2)
# Outliers (regla de Tukey, 1.5*IQR) — se usan en la conclusión
q1 <- quantile(EMIS_CH4, 0.25)
q3 <- quantile(EMIS_CH4, 0.75)
iqr_val <- q3 - q1
lim_inf <- q1 - 1.5 * iqr_val
lim_sup <- q3 + 1.5 * iqr_val
outliers <- EMIS_CH4[EMIS_CH4 < lim_inf | EMIS_CH4 > lim_sup]
n_outliers <- length(outliers)
porc_outliers <- round(n_outliers / n * 100, 2)
Tabla_indicadores <- data.frame(
Variable = "EMIS_CH4",
Rango = paste0("[", round(min_ch4, 0), " - ", round(max_ch4, 0), "]"),
Media = round(X, 0),
Mediana = round(Me, 0),
Moda = Mo,
DesvEst = round(desv, 0),
CV = CV,
Asimetria = round(As, 4),
Curtosis = round(K, 4)
)
Tabla_indicadores %>%
gt() %>%
cols_label(
Variable = "Variable", Rango = "Rango",
Media = "Media (X)", Mediana = "Mediana (Me)", Moda = "Moda (Mo)",
DesvEst = "Desv. Est. (sd)", CV = "CV (%)",
Asimetria = "Asimetría (As)", Curtosis = "Curtosis (K)"
) %>%
tab_header(
title = md("Tabla Nro. 3"),
subtitle = md("Indicadores Estadísticos de EMIS_CH4 para el análisis de la actividad minera y emisión de gases en Estados Unidos.")
) %>%
tab_spanner(label = "Tendencia Central", columns = c(Media, Mediana, Moda)) %>%
tab_spanner(label = "Dispersión", columns = c(DesvEst, CV)) %>%
tab_spanner(label = "Forma", columns = c(Asimetria, Curtosis)) %>%
cols_align(align = "center", columns = everything()) %>%
tab_source_note(source_note = md("Autor: Luis Cruz"))
| Tabla Nro. 3 | ||||||||
| Indicadores Estadísticos de EMIS_CH4 para el análisis de la actividad minera y emisión de gases en Estados Unidos. | ||||||||
| Variable | Rango |
Tendencia Central
|
Dispersión
|
Forma
|
||||
|---|---|---|---|---|---|---|---|---|
| Media (X) | Mediana (Me) | Moda (Mo) | Desv. Est. (sd) | CV (%) | Asimetría (As) | Curtosis (K) | ||
| EMIS_CH4 | [6055498 - 7664816242] | 3979431764 | 3003562806 | 7500000000 | 3184210998 | 80.02 | 0.1 | -1.7055 |
| Autor: Luis Cruz | ||||||||
En conclusión:
La variable EMIS_CH4 fluctúa entre un mínimo de 6055498 y un máximo de 7664816242 toneladas, con una media de 3979431764 y una desviación estándar de 3184210998. Debido a un coeficiente de variación del 80.02%, se concluye que es un conjunto de valores altamente heterogéneo entre estados, con una distribución de asimetría positiva (0.1). Se han detectado 0 valores atípicos (0% del total), correspondientes principalmente a estados con mayor densidad de minas de carbón subterráneas.