datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")
# Se eliminó el agrupamiento 'Otros' para incluir todas las regiones del dataset
tabla_freq <- datos_originales %>%
select(Region) %>%
filter(!is.na(Region)) %>%
mutate(Categoria = as.character(Region)) %>%
count(Categoria) %>%
mutate(
hi = n / sum(n),
porcentaje = hi * 100,
Fi_ac = cumsum(n),
hi_ac = cumsum(hi)
) %>%
arrange(desc(n))
La variable REGION registra la región administrativa donde se ubica el pozo. En este análisis se consideran la totalidad de las regiones registradas en la base de datos oficial.
| Criterio | Descripción_Técnica |
|---|---|
| Variable | Region (Región) |
| Tipo | Cualitativa |
| Subtipo | Nominal |
| Dominio | D = {x : x es el número de una región} |
| Rango | R = {x : x ∈ regiones registradas} |
| Unidad de medida | No aplica |
| Escala | Nominal |
| Fuente | Oil, Gas & Other Regulated Wells - NY State |
tabla_formato <- tabla_freq %>%
select(Categoria, n, porcentaje, hi) %>%
rename(
'Región' = Categoria,
'Frecuencia (ni)' = n,
'Porcentaje (hi %)' = porcentaje,
'Porcentaje en fracción (hi)' = hi
)
total_fila <- data.frame(
'Región' = "TOTAL",
'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
check.names = FALSE # Esto es clave para evitar que R cambie los nombres
)
tabla_final <- rbind(tabla_formato, total_fila)
tabla_final %>%
mutate(
`Porcentaje (hi %)` = ifelse(`Región` == "TOTAL",
paste0(round(`Porcentaje (hi %)`, 2), "%"),
paste0(round(`Porcentaje (hi %)`, 2), "%")),
`Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
) %>%
kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Región", align = "lccc") %>%
kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
row_spec(0, bold = T, background = "#BDC5C8") %>%
row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
| Región | Frecuencia (ni) | Porcentaje (hi %) | Porcentaje en fracción (hi) |
|---|---|---|---|
| 9 | 39894 | 84.21% | 0.8421 |
| 8 | 5206 | 10.99% | 0.1099 |
| 7 | 1684 | 3.55% | 0.0355 |
| 2 | 247 | 0.52% | 0.0052 |
| 6 | 114 | 0.24% | 0.0024 |
| 3 | 112 | 0.24% | 0.0024 |
| 4 | 96 | 0.2% | 0.0020 |
| 5 | 19 | 0.04% | 0.0004 |
| 1 | 4 | 0.01% | 0.0001 |
| TOTAL | 47376 | 100% | 1.0000 |
tema_limpio <- theme_minimal() +
theme(
panel.grid.major.x = element_blank(),
panel.grid.minor.x = element_blank(),
axis.text.x = element_text(angle = 0, hjust = 1)
)
colores_usados <- colorRampPalette(paleta_colores)(nrow(tabla_freq))
ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
geom_col() + scale_fill_manual(values = colores_usados) +
geom_text(aes(label = n), vjust = -0.5, size = 3) +
tema_limpio + labs(title = "Gráfica N°1: Diagrama de Barras (Frecuencia Absoluta)", x = "Región", y = "Frecuencia Absoluta (Fi)")
ggplot(tabla_freq, aes(x = reorder(Categoria, -porcentaje), y = porcentaje, fill = Categoria)) +
geom_col() + scale_fill_manual(values = colores_usados) +
geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
tema_limpio + labs(title = "Gráfica N°2: Diagrama de Barras (Porcentajes)", x = "Región", y = "Porcentajes (%)")
tabla_freq_legenda <- tabla_freq %>%
mutate(etiqueta_legenda = paste0(Categoria, " (", round(porcentaje, 1), "%)"))
ggplot(tabla_freq_legenda, aes(x = "", y = porcentaje, fill = etiqueta_legenda)) +
geom_col() + coord_polar("y") +
scale_fill_manual(values = colores_usados) +
theme_void() +
labs(title = "Gráfica N°3: Distribución Porcentual", fill = "Región") +
theme(legend.position = "right")
moda <- tabla_freq$Categoria[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- max(tabla_freq$porcentaje)
total_muestral <- sum(tabla_freq$n)
indicadores <- data.frame(
Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)
indicadores %>%
kable(caption = "Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Región, pozos registrados, NY, EE.UU.", align = "lc") %>%
kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
| Indicador | Valor |
|---|---|
| Tamaño muestral (n) | 47,376 |
| Número de categorías | 9 |
| Moda | 9 |
| Frecuencia de la moda | 39,894 |
| Porcentaje de la moda | 84.21% |
De un total de 47,376 pozos analizados, la variable Región se categorizó en 9 grupos distintos. La categoría dominante es 9 con 84.21%. Al ser una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza o desviación estándar.
Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State