datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")
df_clean <- datos_originales %>%
select(County) %>%
filter(!is.na(County)) %>%
mutate(County = as.character(County))
top_8 <- df_clean %>% count(County, sort = TRUE) %>% head(8) %>% pull(County)
tabla_freq <- df_clean %>%
mutate(Categoria = ifelse(County %in% top_8, County, "Otros")) %>%
count(Categoria) %>%
mutate(
hi = n / sum(n),
porcentaje = hi * 100,
Fi_ac = cumsum(n),
hi_ac = cumsum(hi)
) %>%
arrange(desc(n))
La variable COUNTY registra el condado donde se ubica el pozo. Debido a la alta cantidad de categorías en la variable, aquellas que no se encuentran entre las 8 más frecuentes se agruparán en la categoría ‘Otros’ para optimizar la representación gráfica y el análisis de tendencias principales.
| Criterio | Descripción_Técnica |
|---|---|
| Variable | Condado (County) |
| Tipo | Cualitativa |
| Subtipo | Nominal |
| Dominio | D = {x : x es el nombre de un condado} |
| Rango | R = {x : x pertenece a condados registrados} |
| Unidad de medida | No aplica |
| Escala | Nominal |
| Fuente | Oil, Gas & Other Regulated Wells - NY State |
tabla_formato <- tabla_freq %>%
rename('Condado' = Categoria, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje,
'Porcentaje en fracción (hi)' = hi, 'Frec. Abs. Acumulada (Fi_ac)' = Fi_ac,
'Frec. Rel. Acumulada (hi_ac)' = hi_ac)
kable(tabla_formato, caption = "Tabla 2. Distribución de Frecuencias de Pozos por Condado", digits = 4, align = "c") %>%
kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
| Condado | Frecuencia (ni) | Porcentaje en fracción (hi) | Porcentaje (hi %) | Frec. Abs. Acumulada (Fi_ac) | Frec. Rel. Acumulada (hi_ac) |
|---|---|---|---|---|---|
| Allegany | 16397 | 0.3462 | 34.6220 | 16397 | 0.3462 |
| Cattaraugus | 11951 | 0.2523 | 25.2344 | 28348 | 0.5986 |
| Chautauqua | 6367 | 0.1344 | 13.4438 | 34715 | 0.7330 |
| Otros | 4473 | 0.0944 | 9.4447 | 43551 | 0.9196 |
| Erie | 3483 | 0.0735 | 7.3543 | 38198 | 0.8065 |
| Steuben | 2067 | 0.0436 | 4.3644 | 46211 | 0.9757 |
| Wyoming | 1149 | 0.0243 | 2.4261 | 47360 | 1.0000 |
| Genesee | 880 | 0.0186 | 1.8581 | 39078 | 0.8251 |
| Statewide | 593 | 0.0125 | 1.2521 | 44144 | 0.9321 |
tema_limpio <- theme_minimal() +
theme(
panel.grid.major.x = element_blank(),
panel.grid.minor.x = element_blank(),
axis.text.x = element_text(angle = 45, hjust = 1)
)
colores_usados <- colorRampPalette(paleta_colores)(nrow(tabla_freq))
ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
geom_col() + scale_fill_manual(values = colores_usados) +
geom_text(aes(label = n), vjust = -0.5, size = 3) +
tema_limpio + labs(title = "Gráfica N°1: Diagrama de Barras (Frecuencia Absoluta)", x = "Condado", y = "Frecuencia Absoluta (Fi)")
ggplot(tabla_freq, aes(x = reorder(Categoria, -porcentaje), y = porcentaje, fill = Categoria)) +
geom_col() + scale_fill_manual(values = colores_usados) +
geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
tema_limpio + labs(title = "Gráfica N°2: Diagrama de Barras (Porcentajes)", x = "Condado", y = "Porcentajes (%)")
tabla_freq_legenda <- tabla_freq %>%
mutate(etiqueta_legenda = paste0(Categoria, " (", round(porcentaje, 1), "%)"))
ggplot(tabla_freq_legenda, aes(x = "", y = porcentaje, fill = etiqueta_legenda)) +
geom_col() + coord_polar("y") +
scale_fill_manual(values = colores_usados) +
theme_void() +
labs(title = "Gráfica N°3: Distribución Porcentual", fill = "Condado") +
theme(legend.position = "right")
moda <- tabla_freq$Categoria[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- max(tabla_freq$porcentaje)
indicadores <- data.frame(
Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
Valor = c(as.character(nrow(df_clean)), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)
indicadores %>%
kable(caption = "Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Condado, pozos registrados, NY, EE.UU.", align = "lc") %>%
kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
| Indicador | Valor |
|---|---|
| Tamaño muestral (n) | 47360 |
| Número de categorías | 9 |
| Moda | Allegany |
| Frecuencia de la moda | 16,397 |
| Porcentaje de la moda | 34.62% |
De un total de 47360 pozos analizados, la variable Condado se categorizó en 9 grupos. La categoría dominante es Allegany con 34.62%. Al ser una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza o desviación estándar.
Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State