1. Configuración y Carga de Datos

datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")

2. Extracción y Limpieza de la Variable

df_clean <- datos_originales %>%
  select(County) %>%
  filter(!is.na(County)) %>%
  mutate(County = as.character(County))

top_8 <- df_clean %>% count(County, sort = TRUE) %>% head(8) %>% pull(County)

tabla_freq <- df_clean %>%
  mutate(Categoria = ifelse(County %in% top_8, County, "Otros")) %>%
  count(Categoria) %>%
  mutate(
    hi = n / sum(n),
    porcentaje = hi * 100,
    Fi_ac = cumsum(n),
    hi_ac = cumsum(hi)
  ) %>%
  arrange(desc(n))

3. Identificación de la Variable

La variable COUNTY registra el condado donde se ubica el pozo. Debido a la alta cantidad de categorías en la variable, aquellas que no se encuentran entre las 8 más frecuentes se agruparán en la categoría “Otros” para optimizar la representación gráfica y el análisis de tendencias principales.

Tabla 1. Identificación de la variable
Criterio Descripción_Técnica
Variable Condado (County)
Tipo Cualitativa
Subtipo Nominal
Dominio D = {x : x es el nombre de un condado}
Rango R = {x : x pertenece a condados registrados}
Unidad de medida No aplica
Escala Nominal
Fuente Oil, Gas & Other Regulated Wells - NY State

4. Tabla de Distribución de Frecuencias

tabla_formato <- tabla_freq %>%
  rename('Condado' = Categoria, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 
         'Porcentaje en fracción (hi)' = hi, 'Frec. Abs. Acumulada (Fi_ac)' = Fi_ac, 
         'Frec. Rel. Acumulada (hi_ac)' = hi_ac)

kable(tabla_formato, caption = "Tabla 2. Distribución de Frecuencias de Pozos por Condado", digits = 4, align = "c") %>%
  kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Tabla 2. Distribución de Frecuencias de Pozos por Condado
Condado Frecuencia (ni) Porcentaje en fracción (hi) Porcentaje (hi %) Frec. Abs. Acumulada (Fi_ac) Frec. Rel. Acumulada (hi_ac)
Allegany 16397 0.3462 34.6220 16397 0.3462
Cattaraugus 11951 0.2523 25.2344 28348 0.5986
Chautauqua 6367 0.1344 13.4438 34715 0.7330
Otros 4473 0.0944 9.4447 43551 0.9196
Erie 3483 0.0735 7.3543 38198 0.8065
Steuben 2067 0.0436 4.3644 46211 0.9757
Wyoming 1149 0.0243 2.4261 47360 1.0000
Genesee 880 0.0186 1.8581 39078 0.8251
Statewide 593 0.0125 1.2521 44144 0.9321

5. Representación Gráfica

tema_limpio <- theme_minimal() + 
  theme(
    panel.grid.major.x = element_blank(), 
    panel.grid.minor.x = element_blank(),
    axis.text.x = element_text(angle = 45, hjust = 1)
  )
colores_usados <- colorRampPalette(paleta_colores)(nrow(tabla_freq))

5.1 Gráfica N°1 — Diagrama de Barras (Frecuencia Absoluta)

ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
  geom_col() + scale_fill_manual(values = colores_usados) +
  geom_text(aes(label = n), vjust = -0.5, size = 3) +
  tema_limpio + labs(title = "Gráfica N°1: Diagrama de Barras (Frecuencia Absoluta)", x = "Condado", y = "Frecuencia Absoluta (Fi)")

5.2 Gráfica N°2 — Diagrama de Barras (Porcentajes)

ggplot(tabla_freq, aes(x = reorder(Categoria, -porcentaje), y = porcentaje, fill = Categoria)) +
  geom_col() + scale_fill_manual(values = colores_usados) +
  geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
  tema_limpio + labs(title = "Gráfica N°2: Diagrama de Barras (Porcentajes)", x = "Condado", y = "Porcentajes (%)")

5.3 Gráfica N°3 — Diagrama Circular (Distribución Porcentual)

tabla_freq_legenda <- tabla_freq %>%
  mutate(etiqueta_legenda = paste0(Categoria, " (", round(porcentaje, 1), "%)"))

ggplot(tabla_freq_legenda, aes(x = "", y = porcentaje, fill = etiqueta_legenda)) +
  geom_col() + coord_polar("y") +
  scale_fill_manual(values = colores_usados) +
  theme_void() + 
  labs(title = "Gráfica N°3: Distribución Porcentual", fill = "Condado") +
  theme(legend.position = "right")

6. Tabla de Indicadores

moda <- tabla_freq$Categoria[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- max(tabla_freq$porcentaje)

indicadores <- data.frame(
  Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
  Valor = c(as.character(nrow(df_clean)), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)

indicadores %>% 
  kable(caption = "Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Condado, pozos registrados, NY, EE.UU.", align = "lc") %>% 
  kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Condado, pozos registrados, NY, EE.UU.
Indicador Valor
Tamaño muestral (n) 47360
Número de categorías 9
Moda Allegany
Frecuencia de la moda 16,397
Porcentaje de la moda 34.62%

7. Conclusión

De un total de 47360 pozos analizados, la variable Condado se categorizó en 9 grupos. La categoría dominante es Allegany con 34.62%. Al ser una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza o desviación estándar.


Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State