1. Configuración y Carga de Datos

datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")

2. Extracción y Limpieza de la Variable

top_10_lista <- datos_originales %>%
  filter(!is.na(Quad)) %>%
  count(Quad, sort = TRUE) %>%
  head(10) %>%
  pull(Quad)

tabla_freq <- datos_originales %>%
  filter(!is.na(Quad)) %>%
  mutate(Categoria = ifelse(Quad %in% top_10_lista, Quad, "Otros")) %>%
  count(Categoria) %>%
  mutate(
    hi = n / sum(n),
    porcentaje = hi * 100
  ) %>%
  mutate(orden = ifelse(Categoria == "Otros", 999, -n)) %>%
  arrange(orden) %>%
  select(-orden)

3. Identificación de la Variable

La variable QUAD registra el cuadrante donde se ubica el pozo. Debido a la alta cantidad de categorías presentes en el conjunto de datos original, se ha aplicado un criterio de agrupamiento estadístico para la optimización del análisis: aquellas categorías que presentan una frecuencia relativa individual menor al 5% han sido consolidadas bajo la etiqueta “Otros”. Este proceso permite concentrar la capacidad analítica en las zonas de mayor relevancia, facilitando tanto la representación gráfica como la identificación de tendencias principales en el territorio.

Tabla 1. Identificación de la variable
Criterio Descripción_Técnica
Variable Quad (Cuadrante)
Tipo Cualitativa
Subtipo Nominal
Dominio D = {x : x es el nombre de un cuadrante cartográfico}
Rango R = {x : x ∈ cuadrantes registrados}
Unidad de medida No aplica
Escala Nominal
Fuente Oil, Gas & Other Regulated Wells - NY State

4. Tabla de Distribución de Frecuencias

tabla_formato <- tabla_freq %>%
  select(Categoria, n, porcentaje, hi) %>%
  rename('Cuadrante' = Categoria, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)

total_fila <- data.frame(
  'Cuadrante' = "TOTAL",
  'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
  'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
  'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
  check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)

tabla_final %>%
  mutate(
    `Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
    `Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
  ) %>%
  kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Cuadrante", align = "lccc") %>%
  kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
  row_spec(0, bold = T, background = "#BDC5C8") %>%
  row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
Tabla 2. Distribución de Frecuencias de Pozos por Cuadrante
Cuadrante Frecuencia (ni) Porcentaje (hi %) Porcentaje en fracción (hi)
Knapp Creek 6622 14.26% 0.1426
Allentown 6154 13.25% 0.1325
Bolivar 5960 12.83% 0.1283
Olean 2966 6.39% 0.0639
Whitesville 1457 3.14% 0.0314
Wellsville South 1220 2.63% 0.0263
Rexville 982 2.11% 0.0211
Lakewood 871 1.88% 0.0188
Greenwood 579 1.25% 0.0125
Wellsville North 575 1.24% 0.0124
Otros 19058 41.03% 0.4103
TOTAL 46444 100% 1.0000

5. Representación Gráfica

tema_limpio <- theme_minimal() + 
  theme(
    panel.grid.major.x = element_blank(), 
    panel.grid.minor.x = element_blank(),
    panel.grid.minor.y = element_blank(),
    axis.text.x = element_text(angle = 45, hjust = 1)
  )

ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
  geom_col() + 
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  tema_limpio + 
  labs(title = "Distribución de Pozos por Cuadrante", x = "Cuadrante", y = "Frecuencia (ni)")

6. Tabla de Indicadores

tabla_solo_datos <- tabla_freq %>% filter(Categoria != "Otros")
moda <- tabla_solo_datos$Categoria[which.max(tabla_solo_datos$n)]
frecuencia_moda <- max(tabla_solo_datos$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)

indicadores <- data.frame(
  Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda (excl. Otros)", "Frecuencia de la moda", "Porcentaje de la moda"),
  Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)

indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>% 
  kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Tabla N°3: Indicadores Estadísticos
Indicador Valor
Tamaño muestral (n) 46,444
Número de categorías 11
Moda (excl. Otros) Knapp Creek
Frecuencia de la moda 6,622
Porcentaje de la moda 14.26%

7. Conclusión

De un total de 46,444 pozos clasificables (se excluyeron los registros con valores nulos o sin información de cuadrante válida), la variable Quad se organizó en 11 categorías nominales, desde las identificaciones más frecuentes hasta la agrupación ‘Otros’. La categoría dominante es Knapp Creek con 14.26% de los casos. Al tratarse de una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza, asimetría ni curtosis.