1. Configuración y Carga de Datos

datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")

2. Extracción y Limpieza de la Variable

tabla_freq <- datos_originales %>%
  filter(!is.na(`Quad Section`)) %>%
  count(`Quad Section`) %>%
  mutate(
    hi = n / sum(n),
    porcentaje = hi * 100
  ) %>%
  arrange(desc(n))

3. Identificación de la Variable

La variable QUAD_SECTION registra la sección específica dentro del cuadrante donde se ubica el pozo. Para este análisis, se han considerado la totalidad de las categorías presentes en el registro, manteniendo la integridad de los datos originales sin realizar procesos de agrupación. Esto permite una visión exhaustiva de la distribución de los pozos en cada sección identificada.

Tabla 1. Identificación de la variable
Criterio Descripción_Técnica
Variable QUAD_SECTION (Sección del Cuadrante)
Tipo Cualitativa
Subtipo Nominal
Dominio D = {A, B, C, D, E, F, G, H, I}
Rango R = {x : x ∈ {A, B, C, D, E, F, G, H, I}}
Unidad de medida No aplica
Escala Nominal
Fuente Oil, Gas & Other Regulated Wells - NY State

4. Tabla de Distribución de Frecuencias

tabla_formato <- tabla_freq %>%
  select(`Quad Section`, n, porcentaje, hi) %>%
  rename('Sección' = `Quad Section`, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)

total_fila <- data.frame(
  'Sección' = "TOTAL",
  'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
  'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
  'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
  check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)

tabla_final %>%
  mutate(
    `Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
    `Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
  ) %>%
  kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Sección del Cuadrante", align = "lccc") %>%
  kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
  row_spec(0, bold = T, background = "#BDC5C8") %>%
  row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
Tabla 2. Distribución de Frecuencias de Pozos por Sección del Cuadrante
Sección Frecuencia (ni) Porcentaje (hi %) Porcentaje en fracción (hi)
G 6723 14.45% 0.1445
E 6156 13.23% 0.1323
I 6093 13.1% 0.1310
D 5772 12.41% 0.1241
H 5546 11.92% 0.1192
F 4933 10.6% 0.1060
B 4831 10.39% 0.1039
C 3264 7.02% 0.0702
A 3201 6.88% 0.0688
TOTAL 46519 100% 1.0000

5. Representación Gráfica

5.1 Gráfica N°1 — Diagrama de Barras (Frecuencia Absoluta)

ggplot(tabla_freq, aes(x = reorder(`Quad Section`, -n), y = n, fill = `Quad Section`)) +
  geom_col() + 
  # Se cambió la etiqueta para mostrar solo 'n'
  geom_text(aes(label = n), vjust = -0.5, size = 3) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  tema_limpio + theme(axis.text.x = element_text(angle = 45, hjust = 1)) +
  labs(x = "Sección", y = "Frecuencia (ni)") + 
  ylim(0, max(tabla_freq$n) * 1.1) + 
  guides(fill = "none")

5.2 Gráfica N°2 — Diagrama de Barras (Porcentaje)

ggplot(tabla_freq, aes(x = reorder(`Quad Section`, -n), y = porcentaje, fill = `Quad Section`)) +
  geom_col() + 
  geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  tema_limpio + theme(axis.text.x = element_text(angle =, hjust = 1)) +
  labs(x = "Sección", y = "Porcentaje (hi %)") + 
  ylim(0, max(tabla_freq$porcentaje) * 1.1) +
  guides(fill = "none")

5.3 Gráfica N°3 — Diagrama Circular (Distribución Porcentual)

ggplot(tabla_freq, aes(x = "", y = porcentaje, fill = `Quad Section`)) +
  geom_col(width = 1) +
  geom_text(aes(label = paste0(round(porcentaje, 1), "%")), position = position_stack(vjust = 0.5), size = 3) +
  coord_polar("y", start = 0) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  theme_void() + labs(fill = "Sección")

6. Tabla de Indicadores

moda <- tabla_freq$`Quad Section`[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)

indicadores <- data.frame(
  Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
  Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)

indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>% 
  kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Tabla N°3: Indicadores Estadísticos
Indicador Valor
Tamaño muestral (n) 46,519
Número de categorías 9
Moda G
Frecuencia de la moda 6,723
Porcentaje de la moda 14.45%

7. Conclusión

De un total de 46,519 pozos, la variable QUAD_SECTION se organizó en 9 categorías nominales. La categoría dominante es G con 14.45% de los casos. Al tratarse de una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza, asimetría ni curtosis.


Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State