1. Configuración y Carga de Datos

datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")

2. Extracción y Limpieza de la Variable

# Se eliminó el agrupamiento 'Otros' para incluir todas las regiones del dataset
tabla_freq <- datos_originales %>%
  select(Region) %>%
  filter(!is.na(Region)) %>%
  mutate(Categoria = as.character(Region)) %>%
  count(Categoria) %>%
  mutate(
    hi = n / sum(n),
    porcentaje = hi * 100,
    Fi_ac = cumsum(n),
    hi_ac = cumsum(hi)
  ) %>%
  arrange(desc(n))

3. Identificación de la Variable

La variable REGION registra la región administrativa donde se ubica el pozo. En este análisis se consideran la totalidad de las regiones registradas en la base de datos oficial.

Tabla 1. Identificación de la variable
Criterio Descripción_Técnica
Variable Region (Región)
Tipo Cualitativa
Subtipo Nominal
Dominio D = {x : x es el número de una región}
Rango R = {x : x ∈ regiones registradas}
Unidad de medida No aplica
Escala Nominal
Fuente Oil, Gas & Other Regulated Wells - NY State

4. Tabla de Distribución de Frecuencias

tabla_formato <- tabla_freq %>%
  select(Categoria, n, porcentaje, hi) %>%
  rename(
    'Región' = Categoria, 
    'Frecuencia (ni)' = n, 
    'Porcentaje (hi %)' = porcentaje, 
    'Porcentaje en fracción (hi)' = hi
  )

total_fila <- data.frame(
  'Región' = "TOTAL",
  'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
  'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
  'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
  check.names = FALSE # Esto es clave para evitar que R cambie los nombres
)
tabla_final <- rbind(tabla_formato, total_fila)

tabla_final %>%
  mutate(
    `Porcentaje (hi %)` = ifelse(`Región` == "TOTAL", 
                                 paste0(round(`Porcentaje (hi %)`, 2), "%"), 
                                 paste0(round(`Porcentaje (hi %)`, 2), "%")),
    `Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
  ) %>%
  kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Región", align = "lccc") %>%
  kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
  row_spec(0, bold = T, background = "#BDC5C8") %>%
  row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
Tabla 2. Distribución de Frecuencias de Pozos por Región
Región Frecuencia (ni) Porcentaje (hi %) Porcentaje en fracción (hi)
9 39894 84.21% 0.8421
8 5206 10.99% 0.1099
7 1684 3.55% 0.0355
2 247 0.52% 0.0052
6 114 0.24% 0.0024
3 112 0.24% 0.0024
4 96 0.2% 0.0020
5 19 0.04% 0.0004
1 4 0.01% 0.0001
TOTAL 47376 100% 1.0000

5. Representación Gráfica

tema_limpio <- theme_minimal() + 
  theme(
    panel.grid.major.x = element_blank(), 
    panel.grid.minor.x = element_blank(),
    axis.text.x = element_text(angle = 0, hjust = 1)
  )
colores_usados <- colorRampPalette(paleta_colores)(nrow(tabla_freq))

5.1 Gráfica N°1 — Diagrama de Barras (Frecuencia Absoluta)

ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
  geom_col() + scale_fill_manual(values = colores_usados) +
  geom_text(aes(label = n), vjust = -0.5, size = 3) +
  tema_limpio + labs(title = "Gráfica N°1: Diagrama de Barras (Frecuencia Absoluta)", x = "Región", y = "Frecuencia Absoluta (Fi)")

5.2 Gráfica N°2 — Diagrama de Barras (Porcentajes)

ggplot(tabla_freq, aes(x = reorder(Categoria, -porcentaje), y = porcentaje, fill = Categoria)) +
  geom_col() + scale_fill_manual(values = colores_usados) +
  geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
  tema_limpio + labs(title = "Gráfica N°2: Diagrama de Barras (Porcentajes)", x = "Región", y = "Porcentajes (%)")

5.3 Gráfica N°3 — Diagrama Circular (Distribución Porcentual)

tabla_freq_legenda <- tabla_freq %>%
  mutate(etiqueta_legenda = paste0(Categoria, " (", round(porcentaje, 1), "%)"))

ggplot(tabla_freq_legenda, aes(x = "", y = porcentaje, fill = etiqueta_legenda)) +
  geom_col() + coord_polar("y") +
  scale_fill_manual(values = colores_usados) +
  theme_void() + 
  labs(title = "Gráfica N°3: Distribución Porcentual", fill = "Región") +
  theme(legend.position = "right")

6. Tabla de Indicadores

moda <- tabla_freq$Categoria[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- max(tabla_freq$porcentaje)
total_muestral <- sum(tabla_freq$n)

indicadores <- data.frame(
  Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
  Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)

indicadores %>% 
  kable(caption = "Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Región, pozos registrados, NY, EE.UU.", align = "lc") %>% 
  kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Cuadro N°2: Indicadores de la Variable Cualitativa Nominal Región, pozos registrados, NY, EE.UU.
Indicador Valor
Tamaño muestral (n) 47,376
Número de categorías 9
Moda 9
Frecuencia de la moda 39,894
Porcentaje de la moda 84.21%

7. Conclusión

De un total de 47,376 pozos analizados, la variable Región se categorizó en 9 grupos distintos. La categoría dominante es 9 con 84.21%. Al ser una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza o desviación estándar.


Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State