1. Configuración y Carga de Datos

datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")

2. Extracción y Limpieza de la Variable

tabla_freq <- datos_originales %>%
  filter(!is.na(`Map Symbol`)) %>%
  count(`Map Symbol`) %>%
  mutate(
    hi = n / sum(n),
    porcentaje = hi * 100
  ) %>%
  arrange(desc(n))

3. Identificación de la Variable

La variable Map Symbol registra la representación gráfica o símbolo asignado a cada pozo en el sistema cartográfico. Se ha realizado un análisis exhaustivo de todas las categorías registradas, preservando la totalidad de los datos para garantizar una interpretación precisa de la simbología utilizada en la cartografía técnica. Esta variable, de naturaleza cualitativa nominal, es fundamental para la clasificación visual de los activos dentro del proyecto.

Tabla 1. Identificación de la variable
Criterio Descripción_Técnica
Variable Map Symbol (Símbolo del Mapa)
Tipo Cualitativa
Subtipo Nominal
Dominio D = {x : x Símbolos cartográficos de mapa}
Rango R = {x : x ∈ símbolos cartográficos registrados}
Unidad de medida No aplica
Escala Nominal
Fuente Oil, Gas & Other Regulated Wells - NY State

4. Tabla de Distribución de Frecuencias

tabla_formato <- tabla_freq %>%
  select(`Map Symbol`, n, porcentaje, hi) %>%
  rename('Símbolo' = `Map Symbol`, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)

total_fila <- data.frame(
  'Símbolo' = "TOTAL",
  'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
  'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
  'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
  check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)

tabla_final %>%
  mutate(
    `Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
    `Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
  ) %>%
  kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Símbolo", align = "lccc") %>%
  kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
  row_spec(0, bold = T, background = "#BDC5C8") %>%
  row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
Tabla 2. Distribución de Frecuencias de Pozos por Símbolo
Símbolo Frecuencia (ni) Porcentaje (hi %) Porcentaje en fracción (hi)
OWP 10058 21.22% 0.2122
GW 8737 18.44% 0.1844
O 8156 17.21% 0.1721
OW 7975 16.83% 0.1683
OP 5561 11.74% 0.1174
DP 2238 4.72% 0.0472
GWP 2156 4.55% 0.0455
S 961 2.03% 0.0203
SMP 597 1.26% 0.0126
DH 593 1.25% 0.0125
SM 172 0.36% 0.0036
SP 170 0.36% 0.0036
CON 14 0.03% 0.0003
TOTAL 47388 100% 1.0000

5. Representación Gráfica

5.1 Gráfica N°1 — Diagrama de Barras (Frecuencia Absoluta)

ggplot(tabla_freq, aes(x = reorder(`Map Symbol`, -n), y = n, fill = `Map Symbol`)) +
  geom_col() + 
  geom_text(aes(label = n), vjust = -0.5, size = 3) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  tema_limpio + theme(axis.text.x = element_text(angle = , hjust = 1)) +
  labs(x = "Símbolo", y = "Frecuencia (ni)") + 
  ylim(0, max(tabla_freq$n) * 1.1) + guides(fill = "none")

5.2 Gráfica N°2 — Diagrama de Barras (Porcentaje)

ggplot(tabla_freq, aes(x = reorder(`Map Symbol`, -n), y = porcentaje, fill = `Map Symbol`)) +
  geom_col() + 
  geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
  tema_limpio + theme(axis.text.x = element_text(angle = , hjust = 1)) +
  labs(x = "Símbolo", y = "Porcentaje (hi %)") + 
  ylim(0, max(tabla_freq$porcentaje) * 1.1) + guides(fill = "none")

5.3 Gráfica N°3 — Diagrama Circular (Distribución Porcentual)

# Creamos etiquetas personalizadas para la leyenda: "Categoria (XX.X%)"
datos_leyenda <- tabla_freq %>%
  mutate(etiqueta_legend = paste0(`Map Symbol`, " (", round(porcentaje, 1), "%)"))

ggplot(datos_leyenda, aes(x = "", y = porcentaje, fill = etiqueta_legend)) +
  geom_col(width = 1) +
  # Usamos la nueva etiqueta para el relleno (fill)
  coord_polar("y", start = 0) +
  scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(datos_leyenda))) +
  theme_void() + 
  labs(fill = "Símbolo (%)") + # Título de la leyenda
  theme(legend.position = "right") # Asegura que la leyenda sea visible

6. Tabla de Indicadores

moda <- tabla_freq$`Map Symbol`[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)

indicadores <- data.frame(
  Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
  Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)

indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>% 
  kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
  row_spec(0, bold = T, color = "white", background = "#1D4E73")
Tabla N°3: Indicadores Estadísticos
Indicador Valor
Tamaño muestral (n) 47,388
Número de categorías 13
Moda OWP
Frecuencia de la moda 10,058
Porcentaje de la moda 21.22%

7. Conclusión

De un total de 47,388 pozos, la variable Map Symbol se organizó en 13 categorías nominales. La categoría dominante es OWP con 21.22% de los casos. Al tratarse de una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza, asimetría ni curtosis.


Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State