datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")
tabla_freq <- datos_originales %>%
filter(!is.na(`Map Symbol`)) %>%
count(`Map Symbol`) %>%
mutate(
hi = n / sum(n),
porcentaje = hi * 100
) %>%
arrange(desc(n))
La variable Map Symbol registra la representación gráfica o símbolo asignado a cada pozo en el sistema cartográfico. Se ha realizado un análisis exhaustivo de todas las categorías registradas, preservando la totalidad de los datos para garantizar una interpretación precisa de la simbología utilizada en la cartografía técnica. Esta variable, de naturaleza cualitativa nominal, es fundamental para la clasificación visual de los activos dentro del proyecto.
| Criterio | Descripción_Técnica |
|---|---|
| Variable | Map Symbol (Símbolo del Mapa) |
| Tipo | Cualitativa |
| Subtipo | Nominal |
| Dominio | D = {x : x Símbolos cartográficos de mapa} |
| Rango | R = {x : x ∈ símbolos cartográficos registrados} |
| Unidad de medida | No aplica |
| Escala | Nominal |
| Fuente | Oil, Gas & Other Regulated Wells - NY State |
tabla_formato <- tabla_freq %>%
select(`Map Symbol`, n, porcentaje, hi) %>%
rename('Símbolo' = `Map Symbol`, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)
total_fila <- data.frame(
'Símbolo' = "TOTAL",
'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)
tabla_final %>%
mutate(
`Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
`Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
) %>%
kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Símbolo", align = "lccc") %>%
kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
row_spec(0, bold = T, background = "#BDC5C8") %>%
row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
| Símbolo | Frecuencia (ni) | Porcentaje (hi %) | Porcentaje en fracción (hi) |
|---|---|---|---|
| OWP | 10058 | 21.22% | 0.2122 |
| GW | 8737 | 18.44% | 0.1844 |
| O | 8156 | 17.21% | 0.1721 |
| OW | 7975 | 16.83% | 0.1683 |
| OP | 5561 | 11.74% | 0.1174 |
| DP | 2238 | 4.72% | 0.0472 |
| GWP | 2156 | 4.55% | 0.0455 |
| S | 961 | 2.03% | 0.0203 |
| SMP | 597 | 1.26% | 0.0126 |
| DH | 593 | 1.25% | 0.0125 |
| SM | 172 | 0.36% | 0.0036 |
| SP | 170 | 0.36% | 0.0036 |
| CON | 14 | 0.03% | 0.0003 |
| TOTAL | 47388 | 100% | 1.0000 |
ggplot(tabla_freq, aes(x = reorder(`Map Symbol`, -n), y = n, fill = `Map Symbol`)) +
geom_col() +
geom_text(aes(label = n), vjust = -0.5, size = 3) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
tema_limpio + theme(axis.text.x = element_text(angle = , hjust = 1)) +
labs(x = "Símbolo", y = "Frecuencia (ni)") +
ylim(0, max(tabla_freq$n) * 1.1) + guides(fill = "none")
ggplot(tabla_freq, aes(x = reorder(`Map Symbol`, -n), y = porcentaje, fill = `Map Symbol`)) +
geom_col() +
geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
tema_limpio + theme(axis.text.x = element_text(angle = , hjust = 1)) +
labs(x = "Símbolo", y = "Porcentaje (hi %)") +
ylim(0, max(tabla_freq$porcentaje) * 1.1) + guides(fill = "none")
# Creamos etiquetas personalizadas para la leyenda: "Categoria (XX.X%)"
datos_leyenda <- tabla_freq %>%
mutate(etiqueta_legend = paste0(`Map Symbol`, " (", round(porcentaje, 1), "%)"))
ggplot(datos_leyenda, aes(x = "", y = porcentaje, fill = etiqueta_legend)) +
geom_col(width = 1) +
# Usamos la nueva etiqueta para el relleno (fill)
coord_polar("y", start = 0) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(datos_leyenda))) +
theme_void() +
labs(fill = "Símbolo (%)") + # Título de la leyenda
theme(legend.position = "right") # Asegura que la leyenda sea visible
moda <- tabla_freq$`Map Symbol`[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)
indicadores <- data.frame(
Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)
indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>%
kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
| Indicador | Valor |
|---|---|
| Tamaño muestral (n) | 47,388 |
| Número de categorías | 13 |
| Moda | OWP |
| Frecuencia de la moda | 10,058 |
| Porcentaje de la moda | 21.22% |
De un total de 47,388 pozos, la variable Map Symbol se organizó en 13 categorías nominales. La categoría dominante es OWP con 21.22% de los casos. Al tratarse de una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza, asimetría ni curtosis.
Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State