datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")
tabla_freq <- datos_originales %>%
filter(!is.na(`Quad Section`)) %>%
count(`Quad Section`) %>%
mutate(
hi = n / sum(n),
porcentaje = hi * 100
) %>%
arrange(desc(n))
La variable QUAD_SECTION registra la sección específica dentro del cuadrante donde se ubica el pozo. Para este análisis, se han considerado la totalidad de las categorías presentes en el registro, manteniendo la integridad de los datos originales sin realizar procesos de agrupación. Esto permite una visión exhaustiva de la distribución de los pozos en cada sección identificada.
| Criterio | Descripción_Técnica |
|---|---|
| Variable | QUAD_SECTION (Sección del Cuadrante) |
| Tipo | Cualitativa |
| Subtipo | Nominal |
| Dominio | D = {A, B, C, D, E, F, G, H, I} |
| Rango | R = {x : x ∈ {A, B, C, D, E, F, G, H, I}} |
| Unidad de medida | No aplica |
| Escala | Nominal |
| Fuente | Oil, Gas & Other Regulated Wells - NY State |
tabla_formato <- tabla_freq %>%
select(`Quad Section`, n, porcentaje, hi) %>%
rename('Sección' = `Quad Section`, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)
total_fila <- data.frame(
'Sección' = "TOTAL",
'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)
tabla_final %>%
mutate(
`Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
`Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
) %>%
kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Sección del Cuadrante", align = "lccc") %>%
kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
row_spec(0, bold = T, background = "#BDC5C8") %>%
row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
| Sección | Frecuencia (ni) | Porcentaje (hi %) | Porcentaje en fracción (hi) |
|---|---|---|---|
| G | 6723 | 14.45% | 0.1445 |
| E | 6156 | 13.23% | 0.1323 |
| I | 6093 | 13.1% | 0.1310 |
| D | 5772 | 12.41% | 0.1241 |
| H | 5546 | 11.92% | 0.1192 |
| F | 4933 | 10.6% | 0.1060 |
| B | 4831 | 10.39% | 0.1039 |
| C | 3264 | 7.02% | 0.0702 |
| A | 3201 | 6.88% | 0.0688 |
| TOTAL | 46519 | 100% | 1.0000 |
ggplot(tabla_freq, aes(x = reorder(`Quad Section`, -n), y = n, fill = `Quad Section`)) +
geom_col() +
# Se cambió la etiqueta para mostrar solo 'n'
geom_text(aes(label = n), vjust = -0.5, size = 3) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
tema_limpio + theme(axis.text.x = element_text(angle = 45, hjust = 1)) +
labs(x = "Sección", y = "Frecuencia (ni)") +
ylim(0, max(tabla_freq$n) * 1.1) +
guides(fill = "none")
ggplot(tabla_freq, aes(x = reorder(`Quad Section`, -n), y = porcentaje, fill = `Quad Section`)) +
geom_col() +
geom_text(aes(label = paste0(round(porcentaje, 1), "%")), vjust = -0.5, size = 3) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
tema_limpio + theme(axis.text.x = element_text(angle =, hjust = 1)) +
labs(x = "Sección", y = "Porcentaje (hi %)") +
ylim(0, max(tabla_freq$porcentaje) * 1.1) +
guides(fill = "none")
ggplot(tabla_freq, aes(x = "", y = porcentaje, fill = `Quad Section`)) +
geom_col(width = 1) +
geom_text(aes(label = paste0(round(porcentaje, 1), "%")), position = position_stack(vjust = 0.5), size = 3) +
coord_polar("y", start = 0) +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
theme_void() + labs(fill = "Sección")
moda <- tabla_freq$`Quad Section`[which.max(tabla_freq$n)]
frecuencia_moda <- max(tabla_freq$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)
indicadores <- data.frame(
Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda", "Frecuencia de la moda", "Porcentaje de la moda"),
Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)
indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>%
kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
| Indicador | Valor |
|---|---|
| Tamaño muestral (n) | 46,519 |
| Número de categorías | 9 |
| Moda | G |
| Frecuencia de la moda | 6,723 |
| Porcentaje de la moda | 14.45% |
De un total de 46,519 pozos, la variable QUAD_SECTION se organizó en 9 categorías nominales. La categoría dominante es G con 14.45% de los casos. Al tratarse de una variable nominal, el análisis se limita a estadísticos de posición como la moda, sin aplicar cálculos de media, varianza, asimetría ni curtosis.
Autor: Jennifer Cordones | Análisis Estadístico — Oil, Gas & Other Regulated Wells - NY State