1. Configuración y Carga de Datos
datos_originales <- read_csv2("C:/Users/cordo/OneDrive/Desktop/ESTADISITCA/Oil__Gas____Other_Regulated_Wells__Beginning_1860.csv")
3. Identificación de la Variable
La variable QUAD registra el cuadrante donde se ubica el pozo. Debido
a la alta cantidad de categorías presentes en el conjunto de datos
original, se ha aplicado un criterio de agrupamiento estadístico para la
optimización del análisis: aquellas categorías que presentan una
frecuencia relativa individual menor al 5% han sido consolidadas bajo la
etiqueta “Otros”. Este proceso permite concentrar la capacidad analítica
en las zonas de mayor relevancia, facilitando tanto la representación
gráfica como la identificación de tendencias principales en el
territorio.
Tabla 1. Identificación de la variable
|
Criterio
|
Descripción_Técnica
|
|
Variable
|
Quad (Cuadrante)
|
|
Tipo
|
Cualitativa
|
|
Subtipo
|
Nominal
|
|
Dominio
|
D = {x : x es el nombre de un cuadrante cartográfico}
|
|
Rango
|
R = {x : x ∈ cuadrantes registrados}
|
|
Unidad de medida
|
No aplica
|
|
Escala
|
Nominal
|
|
Fuente
|
Oil, Gas & Other Regulated Wells - NY State
|
4. Tabla de Distribución de Frecuencias
tabla_formato <- tabla_freq %>%
select(Categoria, n, porcentaje, hi) %>%
rename('Cuadrante' = Categoria, 'Frecuencia (ni)' = n, 'Porcentaje (hi %)' = porcentaje, 'Porcentaje en fracción (hi)' = hi)
total_fila <- data.frame(
'Cuadrante' = "TOTAL",
'Frecuencia (ni)' = sum(tabla_formato[['Frecuencia (ni)']]),
'Porcentaje (hi %)' = sum(tabla_formato[['Porcentaje (hi %)']]),
'Porcentaje en fracción (hi)' = sum(tabla_formato[['Porcentaje en fracción (hi)']]),
check.names = FALSE
)
tabla_final <- rbind(tabla_formato, total_fila)
tabla_final %>%
mutate(
`Porcentaje (hi %)` = paste0(round(`Porcentaje (hi %)`, 2), "%"),
`Porcentaje en fracción (hi)` = sprintf("%.4f", `Porcentaje en fracción (hi)`)
) %>%
kable(caption = "Tabla 2. Distribución de Frecuencias de Pozos por Cuadrante", align = "lccc") %>%
kable_styling(bootstrap_options = c("striped", "hover"), full_width = F, position = "center") %>%
row_spec(0, bold = T, background = "#BDC5C8") %>%
row_spec(nrow(tabla_final), bold = T, background = "#BDC5C8")
Tabla 2. Distribución de Frecuencias de Pozos por Cuadrante
|
Cuadrante
|
Frecuencia (ni)
|
Porcentaje (hi %)
|
Porcentaje en fracción (hi)
|
|
Knapp Creek
|
6622
|
14.26%
|
0.1426
|
|
Allentown
|
6154
|
13.25%
|
0.1325
|
|
Bolivar
|
5960
|
12.83%
|
0.1283
|
|
Olean
|
2966
|
6.39%
|
0.0639
|
|
Whitesville
|
1457
|
3.14%
|
0.0314
|
|
Wellsville South
|
1220
|
2.63%
|
0.0263
|
|
Rexville
|
982
|
2.11%
|
0.0211
|
|
Lakewood
|
871
|
1.88%
|
0.0188
|
|
Greenwood
|
579
|
1.25%
|
0.0125
|
|
Wellsville North
|
575
|
1.24%
|
0.0124
|
|
Otros
|
19058
|
41.03%
|
0.4103
|
|
TOTAL
|
46444
|
100%
|
1.0000
|
5. Representación Gráfica
tema_limpio <- theme_minimal() +
theme(
panel.grid.major.x = element_blank(),
panel.grid.minor.x = element_blank(),
panel.grid.minor.y = element_blank(),
axis.text.x = element_text(angle = 45, hjust = 1)
)
ggplot(tabla_freq, aes(x = reorder(Categoria, -n), y = n, fill = Categoria)) +
geom_col() +
scale_fill_manual(values = colorRampPalette(paleta_colores)(nrow(tabla_freq))) +
tema_limpio +
labs(title = "Distribución de Pozos por Cuadrante", x = "Cuadrante", y = "Frecuencia (ni)")

6. Tabla de Indicadores
tabla_solo_datos <- tabla_freq %>% filter(Categoria != "Otros")
moda <- tabla_solo_datos$Categoria[which.max(tabla_solo_datos$n)]
frecuencia_moda <- max(tabla_solo_datos$n)
porcentaje_moda <- (frecuencia_moda / sum(tabla_freq$n)) * 100
total_muestral <- sum(tabla_freq$n)
indicadores <- data.frame(
Indicador = c("Tamaño muestral (n)", "Número de categorías", "Moda (excl. Otros)", "Frecuencia de la moda", "Porcentaje de la moda"),
Valor = c(format(total_muestral, big.mark=","), as.character(nrow(tabla_freq)), moda, format(frecuencia_moda, big.mark=","), paste0(round(porcentaje_moda, 2), "%"))
)
indicadores %>% kable(caption = "Tabla N°3: Indicadores Estadísticos", align = "lc") %>%
kable_styling(full_width = F, position = "center", bootstrap_options = "striped") %>%
row_spec(0, bold = T, color = "white", background = "#1D4E73")
Tabla N°3: Indicadores Estadísticos
|
Indicador
|
Valor
|
|
Tamaño muestral (n)
|
46,444
|
|
Número de categorías
|
11
|
|
Moda (excl. Otros)
|
Knapp Creek
|
|
Frecuencia de la moda
|
6,622
|
|
Porcentaje de la moda
|
14.26%
|
7. Conclusión
De un total de 46,444 pozos clasificables (se excluyeron los
registros con valores nulos o sin información de cuadrante válida), la
variable Quad se organizó en 11 categorías nominales, desde las
identificaciones más frecuentes hasta la agrupación ‘Otros’. La
categoría dominante es Knapp Creek con 14.26% de los casos. Al tratarse
de una variable nominal, el análisis se limita a estadísticos de
posición como la moda, sin aplicar cálculos de media, varianza,
asimetría ni curtosis.