2026-06-26Se carga el conjunto de datos de arrendamientos de hidrocarburos del estado de Kansas, EE.UU., registrados por el Kansas Geological Survey.
ruta_archivo <- "C:/Users/thann/OneDrive/Escritorio/ESTADISTICA.LOL/daataset/oil_and_gas_leases_data.csv.csv"
datos_vale <- read_csv(
ruta_archivo,
show_col_types = FALSE
)
cat("Base de datos cargada correctamente.\n")
## Base de datos cargada correctamente.
cat("Total de registros (filas):", nrow(datos_vale), "\n")
## Total de registros (filas): 47757
La variable LONGITUDE_LATITUDE_SOURCE (Fuente de Coordenadas) identifica el método o sistema utilizado para registrar las coordenadas geográficas de cada arrendamiento. Se eliminan los registros sin valor (NA o vacíos).
x_raw <- datos_vale %>%
filter(!is.na(LONGITUDE_LATITUDE_SOURCE), LONGITUDE_LATITUDE_SOURCE != "") %>%
pull(LONGITUDE_LATITUDE_SOURCE)
n <- length(x_raw)
cat("Observaciones válidas:", n, "\n")
## Observaciones válidas: 47757
cat("Fuentes distintas:", length(unique(x_raw)), "\n")
## Fuentes distintas: 2
| Criterio | Clasificación |
|---|---|
| Nombre | Fuente de Coordenadas |
| Nombre técnico | LONGITUDE_LATITUDE_SOURCE |
| Tipo | Cualitativa |
| Subtipo | Nominal dicotómica |
| Dominio | {CENTER_OF_SECTION, QUARTER_CALLS} |
| Rango | 2 categorías |
| Unidad | No aplica |
| Escala | Nominal |
| Fuente | Kansas Geological Survey – Kansas, EE.UU. |
Justificación: La variable identifica el origen de los datos de localización sin establecer un orden jerárquico entre las fuentes. Verificado contra el dataset, toma únicamente dos valores posibles (CENTER_OF_SECTION y QUARTER_CALLS), por lo que corresponde a una variable cualitativa nominal dicotómica. Se construye la tabla de distribución de frecuencias con frecuencia absoluta, porcentual y en fracción.
Se construye la tabla de distribución de frecuencias de la variable Fuente de Coordenadas, correspondiente a los arrendamientos de hidrocarburos registrados en Kansas, EE.UU. (n = 47,757).
freq_abs <- sort(table(x_raw), decreasing = TRUE)
categorias <- names(freq_abs)
ni <- as.integer(freq_abs)
hi_pct <- ni / n * 100
hi_frac <- ni / n
tabla_df <- data.frame(
Categoria = categorias,
ni = ni,
hi_pct = sprintf("%.2f%%", hi_pct),
stringsAsFactors = FALSE
)
total_row <- data.frame(
Categoria = "**TOTAL**",
ni = n,
hi_pct = "100.00%",
stringsAsFactors = FALSE
)
tabla_df$ni <- as.character(tabla_df$ni)
total_row$ni <- as.character(total_row$ni)
tabla_final <- bind_rows(tabla_df, total_row)
kable(
tabla_final,
caption = paste0(
"Cuadro N°1: Distribución de Frecuencias de la Variable Cualitativa Nominal Fuente de Coordenadas, ",
"registrada en los arrendamientos de hidrocarburos del estado de Kansas, EE.UU., ",
"período histórico disponible (n = ", format(n, big.mark = ","), " registros válidos)."
),
col.names = c("Fuente de Coordenadas", "Frecuencia (nᵢ)", "Porcentaje (hᵢ %)"),
align = c("l", "c", "c"),
escape = FALSE
) %>%
kable_styling(
bootstrap_options = c("striped", "hover", "condensed", "bordered"),
full_width = TRUE, font_size = 12
) %>%
row_spec(0, bold = TRUE, background = "#d3d3d3", color = "black") %>%
row_spec(nrow(tabla_final), bold = TRUE, background = "#a9a9a9", color = "black")
| Fuente de Coordenadas | Frecuencia (nᵢ) | Porcentaje (hᵢ %) |
|---|---|---|
| CENTER_OF_SECTION | 26553 | 55.60% |
| QUARTER_CALLS | 21204 | 44.40% |
| TOTAL | 47757 | 100.00% |
freq_ord <- sort(table(x_raw), decreasing = TRUE)
colores_g <- gray(seq(0.30, 0.80, length.out = length(freq_ord)))
par(mar = c(9, 6, 7, 2))
bp <- barplot(
as.numeric(freq_ord),
names.arg = names(freq_ord),
col = colores_g,
border = "black",
ylim = c(0, max(as.numeric(freq_ord)) * 1.18),
xlab = "", ylab = "", main = "", las = 2, cex.names = 0.75
)
text(bp, as.numeric(freq_ord) + max(as.numeric(freq_ord)) * 0.02,
labels = format(as.numeric(freq_ord), big.mark = ","), cex = 0.85)
mtext("Frecuencia Absoluta (nᵢ)", side = 2, line = 4.5, cex = 1)
mtext("Fuente de Coordenadas", side = 1, line = 7.5, cex = 1)
mtext(
"Gráfica N°1: Diagrama de Barras — Frecuencia Absoluta\nde la Variable Fuente de Coordenadas, Kansas, EE.UU.",
side = 3, line = 3.5, cex = 0.9, font = 2
)
pct_ord <- sort(table(x_raw) / n * 100, decreasing = TRUE)
par(mar = c(9, 6, 7, 2))
bp2 <- barplot(
as.numeric(pct_ord),
names.arg = names(pct_ord),
col = colores_g,
border = "black",
ylim = c(0, max(as.numeric(pct_ord)) * 1.18),
xlab = "", ylab = "", main = "", las = 2, cex.names = 0.75
)
text(bp2, as.numeric(pct_ord) + max(as.numeric(pct_ord)) * 0.02,
labels = paste0(round(as.numeric(pct_ord), 2), "%"), cex = 0.85)
mtext("Porcentaje (hᵢ %)", side = 2, line = 4.5, cex = 1)
mtext("Fuente de Coordenadas", side = 1, line = 7.5, cex = 1)
mtext(
"Gráfica N°2: Diagrama de Barras — Porcentaje\nde la Variable Fuente de Coordenadas, Kansas, EE.UU.",
side = 3, line = 3.5, cex = 0.9, font = 2
)
pct_circ <- table(x_raw) / n * 100
grises_c <- gray(seq(0.15, 0.85, length.out = length(pct_circ)))
par(mar = c(2, 2, 6, 12), xpd = TRUE)
pie(
as.numeric(pct_circ),
labels = paste0(round(as.numeric(pct_circ), 2), "%"),
col = grises_c,
border = "black",
main = "",
radius = 1,
cex = 0.85
)
legend(
x = 1.2,
y = 1,
legend = names(pct_circ),
fill = grises_c,
cex = 0.75,
title = "Fuente",
bty = "n"
)
mtext(
"Gráfica N°3: Diagrama Circular — Distribución Porcentual\nde la Variable Fuente de Coordenadas, Kansas, EE.UU.",
side = 3, line = 3.5, cex = 0.9, font = 2
)
moda_val <- names(sort(table(x_raw), decreasing = TRUE))[1]
moda_n <- max(table(x_raw))
moda_hi <- moda_n / n
tabla_indicadores <- data.frame(
Indicador = c(
"Variable",
"Tipo de variable",
"Categorías (Rango)",
"Moda (Mo)",
"Mediana (Me)",
"Media (X̄)",
"Varianza (V)",
"Desv. Estándar (Sd)",
"Coef. Variación (CV%)",
"Asimetría (As)",
"Curtosis (K)"
),
Valor = c(
"Fuente de Coordenadas",
"Cualitativa Nominal Dicotómica",
"CENTER_OF_SECTION — QUARTER_CALLS",
moda_val,
"—",
"—",
"—",
"—",
"—",
"—",
"—"
),
stringsAsFactors = FALSE
)
tabla_indicadores %>%
gt() %>%
tab_header(
title = md("**Tabla N°2: Indicadores Estadísticos**"),
subtitle = md("*Variable Cualitativa Nominal: Fuente de Coordenadas*")
) %>%
cols_label(
Indicador = md("**Indicador**"),
Valor = md("**Valor**")
) %>%
tab_style(
style = list(
cell_fill(color = "#2C2C2C"),
cell_text(color = "white", weight = "bold")
),
locations = cells_column_labels()
) %>%
tab_style(
style = cell_fill(color = "#F5F5F5"),
locations = cells_body(rows = seq(1, nrow(tabla_indicadores), by = 2))
) %>%
tab_style(
style = list(
cell_fill(color = "#D6D6D6"),
cell_text(weight = "bold")
),
locations = cells_body(
rows = Indicador == "Moda (Mo)",
columns = everything()
)
) %>%
tab_style(
style = cell_text(style = "italic", color = "gray40"),
locations = cells_body(
rows = Valor == "—",
columns = Valor
)
) %>%
tab_source_note(source_note = md("*Autor: Araujo Valeska*")) %>%
tab_options(
table.width = pct(60),
heading.title.font.size = px(16),
heading.subtitle.font.size = px(12),
table.font.size = px(13),
data_row.padding = px(6)
)
| Tabla N°2: Indicadores Estadísticos | |
| Variable Cualitativa Nominal: Fuente de Coordenadas | |
| Indicador | Valor |
|---|---|
| Variable | Fuente de Coordenadas |
| Tipo de variable | Cualitativa Nominal Dicotómica |
| Categorías (Rango) | CENTER_OF_SECTION — QUARTER_CALLS |
| Moda (Mo) | CENTER_OF_SECTION |
| Mediana (Me) | — |
| Media (X̄) | — |
| Varianza (V) | — |
| Desv. Estándar (Sd) | — |
| Coef. Variación (CV%) | — |
| Asimetría (As) | — |
| Curtosis (K) | — |
| Autor: Araujo Valeska | |
La variable Fuente de Coordenadas es una variable cualitativa nominal dicotómica cuyas categorías son CENTER_OF_SECTION y QUARTER_CALLS. Su valor más frecuente (moda) es CENTER_OF_SECTION, con una participación del 55.60% en la muestra, lo que evidencia que la mayoría de los arrendamientos de hidrocarburos en Kansas registran sus coordenadas utilizando este método de georreferenciación.
Autor: Araujo Valeska | Análisis Estadístico — Kansas Hydrocarbon Leases Dataset