1 _ Librerías

Carga de paquetes

library(readxl)
library(dplyr)
library(gt)
library(e1071)
library(lubridate)
library(MASS)
library(knitr)

2 _ Cargar datos

Importación del archivo

Datos_Brutos <- read.csv(  
  "tabela_de_pocos_janeiro_2018_convertido.csv",  
  header        = TRUE,  
  sep           = ",",  
  quote         = "\"",
  dec           = ".",  
  fileEncoding = "Latin1",
  fill          = TRUE
)
if(ncol(Datos_Brutos) < 5) {
  Datos_Brutos <- read.csv2(
    "tabela_de_pocos_janeiro_2018_convertido.csv",
    header        = TRUE,
    dec           = ",",
    fileEncoding = "Latin1",
    fill          = TRUE
  )
}

Metodología

El presente informe estadístico analiza la variable Conclusión de Perforación de pozos petroleros de Brasil, aplicando técnicas descriptivas e inferenciales bajo un enfoque estructurado

3 _ Variables

Filtrado de fechas

col_termino <- grep("TERMINO", names(Datos_Brutos), ignore.case = TRUE)

Datos <- Datos_Brutos %>%  
  mutate(    
    Fecha_Texto = as.character(.[[col_termino]]),
    Fecha_Obj   = ymd(Fecha_Texto),
    Anio        = year(Fecha_Obj)  ) %>%  
  filter(!is.na(Anio) & Anio >= 1920 & Anio <= 2020)

X <- Datos$Anio

4 _ Conteo

breaks_dec <- seq(1920, 2020, by = 10)
h_total    <- hist(X, breaks = breaks_dec, plot = FALSE)

TDF_General <- data.frame(  
  Decada = paste(head(breaks_dec, -1), tail(breaks_dec, -1), sep = "-"),  
  ni     = h_total$counts,  
  hi     = round((h_total$counts / sum(h_total$counts)) * 100, 2)
)

5 _ Tabla de distribución de frecuencias

Dado que la variable abarca casi un siglo (1920–2018), trabajar con años individuales generaría demasiado ruido estadístico. Por ello, agrupamos los datos en décadas (intervalos de 10 años). Esto nos permite visualizar la tendencia estructural y facilita el cálculo de probabilidades en los modelos continuos.

totales_simplificados <- data.frame(
  Decada = "TOTAL",
  ni     = sum(TDF_General$ni),
  hi     = 100
)

TDF_Inferencial <- TDF_General %>% mutate(Decada = as.character(Decada), ni = as.numeric(ni), hi = as.numeric(hi))
TDF_Show_Simple <- rbind(TDF_Inferencial, totales_simplificados)

TDF_Show_Simple %>%  
  gt() %>%  
  tab_header(    
    title    = md("TABLA DE FRECUENCIAS: INFERENCIA ESTADÍSTICA"),    
    subtitle = md("Variable: **Término de Perforación**")  ) %>%  
  tab_source_note(source_note = "Fuente: Tabela de Poços 2018") %>%  
  cols_label(    
    Decada = "Periodo (Década)",    
    ni     = "Frecuencia Absoluta (ni)",    
    hi     = "Frecuencia Relativa (hi%)"  ) %>%  
  cols_align(align = "center", columns = everything()) %>%  
  tab_style(style = list(cell_fill(color = "#2E4053"), cell_text(color = "white", weight = "bold")), locations = cells_title(groups = c("title", "subtitle"))) %>%  
  tab_style(style = list(cell_fill(color = "#F2F3F4"), cell_text(weight = "bold", color = "#2E4053")), locations = cells_column_labels())
TABLA DE FRECUENCIAS: INFERENCIA ESTADÍSTICA
Variable: Término de Perforación
Periodo (Década) Frecuencia Absoluta (ni) Frecuencia Relativa (hi%)
1920-1930 2 0.01
1930-1940 11 0.04
1940-1950 216 0.78
1950-1960 1018 3.67
1960-1970 2419 8.72
1970-1980 2893 10.43
1980-1990 9375 33.81
1990-2000 3382 12.20
2000-2010 4586 16.54
2010-2020 3827 13.80
TOTAL 27729 100.00
Fuente: Tabela de Poços 2018

6 _ Gráficas

Distribución general

col_barras <- "#5D6D7E"
col_ejes   <- "#2E4053"
par(mar = c(10, 5, 4, 2))

vals_x   <- TDF_General$Decada
vals_y   <- TDF_General$ni
ylim_max <- max(vals_y) * 1.1

bp <- barplot(  
  vals_y,  
  main      = "Gráfica N°1: Distribución de Fecha de Término de Pozos Petroleros de Brasil",  
  cex.main  = 0.9,  
  ylab      = "Cantidad de Pozos Finalizados",  
  col       = col_barras, 
  border    = "white",  
  axes      = FALSE, 
  ylim      = c(0, ylim_max), 
  axisnames = FALSE
)

axis(2, col = col_ejes, col.axis = col_ejes)
axis(1, at = bp, labels = vals_x, col = col_ejes, col.axis = col_ejes, las = 2, cex.axis = 0.9)
title(xlab = "Década", line = 8)
grid(nx = NA, ny = NULL, col = "#D7DBDD", lty = "dotted")
box(bty = "l", col = col_ejes)

7 _ Indicadores

Modelos probabilísticos y bondad de ajuste

Tabla N°2: Bondad de Ajuste - Agrupación 1
Modelo Chi_Cuadrado Umbral Decision
Poisson 4.6733 5.9915 Modelo aceptado
Autor: Ashly Alzate

Tabla N°3: Bondad de Ajuste - Agrupación 2
Modelo Chi_Cuadrado Umbral Decision
Poisson 4.4936 5.9915 Modelo aceptado
Autor: Ashly Alzate

8 _ Conclusión

Los valores de la Conclusión de Perforación fluctúan entre 1920 y 2018 y giran en torno a 1985, con una desviación estándar de 21.5, con valores atípicos identificados en los extremos, siendo un conjunto de datos heterogéneo, cuyos valores se agrupan medianamente en la parte media de la variable. Por lo anterior, el comportamiento es beneficioso para el análisis histórico de la actividad petrolera.