1.Librerías

library(gt)
library(dplyr)
## 
## Adjuntando el paquete: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union

2.Leer datos

# =========================
# Cargar Datos
# =========================
datos <- read.csv(
  "waterPollution.csv",
  sep = ",",
  stringsAsFactors = FALSE
)

3.Selección de la variable

# =========================
# SELECCIÓN DE LA VARIABLE
# =========================
PAF <- datos$procedureAnalysedFraction

4. Tabla de distribución de frecuencias

# =========================
# Tabla con todos los daos
# =========================

# 1. Cambiar "total" en minúsculas para diferenciarlo de la suma final
PAF[PAF == "total"] <- "Total (Muestra Completa)"

# 2. Crear la tabla de frecuencias base con el dato corregido
TDF_PAF <- data.frame(table(PAF))

# 3. Calcular frecuencias absolutas (ni) y relativas porcentuales (hi)
ni <- TDF_PAF$Freq
hi <- round((ni / sum(ni)) * 100, 2)

# 4. Construir el data frame con las columnas deseadas
TDF_PAF <- data.frame(
  PAF = TDF_PAF$PAF, 
  ni, 
  hi
)

# 4. Crear la fila del TOTAL
Summary <- data.frame(
  PAF = "TOTAL", 
  ni = sum(ni), 
  hi = 100
)

# 6. Unir la tabla con el total y renombrar columnas
TDF_PAF_suma <- rbind(TDF_PAF, Summary)
colnames(TDF_PAF_suma) <- c("Fracción Analizada", "ni", "hi(%)")

# ==============================================================================
# FORMATO DE LA TABLA CON GT
# ==============================================================================

TDF_PAF_suma %>%
  gt() %>%
  tab_header(
    title = md("*Tabla Nro. 1*"),
    subtitle = md("**Distribución de frecuencias de las fracciones analizadas 
                  en el estudio de la calidad de agua en Europa (1991-2017)**")
  ) %>%
  tab_source_note(
    source_note = md("Autor: Grupo 3")
  ) %>%
  tab_options(
    table.border.top.color = "black",
    table.border.bottom.color = "black",
    table.border.top.style = "solid",
    table.border.bottom.style = "solid",
    column_labels.border.top.color = "black",
    column_labels.border.bottom.color = "black",
    column_labels.border.bottom.width = px(2),
    row.striping.include_table_body = TRUE,
    heading.border.bottom.color = "black",
    heading.border.bottom.width = px(2),
    table_body.hlines.color = "gray",
    table_body.border.bottom.color = "black"
  )
Tabla Nro. 1
Distribución de frecuencias de las fracciones analizadas en el estudio de la calidad de agua en Europa (1991-2017)
Fracción Analizada ni hi(%)
dissolved 146 0.73
SPM 44 0.22
Total (Muestra Completa) 19810 99.05
TOTAL 20000 100.00
Autor: Grupo 3

5. Gráficas

5.1 Diagrama de barras de cantidad

# =========================================
# Diagrama de barras genrado por RStudio 
# =========================================

barplot(ni,
        main = "Gráfica N°1: Distribución de las fracciones analizadas, en el estudio 
        de la calidad de agua en Europa (1991-2017)",
        xlab = "Fracción Analizada",
        ylab = "Cantidad",
        col = "royalblue1",
        ylim = c(0,19000),
        las = 1,
        cex.names = 0.8,
        names.arg = TDF_PAF$PAF)

# ===========================================================
# Diagrama de barras con relación a la totalidad de los datos
# ===========================================================

barplot(ni,
        main = "Gráfica N°2: Distribución de las fracciones analizadas, en el 
        estudio de la calidad de agua en Europa (1991-2017)",
        xlab = "Fracción Analizada",
        ylab = "Cantidad",
        col = "royalblue3",
        ylim = c(0,20000),
        las = 1,
        cex.names = 0.8,
        names.arg = TDF_PAF$PAF)

5.2 Diagrama de barras porcentuales

# ======================================
# Diagrama de barras que genera RStudio
# ======================================

barplot(hi,
        main = "Gráfica N°3: Distribución porcentual de las fracciones analizadas, 
        en el estudio de la calidad de agua en Europa (1991-2017)",
        xlab = "Fraccón Analizada",
        ylab = "Porcentaje (%)",
        col = "royalblue1",
        ylim = c(0,98),
        las = 1,
        cex.names = 0.8,
        names.arg = TDF_PAF$PAF)

# ===========================================================
# Diagrama de barras porcentual con relación a la totalidad 
# ===========================================================

barplot(hi,
        main = "Gráfica N°4: Distribución porcentual de las fracciones analizadas,
        en el estudio de la calidad de agua en Europa (1991-2017)",
        xlab = "Fracción Analizada",
        ylab = "Porcentaje (%)",
        col = "royalblue3",
        ylim = c(0,100),
        las = 1,
        cex.names = 0.8,
        names.arg = TDF_PAF$PAF)

5.3 Diagrama circular

# ======================================
# Diagrama de circular con hi
# ======================================
etiquetas <- paste0(hi, " %")

colores <- c("skyblue3", "steelblue", "lightsteelblue2", "lightsalmon", "wheat", "yellow",
             "lemonchiffon", "lightblue", "green", "chocolate")

par(mar = c(2, 2, 4, 6))

pie(
  hi,
  labels = etiquetas,
  col = colores,
  main = "Gráfica N°5: Distribución de las fracciones analizadas, en el 
  estudio de la calidad de agua en Europa (1991-2017)",
  cex = 0.6
)

legend(
  "topright",
  legend = TDF_PAF$PAF,
  fill = colores,
  title = "Leyenda",
  cex = 0.8,
  xpd = TRUE
)

6. Indicadores estadísticos

# ======================================
# Indicadores Estadísticos
# ======================================

# 1. CÁLCULO DE LA MODA (Mo)

TDF_solo_PAF <- TDF_PAF_suma[TDF_PAF_suma$`Fracción Analizada` != "TOTAL", ]
Moda_row_PAF <- TDF_solo_PAF[which.max(TDF_solo_PAF$ni), ]
Mo_PAF <- as.character(Moda_row_PAF$`Fracción Analizada`[1])

# 2. CREACIÓN DE LA TABLA DE INDICADORES
tabla_indicadores_PAF <- data.frame(
  "Variable" = c("PAF"),
  "Rango" = "-",
  "X" = "-",
  "Me" = "-",
  "Mo" = c(Mo_PAF),
  "V" = "-",
  "Sd" = "-",
  "Cv" = "-",
  "As" = "-",
  "K" = "-",
  "Valores Atipicos" = "-"
)

# 3. FORMATO DE LA TABLA CON GT
tabla_indicadores_PAF %>%
  gt() %>%
  tab_header(
    title = md("*Tabla Nro. 2*"),
    subtitle = md("**Indicadores Estadísticos de las fracciones analizadas en 
                  el estudio de la calidad de agua en Europa (1991-2017)**")
  ) %>%
  tab_source_note(
    source_note = md("Autor: Grupo 3")
  ) %>%
  tab_options(
    table.border.top.color = "black",
    table.border.bottom.color = "black",
    table.border.top.style = "solid",
    table.border.bottom.style = "solid",
    column_labels.border.top.color = "black",
    column_labels.border.bottom.color = "black",
    column_labels.border.bottom.width = px(2),
    row.striping.include_table_body = TRUE,
    heading.border.bottom.color = "black",
    heading.border.bottom.width = px(2),
    table_body.hlines.color = "gray",
    table_body.border.bottom.color = "black"
  )
Tabla Nro. 2
Indicadores Estadísticos de las fracciones analizadas en el estudio de la calidad de agua en Europa (1991-2017)
Variable Rango X Me Mo V Sd Cv As K Valores.Atipicos
PAF - - - Total (Muestra Completa) - - - - - -
Autor: Grupo 3

7. Conclusión

El valor más frecuente de la variable fracción analizada se encuentra en Total (Muestra Completa).