Import data

# excel file
data <- read_excel("CliffordSalmonidDataApply5.xlsx")
data
## # A tibble: 2,808 × 9
##    species date                geo_group region losses   dead discarded escaped
##    <chr>   <dttm>              <chr>     <chr>   <dbl>  <dbl>     <dbl>   <dbl>
##  1 salmon  2020-01-01 00:00:00 area      1       31425  28126      3299       0
##  2 salmon  2020-01-01 00:00:00 area      2      324116 277888     46113       0
##  3 salmon  2020-01-01 00:00:00 area      3      844829 776983     63770       0
##  4 salmon  2020-01-01 00:00:00 area      4      676852 623159     51823       0
##  5 salmon  2020-01-01 00:00:00 area      5      109269  97627     11424       0
##  6 salmon  2020-01-01 00:00:00 area      6      548921 531193     15710       0
##  7 salmon  2020-01-01 00:00:00 area      7      231487 228847      2640       0
##  8 salmon  2020-01-01 00:00:00 area      8      442659 431218     11228       0
##  9 salmon  2020-01-01 00:00:00 area      9      311127 308298      2212       0
## 10 salmon  2020-01-01 00:00:00 area      10     288849 281808      3120       0
## # ℹ 2,798 more rows
## # ℹ 1 more variable: other <dbl>

Apply the following dplyr verbs to your data

Filter rows

filter(data, region == 1 & discarded == 0)
## # A tibble: 95 × 9
##    species date                geo_group region losses   dead discarded escaped
##    <chr>   <dttm>              <chr>     <chr>   <dbl>  <dbl>     <dbl>   <dbl>
##  1 salmon  2020-03-01 00:00:00 area      1       46337  46337         0       0
##  2 salmon  2020-08-01 00:00:00 area      1      147200 147200         0       0
##  3 salmon  2021-07-01 00:00:00 area      1        4287   4287         0       0
##  4 salmon  2021-08-01 00:00:00 area      1       12109  12109         0       0
##  5 salmon  2021-09-01 00:00:00 area      1       60633  60633         0       0
##  6 salmon  2022-02-01 00:00:00 area      1       15847  15847         0       0
##  7 salmon  2022-03-01 00:00:00 area      1       13198  13198         0       0
##  8 salmon  2022-04-01 00:00:00 area      1       12340  12340         0       0
##  9 salmon  2022-05-01 00:00:00 area      1       15742  15742         0       0
## 10 salmon  2022-06-01 00:00:00 area      1       18893  18893         0       0
## # ℹ 85 more rows
## # ℹ 1 more variable: other <dbl>

Arrange rows

arrange(data, desc(region), desc(discarded))
## # A tibble: 2,808 × 9
##    species date                geo_group region  losses   dead discarded escaped
##    <chr>   <dttm>              <chr>     <chr>    <dbl>  <dbl>     <dbl>   <dbl>
##  1 salmon  2024-05-01 00:00:00 county    Vestla… 1.00e6 7.80e5    214513       0
##  2 salmon  2020-05-01 00:00:00 county    Vestla… 1.28e6 1.02e6    206727       0
##  3 salmon  2021-01-01 00:00:00 county    Vestla… 1.42e6 1.22e6    203090      33
##  4 salmon  2020-10-01 00:00:00 county    Vestla… 1.89e6 1.71e6    174622    4824
##  5 salmon  2020-11-01 00:00:00 county    Vestla… 2.03e6 1.85e6    165470       0
##  6 salmon  2020-06-01 00:00:00 county    Vestla… 1.38e6 1.21e6    164874       0
##  7 salmon  2020-12-01 00:00:00 county    Vestla… 1.52e6 1.35e6    159810       0
##  8 salmon  2021-08-01 00:00:00 county    Vestla… 1.31e6 1.15e6    145442       0
##  9 salmon  2023-09-01 00:00:00 county    Vestla… 1.53e6 1.39e6    133937       0
## 10 salmon  2022-12-01 00:00:00 county    Vestla… 1.57e6 1.43e6    133690       0
## # ℹ 2,798 more rows
## # ℹ 1 more variable: other <dbl>

Select columns

select(data, geo_group, region, date)
## # A tibble: 2,808 × 3
##    geo_group region date               
##    <chr>     <chr>  <dttm>             
##  1 area      1      2020-01-01 00:00:00
##  2 area      2      2020-01-01 00:00:00
##  3 area      3      2020-01-01 00:00:00
##  4 area      4      2020-01-01 00:00:00
##  5 area      5      2020-01-01 00:00:00
##  6 area      6      2020-01-01 00:00:00
##  7 area      7      2020-01-01 00:00:00
##  8 area      8      2020-01-01 00:00:00
##  9 area      9      2020-01-01 00:00:00
## 10 area      10     2020-01-01 00:00:00
## # ℹ 2,798 more rows

Add columns

mutate(data,
       total_sum = losses, discarded, escaped) %>%
    
    # rename new column
    rename(totalnotdead=total_sum)
## # A tibble: 2,808 × 10
##    species date                geo_group region losses   dead discarded escaped
##    <chr>   <dttm>              <chr>     <chr>   <dbl>  <dbl>     <dbl>   <dbl>
##  1 salmon  2020-01-01 00:00:00 area      1       31425  28126      3299       0
##  2 salmon  2020-01-01 00:00:00 area      2      324116 277888     46113       0
##  3 salmon  2020-01-01 00:00:00 area      3      844829 776983     63770       0
##  4 salmon  2020-01-01 00:00:00 area      4      676852 623159     51823       0
##  5 salmon  2020-01-01 00:00:00 area      5      109269  97627     11424       0
##  6 salmon  2020-01-01 00:00:00 area      6      548921 531193     15710       0
##  7 salmon  2020-01-01 00:00:00 area      7      231487 228847      2640       0
##  8 salmon  2020-01-01 00:00:00 area      8      442659 431218     11228       0
##  9 salmon  2020-01-01 00:00:00 area      9      311127 308298      2212       0
## 10 salmon  2020-01-01 00:00:00 area      10     288849 281808      3120       0
## # ℹ 2,798 more rows
## # ℹ 2 more variables: other <dbl>, totalnotdead <dbl>

Summarize by groups

data %>%
    group_by(region) %>%
    summarise(region_totaldead = mean(dead, na.rm=TRUE)) %>%
    arrange(region_totaldead)
## # A tibble: 23 × 2
##    region   region_totaldead
##    <chr>               <dbl>
##  1 Akershus               0 
##  2 13                 14347.
##  3 1                  39104.
##  4 Agder              39104.
##  5 5                 149260.
##  6 2                 169258.
##  7 10                170171.
##  8 9                 174718.
##  9 Rogaland          182980.
## 10 11                223310.
## # ℹ 13 more rows