Import data
# excel file
data <- read_excel("CliffordSalmonidDataApply5.xlsx")
data
## # A tibble: 2,808 × 9
## species date geo_group region losses dead discarded escaped
## <chr> <dttm> <chr> <chr> <dbl> <dbl> <dbl> <dbl>
## 1 salmon 2020-01-01 00:00:00 area 1 31425 28126 3299 0
## 2 salmon 2020-01-01 00:00:00 area 2 324116 277888 46113 0
## 3 salmon 2020-01-01 00:00:00 area 3 844829 776983 63770 0
## 4 salmon 2020-01-01 00:00:00 area 4 676852 623159 51823 0
## 5 salmon 2020-01-01 00:00:00 area 5 109269 97627 11424 0
## 6 salmon 2020-01-01 00:00:00 area 6 548921 531193 15710 0
## 7 salmon 2020-01-01 00:00:00 area 7 231487 228847 2640 0
## 8 salmon 2020-01-01 00:00:00 area 8 442659 431218 11228 0
## 9 salmon 2020-01-01 00:00:00 area 9 311127 308298 2212 0
## 10 salmon 2020-01-01 00:00:00 area 10 288849 281808 3120 0
## # ℹ 2,798 more rows
## # ℹ 1 more variable: other <dbl>
Apply the following dplyr verbs to your data
Filter rows
filter(data, region == 1 & discarded == 0)
## # A tibble: 95 × 9
## species date geo_group region losses dead discarded escaped
## <chr> <dttm> <chr> <chr> <dbl> <dbl> <dbl> <dbl>
## 1 salmon 2020-03-01 00:00:00 area 1 46337 46337 0 0
## 2 salmon 2020-08-01 00:00:00 area 1 147200 147200 0 0
## 3 salmon 2021-07-01 00:00:00 area 1 4287 4287 0 0
## 4 salmon 2021-08-01 00:00:00 area 1 12109 12109 0 0
## 5 salmon 2021-09-01 00:00:00 area 1 60633 60633 0 0
## 6 salmon 2022-02-01 00:00:00 area 1 15847 15847 0 0
## 7 salmon 2022-03-01 00:00:00 area 1 13198 13198 0 0
## 8 salmon 2022-04-01 00:00:00 area 1 12340 12340 0 0
## 9 salmon 2022-05-01 00:00:00 area 1 15742 15742 0 0
## 10 salmon 2022-06-01 00:00:00 area 1 18893 18893 0 0
## # ℹ 85 more rows
## # ℹ 1 more variable: other <dbl>
Arrange rows
arrange(data, desc(region), desc(discarded))
## # A tibble: 2,808 × 9
## species date geo_group region losses dead discarded escaped
## <chr> <dttm> <chr> <chr> <dbl> <dbl> <dbl> <dbl>
## 1 salmon 2024-05-01 00:00:00 county Vestla… 1.00e6 7.80e5 214513 0
## 2 salmon 2020-05-01 00:00:00 county Vestla… 1.28e6 1.02e6 206727 0
## 3 salmon 2021-01-01 00:00:00 county Vestla… 1.42e6 1.22e6 203090 33
## 4 salmon 2020-10-01 00:00:00 county Vestla… 1.89e6 1.71e6 174622 4824
## 5 salmon 2020-11-01 00:00:00 county Vestla… 2.03e6 1.85e6 165470 0
## 6 salmon 2020-06-01 00:00:00 county Vestla… 1.38e6 1.21e6 164874 0
## 7 salmon 2020-12-01 00:00:00 county Vestla… 1.52e6 1.35e6 159810 0
## 8 salmon 2021-08-01 00:00:00 county Vestla… 1.31e6 1.15e6 145442 0
## 9 salmon 2023-09-01 00:00:00 county Vestla… 1.53e6 1.39e6 133937 0
## 10 salmon 2022-12-01 00:00:00 county Vestla… 1.57e6 1.43e6 133690 0
## # ℹ 2,798 more rows
## # ℹ 1 more variable: other <dbl>
Select columns
select(data, geo_group, region, date)
## # A tibble: 2,808 × 3
## geo_group region date
## <chr> <chr> <dttm>
## 1 area 1 2020-01-01 00:00:00
## 2 area 2 2020-01-01 00:00:00
## 3 area 3 2020-01-01 00:00:00
## 4 area 4 2020-01-01 00:00:00
## 5 area 5 2020-01-01 00:00:00
## 6 area 6 2020-01-01 00:00:00
## 7 area 7 2020-01-01 00:00:00
## 8 area 8 2020-01-01 00:00:00
## 9 area 9 2020-01-01 00:00:00
## 10 area 10 2020-01-01 00:00:00
## # ℹ 2,798 more rows
Add columns
mutate(data,
total_sum = losses, discarded, escaped) %>%
# rename new column
rename(totalnotdead=total_sum)
## # A tibble: 2,808 × 10
## species date geo_group region losses dead discarded escaped
## <chr> <dttm> <chr> <chr> <dbl> <dbl> <dbl> <dbl>
## 1 salmon 2020-01-01 00:00:00 area 1 31425 28126 3299 0
## 2 salmon 2020-01-01 00:00:00 area 2 324116 277888 46113 0
## 3 salmon 2020-01-01 00:00:00 area 3 844829 776983 63770 0
## 4 salmon 2020-01-01 00:00:00 area 4 676852 623159 51823 0
## 5 salmon 2020-01-01 00:00:00 area 5 109269 97627 11424 0
## 6 salmon 2020-01-01 00:00:00 area 6 548921 531193 15710 0
## 7 salmon 2020-01-01 00:00:00 area 7 231487 228847 2640 0
## 8 salmon 2020-01-01 00:00:00 area 8 442659 431218 11228 0
## 9 salmon 2020-01-01 00:00:00 area 9 311127 308298 2212 0
## 10 salmon 2020-01-01 00:00:00 area 10 288849 281808 3120 0
## # ℹ 2,798 more rows
## # ℹ 2 more variables: other <dbl>, totalnotdead <dbl>
Summarize by groups
data %>%
group_by(region) %>%
summarise(region_totaldead = mean(dead, na.rm=TRUE)) %>%
arrange(region_totaldead)
## # A tibble: 23 × 2
## region region_totaldead
## <chr> <dbl>
## 1 Akershus 0
## 2 13 14347.
## 3 1 39104.
## 4 Agder 39104.
## 5 5 149260.
## 6 2 169258.
## 7 10 170171.
## 8 9 174718.
## 9 Rogaland 182980.
## 10 11 223310.
## # ℹ 13 more rows