eko2 proje

R VE R STUDIO

-r ve r studio indirdim -r markdown ile dosyamı açıp proje adını yazdım -vize proje konumu belirledim -https://data.worldbank.org/indicator güncel veri kanalından faydalanarak konu ile ilgili verileri edindim -program dilini keşfederek programı öğrenmeye başladım -sunuma başlarken program hakkında kısa bilgi geçtim -kullanabileceğimiz bir kaç paket örneği vererek asıl konum ve verilerimle iligili sunuma geçtim -bu süreçte bizim için faydalı olan teams video kaydıyla ilerledim -aynı zamanda https://demir.pw/courses/r-ekonometri-1/ öğretim görevlimiz Hüseyin Utku Demir’in sitesinde paylaştığı bilgilerden de faydalanarak ilerledim -birkaç gerekli paketleri alıştırarak devam ettim -verileri değerlendirip, işledim -rahat anlaşılabilmesi için grafik şemaları üzerinde gösterdim -gereksiz verileri temizledim -temizlenen verilerin değerlendirilmesi -konu çeşitliliği ile şimdilik sonlandırmış bulunmaktayım :)

R NEDİR? VE KİMLER KULLANIR?

R, çok geniş istatistiki (doğrusal ve doğrusal olmayan modelleme, klasik istatistik testleri, zaman serileri analizi, sınıflandırma, kümeleme ve diğer) ve grafik çizim teknikleri sunmaktadır. Bu nedenle veri bilimciler ve analistler arasında oldukça popülerdir.

NEDEN R ?

R ile Python kullanım alanı oldukça benzerdir. Peki o zaman neden veya hangi durumlarda R’ı tercih edebiliriz?

Python’un kullanım alanı R’a göre daha geneldir. Python istatistiksel hesaplamalarla birlikte yazılım geliştirmeyi de kapsar. Fakat R’ın amacı istatistiksel analiz yapmaktır ve bu alanda Python’a göre kullanıcılarına daha çok paket sunmaktadır.

tidyverse,

# düzenli veri analizi ve sunumu için birçok paket içerir

##dplyr, # data yönetimi

##tidyr, # data yönetimi

##ggplot2, # data gösterimi

##stringr, # dizeler ve karakterlerle çalışma

##forcats, # faktörlerle çalışma

##lubridate, # tarihlerle çalışma

##purrr, # yineleme ve listelerle çalışma

-https://data.worldbank.org/indicator/IC.TAX.LABR.CP.ZS (kar vergisi)

-https://data.worldbank.org/indicator/IC.TAX.PRFT.CP.ZS (işgücü vergisi)

library(WDI)
library(tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.1.4     ✔ readr     2.1.5
## ✔ forcats   1.0.0     ✔ stringr   1.5.1
## ✔ ggplot2   3.5.0     ✔ tibble    3.2.1
## ✔ lubridate 1.9.3     ✔ tidyr     1.3.1
## ✔ purrr     1.0.2     
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
library(dplyr)
library(ggplot2)
library(explore)
data <- WDI(country = "all", indicator = c("IC.TAX.LABR.CP.ZS","IC.TAX.PRFT.CP.ZS","NY.GDP.MKTP.CD"),start = 2005,end = 2020)
describe_all(data)
## # A tibble: 7 × 8
##   variable          type     na na_pct unique        min     mean      max
##   <chr>             <chr> <int>  <dbl>  <int>      <dbl>    <dbl>    <dbl>
## 1 country           chr       0    0      266       NA   NA       NA      
## 2 iso2c             chr       0    0      266       NA   NA       NA      
## 3 iso3c             chr       0    0      262       NA   NA       NA      
## 4 year              int       0    0       16     2005    2.01e 3  2.02e 3
## 5 IC.TAX.LABR.CP.ZS dbl     859   20.2    958        0    1.60e 1  5.4 e 1
## 6 IC.TAX.PRFT.CP.ZS dbl     859   20.2    949       -0.2  1.66e 1  6.59e 1
## 7 NY.GDP.MKTP.CD    dbl     139    3.3   4087 22909980.   2.27e12  8.78e13
ekstra_data <- WDI_data$country
data_extra <- left_join(data, ekstra_data)
## Joining with `by = join_by(country, iso2c, iso3c)`
data_extra <- data_extra %>% filter(income != "Aggregates")
data_extra %>% describe_all()
## # A tibble: 13 × 8
##    variable          type     na na_pct unique        min     mean      max
##    <chr>             <chr> <int>  <dbl>  <int>      <dbl>    <dbl>    <dbl>
##  1 country           chr       0    0      215       NA   NA       NA      
##  2 iso2c             chr       0    0      215       NA   NA       NA      
##  3 iso3c             chr       0    0      215       NA   NA       NA      
##  4 year              int       0    0       16     2005    2.01e 3  2.02e 3
##  5 IC.TAX.LABR.CP.ZS dbl     793   23.1    359        0    1.60e 1  5.4 e 1
##  6 IC.TAX.PRFT.CP.ZS dbl     793   23.1    320       -0.2  1.66e 1  6.59e 1
##  7 NY.GDP.MKTP.CD    dbl     123    3.6   3318 22909980.   3.42e11  2.14e13
##  8 region            chr       0    0        7       NA   NA       NA      
##  9 capital           chr       0    0      210       NA   NA       NA      
## 10 longitude         chr       0    0      210       NA   NA       NA      
## 11 latitude          chr       0    0      210       NA   NA       NA      
## 12 income            chr       0    0        5       NA   NA       NA      
## 13 lending           chr       0    0        4       NA   NA       NA
eksik_veri <- data_extra[is.na(data_extra$NY.GDP.MKTP.CD),]
kayip_deger <- data_extra %>% group_by(country) %>% summarise(kayip = sum(is.na(NY.GDP.MKTP.CD)))
data <- left_join(data_extra,kayip_deger)
## Joining with `by = join_by(country)`
data <- data %>% filter(kayip < 1)
describe_all(data)
## # A tibble: 14 × 8
##    variable          type     na na_pct unique        min     mean      max
##    <chr>             <chr> <int>  <dbl>  <int>      <dbl>    <dbl>    <dbl>
##  1 country           chr       0    0      200       NA   NA       NA      
##  2 iso2c             chr       0    0      200       NA   NA       NA      
##  3 iso3c             chr       0    0      200       NA   NA       NA      
##  4 year              int       0    0       16     2005    2.01e 3  2.02e 3
##  5 IC.TAX.LABR.CP.ZS dbl     617   19.3    359        0    1.62e 1  5.4 e 1
##  6 IC.TAX.PRFT.CP.ZS dbl     617   19.3    317       -0.2  1.67e 1  6.59e 1
##  7 NY.GDP.MKTP.CD    dbl       0    0     3200 22909980.   3.53e11  2.14e13
##  8 region            chr       0    0        7       NA   NA       NA      
##  9 capital           chr       0    0      197       NA   NA       NA      
## 10 longitude         chr       0    0      200       NA   NA       NA      
## 11 latitude          chr       0    0      200       NA   NA       NA      
## 12 income            chr       0    0        4       NA   NA       NA      
## 13 lending           chr       0    0        4       NA   NA       NA      
## 14 kayip             int       0    0        1        0    0        0

veri analizi yapmaya başlama zamanı

turkiye <- data %>% filter(iso2c=="TR")
ggplot(turkiye, aes(x=year,y=IC.TAX.LABR.CP.ZS))+ geom_line(colur="red")+ labs(title= " türkiye 2005-2020 ye kadar işgücü vergisi ve katkı payları ")
## Warning in geom_line(colur = "red"): Ignoring unknown parameters: `colur`
## Warning: Removed 1 row containing missing values or values outside the scale range
## (`geom_line()`).

sene seçimi

data_2010 <- data %>% filter(year==2010)
ggplot(data_2010,aes(x=IC.TAX.LABR.CP.ZS,y=NY.GDP.MKTP.CD, label = iso2c,color = region)) + geom_point() + geom_text()
## Warning: Removed 35 rows containing missing values or values outside the scale range
## (`geom_point()`).
## Warning: Removed 35 rows containing missing values or values outside the scale range
## (`geom_text()`).

data_2010_1 <- data_2010 %>% filter(IC.TAX.LABR.CP.ZS > 10)
ggplot(data_2010_1,aes(x=NY.GDP.MKTP.CD,y=IC.TAX.LABR.CP.ZS, label = iso2c,colour = region)) + geom_point() + geom_text()

veriyi daha iyi yorumlamak için uçlardaki ülkeleri siliyoruz

data_2010_1a <- data_2010_1
data_2010_1a <- data_2010_1 %>% filter(iso2c !="CN")
data_2010_1a <- data_2010_1a %>% filter(iso2c !="BE")
data_2010_1a <- data_2010_1a %>% filter(iso2c !="FR")
data_2010_1a <- data_2010_1a %>% filter(iso2c !="IT")
ggplot(data_2010_1a,aes(x=IC.TAX.LABR.CP.ZS,y=NY.GDP.MKTP.CD, label = iso2c,colour = region)) + geom_point() + geom_text()

dünya toplam üretimi

world_data <- data %>% group_by(year) %>% summarise(nufus = sum(NY.GDP.MKTP.CD), karvergisi= sum(IC.TAX.PRFT.CP.ZS), kisibasi = sum(nufus/karvergisi))
ggplot(world_data, aes(x=year,y=karvergisi))+ geom_line()+ scale_y_continuous(labels = scales::comma)+ labs(title="2005-2020 yılları arası işgücü vergisi ve katkı payları")
## Warning: Removed 16 rows containing missing values or values outside the scale range
## (`geom_line()`).

ggplot(world_data,aes(x=year,y=karvergisi, colour="red"))+ geom_line()+ scale_y_continuous(labels = scales::comma)+ labs(title = "2005-2020  kar vergisi",x="yil", Y="kar vergisi")+ theme_classic()
## Warning: Removed 16 rows containing missing values or values outside the scale range
## (`geom_line()`).

data <- left_join(data,world_data, by="year")

ülke payları

Ülkenin senelik veremi nedir? Belirli bir ülkenin nüfüstaki payı nedir?

mutate

data <- data %>% mutate(karvergisi= (IC.TAX.PRFT.CP.ZS)/karvergisi, gsyih= NY.GDP.MKTP.CD/nufus, vergi = karvergisi/gsyih)
ggplot(data[2005:2020 , ], aes(x=year,y=gsyih))+ geom_line()+ labs(title = "2005-2020 yılları arasında Türkiye'nin GSYİH ")

data <- left_join(data,world_data, by="year")
ggplot(data[2005:2020, ], aes(x=year,y=gsyih))+
  geom_line()+
labs(title = "2005-2020 yılları arasında Türkiye'nin dünyadakı gsyih  orani")

kar vergisi ve işgücü

2010 yılını seçtim

data_2010 <- data %>% filter(year==2010)
ggplot(data_2010, aes(x=NY.GDP.MKTP.CD,y=gsyih, label = iso2c,colour = region)) + geom_point() + geom_text() + geom_hline(yintercept = 0)+theme_classic()

ülke sayınsını azatmak için avrupa ve asya kıtasına bakıyorum

data_2010_eu <- data_2010 %>% filter(region == "Europe & Central Asia")
ggplot(data_2010_eu,aes(x=NY.GDP.MKTP.CD,y=gsyih, label = iso2c,colour = region)) + geom_point() +
  geom_text()+ 
  geom_hline(yintercept = 0.0001)+ 
  scale_x_continuous(labels = scales::comma)+ theme_classic()+ labs(title="karvergisi ve gsyih ",x="karvergisi", y="gsyih")