Ekonometri Vize Sınavı

Kggle Projesi

İlk Proje

  1. R Yüklemek
  2. Rmarkdown Başlangıç
  3. Web Sayfasını Hazırlama
  4. İnternete Yüklemek

Birnci soru en sevdiğiniz formül yazınız?

Formül Yazmak (En sevdiğim frmül)

\[\begin{aligned} &t=\sqrt{\frac{\ln (c)}{-2 \lambda \sqrt{c}}} \quad f(x)=\frac{1}{\sqrt{2 \pi \sigma}} e^{-\frac{(x-\mu)^2}{2 \sigma^2}}\\ &H(X)=-\sum_{i=1} P\left(x_i\right) \log _b P\left(x_i\right) \end{aligned}\]

##İkinci İki tane ülke seçin ve grafiğin gösteriniz?

##Teknoloji

##Bilim Teknolojisi Yüksek Teknoloji ürünlerinin İhracatı (% imal edilen ihracat)

Yüksek teknoloji ihracatı, bir ülkenin ekonomik gücünü ve yenilik kapasitesini yansıtan önemli bir göstergedir. Bu ölçüt, üretilen ihracatın yüzdesini temsil ederek, bir ülkenin bilgi ve teknoloji yoğun ürünleri uluslararası arenada ne kadar etkili bir şekilde satabildiğini gösterir. Bu projede, dünya genelindeki yüksek teknoloji ihracatının zaman içindeki değişimini analiz ederek, ülkeler arasındaki rekabet gücünü ve teknolojiye olan bağımlılıklarını inceleyeceğiz.

Bu projede, dünya genelindeki yüksek teknoloji ürünlerinin ihracatını (TX.VAL.TECH.MF.ZS) incelemek için Dünya Bankası verilerini kullanıyoruz ve bunu ülkelerin nüfus verileri (SP.POP.TOTL) ile birleştiriyoruz. Dünya Bankası’nın sunduğu çeşitli ekonomik göstergeleri analiz ederek, ülkelerin yüksek teknoloji ihracatındaki değişimleri anlamaya çalışacağız.

library(WDI)
library(ggplot2)
Data_WDI <- WDI(country = "all", indicator = c("TX.VAL.TECH.MF.ZS","SP.POP.TOTL"), start = 2000)

Ülke seçimi ve grafiği

Verilerimizi temizledikten sonra, şimdi bu veri kümesindeki bilgilere dayanarak analizler yapacağız.

İlk olarak, bir ülkeyi seçip o ülkenin yüksek enflasyonu (yüzde olarak imal edilen enflasyon) analiz edeceğiz. Ben seçtiğim ülkeyi Abd,Japonya,Çin olarak belirleyeceğim.

library(ggplot2)

veri <- data.frame(
  Ülke = c("ABD", "Çin", "Japonya"),
  GSYIH = c(21.43, 14.34, 5.08)
)

ggplot(veri, aes(x = Ülke, y = GSYIH, fill = Ülke)) +
  geom_bar(stat = "identity") +
  labs(title = "ABD, Çin ve Japonya'nın GSYIH Karşılaştırması",
       x = "Ülke",
       y = "GSYIH (trilyon dolar)") +
  theme_minimal()

Ortalama,Standart Sapma, Kovaryans ve Korelasyon Nedir?

  1. Formüllerini Yazın-Örnek Yazın
  2. Örneği çözün

(Açıklaması)

  1. Ortalama (Mean): Bir veri kümesindeki değerlerin toplamının, bu veri kümesindeki eleman sayısına bölünmesiyle elde edilen değerdir. Genellikle veri kümesinin merkezini temsil eder.

  2. Standart Sapma (Standard Deviation): Bir veri kümesindeki değerlerin ne kadar dağıldığını ölçen bir istatistiksel terimdir. Standart sapma, her bir veri noktasının ortalama ile arasındaki farkın karelerinin toplamının, bu farkların sayısına bölünüp karekök alınmasıyla elde edilir. Düşük standart sapma, veri noktalarının ortalama etrafında yoğunlaştığını, yüksek standart sapma ise veri noktalarının daha fazla dağıldığını gösterir.

Formullerini (Standart Sapma)

Rassal değişken için standart sapma Bir rassal değişken olan X için standart sapma şöyle tanımlanır:

\[ {\displaystyle {\begin{array}{lcl}\sigma &=&{\sqrt {\operatorname {E} ((X-\operatorname {E} (X))^{2})}}={\sqrt {\operatorname {E} (X^{2})-(\operatorname {E} (X))^{2}}}\\&=&{\sqrt {\operatorname {Var} (X)}}\end{array}}}\] Önce, X için ortalama {x}}}, şu toplam olarak tanımlanır:

\[ {\displaystyle {\overline {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}={\frac {x_{1}+x_{2}+\cdots +x_{n}}{n}}}\] Burada N alınan örneklem büyüklüğü sayısıdır.

Sonra, standart sapma ifadesi şöyle basitleştirilir:

\[ {\displaystyle \sigma ={\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}.}\] Yani, bir aralıklı tekdüze dağılım gösteren rassal değişken X için standart sapma şöyle hesaplanır:

x_{i}} değeri için xi le ortalama değer olan {x}}} arasında olan farklar {x}}} olarak bulunur. (1)Bu farkların kareleri hesaplanır. (2)Bu farkların karelerinin ortalaması bulunur. Bu değer varyans, yani σ2, olur. (3)Bu varyans değerinin kare kökü alınır. Ancak hesapları elle veya el hesap makinesi ile yapmak için genellikle daha uygun bir formül kullanılır:

\[ {\displaystyle \sigma ={\sqrt {{\frac {1}{n}}\left(\sum _{i=1}^{n}x_{i}^{2}-n{\overline {x}}^{2}\right)}}.}\] Bu iki formülün birbire eşitliği biraz cebir kullanılarak gösterilebilir:

\[ {\displaystyle {\begin{aligned}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}&={}\sum _{i=1}^{n}(x_{i}^{2}-2x_{i}{\overline {x}}+{\overline {x}}^{2})\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-\left(2{\overline {x}}\sum _{i=1}^{n}x_{i}\right)+n{\overline {x}}^{2}\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-2{\overline {x}}(n{\overline {x}})+n{\overline {x}}^{2}\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-n{\overline {x}}^{2}.\end{aligned}}}\]

Örneğin Burada önce çok ufak bir anakütle veri serisi için standart sapma hesaplaması gösterilmektedir. Bu seri bir inşaat firmasının yabancılara yaptığı aylık daire satış sayılarını göstermektedir ve veri serisi şudur: { 5, 2, 11, 12, 3, 6 }.

  1. Önce bir aritmetik ortalama {x}}} şöyle hesaplanır:

\[ {\displaystyle {\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\,\,.}\] Burada i her veriye verilen sıra numarasıdır yani i=1,2,3,…,6. Yani

     X1=5
     X2=2
     X3=11
     X4=12
     X5=3
     X6=6
     Bu halde N = 6 olup veri büyüklüğü veya anakütle hacmidir.

Bu halde N = 6 olup veri büyüklüğü veya anakütle hacmidir. N yerine 6

\[{\displaystyle {\overline {x}}={\frac {1}{6}}\sum _{i=1}^{6}x_{i}} N yerine 6\]

\[{\displaystyle {\overline {x}}={\frac {1}{6}}\left(x_{1}+x_{2}+x_{3}+x_{4}+x_{5}+x_{6}\right)} \] \[{\displaystyle {\overline {x}}={\frac {1}{6}}\left(5+2+11+12+3+6\right)}\] \[{\displaystyle {\overline {x}}=6.5} Bu aritmetik ortalamadır.\] 2. Standart sapma değerini bulma:

\[{\displaystyle {\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\,\,.} \]

\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\sum _{i=1}^{6}(x_{i}-{\overline {x}})^{2}}}} N yerine 6\]

\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\sum _{i=1}^{6}(x_{i}-6.5)^{2}}}} {\displaystyle {\overline {x}}} yerine 6.5 \]

\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left[(5-6.5)^{2}+(2-6.5)^{2}+(11-6.5)^{2}+(12-6.5)^{2}+(3-6.5)^{2}+(6-6.5)^{2}\right]}}}\]

\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left((-1.5)^{2}+(-4.5)^{2}+(4.5)^{2}+(5.5)^{2}+(-3.5)^{2}+(-0.5)^{2}\right)}}}\]

\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left(2.25+20.25+20.25+30.25+12.25+0.25\right)}}} \]

\[{\displaystyle \sigma ={\sqrt {\frac {85.5}{6}}}}\]

\[{\displaystyle \sigma ={\sqrt {14.25}}} \]

\[{\displaystyle \sigma =3.77\,\!} Bu standart sapma değeri olur.\]

Bu sonucun dikkati çekecek bir yanı verilerin tam sayı olmasına rağmen standart sapmanın (ve ayni şekilde aritmetik ortalamanın) kesirli olmasıdır.

Bu hesaplamayı daha kolaylaştırmak için şu formül kullanılabilir:

Bu standart sapma değeri olur.

  1. Kovaryans (Covariance): İki değişken arasındaki ilişkinin değişkenliğini ölçer. Negatif bir kovaryans, bir değişkenin değeri artarken diğerinin azaldığını gösterirken, pozitif bir kovaryans, iki değişkenin birlikte arttığını gösterir. Kovaryansın mutlak değeri, değişkenler arasındaki ilişkinin gücünü gösterir.

Kovaryans Formülü

     Burada

Cov(X,Y) kovaryans,

ise X ve Y değişkenlerinin ortalama değerleri, ise veri kümesindeki X ve Y değişkenlerinin her bir değeri temsil eder.

\[{\displaystyle \operatorname {Cov} \left(\sum _{i=1}^{n}{X_{i}},\sum _{j=1}^{m}{Y_{j}}\right)=\sum _{i=1}^{n}{\sum _{j=1}^{m}{\operatorname {Cov} \left(X_{i},Y_{j}\right)}}.\,}\]

örnek çözum

  Bir seri rastsal değişken X1, ..., Xn ve sabitler a1, ..., an için şu ifade bulunabilir:

\[{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{n}a_{i}X_{i}\right)=\sum _{i=1}^{n}a_{i}^{2}\operatorname {Var} (X_{i})+2\sum _{i,j\,:\,i<j}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j}).}\]

  1. Korelasyon (Correlation): İki değişken arasındaki ilişkinin gücünü ve yönünü ölçer. Korelasyon katsayısı, genellikle -1 ile +1 arasında bir değer alır. Pozitif bir korelasyon, iki değişkenin birlikte arttığını gösterirken, negatif bir korelasyon ise bir değişken artarken diğerinin azaldığını gösterir. 0’a yakın bir korelasyon katsayısı, değişkenler arasında bir ilişki olmadığını gösterir. Korelasyon, kovaryansın standart sapmalarının çarpımına bölünmesiyle hesaplanır, bu da birimlerin bağımsızlığını sağlar ve -1 ile +1 arasında standartlaştırılmış bir değer elde edilmesini sağlar.

(Korelasyon Formül)

\[{\displaystyle \rho _{X,Y}={\mathrm {Cov} (X,Y) \over \sigma _{X}\sigma _{Y}}={E((X-\mu _{X})(Y-\mu _{Y})) \over \sigma _{X}\sigma _{Y}},}\]

Örnek çözum

E değişkenin matematiksel beklenti değerini, cov ise kovaryansı ifade eder,

μX = E(X) olduğundan, σX2 = E(X2) - E2(X) ve

Y, için de aynısı geçerli olduğundan, şu ifadeyi yazabiliriz: \[{\displaystyle \rho _{X,Y}={\frac {E(XY)-E(X)E(Y)}{{\sqrt {E(X^{2})-E^{2}(X)}}~{\sqrt {E(Y^{2})-E^{2}(Y)}}}}}\]

Makine Öğrenmesine (Açıklaması)

Description(Tanım)

İşte efsanevi Titanic ML yarışması - Makine Öğrenimi yarışmalarına dalmak ve Kaggle platformunun nasıl çalıştığıyla tanışmak için en iyi ilk meydan okuma.

Bu yarışma hakkında diğer kullanıcılarla konuşmak isterseniz, Discord’a katılın! Yarışmalar, iş ilanları ve kariyer tartışmaları, kaynaklar ve diğer veri bilimcileri ile sosyalleşme için kanallarımız var. İşte bağlantı: https://discord.gg/kaggle

Yarışma oldukça basit: Makine öğrenimi kullanarak, Titanic gemi enkazında hangi yolcuların hayatta kaldığını tahmin eden bir model oluşturun.

Daha fazla ayrıntı keşfetmek için aşağıdaki videoyu izleyin veya okumaya devam edin. Yarışmaya başlamak için hazır olduğunuzda, “Yarışmaya Katıl” düğmesine tıklayarak bir hesap oluşturun ve yarışma verilerine erişin. Ardından, ilk gönderiminizi nasıl yapacağınızı adım adım anlatan Alexis Cook’un Titanic Öğretici’sini inceleyin!

kaggle Projesi

Kozmik bir gizemi çözmek için veri bilimi becerilerinize ihtiyaç duyulan 2912 yılına hoş geldiniz. Dört ışık yılı öteden bir sinyal aldık ve işler pek iyi görünmüyor.

Uzay Gemisi Titanik, bir ay önce fırlatılan yıldızlararası bir yolcu gemisiydi. Gemide yaklaşık 13.000 yolcu bulunan gemi, güneş sistemimizden göçmenleri yakın yıldızların yörüngesinde bulunan üç yeni yaşanabilir dış gezegene taşımak üzere ilk yolculuğuna çıktı.

Dikkatsiz Uzay Gemisi Titanic, ilk varış noktası olan kavurucu 55 Cancri E’ye giderken Alpha Centauri’yi dönerken, bir toz bulutunun içine gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki 1000 yıl öncesindeki adaşı ile benzer bir kaderle karşılaştı. Gemi sağlam kalmasına rağmen yolcuların neredeyse yarısı alternatif bir boyuta nakledildi

Dataset Description(Veri Kümesi Açıklaması)

Bu yarışmada göreviniz, Uzay Gemisi Titanic’in uzay-zaman anomalisine çarpışması sırasında bir yolcunun alternatif bir boyuta taşınıp taşınmadığını tahmin etmektir. Bu tahminleri yapmanıza yardımcı olmak için, geminin hasar görmüş bilgisayar sisteminden kurtarılan bir dizi kişisel kayıt verilmiştir.

File and Data Field Descriptions(Dosya ve Veri Alanı Açıklamaları)

train.csv - Eğitim verisi olarak kullanılmak üzere yolcuların yaklaşık üçte ikisi (~8700) için kişisel kayıtlar

  • PassengerId - Her yolcu için benzersiz bir kimlik. Her kimlik gggg_pp formunda olup, gggg yolcunun seyahat ettiği grubu ve pp ise gruptaki sırasını belirtir. Bir grup içindeki insanlar genellikle aile üyeleridir, ancak her zaman değil.

  • HomePlanet - Yolcunun ayrıldığı gezegen, genellikle kalıcı ikamet ettikleri gezegen.

  • CryoSleep - Yolcunun seyahat süresince askıya alınma seçeneğini seçip seçmediğini belirtir. Kriyo uyku alan yolcular, kabinlerine hapsedilirler.

  • Cabin - Yolcunun kaldığı kabin numarası. Yan, genellikle P limanı için veya S sancak tarafı için olabilir, şeklindeki formunda deck/num/side şeklindedir.

  • Destination - Yolcunun iniş yapacağı gezegen.

  • Yaş - Yolcunun yaşı.

  • VIP - Yolcunun seyahat sırasında özel VIP hizmeti için ödeme yapıp yapmadığı.

  • RoomService - , FoodCourt, ShoppingMall, Spa, VRDeck - Yolcunun Spaceship Titanic’in birçok lüks olanaklarından her birinde fatura edilen miktar.

  • Ad - Yolcunun adı ve soyadı.

-Taşınan - Yolcunun başka bir boyuta taşınıp taşınmadığı. Bu, tahmin etmeye çalıştığınız sütun, hedef sütundur.

test.csv - Geriye kalan yolcuların yaklaşık üçte biri (~4300) için kişisel kayıtlar, test verisi olarak kullanılacak. Göreviniz, bu setteki yolcuların Taşınan değerini tahmin etmektir.

sample_submission.csv - Doğru formatta bir gönderim dosyası

PassengerId - Test setindeki her yolcu için kimlik. Taşınan - Hedef. Her bir yolcu için ya Doğru (True) ya da Yanlış (False) tahmin edin.

Train ve Test Yüklemek

library(readr)
test <- read_csv("test (1).csv")
## Rows: 4277 Columns: 13
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (2): CryoSleep, VIP
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
library(readr)
train <- read_csv("train (1).csv")
## Rows: 8693 Columns: 14
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (3): CryoSleep, VIP, Transported
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
head(train )
## # A tibble: 6 × 14
##   PassengerId HomePlanet CryoSleep Cabin Destination     Age VIP   RoomService
##   <chr>       <chr>      <lgl>     <chr> <chr>         <dbl> <lgl>       <dbl>
## 1 0001_01     Europa     FALSE     B/0/P TRAPPIST-1e      39 FALSE           0
## 2 0002_01     Earth      FALSE     F/0/S TRAPPIST-1e      24 FALSE         109
## 3 0003_01     Europa     FALSE     A/0/S TRAPPIST-1e      58 TRUE           43
## 4 0003_02     Europa     FALSE     A/0/S TRAPPIST-1e      33 FALSE           0
## 5 0004_01     Earth      FALSE     F/1/S TRAPPIST-1e      16 FALSE         303
## 6 0005_01     Earth      FALSE     F/0/P PSO J318.5-22    44 FALSE           0
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## #   VRDeck <dbl>, Name <chr>, Transported <lgl>
library(rmarkdown)
paged_table(train)
str(train)
## spc_tbl_ [8,693 × 14] (S3: spec_tbl_df/tbl_df/tbl/data.frame)
##  $ PassengerId : chr [1:8693] "0001_01" "0002_01" "0003_01" "0003_02" ...
##  $ HomePlanet  : chr [1:8693] "Europa" "Earth" "Europa" "Europa" ...
##  $ CryoSleep   : logi [1:8693] FALSE FALSE FALSE FALSE FALSE FALSE ...
##  $ Cabin       : chr [1:8693] "B/0/P" "F/0/S" "A/0/S" "A/0/S" ...
##  $ Destination : chr [1:8693] "TRAPPIST-1e" "TRAPPIST-1e" "TRAPPIST-1e" "TRAPPIST-1e" ...
##  $ Age         : num [1:8693] 39 24 58 33 16 44 26 28 35 14 ...
##  $ VIP         : logi [1:8693] FALSE FALSE TRUE FALSE FALSE FALSE ...
##  $ RoomService : num [1:8693] 0 109 43 0 303 0 42 0 0 0 ...
##  $ FoodCourt   : num [1:8693] 0 9 3576 1283 70 ...
##  $ ShoppingMall: num [1:8693] 0 25 0 371 151 0 3 0 17 0 ...
##  $ Spa         : num [1:8693] 0 549 6715 3329 565 ...
##  $ VRDeck      : num [1:8693] 0 44 49 193 2 0 0 NA 0 0 ...
##  $ Name        : chr [1:8693] "Maham Ofracculy" "Juanna Vines" "Altark Susent" "Solam Susent" ...
##  $ Transported : logi [1:8693] FALSE TRUE FALSE FALSE TRUE TRUE ...
##  - attr(*, "spec")=
##   .. cols(
##   ..   PassengerId = col_character(),
##   ..   HomePlanet = col_character(),
##   ..   CryoSleep = col_logical(),
##   ..   Cabin = col_character(),
##   ..   Destination = col_character(),
##   ..   Age = col_double(),
##   ..   VIP = col_logical(),
##   ..   RoomService = col_double(),
##   ..   FoodCourt = col_double(),
##   ..   ShoppingMall = col_double(),
##   ..   Spa = col_double(),
##   ..   VRDeck = col_double(),
##   ..   Name = col_character(),
##   ..   Transported = col_logical()
##   .. )
##  - attr(*, "problems")=<externalptr>
library(tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.1.4     ✔ stringr   1.5.1
## ✔ forcats   1.0.0     ✔ tibble    3.2.1
## ✔ lubridate 1.9.3     ✔ tidyr     1.3.1
## ✔ purrr     1.0.2     
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors

Verielrin gözlemlerini yerleri dolduralım(ailenum ve ailesira)fertlerine göre düzeltelim

veri <- separate(train,  PassengerId, into = c ("group_id", "sequence_number"), sep = "_", remove = FALSE)
tekrarlanan_grouplar <- veri %>%
  group_by(group_id) %>%
  filter(n() > 1) %>%
  pull(group_id)
veri <- veri %>%
  mutate(beraber_yolculuk_yapamlar = ifelse(group_id %in% tekrarlanan_grouplar, TRUE, FALSE))

Cabine üç ayırmak

  • Cabine bilgi çıkarmak
train[c('deck', 'num', 'side')] <- str_split_fixed(train$Cabin, '/', 3)
test[c('deck', 'num', 'side')] <- str_split_fixed(test$Cabin, '/', 3)
veri <- separate(veri, Cabin, into = c("deck1","num2","side3"), sep = , "/", remove = FALSE)
library(explore)
## Warning: le package 'explore' a été compilé avec la version R 4.3.3
describe_all(veri)
## # A tibble: 20 × 8
##    variable                  type     na na_pct unique   min   mean   max
##    <chr>                     <chr> <int>  <dbl>  <int> <dbl>  <dbl> <dbl>
##  1 PassengerId               chr       0    0     8693    NA  NA       NA
##  2 group_id                  chr       0    0     6217    NA  NA       NA
##  3 sequence_number           chr       0    0        8    NA  NA       NA
##  4 HomePlanet                chr     201    2.3      4    NA  NA       NA
##  5 CryoSleep                 lgl     217    2.5      3     0   0.36     1
##  6 Cabin                     chr     199    2.3   6561    NA  NA       NA
##  7 deck1                     chr     199    2.3      9    NA  NA       NA
##  8 num2                      chr     199    2.3   1818    NA  NA       NA
##  9 side3                     chr     199    2.3      3    NA  NA       NA
## 10 Destination               chr     182    2.1      4    NA  NA       NA
## 11 Age                       dbl     179    2.1     81     0  28.8     79
## 12 VIP                       lgl     203    2.3      3     0   0.02     1
## 13 RoomService               dbl     181    2.1   1274     0 225.   14327
## 14 FoodCourt                 dbl     183    2.1   1508     0 458.   29813
## 15 ShoppingMall              dbl     208    2.4   1116     0 174.   23492
## 16 Spa                       dbl     183    2.1   1328     0 311.   22408
## 17 VRDeck                    dbl     188    2.2   1307     0 305.   24133
## 18 Name                      chr     200    2.3   8474    NA  NA       NA
## 19 Transported               lgl       0    0        2     0   0.5      1
## 20 beraber_yolculuk_yapamlar lgl       0    0        2     0   0.45     1
İlk Yontem
veri2 <- veri %>% na.omit()

NOT: Bütün Train ve Test için Sıfırladım,

Bu ifade, “train”“test” için geçerlidir

veri çerçevesindeki “HomePlanet” sütununa erişir. HomePlanet” sütununun faktör olduğunu varsayarak, bu faktörün içinde bulunan benzersiz kategorik seviyeleri döndürür.

veri$HomePlanet <- as.factor(veri$HomePlanet)
veri$HomePlanet <- as.factor(veri$HomePlanet)
train <- train %>% mutate_if(is.character,as.factor)
library(ggplot2)

Burda Histogramım fotoğrafın yükledik

ggplot(train,aes(x=RoomService))+
  geom_histogram()
## `stat_bin()` using `bins = 30`. Pick better value with `binwidth`.
## Warning: Removed 181 rows containing non-finite outside the scale range
## (`stat_bin()`).

Mice Paketı boşlukları doldurmak için kulanır**

library(mice)
## Warning: le package 'mice' a été compilé avec la version R 4.3.3
## 
## Attachement du package : 'mice'
## L'objet suivant est masqué depuis 'package:stats':
## 
##     filter
## Les objets suivants sont masqués depuis 'package:base':
## 
##     cbind, rbind

NOT: Bildiklerim göre gezegenler ayırladık bütün boşluklar sıfırladık yani

train$HomePlanet <- addNA(train$HomePlanet)
levels(train$HomePlanet)[is.na(train$HomePlanet)] 
## character(0)
test$HomePlanet <- addNA(test$HomePlanet)
levels(test$HomePlanet)[is.na(test$HomePlanet)] 
## character(0)
train$CryoSleep <- addNA(train$CryoSleep)
levels(train$CryoSleep)[is.na(train$CryoSleep)] 
## character(0)
test$CryoSleep <- addNA(test$CryoSleep)
levels(test$CryoSleep)[is.na(test$CryoSleep)] 
## character(0)
train$Cabin <- addNA(train$Cabin)
levels(train$Cabin)[is.na(train$Cabin)]
## character(0)
test$Cabin <- addNA(test$Cabin)
levels(test$Cabin)[is.na(test$Cabin)] 
## character(0)
train$Destination <- addNA(train$Destination)
levels(train$Destination)[is.na(train$Destination)]
## character(0)
test$Destination <- addNA(test$Destination)
levels(test$Destination)[is.na(test$Destination)]
## character(0)
train$Age <- addNA(train$Age)
levels(train$Age)[is.na(train$Age)]
## character(0)
test$Age <- addNA(test$Age)
levels(test$Age)[is.na(test$Age)]
## character(0)
train$VIP <- addNA(train$VIP)
levels(train$VIP)[is.na(train$VIP)]
## character(0)
test$VIP <- addNA(test$VIP)
levels(test$VIP)[is.na(test$VIP)]
## character(0)
train$RoomService <- addNA(train$RoomService)
levels(train$RoomService)[is.na(train$RoomService)]
## character(0)
test$RoomService <- addNA(test$RoomService)
levels(test$RoomService)[is.na(test$RoomService)]
## character(0)
train$FoodCourt <- addNA(train$FoodCourt)
levels(train$FoodCourt)[is.na(train$FoodCourt)]
## character(0)
test$FoodCourt <- addNA(test$FoodCourt)
levels(test$FoodCourt)[is.na(test$FoodCourt)]
## character(0)
train$ShoppingMall <- addNA(train$ShoppingMall)
levels(train$ShoppingMall)[is.na(train$ShoppingMall)]
## character(0)
test$ShoppingMall <- addNA(test$ShoppingMall)
levels(test$ShoppingMall)[is.na(test$ShoppingMall)]
## character(0)
train$Spa <- addNA(train$Spa)
levels(train$Spa)[is.na(train$Spa)]
## character(0)
test$Spa <- addNA(test$Spa)
levels(test$Spa)[is.na(test$Spa)]
## character(0)
train$VRDeck <- addNA(train$VRDeck)
levels(train$VRDeck)[is.na(train$VRDeck)]
## character(0)
test$VRDeck <- addNA(test$VRDeck)
levels(test$VRDeck)[is.na(test$VRDeck)]
## character(0)
train$deck<- addNA(train$deck)
levels(train$deck)[is.na(train$deck)]
## character(0)
test$deck<- addNA(test$deck)
levels(test$deck)[is.na(test$deck)]
## character(0)
train$num<- addNA(train$num)
levels(train$num)[is.na(train$num)]
## character(0)
test$num<- addNA(test$num)
levels(test$num)[is.na(test$num)]
## character(0)
train$Name<- addNA(train$Name)
levels(train$Name)[is.na(train$Name)]
## character(0)
test$Name<- addNA(test$Name)
levels(test$Name)[is.na(test$Name)]
## character(0)
train$VRDeck<- addNA(train$VRDeck)
levels(train$VRDeck)[is.na(train$VRDeck)]
## character(0)
test$VRDeck<- addNA(test$VRDeck)
levels(test$VRDeck)[is.na(test$VRDeck)]
## character(0)
train$Spa<- addNA(train$Spa)
levels(train$Spa)[is.na(train$Spa)]
## character(0)
test$Spa<- addNA(test$Spa)
levels(test$Spa)[is.na(test$Spa)]
## character(0)
describe_all(train)
## # A tibble: 17 × 8
##    variable     type     na na_pct unique   min  mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl> <dbl> <dbl>
##  1 PassengerId  fct       0      0   8693    NA  NA      NA
##  2 HomePlanet   fct       0      0      4    NA  NA      NA
##  3 CryoSleep    fct       0      0      3    NA  NA      NA
##  4 Cabin        fct       0      0   6561    NA  NA      NA
##  5 Destination  fct       0      0      4    NA  NA      NA
##  6 Age          fct       0      0     81    NA  NA      NA
##  7 VIP          fct       0      0      3    NA  NA      NA
##  8 RoomService  fct       0      0   1274    NA  NA      NA
##  9 FoodCourt    fct       0      0   1508    NA  NA      NA
## 10 ShoppingMall fct       0      0   1116    NA  NA      NA
## 11 Spa          fct       0      0   1328    NA  NA      NA
## 12 VRDeck       fct       0      0   1307    NA  NA      NA
## 13 Name         fct       0      0   8474    NA  NA      NA
## 14 Transported  lgl       0      0      2     0   0.5     1
## 15 deck         fct       0      0      9    NA  NA      NA
## 16 num          fct       0      0   1818    NA  NA      NA
## 17 side         fct       0      0      3    NA  NA      NA
describe_all(test)
## # A tibble: 16 × 8
##    variable     type     na na_pct unique   min  mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl> <dbl> <dbl>
##  1 PassengerId  chr       0      0   4277    NA    NA    NA
##  2 HomePlanet   fct       0      0      4    NA    NA    NA
##  3 CryoSleep    fct       0      0      3    NA    NA    NA
##  4 Cabin        fct       0      0   3266    NA    NA    NA
##  5 Destination  fct       0      0      4    NA    NA    NA
##  6 Age          fct       0      0     80    NA    NA    NA
##  7 VIP          fct       0      0      3    NA    NA    NA
##  8 RoomService  fct       0      0    843    NA    NA    NA
##  9 FoodCourt    fct       0      0    903    NA    NA    NA
## 10 ShoppingMall fct       0      0    716    NA    NA    NA
## 11 Spa          fct       0      0    834    NA    NA    NA
## 12 VRDeck       fct       0      0    797    NA    NA    NA
## 13 Name         fct       0      0   4177    NA    NA    NA
## 14 deck         fct       0      0      9    NA    NA    NA
## 15 num          fct       0      0   1506    NA    NA    NA
## 16 side         chr       0      0      3    NA    NA    NA
veri <- veri %>%
  group_by(group_id)%>%
  mutate(homePlanet = if_else(is.na(HomePlanet),first(HomePlanet),HomePlanet))
veri <- veri %>% mutate(hp = if_else(is.na(homePlanet), "Earth",homePlanet))
summary(veri)
##  PassengerId          group_id         sequence_number     HomePlanet  
##  Length:8693        Length:8693        Length:8693        Earth :4602  
##  Class :character   Class :character   Class :character   Europa:2131  
##  Mode  :character   Mode  :character   Mode  :character   Mars  :1759  
##                                                           NA's  : 201  
##                                                                        
##                                                                        
##                                                                        
##  CryoSleep          Cabin              deck1               num2          
##  Mode :logical   Length:8693        Length:8693        Length:8693       
##  FALSE:5439      Class :character   Class :character   Class :character  
##  TRUE :3037      Mode  :character   Mode  :character   Mode  :character  
##  NA's :217                                                               
##                                                                          
##                                                                          
##                                                                          
##     side3           Destination             Age           VIP         
##  Length:8693        Length:8693        Min.   : 0.00   Mode :logical  
##  Class :character   Class :character   1st Qu.:19.00   FALSE:8291     
##  Mode  :character   Mode  :character   Median :27.00   TRUE :199      
##                                        Mean   :28.83   NA's :203      
##                                        3rd Qu.:38.00                  
##                                        Max.   :79.00                  
##                                        NA's   :179                    
##   RoomService        FoodCourt        ShoppingMall          Spa         
##  Min.   :    0.0   Min.   :    0.0   Min.   :    0.0   Min.   :    0.0  
##  1st Qu.:    0.0   1st Qu.:    0.0   1st Qu.:    0.0   1st Qu.:    0.0  
##  Median :    0.0   Median :    0.0   Median :    0.0   Median :    0.0  
##  Mean   :  224.7   Mean   :  458.1   Mean   :  173.7   Mean   :  311.1  
##  3rd Qu.:   47.0   3rd Qu.:   76.0   3rd Qu.:   27.0   3rd Qu.:   59.0  
##  Max.   :14327.0   Max.   :29813.0   Max.   :23492.0   Max.   :22408.0  
##  NA's   :181       NA's   :183       NA's   :208       NA's   :183      
##      VRDeck            Name           Transported     beraber_yolculuk_yapamlar
##  Min.   :    0.0   Length:8693        Mode :logical   Mode :logical            
##  1st Qu.:    0.0   Class :character   FALSE:4315      FALSE:4805               
##  Median :    0.0   Mode  :character   TRUE :4378      TRUE :3888               
##  Mean   :  304.9                                                               
##  3rd Qu.:   46.0                                                               
##  Max.   :24133.0                                                               
##  NA's   :188                                                                   
##   homePlanet        hp           
##  Earth :4621   Length:8693       
##  Europa:2153   Class :character  
##  Mars  :1776   Mode  :character  
##  NA's  : 143                     
##                                  
##                                  
## 
veri <- veri %>% mutate(hp = if_else(is.na(homePlanet), "Earth",homePlanet))
# veri$hp sütununu faktör değişkenine dönüştürme
veri$hp <- as.factor(veri$hp)
veri[401:600, c(2,4,21, 22 )]
## # A tibble: 200 × 4
## # Groups:   group_id [132]
##    group_id HomePlanet homePlanet hp    
##    <chr>    <fct>      <fct>      <fct> 
##  1 0438     Europa     Europa     Europa
##  2 0439     Europa     Europa     Europa
##  3 0441     Earth      Earth      Earth 
##  4 0442     Earth      Earth      Earth 
##  5 0444     Mars       Mars       Mars  
##  6 0444     <NA>       Mars       Mars  
##  7 0445     Earth      Earth      Earth 
##  8 0445     <NA>       Earth      Earth 
##  9 0446     Europa     Europa     Europa
## 10 0447     Earth      Earth      Earth 
## # ℹ 190 more rows
veri <- veri %>%
  group_by(group_id)%>%
  mutate(DestinationNasiz = if_else(is.na(Destination),first(Destination),Destination))
describe_all(veri)
## # A tibble: 23 × 8
##    variable        type     na na_pct unique   min  mean   max
##    <chr>           <chr> <int>  <dbl>  <int> <dbl> <dbl> <dbl>
##  1 PassengerId     chr       0    0     8693    NA NA       NA
##  2 group_id        chr       0    0     6217    NA NA       NA
##  3 sequence_number chr       0    0        8    NA NA       NA
##  4 HomePlanet      fct     201    2.3      4    NA NA       NA
##  5 CryoSleep       lgl     217    2.5      3     0  0.36     1
##  6 Cabin           chr     199    2.3   6561    NA NA       NA
##  7 deck1           chr     199    2.3      9    NA NA       NA
##  8 num2            chr     199    2.3   1818    NA NA       NA
##  9 side3           chr     199    2.3      3    NA NA       NA
## 10 Destination     chr     182    2.1      4    NA NA       NA
## # ℹ 13 more rows

TRAPPIST-1e

veri <- veri %>%mutate(DestinationNasiz = if_else(is.na(DestinationNasiz), "TRAPPIST-1e", DestinationNasiz))
veri$DestinationNasiz <- as.factor(veri$DestinationNasiz)
describe_all(train)
## # A tibble: 17 × 8
##    variable     type     na na_pct unique   min  mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl> <dbl> <dbl>
##  1 PassengerId  fct       0      0   8693    NA  NA      NA
##  2 HomePlanet   fct       0      0      4    NA  NA      NA
##  3 CryoSleep    fct       0      0      3    NA  NA      NA
##  4 Cabin        fct       0      0   6561    NA  NA      NA
##  5 Destination  fct       0      0      4    NA  NA      NA
##  6 Age          fct       0      0     81    NA  NA      NA
##  7 VIP          fct       0      0      3    NA  NA      NA
##  8 RoomService  fct       0      0   1274    NA  NA      NA
##  9 FoodCourt    fct       0      0   1508    NA  NA      NA
## 10 ShoppingMall fct       0      0   1116    NA  NA      NA
## 11 Spa          fct       0      0   1328    NA  NA      NA
## 12 VRDeck       fct       0      0   1307    NA  NA      NA
## 13 Name         fct       0      0   8474    NA  NA      NA
## 14 Transported  lgl       0      0      2     0   0.5     1
## 15 deck         fct       0      0      9    NA  NA      NA
## 16 num          fct       0      0   1818    NA  NA      NA
## 17 side         fct       0      0      3    NA  NA      NA