Ekonometri Vize Sınavı
Kggle Projesi
İlk Proje
- R Yüklemek
- Rmarkdown Başlangıç
- Web Sayfasını Hazırlama
- İnternete Yüklemek
Birnci soru en sevdiğiniz formül yazınız?
Formül Yazmak (En sevdiğim frmül)
\[\begin{aligned} &t=\sqrt{\frac{\ln (c)}{-2 \lambda \sqrt{c}}} \quad f(x)=\frac{1}{\sqrt{2 \pi \sigma}} e^{-\frac{(x-\mu)^2}{2 \sigma^2}}\\ &H(X)=-\sum_{i=1} P\left(x_i\right) \log _b P\left(x_i\right) \end{aligned}\]
##İkinci İki tane ülke seçin ve grafiğin gösteriniz?
##Teknoloji
##Bilim Teknolojisi Yüksek Teknoloji ürünlerinin İhracatı (% imal edilen ihracat)
Yüksek teknoloji ihracatı, bir ülkenin ekonomik gücünü ve yenilik kapasitesini yansıtan önemli bir göstergedir. Bu ölçüt, üretilen ihracatın yüzdesini temsil ederek, bir ülkenin bilgi ve teknoloji yoğun ürünleri uluslararası arenada ne kadar etkili bir şekilde satabildiğini gösterir. Bu projede, dünya genelindeki yüksek teknoloji ihracatının zaman içindeki değişimini analiz ederek, ülkeler arasındaki rekabet gücünü ve teknolojiye olan bağımlılıklarını inceleyeceğiz.
Bu projede, dünya genelindeki yüksek teknoloji ürünlerinin ihracatını (TX.VAL.TECH.MF.ZS) incelemek için Dünya Bankası verilerini kullanıyoruz ve bunu ülkelerin nüfus verileri (SP.POP.TOTL) ile birleştiriyoruz. Dünya Bankası’nın sunduğu çeşitli ekonomik göstergeleri analiz ederek, ülkelerin yüksek teknoloji ihracatındaki değişimleri anlamaya çalışacağız.
Ülke seçimi ve grafiği
Verilerimizi temizledikten sonra, şimdi bu veri kümesindeki bilgilere dayanarak analizler yapacağız.
İlk olarak, bir ülkeyi seçip o ülkenin yüksek enflasyonu (yüzde olarak imal edilen enflasyon) analiz edeceğiz. Ben seçtiğim ülkeyi Abd,Japonya,Çin olarak belirleyeceğim.
library(ggplot2)
veri <- data.frame(
Ülke = c("ABD", "Çin", "Japonya"),
GSYIH = c(21.43, 14.34, 5.08)
)
ggplot(veri, aes(x = Ülke, y = GSYIH, fill = Ülke)) +
geom_bar(stat = "identity") +
labs(title = "ABD, Çin ve Japonya'nın GSYIH Karşılaştırması",
x = "Ülke",
y = "GSYIH (trilyon dolar)") +
theme_minimal()Ortalama,Standart Sapma, Kovaryans ve Korelasyon Nedir?
- Formüllerini Yazın-Örnek Yazın
- Örneği çözün
(Açıklaması)
Ortalama (Mean): Bir veri kümesindeki değerlerin toplamının, bu veri kümesindeki eleman sayısına bölünmesiyle elde edilen değerdir. Genellikle veri kümesinin merkezini temsil eder.
Standart Sapma (Standard Deviation): Bir veri kümesindeki değerlerin ne kadar dağıldığını ölçen bir istatistiksel terimdir. Standart sapma, her bir veri noktasının ortalama ile arasındaki farkın karelerinin toplamının, bu farkların sayısına bölünüp karekök alınmasıyla elde edilir. Düşük standart sapma, veri noktalarının ortalama etrafında yoğunlaştığını, yüksek standart sapma ise veri noktalarının daha fazla dağıldığını gösterir.
Formullerini (Standart Sapma)
Rassal değişken için standart sapma Bir rassal değişken olan X için standart sapma şöyle tanımlanır:
\[ {\displaystyle {\begin{array}{lcl}\sigma &=&{\sqrt {\operatorname {E} ((X-\operatorname {E} (X))^{2})}}={\sqrt {\operatorname {E} (X^{2})-(\operatorname {E} (X))^{2}}}\\&=&{\sqrt {\operatorname {Var} (X)}}\end{array}}}\] Önce, X için ortalama {x}}}, şu toplam olarak tanımlanır:
\[ {\displaystyle {\overline {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}={\frac {x_{1}+x_{2}+\cdots +x_{n}}{n}}}\] Burada N alınan örneklem büyüklüğü sayısıdır.
Sonra, standart sapma ifadesi şöyle basitleştirilir:
\[ {\displaystyle \sigma ={\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}.}\] Yani, bir aralıklı tekdüze dağılım gösteren rassal değişken X için standart sapma şöyle hesaplanır:
x_{i}} değeri için xi le ortalama değer olan {x}}} arasında olan farklar {x}}} olarak bulunur. (1)Bu farkların kareleri hesaplanır. (2)Bu farkların karelerinin ortalaması bulunur. Bu değer varyans, yani σ2, olur. (3)Bu varyans değerinin kare kökü alınır. Ancak hesapları elle veya el hesap makinesi ile yapmak için genellikle daha uygun bir formül kullanılır:
\[ {\displaystyle \sigma ={\sqrt {{\frac {1}{n}}\left(\sum _{i=1}^{n}x_{i}^{2}-n{\overline {x}}^{2}\right)}}.}\] Bu iki formülün birbire eşitliği biraz cebir kullanılarak gösterilebilir:
\[ {\displaystyle {\begin{aligned}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}&={}\sum _{i=1}^{n}(x_{i}^{2}-2x_{i}{\overline {x}}+{\overline {x}}^{2})\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-\left(2{\overline {x}}\sum _{i=1}^{n}x_{i}\right)+n{\overline {x}}^{2}\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-2{\overline {x}}(n{\overline {x}})+n{\overline {x}}^{2}\\&{}=\left(\sum _{i=1}^{n}x_{i}^{2}\right)-n{\overline {x}}^{2}.\end{aligned}}}\]
Örneğin Burada önce çok ufak bir anakütle veri serisi için standart sapma hesaplaması gösterilmektedir. Bu seri bir inşaat firmasının yabancılara yaptığı aylık daire satış sayılarını göstermektedir ve veri serisi şudur: { 5, 2, 11, 12, 3, 6 }.
- Önce bir aritmetik ortalama {x}}} şöyle hesaplanır:
\[ {\displaystyle {\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\,\,.}\] Burada i her veriye verilen sıra numarasıdır yani i=1,2,3,…,6. Yani
X1=5
X2=2
X3=11
X4=12
X5=3
X6=6
Bu halde N = 6 olup veri büyüklüğü veya anakütle hacmidir.
Bu halde N = 6 olup veri büyüklüğü veya anakütle hacmidir. N yerine 6
\[{\displaystyle {\overline {x}}={\frac {1}{6}}\sum _{i=1}^{6}x_{i}} N yerine 6\]
\[{\displaystyle {\overline {x}}={\frac {1}{6}}\left(x_{1}+x_{2}+x_{3}+x_{4}+x_{5}+x_{6}\right)} \] \[{\displaystyle {\overline {x}}={\frac {1}{6}}\left(5+2+11+12+3+6\right)}\] \[{\displaystyle {\overline {x}}=6.5} Bu aritmetik ortalamadır.\] 2. Standart sapma değerini bulma:
\[{\displaystyle {\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}}}\,\,.} \]
\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\sum _{i=1}^{6}(x_{i}-{\overline {x}})^{2}}}} N yerine 6\]
\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\sum _{i=1}^{6}(x_{i}-6.5)^{2}}}} {\displaystyle {\overline {x}}} yerine 6.5 \]
\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left[(5-6.5)^{2}+(2-6.5)^{2}+(11-6.5)^{2}+(12-6.5)^{2}+(3-6.5)^{2}+(6-6.5)^{2}\right]}}}\]
\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left((-1.5)^{2}+(-4.5)^{2}+(4.5)^{2}+(5.5)^{2}+(-3.5)^{2}+(-0.5)^{2}\right)}}}\]
\[{\displaystyle \sigma ={\sqrt {{\frac {1}{6}}\left(2.25+20.25+20.25+30.25+12.25+0.25\right)}}} \]
\[{\displaystyle \sigma ={\sqrt {\frac {85.5}{6}}}}\]
\[{\displaystyle \sigma ={\sqrt {14.25}}} \]
\[{\displaystyle \sigma =3.77\,\!} Bu standart sapma değeri olur.\]
Bu sonucun dikkati çekecek bir yanı verilerin tam sayı olmasına rağmen standart sapmanın (ve ayni şekilde aritmetik ortalamanın) kesirli olmasıdır.
Bu hesaplamayı daha kolaylaştırmak için şu formül kullanılabilir:
Bu standart sapma değeri olur.
- Kovaryans (Covariance): İki değişken arasındaki ilişkinin değişkenliğini ölçer. Negatif bir kovaryans, bir değişkenin değeri artarken diğerinin azaldığını gösterirken, pozitif bir kovaryans, iki değişkenin birlikte arttığını gösterir. Kovaryansın mutlak değeri, değişkenler arasındaki ilişkinin gücünü gösterir.
Kovaryans Formülü
Burada
Cov(X,Y) kovaryans,
ise X ve Y değişkenlerinin ortalama değerleri, ise veri kümesindeki X ve Y değişkenlerinin her bir değeri temsil eder.
\[{\displaystyle \operatorname {Cov} \left(\sum _{i=1}^{n}{X_{i}},\sum _{j=1}^{m}{Y_{j}}\right)=\sum _{i=1}^{n}{\sum _{j=1}^{m}{\operatorname {Cov} \left(X_{i},Y_{j}\right)}}.\,}\]
örnek çözum
Bir seri rastsal değişken X1, ..., Xn ve sabitler a1, ..., an için şu ifade bulunabilir:
\[{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{n}a_{i}X_{i}\right)=\sum _{i=1}^{n}a_{i}^{2}\operatorname {Var} (X_{i})+2\sum _{i,j\,:\,i<j}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j}).}\]
- Korelasyon (Correlation): İki değişken arasındaki ilişkinin gücünü ve yönünü ölçer. Korelasyon katsayısı, genellikle -1 ile +1 arasında bir değer alır. Pozitif bir korelasyon, iki değişkenin birlikte arttığını gösterirken, negatif bir korelasyon ise bir değişken artarken diğerinin azaldığını gösterir. 0’a yakın bir korelasyon katsayısı, değişkenler arasında bir ilişki olmadığını gösterir. Korelasyon, kovaryansın standart sapmalarının çarpımına bölünmesiyle hesaplanır, bu da birimlerin bağımsızlığını sağlar ve -1 ile +1 arasında standartlaştırılmış bir değer elde edilmesini sağlar.
(Korelasyon Formül)
\[{\displaystyle \rho _{X,Y}={\mathrm {Cov} (X,Y) \over \sigma _{X}\sigma _{Y}}={E((X-\mu _{X})(Y-\mu _{Y})) \over \sigma _{X}\sigma _{Y}},}\]
Örnek çözum
E değişkenin matematiksel beklenti değerini, cov ise kovaryansı ifade eder,
μX = E(X) olduğundan, σX2 = E(X2) - E2(X) ve
Y, için de aynısı geçerli olduğundan, şu ifadeyi yazabiliriz: \[{\displaystyle \rho _{X,Y}={\frac {E(XY)-E(X)E(Y)}{{\sqrt {E(X^{2})-E^{2}(X)}}~{\sqrt {E(Y^{2})-E^{2}(Y)}}}}}\]
Makine Öğrenmesine (Açıklaması)
Description(Tanım)
İşte efsanevi Titanic ML yarışması - Makine Öğrenimi yarışmalarına dalmak ve Kaggle platformunun nasıl çalıştığıyla tanışmak için en iyi ilk meydan okuma.
Bu yarışma hakkında diğer kullanıcılarla konuşmak isterseniz, Discord’a katılın! Yarışmalar, iş ilanları ve kariyer tartışmaları, kaynaklar ve diğer veri bilimcileri ile sosyalleşme için kanallarımız var. İşte bağlantı: https://discord.gg/kaggle
Yarışma oldukça basit: Makine öğrenimi kullanarak, Titanic gemi enkazında hangi yolcuların hayatta kaldığını tahmin eden bir model oluşturun.
Daha fazla ayrıntı keşfetmek için aşağıdaki videoyu izleyin veya okumaya devam edin. Yarışmaya başlamak için hazır olduğunuzda, “Yarışmaya Katıl” düğmesine tıklayarak bir hesap oluşturun ve yarışma verilerine erişin. Ardından, ilk gönderiminizi nasıl yapacağınızı adım adım anlatan Alexis Cook’un Titanic Öğretici’sini inceleyin!
kaggle Projesi
Kozmik bir gizemi çözmek için veri bilimi becerilerinize ihtiyaç duyulan 2912 yılına hoş geldiniz. Dört ışık yılı öteden bir sinyal aldık ve işler pek iyi görünmüyor.
Uzay Gemisi Titanik, bir ay önce fırlatılan yıldızlararası bir yolcu gemisiydi. Gemide yaklaşık 13.000 yolcu bulunan gemi, güneş sistemimizden göçmenleri yakın yıldızların yörüngesinde bulunan üç yeni yaşanabilir dış gezegene taşımak üzere ilk yolculuğuna çıktı.
Dikkatsiz Uzay Gemisi Titanic, ilk varış noktası olan kavurucu 55 Cancri E’ye giderken Alpha Centauri’yi dönerken, bir toz bulutunun içine gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki 1000 yıl öncesindeki adaşı ile benzer bir kaderle karşılaştı. Gemi sağlam kalmasına rağmen yolcuların neredeyse yarısı alternatif bir boyuta nakledildi
Dataset Description(Veri Kümesi Açıklaması)
Bu yarışmada göreviniz, Uzay Gemisi Titanic’in uzay-zaman anomalisine çarpışması sırasında bir yolcunun alternatif bir boyuta taşınıp taşınmadığını tahmin etmektir. Bu tahminleri yapmanıza yardımcı olmak için, geminin hasar görmüş bilgisayar sisteminden kurtarılan bir dizi kişisel kayıt verilmiştir.
File and Data Field Descriptions(Dosya ve Veri Alanı Açıklamaları)
train.csv - Eğitim verisi olarak kullanılmak üzere yolcuların yaklaşık üçte ikisi (~8700) için kişisel kayıtlar
PassengerId - Her yolcu için benzersiz bir kimlik. Her kimlik gggg_pp formunda olup, gggg yolcunun seyahat ettiği grubu ve pp ise gruptaki sırasını belirtir. Bir grup içindeki insanlar genellikle aile üyeleridir, ancak her zaman değil.
HomePlanet - Yolcunun ayrıldığı gezegen, genellikle kalıcı ikamet ettikleri gezegen.
CryoSleep - Yolcunun seyahat süresince askıya alınma seçeneğini seçip seçmediğini belirtir. Kriyo uyku alan yolcular, kabinlerine hapsedilirler.
Cabin - Yolcunun kaldığı kabin numarası. Yan, genellikle P limanı için veya S sancak tarafı için olabilir, şeklindeki formunda deck/num/side şeklindedir.
Destination - Yolcunun iniş yapacağı gezegen.
Yaş - Yolcunun yaşı.
VIP - Yolcunun seyahat sırasında özel VIP hizmeti için ödeme yapıp yapmadığı.
RoomService - , FoodCourt, ShoppingMall, Spa, VRDeck - Yolcunun Spaceship Titanic’in birçok lüks olanaklarından her birinde fatura edilen miktar.
Ad - Yolcunun adı ve soyadı.
-Taşınan - Yolcunun başka bir boyuta taşınıp taşınmadığı. Bu, tahmin etmeye çalıştığınız sütun, hedef sütundur.
test.csv - Geriye kalan yolcuların yaklaşık üçte biri (~4300) için kişisel kayıtlar, test verisi olarak kullanılacak. Göreviniz, bu setteki yolcuların Taşınan değerini tahmin etmektir.
sample_submission.csv - Doğru formatta bir gönderim dosyası
PassengerId - Test setindeki her yolcu için kimlik. Taşınan - Hedef. Her bir yolcu için ya Doğru (True) ya da Yanlış (False) tahmin edin.
Train ve Test Yüklemek
## Rows: 4277 Columns: 13
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (2): CryoSleep, VIP
##
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
## Rows: 8693 Columns: 14
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (3): CryoSleep, VIP, Transported
##
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
## # A tibble: 6 × 14
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0001_01 Europa FALSE B/0/P TRAPPIST-1e 39 FALSE 0
## 2 0002_01 Earth FALSE F/0/S TRAPPIST-1e 24 FALSE 109
## 3 0003_01 Europa FALSE A/0/S TRAPPIST-1e 58 TRUE 43
## 4 0003_02 Europa FALSE A/0/S TRAPPIST-1e 33 FALSE 0
## 5 0004_01 Earth FALSE F/1/S TRAPPIST-1e 16 FALSE 303
## 6 0005_01 Earth FALSE F/0/P PSO J318.5-22 44 FALSE 0
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>, Transported <lgl>
## spc_tbl_ [8,693 × 14] (S3: spec_tbl_df/tbl_df/tbl/data.frame)
## $ PassengerId : chr [1:8693] "0001_01" "0002_01" "0003_01" "0003_02" ...
## $ HomePlanet : chr [1:8693] "Europa" "Earth" "Europa" "Europa" ...
## $ CryoSleep : logi [1:8693] FALSE FALSE FALSE FALSE FALSE FALSE ...
## $ Cabin : chr [1:8693] "B/0/P" "F/0/S" "A/0/S" "A/0/S" ...
## $ Destination : chr [1:8693] "TRAPPIST-1e" "TRAPPIST-1e" "TRAPPIST-1e" "TRAPPIST-1e" ...
## $ Age : num [1:8693] 39 24 58 33 16 44 26 28 35 14 ...
## $ VIP : logi [1:8693] FALSE FALSE TRUE FALSE FALSE FALSE ...
## $ RoomService : num [1:8693] 0 109 43 0 303 0 42 0 0 0 ...
## $ FoodCourt : num [1:8693] 0 9 3576 1283 70 ...
## $ ShoppingMall: num [1:8693] 0 25 0 371 151 0 3 0 17 0 ...
## $ Spa : num [1:8693] 0 549 6715 3329 565 ...
## $ VRDeck : num [1:8693] 0 44 49 193 2 0 0 NA 0 0 ...
## $ Name : chr [1:8693] "Maham Ofracculy" "Juanna Vines" "Altark Susent" "Solam Susent" ...
## $ Transported : logi [1:8693] FALSE TRUE FALSE FALSE TRUE TRUE ...
## - attr(*, "spec")=
## .. cols(
## .. PassengerId = col_character(),
## .. HomePlanet = col_character(),
## .. CryoSleep = col_logical(),
## .. Cabin = col_character(),
## .. Destination = col_character(),
## .. Age = col_double(),
## .. VIP = col_logical(),
## .. RoomService = col_double(),
## .. FoodCourt = col_double(),
## .. ShoppingMall = col_double(),
## .. Spa = col_double(),
## .. VRDeck = col_double(),
## .. Name = col_character(),
## .. Transported = col_logical()
## .. )
## - attr(*, "problems")=<externalptr>
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr 1.1.4 ✔ stringr 1.5.1
## ✔ forcats 1.0.0 ✔ tibble 3.2.1
## ✔ lubridate 1.9.3 ✔ tidyr 1.3.1
## ✔ purrr 1.0.2
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag() masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
Verielrin gözlemlerini yerleri dolduralım(ailenum ve ailesira)fertlerine göre düzeltelim
Cabine üç ayırmak
- Cabine bilgi çıkarmak
## Warning: le package 'explore' a été compilé avec la version R 4.3.3
## # A tibble: 20 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId chr 0 0 8693 NA NA NA
## 2 group_id chr 0 0 6217 NA NA NA
## 3 sequence_number chr 0 0 8 NA NA NA
## 4 HomePlanet chr 201 2.3 4 NA NA NA
## 5 CryoSleep lgl 217 2.5 3 0 0.36 1
## 6 Cabin chr 199 2.3 6561 NA NA NA
## 7 deck1 chr 199 2.3 9 NA NA NA
## 8 num2 chr 199 2.3 1818 NA NA NA
## 9 side3 chr 199 2.3 3 NA NA NA
## 10 Destination chr 182 2.1 4 NA NA NA
## 11 Age dbl 179 2.1 81 0 28.8 79
## 12 VIP lgl 203 2.3 3 0 0.02 1
## 13 RoomService dbl 181 2.1 1274 0 225. 14327
## 14 FoodCourt dbl 183 2.1 1508 0 458. 29813
## 15 ShoppingMall dbl 208 2.4 1116 0 174. 23492
## 16 Spa dbl 183 2.1 1328 0 311. 22408
## 17 VRDeck dbl 188 2.2 1307 0 305. 24133
## 18 Name chr 200 2.3 8474 NA NA NA
## 19 Transported lgl 0 0 2 0 0.5 1
## 20 beraber_yolculuk_yapamlar lgl 0 0 2 0 0.45 1
veri çerçevesindeki “HomePlanet” sütununa erişir. HomePlanet” sütununun faktör olduğunu varsayarak, bu faktörün içinde bulunan benzersiz kategorik seviyeleri döndürür.
Burda Histogramım fotoğrafın yükledik
## `stat_bin()` using `bins = 30`. Pick better value with `binwidth`.
## Warning: Removed 181 rows containing non-finite outside the scale range
## (`stat_bin()`).
Mice Paketı boşlukları doldurmak için kulanır**
## Warning: le package 'mice' a été compilé avec la version R 4.3.3
##
## Attachement du package : 'mice'
## L'objet suivant est masqué depuis 'package:stats':
##
## filter
## Les objets suivants sont masqués depuis 'package:base':
##
## cbind, rbind
NOT: Bildiklerim göre gezegenler ayırladık bütün boşluklar sıfırladık yani
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
train$ShoppingMall <- addNA(train$ShoppingMall)
levels(train$ShoppingMall)[is.na(train$ShoppingMall)]## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## character(0)
## # A tibble: 17 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId fct 0 0 8693 NA NA NA
## 2 HomePlanet fct 0 0 4 NA NA NA
## 3 CryoSleep fct 0 0 3 NA NA NA
## 4 Cabin fct 0 0 6561 NA NA NA
## 5 Destination fct 0 0 4 NA NA NA
## 6 Age fct 0 0 81 NA NA NA
## 7 VIP fct 0 0 3 NA NA NA
## 8 RoomService fct 0 0 1274 NA NA NA
## 9 FoodCourt fct 0 0 1508 NA NA NA
## 10 ShoppingMall fct 0 0 1116 NA NA NA
## 11 Spa fct 0 0 1328 NA NA NA
## 12 VRDeck fct 0 0 1307 NA NA NA
## 13 Name fct 0 0 8474 NA NA NA
## 14 Transported lgl 0 0 2 0 0.5 1
## 15 deck fct 0 0 9 NA NA NA
## 16 num fct 0 0 1818 NA NA NA
## 17 side fct 0 0 3 NA NA NA
## # A tibble: 16 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId chr 0 0 4277 NA NA NA
## 2 HomePlanet fct 0 0 4 NA NA NA
## 3 CryoSleep fct 0 0 3 NA NA NA
## 4 Cabin fct 0 0 3266 NA NA NA
## 5 Destination fct 0 0 4 NA NA NA
## 6 Age fct 0 0 80 NA NA NA
## 7 VIP fct 0 0 3 NA NA NA
## 8 RoomService fct 0 0 843 NA NA NA
## 9 FoodCourt fct 0 0 903 NA NA NA
## 10 ShoppingMall fct 0 0 716 NA NA NA
## 11 Spa fct 0 0 834 NA NA NA
## 12 VRDeck fct 0 0 797 NA NA NA
## 13 Name fct 0 0 4177 NA NA NA
## 14 deck fct 0 0 9 NA NA NA
## 15 num fct 0 0 1506 NA NA NA
## 16 side chr 0 0 3 NA NA NA
veri <- veri %>%
group_by(group_id)%>%
mutate(homePlanet = if_else(is.na(HomePlanet),first(HomePlanet),HomePlanet))## PassengerId group_id sequence_number HomePlanet
## Length:8693 Length:8693 Length:8693 Earth :4602
## Class :character Class :character Class :character Europa:2131
## Mode :character Mode :character Mode :character Mars :1759
## NA's : 201
##
##
##
## CryoSleep Cabin deck1 num2
## Mode :logical Length:8693 Length:8693 Length:8693
## FALSE:5439 Class :character Class :character Class :character
## TRUE :3037 Mode :character Mode :character Mode :character
## NA's :217
##
##
##
## side3 Destination Age VIP
## Length:8693 Length:8693 Min. : 0.00 Mode :logical
## Class :character Class :character 1st Qu.:19.00 FALSE:8291
## Mode :character Mode :character Median :27.00 TRUE :199
## Mean :28.83 NA's :203
## 3rd Qu.:38.00
## Max. :79.00
## NA's :179
## RoomService FoodCourt ShoppingMall Spa
## Min. : 0.0 Min. : 0.0 Min. : 0.0 Min. : 0.0
## 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0
## Median : 0.0 Median : 0.0 Median : 0.0 Median : 0.0
## Mean : 224.7 Mean : 458.1 Mean : 173.7 Mean : 311.1
## 3rd Qu.: 47.0 3rd Qu.: 76.0 3rd Qu.: 27.0 3rd Qu.: 59.0
## Max. :14327.0 Max. :29813.0 Max. :23492.0 Max. :22408.0
## NA's :181 NA's :183 NA's :208 NA's :183
## VRDeck Name Transported beraber_yolculuk_yapamlar
## Min. : 0.0 Length:8693 Mode :logical Mode :logical
## 1st Qu.: 0.0 Class :character FALSE:4315 FALSE:4805
## Median : 0.0 Mode :character TRUE :4378 TRUE :3888
## Mean : 304.9
## 3rd Qu.: 46.0
## Max. :24133.0
## NA's :188
## homePlanet hp
## Earth :4621 Length:8693
## Europa:2153 Class :character
## Mars :1776 Mode :character
## NA's : 143
##
##
##
## # A tibble: 200 × 4
## # Groups: group_id [132]
## group_id HomePlanet homePlanet hp
## <chr> <fct> <fct> <fct>
## 1 0438 Europa Europa Europa
## 2 0439 Europa Europa Europa
## 3 0441 Earth Earth Earth
## 4 0442 Earth Earth Earth
## 5 0444 Mars Mars Mars
## 6 0444 <NA> Mars Mars
## 7 0445 Earth Earth Earth
## 8 0445 <NA> Earth Earth
## 9 0446 Europa Europa Europa
## 10 0447 Earth Earth Earth
## # ℹ 190 more rows
veri <- veri %>%
group_by(group_id)%>%
mutate(DestinationNasiz = if_else(is.na(Destination),first(Destination),Destination))## # A tibble: 23 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId chr 0 0 8693 NA NA NA
## 2 group_id chr 0 0 6217 NA NA NA
## 3 sequence_number chr 0 0 8 NA NA NA
## 4 HomePlanet fct 201 2.3 4 NA NA NA
## 5 CryoSleep lgl 217 2.5 3 0 0.36 1
## 6 Cabin chr 199 2.3 6561 NA NA NA
## 7 deck1 chr 199 2.3 9 NA NA NA
## 8 num2 chr 199 2.3 1818 NA NA NA
## 9 side3 chr 199 2.3 3 NA NA NA
## 10 Destination chr 182 2.1 4 NA NA NA
## # ℹ 13 more rows
TRAPPIST-1e
veri <- veri %>%mutate(DestinationNasiz = if_else(is.na(DestinationNasiz), "TRAPPIST-1e", DestinationNasiz))## # A tibble: 17 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId fct 0 0 8693 NA NA NA
## 2 HomePlanet fct 0 0 4 NA NA NA
## 3 CryoSleep fct 0 0 3 NA NA NA
## 4 Cabin fct 0 0 6561 NA NA NA
## 5 Destination fct 0 0 4 NA NA NA
## 6 Age fct 0 0 81 NA NA NA
## 7 VIP fct 0 0 3 NA NA NA
## 8 RoomService fct 0 0 1274 NA NA NA
## 9 FoodCourt fct 0 0 1508 NA NA NA
## 10 ShoppingMall fct 0 0 1116 NA NA NA
## 11 Spa fct 0 0 1328 NA NA NA
## 12 VRDeck fct 0 0 1307 NA NA NA
## 13 Name fct 0 0 8474 NA NA NA
## 14 Transported lgl 0 0 2 0 0.5 1
## 15 deck fct 0 0 9 NA NA NA
## 16 num fct 0 0 1818 NA NA NA
## 17 side fct 0 0 3 NA NA NA