EKONOMETRI ILK PROJE

ILK PROJE

.RYükleme

.Rmarkdown başlangiç

.Web sayfasına hazırlama

.Internete yükleme

##Formül yazma

\[ \pi= \frac{P_t-P_{t-1}}{P_{t-1}} \]

library(WDI)
## Warning: package 'WDI' was built under R version 4.3.3
library(ggplot2)
## Warning: package 'ggplot2' was built under R version 4.3.3
turkey_inflation <- WDI(country = "TR", indicator = "FP.CPI.TOTL.ZG", start = 2000, end = 2023)
japan_inflation <- WDI(country = "JP", indicator = "FP.CPI.TOTL.ZG", start = 2000, end = 2022)
turkey_inflation_df <- data.frame(year = as.numeric(row.names(turkey_inflation)), inflation = turkey_inflation$FP.CPI.TOTL.ZG)

japan_inflation_df <- data.frame(year = as.numeric(row.names(japan_inflation)), inflation = japan_inflation$FP.CPI.TOTL.ZG)
ggplot() +
  geom_line(data = turkey_inflation_df, aes(x = year, y = inflation, color = "Turkey")) +
  geom_line(data = japan_inflation_df, aes(x = year, y = inflation, color = "Japan"))
## Warning: Removed 1 row containing missing values or values outside the scale range
## (`geom_line()`).

Makine Öğrenmesi Açıklayın

Makine öğrenmesi, bilgisayar sistemlerinin deneyimden öğrenmesine ve verilerdeki desenleri tanımasına izin veren bir yapay zeka dalıdır. Bir nevi bilgisayarların belirli bir görevi belirli bir performans ölçütüne göre iyileştirmek için veri analizi yapması ve bu analize dayanarak gelecekteki verilere uygun şekilde tepki vermesidir.

Temel olarak, makine öğrenimi, bir algoritmanın belirli bir görevi gerçekleştirmek için girdi verilerini kullanarak bu görevi öğrenmesi ve optimize etmesi işlemidir. Bu algoritma, genellikle bir model olarak adlandırılır ve belirli bir problemi çözmek için uyarlanır. Model, genellikle eğitim verileri adı verilen bir veri kümesi üzerinde eğitilir ve ardından yeni verilere uygulanabilir.

Makine öğrenimi genellikle iki ana kategoride incelenir:

Denetimli Öğrenme (Supervised Learning): Bu kategoride, eğitim veri seti girdi verilerini ve bunlara karşılık gelen çıktıları içerir. Model, bu veri setine dayalı olarak girdi ve çıktı arasındaki ilişkiyi öğrenir. Ardından, yeni girdilere dayalı olarak çıktıları tahmin edebilir. Sınıflandırma ve regresyon gibi problemler, denetimli öğrenme kullanılarak çözülebilir.

Denetimsiz Öğrenme (Unsupervised Learning): Bu kategoride, eğitim veri seti yalnızca girdi verilerini içerir ve çıktılarla ilgili herhangi bir bilgi sağlanmaz. Model, veri setindeki desenleri veya yapıları öğrenir ve genellikle verileri gruplara veya kümeler halinde ayırır. Kümeleme ve boyut azaltma gibi problemler, denetimsiz öğrenme kullanılarak çözülebilir.

Makine öğrenimi algoritmaları ve teknikleri, veri setlerindeki desenleri tanımak, gelecekteki olayları tahmin etmek, kararlar almak ve veriler arasındaki ilişkileri anlamak için kullanılabilir. Makine öğrenimi, birçok endüstride, örneğin sağlık, finans, perakende ve otomotiv gibi birçok alanda yaygın olarak kullanılmaktadır.

Kaggle Projesi

Spacehip Titanic (Kaggle Tanıtımı)

“2912 yılına hoş geldiniz, burada veri bilimi becerilerinizin bir kozmik gizemi çözmek için gerektiği bir zamandayız. Dört ışık yılı uzaklıktan bir ileti aldık ve durum iyi görünmüyor.

Uzay Gemisi Titanic, bir ay önce fırlatılan bir yıldızlararası yolcu gemisiydi. Yaklaşık 13.000 yolcuyla yola çıkan gemi, Güneş sistemimizden üç yeni yaşanabilir yıldız etrafında dönen gezegenlere göçmenleri taşıyarak ilk seferine başladı.

İlk varış noktası olan 55 Cancri E’ye, Alfa Centauri’yi dolaşırken, dikkatsiz Uzay Gemisi Titanic, bir toz bulutunun içinde gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki, adını taşıdığı gemiye bin yıl önceki kaderle benzer bir kaderi paylaştı. Gemi bütünlüğünü korudu, ancak neredeyse yolcuların yarısı alternatif bir boyuta taşındı!

Kurtarma ekiplerine yardım etmek ve kayıp yolcuları kurtarmak için, uzay gemisinin hasar görmüş bilgisayar sisteminden kurtarılan kayıtları kullanarak hangi yolcuların anormallik tarafından taşındığını tahmin etmeniz isteniyor.

Onları kurtarmaya yardım edin ve tarihi değiştirin!”

ORTALAMA NEDIR?

“Ortalama, bir veri kümesindeki değerlerin genel bir temsilini sağlamak için kullanılan bir istatistiksel ölçüdür. Genellikle, bir veri kümesindeki tüm değerlerin toplamının, bu değerlerin sayısına bölünmesiyle hesaplanır. Bir veri kümesinin ortalama değeri genellikle”x̄” (x çizgi) veya “μ” (mu) sembolleri ile gösterilir.

Bir veri kümesinin ortalama değeri, bu kümedeki değerlerin merkezi bir ölçüsünü temsil eder. Örneğin, bir sınıftaki öğrencilerin notlarının ortalaması, o sınıftaki genel başarı düzeyini temsil eder. Bir şirketin çalışanlarının maaşlarının ortalaması, o şirketteki tipik maaş düzeyini yansıtır.

Ortalama, veri setinin dağılımını anlamak ve karşılaştırmak için sıklıkla kullanılan bir ölçüdür. Ancak, veri setinde aykırı değerler varsa, ortalama bu değerlerden etkilenebilir ve gerçekten temsili olmayabilir. Bu durumlarda, medyan veya mod gibi diğer istatistiksel ölçümler daha uygun olabilir.

Genel olarak, ortalama bir veri setinin merkezi eğilimini temsil eder, ancak tek başına veri seti hakkında tam bir resim sunmaz. Veri setinin dağılımını daha iyi anlamak için diğer istatistiksel ölçümlerle birlikte kullanılmalıdır”

ORTALAMA FÖRMÜL

\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]

korelasyon nedir?

Korelasyon, istatistiksel bir terimdir ve değişkenler arasındaki ilişkiyi ölçmek için kullanılır. Özellikle istatistiksel analizlerde ve veri bilimi alanında sıkça kullanılır. Korelasyon, genellikle Pearson korelasyon katsayısı olarak bilinen bir ölçüt ile ifade edilir.

korelasyon formül

\[ R = \frac {\Sigma (x_i-\bar{x})(y_i-\bar{y})}{ \sqrt {\Sigma (x_i-\bar{x})^2 \Sigma (y_i-\bar{y})}} \] ## standart nedir? Standart sapma, istatistik ve olasılık teorisinde bir veri setinin dağılımının yayılma veya değişkenliğini ölçen bir ölçüdür. Bir veri setindeki değerler ne kadar homojen veya heterojen dağılmışsa, standart sapma o kadar büyük veya küçük olur.

standart sapma formül

\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]

kovaryans nedir?

Kovaryans, istatistik ve olasılık teorisinde iki değişken arasındaki ilişkinin değişkenlik ölçüsünü ifade eden bir terimdir. İki değişken arasındaki ilişkinin doğasını tanımlar ve bu ilişkinin ne kadar değişkenlik gösterdiğini belirler.

kovaryans formül

\[ \sigma = \sqrt \frac {\Sigma^N_i (X_i-\bar{X})^2}{N} \]

TRAIN VE TEST Nedir?

“Train” ve “test” terimleri, makine öğrenimi ve veri bilimi alanlarında sıkça kullanılan kavramlardır ve genellikle veri setlerinin bölünmesi ve modelin değerlendirilmesi süreçlerinde karşımıza çıkarlar.

Eğitim Verisi (Train Data): Makine öğrenimi modelinin öğrenmek için kullandığı veri setidir. Bu veri seti, modelin belirli bir görevi gerçekleştirmesini sağlayacak desenleri öğrenmesine yardımcı olur. Model, eğitim verisi üzerinde eğitilir ve veri setindeki desenleri tanır. Eğitim verisi, genellikle bir veri setinin büyük bir bölümünü oluşturur ve modelin geliştirilmesi için kullanılır.

Test Verisi (Test Data): Makine öğrenimi modelinin performansını değerlendirmek için kullanılan veri setidir. Model, eğitim verisinde öğrendiği desenleri test verisi üzerinde uygular ve bu veri setindeki tahminlerin doğruluğunu ölçer. Test verisi, genellikle ayrılmış küçük bir veri seti parçasıdır ve modelin genelleme yeteneğini değerlendirmek için kullanılır.

Train ve test verilerinin ayrılması, modelin gerçek dünya verilerine nasıl genelleşeceğini anlamak için önemlidir. Eğitim verisi üzerinde iyi performans gösteren bir modelin, test verisinde de benzer şekilde iyi performans göstermesi beklenir. Bu süreç, modelin aşırı uyum (overfitting) veya eksik uyum (underfitting) gibi problemler yaşayıp yaşamadığını belirlemek için önemlidir. Ayrıca, train ve test verilerinin ayrılması, modelin performansını doğru bir şekilde değerlendirmek için kullanılan bağımsız bir değerlendirme setinin oluşturulmasına da olanak sağlar.

library(readr)
## Warning: package 'readr' was built under R version 4.3.3
test_1_ <- read_csv("test (1).csv")
## Rows: 4277 Columns: 13
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (2): CryoSleep, VIP
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
View(test_1_)
library(readr)
train_1_ <- read_csv("train (1).csv")
## Rows: 8693 Columns: 14
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (5): PassengerId, HomePlanet, Cabin, Destination, Name
## dbl (6): Age, RoomService, FoodCourt, ShoppingMall, Spa, VRDeck
## lgl (3): CryoSleep, VIP, Transported
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
View(train_1_)
library(rmarkdown)
paged_table(test_1_)
paged_table(train_1_)

VERI SETI ACIKLAYIN ?

Veri seti, bir araya getirilmiş veya düzenlenmiş verilerin yapılandırılmış bir koleksiyonudur. Bu veriler, belirli bir amaca hizmet etmek üzere toplanmış veya oluşturulmuş olabilir. Veri setleri genellikle bir veya birden fazla değişkenin (veri noktaları veya gözlemler) bir araya getirilmesinden oluşur ve genellikle bir tablo, matris veya diğer veri depolama biçimlerinde temsil edilirler.

Bir veri seti şu bileşenlerden oluşur:

Gözlemler (Samples): Her bir gözlem, veri setindeki bir biriktirilmiş veri noktasını veya bir örneği temsil eder. Örneğin, bir veri seti, bir müşterinin demografik bilgilerini içerebilir ve her bir gözlem bir müşteriyi temsil eder.

Değişkenler (Features): Değişkenler, her bir gözlemin özelliklerini tanımlayan ölçümler veya niteliklerdir. Örneğin, bir müşteri veri setinde, değişkenler müşterinin yaş, cinsiyet, gelir seviyesi gibi özelliklerini temsil eder.

Veri Tipi (Data Type): Her değişkenin bir veri tipi vardır, bu tip verinin hangi tür bilgiyi içerdiğini belirtir. Örneğin, bir değişken sayısal (örneğin, yaş) veya kategorik (örneğin, cinsiyet) olabilir.

Bağımlı ve Bağımsız Değişkenler: Bir veri setinde, genellikle bağımlı ve bağımsız değişkenler vardır. Bağımlı değişken, genellikle modelin tahmin etmeye çalıştığı veya açıklamaya çalıştığı değişkendir. Bağımsız değişkenler ise bağımlı değişkeni etkileyen faktörlerdir.

Veri Setinin Boyutu (Size of the Data Set): Veri setinin boyutu, içerdiği gözlem ve değişken sayısını ifade eder. Büyük veri setleri binlerce veya milyonlarca gözlem ve yüzlerce veya binlerce değişken içerebilirken, küçük veri setleri yalnızca birkaç gözlem ve değişkene sahip olabilir.

Veri setleri, veri bilimi ve makine öğrenimi gibi alanlarda analiz, modelleme ve keşif amaçları için kullanılır. Veri setlerinin iyi bir şekilde anlaşılması ve doğru bir şekilde kullanılması, veri odaklı karar verme süreçlerinin geliştirilmesi için önemlidir.

library(tidyverse)
## Warning: package 'tidyverse' was built under R version 4.3.3
## Warning: package 'tibble' was built under R version 4.3.3
## Warning: package 'tidyr' was built under R version 4.3.3
## Warning: package 'purrr' was built under R version 4.3.3
## Warning: package 'dplyr' was built under R version 4.3.3
## Warning: package 'stringr' was built under R version 4.3.3
## Warning: package 'forcats' was built under R version 4.3.3
## Warning: package 'lubridate' was built under R version 4.3.3
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.1.4     ✔ stringr   1.5.1
## ✔ forcats   1.0.0     ✔ tibble    3.2.1
## ✔ lubridate 1.9.3     ✔ tidyr     1.3.1
## ✔ purrr     1.0.2     
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
library(explore)
## Warning: package 'explore' was built under R version 4.3.3
train_1_ %>% describe_all()
## # A tibble: 14 × 8
##    variable     type     na na_pct unique   min   mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl>  <dbl> <dbl>
##  1 PassengerId  chr       0    0     8693    NA  NA       NA
##  2 HomePlanet   chr     201    2.3      4    NA  NA       NA
##  3 CryoSleep    lgl     217    2.5      3     0   0.36     1
##  4 Cabin        chr     199    2.3   6561    NA  NA       NA
##  5 Destination  chr     182    2.1      4    NA  NA       NA
##  6 Age          dbl     179    2.1     81     0  28.8     79
##  7 VIP          lgl     203    2.3      3     0   0.02     1
##  8 RoomService  dbl     181    2.1   1274     0 225.   14327
##  9 FoodCourt    dbl     183    2.1   1508     0 458.   29813
## 10 ShoppingMall dbl     208    2.4   1116     0 174.   23492
## 11 Spa          dbl     183    2.1   1328     0 311.   22408
## 12 VRDeck       dbl     188    2.2   1307     0 305.   24133
## 13 Name         chr     200    2.3   8474    NA  NA       NA
## 14 Transported  lgl       0    0        2     0   0.5      1
test_1_ %>% describe_all()
## # A tibble: 13 × 8
##    variable     type     na na_pct unique   min   mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl>  <dbl> <dbl>
##  1 PassengerId  chr       0    0     4277    NA  NA       NA
##  2 HomePlanet   chr      87    2        4    NA  NA       NA
##  3 CryoSleep    lgl      93    2.2      3     0   0.37     1
##  4 Cabin        chr     100    2.3   3266    NA  NA       NA
##  5 Destination  chr      92    2.2      4    NA  NA       NA
##  6 Age          dbl      91    2.1     80     0  28.7     79
##  7 VIP          lgl      93    2.2      3     0   0.02     1
##  8 RoomService  dbl      82    1.9    843     0 219.   11567
##  9 FoodCourt    dbl     106    2.5    903     0 439.   25273
## 10 ShoppingMall dbl      98    2.3    716     0 177.    8292
## 11 Spa          dbl     101    2.4    834     0 303.   19844
## 12 VRDeck       dbl      80    1.9    797     0 311.   22272
## 13 Name         chr      94    2.2   4177    NA  NA       NA

{r}message=FALSE, message=FALSE} library(tidyverse)

veri <- separate(train_1_, PassengerId, into = c("group_id", "sequence_number"), sep = "_", remove = FALSE)
veri <- separate(test_1_, PassengerId, into = c("group_id", "sequence_number"), sep = "_", remove = FALSE)
tekrarlanan_grouplar <- veri %>%
group_by(group_id) %>%
filter(n() > 1) %>%
pull(group_id)
veri <- veri %>%
mutate(beraber_yolculuk_yapanlar= ifelse(group_id %in% tekrarlanan_grouplar, TRUE, FALSE))
veri <- separate(veri, Cabin, into = c("sutun1", "sutun2",
 "sutun3"), sep = "/", remove = FALSE )
veri2 <- data.frame(cabin = c("P/3/T", "Q/5/U", "R/7/V"))
veri2 <- separate(veri2, cabin, into = c("sutun1", "sutun2",
 "sutun3"), sep = "/", remove = FALSE )
veri$Cabin <- as.factor(veri$Cabin)
veri$sutun1 <- as.factor(veri$sutun1)
veri$sutun2 <- as.factor(veri$sutun2)
veri$sutun2 <- as.factor(veri$sutun2)
summary(veri)
##  PassengerId          group_id         sequence_number     HomePlanet       
##  Length:4277        Length:4277        Length:4277        Length:4277       
##  Class :character   Class :character   Class :character   Class :character  
##  Mode  :character   Mode  :character   Mode  :character   Mode  :character  
##                                                                             
##                                                                             
##                                                                             
##                                                                             
##  CryoSleep           Cabin          sutun1         sutun2    
##  Mode :logical   G/160/P:   8   F      :1445   4      :  21  
##  FALSE:2640      B/31/P :   7   G      :1222   31     :  18  
##  TRUE :1544      D/273/S:   7   E      : 447   197    :  16  
##  NA's :93        E/228/S:   7   B      : 362   294    :  16  
##                  G/748/S:   7   C      : 355   228    :  14  
##                  (Other):4141   (Other): 346   (Other):4092  
##                  NA's   : 100   NA's   : 100   NA's   : 100  
##     sutun3          Destination             Age           VIP         
##  Length:4277        Length:4277        Min.   : 0.00   Mode :logical  
##  Class :character   Class :character   1st Qu.:19.00   FALSE:4110     
##  Mode  :character   Mode  :character   Median :26.00   TRUE :74       
##                                        Mean   :28.66   NA's :93       
##                                        3rd Qu.:37.00                  
##                                        Max.   :79.00                  
##                                        NA's   :91                     
##   RoomService        FoodCourt        ShoppingMall         Spa         
##  Min.   :    0.0   Min.   :    0.0   Min.   :   0.0   Min.   :    0.0  
##  1st Qu.:    0.0   1st Qu.:    0.0   1st Qu.:   0.0   1st Qu.:    0.0  
##  Median :    0.0   Median :    0.0   Median :   0.0   Median :    0.0  
##  Mean   :  219.3   Mean   :  439.5   Mean   : 177.3   Mean   :  303.1  
##  3rd Qu.:   53.0   3rd Qu.:   78.0   3rd Qu.:  33.0   3rd Qu.:   50.0  
##  Max.   :11567.0   Max.   :25273.0   Max.   :8292.0   Max.   :19844.0  
##  NA's   :82        NA's   :106       NA's   :98       NA's   :101      
##      VRDeck            Name           beraber_yolculuk_yapanlar
##  Min.   :    0.0   Length:4277        Mode :logical            
##  1st Qu.:    0.0   Class :character   FALSE:2340               
##  Median :    0.0   Mode  :character   TRUE :1937               
##  Mean   :  310.7                                               
##  3rd Qu.:   36.0                                               
##  Max.   :22272.0                                               
##  NA's   :80
summary(veri2)
##     cabin              sutun1             sutun2             sutun3         
##  Length:3           Length:3           Length:3           Length:3          
##  Class :character   Class :character   Class :character   Class :character  
##  Mode  :character   Mode  :character   Mode  :character   Mode  :character
veri2 <- veri %>% na.omit()
veri$HomePlanet <- as.factor(veri$HomePlanet)
veri$Destination <- as.factor(veri$Destination)
veri$Cabin <- as.factor(veri$Cabin)
veri$group_id <- as.factor(veri$group_id)
veri$PassengerId <- as.factor(veri$PassengerId)
veri$sequence_number <- as.factor(veri$sequence_number)
summary(veri)
##   PassengerId      group_id    sequence_number  HomePlanet   CryoSleep      
##  0013_01:   1   0339   :   8   01     :3063    Earth :2263   Mode :logical  
##  0018_01:   1   1072   :   8   02     : 723    Europa:1002   FALSE:2640     
##  0019_01:   1   6332   :   8   03     : 269    Mars  : 925   TRUE :1544     
##  0021_01:   1   6499   :   8   04     : 107    NA's  :  87   NA's :93       
##  0023_01:   1   6986   :   8   05     :  56                                 
##  0027_01:   1   8543   :   8   06     :  33                                 
##  (Other):4271   (Other):4229   (Other):  26                                 
##      Cabin          sutun1         sutun2        sutun3         
##  G/160/P:   8   F      :1445   4      :  21   Length:4277       
##  B/31/P :   7   G      :1222   31     :  18   Class :character  
##  D/273/S:   7   E      : 447   197    :  16   Mode  :character  
##  E/228/S:   7   B      : 362   294    :  16                     
##  G/748/S:   7   C      : 355   228    :  14                     
##  (Other):4141   (Other): 346   (Other):4092                     
##  NA's   : 100   NA's   : 100   NA's   : 100                     
##         Destination        Age           VIP           RoomService     
##  55 Cancri e  : 841   Min.   : 0.00   Mode :logical   Min.   :    0.0  
##  PSO J318.5-22: 388   1st Qu.:19.00   FALSE:4110      1st Qu.:    0.0  
##  TRAPPIST-1e  :2956   Median :26.00   TRUE :74        Median :    0.0  
##  NA's         :  92   Mean   :28.66   NA's :93        Mean   :  219.3  
##                       3rd Qu.:37.00                   3rd Qu.:   53.0  
##                       Max.   :79.00                   Max.   :11567.0  
##                       NA's   :91                      NA's   :82       
##    FoodCourt        ShoppingMall         Spa              VRDeck       
##  Min.   :    0.0   Min.   :   0.0   Min.   :    0.0   Min.   :    0.0  
##  1st Qu.:    0.0   1st Qu.:   0.0   1st Qu.:    0.0   1st Qu.:    0.0  
##  Median :    0.0   Median :   0.0   Median :    0.0   Median :    0.0  
##  Mean   :  439.5   Mean   : 177.3   Mean   :  303.1   Mean   :  310.7  
##  3rd Qu.:   78.0   3rd Qu.:  33.0   3rd Qu.:   50.0   3rd Qu.:   36.0  
##  Max.   :25273.0   Max.   :8292.0   Max.   :19844.0   Max.   :22272.0  
##  NA's   :106       NA's   :98       NA's   :101       NA's   :80       
##      Name           beraber_yolculuk_yapanlar
##  Length:4277        Mode :logical            
##  Class :character   FALSE:2340               
##  Mode  :character   TRUE :1937               
##                                              
##                                              
##                                              
## 
veri <- veri %>%
group_by(group_id) %>%
mutate(homePlanet = if_else(is.na(HomePlanet), first(HomePlanet), HomePlanet))
veri <- veri %>% mutate(hp = if_else(is.na(homePlanet), "Earth", homePlanet))
veri$hp <- as.factor(veri$hp)
veri <- veri %>%
group_by(group_id) %>%
mutate(DestinationNasiz = if_else(is.na(Destination), first(HomePlanet), Destination))
library(ggplot2)
veri <- veri %>%
group_by(group_id) %>%
mutate(DestinationNasiz = if_else(is.na(Destination), first(HomePlanet), Destination))
ggplot(veri, aes(x=RoomService)) +
geom_histogram()
## `stat_bin()` using `bins = 30`. Pick better value with `binwidth`.
## Warning: Removed 82 rows containing non-finite outside the scale range
## (`stat_bin()`).

library(mice)
## Warning: package 'mice' was built under R version 4.3.3
## Warning in check_dep_version(): ABI version mismatch: 
## lme4 was built with Matrix ABI version 1
## Current Matrix ABI version is 0
## Please re-install lme4 from source or restore original 'Matrix' package
## 
## Attaching package: 'mice'
## The following object is masked from 'package:stats':
## 
##     filter
## The following objects are masked from 'package:base':
## 
##     cbind, rbind
md.pattern(train_1_[1:500,])

##     PassengerId Transported VIP Destination FoodCourt Spa VRDeck Name CryoSleep
## 376           1           1   1           1         1   1      1    1         1
## 13            1           1   1           1         1   1      1    1         1
## 14            1           1   1           1         1   1      1    1         1
## 12            1           1   1           1         1   1      1    1         1
## 3             1           1   1           1         1   1      1    1         1
## 12            1           1   1           1         1   1      1    1         1
## 2             1           1   1           1         1   1      1    1         1
## 13            1           1   1           1         1   1      1    1         1
## 1             1           1   1           1         1   1      1    1         1
## 10            1           1   1           1         1   1      1    1         0
## 1             1           1   1           1         1   1      1    1         0
## 11            1           1   1           1         1   1      1    0         1
## 6             1           1   1           1         1   1      0    1         1
## 1             1           1   1           1         1   1      0    1         1
## 1             1           1   1           1         1   1      0    1         0
## 8             1           1   1           1         1   0      1    1         1
## 4             1           1   1           1         0   1      1    1         1
## 1             1           1   1           1         0   1      1    1         1
## 1             1           1   1           1         0   1      0    1         1
## 5             1           1   1           0         1   1      1    1         1
## 1             1           1   1           0         1   1      1    1         1
## 4             1           1   0           1         1   1      1    1         1
##               0           0   4           6         6   8      9   11        12
##     RoomService HomePlanet Age Cabin ShoppingMall    
## 376           1          1   1     1            1   0
## 13            1          1   1     1            0   1
## 14            1          1   1     0            1   1
## 12            1          1   0     1            1   1
## 3             1          1   0     1            0   2
## 12            1          0   1     1            1   1
## 2             1          0   1     1            0   2
## 13            0          1   1     1            1   1
## 1             0          1   1     0            1   2
## 10            1          1   1     1            1   1
## 1             1          1   1     0            1   2
## 11            1          1   1     1            1   1
## 6             1          1   1     1            1   1
## 1             1          1   1     0            1   2
## 1             1          1   1     1            1   2
## 8             1          1   1     1            1   1
## 4             1          1   1     1            1   1
## 1             1          1   1     0            1   2
## 1             1          1   1     1            1   2
## 5             1          1   1     1            1   1
## 1             1          0   1     1            1   2
## 4             1          1   1     1            1   1
##              14         15  15    18           18 136
VIM::aggr(x= train_1_, sortVars=T)

## 
##  Variables sorted by number of missings: 
##      Variable      Count
##     CryoSleep 0.02496261
##  ShoppingMall 0.02392730
##           VIP 0.02335212
##    HomePlanet 0.02312205
##          Name 0.02300702
##         Cabin 0.02289198
##        VRDeck 0.02162660
##     FoodCourt 0.02105142
##           Spa 0.02105142
##   Destination 0.02093639
##   RoomService 0.02082135
##           Age 0.02059128
##   PassengerId 0.00000000
##   Transported 0.00000000