.R yükleme
.Rmarkdown başlangıç
.Web sayfasını hazırlama
.İnternete yükleme
\[ A= L*l \]
library(WDI)
library(ggplot2)
install.packages("ggplot2") # ggplot2 kütüphanesi grafiği çizmek için kullanılır
## Warning: package 'ggplot2' is in use and will not be installed
library(ggplot2)
# Varsayımsal veri oluşturma
veri <- data.frame(
Year = 2015:2019,
Cibuti = c(6.2, 5.8, 7.1, 6.5, 6.9), # Cibuti'nin enflasyon oranları
Etiyopya = c(8.3, 8.5, 8.2, 8.6, 8.9) # Etiyopya'nın enflasyon oranları
)
# Grafik çizme
ggplot(veri, aes(x = Year)) +
geom_line(aes(y = Cibuti, color = "Cibuti")) +
geom_line(aes(y = Etiyopya, color = "Etiyopya")) +
labs(title = "Cibuti ve Etiyopya'da 2015-2019 Enflasyon Oranları",
x = "Yıl",
y = "Enflasyon Oranı") +
scale_color_manual(values = c("Cibuti" = "blue", "Etiyopya" = "red")) +
theme_minimal()
Makine öğrenimi, bilgisayar sistemlerinin verilerden öğrenmesini ve deneyimlerden faydalanarak görevleri gerçekleştirmesini sağlayan bir yapay zeka dalıdır. Bu, belirli bir görevi (örneğin, sınıflandırma, regresyon, kümeleme, vb.) gerçekleştirmek için algoritmaların kullanılmasıyla gerçekleşir. Makine öğrenimi algoritmaları, birçok farklı veri türü üzerinde işlem yapabilir, bu veri türleri sayısal veriler, metin verileri, görseller, sesler veya karmaşık yapısal veriler olabilir.
Makine öğrenimi genellikle denetimli ve denetimsiz öğrenme olmak üzere iki ana kategoriye ayrılır:
Denetimli Öğrenme: Bu yöntemde, algoritma eğitim için etiketlenmiş verilere ihtiyaç duyar. Etiketlenmiş veri, girdi verileriyle birlikte doğru çıktı değerlerini içerir. Denetimli öğrenme algoritmaları, bu verilerden öğrenerek yeni giriş verileri için doğru çıktıları tahmin etmeyi amaçlar. Örnek algoritmalar arasında lineer regresyon, lojistik regresyon, karar ağaçları, destek vektör makineleri (SVM) ve yapay sinir ağları (neural networks) bulunur.
Denetimsiz Öğrenme: Bu yöntemde, algoritma etiketlenmemiş verilerle çalışır, yani girdi verilerinin yanında doğru çıktılar verilmez. Denetimsiz öğrenme algoritmaları, veri içindeki desenleri veya yapıları keşfetmek için kullanılır. Bu tür algoritmalar arasında kümeleme, boyut azaltma (örneğin, PCA, t-SNE), birliktelik kuralları, yoğunluk tabanlı kümeleme (örneğin, DBSCAN) ve otomatik kodlayıcılar (autoencoders) yer alır.
Makine öğrenimi uygulamaları birçok farklı alanı kapsar. Örneğin:
Tıp: Hastalık teşhisi, ilaç keşfi ve hasta izleme için makine öğrenimi kullanılır.
Finans: Kredi riski değerlendirmesi, hisse senedi fiyat tahmini ve dolandırıcılık tespiti gibi alanlarda makine öğrenimi uygulanır.
Perakende: Müşteri segmentasyonu, pazarlama stratejilerinin belirlenmesi ve stok yönetimi gibi konularda makine öğrenimi kullanılır.
Görüntü İşleme: Nesne tanıma, yüz tanıma ve video izleme gibi alanlarda makine öğrenimi önemli bir rol oynar.
Makine öğrenimi, veri bilimi, istatistik, matematik ve bilgisayar bilimlerinin kesişiminde bulunur. Verilerin toplanması, temizlenmesi ve işlenmesi, özellik mühendisliği, model seçimi ve eğitimi, modelin doğrulanması ve sonuçların yorumlanması gibi bir dizi adımdan oluşan karmaşık bir süreç gerektirir. Ancak, doğru uygulandığında, makine öğrenimi sayesinde büyük miktarda veriden anlamlı bilgiler elde etmek ve karmaşık problemleri çözmek mümkün hale gelir.
2912 yılına hoş geldiniz, burada veri bilimi becerilerinizin bir kozmik gizemi çözmek için gerektiği bir zamandayız. Dört ışık yılı uzaklıktan bir ileti aldık ve durum iyi görünmüyor.
Uzay Gemisi Titanic, bir ay önce fırlatılan bir yıldızlararası yolcu gemisiydi. Yaklaşık 13.000 yolcuyla yola çıkan gemi, Güneş sistemimizden üç yeni yaşanabilir yıldız etrafında dönen gezegenlere göçmenleri taşıyarak ilk seferine başladı.
İlk varış noktası olan 55 Cancri E’ye, Alfa Centauri’yi dolaşırken, dikkatsiz Uzay Gemisi Titanic, bir toz bulutunun içinde gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki, adını taşıdığı gemiye bin yıl önceki kaderle benzer bir kaderi paylaştı. Gemi bütünlüğünü korudu, ancak neredeyse yolcuların yarısı alternatif bir boyuta taşındı!
Kurtarma ekiplerine yardım etmek ve kayıp yolcuları kurtarmak için, uzay gemisinin hasar görmüş bilgisayar sisteminden kurtarılan kayıtları kullanarak hangi yolcuların anormallik tarafından taşındığını tahmin etmeniz isteniyor.
Onları kurtarmaya yardım edin ve tarihi değiştirin!”
Ortalama, bir veri kümesindeki değerlerin toplamının veri sayısına bölünmesiyle elde edilen bir ölçüdür. İstatistikte sıkça kullanılan bir terimdir ve veri setinin merkezsel eğilimini ifade etmek için kullanılır.
\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]
Örneğin, 10, 20, 30, 40 ve 50 değerlerinden oluşan bir veri kümesinin ortalaması şu şekildedir:
# Örnek veri kümesi oluşturma
veri <- c(10, 20, 30, 40, 50)
# Veri kümesinin ortalamasını hesaplama
ortalama <- mean(veri)
print(ortalama)
## [1] 30
Standart sapma, bir veri setindeki değerlerin ortalama değerden ne kadar uzaklıkta olduğunu ölçen bir istatistiksel ölçüdür. Standart sapma, veri setinin dağılımının ne kadar değişken olduğunu gösterir. Daha düşük bir standart sapma, veri noktalarının ortalama değere daha yakın olduğunu gösterirken, daha yüksek bir standart sapma, veri noktalarının ortalama değere daha yayıldığını gösterir.
\[ \sigma = \sqrt \frac {\Sigma^N_i (X_i-\bar{X})^2}{N} \] ### örnek
# Örnek veri kümesi oluşturma
veri <- c(10, 20, 30, 40, 50)
# Veri kümesinin standart sapmasını hesaplama
standart_sapma <- sd(veri)
print(standart_sapma)
## [1] 15.81139
Korelasyon, iki değişken arasındaki ilişkinin gücünü ve yönünü ölçen istatistiksel bir ölçüdür. Bir değişken diğerinin değerlerindeki değişiklikle nasıl ilişkilidir, bu ilişkinin gücü ve yönü korelasyon ölçütleri ile belirlenir. Korelasyon, bu ilişkinin doğrusal olup olmadığını değil, sadece ilişkinin gücünü ve yönünü ölçer.
\[ R = \frac {\Sigma (x_i-\bar{x})(y_i-\bar{y})}{ \sqrt {\Sigma (x_i-\bar{x})^2 \Sigma (y_i-\bar{y})}} \] ### örnek
# Örnek veri seti oluşturma
degisken1 <- c(10, 20, 30, 40, 50)
degisken2 <- c(5, 15, 25, 35, 45)
# Veri seti oluşturma
veri <- data.frame(degisken1, degisken2)
# Korelasyonu hesaplama
korelasyon <- cor(veri$degisken1, veri$degisken2)
print(korelasyon)
## [1] 1
Kovaryans, iki değişken arasındaki ilişkinin doğrultusunu ve yoğunluğunu ölçen bir istatistiksel ölçüdür. İki değişken arasındaki ilişkinin ne kadar değişken olduğunu gösterir.
Eğer iki değişken birlikte artarsa, kovaryans pozitif olacaktır. Yani, bir değişkenin değeri arttığında, diğer değişkenin değeri de artar. Eğer bir değişken artarken diğeri azalıyorsa, kovaryans negatif olacaktır. İki değişken arasında hiçbir ilişki yoksa, kovaryans sıfır olacaktır.
\[ {cov} (X,Y) = \frac {\Sigma (X-X_i)(Y-Y_i)}{n-1} \]
# Örnek veri seti oluşturma
degisken1 <- c(10, 20, 30, 40, 50)
degisken2 <- c(5, 15, 25, 35, 45)
# Veri seti oluşturma
veri <- data.frame(degisken1, degisken2)
# Kovaryansı hesaplama
kovaryans <- cov(veri$degisken1, veri$degisken2)
print(kovaryans)
## [1] 250
“Train” ve “test”, makine öğrenimi ve veri bilimi gibi alanlarda kullanılan terimlerdir.
Eğitim (Train) Verisi: Bir makine öğrenimi modelinin eğitildiği veri setidir. Bu veri seti, modelin öğrenmesi için kullanılan girdi örneklerini ve bu örneklerin beklenen çıktılarını içerir. Model, eğitim verisi üzerinde eğitildiğinde, girdi ve çıktı arasındaki ilişkiyi anlamak ve öğrenmek için optimize edilir.
Test Verisi: Bir modelin performansını değerlendirmek için kullanılan ayrı bir veri setidir. Test verisi, modelin daha önce görmediği yeni verileri içerir. Model, test verisi üzerinde tahminler yapar ve bu tahminlerin gerçek çıktılarla karşılaştırılmasıyla performansı değerlendirilir. Test verisi, modelin gerçek dünya verilerine ne kadar iyi genelleştiğini belirlemek için kullanılır.
Eğitim verisi, genellikle daha büyük bir veri setinden seçilir ve modelin öğrenme sürecinde kullanılır. Test verisi ise modelin ne kadar iyi genelleştirme yaptığını kontrol etmek için ayrılır ve modelin performansını objektif bir şekilde değerlendirmeye yardımcı olur. Bu ayrım, modelin aşırı uyuma (overfitting) yapmasını engellemeye ve gerçek dünya verilerinde iyi bir performans göstermesini sağlamaya yardımcı olur.
library(readr)
train <- read_csv("train.csv")
test=read_csv("test.csv")
test
## # A tibble: 4,277 × 13
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0013_01 Earth TRUE G/3/S TRAPPIST-1e 27 FALSE 0
## 2 0018_01 Earth FALSE F/4/S TRAPPIST-1e 19 FALSE 0
## 3 0019_01 Europa TRUE C/0/S 55 Cancri e 31 FALSE 0
## 4 0021_01 Europa FALSE C/1/S TRAPPIST-1e 38 FALSE 0
## 5 0023_01 Earth FALSE F/5/S TRAPPIST-1e 20 FALSE 10
## 6 0027_01 Earth FALSE F/7/P TRAPPIST-1e 31 FALSE 0
## 7 0029_01 Europa TRUE B/2/P 55 Cancri e 21 FALSE 0
## 8 0032_01 Europa TRUE D/0/S TRAPPIST-1e 20 FALSE 0
## 9 0032_02 Europa TRUE D/0/S 55 Cancri e 23 FALSE 0
## 10 0033_01 Earth FALSE F/7/S 55 Cancri e 24 FALSE 0
## # ℹ 4,267 more rows
## # ℹ 5 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>
train
## # A tibble: 8,693 × 14
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0001_01 Europa FALSE B/0/P TRAPPIST-1e 39 FALSE 0
## 2 0002_01 Earth FALSE F/0/S TRAPPIST-1e 24 FALSE 109
## 3 0003_01 Europa FALSE A/0/S TRAPPIST-1e 58 TRUE 43
## 4 0003_02 Europa FALSE A/0/S TRAPPIST-1e 33 FALSE 0
## 5 0004_01 Earth FALSE F/1/S TRAPPIST-1e 16 FALSE 303
## 6 0005_01 Earth FALSE F/0/P PSO J318.5-22 44 FALSE 0
## 7 0006_01 Earth FALSE F/2/S TRAPPIST-1e 26 FALSE 42
## 8 0006_02 Earth TRUE G/0/S TRAPPIST-1e 28 FALSE 0
## 9 0007_01 Earth FALSE F/3/S TRAPPIST-1e 35 FALSE 0
## 10 0008_01 Europa TRUE B/1/P 55 Cancri e 14 FALSE 0
## # ℹ 8,683 more rows
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>, Transported <lgl>
Bu yarışmada göreviniz , Uzay Gemisi Titanik’in uzay-zaman anomalisiyle çarpışması sırasında bir yolcunun alternatif bir boyuta taşınıp taşınmadığını tahmin etmektir . Bu tahminleri yapmanıza yardımcı olmak için size geminin hasarlı bilgisayar sisteminden kurtarılan bir dizi kişisel kayıt veriliyor.
Dosya ve Veri Alanı Açıklamaları - train.csv - Yolcuların yaklaşık üçte ikisinin (~8700) kişisel kayıtları, eğitim verileri olarak kullanılacak.
PassengerId- Her yolcu için benzersiz bir Kimlik. Her kimlik, yolcunun birlikte seyahat ettiği grubu belirten ve grup içindeki numarası olan gggg_ppformu alır . Bir gruptaki insanlar çoğunlukla aile üyeleridir, ancak her zaman değil.ggggpp
HomePlanet- Yolcunun ayrıldığı gezegen, genellikle daimi ikamet ettikleri gezegen.
CryoSleep- Yolcunun yolculuk süresince askıya alınmış animasyona alınmayı seçip seçmediğini belirtir. Dondurucu uykudaki yolcular kabinlerine hapsedilir.
Cabin - Yolcunun kaldığı kabin numarası. Biçimi güverte/numara/taraf şeklindedir, taraf P (Port) için ya da S (Starboard) için olabilir.
Destination- Yolcunun ineceği gezegen.
Age- Yolcunun yaşı.
VIP- Yolcunun yolculuk sırasında özel VIP hizmeti için ödeme yapıp yapmadığı.
RoomService, FoodCourt, ShoppingMall, Spa, VRDeck- Yolcunun Uzay Gemisi Titanic’in birçok lüks olanağının her birinde fatura ettiği tutar.
_ Name- Yolcunun adı ve soyadı.
Transported- Yolcunun başka bir boyuta taşınıp taşınmadığı. Bu hedeftir, tahmin etmeye çalıştığınız sütundur.
test.csv - Yolcuların geri kalan üçte birinin (~4300) kişisel kayıtları, test verisi olarak kullanılacak. TransportedGöreviniz bu setteki yolcular için değerini tahmin etmektir .
sample_submission.csv - Doğru formatta bir gönderim dosyası.
PassengerId- Test setindeki her yolcunun kimliği.
Transported- Hedef. Her yolcu için veya’dan birini tahmin Trueedin False.
library(tidyverse)
library(explore)
train <- separate(train, Cabin, into = c("sutun1", "sutun2", "sutun3"), sep = "/", remove=FALSE)
summary(train)
## PassengerId HomePlanet CryoSleep Cabin
## Length:8693 Length:8693 Mode :logical Length:8693
## Class :character Class :character FALSE:5439 Class :character
## Mode :character Mode :character TRUE :3037 Mode :character
## NA's :217
##
##
##
## sutun1 sutun2 sutun3 Destination
## Length:8693 Length:8693 Length:8693 Length:8693
## Class :character Class :character Class :character Class :character
## Mode :character Mode :character Mode :character Mode :character
##
##
##
##
## Age VIP RoomService FoodCourt
## Min. : 0.00 Mode :logical Min. : 0.0 Min. : 0.0
## 1st Qu.:19.00 FALSE:8291 1st Qu.: 0.0 1st Qu.: 0.0
## Median :27.00 TRUE :199 Median : 0.0 Median : 0.0
## Mean :28.83 NA's :203 Mean : 224.7 Mean : 458.1
## 3rd Qu.:38.00 3rd Qu.: 47.0 3rd Qu.: 76.0
## Max. :79.00 Max. :14327.0 Max. :29813.0
## NA's :179 NA's :181 NA's :183
## ShoppingMall Spa VRDeck Name
## Min. : 0.0 Min. : 0.0 Min. : 0.0 Length:8693
## 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0 Class :character
## Median : 0.0 Median : 0.0 Median : 0.0 Mode :character
## Mean : 173.7 Mean : 311.1 Mean : 304.9
## 3rd Qu.: 27.0 3rd Qu.: 59.0 3rd Qu.: 46.0
## Max. :23492.0 Max. :22408.0 Max. :24133.0
## NA's :208 NA's :183 NA's :188
## Transported
## Mode :logical
## FALSE:4315
## TRUE :4378
##
##
##
##
train=train %>% mutate_if(is.character,as.factor)
train$HomePlanet <- as.factor(train$HomePlanet)
train %>% describe_all()
## # A tibble: 17 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId fct 0 0 8693 NA NA NA
## 2 HomePlanet fct 201 2.3 4 NA NA NA
## 3 CryoSleep lgl 217 2.5 3 0 0.36 1
## 4 Cabin fct 199 2.3 6561 NA NA NA
## 5 sutun1 fct 199 2.3 9 NA NA NA
## 6 sutun2 fct 199 2.3 1818 NA NA NA
## 7 sutun3 fct 199 2.3 3 NA NA NA
## 8 Destination fct 182 2.1 4 NA NA NA
## 9 Age dbl 179 2.1 81 0 28.8 79
## 10 VIP lgl 203 2.3 3 0 0.02 1
## 11 RoomService dbl 181 2.1 1274 0 225. 14327
## 12 FoodCourt dbl 183 2.1 1508 0 458. 29813
## 13 ShoppingMall dbl 208 2.4 1116 0 174. 23492
## 14 Spa dbl 183 2.1 1328 0 311. 22408
## 15 VRDeck dbl 188 2.2 1307 0 305. 24133
## 16 Name fct 200 2.3 8474 NA NA NA
## 17 Transported lgl 0 0 2 0 0.5 1
ggplot(train, aes(x=RoomService))+
geom_histogram()
## `stat_bin()` using `bins = 30`. Pick better value with `binwidth`.
## Warning: Removed 181 rows containing non-finite outside the scale range
## (`stat_bin()`).
library(mice)
##
## Attaching package: 'mice'
## The following object is masked from 'package:stats':
##
## filter
## The following objects are masked from 'package:base':
##
## cbind, rbind
VIM::aggr(x= train, sortVars=T)
##
## Variables sorted by number of missings:
## Variable Count
## CryoSleep 0.02496261
## ShoppingMall 0.02392730
## VIP 0.02335212
## HomePlanet 0.02312205
## Name 0.02300702
## Cabin 0.02289198
## sutun1 0.02289198
## sutun2 0.02289198
## sutun3 0.02289198
## VRDeck 0.02162660
## FoodCourt 0.02105142
## Spa 0.02105142
## Destination 0.02093639
## RoomService 0.02082135
## Age 0.02059128
## PassengerId 0.00000000
## Transported 0.00000000
md.pattern(train[1:"570",])
## PassengerId Transported VIP FoodCourt Spa Destination Name CryoSleep VRDeck
## 433 1 1 1 1 1 1 1 1 1
## 15 1 1 1 1 1 1 1 1 1
## 13 1 1 1 1 1 1 1 1 1
## 2 1 1 1 1 1 1 1 1 1
## 12 1 1 1 1 1 1 1 1 1
## 3 1 1 1 1 1 1 1 1 1
## 14 1 1 1 1 1 1 1 1 1
## 14 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 1 1
## 7 1 1 1 1 1 1 1 1 0
## 2 1 1 1 1 1 1 1 1 0
## 1 1 1 1 1 1 1 1 1 0
## 11 1 1 1 1 1 1 1 0 1
## 1 1 1 1 1 1 1 1 0 1
## 1 1 1 1 1 1 1 1 0 0
## 11 1 1 1 1 1 1 0 1 1
## 6 1 1 1 1 1 0 1 1 1
## 1 1 1 1 1 1 0 1 1 1
## 1 1 1 1 1 1 0 1 1 0
## 8 1 1 1 1 0 1 1 1 1
## 4 1 1 1 0 1 1 1 1 1
## 1 1 1 1 0 1 1 1 1 1
## 1 1 1 1 0 1 1 1 1 0
## 1 1 1 1 0 1 0 1 1 1
## 4 1 1 0 1 1 1 1 1 1
## 1 1 1 0 1 1 1 1 1 1
## 0 0 5 7 8 9 11 13 13
## RoomService Cabin sutun1 sutun2 sutun3 Age ShoppingMall HomePlanet
## 433 1 1 1 1 1 1 1 1 0
## 15 1 1 1 1 1 1 1 0 1
## 13 1 1 1 1 1 1 0 1 1
## 2 1 1 1 1 1 1 0 0 2
## 12 1 1 1 1 1 0 1 1 1
## 3 1 1 1 1 1 0 0 1 2
## 14 1 0 0 0 0 1 1 1 4
## 14 0 1 1 1 1 1 1 1 1
## 1 0 1 1 1 1 1 1 0 2
## 1 0 0 0 0 0 1 1 1 5
## 7 1 1 1 1 1 1 1 1 1
## 2 1 1 1 1 1 0 1 1 2
## 1 1 0 0 0 0 1 1 1 5
## 11 1 1 1 1 1 1 1 1 1
## 1 1 0 0 0 0 1 1 1 5
## 1 1 1 1 1 1 1 1 1 2
## 11 1 1 1 1 1 1 1 1 1
## 6 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 0 2
## 1 1 1 1 1 1 1 1 1 2
## 8 1 1 1 1 1 1 1 1 1
## 4 1 1 1 1 1 1 1 1 1
## 1 1 0 0 0 0 1 1 1 5
## 1 1 1 1 1 1 1 1 1 2
## 1 1 1 1 1 1 1 1 1 2
## 4 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 0 1 1 2
## 16 18 18 18 18 18 18 19 209
summary(train)
## PassengerId HomePlanet CryoSleep Cabin sutun1
## 0001_01: 1 Earth :4602 Mode :logical G/734/S: 8 F :2794
## 0002_01: 1 Europa:2131 FALSE:5439 B/11/S : 7 G :2559
## 0003_01: 1 Mars :1759 TRUE :3037 B/201/P: 7 E : 876
## 0003_02: 1 NA's : 201 NA's :217 B/82/S : 7 B : 779
## 0004_01: 1 C/137/S: 7 C : 747
## 0005_01: 1 (Other):8458 (Other): 739
## (Other):8687 NA's : 199 NA's : 199
## sutun2 sutun3 Destination Age
## 82 : 28 P :4206 55 Cancri e :1800 Min. : 0.00
## 19 : 22 S :4288 PSO J318.5-22: 796 1st Qu.:19.00
## 86 : 22 NA's: 199 TRAPPIST-1e :5915 Median :27.00
## 176 : 21 NA's : 182 Mean :28.83
## 56 : 21 3rd Qu.:38.00
## (Other):8380 Max. :79.00
## NA's : 199 NA's :179
## VIP RoomService FoodCourt ShoppingMall
## Mode :logical Min. : 0.0 Min. : 0.0 Min. : 0.0
## FALSE:8291 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0
## TRUE :199 Median : 0.0 Median : 0.0 Median : 0.0
## NA's :203 Mean : 224.7 Mean : 458.1 Mean : 173.7
## 3rd Qu.: 47.0 3rd Qu.: 76.0 3rd Qu.: 27.0
## Max. :14327.0 Max. :29813.0 Max. :23492.0
## NA's :181 NA's :183 NA's :208
## Spa VRDeck Name Transported
## Min. : 0.0 Min. : 0.0 Alraium Disivering: 2 Mode :logical
## 1st Qu.: 0.0 1st Qu.: 0.0 Ankalik Nateansive: 2 FALSE:4315
## Median : 0.0 Median : 0.0 Anton Woody : 2 TRUE :4378
## Mean : 311.1 Mean : 304.9 Apix Wala : 2
## 3rd Qu.: 59.0 3rd Qu.: 46.0 Asch Stradick : 2
## Max. :22408.0 Max. :24133.0 (Other) :8483
## NA's :183 NA's :188 NA's : 200
library(ggplot2)
train <- train[complete.cases(train), ]
summary(train)
## PassengerId HomePlanet CryoSleep Cabin sutun1
## 0001_01: 1 Earth :3566 Mode :logical B/11/S : 7 F :2152
## 0002_01: 1 Europa:1673 FALSE:4274 C/137/S : 7 G :1973
## 0003_01: 1 Mars :1367 TRUE :2332 E/13/S : 7 E : 683
## 0003_02: 1 G/1476/S: 7 B : 628
## 0004_01: 1 G/734/S : 7 C : 587
## 0005_01: 1 C/21/P : 6 D : 374
## (Other):6600 (Other) :6565 (Other): 209
## sutun2 sutun3 Destination Age VIP
## 82 : 22 P:3261 55 Cancri e :1407 Min. : 0.00 Mode :logical
## 56 : 19 S:3345 PSO J318.5-22: 623 1st Qu.:19.00 FALSE:6444
## 97 : 19 TRAPPIST-1e :4576 Median :27.00 TRUE :162
## 176 : 18 Mean :28.89
## 186 : 17 3rd Qu.:38.00
## 269 : 17 Max. :79.00
## (Other):6494
## RoomService FoodCourt ShoppingMall Spa
## Min. : 0 Min. : 0.00 Min. : 0.0 Min. : 0.0
## 1st Qu.: 0 1st Qu.: 0.00 1st Qu.: 0.0 1st Qu.: 0.0
## Median : 0 Median : 0.00 Median : 0.0 Median : 0.0
## Mean : 223 Mean : 478.96 Mean : 178.4 Mean : 313.2
## 3rd Qu.: 49 3rd Qu.: 82.75 3rd Qu.: 30.0 3rd Qu.: 65.0
## Max. :9920 Max. :29813.00 Max. :12253.0 Max. :22408.0
##
## VRDeck Name Transported
## Min. : 0.0 Alraium Disivering: 2 Mode :logical
## 1st Qu.: 0.0 Ankalik Nateansive: 2 FALSE:3279
## Median : 0.0 Anton Woody : 2 TRUE :3327
## Mean : 303.8 Apix Wala : 2
## 3rd Qu.: 52.0 Asch Stradick : 2
## Max. :20336.0 Carry Contrevins : 2
## (Other) :6594
VIM::aggr(x= train, sortVars=T)
##
## Variables sorted by number of missings:
## Variable Count
## PassengerId 0
## HomePlanet 0
## CryoSleep 0
## Cabin 0
## sutun1 0
## sutun2 0
## sutun3 0
## Destination 0
## Age 0
## VIP 0
## RoomService 0
## FoodCourt 0
## ShoppingMall 0
## Spa 0
## VRDeck 0
## Name 0
## Transported 0