\[F = m * a \]
library(ggplot2)
# Örnek yıllık nüfus verisi oluşturalım
yillar <- c(2015, 2016, 2017, 2018, 2019, 2020)
nufus <- c(78000000, 79000000, 80000000, 81000000, 82000000, 83000000)
# Verileri bir veri çerçevesine yerleştirelim
veri <- data.frame(Yıl = yillar, Nüfus = nufus)
# Nüfus artış grafiğini oluşturalım
ggplot(veri, aes(x = Yıl, y = Nüfus)) +
geom_line(color = "blue") +
geom_point(color = "red") +
labs(title = "Türkiye'nin Yıllara Göre Nüfus Artışı",
x = "Yıl",
y = "Nüfus",
caption = "Veriler hayali rakamlardır.")
Makine öğrenmesi, bilgisayarların veri kullanarak öğrenmelerini sağlayan bir teknolojidir. Bu teknoloji, veriye dayalı olarak belirli görevleri gerçekleştirmek için algoritmalar kullanır. Örneğin, resimlerde nesneleri tanıma, e-postalardaki spam mesajlarını tespit etme veya finansal verileri analiz etme gibi görevlerde kullanılabilir. Makine öğrenmesi, veriye dayalı öğrenme ve tahmin yapma süreçlerini otomatikleştirir ve genellikle denetimli, denetimsiz veya pekiştirmeli öğrenme olarak gruplandırılır. Bu teknoloji, birçok endüstride büyük veri analitiği, yapay zeka ve otomasyon alanlarında kullanılır.
2912 yılına hoş geldiniz, veri bilimi becerilerinizin bir kozmik gizemi çözmek için gerektiği bir zamandayız. Dört ışık yılı uzaklıktan bir ileti aldık ve durum pek iç açıcı değil.
Uzay Gemisi Titanic, yaklaşık bir ay önce fırlatılan bir yıldızlararası yolcu gemisiydi. Neredeyse 13.000 yolcusuyla gemi, güneş sistemimizden üç yeni yaşanabilir ekzoplanete yolcu taşıyarak ilk seyahatini başlattı.
İlk hedefi sıcak 55 Cancri E olan Titanic, Alpha Centauri’yi dolaşırken bir toz bulutunun içinde gizlenmiş bir uzayzaman anomalisiyle çarpıştı. Ne yazık ki, adını 1000 yıl önceki gemiden alan bu gemi benzer bir kaderi paylaştı. Gemi bütünlüğünü korudu ancak yolcuların neredeyse yarısı alternatif bir boyuta taşındı!
Kurtarma ekiplerine yardımcı olmak ve kayıp yolcuları kurtarmak için, geminin hasar görmüş bilgisayar sisteminden kurtarılan kayıtları kullanarak anomaliden etkilenen yolcuları tahmin etme görevi size veriliyor.
Onları kurtararak ve tarihi değiştirerek yardımcı olun!
Ortalama: Bir veri kümesindeki değerlerin toplamının veri sayısına bölünmesiyle elde edilen değerdir. Veri setinin merkezsel eğilimini gösterir. Örneğin, bir sınıftaki öğrencilerin notlarının ortalaması, tüm notların toplamının öğrenci sayısına bölünmesiyle bulunur.
Standart Sapma: Bir veri setindeki değerlerin ne kadar yayıldığını ölçen bir ölçüdür. Standart sapma, her bir veri noktasının ortalama ile ne kadar farklı olduğunu gösterir. Küçük standart sapma, veri noktalarının ortalama etrafında yoğunlaştığını, büyük standart sapma ise veri noktalarının ortalama etrafında daha yayıldığını gösterir.
Kovaryans: İki değişken arasındaki ilişkinin değişkenlik ölçüsüdür. Pozitif bir kovaryans, iki değişkenin birlikte arttığını, negatif bir kovaryans ise bir değişkenin artarken diğerinin azaldığını gösterir. Ancak, kovaryansın birimleri, değişkenlerin birimlerinin çarpımı olduğu için standart bir ölçü birimi değildir ve bu nedenle genellikle korelasyon katsayısı kullanılır.
Korelasyon: İki değişken arasındaki ilişkinin gücünü ve yönünü ölçen istatistiksel bir ölçüdür. Korelasyon katsayısı -1 ile +1 arasında değer alır. +1, mükemmel bir pozitif korelasyonu, -1 mükemmel bir negatif korelasyonu ve 0 ise iki değişken arasında hiçbir ilişki olmadığını gösterir. Korelasyon katsayısı, kovaryansın standart sapmaların çarpımına bölünmesiyle elde edilir, bu nedenle korelasyon katsayısı, değişkenlerin standartlaştırılmış bir ölçüsüdür.
Örnek: Bir firma, reklam harcamaları ile satışları arasındaki ilişkiyi değerlendirmek istiyor. Aşağıdaki veriler reklam harcamalarını (x) ve satışları (y) temsil ediyor:
Reklam Harcaması (x): 100, 200, 300, 400, 500 Satışlar (y): 50, 70, 90, 100, 120
Bu verilerle:
Ortalama reklam harcaması: (100 + 200 + 300 + 400 + 500) / 5 = 300 Ortalama satışlar: (50 + 70 + 90 + 100 + 120) / 5 = 86 Standart sapma: Reklam harcamaları ve satışlar için hesaplanır. Kovaryans ve korelasyon: Reklam harcamaları ile satışlar arasındaki ilişkiyi ölçmek için hesaplanır.
Train Seti (Eğitim Seti): Train seti, makine öğrenimi modelinin eğitildiği veri kümesidir. Bu veri kümesi, genellikle birçok örneğin (veri noktalarının veya gözlemlerin) yanı sıra bu örneklerle ilişkilendirilmiş doğru çıktılar (etiketler veya hedefler) içerir. Model, bu eğitim setini kullanarak öğrenme sürecini gerçekleştirir; yani, veriler arasındaki desenleri tanır ve bu desenleri temsil eden bir model oluşturur.
Test Seti (Doğrulama Seti): Test seti, eğitim sonrasında modelin performansını değerlendirmek için kullanılan ayrı bir veri kümesidir. Bu veri kümesi, modelin daha önce görmediği veri örneklerini içerir ve bu örneklerin doğru çıktıları da bilinir. Model, test setindeki verileri kullanarak tahminler yapar ve bu tahminlerle gerçek çıktılar arasındaki uyumu ölçeriz. Bu sayede modelin genelleme yeteneği hakkında bilgi ediniriz, yani yeni ve görülmemiş verilere nasıl cevap vereceğini tahmin ederiz.
library(readr)
train <- read_csv("train.csv")
test <- read_csv("test.csv")
library(rmarkdown)
paged_table(train)
Bu yarışmada göreviniz, Spaceship Titanic’in uzay-zaman anomali ile çarpışması sırasında bir yolcunun başka bir boyuta taşınıp taşınmadığını tahmin etmektir. Bu tahminleri yapmanıza yardımcı olmak için, geminin hasar görmüş bilgisayar sisteminden kurtarılan kişisel kayıtlardan oluşan bir set verilmiştir.
##Dosya ve Veri Alanı Açıklamaları
library(tidyverse)
veri <- separate(train, PassengerId, into = c("group_id","sequence_number"),sep = "_", remove = FALSE)
library(dplyr)
tekrarlanan_gruplar <- veri %>%
group_by(group_id) %>%
filter(n() > 1) %>%
pull(group_id)
veri <- veri %>%
mutate(beraber_yolculuk_yapanlar = ifelse(group_id) %in% tekrarlanan_gruplar , TRUE, FALSE)
veri <- separate(veri, Cabin, into = c("sutun1", "sutun2", "sutun3"), sep = "/", remove = FALSE)
library(explore)
describe_all(train)
## # A tibble: 14 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId chr 0 0 8693 NA NA NA
## 2 HomePlanet chr 201 2.3 4 NA NA NA
## 3 CryoSleep lgl 217 2.5 3 0 0.36 1
## 4 Cabin chr 199 2.3 6561 NA NA NA
## 5 Destination chr 182 2.1 4 NA NA NA
## 6 Age dbl 179 2.1 81 0 28.8 79
## 7 VIP lgl 203 2.3 3 0 0.02 1
## 8 RoomService dbl 181 2.1 1274 0 225. 14327
## 9 FoodCourt dbl 183 2.1 1508 0 458. 29813
## 10 ShoppingMall dbl 208 2.4 1116 0 174. 23492
## 11 Spa dbl 183 2.1 1328 0 311. 22408
## 12 VRDeck dbl 188 2.2 1307 0 305. 24133
## 13 Name chr 200 2.3 8474 NA NA NA
## 14 Transported lgl 0 0 2 0 0.5 1
veri2 <- veri %>% na.omit()
veri$HomePlanet <- as.factor(veri$HomePlanet)
veri <- veri %>%
group_by(group_id) %>%
mutate(homeplanet = if_else(is.na(HomePlanet), "Earth", HomePlanet))
veri$Destination <- as.factor(veri$Destination)
veri <- veri %>%
group_by(group_id) %>%
mutate(DestinationNasiz = if_else(is.na(Destination), "Earth", Destination))
summary(veri)
## PassengerId group_id sequence_number HomePlanet
## Length:8693 Length:8693 Length:8693 Earth :4602
## Class :character Class :character Class :character Europa:2131
## Mode :character Mode :character Mode :character Mars :1759
## NA's : 201
##
##
##
## CryoSleep Cabin sutun1 sutun2
## Mode :logical Length:8693 Length:8693 Length:8693
## FALSE:5439 Class :character Class :character Class :character
## TRUE :3037 Mode :character Mode :character Mode :character
## NA's :217
##
##
##
## sutun3 Destination Age VIP
## Length:8693 55 Cancri e :1800 Min. : 0.00 Mode :logical
## Class :character PSO J318.5-22: 796 1st Qu.:19.00 FALSE:8291
## Mode :character TRAPPIST-1e :5915 Median :27.00 TRUE :199
## NA's : 182 Mean :28.83 NA's :203
## 3rd Qu.:38.00
## Max. :79.00
## NA's :179
## RoomService FoodCourt ShoppingMall Spa
## Min. : 0.0 Min. : 0.0 Min. : 0.0 Min. : 0.0
## 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0
## Median : 0.0 Median : 0.0 Median : 0.0 Median : 0.0
## Mean : 224.7 Mean : 458.1 Mean : 173.7 Mean : 311.1
## 3rd Qu.: 47.0 3rd Qu.: 76.0 3rd Qu.: 27.0 3rd Qu.: 59.0
## Max. :14327.0 Max. :29813.0 Max. :23492.0 Max. :22408.0
## NA's :181 NA's :183 NA's :208 NA's :183
## VRDeck Name Transported beraber_yolculuk_yapanlar
## Min. : 0.0 Length:8693 Mode :logical Mode :logical
## 1st Qu.: 0.0 Class :character FALSE:4315 FALSE:8693
## Median : 0.0 Mode :character TRUE :4378
## Mean : 304.9
## 3rd Qu.: 46.0
## Max. :24133.0
## NA's :188
## TRUE FALSE homeplanet DestinationNasiz
## Mode:logical Mode :logical Length:8693 Length:8693
## TRUE:8693 FALSE:8693 Class :character Class :character
## Mode :character Mode :character
##
##
##
##
veri$HomePlanet <- as.factor(veri$HomePlanet)
veri <- veri %>%
group_by(group_id) %>%
mutate(homeplanetnasiz = if_else(is.na(HomePlanet), "Earth", HomePlanet))
veri$Destination <- as.factor(veri$Destination)
veri <- veri %>%
group_by(group_id) %>%
mutate(DestinationNasiz = if_else(is.na(Destination), "Earth", Destination))
veri$DestinationNasiz <- as.factor(veri$DestinationNasiz)
veri$VIP <- as.factor(veri$VIP)
library(dplyr)
library(magrittr)
##
## Attaching package: 'magrittr'
## The following object is masked from 'package:purrr':
##
## set_names
## The following object is masked from 'package:tidyr':
##
## extract
veri <- veri %>%
group_by(group_id) %>%
mutate(VIPNasiz = if_else(is.na(VIP), "FALSE", VIP))
veri$VIPNasiz <- as.factor(veri$VIPNasiz)
veri$RoomService <- as.factor(veri$RoomService)
train <- train %>% mutate_if(is.character,as.factor)
library(ggplot2)
ggplot(train, aes(x=RoomService)) +
geom_histogram()
## `stat_bin()` using `bins = 30`. Pick better value with `binwidth`.
## Warning: Removed 181 rows containing non-finite outside the scale range
## (`stat_bin()`).
veri <- veri %>%
group_by(group_id) %>%
mutate(RoomServiceNAsiz = if_else(is.na(RoomService), "0", RoomService))
veri$RoomServiceNAsiz <- as.factor(veri$RoomServiceNAsiz)