• Ryükleme
• Rmarkdown başlangıç
• Web sayfasını hazırlama
• Internete yükleme
\[ a+b+c=a(b+c) \]
##Türkiye ve Rusya’nın enflasyon
library(WDI)
turkiye_enflasyon <- c(10.2, 12.5, 14.3, 11.8)
rusya_enflasyon <- c(7.8, 8.2, 6.5, 9.0)
yillar <- c(2019, 2020, 2021, 2022)
# ggplot2 paketini yükleme
library(ggplot2)
# Veri çerçevesi oluşturma
veri <- data.frame(Yil = yillar, Turkiye = turkiye_enflasyon, Rusya = rusya_enflasyon)
# Zaman serisi grafiğini oluşturma
grafik <- ggplot(veri, aes(x = Yil)) +
geom_line(aes(y = Turkiye, color = "Turkiye")) +
geom_line(aes(y = Rusya, color = "Rusya")) +
labs(title = "Türkiye ve Rusya Enflasyonu (2019-2022)",
x = "Yıl",
y = "Enflasyon Oranı") +
scale_color_manual(values = c(Turkiye = "blue", Rusya = "red")) +
theme_minimal()
# Grafiği görüntüleme
print(grafik)
##MAKINE ÖĞRENMESI AÇIKLAYAN
Makine öğrenmesi, bilgisayar sistemlerinin deneyimden öğrenerek belirli bir görevi gerçekleştirmesini sağlayan bir yapay zeka alt dalıdır. Geleneksel programlama yaklaşımlarından farklı olarak, makine öğrenimi algoritmaları veriden öğrenir ve bu öğrenme sürecindeki deneyimleri kullanarak gelecekteki verilere dayalı tahminlerde bulunabilir veya kararlar verebilir.
Makine öğrenimi, genellikle iki ana kategoriye ayrılır:
Denetimli Öğrenme: Bu kategoride, algoritmaya giriş ve çıkış arasındaki ilişkiyi öğrenmesi için etiketlenmiş veri sağlanır. Algoritma, giriş verilerini kullanarak doğru çıkışı tahmin etmeyi öğrenir. Örnek algoritmalar arasında destek vektör makineleri (SVM), karar ağaçları, doğrusal regresyon ve yapay sinir ağları bulunur.
Denetimsiz Öğrenme: Bu kategoride, veri etiketlenmemiş olduğu için algoritma veri setindeki kalıpları veya yapıları öğrenmek için kullanılır. Algoritma, veri setindeki benzerlikleri veya grupları tanımlamak veya veri setini sıkıştırmak gibi görevler için kullanılabilir. K-means kümeleme, hiyerarşik kümeleme ve boyut indirgeme teknikleri gibi örnek algoritmalar bulunur.
Makine öğrenimi, birçok farklı uygulama alanında kullanılır, örneğin:
Makine öğrenimi süreci genellikle veri toplama, veri ön işleme, model eğitimi, model değerlendirmesi ve son olarak modelin dağıtımı ve kullanımı adımlarını içerir. Bu süreç, karmaşık problemleri çözmek için güçlü bir araç seti sağlar ve sürekli olarak gelişen bir araştırma ve uygulama alanıdır.
Kozmik bir gizemi çözmek için veri bilimi becerilerinize ihtiyaç duyulan 2912 yılına hoş geldiniz. Dört ışık yılı öteden bir sinyal aldık ve işler pek iyi görünmüyor.
Uzay Gemisi Titanik, bir ay önce fırlatılan yıldızlararası bir yolcu gemisiydi. Gemide neredeyse 13.000 yolcu bulunan gemi, güneş sistemimizden göçmenleri yakın yıldızların yörüngesinde bulunan üç yeni yaşanabilir dış gezegene taşımak üzere ilk yolculuğuna çıktı.
Dikkatsiz Uzay Gemisi Titanic, ilk varış noktası olan kavurucu 55 Cancri E’ye giderken Alpha Centauri’yi dönerken, bir toz bulutunun içine gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki 1000 yıl önceki adaşı ile benzer bir kaderle karşılaştı. Gemi sağlam kalmasına rağmen yolcuların neredeyse yarısı alternatif bir boyuta taşındı!
Ortalama, bir veri kümesindeki değerlerin toplamının veri sayısına bölünmesiyle elde edilen bir ölçüdür. Veri setindeki her değerin katkısı eşit olarak hesaba katılır. Genellikle bir veri kümesinin genel bir temsilini sağlamak için kullanılır.
\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]
# Veri kümesi oluşturalım
veri <- c(10, 15, 20, 25, 30)
# Aritmetik ortalama hesaplayalım
ortalama <- mean(veri)
print(ortalama)
## [1] 20
Standart sapma, bir veri kümesindeki değerlerin ortalama etrafında ne kadar yayıldığını ölçen bir istatistiksel ölçüdür. Standart sapma, her bir veri noktasının ortalama değerden ne kadar uzak olduğunu gösterir. Daha düşük bir standart sapma, veri noktalarının ortalama etrafında daha sıkı bir şekilde toplandığını gösterirken, daha yüksek bir standart sapma, veri noktalarının daha geniş bir aralığa yayıldığını gösterir.
\[ \sigma = \sqrt \frac {\Sigma^N_i (X_i-\bar{X})^2}{N} \]
Kovaryans, iki değişken arasındaki ilişkinin değişkenlik ölçüsünü ifade eden bir istatistik terimidir. Pozitif kovaryans, değişkenlerin birlikte artma eğiliminde olduğunu gösterirken, negatif kovaryans, bir değişken artarken diğerinin azaldığını gösterir. Kovaryansın mutlak değeri, değişkenler arasındaki ilişkinin gücünü temsil eder.
\[ [ Cov(X, Y) = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y}) ] \]
# İki değişkeni oluşturalım
x <- c(1, 2, 3, 4, 5)
y <- c(2, 3, 4, 5, 6)
# Kovaryansı hesaplayalım
kovaryans <- cov(x, y)
print(kovaryans)
## [1] 2.5
Korelasyon, iki değişken arasındaki ilişkinin gücünü ve yönünü ölçen bir istatistiksel ölçüdür. Korelasyon katsayısı genellikle -1 ile 1 arasında değer alır. Pozitif bir korelasyon katsayısı, iki değişken arasında doğrusal bir ilişkinin olduğunu gösterirken, negatif bir korelasyon katsayısı ise iki değişken arasında ters bir ilişkinin olduğunu gösterir. Korelasyon katsayısının mutlak değeri, ilişkinin gücünü gösterir.
\[ R = \frac {\Sigma (x_i-\bar{x})(y_i-\bar{y})}{ \sqrt {\Sigma (x_i-\bar{x})^2 \Sigma (y_i-\bar{y})^2}} \]
# İki değişkeni oluşturalım
x <- c(1, 2, 3, 4, 5)
y <- c(2, 4, 6, 8, 10)
# Korelasyonu hesaplayalım
korelasyon <- cor(x, y)
print(korelasyon)
## [1] 1
“Train” ve “test”, makine öğrenimi ve istatistiksel modelleme gibi alanlarda kullanılan terimlerdir.
Train (Eğitim):
Eğitim veri seti olarak da adlandırılır. Modelin eğitilmesi için kullanılan veri setidir. Bu veri seti, modelin öğrenme sürecinde kullanılarak modelin parametrelerinin ve içsel yapılarının belirlenmesini sağlar. Eğitim veri seti genellikle veri setinin büyük bir kısmını oluşturur. Test:
Test veri seti olarak da adlandırılır. Eğitilmiş modelin performansını değerlendirmek için kullanılan veri setidir. Modelin daha önce görmediği, eğitim sürecinde kullanılmamış verilerden oluşur. Modelin genelleme yeteneğini ve gerçek dünya verileri üzerindeki performansını değerlendirmek için kullanılır. Test veri seti genellikle eğitim veri setinin küçük bir kısmını oluşturur. Makine öğrenimi modelinin başarısını değerlendirmek için, model eğitimi sırasında eğitim veri setine uygulandığında beklenen çıktılarla gerçek çıktılar arasındaki farkı ölçen bir kayıp fonksiyonu kullanılır. Ardından, modelin performansını değerlendirmek için test veri seti üzerinde bu kayıp fonksiyonu kullanılır. Böylece, modelin eğitim veri setine aşırı uyum sağlaması (overfitting) durumunda bu durumun tespit edilmesi ve modelin gerçek dünya verileri üzerinde ne kadar iyi performans gösterdiğinin belirlenmesi sağlanır.
library(readr)
test <- read_csv("test.csv")
library(readr)
train <- read_csv("train.csv")
test
## # A tibble: 4,277 × 13
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0013_01 Earth TRUE G/3/S TRAPPIST-1e 27 FALSE 0
## 2 0018_01 Earth FALSE F/4/S TRAPPIST-1e 19 FALSE 0
## 3 0019_01 Europa TRUE C/0/S 55 Cancri e 31 FALSE 0
## 4 0021_01 Europa FALSE C/1/S TRAPPIST-1e 38 FALSE 0
## 5 0023_01 Earth FALSE F/5/S TRAPPIST-1e 20 FALSE 10
## 6 0027_01 Earth FALSE F/7/P TRAPPIST-1e 31 FALSE 0
## 7 0029_01 Europa TRUE B/2/P 55 Cancri e 21 FALSE 0
## 8 0032_01 Europa TRUE D/0/S TRAPPIST-1e 20 FALSE 0
## 9 0032_02 Europa TRUE D/0/S 55 Cancri e 23 FALSE 0
## 10 0033_01 Earth FALSE F/7/S 55 Cancri e 24 FALSE 0
## # ℹ 4,267 more rows
## # ℹ 5 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>
train
## # A tibble: 8,693 × 14
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0001_01 Europa FALSE B/0/P TRAPPIST-1e 39 FALSE 0
## 2 0002_01 Earth FALSE F/0/S TRAPPIST-1e 24 FALSE 109
## 3 0003_01 Europa FALSE A/0/S TRAPPIST-1e 58 TRUE 43
## 4 0003_02 Europa FALSE A/0/S TRAPPIST-1e 33 FALSE 0
## 5 0004_01 Earth FALSE F/1/S TRAPPIST-1e 16 FALSE 303
## 6 0005_01 Earth FALSE F/0/P PSO J318.5-22 44 FALSE 0
## 7 0006_01 Earth FALSE F/2/S TRAPPIST-1e 26 FALSE 42
## 8 0006_02 Earth TRUE G/0/S TRAPPIST-1e 28 FALSE 0
## 9 0007_01 Earth FALSE F/3/S TRAPPIST-1e 35 FALSE 0
## 10 0008_01 Europa TRUE B/1/P 55 Cancri e 14 FALSE 0
## # ℹ 8,683 more rows
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>, Transported <lgl>
train.csv - Eğitim verisi olarak kullanılmak üzere yaklaşık üçte ikisi (~8700) yolcunun kişisel kayıtları
PassengerId - Her yolcu için benzersiz bir Kimlik. Her Kimlik, gggg_pp biçiminde olup, gggg, yolcuyla seyahat eden grubu ve pp, gruptaki sırasını belirtir. Bir gruptaki insanlar genellikle aile üyeleridir, ancak her zaman değil.
HomePlanet - Yolcunun ayrıldığı gezegen, genellikle kalıcı ikamet gezegenleri.
CryoSleep - Yolcunun yolculuğun süresince dondurularak animasyonu durdurmayı seçip seçmediğini belirtir. Cryosleep’teki yolcular kabinlerine kapatılmıştır.
Cabin - Yolcunun konakladığı kabin numarası. deck/num/side şeklinde alır, burada side, Port için P veya Starboard için S olabilir . Destination - Yolcunun ineceği gezegen.
Age - Yolcunun yaşı.
VIP - Yolcunun yolculuk sırasında özel VIP hizmeti için ödeme yapmış olup olmadığını belirtir.
RoomService,FoodCourt, ShoppingMall, Spa, VRDeck - Spaceship Titanic’in birçok lüks olanaklarında yolcunun fatura ettiği miktar.
Name - Yolcunun adı ve soyadı Transported - Yolcunun başka bir boyuta taşınıp taşınmadığını belirtir. Bu, tahmin etmeye çalıştığınız sütun olan hedeftir.
test.csv** - Test verisi olarak kullanılmak üzere geriye kalan üçte birlik (~4300) yolcunun kişisel kayıtları. Göreviniz, bu setteki yolcular için Transported değerini tahmin etmektir. sample_submission. csv - Doğru formatta bir gönderim dosyası.
PassengerId - Test setindeki her yolcu için Kimlik. Transported - Hedef. Her yolcu için, True veya False tahmin edin.
library (explore)
library (tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr 1.1.4 ✔ stringr 1.5.1
## ✔ forcats 1.0.0 ✔ tibble 3.2.1
## ✔ lubridate 1.9.3 ✔ tidyr 1.3.1
## ✔ purrr 1.0.2
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag() masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
train <- separate(train, Cabin, into = c("sutun1", "sutun2", "sutun3"), sep = "/", remove=FALSE)
train= train %>% mutate_if(is.character,as.factor)
train$HomePlanet <- as.factor(train$HomePlanet)
train %>% describe_all()
## # A tibble: 17 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId fct 0 0 8693 NA NA NA
## 2 HomePlanet fct 201 2.3 4 NA NA NA
## 3 CryoSleep lgl 217 2.5 3 0 0.36 1
## 4 Cabin fct 199 2.3 6561 NA NA NA
## 5 sutun1 fct 199 2.3 9 NA NA NA
## 6 sutun2 fct 199 2.3 1818 NA NA NA
## 7 sutun3 fct 199 2.3 3 NA NA NA
## 8 Destination fct 182 2.1 4 NA NA NA
## 9 Age dbl 179 2.1 81 0 28.8 79
## 10 VIP lgl 203 2.3 3 0 0.02 1
## 11 RoomService dbl 181 2.1 1274 0 225. 14327
## 12 FoodCourt dbl 183 2.1 1508 0 458. 29813
## 13 ShoppingMall dbl 208 2.4 1116 0 174. 23492
## 14 Spa dbl 183 2.1 1328 0 311. 22408
## 15 VRDeck dbl 188 2.2 1307 0 305. 24133
## 16 Name fct 200 2.3 8474 NA NA NA
## 17 Transported lgl 0 0 2 0 0.5 1
ggplot(train, aes(x=RoomService))+
geom_histogram()
library(mice)
##
## Attachement du package : 'mice'
## L'objet suivant est masqué depuis 'package:stats':
##
## filter
## Les objets suivants sont masqués depuis 'package:base':
##
## cbind, rbind
VIM::aggr(x= train, sortVars=T)
##
## Variables sorted by number of missings:
## Variable Count
## CryoSleep 0.02496261
## ShoppingMall 0.02392730
## VIP 0.02335212
## HomePlanet 0.02312205
## Name 0.02300702
## Cabin 0.02289198
## sutun1 0.02289198
## sutun2 0.02289198
## sutun3 0.02289198
## VRDeck 0.02162660
## FoodCourt 0.02105142
## Spa 0.02105142
## Destination 0.02093639
## RoomService 0.02082135
## Age 0.02059128
## PassengerId 0.00000000
## Transported 0.00000000
md.pattern(train[1:580,])
## PassengerId Transported VIP FoodCourt Spa Destination Name CryoSleep VRDeck
## 440 1 1 1 1 1 1 1 1 1
## 13 1 1 1 1 1 1 1 1 1
## 15 1 1 1 1 1 1 1 1 1
## 2 1 1 1 1 1 1 1 1 1
## 12 1 1 1 1 1 1 1 1 1
## 3 1 1 1 1 1 1 1 1 1
## 14 1 1 1 1 1 1 1 1 1
## 14 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 1 1
## 7 1 1 1 1 1 1 1 1 0
## 1 1 1 1 1 1 1 1 1 0
## 2 1 1 1 1 1 1 1 1 0
## 1 1 1 1 1 1 1 1 1 0
## 11 1 1 1 1 1 1 1 0 1
## 1 1 1 1 1 1 1 1 0 1
## 1 1 1 1 1 1 1 1 0 0
## 11 1 1 1 1 1 1 0 1 1
## 7 1 1 1 1 1 0 1 1 1
## 1 1 1 1 1 1 0 1 1 1
## 1 1 1 1 1 1 0 1 1 0
## 8 1 1 1 1 0 1 1 1 1
## 5 1 1 1 0 1 1 1 1 1
## 1 1 1 1 0 1 1 1 1 1
## 1 1 1 1 0 1 1 1 1 0
## 1 1 1 1 0 1 0 1 1 1
## 4 1 1 0 1 1 1 1 1 1
## 1 1 1 0 1 1 1 1 1 1
## 0 0 5 8 8 10 11 13 14
## RoomService Cabin sutun1 sutun2 sutun3 Age HomePlanet ShoppingMall
## 440 1 1 1 1 1 1 1 1 0
## 13 1 1 1 1 1 1 1 0 1
## 15 1 1 1 1 1 1 0 1 1
## 2 1 1 1 1 1 1 0 0 2
## 12 1 1 1 1 1 0 1 1 1
## 3 1 1 1 1 1 0 1 0 2
## 14 1 0 0 0 0 1 1 1 4
## 14 0 1 1 1 1 1 1 1 1
## 1 0 1 1 1 1 1 0 1 2
## 1 0 0 0 0 0 1 1 1 5
## 7 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 1 0 2
## 2 1 1 1 1 1 0 1 1 2
## 1 1 0 0 0 0 1 1 1 5
## 11 1 1 1 1 1 1 1 1 1
## 1 1 0 0 0 0 1 1 1 5
## 1 1 1 1 1 1 1 1 1 2
## 11 1 1 1 1 1 1 1 1 1
## 7 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 1 0 1 2
## 1 1 1 1 1 1 1 1 1 2
## 8 1 1 1 1 1 1 1 1 1
## 5 1 1 1 1 1 1 1 1 1
## 1 1 0 0 0 0 1 1 1 5
## 1 1 1 1 1 1 1 1 1 2
## 1 1 1 1 1 1 1 1 1 2
## 4 1 1 1 1 1 1 1 1 1
## 1 1 1 1 1 1 0 1 1 2
## 16 18 18 18 18 18 19 19 213
summary(train)
## PassengerId HomePlanet CryoSleep Cabin sutun1
## 0001_01: 1 Earth :4602 Mode :logical G/734/S: 8 F :2794
## 0002_01: 1 Europa:2131 FALSE:5439 B/11/S : 7 G :2559
## 0003_01: 1 Mars :1759 TRUE :3037 B/201/P: 7 E : 876
## 0003_02: 1 NA's : 201 NA's :217 B/82/S : 7 B : 779
## 0004_01: 1 C/137/S: 7 C : 747
## 0005_01: 1 (Other):8458 (Other): 739
## (Other):8687 NA's : 199 NA's : 199
## sutun2 sutun3 Destination Age
## 82 : 28 P :4206 55 Cancri e :1800 Min. : 0.00
## 19 : 22 S :4288 PSO J318.5-22: 796 1st Qu.:19.00
## 86 : 22 NA's: 199 TRAPPIST-1e :5915 Median :27.00
## 176 : 21 NA's : 182 Mean :28.83
## 56 : 21 3rd Qu.:38.00
## (Other):8380 Max. :79.00
## NA's : 199 NA's :179
## VIP RoomService FoodCourt ShoppingMall
## Mode :logical Min. : 0.0 Min. : 0.0 Min. : 0.0
## FALSE:8291 1st Qu.: 0.0 1st Qu.: 0.0 1st Qu.: 0.0
## TRUE :199 Median : 0.0 Median : 0.0 Median : 0.0
## NA's :203 Mean : 224.7 Mean : 458.1 Mean : 173.7
## 3rd Qu.: 47.0 3rd Qu.: 76.0 3rd Qu.: 27.0
## Max. :14327.0 Max. :29813.0 Max. :23492.0
## NA's :181 NA's :183 NA's :208
## Spa VRDeck Name Transported
## Min. : 0.0 Min. : 0.0 Alraium Disivering: 2 Mode :logical
## 1st Qu.: 0.0 1st Qu.: 0.0 Ankalik Nateansive: 2 FALSE:4315
## Median : 0.0 Median : 0.0 Anton Woody : 2 TRUE :4378
## Mean : 311.1 Mean : 304.9 Apix Wala : 2
## 3rd Qu.: 59.0 3rd Qu.: 46.0 Asch Stradick : 2
## Max. :22408.0 Max. :24133.0 (Other) :8483
## NA's :183 NA's :188 NA's : 200