Ilk proje

• Ryükleme

• Rmarkdown başlangıç

• Web sayfasını hazırlama

• Internete yükleme

Formül

\[ a+b+c=a(b+c) \]

##Türkiye ve Rusya’nın enflasyon

library(WDI)
turkiye_enflasyon <- c(10.2, 12.5, 14.3, 11.8)
rusya_enflasyon <- c(7.8, 8.2, 6.5, 9.0)
yillar <- c(2019, 2020, 2021, 2022)

# ggplot2 paketini yükleme
library(ggplot2)

# Veri çerçevesi oluşturma
veri <- data.frame(Yil = yillar, Turkiye = turkiye_enflasyon, Rusya = rusya_enflasyon)

# Zaman serisi grafiğini oluşturma
grafik <- ggplot(veri, aes(x = Yil)) +
  geom_line(aes(y = Turkiye, color = "Turkiye")) +
  geom_line(aes(y = Rusya, color = "Rusya")) +
  labs(title = "Türkiye ve Rusya Enflasyonu (2019-2022)",
       x = "Yıl",
       y = "Enflasyon Oranı") +
  scale_color_manual(values = c(Turkiye = "blue", Rusya = "red")) +
  theme_minimal()

# Grafiği görüntüleme
print(grafik)

##MAKINE ÖĞRENMESI AÇIKLAYAN

Makine öğrenmesi, bilgisayar sistemlerinin deneyimden öğrenerek belirli bir görevi gerçekleştirmesini sağlayan bir yapay zeka alt dalıdır. Geleneksel programlama yaklaşımlarından farklı olarak, makine öğrenimi algoritmaları veriden öğrenir ve bu öğrenme sürecindeki deneyimleri kullanarak gelecekteki verilere dayalı tahminlerde bulunabilir veya kararlar verebilir.

Makine öğrenimi, genellikle iki ana kategoriye ayrılır:

  1. Denetimli Öğrenme: Bu kategoride, algoritmaya giriş ve çıkış arasındaki ilişkiyi öğrenmesi için etiketlenmiş veri sağlanır. Algoritma, giriş verilerini kullanarak doğru çıkışı tahmin etmeyi öğrenir. Örnek algoritmalar arasında destek vektör makineleri (SVM), karar ağaçları, doğrusal regresyon ve yapay sinir ağları bulunur.

  2. Denetimsiz Öğrenme: Bu kategoride, veri etiketlenmemiş olduğu için algoritma veri setindeki kalıpları veya yapıları öğrenmek için kullanılır. Algoritma, veri setindeki benzerlikleri veya grupları tanımlamak veya veri setini sıkıştırmak gibi görevler için kullanılabilir. K-means kümeleme, hiyerarşik kümeleme ve boyut indirgeme teknikleri gibi örnek algoritmalar bulunur.

Makine öğrenimi, birçok farklı uygulama alanında kullanılır, örneğin:

  • Görüntü Tanıma: Nesneleri veya desenleri tanımlamak için kullanılır.
  • Doğal Dil İşleme: Metin verilerini anlamak ve analiz etmek için kullanılır.
  • Tıbbi Teşhis: Hastalıkları teşhis etmek veya tedavi önerileri sağlamak için kullanılır.
  • Pazarlama ve Kişiselleştirme: Müşteri davranışlarını analiz ederek özelleştirilmiş pazarlama stratejileri oluşturmak için kullanılır.

Makine öğrenimi süreci genellikle veri toplama, veri ön işleme, model eğitimi, model değerlendirmesi ve son olarak modelin dağıtımı ve kullanımı adımlarını içerir. Bu süreç, karmaşık problemleri çözmek için güçlü bir araç seti sağlar ve sürekli olarak gelişen bir araştırma ve uygulama alanıdır.

SPACE TITANIC

KAGGLE PROJE

Spaceship titanic ( kaggle tanımı)

Kozmik bir gizemi çözmek için veri bilimi becerilerinize ihtiyaç duyulan 2912 yılına hoş geldiniz. Dört ışık yılı öteden bir sinyal aldık ve işler pek iyi görünmüyor.

Uzay Gemisi Titanik, bir ay önce fırlatılan yıldızlararası bir yolcu gemisiydi. Gemide neredeyse 13.000 yolcu bulunan gemi, güneş sistemimizden göçmenleri yakın yıldızların yörüngesinde bulunan üç yeni yaşanabilir dış gezegene taşımak üzere ilk yolculuğuna çıktı.

Dikkatsiz Uzay Gemisi Titanic, ilk varış noktası olan kavurucu 55 Cancri E’ye giderken Alpha Centauri’yi dönerken, bir toz bulutunun içine gizlenmiş bir uzay-zaman anormalliğiyle çarpıştı. Ne yazık ki 1000 yıl önceki adaşı ile benzer bir kaderle karşılaştı. Gemi sağlam kalmasına rağmen yolcuların neredeyse yarısı alternatif bir boyuta taşındı!

Ortalama nedir?

Ortalama, bir veri kümesindeki değerlerin toplamının veri sayısına bölünmesiyle elde edilen bir ölçüdür. Veri setindeki her değerin katkısı eşit olarak hesaba katılır. Genellikle bir veri kümesinin genel bir temsilini sağlamak için kullanılır.

Formül

\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]

# Veri kümesi oluşturalım
veri <- c(10, 15, 20, 25, 30)

# Aritmetik ortalama hesaplayalım
ortalama <- mean(veri)
print(ortalama)
## [1] 20

Standart sapma nedir ?

Standart sapma, bir veri kümesindeki değerlerin ortalama etrafında ne kadar yayıldığını ölçen bir istatistiksel ölçüdür. Standart sapma, her bir veri noktasının ortalama değerden ne kadar uzak olduğunu gösterir. Daha düşük bir standart sapma, veri noktalarının ortalama etrafında daha sıkı bir şekilde toplandığını gösterirken, daha yüksek bir standart sapma, veri noktalarının daha geniş bir aralığa yayıldığını gösterir.

Formül

\[ \sigma = \sqrt \frac {\Sigma^N_i (X_i-\bar{X})^2}{N} \]

kovaryans nedir ?

Kovaryans, iki değişken arasındaki ilişkinin değişkenlik ölçüsünü ifade eden bir istatistik terimidir. Pozitif kovaryans, değişkenlerin birlikte artma eğiliminde olduğunu gösterirken, negatif kovaryans, bir değişken artarken diğerinin azaldığını gösterir. Kovaryansın mutlak değeri, değişkenler arasındaki ilişkinin gücünü temsil eder.

Formül

\[ [ Cov(X, Y) = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y}) ] \]

# İki değişkeni oluşturalım
x <- c(1, 2, 3, 4, 5)
y <- c(2, 3, 4, 5, 6)

# Kovaryansı hesaplayalım
kovaryans <- cov(x, y)
print(kovaryans)
## [1] 2.5

korelasyon nedir ?

Korelasyon, iki değişken arasındaki ilişkinin gücünü ve yönünü ölçen bir istatistiksel ölçüdür. Korelasyon katsayısı genellikle -1 ile 1 arasında değer alır. Pozitif bir korelasyon katsayısı, iki değişken arasında doğrusal bir ilişkinin olduğunu gösterirken, negatif bir korelasyon katsayısı ise iki değişken arasında ters bir ilişkinin olduğunu gösterir. Korelasyon katsayısının mutlak değeri, ilişkinin gücünü gösterir.

Formül

\[ R = \frac {\Sigma (x_i-\bar{x})(y_i-\bar{y})}{ \sqrt {\Sigma (x_i-\bar{x})^2 \Sigma (y_i-\bar{y})^2}} \]

# İki değişkeni oluşturalım
x <- c(1, 2, 3, 4, 5)
y <- c(2, 4, 6, 8, 10)

# Korelasyonu hesaplayalım
korelasyon <- cor(x, y)
print(korelasyon)
## [1] 1

train ve test nedir

“Train” ve “test”, makine öğrenimi ve istatistiksel modelleme gibi alanlarda kullanılan terimlerdir.

Train (Eğitim):

Eğitim veri seti olarak da adlandırılır. Modelin eğitilmesi için kullanılan veri setidir. Bu veri seti, modelin öğrenme sürecinde kullanılarak modelin parametrelerinin ve içsel yapılarının belirlenmesini sağlar. Eğitim veri seti genellikle veri setinin büyük bir kısmını oluşturur. Test:

Test veri seti olarak da adlandırılır. Eğitilmiş modelin performansını değerlendirmek için kullanılan veri setidir. Modelin daha önce görmediği, eğitim sürecinde kullanılmamış verilerden oluşur. Modelin genelleme yeteneğini ve gerçek dünya verileri üzerindeki performansını değerlendirmek için kullanılır. Test veri seti genellikle eğitim veri setinin küçük bir kısmını oluşturur. Makine öğrenimi modelinin başarısını değerlendirmek için, model eğitimi sırasında eğitim veri setine uygulandığında beklenen çıktılarla gerçek çıktılar arasındaki farkı ölçen bir kayıp fonksiyonu kullanılır. Ardından, modelin performansını değerlendirmek için test veri seti üzerinde bu kayıp fonksiyonu kullanılır. Böylece, modelin eğitim veri setine aşırı uyum sağlaması (overfitting) durumunda bu durumun tespit edilmesi ve modelin gerçek dünya verileri üzerinde ne kadar iyi performans gösterdiğinin belirlenmesi sağlanır.

library(readr)
test <- read_csv("test.csv")
library(readr)
train <- read_csv("train.csv")
test
## # A tibble: 4,277 × 13
##    PassengerId HomePlanet CryoSleep Cabin Destination   Age VIP   RoomService
##    <chr>       <chr>      <lgl>     <chr> <chr>       <dbl> <lgl>       <dbl>
##  1 0013_01     Earth      TRUE      G/3/S TRAPPIST-1e    27 FALSE           0
##  2 0018_01     Earth      FALSE     F/4/S TRAPPIST-1e    19 FALSE           0
##  3 0019_01     Europa     TRUE      C/0/S 55 Cancri e    31 FALSE           0
##  4 0021_01     Europa     FALSE     C/1/S TRAPPIST-1e    38 FALSE           0
##  5 0023_01     Earth      FALSE     F/5/S TRAPPIST-1e    20 FALSE          10
##  6 0027_01     Earth      FALSE     F/7/P TRAPPIST-1e    31 FALSE           0
##  7 0029_01     Europa     TRUE      B/2/P 55 Cancri e    21 FALSE           0
##  8 0032_01     Europa     TRUE      D/0/S TRAPPIST-1e    20 FALSE           0
##  9 0032_02     Europa     TRUE      D/0/S 55 Cancri e    23 FALSE           0
## 10 0033_01     Earth      FALSE     F/7/S 55 Cancri e    24 FALSE           0
## # ℹ 4,267 more rows
## # ℹ 5 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## #   VRDeck <dbl>, Name <chr>
train
## # A tibble: 8,693 × 14
##    PassengerId HomePlanet CryoSleep Cabin Destination     Age VIP   RoomService
##    <chr>       <chr>      <lgl>     <chr> <chr>         <dbl> <lgl>       <dbl>
##  1 0001_01     Europa     FALSE     B/0/P TRAPPIST-1e      39 FALSE           0
##  2 0002_01     Earth      FALSE     F/0/S TRAPPIST-1e      24 FALSE         109
##  3 0003_01     Europa     FALSE     A/0/S TRAPPIST-1e      58 TRUE           43
##  4 0003_02     Europa     FALSE     A/0/S TRAPPIST-1e      33 FALSE           0
##  5 0004_01     Earth      FALSE     F/1/S TRAPPIST-1e      16 FALSE         303
##  6 0005_01     Earth      FALSE     F/0/P PSO J318.5-22    44 FALSE           0
##  7 0006_01     Earth      FALSE     F/2/S TRAPPIST-1e      26 FALSE          42
##  8 0006_02     Earth      TRUE      G/0/S TRAPPIST-1e      28 FALSE           0
##  9 0007_01     Earth      FALSE     F/3/S TRAPPIST-1e      35 FALSE           0
## 10 0008_01     Europa     TRUE      B/1/P 55 Cancri e      14 FALSE           0
## # ℹ 8,683 more rows
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## #   VRDeck <dbl>, Name <chr>, Transported <lgl>

veri seti

train.csv - Eğitim verisi olarak kullanılmak üzere yaklaşık üçte ikisi (~8700) yolcunun kişisel kayıtları

PassengerId - Her yolcu için benzersiz bir Kimlik. Her Kimlik, gggg_pp biçiminde olup, gggg, yolcuyla seyahat eden grubu ve pp, gruptaki sırasını belirtir. Bir gruptaki insanlar genellikle aile üyeleridir, ancak her zaman değil.

HomePlanet - Yolcunun ayrıldığı gezegen, genellikle kalıcı ikamet gezegenleri.

CryoSleep - Yolcunun yolculuğun süresince dondurularak animasyonu durdurmayı seçip seçmediğini belirtir. Cryosleep’teki yolcular kabinlerine kapatılmıştır.

Cabin - Yolcunun konakladığı kabin numarası. deck/num/side şeklinde alır, burada side, Port için P veya Starboard için S olabilir . Destination - Yolcunun ineceği gezegen.

Age - Yolcunun yaşı.

VIP - Yolcunun yolculuk sırasında özel VIP hizmeti için ödeme yapmış olup olmadığını belirtir.

RoomService,FoodCourt, ShoppingMall, Spa, VRDeck - Spaceship Titanic’in birçok lüks olanaklarında yolcunun fatura ettiği miktar.

Name - Yolcunun adı ve soyadı Transported - Yolcunun başka bir boyuta taşınıp taşınmadığını belirtir. Bu, tahmin etmeye çalıştığınız sütun olan hedeftir.

test.csv** - Test verisi olarak kullanılmak üzere geriye kalan üçte birlik (~4300) yolcunun kişisel kayıtları. Göreviniz, bu setteki yolcular için Transported değerini tahmin etmektir. sample_submission. csv - Doğru formatta bir gönderim dosyası.

PassengerId - Test setindeki her yolcu için Kimlik. Transported - Hedef. Her yolcu için, True veya False tahmin edin.

kabinlerin 3 gruba sınıflandırılması

library (explore)
library (tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.1.4     ✔ stringr   1.5.1
## ✔ forcats   1.0.0     ✔ tibble    3.2.1
## ✔ lubridate 1.9.3     ✔ tidyr     1.3.1
## ✔ purrr     1.0.2     
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
train <- separate(train, Cabin, into = c("sutun1", "sutun2", "sutun3"), sep = "/", remove=FALSE)

train”deki boşlukları doldurun

train= train %>% mutate_if(is.character,as.factor)
train$HomePlanet <- as.factor(train$HomePlanet)
train %>% describe_all()
## # A tibble: 17 × 8
##    variable     type     na na_pct unique   min   mean   max
##    <chr>        <chr> <int>  <dbl>  <int> <dbl>  <dbl> <dbl>
##  1 PassengerId  fct       0    0     8693    NA  NA       NA
##  2 HomePlanet   fct     201    2.3      4    NA  NA       NA
##  3 CryoSleep    lgl     217    2.5      3     0   0.36     1
##  4 Cabin        fct     199    2.3   6561    NA  NA       NA
##  5 sutun1       fct     199    2.3      9    NA  NA       NA
##  6 sutun2       fct     199    2.3   1818    NA  NA       NA
##  7 sutun3       fct     199    2.3      3    NA  NA       NA
##  8 Destination  fct     182    2.1      4    NA  NA       NA
##  9 Age          dbl     179    2.1     81     0  28.8     79
## 10 VIP          lgl     203    2.3      3     0   0.02     1
## 11 RoomService  dbl     181    2.1   1274     0 225.   14327
## 12 FoodCourt    dbl     183    2.1   1508     0 458.   29813
## 13 ShoppingMall dbl     208    2.4   1116     0 174.   23492
## 14 Spa          dbl     183    2.1   1328     0 311.   22408
## 15 VRDeck       dbl     188    2.2   1307     0 305.   24133
## 16 Name         fct     200    2.3   8474    NA  NA       NA
## 17 Transported  lgl       0    0        2     0   0.5      1
ggplot(train, aes(x=RoomService))+
  geom_histogram()

library(mice)
## 
## Attachement du package : 'mice'
## L'objet suivant est masqué depuis 'package:stats':
## 
##     filter
## Les objets suivants sont masqués depuis 'package:base':
## 
##     cbind, rbind
VIM::aggr(x= train, sortVars=T)

## 
##  Variables sorted by number of missings: 
##      Variable      Count
##     CryoSleep 0.02496261
##  ShoppingMall 0.02392730
##           VIP 0.02335212
##    HomePlanet 0.02312205
##          Name 0.02300702
##         Cabin 0.02289198
##        sutun1 0.02289198
##        sutun2 0.02289198
##        sutun3 0.02289198
##        VRDeck 0.02162660
##     FoodCourt 0.02105142
##           Spa 0.02105142
##   Destination 0.02093639
##   RoomService 0.02082135
##           Age 0.02059128
##   PassengerId 0.00000000
##   Transported 0.00000000
md.pattern(train[1:580,])

##     PassengerId Transported VIP FoodCourt Spa Destination Name CryoSleep VRDeck
## 440           1           1   1         1   1           1    1         1      1
## 13            1           1   1         1   1           1    1         1      1
## 15            1           1   1         1   1           1    1         1      1
## 2             1           1   1         1   1           1    1         1      1
## 12            1           1   1         1   1           1    1         1      1
## 3             1           1   1         1   1           1    1         1      1
## 14            1           1   1         1   1           1    1         1      1
## 14            1           1   1         1   1           1    1         1      1
## 1             1           1   1         1   1           1    1         1      1
## 1             1           1   1         1   1           1    1         1      1
## 7             1           1   1         1   1           1    1         1      0
## 1             1           1   1         1   1           1    1         1      0
## 2             1           1   1         1   1           1    1         1      0
## 1             1           1   1         1   1           1    1         1      0
## 11            1           1   1         1   1           1    1         0      1
## 1             1           1   1         1   1           1    1         0      1
## 1             1           1   1         1   1           1    1         0      0
## 11            1           1   1         1   1           1    0         1      1
## 7             1           1   1         1   1           0    1         1      1
## 1             1           1   1         1   1           0    1         1      1
## 1             1           1   1         1   1           0    1         1      0
## 8             1           1   1         1   0           1    1         1      1
## 5             1           1   1         0   1           1    1         1      1
## 1             1           1   1         0   1           1    1         1      1
## 1             1           1   1         0   1           1    1         1      0
## 1             1           1   1         0   1           0    1         1      1
## 4             1           1   0         1   1           1    1         1      1
## 1             1           1   0         1   1           1    1         1      1
##               0           0   5         8   8          10   11        13     14
##     RoomService Cabin sutun1 sutun2 sutun3 Age HomePlanet ShoppingMall    
## 440           1     1      1      1      1   1          1            1   0
## 13            1     1      1      1      1   1          1            0   1
## 15            1     1      1      1      1   1          0            1   1
## 2             1     1      1      1      1   1          0            0   2
## 12            1     1      1      1      1   0          1            1   1
## 3             1     1      1      1      1   0          1            0   2
## 14            1     0      0      0      0   1          1            1   4
## 14            0     1      1      1      1   1          1            1   1
## 1             0     1      1      1      1   1          0            1   2
## 1             0     0      0      0      0   1          1            1   5
## 7             1     1      1      1      1   1          1            1   1
## 1             1     1      1      1      1   1          1            0   2
## 2             1     1      1      1      1   0          1            1   2
## 1             1     0      0      0      0   1          1            1   5
## 11            1     1      1      1      1   1          1            1   1
## 1             1     0      0      0      0   1          1            1   5
## 1             1     1      1      1      1   1          1            1   2
## 11            1     1      1      1      1   1          1            1   1
## 7             1     1      1      1      1   1          1            1   1
## 1             1     1      1      1      1   1          0            1   2
## 1             1     1      1      1      1   1          1            1   2
## 8             1     1      1      1      1   1          1            1   1
## 5             1     1      1      1      1   1          1            1   1
## 1             1     0      0      0      0   1          1            1   5
## 1             1     1      1      1      1   1          1            1   2
## 1             1     1      1      1      1   1          1            1   2
## 4             1     1      1      1      1   1          1            1   1
## 1             1     1      1      1      1   0          1            1   2
##              16    18     18     18     18  18         19           19 213
summary(train)
##   PassengerId    HomePlanet   CryoSleep           Cabin          sutun1    
##  0001_01:   1   Earth :4602   Mode :logical   G/734/S:   8   F      :2794  
##  0002_01:   1   Europa:2131   FALSE:5439      B/11/S :   7   G      :2559  
##  0003_01:   1   Mars  :1759   TRUE :3037      B/201/P:   7   E      : 876  
##  0003_02:   1   NA's  : 201   NA's :217       B/82/S :   7   B      : 779  
##  0004_01:   1                                 C/137/S:   7   C      : 747  
##  0005_01:   1                                 (Other):8458   (Other): 739  
##  (Other):8687                                 NA's   : 199   NA's   : 199  
##      sutun2      sutun3            Destination        Age       
##  82     :  28   P   :4206   55 Cancri e  :1800   Min.   : 0.00  
##  19     :  22   S   :4288   PSO J318.5-22: 796   1st Qu.:19.00  
##  86     :  22   NA's: 199   TRAPPIST-1e  :5915   Median :27.00  
##  176    :  21               NA's         : 182   Mean   :28.83  
##  56     :  21                                    3rd Qu.:38.00  
##  (Other):8380                                    Max.   :79.00  
##  NA's   : 199                                    NA's   :179    
##     VIP           RoomService        FoodCourt        ShoppingMall    
##  Mode :logical   Min.   :    0.0   Min.   :    0.0   Min.   :    0.0  
##  FALSE:8291      1st Qu.:    0.0   1st Qu.:    0.0   1st Qu.:    0.0  
##  TRUE :199       Median :    0.0   Median :    0.0   Median :    0.0  
##  NA's :203       Mean   :  224.7   Mean   :  458.1   Mean   :  173.7  
##                  3rd Qu.:   47.0   3rd Qu.:   76.0   3rd Qu.:   27.0  
##                  Max.   :14327.0   Max.   :29813.0   Max.   :23492.0  
##                  NA's   :181       NA's   :183       NA's   :208      
##       Spa              VRDeck                        Name      Transported    
##  Min.   :    0.0   Min.   :    0.0   Alraium Disivering:   2   Mode :logical  
##  1st Qu.:    0.0   1st Qu.:    0.0   Ankalik Nateansive:   2   FALSE:4315     
##  Median :    0.0   Median :    0.0   Anton Woody       :   2   TRUE :4378     
##  Mean   :  311.1   Mean   :  304.9   Apix Wala         :   2                  
##  3rd Qu.:   59.0   3rd Qu.:   46.0   Asch Stradick     :   2                  
##  Max.   :22408.0   Max.   :24133.0   (Other)           :8483                  
##  NA's   :183       NA's   :188       NA's              : 200