• Ryükleme
• Rmarkdown başlangıç
• Web sayfasını hazırlama
• Internete yükleme
\[ (a b c) ² = a ² b² c² \]
library(WDI)
library(ggplot2)
library(ggplot2)
# Verileri içe aktarın veya kendiniz oluşturun
# Örneğin:
# fransa_enflasyon <- read.csv("fransa_enflasyon.csv")
# isvec_enflasyon <- read.csv("isvec_enflasyon.csv")
# Örnek veri çerçeveleri
fransa_enflasyon <- data.frame(year = c(2010, 2011, 2012, 2013, 2014),
inflation_rate = c(1.5, 2.0, 1.8, 1.2, 1.7))
isvec_enflasyon <- data.frame(year = c(2010, 2011, 2012, 2013, 2014),
inflation_rate = c(2.2, 2.5, 2.0, 1.8, 2.1))
# Çizgi grafiğini oluşturun
ggplot() +
geom_line(data = fransa_enflasyon, aes(x = year, y = inflation_rate, color = "Fransa"), size = 1.5) +
geom_line(data = isvec_enflasyon, aes(x = year, y = inflation_rate, color = "İsveç"), size = 1.5) +
labs(x = "Yıl", y = "Enflasyon Oranı (%)", color = "Ülke") +
ggtitle("Fransa ve İsveç Enflasyon Oranları") +
theme_minimal()
## Warning: Using `size` aesthetic for lines was deprecated in ggplot2 3.4.0.
## ℹ Please use `linewidth` instead.
## This warning is displayed once every 8 hours.
## Call `lifecycle::last_lifecycle_warnings()` to see where this warning was
## generated.
Makine öğrenmesi, bilgisayar sistemlerinin veri analizi yaparak kendilerini geliştirebilecek şekilde tasarlanmış bir dalıdır. Genel olarak, makine öğrenmesi algoritmaları, veri tabanlı bir model oluşturarak ve bu modele veri sağlandıkça kendisini iyileştirerek öğrenirler. Bu, belirli bir görevi yerine getirmek için veriye dayalı olarak kalıpları tanıma ve bu kalıpları kullanma yeteneğini içerir.
Makine öğrenmesi, genellikle iki ana kategori altında incelenir:
Denetimli Öğrenme (Supervised Learning): Denetimli öğrenme, girdi ve çıktı arasındaki ilişkiyi modellemeye çalışır. Bu tür bir öğrenmede, algoritmanın eğitilmesi için etiketlenmiş verilere ihtiyaç vardır, yani girişlerle birlikte doğru çıktılar verilir. Algoritma, bu veriye dayalı olarak girişlerle çıktıları eşleştiren bir model oluşturur. Ardından, yeni verilerle beslendiğinde, bu model, doğru çıktıları tahmin etmek için kullanılır. Örnekler arasında sınıflandırma (bir veri noktasını belirli bir kategoriye atama) ve regresyon (bir değeri tahmin etme) bulunur.
Denetimsiz Öğrenme (Unsupervised Learning): Denetimsiz öğrenme, verilerdeki kalıpları bulmak için kullanılır, ancak verilerin etiketlenmemiş olduğu durumlarda kullanılır. Bu tür bir öğrenme, veri içindeki yapıları anlamak için kullanılır. Temel amaç, veri kümesindeki gizli yapıları keşfetmektir. Kümeleme (benzer örnekleri gruplama) ve boyut indirgeme (yüksek boyutlu veriyi daha düşük boyutlu bir temsil ile temsil etme) gibi örnekler verilebilir.
Makine öğrenmesi birçok alanda kullanılır, örneğin:
Makine öğrenmesi, veriye dayalı karar verme yeteneğiyle, karmaşık problemlerin çözümü için güçlü bir araçtır ve geniş bir uygulama alanına sahiptir.
### space ship titanic (kaggle tanım)
Kozmik bir gizemi çözmek için veri bilimi becerilerinize ihtiyaç duyulan 2912’ye hoş geldiniz. Dört ışıkyılı uzaklıktan bir sinyal aldık ve işler pek iyi görünmüyor.
Uzay Gemisi Titanik, bir ay önce fırlatılan yıldızlararası bir gemiydi. Gemide yaklaşık 13.000 yolcu bulunan gemi, güneş sistemimizden göçmenleri yakın yıldızların yörüngesinde bulunan üç yeni yaşanabilir dış gezegene taşıyarak ilk yolculuğuna çıktı.
Dikkatsiz uzay gemisi Titanic, ilk hedefi olan kavurucu 55 Cancri E’ye giderken Alpha Centauri’nin etrafında dönerken, bir toz bulutu içinde gizlenmiş bir uzay-zaman anomalisiyle çarpıştı. Ne yazık ki 1000 yıl önceki adaşı ile aynı kaderi yaşadı. Gemi sağlam kalmasına rağmen yolcuların neredeyse yarısı başka bir boyuta taşındı!
Kurtarma ekiplerine yardımcı olmak ve kayıp yolcuları kurtarmak için, uzay gemisinin hasarlı bilgisayar sisteminden elde edilen kayıtları kullanarak anormalliğin hangi yolcuları taşıdığını tahmin etmeniz gerekir.
Ortalama, bir veri kümesindeki sayısal değerlerin toplamının eleman sayısına bölünmesiyle elde edilen bir ölçüdür. Bir veri kümesinin ortalaması, o kümedeki değerlerin genel “ortalaması” veya “tipik” değeri olarak düşünülür.
\[ \bar{X} = \frac {\Sigma^n_İ (X_i)}{n} \]
# Öğrencinin birinci dönem notları
notlar <- c(85, 72, 90, 88, 95)
# Notların ortalamasını hesapla
ortalama <- mean(notlar)
# Sonucu yazdır
print(ortalama)
## [1] 86
Standart sapma, bir veri kümesindeki değerlerin ne kadar yayıldığını veya değiştiğini ölçen istatistiksel bir ölçüdür. Bir veri setinin standart sapması, veri noktalarının ortalama değerinden ne kadar uzaklıkta olduğunu belirler.
Standart sapma, bir veri kümesinin dağılımını ve değişkenliğini anlamak için önemli bir ölçüdür. Daha düşük bir standart sapma, veri noktalarının ortalama değere daha yakın olduğunu ve daha az değişkenlik olduğunu gösterirken, daha yüksek bir standart sapma, veri noktalarının ortalama değere daha uzak olduğunu ve daha fazla değişkenlik olduğunu gösterir.
Matematiksel olarak, bir veri setinin standart sapması, her bir veri noktasının ortalama değerden farkının karelerinin toplamının, veri noktalarının sayısına bölünmesi ve bu sonucun karekökünün alınması ile hesaplanır.
\[ \sigma = \sqrt \frac {\Sigma^N_i (X_i-\bar{X})^2}{N} \]
##ÖNREK
# Öğrencinin birinci dönem notları
notlar <- c(85, 72, 90, 88, 95)
# Notların standart sapmasını hesapla
standart_sapma <- sd(notlar)
# Sonucu yazdır
print(standart_sapma)
## [1] 8.631338
Korelasyon, iki değişken arasındaki ilişkinin gücünü ve yönünü ölçen bir istatistiksel kavramdır. İki değişken arasındaki ilişki ne kadar güçlüyse, korelasyon katsayısı o kadar yüksek olur. Korelasyon, bir değişkenin diğer değişken üzerinde ne kadar etkili olduğunu belirlemeye yardımcı olur.
Korelasyon katsayısı, genellikle -1 ile +1 arasında bir değer alır:
+1: Mükemmel pozitif korelasyon, yani iki değişken arasında tam bir doğrusal ilişki olduğunu gösterir. Bir değişken artarken, diğeri de artar. 0: Korelasyon yok veya lineer olarak ilişkili değil. İki değişken arasında bir ilişki olmadığını veya ilişkinin doğrusal olmadığını gösterir. -1: Mükemmel negatif korelasyon, yani iki değişken arasında tam ters bir doğrusal ilişki olduğunu gösterir. Bir değişken artarken, diğeri azalır. Korelasyon katsayısının pozitif veya negatif olması, iki değişkenin birlikte hareket etme yönünü belirtirken, korelasyonun mutlak değeri ilişkinin gücünü belirtir.
Korelasyon, istatistik, ekonometri, mühendislik ve diğer birçok bilimsel alanın analizlerinde kullanılır. Örneğin, iki finansal varlık arasındaki korelasyon, portföy çeşitlendirmesi stratejilerinde ve risk yönetiminde önemli bir rol oynar.
\[ R = \frac {\Sigma (x_i-\bar{x})(y_i-\bar{y})}{ \sqrt {\Sigma (x_i-\bar{x})^2 \Sigma (y_i-\bar{y})}} \]
# Matematik ve fizik dersi notları
matematik_notlar <- c(75, 80, 85, 90, 95)
fizik_notlar <- c(70, 75, 80, 85, 90)
# Korelasyonu hesapla
korelasyon <- cor(matematik_notlar, fizik_notlar)
# Sonucu yazdır
print(korelasyon)
## [1] 1
Kovaryans, iki değişken arasındaki ilişkinin doğrusal olmayan doğasını ölçen bir istatistiksel terimdir. İki değişken arasındaki ilişkinin ne kadar birlikte değiştiğini belirtir. Yani, bir değişkenin değerlerindeki değişimlerin, diğer değişkenin değerlerindeki değişimlerle ilişkili olup olmadığını gösterir.
Kovaryans pozitif, negatif veya sıfır olabilir:
Pozitif bir kovaryans, iki değişken arasında pozitif bir ilişki olduğunu gösterir. Yani, bir değişken artarken diğer değişken de artar. Negatif bir kovaryans, iki değişken arasında negatif bir ilişki olduğunu gösterir. Yani, bir değişken artarken diğer değişken azalır. Sıfır kovaryans, iki değişken arasında herhangi bir ilişki olmadığını gösterir.
\[ {cov} (X,Y) = \frac {\Sigma (X_i-X)(Y_i-Y)}{n-1} \] ## örnek
# Matematik ve fizik dersi notları
matematik_notlar <- c(75, 80, 85, 90, 95)
fizik_notlar <- c(70, 75, 80, 85, 90)
# Matematik ve fizik notlarının ortalamalarını bulma
matematik_ortalama <- mean(matematik_notlar)
fizik_ortalama <- mean(fizik_notlar)
# Kovaryansı hesaplama
kovaryans <- cov(matematik_notlar, fizik_notlar)
# Sonucu yazdırma
print(kovaryans)
## [1] 62.5
“Train” ve “test”, makine öğrenimi ve veri madenciliği gibi alanlarda modelin performansını değerlendirmek için kullanılan iki veri kümesini ifade eder.
Eğitim Veri Kümesi (Train Set): Eğitim veri kümesi, modelin öğrenme sürecinde kullanılan veri setidir. Bu veri seti üzerinde model eğitilir ve parametreleri ayarlanır. Eğitim veri kümesi, genellikle verinin büyük bir bölümünü oluşturur ve modelin öğrenme sürecinde gördüğü verilerdir. Model, eğitim veri kümesi üzerinde performansını geliştirmek için eğitilir ve bu veri kümesi üzerindeki hatalarını azaltmaya çalışır.
Test Veri Kümesi (Test Set): Test veri kümesi, eğitim sürecinden sonra modelin performansını değerlendirmek için kullanılan ayrı bir veri setidir. Model, eğitim veri kümesi üzerinde eğitildikten sonra, test veri kümesi üzerindeki verilere uygulanır ve tahminler yapar. Ardından, bu tahminler gerçek değerlerle karşılaştırılır ve modelin ne kadar iyi performans gösterdiği değerlendirilir. Test veri kümesi, modelin genelleme yeteneğini belirlemek için kullanılır; yani, modelin daha önce görmediği yeni verilere ne kadar iyi adapte olduğunu değerlendirir.
Eğitim veri kümesi ve test veri kümesi, modelin gerçek dünya verilerine nasıl genelleştiğini değerlendirmek için birbirinden bağımsız olmalıdır. Ayrıca, veri setinin bir kısmı eğitim için kullanılırken, diğer kısmı modelin performansını değerlendirmek için kullanılır. Bu, modelin verilere aşırı uyum yapmasını (overfitting) ve gerçek dünya verilerinde düşük performans göstermesini önler.
library (readr)
train= read_csv("train.csv")
test= read_csv("test.csv")
train
## # A tibble: 8,693 × 14
## PassengerId HomePlanet CryoSleep Cabin Destination Age VIP RoomService
## <chr> <chr> <lgl> <chr> <chr> <dbl> <lgl> <dbl>
## 1 0001_01 Europa FALSE B/0/P TRAPPIST-1e 39 FALSE 0
## 2 0002_01 Earth FALSE F/0/S TRAPPIST-1e 24 FALSE 109
## 3 0003_01 Europa FALSE A/0/S TRAPPIST-1e 58 TRUE 43
## 4 0003_02 Europa FALSE A/0/S TRAPPIST-1e 33 FALSE 0
## 5 0004_01 Earth FALSE F/1/S TRAPPIST-1e 16 FALSE 303
## 6 0005_01 Earth FALSE F/0/P PSO J318.5-22 44 FALSE 0
## 7 0006_01 Earth FALSE F/2/S TRAPPIST-1e 26 FALSE 42
## 8 0006_02 Earth TRUE G/0/S TRAPPIST-1e 28 FALSE 0
## 9 0007_01 Earth FALSE F/3/S TRAPPIST-1e 35 FALSE 0
## 10 0008_01 Europa TRUE B/1/P 55 Cancri e 14 FALSE 0
## # ℹ 8,683 more rows
## # ℹ 6 more variables: FoodCourt <dbl>, ShoppingMall <dbl>, Spa <dbl>,
## # VRDeck <dbl>, Name <chr>, Transported <lgl>
Bu yarışmada göreviniz , Uzay Gemisi Titanik’in uzay-zaman anomalisiyle çarpışması sırasında bir yolcunun alternatif bir boyuta taşınıp taşınmadığını tahmin etmektir . Bu tahminleri yapmanıza yardımcı olmak için size geminin hasarlı bilgisayar sisteminden kurtarılan bir dizi kişisel kayıt veriliyor.
Dosya ve Veri Alanı Açıklamaları - train.csv - Yolcuların yaklaşık üçte ikisinin (~8700) kişisel kayıtları, eğitim verileri olarak kullanılacak. - PassengerId- Her yolcu için benzersiz bir Kimlik. Her kimlik, yolcunun birlikte seyahat ettiği grubu belirten ve grup içindeki numarası olan gggg_ppformu alır . Bir gruptaki insanlar çoğunlukla aile üyeleridir, ancak her zaman değil.ggggpp - HomePlanet- Yolcunun ayrıldığı gezegen, genellikle daimi ikamet ettikleri gezegen. - CryoSleep- Yolcunun yolculuk süresince askıya alınmış animasyona alınmayı seçip seçmediğini belirtir. Dondurucu uykudaki yolcular kabinlerine hapsedilir. - Cabin - Yolcunun kaldığı kabin numarası. Biçimi güverte/numara/taraf şeklindedir, taraf P (Port) için ya da S (Starboard) için olabilir.. - Destination- Yolcunun ineceği gezegen. - Age- Yolcunun yaşı. - VIP- Yolcunun yolculuk sırasında özel VIP hizmeti için ödeme yapıp yapmadığı. RoomService, FoodCourt, ShoppingMall, Spa, VRDeck- Yolcunun Uzay Gemisi Titanic’in birçok lüks olanağının her birinde fatura ettiği tutar. - Name- Yolcunun adı ve soyadı. - Transported- Yolcunun başka bir boyuta taşınıp taşınmadığı. Bu hedeftir, tahmin etmeye çalıştığınız sütundur. - test.csv - Yolcuların geri kalan üçte birinin (~4300) kişisel kayıtları, test verisi olarak kullanılacak. TransportedGöreviniz bu setteki yolcular için değerini tahmin etmektir . - sample_submission.csv - Doğru formatta bir gönderim dosyası. - PassengerId- Test setindeki her yolcunun kimliği. - Transported- Hedef. Her yolcu için veya’dan birini tahmin Trueedin False
library(explore)
library(tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr 1.1.4 ✔ stringr 1.5.1
## ✔ forcats 1.0.0 ✔ tibble 3.2.1
## ✔ lubridate 1.9.3 ✔ tidyr 1.3.1
## ✔ purrr 1.0.2
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag() masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
train <- separate(train, Cabin, into = c("sutun1", "sutun2", "sutun3"), sep = "/", remove=FALSE)
train=train %>% mutate_if(is.character,as.factor)
train$HomePlanet <- as.factor(train$HomePlanet)
train %>% describe_all()
## # A tibble: 17 × 8
## variable type na na_pct unique min mean max
## <chr> <chr> <int> <dbl> <int> <dbl> <dbl> <dbl>
## 1 PassengerId fct 0 0 8693 NA NA NA
## 2 HomePlanet fct 201 2.3 4 NA NA NA
## 3 CryoSleep lgl 217 2.5 3 0 0.36 1
## 4 Cabin fct 199 2.3 6561 NA NA NA
## 5 sutun1 fct 199 2.3 9 NA NA NA
## 6 sutun2 fct 199 2.3 1818 NA NA NA
## 7 sutun3 fct 199 2.3 3 NA NA NA
## 8 Destination fct 182 2.1 4 NA NA NA
## 9 Age dbl 179 2.1 81 0 28.8 79
## 10 VIP lgl 203 2.3 3 0 0.02 1
## 11 RoomService dbl 181 2.1 1274 0 225. 14327
## 12 FoodCourt dbl 183 2.1 1508 0 458. 29813
## 13 ShoppingMall dbl 208 2.4 1116 0 174. 23492
## 14 Spa dbl 183 2.1 1328 0 311. 22408
## 15 VRDeck dbl 188 2.2 1307 0 305. 24133
## 16 Name fct 200 2.3 8474 NA NA NA
## 17 Transported lgl 0 0 2 0 0.5 1
ggplot(train, aes(x=RoomService))+
geom_histogram()
library(mice)
## Warning in check_dep_version(): ABI version mismatch:
## lme4 was built with Matrix ABI version 1
## Current Matrix ABI version is 0
## Please re-install lme4 from source or restore original 'Matrix' package
##
## Attachement du package : 'mice'
## L'objet suivant est masqué depuis 'package:stats':
##
## filter
## Les objets suivants sont masqués depuis 'package:base':
##
## cbind, rbind