#vprašanje a
library(readxl)
podatki <- read_xlsx("./Nogomet.xlsx")
podatki <- as.data.frame(podatki) #obvezno ko maš excel je tak postopek branja podatkov!
head(podatki)
## Rang Ime Pozicija Starost Vrednost Klub Tekme
## 1 1 Kylian Mbappe 4 22 144 Paris Saint-Germain 16
## 2 2 Erling Haaland 4 21 135 Borussia Dortmund 10
## 3 3 Harry Kane 4 28 108 Tottenham Hotspur 16
## 4 4 Jack Grealish 1 26 90 Manchester City 15
## 5 5 Mohamed Salah 2 29 90 Liverpool FC 15
## 6 6 Romelu Lukaku 4 28 90 Chelsea FC 11
## Zadetki Asistence Karton_rumen
## 1 7 11 3
## 2 13 4 1
## 3 7 2 2
## 4 2 3 1
## 5 15 6 1
## 6 4 1 0
Opis spremenljivk:
#vprašanje b - frekvenčna porazdelitev igralcev, ker je to kategorialna spremenljivka uporabimo faktor!!!
podatki$Pozicija <- factor(podatki$Pozicija,
levels = c(1,2,3,4,5),
labels = c("Zvezni igralec", "Krilni igralec", "Branilec", "Napadalec", "Vratar")) #ko to poženeš maš namesto številk imena, vrstni red je pomemben!
Napiši kodo da to grafično prikaženo
library(ggplot2)
#geom histogram je samo za številsko spremenljivko:starost, višina!
# geom text - to nam nardi številkice na vsakem stolpcu
ggplot(podatki, aes(x = Pozicija)) +
geom_bar() +
labs(title = "Frekvenčna porazdelitev igralcev po pozicijah",
x = "Pozicija",
y = "Število igralcev") +
geom_text(aes(label = after_stat(count)), stat = "count", vjust = 1.5, colour = "white")
ta graf se razlikuje v primerjavi z geom histogram po tem, da bi
histogram bil brez lukenj oz prostorčkom, ker to ni porazdelitev!!!!
Lahko menjamo tudi vrstni red in ne moremo rečt da je to asimetrično
bilokam!!
Katera funkcija je najbolj pogosta? Ukaz bo Table - ko mamo kaztegorialno spremenljivko in jo hočemo preštet
table(podatki$Pozicija) #izpiše kolkokrat se kašna kat. ponovi
##
## Zvezni igralec Krilni igralec Branilec Napadalec Vratar
## 48 9 23 14 6
library(ggplot2)
ggplot(podatki, aes(x = Tekme, y = Zadetki)) +
geom_point() +
labs(title = "Primerjava med stv. odigranih tekem in stv.zadetkov",
x = "Stv. odigranih tekem",
y = "Stv. zadetkov") +
geom_smooth(method = lm, formula = y ~ x, se = FALSE) #to nam da plavo črto - regresijsko funkcijo, method lm pomeni linear model, linearna reg. funkcija, se je brez standardnih napak, regresija je 7. predavanje!
Povezava je pozitivna, ker grejo pikice navzgor, več kot je odigranih tekem več je blo zadetkov.
#vprašanje d - povprečno št. rumenih kartonov branilcev
mean(podatki[podatki$Pozicija == "Branilec", ]$Karton_rumen)
## [1] 1.913043
Preizkus domneve o aritmetični sredini: ali lahko trdimo da je št. rumenih kartonov pri napadalcih nižje od št. kartonov pri branilcih?
H0: Mu = 1.913 #tudi oni majo isto povprečje H1: Mu < 1.913
t.test(podatki[podatki$Pozicija == "Napadalec", ]$Karton_rumen,
mu = 1.913,
alternative = "less")
##
## One Sample t-test
##
## data: podatki[podatki$Pozicija == "Napadalec", ]$Karton_rumen
## t = -0.79125, df = 13, p-value = 0.2215
## alternative hypothesis: true mean is less than 1.913
## 95 percent confidence interval:
## -Inf 2.247475
## sample estimates:
## mean of x
## 1.642857
df je 13, to je ok, ker je velikost vzorca 14. to vidimo iz grafa zgoraj, da je stolpec z napadalci visok 14. mean of x 1,64 pomeni da so meli napadalci v povprečju manj kot branilci runemih kartonov.
Ali lahko trdimo, da je 1,64 manj statistično od 1,91? Pogledamo p vrednost ali smemo zavrniti H0…P vrednost je 22% zato ne moremo zavrniti ničelne domneve. Ne moremo trditi, da povprečno št. rumenih kartonov med napadalci ni enako 1,913. Kaj je tukaj razlog, da je p vrednost tako velika? ker imamo mali vzorec.
P-vrednost je funkcija velikosti vzorca, večji kot je vzorec nižja je p-vrednost!!!