#vprašanje a

library(readxl)
podatki <- read_xlsx("./Nogomet.xlsx")

podatki <- as.data.frame(podatki) #obvezno ko maš excel je tak postopek branja      podatkov!

head(podatki)
##   Rang            Ime Pozicija Starost Vrednost                Klub Tekme
## 1    1  Kylian Mbappe        4      22      144 Paris Saint-Germain    16
## 2    2 Erling Haaland        4      21      135   Borussia Dortmund    10
## 3    3     Harry Kane        4      28      108   Tottenham Hotspur    16
## 4    4  Jack Grealish        1      26       90     Manchester City    15
## 5    5  Mohamed Salah        2      29       90        Liverpool FC    15
## 6    6  Romelu Lukaku        4      28       90          Chelsea FC    11
##   Zadetki Asistence Karton_rumen
## 1       7        11            3
## 2      13         4            1
## 3       7         2            2
## 4       2         3            1
## 5      15         6            1
## 6       4         1            0

Opis spremenljivk:

#vprašanje b - frekvenčna porazdelitev igralcev, ker je to kategorialna spremenljivka uporabimo faktor!!!

podatki$Pozicija <- factor(podatki$Pozicija,
                     levels = c(1,2,3,4,5),
                     labels = c("Zvezni igralec", "Krilni igralec", "Branilec", "Napadalec", "Vratar"))  #ko to poženeš maš namesto številk imena, vrstni red je pomemben!

Napiši kodo da to grafično prikaženo

library(ggplot2)
#geom histogram je samo za številsko spremenljivko:starost, višina!
# geom text - to nam nardi številkice na vsakem stolpcu

ggplot(podatki, aes(x = Pozicija)) + 
  geom_bar() + 
  labs(title = "Frekvenčna porazdelitev igralcev po pozicijah", 
       x = "Pozicija", 
       y = "Število igralcev") +
  geom_text(aes(label = after_stat(count)), stat = "count", vjust = 1.5, colour = "white")

ta graf se razlikuje v primerjavi z geom histogram po tem, da bi histogram bil brez lukenj oz prostorčkom, ker to ni porazdelitev!!!! Lahko menjamo tudi vrstni red in ne moremo rečt da je to asimetrično bilokam!!

Katera funkcija je najbolj pogosta? Ukaz bo Table - ko mamo kaztegorialno spremenljivko in jo hočemo preštet

table(podatki$Pozicija)  #izpiše kolkokrat se kašna kat. ponovi
## 
## Zvezni igralec Krilni igralec       Branilec      Napadalec         Vratar 
##             48              9             23             14              6

vprašanje c - razsevni grafikon, ko nas zanima povezanost

library(ggplot2)

ggplot(podatki, aes(x = Tekme, y = Zadetki)) +
  geom_point() +
  labs(title = "Primerjava med stv. odigranih tekem in stv.zadetkov", 
       x = "Stv. odigranih tekem", 
       y = "Stv. zadetkov") +
  geom_smooth(method = lm, formula = y ~ x, se = FALSE)  #to nam da plavo črto - regresijsko funkcijo, method lm pomeni linear model, linearna reg. funkcija, se je brez standardnih napak, regresija je 7. predavanje!

Povezava je pozitivna, ker grejo pikice navzgor, več kot je odigranih tekem več je blo zadetkov.

#vprašanje d - povprečno št. rumenih kartonov branilcev

mean(podatki[podatki$Pozicija == "Branilec", ]$Karton_rumen)
## [1] 1.913043

Preizkus domneve o aritmetični sredini: ali lahko trdimo da je št. rumenih kartonov pri napadalcih nižje od št. kartonov pri branilcih?

H0: Mu = 1.913 #tudi oni majo isto povprečje H1: Mu < 1.913

t.test(podatki[podatki$Pozicija == "Napadalec", ]$Karton_rumen,
       mu = 1.913,
       alternative = "less")
## 
##  One Sample t-test
## 
## data:  podatki[podatki$Pozicija == "Napadalec", ]$Karton_rumen
## t = -0.79125, df = 13, p-value = 0.2215
## alternative hypothesis: true mean is less than 1.913
## 95 percent confidence interval:
##      -Inf 2.247475
## sample estimates:
## mean of x 
##  1.642857

df je 13, to je ok, ker je velikost vzorca 14. to vidimo iz grafa zgoraj, da je stolpec z napadalci visok 14. mean of x 1,64 pomeni da so meli napadalci v povprečju manj kot branilci runemih kartonov.

Ali lahko trdimo, da je 1,64 manj statistično od 1,91? Pogledamo p vrednost ali smemo zavrniti H0…P vrednost je 22% zato ne moremo zavrniti ničelne domneve. Ne moremo trditi, da povprečno št. rumenih kartonov med napadalci ni enako 1,913. Kaj je tukaj razlog, da je p vrednost tako velika? ker imamo mali vzorec.

P-vrednost je funkcija velikosti vzorca, večji kot je vzorec nižja je p-vrednost!!!