Vir podatkov: https://www.kaggle.com/datasets/ruchi798/analyzing-screen-time

Ta dokument podaja interpretacijo analize, opravljene na času, preživetem na družbenih medijih glede na spol.

Analiza je poskušala odgovoriti na raziskovalno vprašanje: “Ali obstaja statistično značilna razlika v času, preživetem na družbenih medijih, med moškimi in ženskami?”

Nalaganje potrebnih knjižnic

library(ggplot2)
## Warning: package 'ggplot2' was built under R version 4.3.3
library(dplyr)
## Warning: package 'dplyr' was built under R version 4.3.3
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library(car)
## Warning: package 'car' was built under R version 4.3.3
## Loading required package: carData
## Warning: package 'carData' was built under R version 4.3.3
## 
## Attaching package: 'car'
## The following object is masked from 'package:dplyr':
## 
##     recode
library(effsize)
## Warning: package 'effsize' was built under R version 4.3.3

Branje podatkov

data <- read.csv("C:/Users/bostj/OneDrive/Desktop/MTRD/Bla123/Time-WastersOnSocialMedia.csv")

Raziskovalno vprašanje:

“Ali obstaja statistično značilna razlika v času, preživetem na družbenih medijih, med moškimi in ženskami?”

Čiščenje in priprava podatkov

Pregled podatkov Nabor podatkov je sestavljen iz 836 udeležencev (514 moških in 322 žensk) in njihovega skupnega časa, preživetega na družbenih medijih.

Enota opazovanje je posamezen udeleženec, velikost vzorca je 836 enot.

data <- data[data$Gender %in% c("Male", "Female"),]
data$Gender <- factor(data$Gender, levels = c("Male", "Female"))

Opisna statistika

print(summary(data$Total.Time.Spent))
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   10.00   77.75  149.00  150.64  224.00  298.00
print(summary(data$Gender))
##   Male Female 
##    514    322
group_stats <- data %>%
  group_by(Gender) %>%
  summarise(
    count = n(),
    mean = mean(Total.Time.Spent),
    median = median(Total.Time.Spent),
    sd = sd(Total.Time.Spent),
    min = min(Total.Time.Spent),
    max = max(Total.Time.Spent)
  )
print(group_stats)
## # A tibble: 2 × 7
##   Gender count  mean median    sd   min   max
##   <fct>  <int> <dbl>  <dbl> <dbl> <int> <int>
## 1 Male     514  152.   154.  83.8    10   298
## 2 Female   322  148.   144.  85.9    10   298

Ključne povzetne statistike:

Skupni razpon preživetega časa: 10 do 298 minut Skupna mediana: 149 minut Moško povprečje: 151,98 minut Žensko povprečje: 148,49 minut

Opisne statistike razkrivajo, da so moški preživeli nekoliko več časa na družbenih medijih (povprečje = 151,98 minut) v primerjavi z ženskami (povprečje = 148,49 minut). Vendar je ta razlika majhna (približno 3,5 minute) in morda ni praktično pomembna.

Vizualizacije

Škatlasti diagram

ggplot(data, aes(x = Gender, y = Total.Time.Spent)) +
  geom_boxplot() +
  labs(title = "Porazdelitev časa na družbenih medijih glede na spol",
       x = "Spol", y = "Skupni preživeti čas")

Škatlasti diagram: Škatlasti diagrami za oba spola kažejo precejšnje prekrivanje, kar nakazuje, da so porazdelitve časa, preživetega na družbenih medijih, podobne za moške in ženske. Ta vizualna predstavitev kaže, da ni bistvene razlike med obema skupinama.

Histogram

ggplot(data, aes(x = Total.Time.Spent)) +
  geom_histogram(binwidth = 10, fill = "skyblue", color = "black") +
  facet_wrap(~Gender) +
  labs(title = "Porazdelitev časa, preživetega na družbenih medijih glede na spol",
       x = "Skupni preživeti čas", y = "Število")

Histogram: Histogrami za oba spola imajo podobne oblike, z rahlo asimetrijo v desno. To kaže, da večina uporabnikov preživi zmerno količino časa na družbenih medijih, obstajajo pa nekateri uporabniki v obeh skupinah, ki preživijo bistveno več časa.

Statistični testi

Parametrični test (t-test)

t_test_result <- t.test(Total.Time.Spent ~ Gender, data = data, conf.level = 0.95)
print(t_test_result)
## 
##  Welch Two Sample t-test
## 
## data:  Total.Time.Spent by Gender
## t = 0.57829, df = 669.01, p-value = 0.5633
## alternative hypothesis: true difference in means between group Male and group Female is not equal to 0
## 95 percent confidence interval:
##  -8.376343 15.370060
## sample estimates:
##   mean in group Male mean in group Female 
##             151.9844             148.4876

Neparametrični test (Mann-Whitney U test)

wilcox_test_result <- wilcox.test(Total.Time.Spent ~ Gender, data = data)
print(wilcox_test_result)
## 
##  Wilcoxon rank sum test with continuity correction
## 
## data:  Total.Time.Spent by Gender
## W = 84825, p-value = 0.5424
## alternative hypothesis: true location shift is not equal to 0

Mann-Whitney U Test:

p-vrednost = 0,5424 Ta p-vrednost > 0,05 kaže, da ni statistično značilne razlike v času, preživetem na družbenih medijih, med moškimi in ženskami.

Velikost učinka

cohen_d_result <- cohen.d(Total.Time.Spent ~ Gender, data = data)
print(cohen_d_result)
## 
## Cohen's d
## 
## d estimate: 0.04133495 (negligible)
## 95 percent confidence interval:
##      lower      upper 
## -0.0981786  0.1808485

Preverjanje predpostavk

Normalnost

shapiro_test_male <- shapiro.test(data$Total.Time.Spent[data$Gender == "Male"])
shapiro_test_female <- shapiro.test(data$Total.Time.Spent[data$Gender == "Female"])
print(shapiro_test_male)
## 
##  Shapiro-Wilk normality test
## 
## data:  data$Total.Time.Spent[data$Gender == "Male"]
## W = 0.95309, p-value = 1.043e-11
print(shapiro_test_female)
## 
##  Shapiro-Wilk normality test
## 
## data:  data$Total.Time.Spent[data$Gender == "Female"]
## W = 0.94604, p-value = 1.82e-09

Test normalnosti (Shapiro-Wilk):

Moški: p-vrednost = 1,043e-11 Ženske: p-vrednost = 1,82e-09 Obe p-vrednosti sta < 0,05, kar kaže, da podatki za obe skupini niso normalno porazdeljeni.

Homogenost varianc

levene_test_result <- leveneTest(Total.Time.Spent ~ Gender, data = data)
print(levene_test_result)
## Levene's Test for Homogeneity of Variance (center = median)
##        Df F value Pr(>F)
## group   1  0.3952 0.5297
##       834

Homogenost varianc (Leveneov test):

p-vrednost = 0,5297 Ta p-vrednost > 0,05 nakazuje, da so variance homogene med obema skupinama.

Interpretacija rezultatov

cat("\nInterpretacija rezultatov:\n")
## 
## Interpretacija rezultatov:
if (shapiro_test_male$p.value > 0.05 && shapiro_test_female$p.value > 0.05 && levene_test_result$`Pr(>F)`[1] > 0.05) {
  cat("Predpostavke za t-test so izpolnjene. Uporabimo t-test.\n")
  if (t_test_result$p.value < 0.05) {
    cat("T-test kaže statistično značilno razliko v času, preživetem na družbenih medijih, med moškimi in ženskami (p < 0.05).\n")
  } else {
    cat("T-test ne kaže statistično značilne razlike v času, preživetem na družbenih medijih, med moškimi in ženskami (p >= 0.05).\n")
  }
} else {
  cat("Predpostavke za t-test niso izpolnjene. Uporabimo Mann-Whitney U test.\n")
  if (wilcox_test_result$p.value < 0.05) {
    cat("Mann-Whitney U test kaže statistično značilno razliko v času, preživetem na družbenih medijih, med moškimi in ženskami (p < 0.05).\n")
  } else {
    cat("Mann-Whitney U test ne kaže statistično značilne razlike v času, preživetem na družbenih medijih, med moškimi in ženskami (p >= 0.05).\n")
  }
}
## Predpostavke za t-test niso izpolnjene. Uporabimo Mann-Whitney U test.
## Mann-Whitney U test ne kaže statistično značilne razlike v času, preživetem na družbenih medijih, med moškimi in ženskami (p >= 0.05).
cat("\nVelikost učinka (Cohen's d):", cohen_d_result$estimate, "\n")
## 
## Velikost učinka (Cohen's d): 0.04133495
cat("Interpretacija velikosti učinka:\n")
## Interpretacija velikosti učinka:
if (abs(cohen_d_result$estimate) < 0.2) {
  cat("Majhen učinek\n")
} else if (abs(cohen_d_result$estimate) < 0.5) {
  cat("Srednji učinek\n")
} else {
  cat("Velik učinek\n")
}
## Majhen učinek

Shapiro-Wilkov test normalnosti je bil uporabljen za preverjanje, ali podatki za moške in ženske sledijo normalni porazdelitvi. Če sta p-vrednosti za obe skupini večji od 0,05, to pomeni, da podatki sledijo normalni porazdelitvi, kar je predpostavka za uporabo t-testa.

Levenov test homogenosti varianc je bil izveden za preverjanje, ali so variance v času, preživetem na družbenih medijih, med moškimi in ženskami enake. Če je p-vrednost večja od 0,05, to kaže, da ni statistično značilnih razlik v variancah, kar pomeni, da je predpostavka enakosti varianc izpolnjena in se lahko uporabi t-test.

T-test za neodvisne vzorce je bil uporabljen za primerjavo povprečnega časa, preživetega na družbenih medijih, med moškimi in ženskami. Če je p-vrednost t-testa manjša od 0,05, to kaže na statistično značilno razliko med skupinama. V tem primeru pa p-vrednost presega 0,05, kar pomeni, da ni statistično značilne razlike med moškimi in ženskami glede časa, preživetega na družbenih medijih.

Mann-Whitney U test je bil uporabljen kot alternativa t-testu, ker predpostavke za t-test niso bile izpolnjene. Ta test primerja mediane med dvema skupinama. Rezultat testa kaže, da p-vrednost presega 0,05, kar pomeni, da ni statistično značilne razlike med moškimi in ženskami v času, preživetem na družbenih medijih.

Cohen’s d je mera velikosti učinka, ki pokaže, kako velika je razlika med moškimi in ženskami glede časa, preživetega na družbenih medijih. Vrednost Cohen’s d je 0,041, kar kaže na zelo majhen učinek. To pomeni, da je razlika med skupinama tako majhna, da verjetno nima praktičnega pomena.

Zaključek Na podlagi opravljene analize lahko zaključimo, da ni statistično značilne razlike v času, preživetem na družbenih medijih, med moškimi in ženskami v tem naboru podatkov. Ključne točke, ki podpirajo ta zaključek, so:

Razlika v povprečnem preživetem času je majhna (približno 3,5 minute). Vizualizacije kažejo precejšnje prekrivanje med obema skupinama. Mann-Whitney U test (izbran zaradi nenormalne porazdelitve) ne kaže značilne razlike (p = 0,5424). Velikost učinka je zanemarljiva (Cohen’s d = 0,04133495).

Čeprav opisne statistike kažejo nekoliko višje povprečje za moške, ta razlika ni statistično značilna in velikost učinka je zelo majhna. Zato na podlagi te analize spol ne zdi odločilni dejavnik pri količini časa, preživetega na družbenih medijih, za ta konkretni nabor podatkov.