Vir podatkov: https://www.kaggle.com/datasets/ruchi798/analyzing-screen-time
Ta analiza preučuje dejavnike, ki vplivajo na čas, preživet na družbenih medijih. Analiza poizkuša odgovoriti na raziskovalno vprašanje: “Kateri demografski in psihološki dejavniki vplivajo na čas, preživet na družbenih medijih?
Enota opazovanja je posamezen udeležene, velikost vzorca je 1.000 enot
suppressPackageStartupMessages({
library(ggplot2)
library(dplyr)
library(car)
library(lmtest)
library(corrplot)
})
data <- read.csv("C:/Users/bostj/OneDrive/Desktop/MTRD/Bla123/Time-WastersOnSocialMedia.csv")
summary(data[c("Total.Time.Spent", "Age", "Income", "Self.Control", "Addiction.Level")])
## Total.Time.Spent Age Income Self.Control
## Min. : 10.0 Min. :18.00 Min. :20138 Min. : 3.000
## 1st Qu.: 78.0 1st Qu.:29.00 1st Qu.:38675 1st Qu.: 5.000
## Median :152.0 Median :42.00 Median :58805 Median : 7.000
## Mean :151.4 Mean :40.99 Mean :59524 Mean : 7.094
## 3rd Qu.:223.0 3rd Qu.:52.00 3rd Qu.:79792 3rd Qu.: 8.000
## Max. :298.0 Max. :64.00 Max. :99676 Max. :10.000
## Addiction.Level
## Min. :0.000
## 1st Qu.:2.000
## Median :3.000
## Mean :2.906
## 3rd Qu.:5.000
## Max. :7.000
Opisna statistika: Povzetki statistik kažejo, da:
Skupni čas, preživet na družbenih medijih, sega od 10 do 298 minut, s povprečjem 151,4.minute. Starost udeležencev sega od 18 do 64 let, s povprečjem 41 let. Dohodek sega od 20.138 denarnih enot do 99.676 denarnih enot, s povprečjem 59.524 denarnih enot. Ocene samokontrole segajo od 3 do 10, s povprečjem 7,094. Stopnja zasvojenosti sega od 0 do 7, s povprečjem 2,906.
Te statistike nam dajo splošen pregled značilnosti vzorca.
cor_matrix <- cor(data[c("Total.Time.Spent", "Age", "Income", "Self.Control", "Addiction.Level")])
corrplot(cor_matrix, method = "color")
par(mfrow=c(2,2))
hist(data$Total.Time.Spent, main="Histogram skupnega preživetega časa", xlab="Skupni preživeti čas")
hist(data$Age, main="Histogram starosti", xlab="Starost")
hist(data$Income, main="Histogram dohodka", xlab="Dohodek")
hist(data$Self.Control, main="Histogram samokontrole", xlab="Samokontrola")
par(mfrow=c(1,1))
ggplot(data, aes(x=Age, y=Total.Time.Spent)) +
geom_point() +
geom_smooth(method="lm") +
labs(title = "Odnos med starostjo in časom na družbenih medijih",
x = "Starost", y = "Skupni preživeti čas")
## `geom_smooth()` using formula = 'y ~ x'
ggplot(data, aes(x=Income, y=Total.Time.Spent)) +
geom_point() +
geom_smooth(method="lm") +
labs(title = "Odnos med dohodkom in časom na družbenih medijih",
x = "Dohodek", y = "Skupni preživeti čas")
## `geom_smooth()` using formula = 'y ~ x'
ggplot(data, aes(x=Self.Control, y=Total.Time.Spent)) +
geom_point() +
geom_smooth(method="lm") +
labs(title = "Odnos med samokontrolo in časom na družbenih medijih",
x = "Samokontrola", y = "Skupni preživeti čas")
## `geom_smooth()` using formula = 'y ~ x'
ggplot(data, aes(x=Addiction.Level, y=Total.Time.Spent)) +
geom_point() +
geom_smooth(method="lm") +
labs(title = "Odnos med stopnjo zasvojenosti in časom na družbenih medijih",
x = "Stopnja zasvojenosti", y = "Skupni preživeti čas")
## `geom_smooth()` using formula = 'y ~ x'
Razsevni diagrami s prilagojenimi črtami bi prikazali odnos med vsakim napovedovalcem in skupnim preživetim časom. Ti grafi ne kažejo jasnih linearnih odnosov. To pomeni, da ti dejavniki ne vplivajo dovolj močno ali pa ne vplivajo na način, ki bi bil opazen kot linearni trend, da bi pojasnili, zakaj nekdo preživi več ali manj časa na družbenih medijih.
model <- lm(Total.Time.Spent ~ Age + Income + Self.Control, data = data)
Regresijska analiza:
R-kvadrat modela je 0,0004739, kar pomeni, da je le približno 0,05 % variance v skupnem preživetem času pojasnjeno z napovedovalci. To je izjemno nizko. Prilagojen R-kvadrat je negativen (-0,002537), kar nakazuje, da model deluje slabše kot vodoravna črta. F-statistika (0,1574) s p-vrednostjo 0,9249 kaže, da model kot celota ni statistično značilen. Noben od posameznih napovedovalcev (starost, dohodek, samokontrola) ni statistično značilen, vse p-vrednosti so > 0,05.
summary_model <- summary(model)
print(summary_model)
##
## Call:
## lm(formula = Total.Time.Spent ~ Age + Income + Self.Control,
## data = data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -143.520 -72.961 -0.467 71.749 148.983
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 1.545e+02 1.425e+01 10.840 <2e-16 ***
## Age -2.786e-02 1.972e-01 -0.141 0.888
## Income 4.917e-05 1.122e-04 0.438 0.661
## Self.Control -6.844e-01 1.294e+00 -0.529 0.597
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 84.06 on 996 degrees of freedom
## Multiple R-squared: 0.0004739, Adjusted R-squared: -0.002537
## F-statistic: 0.1574 on 3 and 996 DF, p-value: 0.9249
plot(model, which = 1)
Predpostavka linearnosti: Graf ostankov glede na napovedane vrednosti bi
idealno prikazal naključno razpršenost okoli vodoravne črte pri y=0.
Brez ogleda grafa ne moremo potrditi, ali je ta predpostavka izpolnjena,
vendar glede na slabo prileganje modela ta preverba morda ni zelo
smiselna.
plot(model, which = 3)
Homoskedastičnost: Graf standardiziranih ostankov glede na napovedane
vrednosti kaže naključno razpršenost z dosledno razširjenostjo.
vif_values <- vif(model)
print(vif_values)
## Age Income Self.Control
## 1.001400 1.001815 1.002618
Multikolinearnost: Vrednosti VIF (Variance Inflation Factor) za vse napovedovalce so zelo blizu 1 (Starost: 1,001400, Dohodek: 1,001815, Samokontrola: 1,002618). To kaže, da v modelu ni zaskrbljujoče multikolinearnosti. Napovedovalci niso močno korelirani med seboj.
cat("\nInterpretacija rezultatov:\n")
##
## Interpretacija rezultatov:
cat("R-kvadrat:", summary_model$r.squared, "\n")
## R-kvadrat: 0.0004738716
cat("Prilagojen R-kvadrat:", summary_model$adj.r.squared, "\n")
## Prilagojen R-kvadrat: -0.002536749
cat("\nPovzetek regresijske analize:\n")
##
## Povzetek regresijske analize:
cat("Model pojasni", round(summary_model$r.squared * 100, 2), "% variance v času, preživetem na družbenih medijih.\n")
## Model pojasni 0.05 % variance v času, preživetem na družbenih medijih.
cat("\nInterpretacija koeficientov:\n")
##
## Interpretacija koeficientov:
coef_table <- summary_model$coefficients
for(i in 2:nrow(coef_table)) {
var_name <- rownames(coef_table)[i]
coef <- coef_table[i, 1]
p_value <- coef_table[i, 4]
cat(var_name, ": ")
if(p_value < 0.05) {
cat("Statistično značilen vpliv. ")
if(coef > 0) {
cat("Pozitivna povezava s časom na družbenih medijih.\n")
} else {
cat("Negativna povezava s časom na družbenih medijih.\n")
}
} else {
cat("Ni statistično značilnega vpliva.\n")
}
}
## Age : Ni statistično značilnega vpliva.
## Income : Ni statistično značilnega vpliva.
## Self.Control : Ni statistično značilnega vpliva.
Multipli koeficient determinacije: Vrednost R-kvadrata (0,0004738716) kaže, da model pojasni le približno 0,05 % variance v času, preživetem na družbenih medijih. To pomeni, da vključeni neodvisni spremenljivki (kot so starost, dohodek in samokontrola) zelo malo prispevajo k razlagi razlik v času, ki ga posamezniki preživijo na družbenih medijih. Mmodel skorajda ne pojasni, zakaj nekateri preživijo več časa na družbenih medijih kot drugi.
Povzetek regresijske analize: Regresijska analiza kaže, da model pojasni zanemarljivo majhen delež (0,05 %) variance v času, preživetem na družbenih medijih. To pomeni, da so starost, dohodek in samokontrola zelo šibki napovedovalci, kar se tiče časa, preživetega na družbenih medijih. Model tako ne nudi praktično nobene uporabne informacije o vplivu teh dejavnikov.
Interpretacija koeficientov: Pri pregledu koeficientov posameznih spremenljivk je razvidno, da nobena izmed njih nima statistično značilnega vpliva na čas, preživet na družbenih medijih, saj vse p-vrednosti presegajo 0,05. To pomeni, da na podlagi tega modela ni mogoče trditi, da starost, dohodek ali samokontrola pomembno vplivajo na količino časa, ki ga ljudje preživijo na družbenih medijih. Vpliv teh spremenljivk je tako statistično neznačilen in zelo verjetno nepomemben.
Na splošno, čeprav model izpolnjuje nekatere predpostavke (ni multikolinearnosti), njegovo izjemno slabo prileganje podatkom (kot dokazuje skoraj ničelni R-kvadrat in neznačilen F-test) nakazuje, da te spremenljivke niso uporabni napovedovalci časa, preživetega na družbenih medijih, v tem naboru podatkov. Analiza ne uspe identificirati nobenih pomembnih dejavnikov, ki bi vplivali na čas uporabe družbenih medijev med obravnavanimi spremenljivkami.