library(ggplot2)
library(dplyr)
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(car)
## Loading required package: carData
##
## Attaching package: 'car'
## The following object is masked from 'package:dplyr':
##
## recode
data_set_amazon <- read.csv("data_set_amazon.csv")
En este análisis se tienen 7 tipos de géneros de peliculas que más ven los hombres y las mujeres en la plataforma de Amazon, lo cual se muestra de manera más clara en la siguiente gráfica.
amazon1 <- data_set_amazon %>%
group_by(Favorite.Genres) %>%
count()
ggplot(amazon1, aes(x = Favorite.Genres, y = n, fill = Favorite.Genres)) +
geom_bar(stat = "identity", color = "black", size = 0.5) +
labs(title = "Genero de peliculas favorito",
x = "Genero",
y = "Numero de personas") +
theme_classic()
## Warning: Using `size` aesthetic for lines was deprecated in ggplot2 3.4.0.
## ℹ Please use `linewidth` instead.
## This warning is displayed once every 8 hours.
## Call `lifecycle::last_lifecycle_warnings()` to see where this warning was
## generated.
En la hipótesis se menciona que las mujeres ven más el género romántico que los hombres, en este apartado se muestra la categoria que cada persona tiene respecto al genéro romántico.
Así mismo, se comprueba lo dicho anteriormente, se presenta segmentado por género de usuario que género de peliculas prefiere, utilizando el género de los hombres.
amazon <- data_set_amazon %>%
filter(`Favorite.Genres` == "Romance", Gender == "Male") %>%
select(`Favorite.Genres`, `Feedback.Ratings`) %>%
mutate(Personas_Romance = row_number()) %>%
select(Personas_Romance, everything())
ggplot(amazon, aes(x = `Favorite.Genres`, y= Personas_Romance,
fill = `Favorite.Genres`)) +
geom_bar(stat = "identity", color = "yellow", size = 0.5) +
labs(title = "Número de hombres que prefieren peliculas de Romance",
x = "Genero romantico",
y = "Número de hombres")
ggplot(data = amazon, aes(x= Personas_Romance, y = `Feedback.Ratings`)) +
geom_point(alpha=0.5)
labs(tiltle = "Nivel de preferencia de las personas que ven romance",
x = "Personas que ven romance",
y = "Rating") +
theme_classic()
## NULL
Como parte para concluir con el análisis se establecieron variables para realizar un modelo de regresión lineal simple, tomando en cuenta la variable de personas que prefieren el género romantico y la calificación que le dan a ese género.
Y=B0+B1*X1+e
En este caso la variable Y es la calificación y la X es de los hombres que ven peliculas románticas.
Rating = B0 + Personas que ven el género romántico * CoefB1 + e
x = amazon$Personas_Romance
y = amazon$`Feedback.Ratings`
modelo <- lm(data = amazon, formula = `Feedback.Ratings` ~ Personas_Romance )
summary(modelo)
##
## Call:
## lm(formula = Feedback.Ratings ~ Personas_Romance, data = amazon)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.07616 -0.53211 0.07428 0.48387 1.11885
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 3.8459845 0.0860876 44.675 <2e-16 ***
## Personas_Romance 0.0015985 0.0007696 2.077 0.0391 *
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5957 on 191 degrees of freedom
## Multiple R-squared: 0.02209, Adjusted R-squared: 0.01697
## F-statistic: 4.314 on 1 and 191 DF, p-value: 0.03914
x = amazon$Personas_Romance
y = amazon$`Feedback.Ratings`
cor (x, y )
## [1] 0.1486205
En este caso la intersección es de 3.8, lo que significa que cuando x es 0, y es 3.8 la pendientes es x 0.0015 , lo que significa que por cada unidad adicional en x, y aumenta en promedio 0.0015 unidades. El R cuadrado multiple es de 0.022, indicando que el 2.2% de la variación en “y” puede ser explicado por “x” el coeficiente de correlación que se tiene es demasiado bajo, por lo que no tiene un relación directa entre las personas que prefieren el romance y el rating que se tiene.
car::scatterplot(data = amazon,
`Feedback.Ratings` ~ Personas_Romance ,
smooth= FALSE)
como se puede ver, la linea esta un poco horizontal, demuestra que si hay relación pero es muy poca, esto significa que puede haber otros factores que determinen el rating y no la preferencias por el género romántico.
Este trabajo consistio en ver las preferencias de los géneros de peliculas en la plataforma de Amazon, pero en este caso está enfocado al género romántico, por logíca se podria decir que las mujeres son las que prefieren el género romántico que lo hombres, y de acuero a lo realizado es así. Comprobando que cuando aumenta la preferencia esto no quiere decir que tenga una relación con el rating que tiene amazon, por lo que puede haber otros factores que determinan esta variable, por ende no tiene un correlación en nuestro modelo obtenido en el análisis.