Se carga la base de datos de Amazon Prime

Base de Datos de Amazon

La hipotesis inicial es que si la frecuencia de uso y el compromiso que se tiene con el servicio de Amazon Prime, tiene algo que ver con el genero favorito de los usuarios. Para eso, vamos a crear la tabla 1, donde se nos muestra solamente el genero favorito de los usuarios y la frecuencia de visualización.

Manipulación de los datos

Tabla1  <-data.frame((table(Base_de_DatosAmazon$Favorite.Genres,
                            Base_de_DatosAmazon$Usage.Frequency)))
colnames(Tabla1) <- c("Favorite.Genres",
                                "Usage.Frequency",
                                "Frequency")
Tabla1

Posterior a esto, vamos a realizar un grafico de barra para comparar las frecuencias de visualización.

library(ggplot2)
library(ggthemes)
ggplot(Tabla1, aes(x=Favorite.Genres, y=Frequency, fill=
                     Usage.Frequency)) + 
  geom_bar(stat = "identity", position="dodge" )+ 
  labs(x="Genero favorito",
       y="fecuencia",
       fill="Frecuencia de visualizacion",
       title = "Frecuencia de uso por genero") +
  theme_calc()

En esta grafica se puede observar claramente que el genero “horror” es el genero preferido de los usuarios, se puede observar como este genero tiene la mayor frecuencia catalogada como “Frequent” y “Occasional”.

Teniendo esto en cuenta, vamos a hacer otra tabla donde incluya “Engagement.Metrics” donde este significa el compromiso que tiene con el servicio de Amazon Prime

library(dplyr)
Tabla2 <-  Base_de_DatosAmazon %>% select(Engagement.Metrics,Usage.Frequency, Favorite.Genres) %>%
  arrange(desc(Engagement.Metrics))
Tabla2

Para un mejor manejo de los datos y poder aplicar la siguiente grafica, vamos a transformar el Engagement.Metrics en un valores numericos.

Tabla2$Favorite.Genres <- as.factor(Tabla2$Favorite.Genres)
Tabla2$Engagement.Metrics <- as.numeric(Tabla2$Engagement.Metrics)

Con esta conversión, Engagement.Metrics se convierte de la siguiente forma:

Medium tiene un valor de 3

Low tiene un valor de 2

High tiene un valor de 1

La proxima grafica nos servira incluira las 3 variables, Usage.Frequency, Engagament.Metrics y Favorite.Genres.

ggplot(Tabla2, aes(x =Favorite.Genres , y =  Engagement.Metrics, col = Usage.Frequency)) +
  geom_jitter(width = 0.2, height = 0.2) +
  labs(x="Genero Favorito",
       y="Compromiso con la app",
       fill="Frecuencia de visualización",
       title = "Compromiso con la app dependiendo de frecuencia de uso y genero") +
  theme_economist()

Esta grafica es bastante compleja para un analisis, dado a que no hay un patron visible, por ejemplo, el genero de “Horror” que tenia mayor frecuencia de visualización, tienen muy disperso su compromiso con la app dado a su frecuencia de visualización, a simple vista se ve mas puntos de Frquent en un compromiso nivel 3 (medium). En general, esta grafica es muy dificil de interpretar, por lo que igual nos da una vista de que a lo mejor estos datos no sean los necesarios o factores importantes para determinar su compromiso dependiendo algun factor. Por lo que para comprobar eso, se realizara un modelo de regresión lineal simple.

modelo <- lm(Engagement.Metrics ~ Favorite.Genres, data = Tabla2)

summary(modelo)
## 
## Call:
## lm(formula = Engagement.Metrics ~ Favorite.Genres, data = Tabla2)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -1.0816 -0.9582  0.0094  0.9783  1.0665 
## 
## Coefficients:
##                            Estimate Std. Error t value Pr(>|t|)    
## (Intercept)                 2.08158    0.04203  49.526   <2e-16 ***
## Favorite.GenresComedy      -0.06725    0.06075  -1.107   0.2683    
## Favorite.GenresDocumentary -0.11687    0.06116  -1.911   0.0561 .  
## Favorite.GenresDrama       -0.14806    0.06022  -2.459   0.0140 *  
## Favorite.GenresHorror      -0.12335    0.05932  -2.079   0.0377 *  
## Favorite.GenresRomance     -0.05984    0.05992  -0.999   0.3181    
## Favorite.GenresSci-Fi      -0.09098    0.06222  -1.462   0.1438    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.8193 on 2493 degrees of freedom
## Multiple R-squared:  0.003241,   Adjusted R-squared:  0.0008423 
## F-statistic: 1.351 on 6 and 2493 DF,  p-value: 0.2309

Donde, efectivamente, comprobamos lo que en la grafica se deducia, solo se podria hacer predicciones muy pocas significativas o nulas, salvo de tres generos, los cuales son: “Horror”, “Drama”, “Documentary”.

Por lo que se concluye que no tienen una relación cerca sobre la frecuencia de uso, el compromiso con la app con los generos favoritos de los usuarios.