Cargamos librerías y base de datos

Análisis sobre usuarios de Amazon Prime y sus preferencias

En este documento analizaremos el caso de usuarios de Amazon Prime; sus preferencias dependiendo su sexo y qué tantos problemas de la aplicación enfrentan.

Mi hipótesis es que quienes mayormente consumen esta plataforma son los hombres y el género cinematográfico que más se consume por ellos es: comedia y documentales, mientras que las mujeres consumen más: drama y Romance. Al igual que no todos los usuarios suelen presentar problemas con la aplicación.

R Markdown

This is an R Markdown document. Markdown is a simple formatting syntax for authoring HTML, PDF, and MS Word documents. For more details on using R Markdown see http://rmarkdown.rstudio.com.

When you click the Knit button a document will be generated that includes both content as well as the output of any embedded R code chunks within the document. You can ebbed an R code chunk like this:

Elegimos nuestros datos de interés y los convertimos:

# Convertimos una variable categorica a una númerica(mujeres = 1)
Mujeres <- data_amazon %>% filter(Gender == "Female") %>%
  mutate(Gender = 1) %>% select(Gender)
#Convertimos la otra variable categorica a una númerica(Hombres = 0)
Hombres <- data_amazon %>% filter(Gender == "Male") %>% 
  mutate(Gender = 2) %>% select(Gender)

Ahora podemos ver el total de Hombres:

## Gender 
##   1260

y el total de mujeres:

## Gender 
##   1240

De estos datos obtenidos podemos ver que quienes consumen más la plataforma de Amazon Prime son los Hombres, por una diferencia de 10 usuarios más. Pero…de estos usuarios ¿cuál es el género cinematográfico que más les agrada?

A las mujeres les gusta más el género de acción, drama y comedia, con una cantidad de usuarios de 198 para acción, 182 para comedia y 186 para drama, estos géneros son los cuales ocupan los tres primeros lugares de la lista de la plataforma.

A los hombres les gusta más el género de Horror, romance y acción, con una cantidad de usuarios de 203 para Horror, 193 para romance y 182 para acción, estos géneros son los cuales ocupan los tres primeros lugares de la lista de la plataforma.

Para entender mejor la demanda de géneros dentro de la plataforma, presentamos la siguiente tabla la cual presenta resultados generales sin dividir los gustos por sexo:

## # A tibble: 7 × 2
##   `Favorite Genres`     n
##   <chr>             <int>
## 1 Horror              383
## 2 Action              380
## 3 Romance             368
## 4 Drama               361
## 5 Comedy              349
## 6 Documentary         340
## 7 Sci-Fi              319

De esta tabla podemos observar que el género cinematográfico más visto es Horror, acción y romance, ninguno de los dos primero fueron las opciones a favorito en nuestra hipótesis cabe aclarar.

Ahora, para entender mejor si la aplicación ha tenido un buen rendimiento a la hora de usarse podemos hacer la siguiente regresión lineal.

REGRESIÓN LINEAL

Preparamos una nueva tabla con información necesaria para hacer nuestro modelo.

regre_tabla <- data_amazon %>%
  filter(Gender == "Female" | Gender == "Male") %>% mutate(Gender = ifelse(Gender == "Female", 1, 0)) %>% group_by(Gender, `Customer Support Interactions`) %>%
  summarise(contar = n()) %>%
  select(Gender, `Customer Support Interactions`, contar)
## `summarise()` has grouped output by 'Gender'. You can override using the
## `.groups` argument.

Asignamos valor a nuestras variables:

x <- regre_tabla$`Customer Support Interactions`
y <- regre_tabla$contar

Analizamos nuestra información estadística

modelo1 <- lm(y ~ x, data = data_amazon)
summary(modelo1)
## 
## Call:
## lm(formula = y ~ x, data = data_amazon)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -13.736  -3.911  -1.086   3.326  16.364 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept) 116.3864     3.1286   37.20   <2e-16 ***
## x            -0.5500     0.5288   -1.04    0.311    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 7.844 on 20 degrees of freedom
## Multiple R-squared:  0.05131,    Adjusted R-squared:  0.003872 
## F-statistic: 1.082 on 1 and 20 DF,  p-value: 0.3107

Podemos ver una relación negativa, con una pendiente de -1.04 donde la variable x (interacciones con atención al cliente ) tiene una relación negativa con la variable y (el número de usuarios), aunque nuestra f estadística no es muy alta pero si positiva, nos hace alusión a una pequeña relación entre nuestras variables.

scatterplot(data = data_amazon, y ~ x, smooth = FALSE, 
            main = "Modelo de regresión lineal",
            col = "black",
            pch = c(22),
            xlab = "Interacciones con soporte",
            ylab = "usuarios")

Se presenta nuestro gráfico, en el cual podemos notar que mayor número de usuarios tienden a tener menos interacción con atención al cliente, y viceversa, menor número de usuarios tienden a tener mayor interacción con atención al cliente, podría concluirse que la plataforma tiene un buen rendimiento, ya que no sabemos con exactitud cada uno de los problemas que pudieron tener cada usuario y si en verdad era por la plataforma o por algún factor externo.