En este documento analizaremos el caso de usuarios de Amazon Prime; sus preferencias dependiendo su sexo y qué tantos problemas de la aplicación enfrentan.
Mi hipótesis es que quienes mayormente consumen esta plataforma son los hombres y el género cinematográfico que más se consume por ellos es: comedia y documentales, mientras que las mujeres consumen más: drama y Romance. Al igual que no todos los usuarios suelen presentar problemas con la aplicación.
This is an R Markdown document. Markdown is a simple formatting syntax for authoring HTML, PDF, and MS Word documents. For more details on using R Markdown see http://rmarkdown.rstudio.com.
When you click the Knit button a document will be generated that includes both content as well as the output of any embedded R code chunks within the document. You can ebbed an R code chunk like this:
# Convertimos una variable categorica a una númerica(mujeres = 1)
Mujeres <- data_amazon %>% filter(Gender == "Female") %>%
mutate(Gender = 1) %>% select(Gender)
#Convertimos la otra variable categorica a una númerica(Hombres = 0)
Hombres <- data_amazon %>% filter(Gender == "Male") %>%
mutate(Gender = 2) %>% select(Gender)
Ahora podemos ver el total de Hombres:
## Gender
## 1260
y el total de mujeres:
## Gender
## 1240
De estos datos obtenidos podemos ver que quienes consumen más la plataforma de Amazon Prime son los Hombres, por una diferencia de 10 usuarios más. Pero…de estos usuarios ¿cuál es el género cinematográfico que más les agrada?
A las mujeres les gusta más el género de acción, drama y comedia, con una cantidad de usuarios de 198 para acción, 182 para comedia y 186 para drama, estos géneros son los cuales ocupan los tres primeros lugares de la lista de la plataforma.
A los hombres les gusta más el género de Horror, romance y acción, con una cantidad de usuarios de 203 para Horror, 193 para romance y 182 para acción, estos géneros son los cuales ocupan los tres primeros lugares de la lista de la plataforma.
Para entender mejor la demanda de géneros dentro de la plataforma, presentamos la siguiente tabla la cual presenta resultados generales sin dividir los gustos por sexo:
## # A tibble: 7 × 2
## `Favorite Genres` n
## <chr> <int>
## 1 Horror 383
## 2 Action 380
## 3 Romance 368
## 4 Drama 361
## 5 Comedy 349
## 6 Documentary 340
## 7 Sci-Fi 319
De esta tabla podemos observar que el género cinematográfico más visto es Horror, acción y romance, ninguno de los dos primero fueron las opciones a favorito en nuestra hipótesis cabe aclarar.
Ahora, para entender mejor si la aplicación ha tenido un buen rendimiento a la hora de usarse podemos hacer la siguiente regresión lineal.
Preparamos una nueva tabla con información necesaria para hacer nuestro modelo.
regre_tabla <- data_amazon %>%
filter(Gender == "Female" | Gender == "Male") %>% mutate(Gender = ifelse(Gender == "Female", 1, 0)) %>% group_by(Gender, `Customer Support Interactions`) %>%
summarise(contar = n()) %>%
select(Gender, `Customer Support Interactions`, contar)
## `summarise()` has grouped output by 'Gender'. You can override using the
## `.groups` argument.
x <- regre_tabla$`Customer Support Interactions`
y <- regre_tabla$contar
modelo1 <- lm(y ~ x, data = data_amazon)
summary(modelo1)
##
## Call:
## lm(formula = y ~ x, data = data_amazon)
##
## Residuals:
## Min 1Q Median 3Q Max
## -13.736 -3.911 -1.086 3.326 16.364
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 116.3864 3.1286 37.20 <2e-16 ***
## x -0.5500 0.5288 -1.04 0.311
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 7.844 on 20 degrees of freedom
## Multiple R-squared: 0.05131, Adjusted R-squared: 0.003872
## F-statistic: 1.082 on 1 and 20 DF, p-value: 0.3107
Podemos ver una relación negativa, con una pendiente de -1.04 donde la variable x (interacciones con atención al cliente ) tiene una relación negativa con la variable y (el número de usuarios), aunque nuestra f estadística no es muy alta pero si positiva, nos hace alusión a una pequeña relación entre nuestras variables.
scatterplot(data = data_amazon, y ~ x, smooth = FALSE,
main = "Modelo de regresión lineal",
col = "black",
pch = c(22),
xlab = "Interacciones con soporte",
ylab = "usuarios")
Se presenta nuestro gráfico, en el cual podemos notar que mayor número de usuarios tienden a tener menos interacción con atención al cliente, y viceversa, menor número de usuarios tienden a tener mayor interacción con atención al cliente, podría concluirse que la plataforma tiene un buen rendimiento, ya que no sabemos con exactitud cada uno de los problemas que pudieron tener cada usuario y si en verdad era por la plataforma o por algún factor externo.