Ho: No hay diferencia significativa en el tiempo de compra entre género masculino y femenino en Amazon
Ha: El género masculino pasa menos tiempo comprando en Amazon que el género femenino.
library(dplyr)
## Warning: package 'dplyr' was built under R version 4.2.3
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(ggplot2)
## Warning: package 'ggplot2' was built under R version 4.2.3
El archivo es de tipo csv.
base_amazon <- read.csv("data_set_amazon.csv",
stringsAsFactors = TRUE)
En este apartado verificaremos si los correos son unicos y solo corresponden a un usuario para ello utilizaremos la función de “count”
correos_rpt <- base_amazon %>%
select(Email.Address) %>%
count(Email.Address)
head(correos_rpt,20)
## Email.Address n
## 1 aanderson@example.org 1
## 2 aaron27@example.com 1
## 3 aaron29@example.net 1
## 4 aaron39@example.com 1
## 5 aaron70@example.net 1
## 6 aaronking@example.net 1
## 7 aaronmiller@example.org 1
## 8 aaronwelch@example.org 1
## 9 aatkinson@example.com 1
## 10 abigailconrad@example.com 1
## 11 abigailwilson@example.org 1
## 12 abutler@example.net 1
## 13 acline@example.org 1
## 14 acrawford@example.com 1
## 15 adam03@example.org 1
## 16 adam28@example.org 1
## 17 adam73@example.com 1
## 18 adamshelen@example.org 1
## 19 adamsjesse@example.org 1
## 20 adamsmark@example.net 1
correos <- base_amazon %>%
select(Email.Address) %>%
group_by(Email.Address) %>%
summarise(correos_rp = n()) %>%
filter ( correos_rp > 2)
print(correos)
## # A tibble: 0 × 2
## # ℹ 2 variables: Email.Address <fct>, correos_rp <int>
Como se puede observar en el data frame “correost” los correos son únicos y ninguno se repite, tambien en “correos_rpt” se muestra que los correos solo correpesde a n=1
se utilizara a función de “select” para seleccionar las variables de interés.
names(base_amazon)
## [1] "User.ID" "Name"
## [3] "Email.Address" "Username"
## [5] "Date.of.Birth" "Gender"
## [7] "Location" "Membership.Start.Date"
## [9] "Membership.End.Date" "Subscription.Plan"
## [11] "Payment.Information" "Renewal.Status"
## [13] "Usage.Frequency" "Purchase.History"
## [15] "Favorite.Genres" "Devices.Used"
## [17] "Engagement.Metrics" "Feedback.Ratings"
## [19] "Customer.Support.Interactions"
amazon <- base_amazon %>%
select(Username,Gender,Purchase.History, Usage.Frequency)
genero_uso <- amazon %>%
group_by(Gender) %>%
summarise(count = n()) %>%
arrange(desc(count)) # Ordenar de mayor a menor uso
# Mostrar el resultado
print(genero_uso)
## # A tibble: 2 × 2
## Gender count
## <fct> <int>
## 1 Male 1260
## 2 Female 1240
En los resultados nos arrojó que el género que más predomina en la base de datos es el género masculino sin embargo se está excluyendo con que precuencia la usa.
# gráfico de barras
ggplot(genero_uso, aes(x = Gender, y = count, fill = Gender)) +
geom_bar(stat = "identity") +
labs(title = "Uso de Amazon por Género", x = "Género", y = "Número de Usuarios") +
theme_minimal()
# Un análisis por separado en tanto al a la frecuencia que usan Amazon:
masculino
masculino_uso <- amazon %>%
filter(Gender == "Male") %>%
group_by(Usage.Frequency) %>%
summarise(count = n()) %>%
arrange(desc(count)) # Ordenar de mayor a menor uso
print(masculino_uso)
## # A tibble: 3 × 2
## Usage.Frequency count
## <fct> <int>
## 1 Regular 424
## 2 Frequent 423
## 3 Occasional 413
# Mostrar el resultado para el genero masculino
ggplot(masculino_uso, aes(x = Usage.Frequency, y = count, fill = Usage.Frequency)) +
geom_bar(stat = "identity") +
labs(title = "Frecuencia de uso de Amazon por el género masculino",
x = "Frecuencia de Uso",
y = "Número de Usuarios") +
theme_minimal()
Podemos observar que el género Masculino quien es el que más utiliza Amazon en relación a la frecuencia de uso es quien menos frecuenta a utilizarla sin embargo la diferencia de uso masculino-femenino es mínima.
femenino_uso <- amazon %>%
filter(Gender == "Female") %>%
group_by(Usage.Frequency) %>%
summarise(count = n()) %>%
arrange(desc(count)) # Ordenar de mayor a menor uso
print(femenino_uso)
## # A tibble: 3 × 2
## Usage.Frequency count
## <fct> <int>
## 1 Frequent 428
## 2 Occasional 409
## 3 Regular 403
ggplot(femenino_uso, aes(x = Usage.Frequency, y = count, fill = Usage.Frequency)) +
geom_bar(stat = "identity") +
labs(title = "Frecuencia de Uso de Amazon por el género femenino",
x = "Frecuencia de Uso",
y = "Número de Usuarios") +
theme_minimal()
A pesar de que el género femenino tiene una ligera carga en tanto al uso
de Amazon es quien más frecuenta por lo que si se quier hacer un
incentivo por el uso de aplicación tendría más relevancia al género
Femenino por otro lado se tendría que buscar alguna manera (marketing)
para incentivar al genero masculino a usar más Amazon
productos_f <- amazon %>%
filter(Gender == "Female") %>%
group_by(Purchase.History) %>%
summarise(count = n()) %>%
arrange(desc(count)) # Ordenar de mayor a menor uso
print(productos_f)
## # A tibble: 3 × 2
## Purchase.History count
## <fct> <int>
## 1 Electronics 429
## 2 Books 410
## 3 Clothing 401
ggplot(productos_f, aes(x = Purchase.History, y = count, fill = Purchase.History)) +
geom_bar(stat = "identity") +
labs(title = "Productos que más compra el género femenino",
x = "Historial de productos",
y = "Número de Usuarios") +
theme_minimal()
productos_m <- amazon %>%
filter(Gender == "Male") %>%
group_by(Purchase.History) %>%
summarise(count = n()) %>%
arrange(desc(count)) # Ordenar de mayor a menor uso
print(productos_m)
## # A tibble: 3 × 2
## Purchase.History count
## <fct> <int>
## 1 Books 441
## 2 Electronics 418
## 3 Clothing 401
ggplot(productos_m, aes(x = Purchase.History, y = count, fill = Purchase.History)) +
geom_bar(stat = "identity") +
labs(title = "Productos que más compra el género Masculino",
x = "Historial de productos",
y = "Número de Usuarios") +
theme_minimal()
#Resumen
print(genero_uso)
## # A tibble: 2 × 2
## Gender count
## <fct> <int>
## 1 Male 1260
## 2 Female 1240
print(masculino_uso)
## # A tibble: 3 × 2
## Usage.Frequency count
## <fct> <int>
## 1 Regular 424
## 2 Frequent 423
## 3 Occasional 413
print(femenino_uso)
## # A tibble: 3 × 2
## Usage.Frequency count
## <fct> <int>
## 1 Frequent 428
## 2 Occasional 409
## 3 Regular 403
print(productos_f)
## # A tibble: 3 × 2
## Purchase.History count
## <fct> <int>
## 1 Electronics 429
## 2 Books 410
## 3 Clothing 401
print(productos_m)
## # A tibble: 3 × 2
## Purchase.History count
## <fct> <int>
## 1 Books 441
## 2 Electronics 418
## 3 Clothing 401
Podemos comprobar que mi hipótesis resulto se invalida pues el género que menos tiempo pasa en Amazon es el género femenino sin embargo este resulta que es más susceptible a usar en donde los productos que más compra son electrónicos y el menos compra es ropa. Por otro lado, el género masculino compra más libros y menos ropa. Por lo que en pocas palabra Amazon debería de ver por qué en ambos géneros la ropa es el producto que menos compra y en caso de hacer de hacer una encuesta de satisfacción por más atención en el género masculino pues a pesar que el que más lo y el quien menos lo frecuenta.
hipótesis
Ho: No hay una relación significativa entre las calificaciones de usuarios
Ha: Existe una relación significativa entre las calificaciones de usuarios
# Declarando mis variable
x <- base_amazon$Customer.Support.Interactions
y <- base_amazon$Feedback.Ratings
#correlación
cor(x, y)
## [1] 0.008025796
# Ajustando el modelo de regresíón
modelo <- lm(Customer.Support.Interactions ~ Feedback.Ratings , data = base_amazon)
summary(modelo)
##
## Call:
## lm(formula = Customer.Support.Interactions ~ Feedback.Ratings,
## data = base_amazon)
##
## Residuals:
## Min 1Q Median 3Q Max
## -4.9955 -2.9382 0.0376 3.0266 5.0927
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 4.77497 0.44492 10.732 <2e-16 ***
## Feedback.Ratings 0.04411 0.10995 0.401 0.688
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 3.192 on 2498 degrees of freedom
## Multiple R-squared: 6.441e-05, Adjusted R-squared: -0.0003359
## F-statistic: 0.1609 on 1 and 2498 DF, p-value: 0.6883
Este modelo de regresión lineal simple sugiere que no hay una relación estadísticamente significativa entre las calificaciones de los usuarios (Feedback.Ratings) y las interacciones de atención al cliente (Customer.Support.Interactions). Los valores de R-cuadrado muy bajos y el valor p alto para el coeficiente de Feedback.Ratings apoyan esta conclusión