Hipotesis

Ho: No hay diferencia significativa en el tiempo de compra entre género masculino y femenino en Amazon

Ha: El género masculino pasa menos tiempo comprando en Amazon que el género femenino.

Cargaremes las librerias que vamos a utilizar

library(dplyr)
## Warning: package 'dplyr' was built under R version 4.2.3
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library(ggplot2)
## Warning: package 'ggplot2' was built under R version 4.2.3

Cargaremos la base de datos de “amazon”

El archivo es de tipo csv.

base_amazon <- read.csv("data_set_amazon.csv",
                        stringsAsFactors = TRUE)

Verificación de correos.

En este apartado verificaremos si los correos son unicos y solo corresponden a un usuario para ello utilizaremos la función de “count”

correos_rpt <- base_amazon %>%
  select(Email.Address) %>%
  count(Email.Address)
head(correos_rpt,20)
##                Email.Address n
## 1      aanderson@example.org 1
## 2        aaron27@example.com 1
## 3        aaron29@example.net 1
## 4        aaron39@example.com 1
## 5        aaron70@example.net 1
## 6      aaronking@example.net 1
## 7    aaronmiller@example.org 1
## 8     aaronwelch@example.org 1
## 9      aatkinson@example.com 1
## 10 abigailconrad@example.com 1
## 11 abigailwilson@example.org 1
## 12       abutler@example.net 1
## 13        acline@example.org 1
## 14     acrawford@example.com 1
## 15        adam03@example.org 1
## 16        adam28@example.org 1
## 17        adam73@example.com 1
## 18    adamshelen@example.org 1
## 19    adamsjesse@example.org 1
## 20     adamsmark@example.net 1
correos <- base_amazon %>%
  select(Email.Address) %>%
  group_by(Email.Address) %>%
  summarise(correos_rp = n()) %>%
  filter ( correos_rp > 2)
print(correos)
## # A tibble: 0 × 2
## # ℹ 2 variables: Email.Address <fct>, correos_rp <int>

Como se puede observar en el data frame “correost” los correos son únicos y ninguno se repite, tambien en “correos_rpt” se muestra que los correos solo correpesde a n=1

Selección de variables a utilizar

se utilizara a función de “select” para seleccionar las variables de interés.

names(base_amazon)
##  [1] "User.ID"                       "Name"                         
##  [3] "Email.Address"                 "Username"                     
##  [5] "Date.of.Birth"                 "Gender"                       
##  [7] "Location"                      "Membership.Start.Date"        
##  [9] "Membership.End.Date"           "Subscription.Plan"            
## [11] "Payment.Information"           "Renewal.Status"               
## [13] "Usage.Frequency"               "Purchase.History"             
## [15] "Favorite.Genres"               "Devices.Used"                 
## [17] "Engagement.Metrics"            "Feedback.Ratings"             
## [19] "Customer.Support.Interactions"
amazon <- base_amazon %>%
  select(Username,Gender,Purchase.History, Usage.Frequency)

A continuación, se quiere demostrar que género es quien utiliza más Amazon

genero_uso <- amazon %>%
  group_by(Gender) %>%
  summarise(count = n()) %>%
  arrange(desc(count)) # Ordenar de mayor a menor uso

# Mostrar el resultado
print(genero_uso)
## # A tibble: 2 × 2
##   Gender count
##   <fct>  <int>
## 1 Male    1260
## 2 Female  1240

En los resultados nos arrojó que el género que más predomina en la base de datos es el género masculino sin embargo se está excluyendo con que precuencia la usa.

# gráfico de barras
ggplot(genero_uso, aes(x = Gender, y = count, fill = Gender)) +
  geom_bar(stat = "identity") +
  labs(title = "Uso de Amazon por Género", x = "Género", y = "Número de Usuarios") +
  theme_minimal()

# Un análisis por separado en tanto al a la frecuencia que usan Amazon: masculino

masculino_uso <- amazon %>%
  filter(Gender == "Male") %>%
  group_by(Usage.Frequency) %>%
  summarise(count = n()) %>%
  arrange(desc(count)) # Ordenar de mayor a menor uso
print(masculino_uso)
## # A tibble: 3 × 2
##   Usage.Frequency count
##   <fct>           <int>
## 1 Regular           424
## 2 Frequent          423
## 3 Occasional        413
# Mostrar el resultado para el genero masculino
ggplot(masculino_uso, aes(x = Usage.Frequency, y = count, fill = Usage.Frequency)) +
  geom_bar(stat = "identity") +
  labs(title = "Frecuencia de uso de Amazon por el género masculino",
       x = "Frecuencia de Uso",
       y = "Número de Usuarios") +
  theme_minimal()

Podemos observar que el género Masculino quien es el que más utiliza Amazon en relación a la frecuencia de uso es quien menos frecuenta a utilizarla sin embargo la diferencia de uso masculino-femenino es mínima.

Un análisis por separado en tanto a la frecuencia que usan Amazon: femenino

femenino_uso <- amazon %>%
  filter(Gender == "Female") %>%
  group_by(Usage.Frequency) %>%
  summarise(count = n()) %>%
  arrange(desc(count)) # Ordenar de mayor a menor uso
print(femenino_uso)
## # A tibble: 3 × 2
##   Usage.Frequency count
##   <fct>           <int>
## 1 Frequent          428
## 2 Occasional        409
## 3 Regular           403
ggplot(femenino_uso, aes(x = Usage.Frequency, y = count, fill = Usage.Frequency)) +
  geom_bar(stat = "identity") +
  labs(title = "Frecuencia de Uso de Amazon por el género femenino",
       x = "Frecuencia de Uso",
       y = "Número de Usuarios") +
  theme_minimal()

A pesar de que el género femenino tiene una ligera carga en tanto al uso de Amazon es quien más frecuenta por lo que si se quier hacer un incentivo por el uso de aplicación tendría más relevancia al género Femenino por otro lado se tendría que buscar alguna manera (marketing) para incentivar al genero masculino a usar más Amazon

Productos que más consume el género femenino

productos_f <- amazon %>%
  filter(Gender == "Female") %>%
  group_by(Purchase.History) %>%
  summarise(count = n()) %>%
  arrange(desc(count)) # Ordenar de mayor a menor uso
print(productos_f)
## # A tibble: 3 × 2
##   Purchase.History count
##   <fct>            <int>
## 1 Electronics        429
## 2 Books              410
## 3 Clothing           401
ggplot(productos_f, aes(x = Purchase.History, y = count, fill = Purchase.History)) +
  geom_bar(stat = "identity") +
  labs(title = "Productos que más compra el género femenino",
       x = "Historial de productos",
       y = "Número de Usuarios") +
  theme_minimal()

Productos que más consume el género Masculino

productos_m <- amazon %>%
  filter(Gender == "Male") %>%
  group_by(Purchase.History) %>%
  summarise(count = n()) %>%
  arrange(desc(count)) # Ordenar de mayor a menor uso
print(productos_m)
## # A tibble: 3 × 2
##   Purchase.History count
##   <fct>            <int>
## 1 Books              441
## 2 Electronics        418
## 3 Clothing           401
ggplot(productos_m, aes(x = Purchase.History, y = count, fill = Purchase.History)) +
  geom_bar(stat = "identity") +
  labs(title = "Productos que más compra el género Masculino",
       x = "Historial de productos",
       y = "Número de Usuarios") +
  theme_minimal()

#Resumen

print(genero_uso)
## # A tibble: 2 × 2
##   Gender count
##   <fct>  <int>
## 1 Male    1260
## 2 Female  1240
print(masculino_uso)
## # A tibble: 3 × 2
##   Usage.Frequency count
##   <fct>           <int>
## 1 Regular           424
## 2 Frequent          423
## 3 Occasional        413
print(femenino_uso)
## # A tibble: 3 × 2
##   Usage.Frequency count
##   <fct>           <int>
## 1 Frequent          428
## 2 Occasional        409
## 3 Regular           403
print(productos_f)
## # A tibble: 3 × 2
##   Purchase.History count
##   <fct>            <int>
## 1 Electronics        429
## 2 Books              410
## 3 Clothing           401
print(productos_m)
## # A tibble: 3 × 2
##   Purchase.History count
##   <fct>            <int>
## 1 Books              441
## 2 Electronics        418
## 3 Clothing           401

Podemos comprobar que mi hipótesis resulto se invalida pues el género que menos tiempo pasa en Amazon es el género femenino sin embargo este resulta que es más susceptible a usar en donde los productos que más compra son electrónicos y el menos compra es ropa. Por otro lado, el género masculino compra más libros y menos ropa. Por lo que en pocas palabra Amazon debería de ver por qué en ambos géneros la ropa es el producto que menos compra y en caso de hacer de hacer una encuesta de satisfacción por más atención en el género masculino pues a pesar que el que más lo y el quien menos lo frecuenta.

Modelo de regreción simple

hipótesis

Ho: No hay una relación significativa entre las calificaciones de usuarios

Ha: Existe una relación significativa entre las calificaciones de usuarios

# Declarando mis variable
x <- base_amazon$Customer.Support.Interactions
y <- base_amazon$Feedback.Ratings

#correlación 
cor(x, y)
## [1] 0.008025796
# Ajustando el modelo de regresíón 
modelo <- lm(Customer.Support.Interactions ~ Feedback.Ratings , data = base_amazon)
summary(modelo)
## 
## Call:
## lm(formula = Customer.Support.Interactions ~ Feedback.Ratings, 
##     data = base_amazon)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -4.9955 -2.9382  0.0376  3.0266  5.0927 
## 
## Coefficients:
##                  Estimate Std. Error t value Pr(>|t|)    
## (Intercept)       4.77497    0.44492  10.732   <2e-16 ***
## Feedback.Ratings  0.04411    0.10995   0.401    0.688    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 3.192 on 2498 degrees of freedom
## Multiple R-squared:  6.441e-05,  Adjusted R-squared:  -0.0003359 
## F-statistic: 0.1609 on 1 and 2498 DF,  p-value: 0.6883

Conclusión

Este modelo de regresión lineal simple sugiere que no hay una relación estadísticamente significativa entre las calificaciones de los usuarios (Feedback.Ratings) y las interacciones de atención al cliente (Customer.Support.Interactions). Los valores de R-cuadrado muy bajos y el valor p alto para el coeficiente de Feedback.Ratings apoyan esta conclusión