datos de amazon.

En este documento trataremos de explorar el dataset de Amazon para entender cómo las interacciones con el soporte al cliente afectan las calificaciones de retroalimentación de los usuarios.

Exporación de datos

Primero cargamos las librerias y datos que vamos a utliizar

datos_amazon <- read.csv("data_set_amazon.csv")
library(ggplot2)

Segundo decidimos explorar los datos y ver qué formatos tienen.

View(datos_amazon)
names(datos_amazon)
##  [1] "User.ID"                       "Name"                         
##  [3] "Email.Address"                 "Username"                     
##  [5] "Date.of.Birth"                 "Gender"                       
##  [7] "Location"                      "Membership.Start.Date"        
##  [9] "Membership.End.Date"           "Subscription.Plan"            
## [11] "Payment.Information"           "Renewal.Status"               
## [13] "Usage.Frequency"               "Purchase.History"             
## [15] "Favorite.Genres"               "Devices.Used"                 
## [17] "Engagement.Metrics"            "Feedback.Ratings"             
## [19] "Customer.Support.Interactions"
# Agrupar y resumir los datos

ggplot(data = datos_amazon, aes (y= Feedback.Ratings)) + 
  geom_boxplot() + facet_grid(~Engagement.Metrics) +
  labs(title = "Correlación entre interacciones con soporte al cliente y calificaciones",
     x = "Interacciones con soporte al cliente",
     y = "Calificaciones de retroalimentación promedio") +
theme_classic()

ggplot(data = datos_amazon, aes (y= Feedback.Ratings)) + 
  geom_boxplot() + facet_grid(~Customer.Support.Interactions) +
  labs(title = "Correlación entre interacciones con soporte al cliente y calificaciones",
     x = "Interacciones con soporte al cliente",
     y = "Calificaciones de retroalimentación promedio") +
theme_classic()

Hipotesis

Se tiene la idea de que las variables de llamamadas por servicio técnico y la participación el la plataforma puede afectar el resultado de los las calificaciones que dan los usuarios.

Contruyendo un modelo

Como tercer paso para construir un modelo, se definen las variables que influirán en la relación entre la cantidad de llamadas por servicio técnico y las calificaciones de los usuarios.

Se va a construir un modelo de regresión lineal simple, donde utilizaremos la variable de llamadas por servicio técnico para explicar la variable de calificaciones de los usuarios.

\(Y = B0 + X1 + e\)

En este caso, nuestra variable 𝑌 es la calificación de los usuarios y la variable 𝑋 son las llamadas por servicio técnico. \(Calificación estimada = B0 + Llamadas*CoefB1 + e\)

Y = datos_amazon$Feedback.Ratings
x = datos_amazon$Customer.Support.Interactions

modelo1 <- lm( data = datos_amazon,
   formula =Feedback.Ratings  ~ Customer.Support.Interactions)

summary(modelo1)
## 
## Call:
## lm(formula = Feedback.Ratings ~ Customer.Support.Interactions, 
##     data = datos_amazon)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.01213 -0.50191 -0.00337  0.49517  1.00247 
## 
## Coefficients:
##                               Estimate Std. Error t value Pr(>|t|)    
## (Intercept)                   3.997528   0.021446 186.396   <2e-16 ***
## Customer.Support.Interactions 0.001460   0.003641   0.401    0.688    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.5809 on 2498 degrees of freedom
## Multiple R-squared:  6.441e-05,  Adjusted R-squared:  -0.0003359 
## F-statistic: 0.1609 on 1 and 2498 DF,  p-value: 0.6883

El valor de R^2 es extremadamente bajo (0.00006441), lo que sugiere que el modelo explica una cantidad insignificante de la variabilidad en las calificaciones de retroalimentación. El coeficiente para la variable “Customer.Support.Interactions” es 0.00146, indicando que por cada interacción adicional con el soporte al cliente, la calificación de retroalimentación aumenta en promedio en 0.00146 unidades. Se puede concluir que, las interacciones con el soporte al cliente no son un buen predictor de las calificaciones de retroalimentación en este conjunto de datos.