library(readxl)
## Warning: package 'readxl' was built under R version 4.3.3
library(dplyr)
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(ggplot2)
## Warning: package 'ggplot2' was built under R version 4.3.3
data <- read_excel("C:/Users/mcast/Downloads/IMDB_Top250_Tvshows.xlsx")
head(data)
## # A tibble: 6 × 7
## Titile Year Total_episodes Age Rating Vote_count Category
## <chr> <chr> <chr> <chr> <chr> <chr> <chr>
## 1 1. Breaking Bad 2008ñ2013 62 eps 18 9.5 (2.2M) TV Series
## 2 2. Planet Earth II 2016 6 eps PG 9.5 (159K) TV Mini …
## 3 3. Planet Earth 2006 11 eps PG 9.4 (221K) TV Mini …
## 4 4. Band of Brothers 2001 10 eps 15 9.4 (533K) TV Mini …
## 5 5. Chernobyl 2019 5 eps 15 9.3 (876K) TV Mini …
## 6 6. The Wire 2002ñ2008 60 eps 18 9.3 (381K) TV Series
data <- data %>% slice(1:100)
data<- data %>%
mutate(Rating = as.numeric(Rating),
Year = as.factor(Year))
data_subset <- na.omit(data)
ggplot(data_subset, aes(x = Year, y = Rating)) +
geom_jitter(width = 0.2, height = 0, alpha = 0.5) +
theme(axis.text.x = element_text(angle = 90, hjust = 1)) +
labs(title = "Dispersion de Rating por Año", x = "Año", y = "Rating")
Observando el gráfico, se puede ver que los ratings están dispersos a lo largo de los años sin una tendencia clara de aumento o disminución consistente. Los puntos se agrupan en ciertos rangos de ratings, con varios años teniendo múltiples ratings alrededor de 9.0.
ggplot(data, aes(x = as.numeric(as.character(Year)), y = Rating)) +
stat_summary(fun = mean, geom = "line", color = "blue") +
labs(title = "Tendencia de Rating por Año", x = "Año", y = "Rating Medio") +
theme_minimal()
## Warning in FUN(X[[i]], ...): NAs introducidos por coerción
## Warning: Removed 75 rows containing non-finite outside the scale range
## (`stat_summary()`).
El gráfico de tendencia de rating por año muestra que los ratings medios han experimentado fluctuaciones significativas a lo largo de los años, con varios picos y valles. Los picos en 1980, 2000 y 2015 indican años de alta calificación, mientras que los valles en 1985 y 2023 sugieren años de menor calificación
results <- aov(Rating ~ Year, data = data)
summary(results)
## Df Sum Sq Mean Sq F value Pr(>F)
## Year 84 3.236 0.03853 0.696 0.85
## Residuals 15 0.830 0.05533
Dado que el valor p (0.85) es mucho mayor que el nivel de significancia de 0.05, no tenemos suficiente evidencia para rechazar la hipótesis nula. Esto significa que no hay diferencias significativas en las calificaciones promedio (Rating) entre los diferentes años en los primeros 100 registros del conjunto de datos.
ggplot(data, aes(x = Year, y = Rating)) +
geom_boxplot() +
theme(axis.text.x = element_text(angle = 90, hjust = 1)) +
labs(title = "ANOVA de Rating por Año", x = "Año", y = "Rating")
Observando el gráfico, se puede ver que los ratings han variado a lo largo de los años sin una tendencia clara de aumento o disminución consistente. Los ratings más altos parecen concentrarse en ciertos años específicos.
Hay varios outliers (puntos fuera de los bigotes) a lo largo de los años, lo que sugiere que en ciertos años hubo algunos ratings que se desviaron significativamente del resto. Por ejemplo, en 2017 y 2021 hay outliers notables por encima de la mayoría de los datos.