Para esta análise foram utilizados dados das séries 13 Reasons Why e Sherlock, coletados do IMDB.

episodes = read_csv(here("data/series_from_imdb.csv"), 
                    progress = FALSE,
                    col_types = cols(.default = col_double(), 
                                     series_name = col_character(), 
                                     episode = col_character(), 
                                     url = col_character(),
                                     season = col_character()))
myseries = episodes %>% filter(series_name %in% c("13 Reasons Why", "Sherlock"))

2a. Qual das séries que você escolheu é mais bem avaliada no IMDB? A diferença é grande? Pequena? Muda de acordo com as temporadas da série?

Através do box-plot abaixo, observamos que a mediana das avaliações dos usuários é maior para a série Sherlock do que para 13 Reasons Why, logo, Sherlock foi melhor avaliada. A mediana expressa o valor central dos dados.

Os valores encontrados para a mediana de 13 Reasons Why e Sherlock são 8.5 e 9, respectivamente. Sendo assim, a diferença entre a avaliação das séries pelos usuários não é tão grande.

myseries %>% 
    ggplot(aes(x = series_name, y = user_rating)) + 
    geom_boxplot(width = .5) +   
    geom_jitter(width = .1, size = 2, alpha = .5, color = myseries$season)

Podemos observar também que os pontos, que representam os episódios, estão mais espalhados (dispersos) em Sherlock. Isso implica numa maior variação das notas. As diferentes cores nas observações representam a temporada ao qual o episódio pertence.

Para melhor visualizar se a avaliação das séries muda de acordo com a temporada e a discrepância das notas, utilizamos um gráfico de linhas e outro box-plot.

myseries %>% 
    ggplot(aes(x = series_ep, y = user_rating, color = series_name, shape = season)) + 
  geom_line() + 
  geom_point() 

O gráfico acima confirma que existe uma grande discrepância na notas da série Sherlock de um episódio para outro em todas as temporadas. Já em 13 Reasons Why, que possui uma única temporada, a diferença entre as notas foi menor.

Por fim, o box-plot abaixo mostra com maior clareza a diferença das notas da série Sherlock ao longo das temporadas. Nele é possível ver que a segunda temporada apresentou o melhor desempenho e que a última temporada da série teve a pior avaliação.

myseries2 = episodes %>% filter(series_name %in% c("Sherlock"))
myseries2 %>% 
    ggplot(aes(x = season, y = user_rating)) + 
    geom_boxplot(width = .5) +   
    geom_jitter(width = .1, size = 2, alpha = .5, color = myseries2$season)

2b. Qual das séries que você escolheu tem episódios de qualidade mais irregular segundo o IMDB? A diferença é grande? Pequena?

Como já foi observado nos gráficos acima e podemos confirmar no gráfico abaixo, a dispersão das notas dos episódios é bem maior em Sherlock, logo, ela apresenta uma maior irregularidade nas notas. A maior nota ultrapassa 9,5, enquanto a menor fica abaixo de 8.

myseries %>% 
    ggplot(aes(x = series_name, y = user_rating, color = user_rating)) + 
    geom_jitter(width = .05) +
    ylim(7, 10) + 
    labs(x = "Série", y = "Avaliação no IMDB")