Para esta análise foram utilizados dados das séries 13 Reasons Why e Sherlock, coletados do IMDB.

episodes = read_csv(here("data/series_from_imdb.csv"), 
                    progress = FALSE,
                    col_types = cols(.default = col_double(), 
                                     series_name = col_character(), 
                                     episode = col_character(), 
                                     url = col_character(),
                                     season = col_character()))
myseries = episodes %>% filter(series_name %in% c("13 Reasons Why", "Sherlock"))

2a. Qual das séries que você escolheu é mais bem avaliada no IMDB? A diferença é grande? Pequena? Muda de acordo com as temporadas da série?

Através do box-plot abaixo, observamos que a mediana das avaliações dos usuários é maior para a série Sherlock do que para 13 Reasons Why, logo, Sherlock foi melhor avaliada. A mediana expressa o valor central dos dados.

Os valores encontrados para a mediana de 13 Reasons Why e Sherlock são 8.5 e 9, respectivamente. Sendo assim, a diferença entre a avaliação das séries pelos usuários não é tão grande.

myseries %>% 
    ggplot(aes(x = series_name, y = user_rating)) + 
    geom_boxplot(width = .5) +   
    geom_jitter(width = .1, size = 2, alpha = .5, color = myseries$season)

Podemos observar também que os pontos, que representam os episódios, estão mais espalhados (dispersos) em Sherlock. Isso implica numa maior variação das notas. As diferentes cores nas observações representam a temporada ao qual o episódio pertence.

Para melhor visualizar se a avaliação das séries muda de acordo com a temporada, utilizamos, um gráfico de linhas:

myseries %>% 
    ggplot(aes(x = series_ep, y = user_rating, color = series_name, shape = season)) + 
  geom_line() + 
  geom_point() 

Com ele fica mais fácil observar que existe uma grande discrepância na notas da série Sherlock de um episódio para outro, independente da temporada. Já em 13 Reasons Why, que possui uma única temporada, a diferença nas notas foi menor e no geral, aumentou ao decorrer da série.

2b. Qual das séries que você escolheu tem episódios de qualidade mais irregular segundo o IMDB? A diferença é grande? Pequena?

Como já foi observado nos gráficos acima e podemos confirmar no gráfico abaixo, a dispersão das notas dos episódios é bem maior em Sherlock, logo, ela apresenta uma maior irregularidade nas notas.

myseries %>% 
    ggplot(aes(x = series_name, y = user_rating, color = season)) + 
    geom_jitter(width = .05) +
    ylim(6, 10) + 
    labs(x = "Série", y = "Avaliação no IMDB")