#Questão
Estamos interessados na relação entre quanto as pessoas de diferentes paÃses comentam em questões dos outros. A proporção das pessoas do paÃs que comentou nas questões de outros está medido na variável comentaram_prop.
Considerando essa variável, queremos examinar a relação entre ela e o quão hierárquicas são as relações em um paÃs (PDI). Queremos também levar em conta o quanto as pessoas daquele paÃs têm acesso à Internet (Internet) e qual o tamanho da base de dados que detectamos daquele paÃs (usuarios).
Faça uma visualização que usa os princÃpios de eficácia no projeto de visualizações para facilitar as comparações que você acha que são as mais importantes para entendermos esse contexto.
ggplot(data = dados) +
geom_point(mapping = aes(x = Internet, y = comentaram_prop))
## Warning: Removed 4 rows containing missing values (`geom_point()`).
dados %>% summarise(
spearman = cor(Internet,comentaram_prop,method ="spearman", use = "complete.obs"),
pearson = cor(Internet,comentaram_prop,method ="pearson", use = "complete.obs"),
kendall = cor(Internet,comentaram_prop, method = "kendall", use = "complete.obs"))
## spearman pearson kendall
## 1 0.5834536 0.5492399 0.4329312
Essa correlação representa que os comentários são maiores onde o acesso a internet também é maior. Isso demonstra uma relação moderada e positiva devido ao citado anteriormente.
ggplot(data = dados) +
geom_point(mapping = aes(x = comentaram_prop, y = PDI))
A partir da observação dos dados referentes ao PDI e os comentários, foi entendido que os comentários seguem a proporção do PDI, quanto menor o primeiro indicar, menor a quantidade de comentários e o contrário também é observado. Através disso, é percebido que existe uma concentração maior na taxa de comentários entre 0.2 e um pouco além de 0.3 e por outro lado, essa concentração representa o valor do PDI entre 50 e 70.
ggplot(data = dados) +
geom_point(mapping = aes(x = comentaram_prop, y = usuarios))
Ambas as variáveis apresentadas são representadas por valores muito
baixo, não sendo possÃvel identificar a correlação entre elas, porém,
são representados outliers em alguns casos, o que cabe uma melhor
análise para identificar os paÃses e entender melhor esses dados fora do
comum, se considerarmos todos os outros dados.
ggplot(data = dados) +
geom_point(mapping = aes(x = Internet, y = comentaram_prop, color = country))
## Warning: Removed 4 rows containing missing values (`geom_point()`).
Os dados são representados por cores e cada cor um paÃs. Devido quantidade enorme de paÃses e escalas de cores utilizadas, sendo que elas possuem diferenças imperceptÃveis, a visualização e a consequente relação dos pontos com paÃses são difÃceis de serem realizadas.
ggplot(na.omit(dados), aes(
x=PDI ,
y=comentaram_prop,
shape = log10(usuarios),
color = Internet)) +
scale_color_gradient(low = "red", high = "orange") +
geom_point(alpha=4) +
labs(title = "comentarios X Internet X PDI X usuarios",
y = "comentarios",
x = "PDI",
shape = "Quantidade usuarios") +
scale_shape_binned()
Apresentar os dados por formas e sem uma variedade compatÃvel a enorme
quantidade de dados, dificulta a visualização e o consequente
entendimentos dos dados
dados %>%
filter(!is.na(six_regions)) %>%
ggplot(aes(
x=PDI ,
y=comentaram_prop,
size = log10(usuarios),
color = Internet)) +
scale_color_gradient(low = "blue", high = "orange") +
geom_point(alpha=6.0) +
facet_wrap(~ six_regions)