O dataset Ultimate Student Productivity contém informações sobre 5.000 estudantes de diferentes níveis acadêmicos (Ensino Médio, Graduação e Pós-Graduação). Os dados foram coletados para analisar o impacto de hábitos diários — como horas de estudo, sono, uso de redes sociais, consumo de cafeína e prática de exercícios — sobre o desempenho acadêmico e a produtividade dos estudantes.
O conjunto de dados possui 21 variáveis, classificadas em:
gender) e Emprego de meio período
(part_time_job)academic_level) e Qualidade da internet
(internet_quality)mental_health_score) e Consumo de cafeína
(caffeine_intake_mg)study_hours), Horas de sono (sleep_hours),
Pontuação de produtividade (productivity_score) e Nota no
exame (exam_score)Cada aba deste dashboard apresenta dois gráficos de uma mesma categoria de variável, com suas respectivas explicações estatísticas.
Nome: Tayná
Idade: 20 anos
Período: 5º período — ADS
Campus: IFRO — Ji-Paraná
Este dashboard foi desenvolvido como projeto da disciplina de
Probabilidade e Estatística, com o objetivo de explorar
graficamente diferentes tipos de variáveis estatísticas utilizando a
linguagem R e o pacote flexdashboard.
Os gráficos foram construídos com ggplot2 e os dados
utilizados são públicos, provenientes do dataset Ultimate Student
Productivity.
O que é uma variável qualitativa nominal?
É uma variável cujas categorias não possuem ordem ou
hierarquia entre si. No caso do gênero, as categorias
Feminino, Masculino e Outro são simplesmente
rótulos distintos — não faz sentido dizer que uma categoria é “maior” ou
“melhor” do que outra.
Por que usamos gráfico de pizza (setores)?
O gráfico de setores é ideal para variáveis nominais com poucas
categorias (2 a 5), pois permite visualizar a proporção de cada
grupo em relação ao todo de forma intuitiva. Cada fatia
representa a participação percentual de um gênero no conjunto de
dados.
Interpretação:
O gráfico revela a distribuição de gênero dos 5.000 estudantes. A
presença de três categorias reflete uma coleta de dados inclusiva, que
reconhece identidades além do binário tradicional. Diferenças nas
proporções podem indicar padrões de participação acadêmica por
gênero.
Por que é nominal?
A variável part_time_job registra apenas se o
estudante tem ou não emprego de meio período (Sim / Não).
Trata-se de uma variável binária nominal — as duas categorias não têm
relação de ordem entre si.
Por que usamos gráfico de barras?
O gráfico de barras é a representação mais clara para comparar
frequências absolutas entre categorias nominais. A altura de
cada barra representa o total de estudantes em cada grupo, facilitando a
comparação direta.
Interpretação:
Observar a proporção de estudantes trabalhadores é relevante pois o
emprego de meio período pode impactar diretamente as horas de estudo, o
sono e, consequentemente, o desempenho acadêmico — conexão que pode ser
explorada nas abas seguintes do dashboard.
O que é uma variável qualitativa ordinal?
É uma variável cujas categorias possuem uma ordem natural e
significativa entre si, mas a distância entre elas não é
necessariamente igual nem mensurável numericamente. O nível acadêmico é
um exemplo clássico: Ensino Médio < Graduação <
Pós-Graduação — há uma progressão hierárquica clara.
Por que mantemos a ordem no gráfico?
Ao contrário de variáveis nominais, em variáveis ordinais a
posição das barras importa. Apresentar as categorias na ordem
correta (da menor à maior) facilita a leitura e respeita a natureza
ordinal dos dados. A escala de verde mais claro para mais escuro também
reforça visualmente essa progressão.
Interpretação:
A distribuição entre os três níveis acadêmicos mostra como o dataset
está composto. Diferenças nas proporções podem influenciar padrões de
produtividade, pois estudantes de pós-graduação tendem a ter perfis de
estudo distintos dos do ensino médio.
Por que é ordinal?
A variável internet_quality classifica a conexão em
Ruim, Regular e Boa — há uma ordem
crescente de qualidade. Porém, não sabemos numericamente
“quanto” melhor é Boa em relação a Regular, o que a
diferencia de variáveis quantitativas.
Cores como ferramenta semiótica:
O uso de vermelho (ruim), amarelo (regular) e verde (boa) não é
aleatório — segue uma convenção semântica amplamente reconhecida (como
em semáforos), reforçando a ordem ordinal e tornando a leitura mais
intuitiva.
Interpretação:
A qualidade da internet impacta diretamente o acesso a aulas online.
Estudantes com conexão ruim podem ter desvantagens no aprendizado
remoto, o que torna essa variável relevante para análises de equidade
educacional.
O que é uma variável quantitativa discreta?
É uma variável numérica cujos valores são contáveis e
finitos — ou seja, só assume valores inteiros específicos, sem
frações entre eles. A pontuação de saúde mental varia de 1 a
10 em números inteiros, sendo um exemplo típico de variável
discreta.
Por que usamos gráfico de barras e não
histograma?
O gráfico de barras (com espaços entre as barras) é mais adequado para
variáveis discretas porque cada valor é isolado e
distinto. Um histograma seria mais apropriado para variáveis
contínuas, onde os valores se distribuem em intervalos contínuos.
Interpretação:
A distribuição da saúde mental entre os estudantes revela como esse
fator se distribui na amostra. Se os valores se concentrarem nos
extremos, isso pode indicar polarização no bem-estar dos estudantes; se
concentrados no centro, sugere uma população com saúde mental
moderada.
Por que é discreta?
O consumo de cafeína (caffeine_intake_mg) é registrado em
miligramas inteiras (0, 1, 2, …, 499 mg). Embora o
intervalo de valores seja amplo, cada observação é um número inteiro
contável — característica que define a discretude.
Por que usamos histograma aqui?
Quando uma variável discreta tem muitos valores
possíveis (500 valores distintos, de 0 a 499), agrupá-los em
intervalos (bins) por meio de um histograma é a melhor forma de
visualizar a distribuição geral. A linha tracejada vermelha indica a
média, facilitando a comparação da distribuição em
relação ao valor central.
Interpretação:
Uma distribuição aproximadamente uniforme do consumo de cafeína sugere
que os hábitos variam bastante entre os estudantes. A média e a forma da
distribuição ajudam a entender se há um padrão dominante de consumo na
amostra.
O que é uma variável quantitativa contínua?
É uma variável numérica que pode assumir qualquer valor dentro
de um intervalo, incluindo decimais — não há “saltos” entre os
valores possíveis. As horas de sono variam de 4,0 a 10,0 horas com
qualquer valor fracionário possível (ex: 6,73h), o que caracteriza a
continuidade.
Histograma + Curva de Densidade:
Para variáveis contínuas, o histograma com curva de
densidade é a visualização mais completa: o histograma mostra a
frequência em intervalos, enquanto a curva suaviza a distribuição
revelando seu formato geral (simétrico, assimétrico, bimodal, etc.). As
linhas de média e mediana permitem
avaliar a tendência central.
Interpretação:
A distribuição das horas de sono revela o padrão de descanso dos
estudantes. Quando média e mediana estão próximas, a distribuição tende
a ser simétrica. Se a maioria dos estudantes dorme abaixo de 7–8 horas
(recomendação médica), isso pode ser um fator de risco para a
produtividade e saúde.
Por que é contínua?
Tanto as horas de estudo quanto a nota no exame são variáveis que
assumem valores decimais dentro de intervalos contínuos — horas de
estudo de 0 a ~12h e notas de 1 a ~64 pontos com qualquer valor
fracionário.
Gráfico de Dispersão (Scatterplot):
É a ferramenta ideal para analisar a relação entre duas
variáveis contínuas. Cada ponto representa um estudante. A
linha de regressão linear (vermelha) indica a tendência
geral da relação, e o intervalo sombreado representa o intervalo
de confiança de 95% — quanto mais estreito, mais precisa é a
estimativa.
Interpretação:
A inclinação da reta de regressão indica se há associação positiva (mais
estudo → nota maior) ou negativa entre as variáveis. A dispersão dos
pontos ao redor da reta indica o quão forte é essa relação: pontos muito
espalhados sugerem que outros fatores além das horas de estudo
influenciam a nota. ```