Este dashboard apresenta um estudo analítico prático sobre um conjunto de dados do Kaggle contendo registros de 5.000 estudantes. O objetivo é investigar as relações empíricas entre hábitos de estudo, rotina de sono, infraestrutura e o desempenho ou produtividade discente.
Estrutura de Classificação das Variáveis:
| Variável | Classificação Estatística | Papel na Análise |
|---|---|---|
| Gênero | Qualitativa Nominal | Rótulo demográfico (Feminino, Masculino, Outro) |
| Emprego de Meio Período | Qualitativa Nominal | Condição binária extracurricular (Sim / Não) |
| Qualidade da Internet | Qualitativa Ordinal | Gradação de infraestrutura (Ruim, Média, Boa) |
| Nível de Burnout | Qualitativa Ordinal | Faixas de intensidade de esgotamento (Baixo, Mod, Alto) |
| Idade | Quantitativa Discreta | Contagem de anos completos (16 a 25 anos) |
| Saúde Mental | Quantitativa Discreta | Escala inteira de avaliação psicológica (0 a 10) |
| Consumo de Cafeína | Quantitativa Contínua | Medição contínua em miligramas (mg) |
| Horas de Sono / Estudo | Quantitativa Contínua | Grandeza temporal contínua diária |
| Produtividade | Quantitativa Contínua | Pontuação de rendimento final (0 a 100) |
Fonte dos dados: Kaggle - Ultimate Student Productivity Dataset
Alencar Morete é estudante de Análise e Desenvolvimento de Sistemas no Instituto Federal de Rondônia (IFRO - Campus Ji-Paraná).
Entusiasta de ciência de dados, seu foco está em transformar volumes de dados brutos em visualizações dinâmicas e painéis intuitivos. Este projeto integra conceitos teóricos de estatística com a prática de desenvolvimento de software, criando relatórios interativos de alto valor para tomada de decisão.
Este gráfico em barras verticais apresenta a distribuição da variável qualitativa nominal Gênero na amostra dos 5.000 estudantes. Como característica essencial das variáveis nominais, os grupos (Feminino, Masculino e Outro) funcionam puramente como rótulos de classificação demográfica, sem implicar qualquer relação de ordem, superioridade ou hierarquia entre as categorias. A visualização oferece um panorama demográfico cristalino da base de dados, atestando a distribuição percentual de cada grupo na coleta das observações.
O gráfico de setores (pizza) exibe a proporção de alunos que conciliam os estudos com um Emprego de Meio Período (Sim ou Não). Por se tratar de uma variável qualitativa nominal binária, sua função é segregar a amostra em dois grupos mutuamente exclusivos. A representação percentual permite analisar rapidamente o peso dessa atividade extracurricular na rotina dos discentes, um fator indispensável ao contextualizar eventuais dificuldades na administração do tempo de estudo e descanso.
O gráfico ilustra a percepção dos estudantes em relação à Qualidade da Internet, classificada nas categorias ordinais de gradação: Ruim, Média e Boa. Diferente de variáveis nominais, esta representação exige respeito à ordem hierárquica do sinal de internet, demonstrando como a infraestrutura de conexão se distribui entre os alunos. Trata-se de uma variável ordinal de suma importância no contexto educacional moderno, servindo para diagnosticar se problemas de lentidão ou falta de acesso estão atuando como gargalos no rendimento das aulas online e nas horas dedicadas ao autoestudo.
O gráfico exibe a proporção de alunos divididos em três faixas ordinais de intensidade de Burnout: Baixo, Moderado e Alto. Ao converter a pontuação contínua de esgotamento em faixas ordinais, criamos uma estrutura hierárquica clara de gravidade. A visualização evidencia em barras verticais como o estresse e o cansaço extremo progridem entre os discentes, fornecendo indícios sobre o impacto da carga de trabalho acadêmica e a necessidade de apoio e orientação psicológica na instituição.
O gráfico apresenta a distribuição de frequência por Idade dos estudantes da amostra, com 5.000 observações. A idade em anos completos é um exemplo clássico de Variável Quantitativa Discreta, assumindo valores inteiros contáveis (16 a 25 anos). A distribuição exibe um perfil aproximadamente uniforme entre as idades, sem picos expressivos que indiquem concentração etária dominante.
Cada faixa etária concentra cerca de 10% dos estudantes, com as idades de 24 (521), 22 (515) e 20 anos (513) registrando as maiores frequências — diferenças pequenas que reforçam a uniformidade da distribuição. Esse padrão uniforme é indicativo de dados gerados artificialmente no Kaggle, já que populações estudantis reais tendem a apresentar concentração maior em determinadas faixas etárias, especialmente nas idades típicas de ingresso na graduação (18–21 anos).
O gráfico exibe a distribuição da Pontuação de Saúde Mental dos alunos, avaliada em uma escala com valores inteiros discretos de 0 a 10. Por se tratar de uma variável quantitativa discreta baseada em contagem/escala inteira, cada barra ilustra o montante exato de estudantes alocados em cada degrau de bem-estar psicológico. Assim como na idade, observa-se uma dispersão uniforme ao longo de toda a escala, reforçando o perfil sintético da base e permitindo estudar o impacto da saúde mental sobre o foco e o desempenho acadêmico sem viés de concentração.
O gráfico apresenta a Função Densidade de Probabilidade (FDP)
estimada para a variável contínua consumo_cafeina_mg,
construída a partir de 5.000 observações. Variáveis contínuas derivam de
medições e podem assumir infinitos valores reais dentro de um intervalo.
A curva exibe um perfil notavelmente plano e uniforme ao longo de toda a
amplitude de valores (0 mg a 499 mg), indicando que o consumo de cafeína
está distribuído de forma aproximadamente uniforme entre os estudantes
da amostra. A proximidade entre a média (251,5 mg) e a mediana (252,0
mg) reforça a simetria da distribuição. A ausência de picos sugere que
os dados foram gerados artificialmente, o que deve ser considerado em
análises inferenciais, pois torna a variável pouco discriminativa por si
só.
O Gráfico 2 ilustra, por meio de um histograma de 30
classes (bins = 30), a distribuição de frequência da
variável contínua horas_sono. Sendo o tempo uma grandeza
tipicamente contínua, o histograma permite visualizar o agrupamento dos
dados em intervalos reais de tempo. O padrão de repouso diário constitui
um elemento metabólico e cognitivo primordial para a consolidação da
memória e regulação do nível de alerta, servindo como base empírica
valiosa para correlações de saúde e rendimento.
A análise bivariada expressa no Gráfico 3 explora a
correlação entre duas variáveis quantitativas contínuas: o tempo diário
dedicado aos estudos (horas_estudo) e a pontuação de
produtividade (pontuacao_produtividade). A linha de
tendência estimada por regressão linear (method = "lm")
facilita a interpretação da inclinação da relação, evidenciando em que
medida o investimento de tempo em horas contínuas se converte
efetivamente em ganho de rendimento acadêmico na escala de
produtividade.