flowchart LR
A["Dado bruto"] --> B["Estatística descritiva"]
B --> C["Visualização"]
C --> D["Caracterização"]
D --> E["Decisão de modelagem"]
style E fill:#12283F,color:#ffffff,stroke:#12283F
Um algoritmo de aprendizado de máquina não “entende” uma tabela de dados — ele opera sobre distribuições: escalas, formas, centros e dispersões. Cada decisão de pré-processamento (normalizar, transformar, codificar) é, na prática, uma resposta a uma pergunta estatística.
flowchart LR
A["Dado bruto"] --> B["Estatística descritiva"]
B --> C["Visualização"]
C --> D["Caracterização"]
D --> E["Decisão de modelagem"]
style E fill:#12283F,color:#ffffff,stroke:#12283F
Os dois grupos têm média aproximadamente igual, mas o Grupo B tem desvio-padrão maior. Essa diferença afeta diretamente algoritmos baseados em distância.
Conexão com ML
Padronização (z-score): subtrai a média e divide pelo desvio-padrão — centraliza em 0, variância 1. Normalização (min-max): reescala para um intervalo fixo, ex. [0,1]. RobustScaler: usa mediana e IQR em vez de média e desvio-padrão — mais adequado quando há outliers.
Duas variáveis podem ter a mesma média e o mesmo desvio-padrão e, ainda assim, formatos diferentes.
Conexão com ML
Quando transformar uma variável: assimetria forte e valores estritamente positivos → transformação logarítmica é o primeiro candidato. Assimetria com zeros ou negativos → família Box-Cox / Yeo-Johnson. O objetivo é estabilizar variância e reduzir a influência da cauda.
Conexão com ML
Multicolinearidade não costuma prejudicar a capacidade preditiva de modelos como Random Forest ou XGBoost, mas ainda compromete a interpretação de importância de variáveis nesses modelos.
Mesmos dados, dois eixos: cortar o eixo y (à direita) faz uma diferença de 4 pontos parecer maior do que é. É importante verificar a escala antes de interpretar um gráfico.
| Variável | Tipo | Resumo recomendado |
|---|---|---|
| Idade | Quantitativa contínua | Média ± desvio-padrão (se simétrica) ou mediana [IQR] |
| Sexo | Qualitativa nominal | Frequência absoluta e relativa (n, %) |
| Estágio da doença | Qualitativa ordinal | Frequência por categoria, respeitando a ordem |
| Tempo de internação | Quantitativa contínua (assimétrica) | Mediana [Q1–Q3] |
| Número de comorbidades | Quantitativa discreta | Mediana [IQR] ou média se distribuição regular |
Esse tipo de tabela, comum em artigos científicos, também serve como ficha técnica inicial de uma base usada para treinar um modelo.
Checklist adicional para ML
Conexão com ML
Identificar o mecanismo por trás dos dados ausentes, antes de escolher a técnica de imputação, evita introduzir um viés sistemático que o modelo aprenderá como se fosse um padrão real.
O padrão de valores ausentes e a presença de outliers influenciam a estratégia de imputação e podem afetar os coeficientes de modelos lineares. Uma regra prática comum para detectar outliers univariados é sinalizar valores além de 1,5×IQR acima de Q3 ou abaixo de Q1 — a mesma regra usada para desenhar os “bigodes” do boxplot.
flowchart LR
A["Dado bruto<br/>base sem tratamento"] --> B["EDA<br/>tipos, posição, dispersão,<br/>forma, gráficos"]
B --> C["Achados<br/>faltantes · outliers ·<br/>escalas · assimetria"]
C --> D["Pré-processamento<br/>imputação · normalização ·<br/>encoding · transformação"]
D --> E["Modelo<br/>treinamento com<br/>dados prontos"]
style B fill:#1B4F7A,color:#ffffff,stroke:#1B4F7A
style D fill:#3A7CB0,color:#ffffff,stroke:#3A7CB0
style E fill:#12283F,color:#ffffff,stroke:#12283F
Cada etapa do pré-processamento é definida a partir dos resultados da EDA.
A estatística descritiva faz parte do processo de construção de um modelo de aprendizado de máquina