Relatório

Manipulação de Dados

Nesta seção, utilizamos o conjunto de dados nativo do R, iris, que contém medidas morfológicas de três espécies de flores. O objetivo desta etapa é realizar uma manipulação exploratória básica utilizando o pacote dplyr.

data("iris")

iris_modificado <- iris %>%
  mutate(Petal.Area = Petal.Length * Petal.Width) %>%
  filter(Species %in% c("versicolor", "virginica") & Petal.Area > 5) %>%
  arrange(desc(Petal.Area)) %>%
  select(Species, Sepal.Length, Petal.Length, Petal.Width, Petal.Area)

head(iris_modificado)
##     Species Sepal.Length Petal.Length Petal.Width Petal.Area
## 1 virginica          7.7          6.9         2.3      15.87
## 2 virginica          7.2          6.1         2.5      15.25
## 3 virginica          6.3          6.0         2.5      15.00
## 4 virginica          7.7          6.7         2.2      14.74
## 5 virginica          6.7          5.7         2.5      14.25
## 6 virginica          7.7          6.1         2.3      14.03

Detalhamento dos Resultados e Passos:

  • mutate(): Adicionou uma nova coluna chamada Petal.Area, calculada multiplicando o comprimento pela largura da pétala. Isso ajuda a extrair uma nova feature com base nos dados originais.
  • filter(): Reduziu o conjunto de dados para focar apenas nas espécies versicolor e virginica que possuem uma área de pétala maior que 5, eliminando as flores menores (como a setosa).
  • arrange(): Ordenou o conjunto de dados de forma decrescente (do maior para o menor) com base na área da pétala calculada, permitindo identificar rapidamente os maiores espécimes na nossa filtragem.
  • select(): Manteve apenas as colunas relevantes para a análise final, descartando variáveis que não são de interesse no momento.

Tabela Interativa

Abaixo, apresentamos o conjunto de dados modificado utilizando a biblioteca DT. Esta tabela permite ao usuário buscar por valores específicos, ordenar colunas clicando em seus cabeçalhos e navegar pela paginação.

datatable(
  iris_modificado, 
  options = list(
    pageLength = 10, 
    autoWidth = TRUE,
    language = list(url = '//cdn.datatables.net/plug-ins/1.10.11/i18n/Portuguese-Brasil.json')
  ),
  caption = "Tabela 1: Flores Versicolor e Virginica com Área de Pétala > 5"
)

Equações Complexas

Abaixo estão cinco equações fundamentais nos estudos de Inteligência Artificial, Aprendizado de Máquina e Estatística, renderizadas utilizando a sintaxe do LaTeX.

1. Distância de Minkowski (K-Nearest Neighbors - KNN) \[D(X, Y) = \left( \sum_{i=1}^{n} |x_i - y_i|^p \right)^{\frac{1}{p}}\] Significado: Generalização das distâncias Euclidiana (quando \(p=2\)) e Manhattan (quando \(p=1\)). É amplamente utilizada em algoritmos de classificação baseados em instâncias, como o KNN, para calcular a proximidade entre pontos em um espaço n-dimensional.

2. Entropia de Shannon (Árvores de Decisão - ID3) \[H(S) = -\sum_{i=1}^{c} p_i \log_2(p_i)\] Significado: Mede a impureza ou o nível de incerteza em um conjunto de dados \(S\). Em algoritmos de indução de árvores de decisão, é utilizada para calcular o Ganho de Informação, determinando qual atributo divide melhor os dados.

3. Teorema de Bayes (Classificador Naive Bayes) \[P(A|B) = \frac{P(B|A)P(A)}{P(B)}\] Significado: Calcula a probabilidade condicional de um evento \(A\) ocorrer dado que o evento \(B\) ocorreu. No Machine Learning, é a base do classificador Naive Bayes, relacionando a probabilidade de uma classe dada a observação das features.

4. Erro Quadrático Médio (MSE - Avaliação de Modelos) \[\text{MSE} = \frac{1}{n}\sum_{i=1}^{n}(y_i - \hat{y}_i)^2\] Significado: É uma métrica de avaliação usada em modelos de regressão. Ela calcula a média dos quadrados das diferenças entre os valores reais (\(y_i\)) e os valores preditos pelo modelo (\(\hat{y}_i\)), penalizando erros maiores.

5. Função de Ativação Sigmoide \[\sigma(x) = \frac{1}{1 + e^{-x}}\] Significado: Mapeia qualquer valor real \(x\) para um intervalo entre 0 e 1. É amplamente utilizada em regressões logísticas para estimar probabilidades e como função de ativação na camada de saída de redes neurais para tarefas de classificação binária.

Referências

  1. Mitchell, T. M. (1997). Machine Learning. McGraw-Hill. (Referência fundamental para os conceitos de Árvores de Decisão, KNN e Naive Bayes).
  2. Wickham, H., & Grolemund, G. (2016). R for Data Science: Import, Tidy, Transform, Visualize, and Model Data. O’Reilly Media.
  3. Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer.
  4. Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
  5. James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning: with Applications in R. Springer.