Nesta seção, utilizamos o conjunto de dados nativo do R,
iris, que contém medidas morfológicas de três espécies de
flores. O objetivo desta etapa é realizar uma manipulação exploratória
básica utilizando o pacote dplyr.
data("iris")
iris_modificado <- iris %>%
mutate(Petal.Area = Petal.Length * Petal.Width) %>%
filter(Species %in% c("versicolor", "virginica") & Petal.Area > 5) %>%
arrange(desc(Petal.Area)) %>%
select(Species, Sepal.Length, Petal.Length, Petal.Width, Petal.Area)
head(iris_modificado)
## Species Sepal.Length Petal.Length Petal.Width Petal.Area
## 1 virginica 7.7 6.9 2.3 15.87
## 2 virginica 7.2 6.1 2.5 15.25
## 3 virginica 6.3 6.0 2.5 15.00
## 4 virginica 7.7 6.7 2.2 14.74
## 5 virginica 6.7 5.7 2.5 14.25
## 6 virginica 7.7 6.1 2.3 14.03
Detalhamento dos Resultados e Passos:
mutate(): Adicionou uma nova coluna
chamada Petal.Area, calculada multiplicando o comprimento
pela largura da pétala. Isso ajuda a extrair uma nova feature
com base nos dados originais.filter(): Reduziu o conjunto de dados
para focar apenas nas espécies versicolor e virginica
que possuem uma área de pétala maior que 5, eliminando as flores menores
(como a setosa).arrange(): Ordenou o conjunto de dados
de forma decrescente (do maior para o menor) com base na área da pétala
calculada, permitindo identificar rapidamente os maiores espécimes na
nossa filtragem.select(): Manteve apenas as colunas
relevantes para a análise final, descartando variáveis que não são de
interesse no momento.Abaixo, apresentamos o conjunto de dados modificado utilizando a
biblioteca DT. Esta tabela permite ao usuário buscar por
valores específicos, ordenar colunas clicando em seus cabeçalhos e
navegar pela paginação.
datatable(
iris_modificado,
options = list(
pageLength = 10,
autoWidth = TRUE,
language = list(url = '//cdn.datatables.net/plug-ins/1.10.11/i18n/Portuguese-Brasil.json')
),
caption = "Tabela 1: Flores Versicolor e Virginica com Área de Pétala > 5"
)
Abaixo estão cinco equações fundamentais nos estudos de Inteligência Artificial, Aprendizado de Máquina e Estatística, renderizadas utilizando a sintaxe do LaTeX.
1. Distância de Minkowski (K-Nearest Neighbors - KNN) \[D(X, Y) = \left( \sum_{i=1}^{n} |x_i - y_i|^p \right)^{\frac{1}{p}}\] Significado: Generalização das distâncias Euclidiana (quando \(p=2\)) e Manhattan (quando \(p=1\)). É amplamente utilizada em algoritmos de classificação baseados em instâncias, como o KNN, para calcular a proximidade entre pontos em um espaço n-dimensional.
2. Entropia de Shannon (Árvores de Decisão - ID3) \[H(S) = -\sum_{i=1}^{c} p_i \log_2(p_i)\] Significado: Mede a impureza ou o nível de incerteza em um conjunto de dados \(S\). Em algoritmos de indução de árvores de decisão, é utilizada para calcular o Ganho de Informação, determinando qual atributo divide melhor os dados.
3. Teorema de Bayes (Classificador Naive Bayes) \[P(A|B) = \frac{P(B|A)P(A)}{P(B)}\] Significado: Calcula a probabilidade condicional de um evento \(A\) ocorrer dado que o evento \(B\) ocorreu. No Machine Learning, é a base do classificador Naive Bayes, relacionando a probabilidade de uma classe dada a observação das features.
4. Erro Quadrático Médio (MSE - Avaliação de Modelos) \[\text{MSE} = \frac{1}{n}\sum_{i=1}^{n}(y_i - \hat{y}_i)^2\] Significado: É uma métrica de avaliação usada em modelos de regressão. Ela calcula a média dos quadrados das diferenças entre os valores reais (\(y_i\)) e os valores preditos pelo modelo (\(\hat{y}_i\)), penalizando erros maiores.
5. Função de Ativação Sigmoide \[\sigma(x) = \frac{1}{1 + e^{-x}}\] Significado: Mapeia qualquer valor real \(x\) para um intervalo entre 0 e 1. É amplamente utilizada em regressões logísticas para estimar probabilidades e como função de ativação na camada de saída de redes neurais para tarefas de classificação binária.