A manipulação de dados refere-se ao processo de limpar, transformar e reformular dados brutos para torná-los mais adequados para análise. Esse processo é fundamental para garantir que os dados estejam organizados de maneira correta antes de qualquer tipo de modelagem estatística.
Para realizar manipulação de dados no R de maneira eficiente,
usaremos o pacote tidyverse, que oferece um conjunto de
ferramentas poderosas para transformar dados.
install.packages("tidyverse") # Instalar o pacote
library(tidyverse) # Carregar o pacote
<- ou
=)O operador de atribuição é usado para criar variáveis e armazenar
valores dentro delas. Podemos usar <- ou =,
mas o mais recomendado no R é o operador <-.
# Criando um objeto e atribuindo um valor a ele
objeto_nome <- valor
objeto_nome → Nome do objeto que será criado (utilize nomes descritivos para facilitar a leitura do código).
<- → Operador de atribuição. O
valor localizado à direita será atribuído ao objeto localizado à
esquerda.
valor → Pode ser um número, texto, vetor, lista, matriz ou qualquer outro objeto do R.
# Criando um novo objeto 'm.acm' e atribuindo a ele a lista 'acm' do objeto 'ma'
m.acm <- ma$acm
Esse código extrai a planilha acm do objeto ma e a armazena em um novo objeto chamado m.acm, permitindo que ela seja manipulada de forma independente.
📌 (Inserir imagem mostrando o ambiente do RStudio após a
criação do objeto m.acm.)
[])O operador [] é utilizado para selecionar elementos
específicos de um vetor, matriz ou data frame.
ma$acm["Author"]
O comando acima seleciona a coluna Author do objeto ma$acm, retornando todos os valores dessa variável.
📌 (Inserir imagem mostrando a saída no console do RStudio.)
())Os parênteses () são utilizados para chamar funções e
passar argumentos para elas.
library(tidyverse)
Nesse exemplo, a função library() recebe como argumento
o pacote tidyverse, carregando-o para utilização durante a
sessão do R.
%>%)O operador %>% permite encadear múltiplas operações
de maneira clara e intuitiva, evitando a criação de diversos objetos
intermediários.
💡 Pense no %>% como “e então”.
m.acm <- metabin(
event.e,
n.e,
event.c,
n.c,
data = ma$acm,
method = "MH",
method.tau = "DL",
sm = "RR",
studlab = Author
) %>% forest()
O comando metabin() realiza uma metanálise para dados
binários.
O operador %>% envia automaticamente o resultado da
metanálise para a função forest(), responsável pela
construção do Forest Plot.
Dessa forma, não há necessidade de criar um objeto intermediário contendo o resultado da metanálise antes de gerar o gráfico.
Dataset: termo genérico utilizado para qualquer estrutura de dados do R, como vetores, listas, matrizes e data frames.
Data Frame: estrutura bidimensional composta por linhas (observações) e colunas (variáveis), sendo o formato mais utilizado em análises estatísticas.
Muitos pacotes do R exigem que os dados estejam no formato data frame para que suas funções funcionem corretamente.
# Convertendo um objeto para data frame
m.acm <- as.data.frame(m.acm)
O R não reconhece automaticamente os nomes das variáveis. Para acessá-las, é necessário indicar o objeto ao qual pertencem.
📌 (Inserir imagem mostrando o objeto ma$acm no
RStudio.)
Tentar utilizar uma variável sem informar o objeto de origem.
Author
Esse comando retornará um erro, pois o R não sabe onde procurar a variável Author.
📌 (Inserir imagem mostrando a mensagem de erro no console do RStudio.) ## 1. Selecionando uma única variável
Existem diferentes maneiras de selecionar uma variável específica de um conjunto de dados.
$ma$acm$Author # Seleciona a variável "Author"
ma$acm$Year # Seleciona a variável "Year"
O operador $ permite acessar diretamente uma variável
pertencente a um data frame.
📌 (Inserir imagem do console do RStudio mostrando os valores das variáveis selecionadas.)
[]Também é possível selecionar uma única variável utilizando colchetes.
ma$acm["Author"]
ma$acm["Year"]
Essa abordagem retorna a variável mantendo-a como um data frame.
Também podemos selecionar apenas algumas linhas de uma variável.
ma$acm[1:5, "Author"] # Seleciona as linhas 1 a 5 da coluna "Author"
ma$acm[3:8, "Year"] # Seleciona as linhas 3 a 8 da coluna "Year"
Nesse caso:
1:5 indica as linhas que serão selecionadas;"Author" indica a coluna desejada.📌 (Inserir imagem mostrando a saída no console do RStudio.)
Também é possível selecionar várias colunas simultaneamente.
c()ma$acm[c("Author", "Year")]
A função c() cria um vetor contendo os nomes das colunas
que desejamos selecionar.
📌 (Inserir imagem mostrando os resultados no console do RStudio.)
%>%)Outra forma bastante utilizada consiste em utilizar a função
select() juntamente com o operador Pipe.
ma$acm %>%
select(Author, Year, follow_up)
Esse método costuma ser mais intuitivo e é amplamente utilizado pelos pacotes do tidyverse.
📌 (Inserir imagem mostrando os dados filtrados no RStudio.)
Também podemos selecionar simultaneamente linhas e colunas.
ma$acm[1:5, c("Author", "Year", "follow_up")]
Nesse exemplo:
1:5 seleciona as cinco primeiras linhas;c("Author", "Year", "follow_up") seleciona as três
colunas desejadas.📌 (Inserir imagem mostrando os dados filtrados com seleção simultânea de linhas e colunas.)
Ao final deste capítulo, aprendemos os principais conceitos relacionados à manipulação de dados no R.
Em resumo:
Instalamos e carregamos o pacote tidyverse;
Aprendemos a utilizar os principais operadores do R, como
<-, [], $ e
%>%;
Convertimos objetos para o formato data frame quando necessário;
Selecionamos variáveis, linhas e colunas de diferentes maneiras para facilitar a manipulação dos dados.
Esses conceitos serão fundamentais para os próximos capítulos, nos quais começaremos a preparar os conjuntos de dados para a realização das metanálises.