Este tutorial ensinará como preparar e importar dados para o R usando o RStudio.
Neste tutorial, usaremos planilhas do Microsoft Excel para armazenar os dados que serão analisados no R.
Nomeie corretamente as colunas da sua planilha. Se os nomes das colunas forem apropriados desde o início, você economizará tempo, pois não precisará transformá-los depois no R.
Use underline (_) em vez de espaços
nos nomes das colunas.
A ordem das colunas na planilha não importa, desde que estejam rotuladas corretamente.
Evite caracteres especiais como ä, ü e ö, pois podem ser distorcidos ao serem importados. Se possível, transforme-os antes da importação.
Se houver linhas ou colunas vazias que antes continham dados, exclua-as completamente para evitar que o R interprete esses espaços como valores ausentes.
Aqui está um exemplo básico de como formatar sua planilha quando estiver lidando com variáveis binárias (exemplo de endpoints).
📌 (Inserir imagem mostrando a estrutura do Excel para endpoints binários.)
Cada desfecho da sua metanálise deve estar em uma planilha separada dentro do mesmo arquivo do Excel.
Exemplo:
📌 (Inserir imagem mostrando um arquivo Excel com as abas “acm” para All-Cause Mortality e “mb” para Major Bleeding.)
Uma vez que seu conjunto de dados no Excel esteja pronto, você deve salvá-lo em uma pasta específica do seu computador. Essa pasta será chamada de Diretório de Trabalho (Working Directory - WD).
O WD é essencial, pois é a pasta onde o R buscará seus arquivos de entrada e salvará seus resultados.
Crie uma pasta no seu computador para armazenar seus dados e resultados da metanálise.
Defina essa pasta como seu diretório de trabalho no RStudio
usando a função setwd().
# Definindo o diretório de trabalho no RStudio
setwd("/Users/SeuUsuario/Desktop/WD_RStudio")
.xlsx) dentro dessa
pasta.Exemplo: Nome do arquivo =
data.xlsx
Agora que seu arquivo Excel está salvo no Diretório de Trabalho, podemos importá-lo para o R.
readxlPara ler arquivos Excel no R, precisamos do pacote
readxl.
# Instalar e carregar o pacote readxl
install.packages("readxl")
library(readxl)
Podemos usar a função excel_sheets() para verificar
todas as abas do nosso arquivo.
# Obtendo os nomes das planilhas dentro do arquivo Excel
sheet_names <- excel_sheets("data.xlsx")
sheet_names
📌 (Inserir imagem mostrando a saída no RStudio com os nomes das planilhas “acm” e “mb”.)
Agora vamos importar todas as planilhas do arquivo
data.xlsx e convertê-las para um formato adequado para
análise no R.
# Importando os dados de todas as planilhas e convertendo para data frames
ma <- lapply(sheet_names, function(x) {
as.data.frame(read_excel("data.xlsx", sheet = x))
})
Esse código cria um objeto chamado ma, que é uma lista contendo todas as planilhas do Excel convertidas para data frames.
Para facilitar o uso, podemos renomear cada elemento da lista com os nomes das planilhas originais.
names(ma) <- sheet_names
Agora podemos visualizar os dados que foram importados para o R.
Para visualizar uma planilha específica, utilize as funções
View() ou head().
View(ma$acm) # Visualizar a aba "acm" (All-Cause Mortality)
View(ma$mb) # Visualizar a aba "mb" (Major Bleeding)
📌 (Inserir imagem mostrando os dados sendo visualizados no RStudio usando View().)
Também podemos visualizar um resumo inicial utilizando a função
head(), que exibe as primeiras linhas do conjunto de
dados.
head(ma$acm)
📌 (Inserir imagem mostrando a saída do comando head() no RStudio.)
str()A função str() fornece um resumo da estrutura do
conjunto de dados, incluindo o número de observações, variáveis e seus
tipos.
str(ma$acm)
📌 (Inserir imagem mostrando a saída do console do RStudio com detalhes sobre as colunas e tipos de dados.)
O objeto acm é um data frame contendo 13 observações e 10 variáveis.
chr indica que a variável contém texto (por exemplo,
Author).
num indica que a variável contém valores numéricos
(por exemplo, Year e event.e).
summary()A função summary() fornece estatísticas descritivas das
variáveis do conjunto de dados.
summary(ma$acm)
📌 (Inserir imagem mostrando a saída do console do RStudio com estatísticas descritivas das variáveis.)
Para variáveis numéricas, a função summary() exibe o
valor mínimo, primeiro quartil, mediana, média, terceiro quartil e valor
máximo.
Para variáveis categóricas, exibe a frequência de ocorrência de cada categoria.