Utilizando las funciones citadas en este Laboratorio, comprobad qué paquetes tenéis instalados en vuestra versión de RStudio e instalad el paquete MASS y el paquete Survival y comprobad la información que contienen. Buscad información sobre el paquete Rcmdr (R Commander) desde la consola.
library()
#install.packages(c("MASS","Survival"))
#packageDescription("MASS")
#??Rcmdr
#Importamos la libreria y creamos el dataset1, importando el archivo de texto con read_delim y usando delim \t para indicar que las separaciones en blanco es lo que marca las distintas variables dentro del archivo.
library(readr)
dataset1 <- read_delim("C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_texto.txt", delim = "\t",show_col_types = FALSE)
View(dataset1)
summary(dataset1)
## ID Peso Altura Edad Sistolica
## Min. :1.0 Min. :60.00 Min. :165.0 Min. :22.00 Min. :105.0
## 1st Qu.:2.5 1st Qu.:67.50 1st Qu.:169.0 1st Qu.:26.50 1st Qu.:114.0
## Median :4.0 Median :72.00 Median :175.0 Median :30.00 Median :120.0
## Mean :4.0 Mean :74.57 Mean :174.7 Mean :31.57 Mean :122.6
## 3rd Qu.:5.5 3rd Qu.:82.50 3rd Qu.:180.0 3rd Qu.:35.50 3rd Qu.:132.5
## Max. :7.0 Max. :90.00 Max. :185.0 Max. :45.00 Max. :140.0
## Diastolica
## Min. :68.00
## 1st Qu.:74.00
## Median :80.00
## Mean :79.86
## 3rd Qu.:86.50
## Max. :90.00
#Importamos el dataset2 desde el archivo .csv , en este caso no hay que especificar la separacion.
dataset2 <- read_csv("C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_csv.csv",show_col_types = FALSE)
View(dataset2)
#Usamos la funcion fivenum(), que nos devuelve un vector de 5 valores(Q1,Q2(mediana),Q3,Min, Max) de las columnas FrecuenciaCardiaca y Tiempo.
fivenum(dataset2$FrecuenciaCardiaca)
## [1] 145.0 152.5 158.0 162.5 170.0
fivenum(dataset2$Tiempo)
## [1] 33.50 36.55 38.70 39.95 42.30
A partir del conjunto de datos anorexia del paquete MASS, que corresponden a los datos de cambio de peso de pacientes jóvenes con anorexia, mostrad los tipos de datos que contiene y comprobad si existen valores NA y NULL. Para la variable Treat, transformad los valores «CBT», «Cont» y «FT» en «Cogn Beh Tr», «Contr» y «Fam Tr», respectivamente.
#Cargamos paquete y el data frame.
library("MASS")
library("dplyr")
##
## Adjuntando el paquete: 'dplyr'
## The following object is masked from 'package:MASS':
##
## select
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
data("anorexia")
#Lo visualizamos
View(anorexia)
#Mostramos numero de observaciones y variables.
dim(anorexia)
## [1] 72 3
#Mostramos las variables y algunas observaciones.
str(anorexia)
## 'data.frame': 72 obs. of 3 variables:
## $ Treat : Factor w/ 3 levels "CBT","Cont","FT": 2 2 2 2 2 2 2 2 2 2 ...
## $ Prewt : num 80.7 89.4 91.8 74 78.1 88.3 87.3 75.1 80.6 78.4 ...
## $ Postwt: num 80.2 80.1 86.4 86.3 76.1 78.1 75.1 86.7 73.5 84.6 ...
#Comprobamos que no hay NA ni NULL
any(is.na(anorexia))
## [1] FALSE
sapply(anorexia,is.null)
## Treat Prewt Postwt
## FALSE FALSE FALSE
#Renombramos los valores CBT, Cont y FT de la columna Treat para hacerlos más descriptivos.Accedemos a los valores y los cambiamos.Usamos la libreria dplyr y su funcion recode().
anorexia <- anorexia %>%
mutate(Treat = recode(Treat,
"CBT" = "Cogn Beh Tr",
"Cont" = "Contr",
"FT" = "Fam Tr"))
#cargamos la libreria, el paquete de datos y creamos el archivo .csv
library(MASS)
library(openxlsx)
data("biopsy")
write.csv(biopsy, file="C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_biopsy.csv")
#Exportamos a 3 formatos diferentes.
data("Melanoma")
write.table(Melanoma, file="C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_Melanoma.txt", sep =" ")
write.csv(Melanoma, file="C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_Melanoma.csv")
write.xlsx(Melanoma, file="C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/datos_texto.xlsx")
#Generamos el summary de age y lo asignamos a una variable.
resumen = summary(Melanoma$age)
capture.output(resumen, file="resumenAge.doc")
#Importamos el dataframe descargado y lo mostramos en consola.
library(readr)
dataESP <- read_delim("C:/Users/PC/Desktop/Bioinformatica/2_Software para el analisis de datos/PEC 1/PEC_1_R/Archivos_de_Datos/ESPbirth.txt", delim = ",",show_col_types = FALSE)
View(dataESP)
En el siguiente ejemplo veremos cómo utilizar diferentes operadores sobre el conjunto de datos birthwt, así como también algunas funciones que nos permiten obtener más información de las variables: a) ¿Cuál es la edad máxima de las madres del conjunto de datos? -45 años. b) ¿Cuál es la edad mínima de las madres del conjunto de datos? -14 años. c) ¿Cuál es el rango de edad de las madres? -De 19-45 años. d) ¿Fumaba la madre cuyo recién nacido era el de menor peso? -Si. e) ¿Cuánto pesó el recién nacido cuya madre tenía la edad máxima? -4990g. f) Listad los pesos de los recién nacidos, cuyas madres visitarán menos de dos veces al médico durante el primer trimestre.
library(MASS)
data("birthwt")
View(birthwt)
summary(birthwt)
## low age lwt race
## Min. :0.0000 Min. :14.00 Min. : 80.0 Min. :1.000
## 1st Qu.:0.0000 1st Qu.:19.00 1st Qu.:110.0 1st Qu.:1.000
## Median :0.0000 Median :23.00 Median :121.0 Median :1.000
## Mean :0.3122 Mean :23.24 Mean :129.8 Mean :1.847
## 3rd Qu.:1.0000 3rd Qu.:26.00 3rd Qu.:140.0 3rd Qu.:3.000
## Max. :1.0000 Max. :45.00 Max. :250.0 Max. :3.000
## smoke ptl ht ui
## Min. :0.0000 Min. :0.0000 Min. :0.00000 Min. :0.0000
## 1st Qu.:0.0000 1st Qu.:0.0000 1st Qu.:0.00000 1st Qu.:0.0000
## Median :0.0000 Median :0.0000 Median :0.00000 Median :0.0000
## Mean :0.3915 Mean :0.1958 Mean :0.06349 Mean :0.1481
## 3rd Qu.:1.0000 3rd Qu.:0.0000 3rd Qu.:0.00000 3rd Qu.:0.0000
## Max. :1.0000 Max. :3.0000 Max. :1.00000 Max. :1.0000
## ftv bwt
## Min. :0.0000 Min. : 709
## 1st Qu.:0.0000 1st Qu.:2414
## Median :0.0000 Median :2977
## Mean :0.7937 Mean :2945
## 3rd Qu.:1.0000 3rd Qu.:3487
## Max. :6.0000 Max. :4990
max(birthwt$age) # edad máxima
## [1] 45
min(birthwt$age) # edad mínima
## [1] 14
range(birthwt$age) # rango (mínimo y máximo)
## [1] 14 45
#Apartado D
apartadoD <- subset(birthwt, bwt == min(birthwt$bwt))
apartadoD$smoke
## [1] 1
#Apartado E
apartadoE <- subset(birthwt, age == max(birthwt$age))
apartadoE$bwt
## [1] 4990
#Apartado F
apartadoF <- subset(birthwt, ftv <= 2, select = bwt)
apartadoF$bwt
## [1] 2523 2557 2594 2600 2622 2637 2637 2663 2665 2722 2733 2751 2750 2769 2769
## [16] 2778 2807 2821 2835 2836 2863 2877 2877 2906 2920 2920 2920 2920 2948 2948
## [31] 2977 2977 2977 2977 2922 3005 3033 3042 3062 3062 3062 3062 3062 3090 3090
## [46] 3090 3100 3104 3132 3147 3175 3175 3203 3203 3203 3225 3225 3232 3232 3234
## [61] 3260 3274 3274 3317 3317 3317 3321 3331 3374 3374 3402 3416 3444 3459 3460
## [76] 3473 3544 3487 3544 3572 3572 3586 3600 3614 3614 3629 3629 3637 3643 3651
## [91] 3651 3651 3651 3699 3728 3756 3770 3770 3770 3790 3799 3827 3856 3860 3884
## [106] 3884 3912 3940 3941 3941 3969 3983 3997 3997 4054 4054 4111 4153 4167 4174
## [121] 4238 4593 4990 709 1021 1135 1330 1474 1588 1588 1701 1729 1790 1818 1885
## [136] 1893 1899 1928 1928 1928 1936 1970 2055 2055 2082 2084 2084 2100 2125 2187
## [151] 2187 2211 2225 2240 2240 2282 2296 2296 2325 2353 2353 2367 2381 2381 2381
## [166] 2410 2410 2410 2424 2438 2442 2466 2466 2466 2495 2495 2495
A partir del conjunto de datos anorexia trabajado en apartados anteriores, cread una matriz que tenga como columnas los valores de Prewt y Postwt, y cada fila sean los valores correspondientes para cada posición.
#Cargamos libreria y conjunto de datos anorexia.
library("MASS")
data("anorexia")
View(anorexia)
#Creamos la matriz y la visualizamos.
nuevaMatrix <- matrix(c(anorexia$Prewt,anorexia$Postwt),ncol=2)
View(nuevaMatrix)
Copia el código siguiente en tu consola para generar un data frame con veinticinco registros y seis variables, y responde a los siguientes apartados: a) Seleccionad los registros con edad > 22. b) Seleccionad el elemento 3 de la columna 4 del conjunto de datos (contando el identificador). c) Usad el comando subset() para seleccionar todas las filas que tienen una edad menor que 27 años y sin incluir la columna Alt.
Identificador <-
c("I1","I2","I3","I4","I5","I6","I7","I8","I9","I10","I11","I12","I13","I14",
"I15","I16","I17","I18","I19","I20","I21","I22","I23","I24","I25")
Edad <-
c(23,24,21,22,23,25,26,24,21,22,23,25,26,24,22,21,25,26,24,21,25,27,26,22,29)
Sexo <-c(1,2,1,1,1,2,2,2,1,2,1,2,2,2,1,1,1,2,2,2,1,2,1,1,2) #1 para mujeres y 2 para hombres
Peso <-
c(76.5,81.2,79.3,59.5,67.3,78.6,67.9,100.2,97.8,56.4,65.4,67.5,87.4,99.7,87.6
,93.4,65.4,73.7,85.1,61.2,54.8,103.4,65.8,71.7,85.0)
Alt <-
c(165,154,178,165,164,175,182,165,178,165,158,183,184,164,189,167,182,179,165
,158,183,184,189,166,175) #altura en cm
Fuma <-
c("SÍ","NO","SÍ","SÍ","NO","NO","NO","SÍ","SÍ","SÍ","NO","NO","SÍ","SÍ","SÍ",
"SÍ","NO","NO","SÍ","SÍ","SÍ","NO","SÍ","NO","SÍ")
Trat_Pulmon <- data.frame(Identificador,Edad,Sexo,Peso,Alt,Fuma)
View(Trat_Pulmon)
#Apartado A
apartadoA <- subset(Trat_Pulmon, Edad >22)
apartadoA
#Apartado B
apartadoB <- Trat_Pulmon[3,4]
apartadoB
## [1] 79.3
#Apartado C
apartadoC <- subset(Trat_Pulmon, Edad <27, select = -c(Alt))
apartadoC
Incorporad el dataset ChickWeight que contiene información sobre el peso de 578 pollitos en gramos (weight), el tiempo desde la medición al nacer (Time), una variable identificadora de cada pollito (Chick) a partir del rango de peso y una variable factor con el tipo de dieta experimental que cada pollito recibió (Diet). a) Incorporad el conjunto de datos ChickWeight del paquete datasets a vuestro entorno de trabajo. b) Generad un gráfico de dispersión de la variable weight. c) Cread un diagrama de caja con la variable Time. Para más información sobre ChickWeight: https://rdrr.io/r/datasets/ChickWeight.html
#Apartado A
library("MASS")
data("ChickWeight")
head(ChickWeight)
#Apartado B
plot(ChickWeight$weight, col=blues9, main="Gráfico Weight")
#Apartado C
boxplot(ChickWeight$Time, col="yellow", main="Diagrama cajas")
A partir del conjunto de datos anorexia del paquete MASS, cread otro data frame que se llame anorexia_treat_df formado por Treat y por un vector nuevo calculado a partir de la diferencia Prewt-Postwt. De esta manera, nos quedará un data frame que contenga el tipo de tratamiento y el valor del peso ganado o perdido después de haber realizado el tratamiento. Seleccionad aquellos individuos que han ganado peso después del tratamiento y cread un nuevo conjunto llamado anorexia_treat_C_df que contenga solo los datos de aquellos que han seguido el tratamiento «Cont» y que han ganado peso después del tratamiento.
#Cargamos anorexia
library("MASS")
data("anorexia")
#Creamos nuevo DF con la resta de las 2 columnas y luego creamos nuevo DF con la columna Treat y el DF anteriormente creado.
anorexiaWD <- c(anorexia$Postwt - anorexia$Prewt)
anorexia_treat_df <- data.frame(Treat = anorexia$Treat, WeightDiff = anorexiaWD)
View(anorexia_treat_df)
#Ahora seleccionamos solo los individuos que han realizado el tto COnt y que su valor de Weight Difference es positivo.
anorexia_treat_c <- subset(anorexia_treat_df, WeightDiff > 0 & Treat == "Cont")
View(anorexia_treat_c)
Entrad en RPubs y registraros. Crearos un perfil y subid un documento R Markdown. Los prerequisitos son tener instalado R y RStudio (v0.96.230 o más), y el paquete knitr (v0.5 o más). Pasos que tenéis que seguir para publicar vuestro documento: 1) En RStudio, cread un documento R Markdown. 2) Generad el documento con Knit. 3) En la ventana de previsualización, clicad el botón de publicar. Como solución de vuestro ejercicio, copiad el enlace de vuestra página de prueba de RPubs.