{r setup, include=FALSE} knitr::opts_chunk$set(echo = TRUE)##
1. Introduction This is the Milestone Report for the Coursera Data
Science Capstone Project.
“{r} ## 2. Load the Data Files blogs <- readLines("en_US.blogs.txt", encoding = "UTF-8", skipNul = TRUE) news <- readLines("en_US.news.txt", encoding = "UTF-8", skipNul = TRUE) twitter <- readLines("en_US.twitter.txt", encoding = "UTF-8", skipNul = TRUE) ## 3. Basic Summary Statistics "{r}
file_info <-
file.info(c(”en_US.blogs.txt”,“en_US.news.txt”,“en_US.twitter.txt”))
summary_table <- data.frame( File = c(“Blogs”,“News”,“Twitter”),
Lines = c(length(blogs),length(news),length(twitter)), Size_MB =
round(file_info$size / 1024^2, 2) ) summary_table ## 4. Sample Lines
from Each File cat(“Blogs Example:”, blogs[1], “”) cat(“News Example:”,
news[1], “”) cat(“Twitter Example:”, twitter[1]) ## 5. Word Count
word_count_table <- data.frame( File = c(“Blogs”, “News”, “Twitter”),
Word_Count = c( sum(sapply(blogs, function(x)
length(unlist(strsplit(trimws(x), “\s+”))))), sum(sapply(news,
function(x) length(unlist(strsplit(trimws(x), “\s+”))))),
sum(sapply(twitter, function(x) length(unlist(strsplit(trimws(x),
“\s+”))))) ) )
word_count_table
barplot( word_count_table\(Word_Count, names.arg = word_count_table\)File, main = “Word Count by File”, xlab = “File”, ylab = “Word Count” ) `