{r setup, include=FALSE} knitr::opts_chunk$set(echo = TRUE)## 1. Introduction This is the Milestone Report for the Coursera Data Science Capstone Project. “{r} ## 2. Load the Data Files blogs <- readLines("en_US.blogs.txt", encoding = "UTF-8", skipNul = TRUE) news <- readLines("en_US.news.txt", encoding = "UTF-8", skipNul = TRUE) twitter <- readLines("en_US.twitter.txt", encoding = "UTF-8", skipNul = TRUE) ## 3. Basic Summary Statistics "{r} file_info <- file.info(c(”en_US.blogs.txt”,“en_US.news.txt”,“en_US.twitter.txt”)) summary_table <- data.frame( File = c(“Blogs”,“News”,“Twitter”), Lines = c(length(blogs),length(news),length(twitter)), Size_MB = round(file_info$size / 1024^2, 2) ) summary_table ## 4. Sample Lines from Each File cat(“Blogs Example:”, blogs[1], “”) cat(“News Example:”, news[1], “”) cat(“Twitter Example:”, twitter[1]) ## 5. Word Count word_count_table <- data.frame( File = c(“Blogs”, “News”, “Twitter”), Word_Count = c( sum(sapply(blogs, function(x) length(unlist(strsplit(trimws(x), “\s+”))))), sum(sapply(news, function(x) length(unlist(strsplit(trimws(x), “\s+”))))), sum(sapply(twitter, function(x) length(unlist(strsplit(trimws(x), “\s+”))))) ) )

word_count_table

barplot( word_count_table\(Word_Count, names.arg = word_count_table\)File, main = “Word Count by File”, xlab = “File”, ylab = “Word Count” ) `