En este trabajo se hará un Análisis exploratorio de datos.
library(lsm) # Para descargar una base de datos
library(dplyr)
##
## Adjuntando el paquete: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(moments) # Para hallar las medidas de forma
library(e1071)
##
## Adjuntando el paquete: 'e1071'
## The following objects are masked from 'package:moments':
##
## kurtosis, moment, skewness
library(ggplot2)
##
## Adjuntando el paquete: 'ggplot2'
## The following object is masked from 'package:e1071':
##
## element
datosCompleto <- lsm::survey
Conociendo la base de datos.
Responda las siguientes preguntas:
¿Cuántas observaciones tiene la base de datos?
La base de datos tiene 800 observaciones.
¿Cuántas variables contiene?
La base de datos contiene 66 variables.
Muestre los nombres de todas las variables.
names(datosCompleto) #A) Muestra los nombres de las columnas (variables).
## [1] "Observation" "ID" "Gender" "Like" "Age"
## [6] "Smoke" "Height" "Weight" "BMI" "School"
## [11] "SES" "Enrollment" "Score" "MotherHeight" "MotherAge"
## [16] "MotherCHD" "FatherHeight" "FatherAge" "FatherCHD" "Status"
## [21] "SemAcum" "Exam1" "Exam2" "Exam3" "Exam4"
## [26] "ExamAcum" "Definitive" "Expense" "Income" "Gas"
## [31] "Course" "Law" "Economic" "Race" "Region"
## [36] "EMO1" "EMO2" "EMO3" "EMO4" "EMO5"
## [41] "GOAL1" "GOAL2" "GOAL3" "Pre_STAT1" "Pre_STAT2"
## [46] "Pre_STAT3" "Pre_STAT4" "Post_STAT1" "Post_STAT2" "Post_STAT3"
## [51] "Post_STAT4" "Pre_IDARE1" "Pre_IDARE2" "Pre_IDARE3" "Pre_IDARE4"
## [56] "Pre_IDARE5" "Post_IDARE1" "Post_IDARE2" "Post_IDARE3" "Post_IDARE4"
## [61] "Post_IDARE5" "PSICO1" "PSICO2" "PSICO3" "PSICO4"
## [66] "PSICO5"
Seleccione cinco variables que considere de interés e indique:
La primera de las cinco variables de interés que escogimos es la variable “Age” esta es una variable de tipo cuantitativa continua. “Age” representa la edad de los estudiantes encuestados.
La segunda variable de las cinco de interés que escogimos es la variable “Height”, esta es una variable de tipo cuantitativa continua. “Height” representa la altura de los estudiantes encuestados.
La terecera variable de las cinco de interés que escogimos es la variable “Smoke”,esta es una variable de tipo cualitativa categórica. “Smoke” representa a los estudiantes encuestados que fuman.
La cuarta variable de las cinco de interés que escogimos es la variable “School”, esta es una variable de tipo cualitativa categórica. “School” representa el tipo de colegio al que asisten los estudiantes encuestados.
La quinta variable de las cinco de interés que escogimos es la variable “Course”, esta es una variable de tipo cualitativa categórica. “Course” representa la modalidad de curso que tienen los estudiantes encuestados.
datosCompleto <- lsm::survey
Muestra1 <- datosCompleto[1:100,2:5] # A) Un nuevo data frame
Muestra1
## # A tibble: 100 × 4
## ID Gender Like Age
## <chr> <chr> <chr> <dbl>
## 1 SB11201910010435 Female TV 21.4
## 2 SB11201910004475 Male Network 21.1
## 3 SB11201910011427 Male Network 20.9
## 4 SB11201910041975 Male TV 18.4
## 5 SB11201910013623 Female TV 16.6
## 6 SB11201910038122 Female Network 16.0
## 7 SB11201910037905 Female TV 19.3
## 8 SB11201910038140 Female TV 18.6
## 9 SB11201910038005 Female TV 17.0
## 10 SB11201910037919 Male TV 19.7
## # ℹ 90 more rows
Muestra <- datosCompleto[1:100, c("Age", "Gender", "Like")]
#A) Definiendo y convirtiendo en factor
Sexo <- as.factor(Muestra$Gender)
#B) Calcular tabla de frecuencias
Tabla1 <- table(Sexo)
Tabla1
## Sexo
## Female Male
## 49 51
Aqui podemos observar la cantidad de mujeres y hombres de los estudiantes encuestados, de 100 muestras de las 800 observaciones.
#A) Definiendo y convirtiendo en factor
Like <- as.factor(Muestra$Like)
#B) Calcular tabla de frecuencias
Tabla1 <- table(Like)
Tabla1
## Like
## Network TV
## 41 59
Aquí podemos observar la cantidad de encuestados que prefieren el Network y quienes prefieren el TV, de 100 muestras de las 800 observaciones.
#A) Definiendo y convirtiendo en factor
Age <- as.factor(Muestra$Age)
#B) Calcular tabla de frecuencias
Tabla1 <- table(Age)
Tabla1
## Age
## 16.02 16.04 16.19 16.37 16.42 16.43 16.52 16.59 16.63 16.64 16.65 16.69 16.71
## 1 2 1 1 1 1 2 1 1 1 1 1 1
## 16.73 16.76 16.77 16.88 16.89 17.01 17.05 17.23 17.25 17.32 17.49 17.56 17.59
## 2 1 1 1 1 1 1 1 1 1 1 1 1
## 17.75 17.83 17.88 17.9 17.93 18.08 18.09 18.14 18.15 18.16 18.17 18.18 18.19
## 1 1 1 1 1 1 1 1 1 1 1 1 1
## 18.21 18.36 18.41 18.43 18.51 18.58 18.6 18.62 18.72 18.81 19 19.01 19.02
## 1 1 2 1 1 1 1 1 1 1 1 1 1
## 19.09 19.1 19.17 19.21 19.32 19.38 19.44 19.59 19.66 19.71 19.79 19.82 19.85
## 1 1 1 1 1 1 1 1 1 2 1 1 1
## 19.89 20 20.05 20.17 20.35 20.64 20.72 20.75 20.82 20.83 20.84 20.9 20.92
## 1 1 1 2 1 2 1 1 1 1 1 1 1
## 21.07 21.11 21.15 21.35 21.36 21.43 21.65 21.74 21.78 21.82 21.85 21.89 24.91
## 1 1 1 1 2 1 1 1 1 1 1 1 1
## 27.88
## 1
Aqui podemos observar el rango de edad de los estudiantes encuestados, en orden del menor al mayor, de 100 muestras de las 800 observaciones.
#B) Tabla de frecuencias
Tabla3 <- table(Age, Like, Sexo)
Tabla3
## , , Sexo = Female
##
## Like
## Age Network TV
## 16.02 1 0
## 16.04 0 2
## 16.19 1 0
## 16.37 0 0
## 16.42 1 0
## 16.43 1 0
## 16.52 1 0
## 16.59 1 0
## 16.63 0 0
## 16.64 0 1
## 16.65 0 0
## 16.69 1 0
## 16.71 0 1
## 16.73 0 1
## 16.76 0 0
## 16.77 1 0
## 16.88 1 0
## 16.89 0 0
## 17.01 0 1
## 17.05 1 0
## 17.23 0 0
## 17.25 0 0
## 17.32 0 1
## 17.49 0 0
## 17.56 0 0
## 17.59 0 1
## 17.75 1 0
## 17.83 0 1
## 17.88 1 0
## 17.9 0 0
## 17.93 0 0
## 18.08 0 0
## 18.09 0 0
## 18.14 0 1
## 18.15 0 0
## 18.16 0 0
## 18.17 0 1
## 18.18 1 0
## 18.19 1 0
## 18.21 0 1
## 18.36 0 0
## 18.41 0 0
## 18.43 0 1
## 18.51 0 0
## 18.58 0 1
## 18.6 0 0
## 18.62 0 1
## 18.72 0 1
## 18.81 0 0
## 19 0 0
## 19.01 1 0
## 19.02 0 0
## 19.09 0 1
## 19.1 1 0
## 19.17 0 0
## 19.21 0 0
## 19.32 0 1
## 19.38 0 0
## 19.44 0 0
## 19.59 0 0
## 19.66 0 0
## 19.71 0 1
## 19.79 0 0
## 19.82 0 0
## 19.85 0 1
## 19.89 1 0
## 20 0 0
## 20.05 0 0
## 20.17 0 0
## 20.35 0 0
## 20.64 1 0
## 20.72 0 0
## 20.75 0 1
## 20.82 0 1
## 20.83 0 0
## 20.84 0 1
## 20.9 0 0
## 20.92 0 0
## 21.07 0 0
## 21.11 1 0
## 21.15 0 0
## 21.35 0 1
## 21.36 1 1
## 21.43 0 0
## 21.65 1 0
## 21.74 0 0
## 21.78 0 0
## 21.82 1 0
## 21.85 1 0
## 21.89 0 0
## 24.91 0 0
## 27.88 1 0
##
## , , Sexo = Male
##
## Like
## Age Network TV
## 16.02 0 0
## 16.04 0 0
## 16.19 0 0
## 16.37 0 1
## 16.42 0 0
## 16.43 0 0
## 16.52 1 0
## 16.59 0 0
## 16.63 1 0
## 16.64 0 0
## 16.65 0 1
## 16.69 0 0
## 16.71 0 0
## 16.73 1 0
## 16.76 1 0
## 16.77 0 0
## 16.88 0 0
## 16.89 0 1
## 17.01 0 0
## 17.05 0 0
## 17.23 0 1
## 17.25 0 1
## 17.32 0 0
## 17.49 1 0
## 17.56 0 1
## 17.59 0 0
## 17.75 0 0
## 17.83 0 0
## 17.88 0 0
## 17.9 0 1
## 17.93 0 1
## 18.08 1 0
## 18.09 0 1
## 18.14 0 0
## 18.15 0 1
## 18.16 1 0
## 18.17 0 0
## 18.18 0 0
## 18.19 0 0
## 18.21 0 0
## 18.36 0 1
## 18.41 1 1
## 18.43 0 0
## 18.51 0 1
## 18.58 0 0
## 18.6 0 1
## 18.62 0 0
## 18.72 0 0
## 18.81 0 1
## 19 0 1
## 19.01 0 0
## 19.02 0 1
## 19.09 0 0
## 19.1 0 0
## 19.17 1 0
## 19.21 0 1
## 19.32 0 0
## 19.38 1 0
## 19.44 1 0
## 19.59 0 1
## 19.66 1 0
## 19.71 0 1
## 19.79 0 1
## 19.82 0 1
## 19.85 0 0
## 19.89 0 0
## 20 0 1
## 20.05 0 1
## 20.17 0 2
## 20.35 1 0
## 20.64 0 1
## 20.72 0 1
## 20.75 0 0
## 20.82 0 0
## 20.83 0 1
## 20.84 0 0
## 20.9 0 1
## 20.92 1 0
## 21.07 1 0
## 21.11 0 0
## 21.15 0 1
## 21.35 0 0
## 21.36 0 0
## 21.43 1 0
## 21.65 0 0
## 21.74 0 1
## 21.78 1 0
## 21.82 0 0
## 21.85 0 0
## 21.89 0 1
## 24.91 0 1
## 27.88 0 0
¿Existe alguna diferencia importante entre las distribuciones observadas?
No, no hay una gran diferencia ya que no hay gran brecha entre las muestras tomadas de género y en los dos se evidencia una notable preferencia por Network.
¿Qué conclusiones preliminares pueden obtenerse?
Se puede concluir hasta este momento que tanto mujeres como hombre de todas las edades encuestadas, prefieren Network antes que TV.
ggplot(Muestra, aes(x = Like)) + #1
#geom_bar() + #2
geom_bar(width=0.5, colour="pink", fill="yellow") + #2
labs(x="Like",y= "Frecuencia") + #3
ylim(c(0,60)) + #4
#xlim(c(0,300)) + #4
ggtitle("Diagrama de barras") + #5
# theme_bw() + #6
theme_bw(base_size = 12) + #6
#coord_flip() + #7
geom_text(aes(label=..count..), stat='count', #8
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
) +
facet_wrap(~"Like") #9
## Warning: The dot-dot notation (`..count..`) was deprecated in ggplot2 3.4.0.
## ℹ Please use `after_stat(count)` instead.
## This warning is displayed once per session.
## Call `lifecycle::last_lifecycle_warnings()` to see where this warning was
## generated.
De 100 datos observados, 59 personas prefieren TV y 41 personas
ggplot(Muestra, aes(x = Sexo)) + #1
#geom_bar() + #2
geom_bar(width=0.5, colour="blue", fill="lightgreen") + #2
labs(x="Sexo",y= "Frecuencia") + #3
ylim(c(0,60)) + #4
#xlim(c(0,300)) + #4
ggtitle("Diagrama de barras") + #5
# theme_bw() + #6
theme_bw(base_size = 12) + #6
#coord_flip() + #7
geom_text(aes(label=..count..), stat='count', #8
position=position_dodge(0.9),
vjust=-0.5,
size=5.0
) +
facet_wrap(~"Variable sexo") #9
De 100 datos observados de los estudiantes encuestados, 51 personas son
hombres y 49 son mujeres.
Inicialmente el conjunto de datos tiene un total de 800 observaciones y 66 variables, en las que se seleccionaron 5 variables de interes: 2 cuantitativas “age” y “height”, y 3 de cualitativas “smoke”, “course” y “school”. En cuanto a las distribuciones de 100 estudiantes se evidencia una leve mayoria de hombres con 51 y mujeres con 49. Pero, en las variables de preferencia si es evidente una inclinacion en “like” hacia tv, dejando con menor preferencia a “network”. Al evaluar de manera general los datos podemos concluir que no existe una gran brecha en cuanto a genero, siendo muy poco notable la mayoria de los hombres. Aunque, en la encuesta de preferencia los dos generos si se inclinan de manera significante a “tv”.