class: center, middle, inverse, title-slide .title[ # Bioestadística ] .subtitle[ ## Organización y presentación de datos cualitativos ] .author[ ### Prof. Roberto Roque
RPub
] .institute[ ### Departamento de Matemática y Estatística, Universidad Catolica San Pablo ] --- <style type="text/css"> .remark-slide-content { font-size: 23px; padding: 1em 3.5em 1em 3.5em; } </style>
# Organización y Presentación de datos <br> Una vez presentados los conceptos básicos de la Estadística, empezamos con el proceso de organización y presentación de datos. El primer paso es recolectar datos, organizarlos y presentarlos adecuadamente en cuadros numéricos llamados tablas de distribución de frecuencias o mediante gráficas, de tal manera que facilite su comprensión para luego realizar un análisis estadístico y así obtener conclusiones validas. --- <br> ## Distribución de Frecuencias para Variables Cualitativas Si la variable `\(X\)` es cualitativa, observada en una muestra de tamaño `\(n\)` de una población que origina `\(k\)` cualidades diferentes `\(C_1,C_2,...,C_k\)` la tabulación o agrupación de estos `\(n\)` datos, es la distribución de frecuencias. - **Frecuencia absoluta `\(f_i\)`** es el número de datos que resulta del conteo en la categoría respectiva `\(C_i\)`, donde `\(i=1,2,...,k\)`. La suma de todas las frecuencias absolutas es igual a `\(n\)`, el total de datos observados. - **Frecuencia relativa `\(h_i\)`** se define en cada categoría `\(C_i\)` por `\(h_i=\frac{f_i}{n}\)`. La suma de todas las frecuencias relativas es igual a uno. - **Frecuencia porcentual `\(p_i\)`** se define en cada categoría `\(C_i\)` por `\(p_i=h_i\times 100\%\)`. La suma de todas las frecuencias porcentajes es igual a `\(100\%\)`. --- <br> |Categoría de la variable `\(X\)`|Frecuencia absoluta `\(f_i\)`|Frecuencia relativa `\(h_i\)`|Frecuencia porcentual `\(p_i\)`| |:--:|:--:|:--:|:--:| |$$C_1$$|$$f_1$$|$$h_1$$|$$p_1$$| |$$C_2$$|$$f_2$$|$$h_2$$|$$p_2$$| |$$\vdots$$|$$\vdots$$|$$\vdots$$|$$\vdots$$| |$$C_k$$|$$f_k$$|$$h_k$$|$$p_k$$| |Total|$$n$$|1|100| *Tabla 1: Tabla de distribución de frecuencias de la variable* --- ### Ejemplo. > Construir la tabla de frecuencias de la variable "Ciudad" del documento dato4.xlsx **Solución.** ``` r library(readxl) datos <- read_excel('/Users/robertoroque/Documents/graduacion/PVA 2023-R/Bioestadistica/xaringan2 bio/dato4.xlsx') datos ``` ``` ## # A tibble: 50 × 7 ## Numero Sexo Hermanos Edad Peso Ciudad Puntaje ## <dbl> <chr> <dbl> <dbl> <dbl> <chr> <dbl> ## 1 1 F 1 18 60 Lima 69 ## 2 2 F 2 19 58 Arequipa 78 ## 3 3 M 0 18 59 Cuzco 68 ## 4 4 M 1 20 58 Tacna 69 ## 5 5 F 2 21 61 Moquegua 70 ## 6 6 M 2 22 62 Lima 68 ## 7 7 M 1 20 63 Cuzco 70 ## 8 8 F 3 21 58 Cuzco 74 ## 9 9 M 1 18 59 Arequipa 75 ## 10 10 F 0 19 60 Tacna 75 ## # ℹ 40 more rows ``` --- - Frecuencias absolutas: ``` r table(datos$Ciudad) ``` ``` ## ## Arequipa Cuzco Lima Moquegua Tacna ## 15 9 14 5 7 ``` - Frecuencias relativas: ``` r prop.table(table(datos$Ciudad)) ``` ``` ## ## Arequipa Cuzco Lima Moquegua Tacna ## 0.30 0.18 0.28 0.10 0.14 ``` - Frecuencias porcentuales: ``` r prop.table(table(datos$Ciudad))*100 ``` ``` ## ## Arequipa Cuzco Lima Moquegua Tacna ## 30 18 28 10 14 ``` --- # Ejemplo > Haga el diagrama de frecuencias para la variable Ciudad .panelset[ .panel[.panel-name[Table] ``` ## frec_abs frec_rel frec_por ## Arequipa 15 0.30 30 ## Cuzco 9 0.18 18 ## Lima 14 0.28 28 ## Moquegua 5 0.10 10 ## Tacna 7 0.14 14 ``` ] .panel[.panel-name[R Code] ``` r fi=table(datos$Ciudad) hi=prop.table(table(datos$Ciudad)) pi=hi*100 tabla<-cbind(frec_abs=fi,frec_rel=hi,frec_por=pi) tabla ``` ] ] --- # Gráfica de Barras Los datos de cada una de las cualidades `\(C_i\)` se representan por una barra rectangular vertical (u horizontal), cuya altura (a lo largo) es proporcional a su frecuencia (de cualquier de los tres tipos). Las barras se dibujan dejando un espacio entre ellas. Si la escala es nominal las cualidades pueden ser colocadas en cualquier orden. Pero, si el nivel de la escala es ordinal las cualidades deben ir ordenadas. --- # Ejemplo > Grafique el diagrama de barras de la variable Ciudades .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r x<-datos$Ciudad gr=barplot(table(x), main = 'Grafica de barras', xlab = 'Ciudades', ylab = 'Nro de personas', col=c("blue","yellow","red","brown","green"), ylim=c(0,1.1*max(table(x)))) text(x=gr,y=table(x)+1,labels = table(x)) ``` ] ] --- ## Usando legendas > Tambien podemos hacer el ejemplo anterior con legendas: .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r x<-datos$Ciudad barplot(table(x), main = 'Grafica de barras', xlab = 'Ciudades', ylab = 'Nro de personas', col=c("blue","yellow","red","brown","green"), ylim=c(0,1.1*max(table(x))), legend.text=paste(names(table(x)),as.numeric(table(x))) ) ``` ] ] --- ## Barras horizontales .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r x<-datos$Ciudad gr=barplot(table(x),main = 'Grafica de barras', xlab = 'Número de personas', col=c("brown","yellow","cyan","green","red"), horiz = T,las=1,#Categoria horizontal cex.names = 0.7,#Tamaño de letra xlim = c(0,1.1*max(table(x)))) text(x=table(x)+0.5,y=gr,labels = table(x)) ``` ] ] --- ### Usando el paquete `epiDisplay` Podemos hacer lo anterior instalando el paquete `epiDisplay` con la siguiente instrucción: ``` install.packages("epiDisplay") ``` .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[Table] ``` ## x : ## Frequency Percent ## Arequipa 15 30 ## Cuzco 9 18 ## Lima 14 28 ## Moquegua 5 10 ## Tacna 7 14 ## Total 50 100 ``` ] .panel[.panel-name[R Code] ``` r library(epiDisplay) x<-datos$Ciudad tab1(x,cum.percent = F,graph = T, ylab = "Nro de personas", main="Diagrama de barras") ``` ] ] --- # Sectores circulares Los datos de la categoría `\(C_i\)` se representan por un sector circular cuyo ángulo en el centro es igual a `\(h_i\times 360^{\circ}\)`. .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r frec_rel=prop.table(table(x)) frec_porc=frec_rel*100 pie(table(x),labels = paste(names(frec_porc),frec_porc,"%"), main = "Grafico de sectores", col=c("red","green","cyan","yellow","purple")) ``` ] ] --- ### Sector circular con legenda .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r x<-datos$Ciudad frec_rel=prop.table(table(x)) frec_porc=frec_rel*100 colores=c("salmon","green","cyan","yellow","brown") pie(table(x), labels = paste(as.character(frec_porc),"%"), main = "Grafico de sectores", col=colores) legend("topleft",paste(names(frec_porc)),fill =colores,cex=1.2) ``` ] ] --- ### Sectores circulares en 3D con `plotrix` .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r library(plotrix) colores<-c("salmon","green","blue","yellow","brown") frec_porce<-prop.table(table(x))*100 nombres<-paste(names(table(x)),frec_porce,"%") pie3D(table(x), explode = 0.2, main='Diagrama de sectores circulares', col=colores) legend("topright",nombres,fill = colores,cex=0.6) ``` ] ] --- ## Ejemplo (V.C. Ordinal) > Haga el grafico de barras del nivel de satisfacción de los datos de la hoja `datosCualitativos`. .panelset[ .panel[.panel-name[Plot] <!-- --> ] .panel[.panel-name[R Code] ``` r library(readxl) data1 <- read_excel('/Users/robertoroque/Documents/graduacion/PVA 2023-R/Bioestadistica/xaringan2 bio/datosCualitativos.xlsx',sheet="Hoja1") likert<-data1$`Nivel satisfaccion` niveles<-c("Muy Insatisfecho","Insatisfecho","Satisfecho","Muy Satisfecho") ordenado<-factor(likert,levels = niveles) gr=barplot(table(ordenado), main = 'Grafica de barras', xlab = 'Niveles de satisfacción', ylab = 'Nro de personas', col=c("blue","green","red","brown"), ylim=c(0,1.2*max(table(ordenado))) ) text(x=gr,y=table(ordenado),labels = table(ordenado),pos = 3) ``` ] ] --- ### Ejercicio 1 > En una evaluación realizada a 50 niños de una institución educativa, se registró el estado nutricional de cada uno. Las categorías consideradas fueron: Bajo peso (BP), Normal (N), Sobrepeso (SP) y Obesidad (OB). El siguiente cuadro muestra los resultados obtenidos. Construya la tabla de distribución de frecuencias de la variable "Estado nutricional de los niños" y realice las gráficas correspondientes. > N, SP, N, BP, N, OB, N, SP, N, N, BP, N, SP, OB, N, N, N, SP, BP, N, SP, N, N, OB, SP, N, BP, N, SP, N, N, SP, OB, N, BP, SP, N, N, N, SP, OB, BP, N, SP, N, N, SP, N, BP, N --- ### Ejercicio 2 > Use los datos de la hoja de cálculo `aeusp2.xlsx` para resolver lo siguiente: > 1. Importar el documento `aeusp2.xlsx` a RStudio. 2. Halle la tabla de distribución de frecuencias de la variable Región. 3. Realice el grafico de sectores circulares de la variable Región e interprete. 4. Halle la tabla de distribución de frecuencias de la variable Sexo. 5. Realice el diagrama de barras para la variables Sexo e interprete.