La probabilidad descriptiva es la que permite la recopilación, ordenación, representación y síntesis de información númerica. Prácticamente esta disciplina nos va a permitir tener las herramientas necesarias para poder analizar grandes conjuntos de datos y utilizar los resultados en diversos contextos. Teniendo en cuenta lo mencionado anteriormente,vamos a hacer uso de las herramientas de la probabilidad para analizar una muestra de 200 datos aleatorios, para luego obtener las gráficas correspondientes para los tipos de variables que manejemos, en este caso tendremos una base de datos con variables tanto cualitativas como cuantitativas. Para nuestro trabajo en específico realizaremos diagramas de caja y bigotes, dona e histogramas.
Primero vamos a mencionar los paquetes necesarios para la correcta ejecución de los códigos a implementar
library(magrittr)
library(readxl)
library(dplyr)
Ahora se mostrará la base de datos que utilizaremos para realizar los diferentes tratamientos estadísticos:
datos1 <- read_excel("Olimpicos Atenas 2004.xlsx")
set.seed(407)
datos_aleatorios1 <- data.frame(ID=1:2830, variable=rnorm(2830))
datos_aleatorios2 <- datos1[sample(nrow(datos1),200),]
punto1 <- datos_aleatorios2 %>% select(Name, Sex, Age, Height, Weight, Team, Sport, Event, Medal )
Para tomar nuestra muestra, lo primero que hacemos es estipular la semilla, lo cual permitirá que siempre que ejecutemos el código se tomen siempre los mismos 200 datos necesarios para realizar los tratamientos estadísticos. Adicionalmente, se eiliminaron las columnas correspondientes a ID, NOC, Games, Year, Season y City.
Ahora, para la creación del dataframe con estas características vamos a usar el paquete magrittr, el cual permitirá encadenar varias operaciones de manera ordenada y lógica, así podremos estipular cuantos países participan por sexo al que pertenecen de manera más eficiente.
punto2 <- punto1 %>%
group_by(Sex) %>%
summarise(Team = n_distinct(Team))
Para el caso de la frecuencia absoluta de la medallería, primero se van a determinar cuales son los países que si ganaron medallas, eliminando a los que no lo hicieron. Después, se agrupan los datos por países y al final se hace el conteo total de medallas que gano cada país, lo que correspondería a la frecuencia absoluta.
frecuencia_medallas <- punto1 %>%
filter(Medal != "NA") %>%
group_by(Team) %>%
summarise(Medal= n())
Los diagramas son una herramienta que nos permitirá captar la atención del lector, presentar la información de forma sencilla, clara y precisa, además, facilitará la comparación de datos. En nuestro caso inicialmente, realizaremos 2 gráficos en concreto. Sin embargo, antes de ello vamos a estipular cuales son los paquetes necesarios para lograr nuestro ojetivo y además generaremos las tablas de datos necesarias para construir los gráficos correspondientes.
library(ggplot2)
library(scales)
library(ggrepel)
library(dplyr)
Olimpicos_Atenas_2004 <- read_excel("Olimpicos Atenas 2004.xlsx")
names(Olimpicos_Atenas_2004)
## [1] "ID" "Name" "Sex" "Age" "Height" "Weight" "Team" "NOC"
## [9] "Games" "Year" "Season" "City" "Sport" "Event" "Medal"
deportes <- Olimpicos_Atenas_2004$Sport
frecuencia_deportes <- table(deportes)
df_frecuencia <- as.data.frame(frecuencia_deportes)
names(df_frecuencia) <- c("Deporte", "Frecuencia")
cantidad_total_deportes <- sum(df_frecuencia$Frecuencia)
df_frecuencia2 <- df_frecuencia %>%
mutate(csum = rev(cumsum(rev(Frecuencia))),
pos = Frecuencia/2 + lead(csum, 1),
pos = if_else(is.na(pos), Frecuencia/2, pos))
ggplot(df_frecuencia, aes(x = 2 , y = Frecuencia, fill = Deporte)) +
geom_col(width = 1, color = 1) +
coord_polar(theta = "y") +
geom_label_repel(data = df_frecuencia2,
aes(y = pos, label = (percent(Frecuencia/cantidad_total_deportes,accuracy = 0.01))),
size = 6, nudge_x = 1, show.legend = FALSE) +
guides(fill = guide_legend(title = "Deporte")) +
theme_void() +
labs(title = "Gráfico de Dona") +
xlim(0.5,4.5)
ggplot(Olimpicos_Atenas_2004, aes(x = Sex, y = Weight, fill = Sex)) +
geom_boxplot() +
labs(title = "Diagrama de Caja y Bigotes para Sexo y Peso en los Juegos Olímpicos de Atenas 2004",
x = "Sexo",
y = "Peso") +
theme_minimal()
Para realizar este resumen es necesario saber a que nos referimos con variables cuantititavas,en este caso hablaremos de aquellas característcias de un objeto que se pueden escribir en números, en nuestro caso, tendremos edad, altura y peso.
Asi mismo, es importante mencionar que cuando usamos la función summary, vamos a obtener un resumen estadístico, donde tendremos media, mediana,cuartiles, mínimos y máximos.
summary(subset(punto1,Sex=="F")[c("Age","Height","Weight")])
## Age Height Weight
## Min. :14.00 Min. :147.0 Min. :42.00
## 1st Qu.:19.00 1st Qu.:161.2 1st Qu.:54.00
## Median :22.50 Median :168.0 Median :59.00
## Mean :23.18 Mean :166.7 Mean :59.67
## 3rd Qu.:26.00 3rd Qu.:172.0 3rd Qu.:65.00
## Max. :37.00 Max. :183.0 Max. :93.00
summary(subset(punto1,Sex=="M")[c("Height")])
## Height
## Min. :156.0
## 1st Qu.:174.0
## Median :180.0
## Mean :179.8
## 3rd Qu.:186.0
## Max. :200.0
Por último haremos una tabla de frecuencias donde la idea es obtener frecuencia absoluta, relativa, absoluta acumulada y relativa acumulada. Posteriormente usaremos solo la información de altura con la frecuencia relativa para hacer el histograma correspondiente.
attach(punto1)
fabs2 <- table(subset(punto1,Sex=="F")[c("Height")]);fabs2 #frecuencia absoluta por altura
## Height
## 147 149 150 152 154 156 157 160 161 162 163 165 166 167 168 169 170 172 173 174
## 2 2 1 3 1 1 1 8 1 5 4 3 2 1 6 3 13 2 3 2
## 175 176 178 179 180 181 182 183
## 1 2 3 1 3 2 1 1
View(fabs2)
datos2 <- data.frame("Sex","Height")
longitid_alturas_femeninas <- length(subset(datos2$Height,datos2$Sex == "F"))
frel2 <- round(fabs2/length(longitid_alturas_femeninas),5)#frecuencia relativa para altura
frel2 # Frecuencia relativa pata la variable altura
## Height
## 147 149 150 152 154 156 157 160 161 162 163 165 166 167 168 169 170 172 173 174
## 2 2 1 3 1 1 1 8 1 5 4 3 2 1 6 3 13 2 3 2
## 175 176 178 179 180 181 182 183
## 1 2 3 1 3 2 1 1
fabsacum <- cumsum(fabs2) #frecuencia absoluta acumulada
fabsacum
## 147 149 150 152 154 156 157 160 161 162 163 165 166 167 168 169 170 172 173 174
## 2 4 5 8 9 10 11 19 20 25 29 32 34 35 41 44 57 59 62 64
## 175 176 178 179 180 181 182 183
## 65 67 70 71 74 76 77 78
frelacum <- cumsum(frel2)#frecuencia relativa acumulada
frelacum
## 147 149 150 152 154 156 157 160 161 162 163 165 166 167 168 169 170 172 173 174
## 2 4 5 8 9 10 11 19 20 25 29 32 34 35 41 44 57 59 62 64
## 175 176 178 179 180 181 182 183
## 65 67 70 71 74 76 77 78
#tabla con las frecuencias encontradas
tablafrecuencias <- cbind(fabs2, frel2,fabsacum,frelacum) #Adjunta por columna
tablafrecuencias
## fabs2 frel2 fabsacum frelacum
## 147 2 2 2 2
## 149 2 2 4 4
## 150 1 1 5 5
## 152 3 3 8 8
## 154 1 1 9 9
## 156 1 1 10 10
## 157 1 1 11 11
## 160 8 8 19 19
## 161 1 1 20 20
## 162 5 5 25 25
## 163 4 4 29 29
## 165 3 3 32 32
## 166 2 2 34 34
## 167 1 1 35 35
## 168 6 6 41 41
## 169 3 3 44 44
## 170 13 13 57 57
## 172 2 2 59 59
## 173 3 3 62 62
## 174 2 2 64 64
## 175 1 1 65 65
## 176 2 2 67 67
## 178 3 3 70 70
## 179 1 1 71 71
## 180 3 3 74 74
## 181 2 2 76 76
## 182 1 1 77 77
## 183 1 1 78 78
datos_mujeres <- subset(punto1, Sex == "F")
ggplot(datos_mujeres, aes(x = Height)) +
geom_histogram(binwidth = 3, fill = "pink", color = "black", aes(y = after_stat(density) )) +
labs(title = "Histograma de Altura de Mujeres",
x = "Altura",
y = "Frecuencia Relativa") +
theme_minimal()
Las tareas que fueron realizadas en R, combinadas con los datos que fueron proporcionados nos ofrecen una visión integral y detallada de un anáñisis exploratorio de los eventos deportivos, pudimos ver muchas cosas importantes. Desde seleccionar algunos datos al azar y quitar información que no necesitábamos hasta hacer gráficos y sumar estadísticas, cada tarea realizada nos ayudó a entender mejor quiénes participaron, qué tan bien lo hicieron los países, cómo son físicamente los atletas y cuáles son los deportes más populares. En resumen, todo este trabajo nos da una buena idea de qué está pasando en el mundo del deporte y nos ayuda a tomar decisiones más inteligentes sobre ello. El gráfico de donas creado para representar la distribución de deportes en competición ofrece una representación visual efectiva de la proporción de cada deporte en el evento, facilitando la identificación de los deportes más populares o significativos en la competición. Esto ofrece una visión rápida y clara de la distribución de los deportes en la competición, destacando cuáles tienen una participación más significativa en comparación con otros. Por ejemplo, “Swimming” es el deporte con mayor representación, con un 32.79% de participación.
El análisis comparativo realizado a través del diagrama de caja y bigotes para los pesos según el sexo revela diferencias significativas en la distribución de pesos entre hombres y mujeres, con una clara tendencia hacia pesos más altos en hombres. En el histograma, observamos una distribución asimétrica hacia la izquierda, indicativa de una concentración mayor de valores en el extremo inferior del rango de alturas. Esta distribución sugiere una prevalencia significativa de mujeres con alturas cercanas a 1.70 metros, como se evidencia por el pico pronunciado en esa región del histograma, correspondiente a una alta frecuencia relativa. Este patrón implica que la altura mencionada es frecuente en la muestra analizada, destacando su repetición consistente en comparación con otras alturas en el conjunto de datos. En conjunto, estas técnicas y visualizaciones ofrecen una comprensión profunda y significativa de los datos deportivos, permitiendo identificar tendencias, patrones y aspectos destacados de la competición.