# Cargar librerías necesarias
library(readr)

# Cargar el archivo CSV
data <- read_csv("Datos.csv")
## Rows: 234 Columns: 8
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (2): Country, Area (km2)
## dbl (6): Population 2024, Population 2023, Density (/km2), Growth Rate, Worl...
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
# Visualizar las primeras filas del dataframe
head(data)
## # A tibble: 6 × 8
##   Country      `Population 2024` `Population 2023` `Area (km2)` `Density (/km2)`
##   <chr>                    <dbl>             <dbl> <chr>                   <dbl>
## 1 India               1441719852        1428627663 3M                        485
## 2 China               1425178782        1425671352 9.4M                      151
## 3 United Stat…         341814420         339996563 9.1M                       37
## 4 Indonesia            279798049         277534122 1.9M                      149
## 5 Pakistan             245209815         240485658 770.9K                    318
## 6 Nigeria              229152217         223804632 910.8K                    252
## # ℹ 3 more variables: `Growth Rate` <dbl>, `World %` <dbl>, `World Rank` <dbl>
# Seleccionar la columna de interés
population <- data$`Population 2024`
# Crear un histograma
hist(population, main="Histograma de la Población 2024", xlab="Población 2024", ylab="Frecuencia", col="blue")

# Crear un gráfico Q-Q
qqnorm(population)
qqline(population, col = "red")

# Prueba de Shapiro-Wilk
shapiro.test(population)
## 
##  Shapiro-Wilk normality test
## 
## data:  population
## W = 0.21525, p-value < 2.2e-16
# Prueba de Kolmogorov-Smirnov
ks.test(population, "pnorm", mean=mean(population, na.rm=TRUE), sd=sd(population, na.rm=TRUE))
## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  population
## D = 0.40082, p-value < 2.2e-16
## alternative hypothesis: two-sided
# Instalación y carga de paquetes necesarios
install.packages("readr")
## Installing package into '/cloud/lib/x86_64-pc-linux-gnu-library/4.4'
## (as 'lib' is unspecified)
install.packages("ggplot2")
## Installing package into '/cloud/lib/x86_64-pc-linux-gnu-library/4.4'
## (as 'lib' is unspecified)
library(readr)
library(ggplot2)

# Especificar la ruta del archivo CSV
file_path <- "Datos.csv"

# Importar el archivo CSV
data <- read_csv(file_path)
## Rows: 234 Columns: 8
## ── Column specification ────────────────────────────────────────────────────────
## Delimiter: ","
## chr (2): Country, Area (km2)
## dbl (6): Population 2024, Population 2023, Density (/km2), Growth Rate, Worl...
## 
## ℹ Use `spec()` to retrieve the full column specification for this data.
## ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
# Ver las primeras filas del conjunto de datos
head(data)
## # A tibble: 6 × 8
##   Country      `Population 2024` `Population 2023` `Area (km2)` `Density (/km2)`
##   <chr>                    <dbl>             <dbl> <chr>                   <dbl>
## 1 India               1441719852        1428627663 3M                        485
## 2 China               1425178782        1425671352 9.4M                      151
## 3 United Stat…         341814420         339996563 9.1M                       37
## 4 Indonesia            279798049         277534122 1.9M                      149
## 5 Pakistan             245209815         240485658 770.9K                    318
## 6 Nigeria              229152217         223804632 910.8K                    252
## # ℹ 3 more variables: `Growth Rate` <dbl>, `World %` <dbl>, `World Rank` <dbl>
# Selección de variables relevantes (Población 2024 y Densidad de población)
population_2024 <- data$`Population 2024`
density <- data$`Density (/km2)`

# Cálculo del coeficiente de correlación
correlation <- cor(population_2024, density, use = "complete.obs")

# Visualización con un gráfico de dispersión
ggplot(data, aes(x = `Population 2024`, y = `Density (/km2)`)) +
  geom_point() +
  geom_smooth(method = "lm", col = "blue") +
  labs(title = "Relación entre Población en 2024 y Densidad de Población",
       x = "Población en 2024",
       y = "Densidad de Población")
## `geom_smooth()` using formula = 'y ~ x'

# Mostrar el valor del coeficiente de correlación
print(correlation)
## [1] -0.02660348