Pauta de solución realizada con los datos de Tamara Espinoza.
Si alguien desea que genere esta pauta con sus datos, avíseme, y encantado lo haré.
En esta evaluación usted va a realizar un análisis multivariado de un conjunto de datos ficticios personalizados. Consiste en las siguientes variables de bienestar social para 194 países:
De la plataforma, carpeta Evaluación 1 – Datos descargue su archivo de datos identificado con su nombre completo con el siguiente formato:
Nombre1 Nombre2 Apellido1 Apellido2.csv
Alternativamente, lo puede descargar del siguiente enlace:
https://github.com/jerosmith/Analisis-Multivariado---Evaluacion-1
Genere un histograma para la variable PIB per cápita con intervalos de $5.000, y porcentaje en el eje y (vertical). Coloque el nombre de la variable en el eje x y “Porcentaje de Países” en el eje y. Guarde su gráfico en un archivo llamado Histograma.png y súbalo a la plataforma.
ggplot(data = df_datos, mapping = aes(x=PIB.per.capita, y = after_stat(count)/sum(after_stat(count)))) +
geom_histogram(binwidth = 5000, fill = "red", color = "blue") +
xlab("PIB per Cápita (US$)") + ylab("Porcentaje de Países") +
scale_x_continuous(breaks = seq(0, 200000, 20000), labels = format(seq(0, 200000, 20000), big.mark = ".")) +
scale_y_continuous(breaks = seq(0, 1, 0.01), labels = paste0(0:100, "%"))
Genere un gráfico de deciles para la variable PIB per cápita. Guarde su gráfico en un archivo llamado Grafico de Deciles.png y súbalo a la plataforma.
df = df_datos[, c("Pais", "PIB.per.capita")]
df = df[order(df$PIB.per.capita), ]
df$Num = 1:n
nd = round(n/10, 0)
df$Decil = pmin(ceiling(df$Num/nd), 10)
df = summarise(group_by(df, Decil), mean(PIB.per.capita))
names(df) = c("Decil", "PIB.per.capita")
ggplot(data = df, mapping = aes(x=Decil, y=PIB.per.capita)) +
geom_col(fill = "red", color = "blue") +
ylab("PIB per Cápita (US$)") +
scale_x_continuous(breaks = 1:10) +
scale_y_continuous(breaks = seq(0, 200000, 10000), labels = format(seq(0, 200000, 10000), big.mark = "."))
Genere un gráfico de dispersión con la variable Índice de seguridad ciudadana en el eje y (vertical) y Coeficiente Gini en el eje x (horizontal). Guarde su gráfico en un archivo llamado Grafico de Dispersion.png y súbalo a la plataforma.
ggplot(data = df_datos, mapping = aes(x=Coeficiente.Gini, y=Indice.de.seguridad.ciudadana)) +
geom_point() +
xlab("Coeficiente Gini") + ylab("Índice de Seguridad Ciudadana") +
scale_x_continuous(breaks = seq(0, 100, 10)) +
scale_y_continuous(breaks = seq(0, 100, 10))
Para cada una de las variables, calcule su media muestral y su intervalo de confianza de 95% de tres tipos:
Debe completar la tabla en la planilla Excel adjunta:
Tabla de Intervalos de Confianza.xlsx
| Variable | Individuales | Bonferroni | Simultáneos |
|---|---|---|---|
| 1. PIB per cápita | |||
| 2. Tasa de alfabetismo | |||
| 3. Porcentaje de la población con educación terciaria | |||
| 4. Expectativa de vida al nacer | |||
| 5. Índice de seguridad ciudadana | |||
| 6. Coeficiente Gini | |||
| 7. Índice de democracia | |||
| 8. Índice de corrupción | |||
| 9. Índice de felicidad | |||
| 10. Índice de cuidado del medio ambiente |
Debe ingresar los intervalos de confianza redondeados al entero más cercano, con corchetes cuadrados y coma, con el siguiente formato:
[num1, num2]
Por ejemplo:
[49, 56]
Suba su tabla Excel completada a la plataforma, manteniendo su nombre y estructura original. NO le cambie el nombre al archivo.
Las fórmulas para calcular los márgenes de error de los tres tipos de intervalos de confianza son las siguientes:
Individuales: \[\epsilon_j = t_{n-1,1-\alpha/2} \frac{s_j}{\sqrt n}\]
Bonferroni: \[\epsilon_j = t_{n-1,1-\alpha/2/10} \frac{s_j}{\sqrt n}\]
Simultáneas: \[\epsilon_j = \sqrt{\frac{p(n-1)}{n-p}F_{10,n-10,1-\alpha}}\]
Tabla de Intervalos de Confianza
## Variable Individuales Bonferroni Simultáneos
## 1 PIB per cápita [35527, 44462] [33562, 46427] [29929, 50060]
## 2 Tasa de alfabetismo [89, 91] [88, 91] [87, 92]
## 3 % pob. educ. terciaria [47, 56] [45, 58] [42, 62]
## 4 Expectativa de vida al nacer [59, 69] [57, 71] [54, 74]
## 5 Índice de seguridad ciudadana [46, 55] [44, 57] [40, 60]
## 6 Coeficiente Gini [48, 57] [46, 59] [42, 63]
## 7 Índice de democracia [52, 61] [50, 63] [46, 67]
## 8 Índice de corrupción [58, 67] [56, 69] [52, 73]
## 9 Índice de felicidad [56, 65] [54, 67] [50, 71]
## 10 Índice medio ambiente [36, 37] [35, 37] [35, 38]
Una ONG afirma que la media mundial de cada una de las variables es la siguiente:
Realice tres pruebas de hipótesis para rechazar o no la hipótesis de la ONG.
Responda las siguientes cinco preguntas en el cuestionario del aula virtual. Las respuestas a las preguntas 5.2 al 5.4 deben ser redondeadas al entero más cercano.
5.1 Guiándose en sus resultados obtenidos en la pregunta 4, ¿cuál es la variable cuya media e intervalo de confianza está lejos de la hipótesis de la ONG?
Respuesta:
Se observa que los intervalos de confianza de las variables PIB per cápita e Índice de cuidado del medio ambiente están lejos de la hipótesis de la ONG, puesto que los valores planteados por la ONG caen fuera de dichos intervalos de confianza.
5.2 Calcule la distancia Mahalanobis desde la media afirmada por la ONG (\(\mu_0\)) hasta su media muestral (\(\bar x\)).
Respuesta:
La distancia Mahalanobis del punto \(\mu_0\) postulada por la ONG desde la media \(\bar x\) de los datos está dada por:
\[d_p = \sqrt{(\mu_0 - \bar x)^T \Sigma^{-1} (\mu_0 - \bar x)}\]
El código R es:
X = df_datos[, setdiff(names(df_datos), "Pais")]
S = cov(X)
mu0 = c(12000, 90, 50, 67, 60, 45, 55, 63, 78, 56)
x_bar = apply(X, MARGIN = 2, FUN = mean)
d = sqrt((mu0-x_bar) %*% solve(S) %*% matrix(mu0-x_bar))
d
## [,1]
## [1,] 4.377299
La distancia Mahalanobis es:
\[d_p = 4.377\]
Recordemos que el cuadrado de la distancia Mahalanobis tiene una distribución chi cuadrado con p grados de libertad:
\[d_p^2 \sim \chi_p^2\]
Por lo tanto, el estadístico chi cuadrado correspondiente a la distancia Mahalanobis obtenida es:
\[\chi_p^2 = d_p^2 = 4.377^2 = 19.161\]
El valor p asociado a este estadístico es:
\[p = 0.038\] Esto es significativo al 5%.
5.3 Calcule el mayor estadístico t de la prueba t Student con corrección Bonferroni.
Respuesta:
Se calcula cada estadístico t con corrección Bonferroni mediante la fórmula:
\[t_j = \frac{\bar x_j - \mu_{0j}}{s_j/\sqrt{n}}\]
El código R es:
mu0 = c(12000, 90, 50, 67, 60, 45, 55, 63, 78, 56)
x_bar = apply(X, MARGIN = 2, FUN = mean)
s = apply(X, MARGIN = 2, FUN = sd)
n = nrow(X)
t = (x_bar - mu0)/(s/sqrt(n))
as.data.frame(t)
## t
## PIB.per.capita 12.3589879
## Tasa.de.alfabetismo -0.4919011
## Porcentaje.de.la.poblacion.con.educacion.terciaria 0.8133873
## Expectativa.de.vida.al.nacer -1.3046775
## Indice.de.seguridad.ciudadana -4.3049020
## Coeficiente.Gini 3.1715695
## Indice.de.democracia 0.7324423
## Indice.de.corrupcion -0.2010769
## Indice.de.felicidad -7.3646348
## Indice.de.cuidado.del.medio.ambiente -57.9460391
Se observa que el mayor estadístico t (en valor absoluto) es el del índice de cuidado del medio ambiente, con un valor de -57.95.
5.4 Calcule el estadístico F de la prueba \(T^2\) de Hotelling.
Respuesta:
Primero, calcular el estadístico \(t^2\):
\[t^2 = n(\bar x - mu_0)^T \Sigma^{-1}(\bar x - mu_0)\]
t2 = n*(mu0-x_bar) %*% solve(S) %*% matrix(mu0-x_bar)
\[\therefore t^2 = 3717.1845254\] Luego, calcular el estadístico F:
\[F = \frac{n-p}{p(n-1)}t^2\]
F = (n-p)/(p*(n-1))*t2
\[\therefore F = 354\]
5.5 ¿Rechaza la hipótesis de la ONG? Explique y justifique su respuesta.
Respuesta:
Se rechaza la hipótesis de la ONG, porque las tres pruebas de hipótesis realizadas generaron estadísticos elevados que permiten rechazarla.
Se calculan los valores p asociados a las pruebas Mahalanobis, Bonferroni y \(T^2\) de Hotelling:
pM = 1 - pchisq(d^2, df=p)
pB = 1 - pt(abs(t[10]), df=n-1)
pT = 1 - pf(F, df1 = p, df2 = n-p)
\[p_M = 0.038\] \[p_B = 0\] \[p_T = 0\]
El valor \(p_M\) permite rechazar la hipótesis nula de la ONG al nivel de significancia de 5%. Los valores \(p_B\) y \(p_T\) permiten rechazarla a una significancia mucho menor: < 0,1%.