Paso 1. Importar y revisar la base de datos
datos <- read.delim("datos_desigualdad_sinteticos.txt", header = TRUE, sep = "\t")
str(datos)
## 'data.frame': 100 obs. of 21 variables:
## $ id : int 1 2 3 4 5 6 7 8 9 10 ...
## $ x1 : int 26 29 19 20 22 25 29 29 20 19 ...
## $ x2 : int 0 1 0 0 1 0 1 0 0 1 ...
## $ x3 : int 0 0 0 0 0 0 0 1 1 1 ...
## $ x4 : int 2 4 4 5 2 2 5 1 2 3 ...
## $ x5 : int 7 15 12 13 9 7 13 2 6 12 ...
## $ x6 : int 13 15 15 14 10 12 14 11 13 14 ...
## $ x7 : num 1.97 2.31 3.66 3.18 1.36 2.06 3.06 1.16 1.9 2.05 ...
## $ x8 : int 1 0 0 0 0 1 0 0 0 0 ...
## $ x9 : int 1 1 0 1 0 1 1 0 0 1 ...
## $ x10: num 10 14.3 3.1 9.7 19.6 5.3 12.2 11.4 8.3 13.1 ...
## $ x11: num 40.2 25.4 17 17.2 51.1 41.8 30.4 49.7 44.7 61.3 ...
## $ x12: int 0 0 0 0 0 0 0 1 1 1 ...
## $ x13: num 2.7 1.6 0.6 2.7 4.7 3.2 0 6.6 7.2 3.9 ...
## $ x14: num 5.9 5.6 1.7 2.5 5 3.7 5.5 5.3 6.2 6 ...
## $ x15: num 5.8 4 7.7 6.6 5.8 5.8 4.8 3.6 4.9 5.2 ...
## $ x16: num 6.5 6 8.7 7.2 4.7 7.3 9.4 4.6 2.4 6.5 ...
## $ x17: int 0 0 1 0 1 0 1 0 1 0 ...
## $ x18: int 434 476 702 646 327 422 795 197 339 378 ...
## $ x19: num 7.4 10.2 11.8 7 8.3 8.3 9.7 6.6 2.4 10.8 ...
## $ x20: num 52 75.2 78 53.4 56.7 58.7 72.5 48.3 51.4 56.3 ...
summary(datos)
## id x1 x2 x3 x4
## Min. : 1.00 Min. :18.00 Min. :0.00 Min. :0.00 Min. :1.00
## 1st Qu.: 25.75 1st Qu.:21.00 1st Qu.:0.00 1st Qu.:0.00 1st Qu.:2.00
## Median : 50.50 Median :25.00 Median :0.00 Median :0.00 Median :3.00
## Mean : 50.50 Mean :25.65 Mean :0.49 Mean :0.53 Mean :2.98
## 3rd Qu.: 75.25 3rd Qu.:30.00 3rd Qu.:1.00 3rd Qu.:1.00 3rd Qu.:4.00
## Max. :100.00 Max. :35.00 Max. :1.00 Max. :2.00 Max. :5.00
## x5 x6 x7 x8 x9
## Min. : 0.00 Min. : 8.00 Min. :0.600 Min. :0.00 Min. :0.00
## 1st Qu.: 7.00 1st Qu.:11.00 1st Qu.:1.305 1st Qu.:0.00 1st Qu.:0.00
## Median :10.00 Median :13.00 Median :2.150 Median :0.00 Median :1.00
## Mean : 9.81 Mean :12.78 Mean :2.202 Mean :0.19 Mean :0.61
## 3rd Qu.:13.00 3rd Qu.:14.25 3rd Qu.:3.053 3rd Qu.:0.00 3rd Qu.:1.00
## Max. :18.00 Max. :19.00 Max. :4.950 Max. :1.00 Max. :1.00
## x10 x11 x12 x13
## Min. : 0.200 Min. :10.00 Min. :0.00 Min. :0.000
## 1st Qu.: 6.775 1st Qu.:28.25 1st Qu.:0.00 1st Qu.:1.200
## Median : 9.600 Median :41.70 Median :0.00 Median :2.650
## Mean :10.821 Mean :39.98 Mean :0.29 Mean :3.119
## 3rd Qu.:15.075 3rd Qu.:51.02 3rd Qu.:1.00 3rd Qu.:4.600
## Max. :23.200 Max. :74.30 Max. :1.00 Max. :9.500
## x14 x15 x16 x17 x18
## Min. :1.200 Min. :2.000 Min. :0.500 Min. :0.00 Min. : 59.0
## 1st Qu.:3.875 1st Qu.:4.300 1st Qu.:4.300 1st Qu.:0.00 1st Qu.:339.0
## Median :5.300 Median :5.250 Median :5.600 Median :0.00 Median :487.5
## Mean :5.146 Mean :5.241 Mean :5.521 Mean :0.49 Mean :485.7
## 3rd Qu.:6.300 3rd Qu.:6.400 3rd Qu.:6.900 3rd Qu.:1.00 3rd Qu.:616.8
## Max. :8.900 Max. :9.700 Max. :9.700 Max. :1.00 Max. :900.0
## x19 x20
## Min. : 0.100 Min. :38.80
## 1st Qu.: 6.600 1st Qu.:53.48
## Median : 9.200 Median :60.95
## Mean : 9.054 Mean :61.16
## 3rd Qu.:11.825 3rd Qu.:69.30
## Max. :16.600 Max. :81.40
¿Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres?
aggregate(x10 ~ x2,
data = datos,
FUN = mean)
## x2 x10
## 1 0 6.754902
## 2 1 15.053061
prueba_01 <- t.test(x10 ~ x2,
data = datos,
alternative = "greater")
prueba_01
##
## Welch Two Sample t-test
##
## data: x10 by x2
## t = -13.53, df = 86.666, p-value = 1
## alternative hypothesis: true difference in means between group 0 and group 1 is greater than 0
## 95 percent confidence interval:
## -9.31787 Inf
## sample estimates:
## mean in group 0 mean in group 1
## 6.754902 15.053061
mujeres <- datos$x10[datos$x2 == 1]
hombres <- datos$x10[datos$x2 == 0]
prueba_01 <- t.test(mujeres,
hombres,
alternative = "greater")
prueba_01
##
## Welch Two Sample t-test
##
## data: mujeres and hombres
## t = 13.53, df = 86.666, p-value < 2.2e-16
## alternative hypothesis: true difference in means is greater than 0
## 95 percent confidence interval:
## 7.278448 Inf
## sample estimates:
## mean of x mean of y
## 15.053061 6.754902
H₀ — Hipótesis nula Las mujeres y los hombres dedican, en promedio, la misma cantidad de horas al trabajo doméstico y de cuidado.
En notación:
H₀: μₘujeres = μₕombres
La alternativa sería:
H₁: μₘujeres > μₕombres
Tipo de prueba
Prueba t para comparar dos medias independientes, unilateral.
Justificación
Se selecciona esta prueba porque queremos comparar el promedio de una variable numérica (x10, horas de trabajo doméstico y de cuidado) entre dos grupos independientes definidos por el sexo (x2: hombres y mujeres). Además, la pregunta plantea específicamente si las mujeres tienen un promedio mayor, por lo que la prueba es unilateral.
Interpretación hecha por IA: Existe evidencia estadística suficiente para rechazar la hipótesis nula (\(p < 0.05\)). Se concluye que el promedio de horas dedicadas al trabajo doméstico no remunerado es significativamente mayor en mujeres que en hombres en la población analizada.
Interpretación sin IA: Las mujeres pasan más tiempo haciendo tareas del hogar que los hombres, y la diferencia en los promedios es lo suficientemente grande como para no ser casualidad.
¿La proporción que reporta discriminación laboral es igual entre quienes tienen pertenencia afro/indígena y quienes no?
datos$afro_indigena <- ifelse(datos$x3 == 0, 0, 1)
table(datos$afro_indigena)
##
## 0 1
## 59 41
table(datos$afro_indigena, datos$x12)
##
## 0 1
## 0 51 8
## 1 20 21
afro_indigena <- sum(datos$afro_indigena ==1)
sin_pertenencia <- sum(datos$afro_indigena ==0)
discriminacion_afro <- sum(datos$x12 [datos$afro_indigena == 1] == 1)
discriminación_sin <- sum(datos$x12 [datos$afro_indigena == 0] ==1)
prueba_02 <- prop.test(
x = c(discriminacion_afro, discriminación_sin),
n = c(afro_indigena, sin_pertenencia),
alternative = "two.sided"
)
prueba_02
##
## 2-sample test for equality of proportions with continuity correction
##
## data: c(discriminacion_afro, discriminación_sin) out of c(afro_indigena, sin_pertenencia)
## X-squared = 14.884, df = 1, p-value = 0.0001143
## alternative hypothesis: two.sided
## 95 percent confidence interval:
## 0.1797478 0.5734560
## sample estimates:
## prop 1 prop 2
## 0.5121951 0.1355932
H₀ — Hipótesis nula La proporción de personas que reportan discriminación laboral es igual en ambos grupos.
En notación:
H₀: pₐfro/indígena = pₛin pertenencia
La alternativa:
H₁: pₐfro/indígena ≠ pₛin pertenencia
Tipo de prueba
Prueba de comparación de dos proporciones.
Justificación Se utiliza porque la variable que queremos comparar (x12) es categórica y binaria: reportó discriminación o no reportó discriminación. Se comparan las proporciones entre dos grupos: personas afro/indígenas y personas sin pertenencia étnica declarada.
Interpretación hecha por IA: Se rechaza la hipótesis nula de igualdad de proporciones (\(p < 0.05\)). Se observa una diferencia estadísticamente significativa en las tasas reportadas de discriminación laboral entre personas con pertenencia afro/indígena y aquellas sin pertenencia étnica.
Interpretación sin IA: La cantidad de personas que sufren discriminación en el trabajo no es parecida en ambos grupos; las personas afro e indígenas reportan discriminación en una proporción distinta a las que no lo son.
¿El ingreso laboral promedio es igual en los cinco quintiles socioeconómicos?
aggregate(x7 ~ x4,
data = datos,
FUN = mean)
## x4 x7
## 1 1 0.9047368
## 2 2 1.6626316
## 3 3 2.1368000
## 4 4 2.8131579
## 5 5 3.5838889
modelo_anova <- aov(x7 ~ factor(x4),
data = datos)
summary(modelo_anova)
## Df Sum Sq Mean Sq F value Pr(>F)
## factor(x4) 4 79.08 19.770 46.97 <2e-16 ***
## Residuals 95 39.98 0.421
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
H₀ — Hipótesis nula El ingreso laboral promedio es igual en los cinco quintiles socioeconómicos.
En notación:
H₀: μ₁ = μ₂ = μ₃ = μ₄ = μ₅
La alternativa:
H₁: Al menos una media es diferente.
Tipo de prueba
ANOVA de un factor.
Justificación Se utiliza ANOVA porque queremos comparar el promedio de una variable numérica (x7, ingreso laboral) entre más de dos grupos: los cinco quintiles socioeconómicos (x4). ANOVA permite determinar si existe evidencia de que al menos uno de los promedios es diferente.
Interpretación hecha por IA: Existe una brecha digital estadísticamente significativa (\(p < 0.05\)) entre la población perteneciente a los quintiles más bajos (1–2) y los más altos (4–5), rechazando la hipótesis de equidad en la proporción de cobertura.
Interpretación sin IA: La oportunidad de tener internet en la casa cambia mucho si uno está en los quintiles más pobres o en los más ricos; no tienen la misma cobertura.
¿El acceso a internet difiere entre los quintiles 1-2 y los quintiles 4-52 ?
###Paso 1. Crear los grupos socioeconómicos
datos$grupo_quintil <- ifelse(datos$x4 %in% c(1,2),
"Quintil_1_2",
ifelse(datos$x4 %in% c(4,5),
"Quintil_4_5",
NA))
datos_ej4 <- subset(datos,
grupo_quintil %in% c("Quintil_1_2",
"Quintil_4_5"))
table(datos_ej4$grupo_quintil,
datos_ej4$x17)
##
## 0 1
## Quintil_1_2 29 9
## Quintil_4_5 8 29
internet_1_2 <- sum(datos_ej4$x17[datos_ej4$grupo_quintil == "Quintil_1_2"] == 1)
internet_4_5 <- sum(datos_ej4$x17[datos_ej4$grupo_quintil == "Quintil_4_5"] == 1)
n_1_2 <- sum(datos_ej4$grupo_quintil == "Quintil_1_2")
n_4_5 <- sum(datos_ej4$grupo_quintil == "Quintil_4_5")
prueba_04 <- prop.test(
x = c(internet_1_2, internet_4_5),
n = c(n_1_2, n_4_5),
alternative = "two.sided"
)
prueba_04
##
## 2-sample test for equality of proportions with continuity correction
##
## data: c(internet_1_2, internet_4_5) out of c(n_1_2, n_4_5)
## X-squared = 20.301, df = 1, p-value = 6.616e-06
## alternative hypothesis: two.sided
## 95 percent confidence interval:
## -0.7629978 -0.3308855
## sample estimates:
## prop 1 prop 2
## 0.2368421 0.7837838
H₀ — Hipótesis nula La proporción de personas con acceso estable a internet es igual entre los quintiles 1–2 y 4–5.
En notación:
H₀: p₁₋₂ = p₄₋₅
La alternativa:
H₁: p₁₋₂ ≠ p₄₋₅
Tipo de prueba
Prueba de comparación de dos proporciones.
Justificación Se utiliza porque queremos comparar el porcentaje de personas que tienen internet (x17) entre dos grupos de quintiles socioeconómicos: 1–2 y 4–5. Como el acceso a internet es una variable binaria (sí/no), lo que se compara son proporciones y no promedios.
Interpretación hecha por IA: El coeficiente de correlación de Pearson resulta estadísticamente significativo (\(p < 0.05\)), indicando una asociación lineal positiva entre la duración de los desplazamientos diarios y los niveles de estrés social reportados.
Interpretación sin IA: Entre más tiempo pasa una persona viajando o desplazándose en el día, tiende a registrar mayores niveles de estrés.
¿Existe asociación lineal entre el tiempo diario de desplazamiento y el índice de estrés social en la población hipotética?
Variable explicativa (\(X\)): - Tiempo diario total de desplazamiento en minutos. Tipo: Cuantitativa continua.
Variable de respuesta (\(Y\)): -Índice de estrés social (escala de 0 a 10). Tipo: Cuantitativa continua.
Naturaleza del contraste: Relación lineal entre dos variables cuantitativas.
Prueba seleccionada: Prueba de correlación lineal de
Pearson (cor.test()).
# Cargar la base de datos
summary(datos$x11)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 10.00 28.25 41.70 39.98 51.02 74.30
summary(datos$x14)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 1.200 3.875 5.300 5.146 6.300 8.900
# Ejecución de la prueba de correlación de Pearson
prueba_e5 <- cor.test(datos$x11, datos$x14, method = "pearson", conf.level = 0.95)
# Visualización de los resultados completos
print(prueba_e5)
##
## Pearson's product-moment correlation
##
## data: datos$x11 and datos$x14
## t = 10.699, df = 98, p-value < 2.2e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
## 0.6281428 0.8131817
## sample estimates:
## cor
## 0.7340009
estadistico_t <- round(as.numeric(prueba_e5$statistic), 4)
grados_libertad <- as.numeric(prueba_e5$parameter)
coeficiente_r <- round(as.numeric(prueba_e5$estimate), 4)
p_valor <- format.pval(prueba_e5$p.value, eps = 0.001)
cat("Estadístico t:", estadistico_t, "\n")
## Estadístico t: 10.699
cat("Grados de libertad:", grados_libertad, "\n")
## Grados de libertad: 98
cat("Coeficiente r estimado:", coeficiente_r, "\n")
## Coeficiente r estimado: 0.734
cat("p-valor:", p_valor, "\n")
## p-valor: < 0.001
###Paso 4. conclusiones H₀ — Hipótesis nula
No existe una asociación lineal entre el tiempo de desplazamiento y el estrés social.
En notación:
H₀: ρ = 0
La alternativa:
H₁: ρ ≠ 0
Tipo de prueba
Prueba de correlación de Pearson.
Justificación
Se utiliza porque queremos analizar la relación entre dos variables numéricas:
x11 → tiempo de desplazamiento. x14 → estrés social.
La correlación de Pearson permite determinar si existe una relación lineal entre ambas variables y conocer su dirección y fuerza mediante el coeficiente r.
Interpretación hecha por IA: El coeficiente de correlación de Pearson resulta estadísticamente significativo (\(p < 0.05\)), indicando una asociación lineal positiva entre la duración de los desplazamientos diarios y los niveles de estrés social reportados.
Interpretación sin IA: Entre más tiempo pasa una persona viajando o desplazándose en el día, tiende a registrar mayores niveles de estrés.
¿Existe asociación lineal entre el trato injusto percibido y la confianza institucional en la población hipotética? * Variable explicativa (\(X\)): - Índice de trato injusto percibido en instituciones (0 a 10). Tipo: Cuantitativa continua. * Variable de respuesta (\(Y\)): - Índice de confianza institucional (0 a 10). Tipo: Cuantitativa continua.
Prueba seleccionada: Prueba de correlación de
Pearson (cor.test()).
Justificación: Se analiza el grado de asociación lineal conjunta entre dos variables continuas medidas sobre los mismos individuos.
# Resumen exploratorio de ambas variables
summary(datos$x13)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.000 1.200 2.650 3.119 4.600 9.500
summary(datos$x16)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.500 4.300 5.600 5.521 6.900 9.700
# Ejecución de la correlación de Pearson
prueba_e6 <- cor.test(datos$x13, datos$x16, method = "pearson", conf.level = 0.95)
# Visualización completa del resultado
print(prueba_e6)
##
## Pearson's product-moment correlation
##
## data: datos$x13 and datos$x16
## t = -15.758, df = 98, p-value < 2.2e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
## -0.8944298 -0.7801056
## sample estimates:
## cor
## -0.846775
# Extracción ordenada de métricas clave para la entrega
cat("Estadístico t:", round(as.numeric(prueba_e6$statistic), 4), "\n")
## Estadístico t: -15.7583
cat("Grados de libertad:", as.numeric(prueba_e6$parameter), "\n")
## Grados de libertad: 98
cat("Coeficiente r estimado:", round(as.numeric(prueba_e6$estimate), 4), "\n")
## Coeficiente r estimado: -0.8468
cat("p-valor:", format.pval(prueba_e6$p.value, eps = 0.001), "\n")
## p-valor: < 0.001
###Paso 4. conclusiones H₀ — Hipótesis nula
No existe una asociación lineal entre el trato injusto percibido y la confianza institucional.
En notación:
H₀: ρ = 0
La alternativa:
H₁: ρ ≠ 0
Tipo de prueba
Prueba de correlación de Pearson.
Justificación
Se utiliza porque ambas variables son numéricas:
x13 → índice de trato injusto percibido. x16 → índice de confianza institucional.
Pearson permite determinar si existe una relación lineal entre las dos variables y establecer si esta relación es positiva o negativa.
Interpretación hecha por IA: Se detecta una relación inversa o negativa altamente significativa (\(p < 0.05\)). Incrementos en la percepción de trato injusto se asocian de manera consistente con reducciones en la confianza institucional.
Interpretación sin IA: Cuando las personas sienten que las tratan de forma más injusta en las instituciones, confían mucho menos en ellas.
¿Existe una diferencia en el puntaje promedio de la prueba estandarizada entre personas con y sin pertenencia étnica declarada en la población hipotética?
x3). Tipo: Categórica dicotómica (2
grupos).Prueba seleccionada: Prueba t de Student para dos muestras independientes (Prueba t de Welch). Justificación: Se compara una variable dependiente continua (\(Y\)) a través de dos grupos independientes definidos por una variable categórica dicotómica (\(X\)).
Hipótesis Nula (\(H_0\)): El puntaje promedio en la prueba estandarizada es igual entre personas con pertenencia étnica y personas sin pertenencia étnica en la población hipotética. \(H_0: \mu_{\text{sin etnia}} = \mu_{\text{con etnia}}\) Hipótesis Alternativa (\(H_1\)): El puntaje promedio en la prueba estandarizada difiere entre ambos grupos en la población hipotética. \(H_1: \mu_{\text{sin etnia}} \neq \mu_{\text{con etnia}}\)
# Agrupar pertenencia étnica: 0 = sin pertenencia, 1 o 2 = con pertenencia (afro/indígena)
datos$etnico_bin <- ifelse(datos$x3 == 0, 0, 1)
datos$etnico_factor <- factor(
datos$etnico_bin,
levels = c(0, 1),
labels = c("Sin pertenencia", "Afro / Indígena")
)
# Promedios muestrales por grupo
tapply(datos$x20, datos$etnico_factor, mean)
## Sin pertenencia Afro / Indígena
## 63.02881 58.46098
# Ejecución de la prueba t de dos muestras independientes
prueba_e7 <- t.test(x20 ~ etnico_factor, data = datos)
# Visualización completa del resultado
print(prueba_e7)
##
## Welch Two Sample t-test
##
## data: x20 by etnico_factor
## t = 2.3069, df = 87.73, p-value = 0.02342
## alternative hypothesis: true difference in means between group Sin pertenencia and group Afro / Indígena is not equal to 0
## 95 percent confidence interval:
## 0.6326958 8.5029801
## sample estimates:
## mean in group Sin pertenencia mean in group Afro / Indígena
## 63.02881 58.46098
# Extracción ordenada de métricas clave
cat("Estadístico t:", round(as.numeric(prueba_e7$statistic), 4), "\n")
## Estadístico t: 2.3069
cat("Grados de libertad:", round(as.numeric(prueba_e7$parameter), 2), "\n")
## Grados de libertad: 87.73
cat("Media grupo sin pertenencia:", round(prueba_e7$estimate[1], 2), "\n")
## Media grupo sin pertenencia: 63.03
cat("Media grupo con pertenencia:", round(prueba_e7$estimate[2], 2), "\n")
## Media grupo con pertenencia: 58.46
cat("p-valor:", round(prueba_e7$p.value, 4), "\n")
## p-valor: 0.0234
##Paso 4. conclusiones H₀ — Hipótesis nula
El puntaje promedio de la prueba es igual entre las personas con pertenencia afro/indígena y quienes no declaran pertenencia étnica.
En notación:
H₀: μₐfro/indígena = μₛin pertenencia
La alternativa:
H₁: μₐfro/indígena ≠ μₛin pertenencia
Tipo de prueba
Prueba t para comparar dos medias independientes, bilateral.
Justificación
Se utiliza porque queremos comparar el promedio del puntaje de la prueba (x20) entre dos grupos independientes:
personas con pertenencia afro/indígena; personas sin pertenencia étnica declarada.
Además, la pregunta busca determinar si existe una diferencia, sin establecer desde el inicio que un grupo necesariamente tenga un promedio mayor.
Muy importante: encontrar una diferencia estadística no permite afirmar que la pertenencia étnica sea la causa de esa diferencia.
Interpretación hecha por IA: Se observa un rechazo de la hipótesis nula (\(p < 0.05\)), evidenciando una brecha de rendimiento estadísticamente significativa en los puntajes promedios de la prueba estandarizada según la pertenencia étnica declarada.
Interpretación sin IA: Las notas promedio de la prueba no son iguales entre las personas con pertenencia étnica y quienes no declaran pertenencia.
¿La proporción de personas con acceso estable a internet en el hogar difiere según el sexo en la población hipotética?
Prueba seleccionada: Prueba de Chi-cuadrado de
independencia / Prueba de proporciones
(chisq.test()).
Justificación: Se analiza la asociación entre dos variables categóricas dicotómicas (una binaria de respuesta y una de agrupación de dos niveles).
Hipótesis Nula (\(H_0\)): La proporción de personas con acceso a internet en el hogar es igual entre hombres y mujeres en la población hipotética. \(H_0: p_{\text{hombres}} = p_{\text{mujeres}}\) Hipótesis Alternativa (\(H_1\)): La proporción de personas con acceso a internet en el hogar difiere según el sexo en la población hipotética. \(H_1: p_{\text{hombres}} \neq p_{\text{mujeres}}\)
# Convertir las variables a factores con etiquetas
datos$sexo_f <- factor(datos$x2, levels = c(0, 1), labels = c("Hombre", "Mujer"))
datos$internet_f <- factor(datos$x17, levels = c(0, 1), labels = c("Sin Internet", "Con Internet"))
# Tabla de contingencia y proporciones muestrales
tabla_8 <- table(datos$sexo_f, datos$internet_f)
print(tabla_8)
##
## Sin Internet Con Internet
## Hombre 26 25
## Mujer 25 24
prop.table(tabla_8, margin = 1)
##
## Sin Internet Con Internet
## Hombre 0.5098039 0.4901961
## Mujer 0.5102041 0.4897959
# Ejecución de la prueba Chi-cuadrado
prueba_e8 <- chisq.test(tabla_8, correct = TRUE)
print(prueba_e8)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: tabla_8
## X-squared = 0, df = 1, p-value = 1
# Extracción ordenada de métricas clave
cat("Estadístico Chi-cuadrado:", round(as.numeric(prueba_e8$statistic), 4), "\n")
## Estadístico Chi-cuadrado: 0
cat("Grados de libertad:", as.numeric(prueba_e8$parameter), "\n")
## Grados de libertad: 1
cat("p-valor:", round(prueba_e8$p.value, 4), "\n")
## p-valor: 1
##Paso 4. conclusiones H₀ — Hipótesis nula
El acceso estable a internet es independiente del sexo; es decir, la proporción de personas con internet es igual entre hombres y mujeres.
En términos sencillos:
H₀: No existe asociación entre sexo e internet.
La alternativa:
H₁: Existe asociación entre sexo e internet.
Tipo de prueba
Prueba chi-cuadrado de independencia.
Justificación
Se utiliza porque tenemos dos variables categóricas:
x2 → sexo. x17 → acceso estable a internet.
La prueba chi-cuadrado permite determinar si existe una asociación estadísticamente significativa entre ambas variables. Este es también el procedimiento que aparece en el ejemplo de clase.
Interpretación hecha por IA: No se encuentra suficiente evidencia estadística para rechazar la hipótesis nula (\(p > 0.05\)). Las proporciones de acceso a internet entre hombres y mujeres se distribuyen de manera homogénea en la muestra.
Interpretación sin IA: Ser hombre o mujer no influye en tener o no internet en la casa; las proporciones son muy similares.
¿Existe una relación entre la edad y el puntaje obtenido en la prueba estandarizada?
summary(datos$x1)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.00 21.00 25.00 25.65 30.00 35.00
summary(datos$x20)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 38.80 53.48 60.95 61.16 69.30 81.40
##PASO 2. Hipotesis Hipótesis nula H0: ρ = 0 No existe una relación lineal entre edad y puntaje en la población. Hipótesis alternativa H1: ρ ≠ 0 Existe una relación lineal entre edad y puntaje en la población.
##Paso 3. Realizar la correlación de Pearson
prueba_09 <- cor.test(datos$x1,
datos$x20,
method = "pearson")
prueba_09
##
## Pearson's product-moment correlation
##
## data: datos$x1 and datos$x20
## t = 0.16018, df = 98, p-value = 0.8731
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
## -0.1808140 0.2119233
## sample estimates:
## cor
## 0.01617866
H₀ — Hipótesis nula
No existe una asociación lineal entre la edad y el puntaje de la prueba.
En notación:
H₀: ρ = 0
La alternativa:
H₁: ρ ≠ 0
Tipo de prueba
Prueba de correlación de Pearson.
Justificación
Se utiliza porque queremos analizar la relación entre dos variables numéricas:
x1 → edad. x20 → puntaje de la prueba.
Pearson permite determinar si existe una relación lineal estadísticamente significativa entre ambas.
Interpretación hecha por IA: Al obtener un \(p\)-valor superior a \(0.05\), no se rechaza la hipótesis nula. La edad del evaluado no presenta una relación lineal estadísticamente significativa con el puntaje obtenido.
Interpretación sin IA: Tener más o menos años no se relaciona de forma directa con sacar mejor o peor nota en la prueba.
¿El ingreso laboral promedio difiere entre hombres y mujeres?
#X = x2: Sexo #Y = x7: Ingreso laboral
table(datos$x2)
##
## 0 1
## 51 49
summary(datos$x7)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.600 1.305 2.150 2.202 3.053 4.950
aggregate(x7 ~ x2,
data = datos,
FUN = mean)
## x2 x7
## 1 0 2.446275
## 2 1 1.946939
mean(datos$x7[datos$x2 == 0])
## [1] 2.446275
mean(datos$x7[datos$x2 ==1])
## [1] 1.946939
H0 H0: μ_hombres = μ_mujeres H1 H1: μ_hombres ≠ μ_mujeres
prueba_10 <- t.test(x7 ~ x2,
data = datos)
prueba_10
##
## Welch Two Sample t-test
##
## data: x7 by x2
## t = 2.3245, df = 97.385, p-value = 0.02218
## alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
## 95 percent confidence interval:
## 0.07300978 0.92566168
## sample estimates:
## mean in group 0 mean in group 1
## 2.446275 1.946939
H₀ — Hipótesis nula
El ingreso laboral promedio es igual entre hombres y mujeres.
En notación:
H₀: μₕombres = μₘujeres
La alternativa:
H₁: μₕombres ≠ μₘujeres
Tipo de prueba
Prueba t para comparar dos medias independientes, bilateral.
Justificación
Se utiliza porque queremos comparar una variable numérica (x7, ingreso laboral) entre dos grupos independientes definidos por el sexo (x2). Como la pregunta plantea si el ingreso difiere, y no específicamente si es mayor en un grupo, se utiliza una prueba bilateral.
Interpretación hecha por IA: La prueba confirma diferencias estadísticamente significativas (\(p < 0.05\)) en el ingreso laboral medio según el género, confirmando la existencia de una brecha salarial en los datos.
Interpretación sin IA: Hombres y mujeres no ganan lo mismo en promedio; la prueba muestra que los ingresos varían de forma importante según el sexo.
¿El ingreso laboral promedio difiere entre las personas con pertenencia afrodescendiente/indígena y las personas sin pertenencia étnica declarada?
X=x3 0 = sin pertenencia étnica declarada 1 = afrodescendiente 2 = indígena
datos$afro_indigena <- ifelse(datos$x3 == 0, 0, 1)
0 → sin pertenencia étnica declarada
1 → afrodescendiente o indígena
table(datos$afro_indigena)
##
## 0 1
## 59 41
aggregate(x7 ~ afro_indigena,
data = datos,
FUN = mean)
## afro_indigena x7
## 1 0 2.608814
## 2 1 1.615610
mean(datos$x7[datos$afro_indigena == 0])
## [1] 2.608814
mean(datos$x7[datos$afro_indigena == 1])
## [1] 1.61561
prueba_11 <- t.test(x7 ~ afro_indigena,
data = datos)
prueba_11
##
## Welch Two Sample t-test
##
## data: x7 by afro_indigena
## t = 5.0812, df = 93.008, p-value = 1.928e-06
## alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
## 95 percent confidence interval:
## 0.6050496 1.3813580
## sample estimates:
## mean in group 0 mean in group 1
## 2.608814 1.615610
H0
H0: μ_afro/indígena = μ_sin pertenencia
H1
H1: μ_afro/indígena ≠ μ_sin pertenencia H₀ — Hipótesis nula
El ingreso laboral promedio es igual entre las personas con pertenencia afro/indígena y quienes no declaran pertenencia étnica.
En notación:
H₀: μₐfro/indígena = μₛin pertenencia
La alternativa:
H₁: μₐfro/indígena ≠ μₛin pertenencia
Tipo de prueba
Prueba t para comparar dos medias independientes, bilateral.
Justificación
Se utiliza porque comparamos el promedio del ingreso laboral (x7) entre dos grupos independientes definidos a partir de x3: personas con pertenencia afro/indígena y personas sin pertenencia declarada.
Interpretación hecha por IA: Los resultados rechazan \(H_0\) (\(p < 0.05\)), concluyendo que existen disparidades significativas en la remuneración laboral promedio en función de la condición étnica declarada.
Interpretación sin IA: El dinero que reciben las personas por su trabajo es distinto entre quienes son afro o indígenas y quienes no pertenecen a esos grupos.
¿Existe una relación entre las horas de estudio por semana y el puntaje obtenido en la prueba estandarizada?
#X = x19
Horas de estudio por semana
#Y = x20
Puntaje en prueba estandarizada
summary(datos$x19)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.100 6.600 9.200 9.054 11.825 16.600
summary(datos$x20)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 38.80 53.48 60.95 61.16 69.30 81.40
H0
H0: ρ = 0
H1
H1: ρ ≠ 0
prueba_12 <- cor.test(datos$x19,
datos$x20,
method = "pearson")
prueba_12
##
## Pearson's product-moment correlation
##
## data: datos$x19 and datos$x20
## t = 7.9437, df = 98, p-value = 3.345e-12
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
## 0.4896203 0.7322536
## sample estimates:
## cor
## 0.6258502
H₀ — Hipótesis nula
No existe una asociación lineal entre las horas semanales de estudio y el puntaje de la prueba.
En notación:
H₀: ρ = 0
La alternativa:
H₁: ρ ≠ 0
Tipo de prueba
Prueba de correlación de Pearson.
Justificación
Se utiliza porque las dos variables son numéricas:
x19 → horas semanales de estudio. x20 → puntaje de la prueba.
La prueba de Pearson permite determinar si existe una relación lineal entre ambas variables y medir su intensidad mediante el coeficiente de correlación.
Interpretación hecha por IA: Se valida una correlación lineal positiva directa y estadísticamente significativa (\(p < 0.05\)) entre la cantidad de horas semanales dedicadas al estudio y el puntaje alcanzado en el examen.
Interpretación sin IA: Dedicarle más horas al estudio en la semana sí ayuda a sacar un mejor puntaje en la prueba.
TABLA
library(knitr)
tabla_resumen <- data.frame(
Ejercicio = 1:12,
Prueba = c(
"t de muestras independientes",
"Comparación de dos proporciones",
"ANOVA de un factor",
"Comparación de dos proporciones",
"Correlación de Pearson",
"Correlación de Pearson",
"t de Welch",
"Chi-cuadrado",
"Correlación de Pearson",
"t de muestras independientes",
"t de muestras independientes",
"Correlación de Pearson"
),
Decision = c(
"Rechazar H0", "Rechazar H0", "Rechazar H0", "Rechazar H0",
"Rechazar H0", "Rechazar H0", "Rechazar H0", "No rechazar H0",
"No rechazar H0", "Rechazar H0", "Rechazar H0", "Rechazar H0"
),
Interpretacion_sin_IA = c(
"Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres.",
"La proporción de personas discriminadas cambia según la pertenencia étnica.",
"El ingreso medio cambia entre los distintos quintiles socioeconómicos.",
"Tener internet es más común en los quintiles altos que en los bajos.",
"A mayor tiempo viajando o desplazándose, mayor es el estrés registrado.",
"Sentir un trato injusto disminuye la confianza que se le tiene a las instituciones.",
"Los puntajes de la prueba cambian entre personas con y sin pertenencia étnica.",
"El acceso a internet en el hogar es similar tanto para hombres como para mujeres.",
"La edad no influye directamente en la nota que se obtiene en la prueba.",
"Existe una brecha en los ingresos laborales promedio entre hombres y mujeres.",
"El ingreso promedio difiere según la pertenencia étnica.",
"Estudiar más horas a la semana se relaciona con obtener mejores notas."
),
Interpretacion_hecha_por_IA = c(
"Existe evidencia estadística de que las mujeres dedican un promedio significativamente mayor de horas al trabajo doméstico.",
"Se evidencia una diferencia estadísticamente significativa en las proporciones de discriminación laboral reportadas.",
"El ingreso laboral promedio difiere significativamente en al menos uno de los quintiles socioeconómicos.",
"Se confirma una diferencia estadísticamente significativa en el acceso a internet entre quintiles extremos (1–2 vs 4–5).",
"Existe una asociación lineal positiva estadísticamente significativa entre el tiempo de desplazamiento y el estrés social.",
"Existe una correlación lineal negativa estadísticamente significativa entre el trato injusto percibido y la confianza institucional.",
"Existe evidencia de una diferencia estadísticamente significativa en los puntajes promedios según la pertenencia étnica.",
"No existe evidencia suficiente para afirmar que la proporción de acceso a internet difiera según el sexo.",
"No existe evidencia estadística de una relación lineal significativa entre la edad y el puntaje alcanzado.",
"Existe una diferencia estadísticamente significativa en el ingreso laboral medio entre hombres y mujeres.",
"Existe una disparidad estadísticamente significativa en el ingreso medio según pertenencia étnica declarada.",
"Existe una asociación lineal positiva estadísticamente significativa entre las horas de estudio semanales y el puntaje."
)
)
kable(
tabla_resumen,
caption = "Resumen comparativo de los 12 ejercicios del taller",
align = "c"
)
| Ejercicio | Prueba | Decision | Interpretacion_sin_IA | Interpretacion_hecha_por_IA |
|---|---|---|---|---|
| 1 | t de muestras independientes | Rechazar H0 | Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres. | Existe evidencia estadística de que las mujeres dedican un promedio significativamente mayor de horas al trabajo doméstico. |
| 2 | Comparación de dos proporciones | Rechazar H0 | La proporción de personas discriminadas cambia según la pertenencia étnica. | Se evidencia una diferencia estadísticamente significativa en las proporciones de discriminación laboral reportadas. |
| 3 | ANOVA de un factor | Rechazar H0 | El ingreso medio cambia entre los distintos quintiles socioeconómicos. | El ingreso laboral promedio difiere significativamente en al menos uno de los quintiles socioeconómicos. |
| 4 | Comparación de dos proporciones | Rechazar H0 | Tener internet es más común en los quintiles altos que en los bajos. | Se confirma una diferencia estadísticamente significativa en el acceso a internet entre quintiles extremos (1–2 vs 4–5). |
| 5 | Correlación de Pearson | Rechazar H0 | A mayor tiempo viajando o desplazándose, mayor es el estrés registrado. | Existe una asociación lineal positiva estadísticamente significativa entre el tiempo de desplazamiento y el estrés social. |
| 6 | Correlación de Pearson | Rechazar H0 | Sentir un trato injusto disminuye la confianza que se le tiene a las instituciones. | Existe una correlación lineal negativa estadísticamente significativa entre el trato injusto percibido y la confianza institucional. |
| 7 | t de Welch | Rechazar H0 | Los puntajes de la prueba cambian entre personas con y sin pertenencia étnica. | Existe evidencia de una diferencia estadísticamente significativa en los puntajes promedios según la pertenencia étnica. |
| 8 | Chi-cuadrado | No rechazar H0 | El acceso a internet en el hogar es similar tanto para hombres como para mujeres. | No existe evidencia suficiente para afirmar que la proporción de acceso a internet difiera según el sexo. |
| 9 | Correlación de Pearson | No rechazar H0 | La edad no influye directamente en la nota que se obtiene en la prueba. | No existe evidencia estadística de una relación lineal significativa entre la edad y el puntaje alcanzado. |
| 10 | t de muestras independientes | Rechazar H0 | Existe una brecha en los ingresos laborales promedio entre hombres y mujeres. | Existe una diferencia estadísticamente significativa en el ingreso laboral medio entre hombres y mujeres. |
| 11 | t de muestras independientes | Rechazar H0 | El ingreso promedio difiere según la pertenencia étnica. | Existe una disparidad estadísticamente significativa en el ingreso medio según pertenencia étnica declarada. |
| 12 | Correlación de Pearson | Rechazar H0 | Estudiar más horas a la semana se relaciona con obtener mejores notas. | Existe una asociación lineal positiva estadísticamente significativa entre las horas de estudio semanales y el puntaje. |