Paso 1. Importar y revisar la base de datos

datos <- read.delim("datos_desigualdad_sinteticos.txt", header = TRUE, sep = "\t")
str(datos)
## 'data.frame':    100 obs. of  21 variables:
##  $ id : int  1 2 3 4 5 6 7 8 9 10 ...
##  $ x1 : int  26 29 19 20 22 25 29 29 20 19 ...
##  $ x2 : int  0 1 0 0 1 0 1 0 0 1 ...
##  $ x3 : int  0 0 0 0 0 0 0 1 1 1 ...
##  $ x4 : int  2 4 4 5 2 2 5 1 2 3 ...
##  $ x5 : int  7 15 12 13 9 7 13 2 6 12 ...
##  $ x6 : int  13 15 15 14 10 12 14 11 13 14 ...
##  $ x7 : num  1.97 2.31 3.66 3.18 1.36 2.06 3.06 1.16 1.9 2.05 ...
##  $ x8 : int  1 0 0 0 0 1 0 0 0 0 ...
##  $ x9 : int  1 1 0 1 0 1 1 0 0 1 ...
##  $ x10: num  10 14.3 3.1 9.7 19.6 5.3 12.2 11.4 8.3 13.1 ...
##  $ x11: num  40.2 25.4 17 17.2 51.1 41.8 30.4 49.7 44.7 61.3 ...
##  $ x12: int  0 0 0 0 0 0 0 1 1 1 ...
##  $ x13: num  2.7 1.6 0.6 2.7 4.7 3.2 0 6.6 7.2 3.9 ...
##  $ x14: num  5.9 5.6 1.7 2.5 5 3.7 5.5 5.3 6.2 6 ...
##  $ x15: num  5.8 4 7.7 6.6 5.8 5.8 4.8 3.6 4.9 5.2 ...
##  $ x16: num  6.5 6 8.7 7.2 4.7 7.3 9.4 4.6 2.4 6.5 ...
##  $ x17: int  0 0 1 0 1 0 1 0 1 0 ...
##  $ x18: int  434 476 702 646 327 422 795 197 339 378 ...
##  $ x19: num  7.4 10.2 11.8 7 8.3 8.3 9.7 6.6 2.4 10.8 ...
##  $ x20: num  52 75.2 78 53.4 56.7 58.7 72.5 48.3 51.4 56.3 ...
summary(datos)
##        id               x1              x2             x3             x4      
##  Min.   :  1.00   Min.   :18.00   Min.   :0.00   Min.   :0.00   Min.   :1.00  
##  1st Qu.: 25.75   1st Qu.:21.00   1st Qu.:0.00   1st Qu.:0.00   1st Qu.:2.00  
##  Median : 50.50   Median :25.00   Median :0.00   Median :0.00   Median :3.00  
##  Mean   : 50.50   Mean   :25.65   Mean   :0.49   Mean   :0.53   Mean   :2.98  
##  3rd Qu.: 75.25   3rd Qu.:30.00   3rd Qu.:1.00   3rd Qu.:1.00   3rd Qu.:4.00  
##  Max.   :100.00   Max.   :35.00   Max.   :1.00   Max.   :2.00   Max.   :5.00  
##        x5              x6              x7              x8             x9      
##  Min.   : 0.00   Min.   : 8.00   Min.   :0.600   Min.   :0.00   Min.   :0.00  
##  1st Qu.: 7.00   1st Qu.:11.00   1st Qu.:1.305   1st Qu.:0.00   1st Qu.:0.00  
##  Median :10.00   Median :13.00   Median :2.150   Median :0.00   Median :1.00  
##  Mean   : 9.81   Mean   :12.78   Mean   :2.202   Mean   :0.19   Mean   :0.61  
##  3rd Qu.:13.00   3rd Qu.:14.25   3rd Qu.:3.053   3rd Qu.:0.00   3rd Qu.:1.00  
##  Max.   :18.00   Max.   :19.00   Max.   :4.950   Max.   :1.00   Max.   :1.00  
##       x10              x11             x12            x13       
##  Min.   : 0.200   Min.   :10.00   Min.   :0.00   Min.   :0.000  
##  1st Qu.: 6.775   1st Qu.:28.25   1st Qu.:0.00   1st Qu.:1.200  
##  Median : 9.600   Median :41.70   Median :0.00   Median :2.650  
##  Mean   :10.821   Mean   :39.98   Mean   :0.29   Mean   :3.119  
##  3rd Qu.:15.075   3rd Qu.:51.02   3rd Qu.:1.00   3rd Qu.:4.600  
##  Max.   :23.200   Max.   :74.30   Max.   :1.00   Max.   :9.500  
##       x14             x15             x16             x17            x18       
##  Min.   :1.200   Min.   :2.000   Min.   :0.500   Min.   :0.00   Min.   : 59.0  
##  1st Qu.:3.875   1st Qu.:4.300   1st Qu.:4.300   1st Qu.:0.00   1st Qu.:339.0  
##  Median :5.300   Median :5.250   Median :5.600   Median :0.00   Median :487.5  
##  Mean   :5.146   Mean   :5.241   Mean   :5.521   Mean   :0.49   Mean   :485.7  
##  3rd Qu.:6.300   3rd Qu.:6.400   3rd Qu.:6.900   3rd Qu.:1.00   3rd Qu.:616.8  
##  Max.   :8.900   Max.   :9.700   Max.   :9.700   Max.   :1.00   Max.   :900.0  
##       x19              x20       
##  Min.   : 0.100   Min.   :38.80  
##  1st Qu.: 6.600   1st Qu.:53.48  
##  Median : 9.200   Median :60.95  
##  Mean   : 9.054   Mean   :61.16  
##  3rd Qu.:11.825   3rd Qu.:69.30  
##  Max.   :16.600   Max.   :81.40

Ejercicio 1

¿Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres?

Paso 1. Revisar las medias

aggregate(x10 ~ x2,
          data = datos,
          FUN = mean)
##   x2       x10
## 1  0  6.754902
## 2  1 15.053061

Paso 2. Hacer la prueba

prueba_01 <- t.test(x10 ~ x2,
                    data = datos,
                    alternative = "greater")

prueba_01
## 
##  Welch Two Sample t-test
## 
## data:  x10 by x2
## t = -13.53, df = 86.666, p-value = 1
## alternative hypothesis: true difference in means between group 0 and group 1 is greater than 0
## 95 percent confidence interval:
##  -9.31787      Inf
## sample estimates:
## mean in group 0 mean in group 1 
##        6.754902       15.053061

Paso 3. Comparar mujeres contra hombres

mujeres <- datos$x10[datos$x2 == 1]
hombres <- datos$x10[datos$x2 == 0]

prueba_01 <- t.test(mujeres,
                    hombres,
                    alternative = "greater")

prueba_01
## 
##  Welch Two Sample t-test
## 
## data:  mujeres and hombres
## t = 13.53, df = 86.666, p-value < 2.2e-16
## alternative hypothesis: true difference in means is greater than 0
## 95 percent confidence interval:
##  7.278448      Inf
## sample estimates:
## mean of x mean of y 
## 15.053061  6.754902

Paso 4. Hipotesis

H₀ — Hipótesis nula Las mujeres y los hombres dedican, en promedio, la misma cantidad de horas al trabajo doméstico y de cuidado.

En notación:

H₀: μₘujeres = μₕombres

La alternativa sería:

H₁: μₘujeres > μₕombres

Tipo de prueba

Prueba t para comparar dos medias independientes, unilateral.

Justificación

Se selecciona esta prueba porque queremos comparar el promedio de una variable numérica (x10, horas de trabajo doméstico y de cuidado) entre dos grupos independientes definidos por el sexo (x2: hombres y mujeres). Además, la pregunta plantea específicamente si las mujeres tienen un promedio mayor, por lo que la prueba es unilateral.

Paso 5. Interpretaciones

Interpretación hecha por IA: Existe evidencia estadística suficiente para rechazar la hipótesis nula (\(p < 0.05\)). Se concluye que el promedio de horas dedicadas al trabajo doméstico no remunerado es significativamente mayor en mujeres que en hombres en la población analizada.

Interpretación sin IA: Las mujeres pasan más tiempo haciendo tareas del hogar que los hombres, y la diferencia en los promedios es lo suficientemente grande como para no ser casualidad.

Ejercicio 2

¿La proporción que reporta discriminación laboral es igual entre quienes tienen pertenencia afro/indígena y quienes no?

Paso 1. Crear la variable y revisarla

datos$afro_indigena <- ifelse(datos$x3 == 0, 0, 1)

table(datos$afro_indigena)
## 
##  0  1 
## 59 41

Paso 2. Crear la tabla de contigencia

table(datos$afro_indigena, datos$x12)
##    
##      0  1
##   0 51  8
##   1 20 21

Paso 3. Hacer la prueba

afro_indigena <- sum(datos$afro_indigena ==1)
sin_pertenencia <- sum(datos$afro_indigena ==0)
discriminacion_afro <- sum(datos$x12 [datos$afro_indigena == 1] == 1)
discriminación_sin <- sum(datos$x12 [datos$afro_indigena == 0] ==1)
prueba_02 <- prop.test(
  x = c(discriminacion_afro, discriminación_sin),
  n = c(afro_indigena, sin_pertenencia),
  alternative = "two.sided"
)
prueba_02
## 
##  2-sample test for equality of proportions with continuity correction
## 
## data:  c(discriminacion_afro, discriminación_sin) out of c(afro_indigena, sin_pertenencia)
## X-squared = 14.884, df = 1, p-value = 0.0001143
## alternative hypothesis: two.sided
## 95 percent confidence interval:
##  0.1797478 0.5734560
## sample estimates:
##    prop 1    prop 2 
## 0.5121951 0.1355932

Paso 4. Hipotesis

H₀ — Hipótesis nula La proporción de personas que reportan discriminación laboral es igual en ambos grupos.

En notación:

H₀: pₐfro/indígena = pₛin pertenencia

La alternativa:

H₁: pₐfro/indígena ≠ pₛin pertenencia

Tipo de prueba

Prueba de comparación de dos proporciones.

Justificación Se utiliza porque la variable que queremos comparar (x12) es categórica y binaria: reportó discriminación o no reportó discriminación. Se comparan las proporciones entre dos grupos: personas afro/indígenas y personas sin pertenencia étnica declarada.

Paso 5. Interpretaciones

Interpretación hecha por IA: Se rechaza la hipótesis nula de igualdad de proporciones (\(p < 0.05\)). Se observa una diferencia estadísticamente significativa en las tasas reportadas de discriminación laboral entre personas con pertenencia afro/indígena y aquellas sin pertenencia étnica.

Interpretación sin IA: La cantidad de personas que sufren discriminación en el trabajo no es parecida en ambos grupos; las personas afro e indígenas reportan discriminación en una proporción distinta a las que no lo son.

Ejercicio 3

¿El ingreso laboral promedio es igual en los cinco quintiles socioeconómicos?

Paso 1. Revisar las medias

aggregate(x7 ~ x4,
          data = datos,
          FUN = mean)
##   x4        x7
## 1  1 0.9047368
## 2  2 1.6626316
## 3  3 2.1368000
## 4  4 2.8131579
## 5  5 3.5838889

Paso 2. Hacer el modelo ANOVA

modelo_anova <- aov(x7 ~ factor(x4),
                    data = datos)
summary(modelo_anova)
##             Df Sum Sq Mean Sq F value Pr(>F)    
## factor(x4)   4  79.08  19.770   46.97 <2e-16 ***
## Residuals   95  39.98   0.421                   
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Paso 3. Hipotesis

H₀ — Hipótesis nula El ingreso laboral promedio es igual en los cinco quintiles socioeconómicos.

En notación:

H₀: μ₁ = μ₂ = μ₃ = μ₄ = μ₅

La alternativa:

H₁: Al menos una media es diferente.

Tipo de prueba

ANOVA de un factor.

Justificación Se utiliza ANOVA porque queremos comparar el promedio de una variable numérica (x7, ingreso laboral) entre más de dos grupos: los cinco quintiles socioeconómicos (x4). ANOVA permite determinar si existe evidencia de que al menos uno de los promedios es diferente.

Paso 4. Interpretaciones

Interpretación hecha por IA: Existe una brecha digital estadísticamente significativa (\(p < 0.05\)) entre la población perteneciente a los quintiles más bajos (1–2) y los más altos (4–5), rechazando la hipótesis de equidad en la proporción de cobertura.

Interpretación sin IA: La oportunidad de tener internet en la casa cambia mucho si uno está en los quintiles más pobres o en los más ricos; no tienen la misma cobertura.

Ejercicio 4

¿El acceso a internet difiere entre los quintiles 1-2 y los quintiles 4-52 ?

###Paso 1. Crear los grupos socioeconómicos

datos$grupo_quintil <- ifelse(datos$x4 %in% c(1,2),
                              "Quintil_1_2",
                              ifelse(datos$x4 %in% c(4,5),
                                    "Quintil_4_5",
                                    NA))

Paso 2. Crear los grupos de interés (quintiles 1-2 y 4-5)

datos_ej4 <- subset(datos,
                    grupo_quintil %in% c("Quintil_1_2",
                                         "Quintil_4_5"))
table(datos_ej4$grupo_quintil,
      datos_ej4$x17)
##              
##                0  1
##   Quintil_1_2 29  9
##   Quintil_4_5  8 29

Paso 3. Hacer la prueba

internet_1_2 <- sum(datos_ej4$x17[datos_ej4$grupo_quintil == "Quintil_1_2"] == 1)

internet_4_5 <- sum(datos_ej4$x17[datos_ej4$grupo_quintil == "Quintil_4_5"] == 1)
n_1_2 <- sum(datos_ej4$grupo_quintil == "Quintil_1_2")

n_4_5 <- sum(datos_ej4$grupo_quintil == "Quintil_4_5")
prueba_04 <- prop.test(
  x = c(internet_1_2, internet_4_5),
  n = c(n_1_2, n_4_5),
  alternative = "two.sided"
)

prueba_04
## 
##  2-sample test for equality of proportions with continuity correction
## 
## data:  c(internet_1_2, internet_4_5) out of c(n_1_2, n_4_5)
## X-squared = 20.301, df = 1, p-value = 6.616e-06
## alternative hypothesis: two.sided
## 95 percent confidence interval:
##  -0.7629978 -0.3308855
## sample estimates:
##    prop 1    prop 2 
## 0.2368421 0.7837838

Paso 4. Hipotesis

H₀ — Hipótesis nula La proporción de personas con acceso estable a internet es igual entre los quintiles 1–2 y 4–5.

En notación:

H₀: p₁₋₂ = p₄₋₅

La alternativa:

H₁: p₁₋₂ ≠ p₄₋₅

Tipo de prueba

Prueba de comparación de dos proporciones.

Justificación Se utiliza porque queremos comparar el porcentaje de personas que tienen internet (x17) entre dos grupos de quintiles socioeconómicos: 1–2 y 4–5. Como el acceso a internet es una variable binaria (sí/no), lo que se compara son proporciones y no promedios.

Paso 5. Interpretaciones

Interpretación hecha por IA: El coeficiente de correlación de Pearson resulta estadísticamente significativo (\(p < 0.05\)), indicando una asociación lineal positiva entre la duración de los desplazamientos diarios y los niveles de estrés social reportados.

Interpretación sin IA: Entre más tiempo pasa una persona viajando o desplazándose en el día, tiende a registrar mayores niveles de estrés.

Ejercicio 5

¿Existe asociación lineal entre el tiempo diario de desplazamiento y el índice de estrés social en la población hipotética?

  • Variable explicativa (\(X\)): - Tiempo diario total de desplazamiento en minutos. Tipo: Cuantitativa continua.

  • Variable de respuesta (\(Y\)): -Índice de estrés social (escala de 0 a 10). Tipo: Cuantitativa continua.

  • Naturaleza del contraste: Relación lineal entre dos variables cuantitativas.

Paso 1. Tipo de prueba y justificación

Prueba seleccionada: Prueba de correlación lineal de Pearson (cor.test()).

  • Justificación: Se contrasta el grado de asociación lineal existente entre dos variables de naturaleza cuantitativa continua medidas sobre las mismas unidades muestrales.

Paso 2. Planteamiento de hipótesis

  • Hipótesis Nula (\(H_0\)): No existe correlación lineal entre el tiempo diario de desplazamiento y el índice de estrés social en la población hipotética. \(H_0: \rho = 0\)
  • Hipótesis Alternativa (\(H_1\)): Existe correlación lineal estadísticamente significativa entre el tiempo diario de desplazamiento y el índice de estrés social en la población hipotética. \(H_1: \rho \neq 0\)

Paso 3. Carga de datos y ejecución de la prueba en R

# Cargar la base de datos
summary(datos$x11)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   10.00   28.25   41.70   39.98   51.02   74.30
summary(datos$x14)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   1.200   3.875   5.300   5.146   6.300   8.900
# Ejecución de la prueba de correlación de Pearson
prueba_e5 <- cor.test(datos$x11, datos$x14, method = "pearson", conf.level = 0.95)

# Visualización de los resultados completos
print(prueba_e5)
## 
##  Pearson's product-moment correlation
## 
## data:  datos$x11 and datos$x14
## t = 10.699, df = 98, p-value < 2.2e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  0.6281428 0.8131817
## sample estimates:
##       cor 
## 0.7340009
estadistico_t <- round(as.numeric(prueba_e5$statistic), 4)
grados_libertad <- as.numeric(prueba_e5$parameter)
coeficiente_r <- round(as.numeric(prueba_e5$estimate), 4)
p_valor <- format.pval(prueba_e5$p.value, eps = 0.001)

cat("Estadístico t:", estadistico_t, "\n")
## Estadístico t: 10.699
cat("Grados de libertad:", grados_libertad, "\n")
## Grados de libertad: 98
cat("Coeficiente r estimado:", coeficiente_r, "\n")
## Coeficiente r estimado: 0.734
cat("p-valor:", p_valor, "\n")
## p-valor: < 0.001

###Paso 4. conclusiones H₀ — Hipótesis nula

No existe una asociación lineal entre el tiempo de desplazamiento y el estrés social.

En notación:

H₀: ρ = 0

La alternativa:

H₁: ρ ≠ 0

Tipo de prueba

Prueba de correlación de Pearson.

Justificación

Se utiliza porque queremos analizar la relación entre dos variables numéricas:

x11 → tiempo de desplazamiento. x14 → estrés social.

La correlación de Pearson permite determinar si existe una relación lineal entre ambas variables y conocer su dirección y fuerza mediante el coeficiente r.

Paso 5. Interpretaciones

Interpretación hecha por IA: El coeficiente de correlación de Pearson resulta estadísticamente significativo (\(p < 0.05\)), indicando una asociación lineal positiva entre la duración de los desplazamientos diarios y los niveles de estrés social reportados.

Interpretación sin IA: Entre más tiempo pasa una persona viajando o desplazándose en el día, tiende a registrar mayores niveles de estrés.

Ejercicio 6

¿Existe asociación lineal entre el trato injusto percibido y la confianza institucional en la población hipotética? * Variable explicativa (\(X\)): - Índice de trato injusto percibido en instituciones (0 a 10). Tipo: Cuantitativa continua. * Variable de respuesta (\(Y\)): - Índice de confianza institucional (0 a 10). Tipo: Cuantitativa continua.

  • Naturaleza del contraste: Relación lineal entre dos variables cuantitativas continuas.

Paso 1. Tipo de prueba y justificación

  • Prueba seleccionada: Prueba de correlación de Pearson (cor.test()).

  • Justificación: Se analiza el grado de asociación lineal conjunta entre dos variables continuas medidas sobre los mismos individuos.

Paso 2. Planteamiento de hipótesis

  • Hipótesis Nula (\(H_0\)): No existe correlación lineal entre el trato injusto percibido y la confianza institucional en la población hipotética. \(H_0: \rho = 0\)
  • Hipótesis Alternativa (\(H_1\)): Existe correlación lineal estadísticamente significativa entre el trato injusto percibido y la confianza institucional en la población hipotética. \(H_1: \rho \neq 0\)

Paso 3. Ejecución

# Resumen exploratorio de ambas variables
summary(datos$x13)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.000   1.200   2.650   3.119   4.600   9.500
summary(datos$x16)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.500   4.300   5.600   5.521   6.900   9.700
# Ejecución de la correlación de Pearson 
prueba_e6 <- cor.test(datos$x13, datos$x16, method = "pearson", conf.level = 0.95)

# Visualización completa del resultado
print(prueba_e6)
## 
##  Pearson's product-moment correlation
## 
## data:  datos$x13 and datos$x16
## t = -15.758, df = 98, p-value < 2.2e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  -0.8944298 -0.7801056
## sample estimates:
##       cor 
## -0.846775
# Extracción ordenada de métricas clave para la entrega
cat("Estadístico t:", round(as.numeric(prueba_e6$statistic), 4), "\n")
## Estadístico t: -15.7583
cat("Grados de libertad:", as.numeric(prueba_e6$parameter), "\n")
## Grados de libertad: 98
cat("Coeficiente r estimado:", round(as.numeric(prueba_e6$estimate), 4), "\n")
## Coeficiente r estimado: -0.8468
cat("p-valor:", format.pval(prueba_e6$p.value, eps = 0.001), "\n")
## p-valor: < 0.001

###Paso 4. conclusiones H₀ — Hipótesis nula

No existe una asociación lineal entre el trato injusto percibido y la confianza institucional.

En notación:

H₀: ρ = 0

La alternativa:

H₁: ρ ≠ 0

Tipo de prueba

Prueba de correlación de Pearson.

Justificación

Se utiliza porque ambas variables son numéricas:

x13 → índice de trato injusto percibido. x16 → índice de confianza institucional.

Pearson permite determinar si existe una relación lineal entre las dos variables y establecer si esta relación es positiva o negativa.

Paso 5. Interpretaciones

Interpretación hecha por IA: Se detecta una relación inversa o negativa altamente significativa (\(p < 0.05\)). Incrementos en la percepción de trato injusto se asocian de manera consistente con reducciones en la confianza institucional.

Interpretación sin IA: Cuando las personas sienten que las tratan de forma más injusta en las instituciones, confían mucho menos en ellas.

Ejercicio 7

¿Existe una diferencia en el puntaje promedio de la prueba estandarizada entre personas con y sin pertenencia étnica declarada en la población hipotética?

  • Variable explicativa (\(X\)): Condición étnica sintética agrupada (0 = Sin pertenencia; 1 = Afrodescendiente / Indígena, a partir de x3). Tipo: Categórica dicotómica (2 grupos).
  • Variable de respuesta (\(Y\)): - Puntaje en una prueba estandarizada de 0 a 100. Tipo: Cuantitativa continua.
  • Naturaleza del contraste: Comparación de medias entre dos grupos independientes.

Paso 1. Tipo de prueba y justificación

Prueba seleccionada: Prueba t de Student para dos muestras independientes (Prueba t de Welch). Justificación: Se compara una variable dependiente continua (\(Y\)) a través de dos grupos independientes definidos por una variable categórica dicotómica (\(X\)).

Paso 2. Planteamiento de hipótesis

Hipótesis Nula (\(H_0\)): El puntaje promedio en la prueba estandarizada es igual entre personas con pertenencia étnica y personas sin pertenencia étnica en la población hipotética. \(H_0: \mu_{\text{sin etnia}} = \mu_{\text{con etnia}}\) Hipótesis Alternativa (\(H_1\)): El puntaje promedio en la prueba estandarizada difiere entre ambos grupos en la población hipotética. \(H_1: \mu_{\text{sin etnia}} \neq \mu_{\text{con etnia}}\)

Paso 3. Ejecución de la prueba en R

# Agrupar pertenencia étnica: 0 = sin pertenencia, 1 o 2 = con pertenencia (afro/indígena)
datos$etnico_bin <- ifelse(datos$x3 == 0, 0, 1)
datos$etnico_factor <- factor(
  datos$etnico_bin, 
  levels = c(0, 1), 
  labels = c("Sin pertenencia", "Afro / Indígena")
)

# Promedios muestrales por grupo
tapply(datos$x20, datos$etnico_factor, mean)
## Sin pertenencia Afro / Indígena 
##        63.02881        58.46098
# Ejecución de la prueba t de dos muestras independientes
prueba_e7 <- t.test(x20 ~ etnico_factor, data = datos)

# Visualización completa del resultado
print(prueba_e7)
## 
##  Welch Two Sample t-test
## 
## data:  x20 by etnico_factor
## t = 2.3069, df = 87.73, p-value = 0.02342
## alternative hypothesis: true difference in means between group Sin pertenencia and group Afro / Indígena is not equal to 0
## 95 percent confidence interval:
##  0.6326958 8.5029801
## sample estimates:
## mean in group Sin pertenencia mean in group Afro / Indígena 
##                      63.02881                      58.46098
# Extracción ordenada de métricas clave
cat("Estadístico t:", round(as.numeric(prueba_e7$statistic), 4), "\n")
## Estadístico t: 2.3069
cat("Grados de libertad:", round(as.numeric(prueba_e7$parameter), 2), "\n")
## Grados de libertad: 87.73
cat("Media grupo sin pertenencia:", round(prueba_e7$estimate[1], 2), "\n")
## Media grupo sin pertenencia: 63.03
cat("Media grupo con pertenencia:", round(prueba_e7$estimate[2], 2), "\n")
## Media grupo con pertenencia: 58.46
cat("p-valor:", round(prueba_e7$p.value, 4), "\n")
## p-valor: 0.0234

##Paso 4. conclusiones H₀ — Hipótesis nula

El puntaje promedio de la prueba es igual entre las personas con pertenencia afro/indígena y quienes no declaran pertenencia étnica.

En notación:

H₀: μₐfro/indígena = μₛin pertenencia

La alternativa:

H₁: μₐfro/indígena ≠ μₛin pertenencia

Tipo de prueba

Prueba t para comparar dos medias independientes, bilateral.

Justificación

Se utiliza porque queremos comparar el promedio del puntaje de la prueba (x20) entre dos grupos independientes:

personas con pertenencia afro/indígena; personas sin pertenencia étnica declarada.

Además, la pregunta busca determinar si existe una diferencia, sin establecer desde el inicio que un grupo necesariamente tenga un promedio mayor.

Muy importante: encontrar una diferencia estadística no permite afirmar que la pertenencia étnica sea la causa de esa diferencia.

Paso 5. Interpretaciones

Interpretación hecha por IA: Se observa un rechazo de la hipótesis nula (\(p < 0.05\)), evidenciando una brecha de rendimiento estadísticamente significativa en los puntajes promedios de la prueba estandarizada según la pertenencia étnica declarada.

Interpretación sin IA: Las notas promedio de la prueba no son iguales entre las personas con pertenencia étnica y quienes no declaran pertenencia.

Ejercicio 8

¿La proporción de personas con acceso estable a internet en el hogar difiere según el sexo en la población hipotética?

  • Variable explicativa (\(X\)): - Sexo codificado (0 = Hombre, 1 = Mujer). Tipo: Categórica dicotómica (2 grupos).
  • Variable de respuesta (\(Y\)): - Acceso estable a internet en el hogar (0 = No, 1 = Sí). Tipo: Variable binaria.
  • Naturaleza del contraste: Comparación de proporciones entre dos grupos independientes.

Paso 1. Tipo de prueba y justificación

  • Prueba seleccionada: Prueba de Chi-cuadrado de independencia / Prueba de proporciones (chisq.test()).

  • Justificación: Se analiza la asociación entre dos variables categóricas dicotómicas (una binaria de respuesta y una de agrupación de dos niveles).

Paso 2. Planteamiento de hipótesis

Hipótesis Nula (\(H_0\)): La proporción de personas con acceso a internet en el hogar es igual entre hombres y mujeres en la población hipotética. \(H_0: p_{\text{hombres}} = p_{\text{mujeres}}\) Hipótesis Alternativa (\(H_1\)): La proporción de personas con acceso a internet en el hogar difiere según el sexo en la población hipotética. \(H_1: p_{\text{hombres}} \neq p_{\text{mujeres}}\)

Paso 3. Ejecución de la prueba en R

# Convertir las variables a factores con etiquetas
datos$sexo_f <- factor(datos$x2, levels = c(0, 1), labels = c("Hombre", "Mujer"))
datos$internet_f <- factor(datos$x17, levels = c(0, 1), labels = c("Sin Internet", "Con Internet"))

# Tabla de contingencia y proporciones muestrales
tabla_8 <- table(datos$sexo_f, datos$internet_f)
print(tabla_8)
##         
##          Sin Internet Con Internet
##   Hombre           26           25
##   Mujer            25           24
prop.table(tabla_8, margin = 1)
##         
##          Sin Internet Con Internet
##   Hombre    0.5098039    0.4901961
##   Mujer     0.5102041    0.4897959
# Ejecución de la prueba Chi-cuadrado
prueba_e8 <- chisq.test(tabla_8, correct = TRUE)
print(prueba_e8)
## 
##  Pearson's Chi-squared test with Yates' continuity correction
## 
## data:  tabla_8
## X-squared = 0, df = 1, p-value = 1
# Extracción ordenada de métricas clave
cat("Estadístico Chi-cuadrado:", round(as.numeric(prueba_e8$statistic), 4), "\n")
## Estadístico Chi-cuadrado: 0
cat("Grados de libertad:", as.numeric(prueba_e8$parameter), "\n")
## Grados de libertad: 1
cat("p-valor:", round(prueba_e8$p.value, 4), "\n")
## p-valor: 1

##Paso 4. conclusiones H₀ — Hipótesis nula

El acceso estable a internet es independiente del sexo; es decir, la proporción de personas con internet es igual entre hombres y mujeres.

En términos sencillos:

H₀: No existe asociación entre sexo e internet.

La alternativa:

H₁: Existe asociación entre sexo e internet.

Tipo de prueba

Prueba chi-cuadrado de independencia.

Justificación

Se utiliza porque tenemos dos variables categóricas:

x2 → sexo. x17 → acceso estable a internet.

La prueba chi-cuadrado permite determinar si existe una asociación estadísticamente significativa entre ambas variables. Este es también el procedimiento que aparece en el ejemplo de clase.

Paso 5. Interpretaciones

Interpretación hecha por IA: No se encuentra suficiente evidencia estadística para rechazar la hipótesis nula (\(p > 0.05\)). Las proporciones de acceso a internet entre hombres y mujeres se distribuyen de manera homogénea en la muestra.

Interpretación sin IA: Ser hombre o mujer no influye en tener o no internet en la casa; las proporciones son muy similares.

Ejercicio 9

¿Existe una relación entre la edad y el puntaje obtenido en la prueba estandarizada?

Paso 1. REVISAR LAS VARIABLES

summary(datos$x1)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   18.00   21.00   25.00   25.65   30.00   35.00
summary(datos$x20)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   38.80   53.48   60.95   61.16   69.30   81.40

##PASO 2. Hipotesis Hipótesis nula H0: ρ = 0 No existe una relación lineal entre edad y puntaje en la población. Hipótesis alternativa H1: ρ ≠ 0 Existe una relación lineal entre edad y puntaje en la población.

##Paso 3. Realizar la correlación de Pearson

prueba_09 <- cor.test(datos$x1,
                      datos$x20,
                      method = "pearson")

prueba_09
## 
##  Pearson's product-moment correlation
## 
## data:  datos$x1 and datos$x20
## t = 0.16018, df = 98, p-value = 0.8731
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  -0.1808140  0.2119233
## sample estimates:
##        cor 
## 0.01617866

Paso 4. Hipótesis

H₀ — Hipótesis nula

No existe una asociación lineal entre la edad y el puntaje de la prueba.

En notación:

H₀: ρ = 0

La alternativa:

H₁: ρ ≠ 0

Tipo de prueba

Prueba de correlación de Pearson.

Justificación

Se utiliza porque queremos analizar la relación entre dos variables numéricas:

x1 → edad. x20 → puntaje de la prueba.

Pearson permite determinar si existe una relación lineal estadísticamente significativa entre ambas.

Paso 5. Interpretaciones

Interpretación hecha por IA: Al obtener un \(p\)-valor superior a \(0.05\), no se rechaza la hipótesis nula. La edad del evaluado no presenta una relación lineal estadísticamente significativa con el puntaje obtenido.

Interpretación sin IA: Tener más o menos años no se relaciona de forma directa con sacar mejor o peor nota en la prueba.

Ejercicio 10

¿El ingreso laboral promedio difiere entre hombres y mujeres?

Paso 1. Identiifcar las variables

#X = x2: Sexo #Y = x7: Ingreso laboral

Paso 2. Revisar los datos

table(datos$x2) 
## 
##  0  1 
## 51 49
summary(datos$x7)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.600   1.305   2.150   2.202   3.053   4.950

Paso 3. Comparar las medias

aggregate(x7 ~ x2,
          data = datos,
          FUN = mean)
##   x2       x7
## 1  0 2.446275
## 2  1 1.946939
mean(datos$x7[datos$x2 == 0])
## [1] 2.446275
mean(datos$x7[datos$x2 ==1])
## [1] 1.946939

Paso 4. Hipotesis

H0 H0: μ_hombres = μ_mujeres H1 H1: μ_hombres ≠ μ_mujeres

Paso 5. Hacer la prueba T

prueba_10 <- t.test(x7 ~ x2,
                    data = datos)

prueba_10
## 
##  Welch Two Sample t-test
## 
## data:  x7 by x2
## t = 2.3245, df = 97.385, p-value = 0.02218
## alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
## 95 percent confidence interval:
##  0.07300978 0.92566168
## sample estimates:
## mean in group 0 mean in group 1 
##        2.446275        1.946939

Paso 6. Hipótesis

H₀ — Hipótesis nula

El ingreso laboral promedio es igual entre hombres y mujeres.

En notación:

H₀: μₕombres = μₘujeres

La alternativa:

H₁: μₕombres ≠ μₘujeres

Tipo de prueba

Prueba t para comparar dos medias independientes, bilateral.

Justificación

Se utiliza porque queremos comparar una variable numérica (x7, ingreso laboral) entre dos grupos independientes definidos por el sexo (x2). Como la pregunta plantea si el ingreso difiere, y no específicamente si es mayor en un grupo, se utiliza una prueba bilateral.

Paso 7. Interpretaciones

Interpretación hecha por IA: La prueba confirma diferencias estadísticamente significativas (\(p < 0.05\)) en el ingreso laboral medio según el género, confirmando la existencia de una brecha salarial en los datos.

Interpretación sin IA: Hombres y mujeres no ganan lo mismo en promedio; la prueba muestra que los ingresos varían de forma importante según el sexo.

Ejercicio 11

¿El ingreso laboral promedio difiere entre las personas con pertenencia afrodescendiente/indígena y las personas sin pertenencia étnica declarada?

Paso 1. Identificar la variable

X=x3 0 = sin pertenencia étnica declarada 1 = afrodescendiente 2 = indígena

Paso 2. Crear la variable

datos$afro_indigena <- ifelse(datos$x3 == 0, 0, 1)

0 → sin pertenencia étnica declarada

1 → afrodescendiente o indígena

table(datos$afro_indigena)
## 
##  0  1 
## 59 41

Paso 3. Revisar las medias

aggregate(x7 ~ afro_indigena,
          data = datos,
          FUN = mean)
##   afro_indigena       x7
## 1             0 2.608814
## 2             1 1.615610
mean(datos$x7[datos$afro_indigena == 0])
## [1] 2.608814
mean(datos$x7[datos$afro_indigena == 1])
## [1] 1.61561

Paso 4. Ejecutar la prueba

prueba_11 <- t.test(x7 ~ afro_indigena,
                    data = datos)

prueba_11
## 
##  Welch Two Sample t-test
## 
## data:  x7 by afro_indigena
## t = 5.0812, df = 93.008, p-value = 1.928e-06
## alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
## 95 percent confidence interval:
##  0.6050496 1.3813580
## sample estimates:
## mean in group 0 mean in group 1 
##        2.608814        1.615610

Paso 5. Hipotesis

H0

H0: μ_afro/indígena = μ_sin pertenencia

H1

H1: μ_afro/indígena ≠ μ_sin pertenencia H₀ — Hipótesis nula

El ingreso laboral promedio es igual entre las personas con pertenencia afro/indígena y quienes no declaran pertenencia étnica.

En notación:

H₀: μₐfro/indígena = μₛin pertenencia

La alternativa:

H₁: μₐfro/indígena ≠ μₛin pertenencia

Tipo de prueba

Prueba t para comparar dos medias independientes, bilateral.

Justificación

Se utiliza porque comparamos el promedio del ingreso laboral (x7) entre dos grupos independientes definidos a partir de x3: personas con pertenencia afro/indígena y personas sin pertenencia declarada.

Paso 6. Interpretaciones

Interpretación hecha por IA: Los resultados rechazan \(H_0\) (\(p < 0.05\)), concluyendo que existen disparidades significativas en la remuneración laboral promedio en función de la condición étnica declarada.

Interpretación sin IA: El dinero que reciben las personas por su trabajo es distinto entre quienes son afro o indígenas y quienes no pertenecen a esos grupos.

Ejercicio 12

¿Existe una relación entre las horas de estudio por semana y el puntaje obtenido en la prueba estandarizada?

Paso 1. Identificar X Y Y

#X = x19

Horas de estudio por semana

#Y = x20

Puntaje en prueba estandarizada

Paso 2. Revisar las variables

summary(datos$x19)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.100   6.600   9.200   9.054  11.825  16.600
summary(datos$x20)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   38.80   53.48   60.95   61.16   69.30   81.40

Paso 4. Hipotesis

H0

H0: ρ = 0

H1

H1: ρ ≠ 0

Paso 5. Ejecutar la prueba

prueba_12 <- cor.test(datos$x19,
                      datos$x20,
                      method = "pearson")

prueba_12
## 
##  Pearson's product-moment correlation
## 
## data:  datos$x19 and datos$x20
## t = 7.9437, df = 98, p-value = 3.345e-12
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  0.4896203 0.7322536
## sample estimates:
##       cor 
## 0.6258502

Paso 6. Interpretación

H₀ — Hipótesis nula

No existe una asociación lineal entre las horas semanales de estudio y el puntaje de la prueba.

En notación:

H₀: ρ = 0

La alternativa:

H₁: ρ ≠ 0

Tipo de prueba

Prueba de correlación de Pearson.

Justificación

Se utiliza porque las dos variables son numéricas:

x19 → horas semanales de estudio. x20 → puntaje de la prueba.

La prueba de Pearson permite determinar si existe una relación lineal entre ambas variables y medir su intensidad mediante el coeficiente de correlación.

Paso 6. Interpretaciones

Interpretación hecha por IA: Se valida una correlación lineal positiva directa y estadísticamente significativa (\(p < 0.05\)) entre la cantidad de horas semanales dedicadas al estudio y el puntaje alcanzado en el examen.

Interpretación sin IA: Dedicarle más horas al estudio en la semana sí ayuda a sacar un mejor puntaje en la prueba.

TABLA

library(knitr)

tabla_resumen <- data.frame(
  Ejercicio = 1:12,
  Prueba = c(
    "t de muestras independientes",
    "Comparación de dos proporciones",
    "ANOVA de un factor",
    "Comparación de dos proporciones",
    "Correlación de Pearson",
    "Correlación de Pearson",
    "t de Welch",
    "Chi-cuadrado",
    "Correlación de Pearson",
    "t de muestras independientes",
    "t de muestras independientes",
    "Correlación de Pearson"
  ),
  Decision = c(
    "Rechazar H0", "Rechazar H0", "Rechazar H0", "Rechazar H0",
    "Rechazar H0", "Rechazar H0", "Rechazar H0", "No rechazar H0",
    "No rechazar H0", "Rechazar H0", "Rechazar H0", "Rechazar H0"
  ),
  Interpretacion_sin_IA = c(
    "Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres.",
    "La proporción de personas discriminadas cambia según la pertenencia étnica.",
    "El ingreso medio cambia entre los distintos quintiles socioeconómicos.",
    "Tener internet es más común en los quintiles altos que en los bajos.",
    "A mayor tiempo viajando o desplazándose, mayor es el estrés registrado.",
    "Sentir un trato injusto disminuye la confianza que se le tiene a las instituciones.",
    "Los puntajes de la prueba cambian entre personas con y sin pertenencia étnica.",
    "El acceso a internet en el hogar es similar tanto para hombres como para mujeres.",
    "La edad no influye directamente en la nota que se obtiene en la prueba.",
    "Existe una brecha en los ingresos laborales promedio entre hombres y mujeres.",
    "El ingreso promedio difiere según la pertenencia étnica.",
    "Estudiar más horas a la semana se relaciona con obtener mejores notas."
  ),
  Interpretacion_hecha_por_IA = c(
    "Existe evidencia estadística de que las mujeres dedican un promedio significativamente mayor de horas al trabajo doméstico.",
    "Se evidencia una diferencia estadísticamente significativa en las proporciones de discriminación laboral reportadas.",
    "El ingreso laboral promedio difiere significativamente en al menos uno de los quintiles socioeconómicos.",
    "Se confirma una diferencia estadísticamente significativa en el acceso a internet entre quintiles extremos (1–2 vs 4–5).",
    "Existe una asociación lineal positiva estadísticamente significativa entre el tiempo de desplazamiento y el estrés social.",
    "Existe una correlación lineal negativa estadísticamente significativa entre el trato injusto percibido y la confianza institucional.",
    "Existe evidencia de una diferencia estadísticamente significativa en los puntajes promedios según la pertenencia étnica.",
    "No existe evidencia suficiente para afirmar que la proporción de acceso a internet difiera según el sexo.",
    "No existe evidencia estadística de una relación lineal significativa entre la edad y el puntaje alcanzado.",
    "Existe una diferencia estadísticamente significativa en el ingreso laboral medio entre hombres y mujeres.",
    "Existe una disparidad estadísticamente significativa en el ingreso medio según pertenencia étnica declarada.",
    "Existe una asociación lineal positiva estadísticamente significativa entre las horas de estudio semanales y el puntaje."
  )
)

kable(
  tabla_resumen,
  caption = "Resumen comparativo de los 12 ejercicios del taller",
  align = "c"
)
Resumen comparativo de los 12 ejercicios del taller
Ejercicio Prueba Decision Interpretacion_sin_IA Interpretacion_hecha_por_IA
1 t de muestras independientes Rechazar H0 Las mujeres dedican en promedio más horas al trabajo doméstico que los hombres. Existe evidencia estadística de que las mujeres dedican un promedio significativamente mayor de horas al trabajo doméstico.
2 Comparación de dos proporciones Rechazar H0 La proporción de personas discriminadas cambia según la pertenencia étnica. Se evidencia una diferencia estadísticamente significativa en las proporciones de discriminación laboral reportadas.
3 ANOVA de un factor Rechazar H0 El ingreso medio cambia entre los distintos quintiles socioeconómicos. El ingreso laboral promedio difiere significativamente en al menos uno de los quintiles socioeconómicos.
4 Comparación de dos proporciones Rechazar H0 Tener internet es más común en los quintiles altos que en los bajos. Se confirma una diferencia estadísticamente significativa en el acceso a internet entre quintiles extremos (1–2 vs 4–5).
5 Correlación de Pearson Rechazar H0 A mayor tiempo viajando o desplazándose, mayor es el estrés registrado. Existe una asociación lineal positiva estadísticamente significativa entre el tiempo de desplazamiento y el estrés social.
6 Correlación de Pearson Rechazar H0 Sentir un trato injusto disminuye la confianza que se le tiene a las instituciones. Existe una correlación lineal negativa estadísticamente significativa entre el trato injusto percibido y la confianza institucional.
7 t de Welch Rechazar H0 Los puntajes de la prueba cambian entre personas con y sin pertenencia étnica. Existe evidencia de una diferencia estadísticamente significativa en los puntajes promedios según la pertenencia étnica.
8 Chi-cuadrado No rechazar H0 El acceso a internet en el hogar es similar tanto para hombres como para mujeres. No existe evidencia suficiente para afirmar que la proporción de acceso a internet difiera según el sexo.
9 Correlación de Pearson No rechazar H0 La edad no influye directamente en la nota que se obtiene en la prueba. No existe evidencia estadística de una relación lineal significativa entre la edad y el puntaje alcanzado.
10 t de muestras independientes Rechazar H0 Existe una brecha en los ingresos laborales promedio entre hombres y mujeres. Existe una diferencia estadísticamente significativa en el ingreso laboral medio entre hombres y mujeres.
11 t de muestras independientes Rechazar H0 El ingreso promedio difiere según la pertenencia étnica. Existe una disparidad estadísticamente significativa en el ingreso medio según pertenencia étnica declarada.
12 Correlación de Pearson Rechazar H0 Estudiar más horas a la semana se relaciona con obtener mejores notas. Existe una asociación lineal positiva estadísticamente significativa entre las horas de estudio semanales y el puntaje.