Propósito

En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.

En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.

Trabajaremos principalmente con:

Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.

1. Recuperar nuestra base

Confirme que el objeto que contiene los datos de su entidad se llama base_mex.

base_mex <- readRDS("base_mex.rds")
dim(base_mex)
## [1] 1025  276

Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?

Entidad: Estado de México

Número de casos: 1025 participantes

2. Recordar nuestra variable de satisfacción con la vida

En la práctica anterior generamos la variable numérica satisf_vida a partir de PA1.

Compruebe que sigue disponible:

str(base_mex$satisf_vida)
##  num [1:1025] 9 9 10 10 8 7 10 10 7 10 ...
summary(base_mex$satisf_vida)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##    1.00    8.00    9.00    8.55   10.00   10.00

Si no aparece en la base, vuelva a crearla: #Si apareció la base

Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.

Media: 8.55

Mediana: 9

3. Tipos de variables

Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.

Ejecute:

str(base_mex$SEXO)
##  num [1:1025] 2 1 2 2 2 2 1 1 1 2 ...
str(base_mex$EDAD)
##  num [1:1025] 30 50 37 37 54 68 40 37 59 72 ...
str(base_mex$satisf_vida)
##  num [1:1025] 9 9 10 10 8 7 10 10 7 10 ...
str(base_mex$PB1)
##  num [1:1025] 5 4 4 4 3 3 5 4 3 4 ...

Complete:

Variable ¿Qué representa? Tipo de variable
SEXO sexo de las personas (1=hombre y 2=mujer) variable numérica
EDAD edad de la persona variable numérica
satisf_vida ¿qué tan satisfecho se encuentra actualmente con su vida? variable numérica
PB1 ¿cómo considera su salud actualmente? variable numérica

Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.

4. Satisfacción con la vida según sexo

Primero observe cuántos registros existen en cada categoría de SEXO.

table(base_mex$SEXO)
## 
##   1   2 
## 470 555

Ahora calcule la media de satisfacción con la vida para cada grupo:

tapply(base_mex$satisf_vida,
       base_mex$SEXO,
       mean,
       na.rm = TRUE)
##        1        2 
## 8.634043 8.479279

Calcule también la mediana:

tapply(base_mex$satisf_vida,
       base_mex$SEXO,
       median,
       na.rm = TRUE)
## 1 2 
## 9 9

Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?

Respuesta:
Los hombres tienen una media más alta, con valor de 8.63.

Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.

Respuesta:
La diferencia parece pequeña, tienen una diferencia aproximada de dos decimales.

5. Una gráfica comparativa: boxplot

Construya un diagrama de caja:

boxplot(satisf_vida ~ SEXO,
        data = base_mex,
        xlab = "Sexo",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según sexo")

Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?

Respuesta:
El comportamiento de los grupos se aprecia de forma similar, sin embargo en las mujeres se observa un mayor número de valores atípicos ya que algunas eligieron la categoría 1, 2, 3 y 4 para evaluar su satisfacción con la vida. En los hombres hubo casos en los que se elegió la categoría 3 y 4. La gráfica permite ver la disperción de los datos y los valores extremos que no se apreciaban con el valor de la media.

6. Trabajar con la edad

Observe primero la distribución general de la edad:

summary(base_mex$EDAD)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   18.00   31.00   43.00   44.99   57.00   95.00

En lugar de trabajar únicamente con la edad exacta, construiremos grupos.

base_mex$grupo_edad <- cut(
  base_mex$EDAD,
  breaks = c(17, 29, 44, 59, 74, Inf),
  labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)

Compruebe cuántos casos quedaron en cada grupo:

table(base_mex$grupo_edad)
## 
## 18-29 30-44 45-59 60-74   75+ 
##   218   325   258   175    49

Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?

Respuesta:
El grupo de 30 a 44 años con 325 personas.

7. Satisfacción con la vida según grupo de edad

Calcule la media por grupo de edad:

tapply(base_mex$satisf_vida,
       base_mex$grupo_edad,
       mean,
       na.rm = TRUE)
##    18-29    30-44    45-59    60-74      75+ 
## 8.715596 8.630769 8.414729 8.502857 8.163265

Calcule también la mediana:

tapply(base_mex$satisf_vida,
       base_mex$grupo_edad,
       median,
       na.rm = TRUE)
## 18-29 30-44 45-59 60-74   75+ 
##     9     9     9     9     8

Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?

Respuesta:
El grupo etario más joven de 18 a 29 presentan una media de 8.71.

Pregunta 8. ¿Cuál presenta la más baja?

Respuesta:
El grupo etario más grande de 75 o más años, presentan una media de 8.16.

Construya ahora un boxplot:

boxplot(satisf_vida ~ grupo_edad,
        data = base_mex,
        xlab = "Grupo de edad",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según grupo de edad")

Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.

Respuesta:
La mayoría de los grupos de edad presentan una mediana de 9, sin embargo el grupo de 75 años y más tiene una mediana más baja con valor de 8, también en este grupo se presentan un rango más amplio de respuestas que van de 7 a 10, probablemente relacionado a problemas de salud.

8. Comparar dos variables categóricas

Ahora trabajaremos con SEXO y PB1 (salud autopercibida).

Antes de analizarla, recuerde cómo está codificada PB1.

table(base_mex$PB1)
## 
##   1   2   3   4   5 
##  10  34 357 468 156

Pregunta 10. ¿Qué significan las categorías de PB1?

Respuesta:
1=muy mala, 2=mala, 3=regular, 4=buena y 5=muy buena.La frecuencia absoluta más alta se encuentra en la categoría “buena” (con 468 personas) y lo que menos se repite es muy mala (10 personas).

Construya una tabla de contingencia:

tabla_salud <- table(base_mex$SEXO, base_mex$PB1)

tabla_salud
##    
##       1   2   3   4   5
##   1   6  13 132 241  78
##   2   4  21 225 227  78

La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:

prop.table(tabla_salud, 1) * 100
##    
##              1          2          3          4          5
##   1  1.2765957  2.7659574 28.0851064 51.2765957 16.5957447
##   2  0.7207207  3.7837838 40.5405405 40.9009009 14.0540541

Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?

Respuesta:
Los hombres se autoperciben con una mejor salud, ya que el 51.3% eligió la clasificación “buena” y el 16.6% “muy buena”; mientras que en las mujeres participantes, el 40.9% seleccionó la categoría “buena” y el 14% “muy buena”. También se observa que la categoría “muy mala” fue elegida por el 1.3% de los hombres y el 0.7% de las mujeres.

9. Elegir una comparación propia

Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.

Puede utilizar, por ejemplo:

Variable elegida: PC1

¿Qué mide? Capacidad del hogar para llegar a fin de mes

Formule una pregunta comparativa.

Ejemplos:

Mi pregunta:
¿Cómo se relaciona la capacidad para llegar a fin de mes con el sexo de los participantes?.

Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:

  tabla_mia <- table(base_mex$SEXO, base_mex$PC1)

  tabla_mia
##    
##       1   2   3   4   5   6
##   1  20  55  93 110 146  46
##   2  31  67 124 134 164  35

Pregunta 12. ¿Qué encontró?

Respuesta:
Los datos de frecuencia absoluta muestran un mayor número de casos de mujeres en todas las categorías, excepto en la 6=con mucha facilidad; ya que en esta hay 46 casos de hombres vs 35 de mujeres.En ambos sexos la mayoría de los datos se concentran en las categorías 3, 4 y 5 (con poca dificultad, con poca facilidad y con facilidad). Dado que en la encuesta hay más participantes mujeres, sería conveniente calcular los percentajes para identificar la proporción por sexo que se encuentra en cada una de las categorías.

10. Interpretación antropológica

Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.

Incluya:

  1. una diferencia observada por sexo;
  2. una diferencia observada por grupos de edad;
  3. una posible explicación antropológica o social;
  4. una aclaración sobre lo que estos resultados todavía no permiten afirmar.

Interpretación final:

En México una de las expresiones de desigualdad de género se muestra en la brecha salarial entre hombres y mujeres con preparación profesional y laboral similares; situaciones como la maternidad y actividades de cuidado en el hogar y con familiares, pueden influir en que las mujeres pausen o dediquen menos horas a las actividades económicas remuneradas. Por ello, es probable que al calcular los porcentajes con los datos de frecuencia absoluta presentados en la tabla, la proporción de hombres en las categorías 3, 4, 5 y 6 sean más altas que la de las mujeres. Sin embargo, lo anterior solo se podrá verificar cuando se realice el cálculo. Es importante mencionar que hay otros factores que pueden intervenir en la capacidad del hogar para llegar a fin de mes, como son el número de personas que contribuyen monetariamente en el ingreso familiar, la edad de la persona encuestada, e incluso puede influir si la persona participante es quien administra los recursos en el hogar y desde luego, la propia percepción del encuestado. .

11. Comparación entre entidades durante la sesión

Al final de la práctica compartiremos algunos resultados en el grupo.

Prepare tres datos para comunicar en la sesión:

Observe qué tan similares o diferentes son los resultados entre entidades.

Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?

Cierre

Al terminar esta práctica deberá poder:

Para guardar su trabajo

Guarde el archivo con un nombre que permita identificarlo, por ejemplo:

Apellido_Nombre_Practica2_ENBIARE.Rmd

En esta práctica puede intentar generar el documento final con Knit → HTML.

Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.

Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.