Propósito

En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.

En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.

Trabajaremos principalmente con:

Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.

1. Recuperar nuestra base

Confirme que el objeto que contiene los datos de su entidad se llama base.

base=readRDS("base_chi.rds")
dim(base)
## [1] 991 275

Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?

Entidad: Chihuahua

Número de casos: 991

2. Recordar nuestra variable de satisfacción con la vida

En la práctica anterior generamos la variable numérica satisf_vida a partir de PA1.

Compruebe que sigue disponible:

base$satisf_vida=as.numeric(base$PA1)
str(base$satisf_vida)
##  num [1:991] 9 8 10 8 8 10 10 7 10 10 ...
summary(base$satisf_vida)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.000   8.000   9.000   8.642  10.000  10.000

Si no aparece en la base, vuelva a crearla:

base$satisf_vida <- as.numeric(base$PA1)

Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.

Media: 8.642

Mediana: 9

3. Tipos de variables

Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.

Ejecute:

str(base$SEXO)
##  num [1:991] 2 1 1 1 2 2 1 1 2 2 ...
str(base$EDAD)
##  num [1:991] 63 29 49 38 54 53 30 23 71 28 ...
str(base$satisf_vida)
##  num [1:991] 9 8 10 8 8 10 10 7 10 10 ...
str(base$PB1)
##  num [1:991] 4 3 4 4 3 3 3 3 4 4 ...

Complete:

Variable ¿Qué representa? Tipo de variable
SEXO Sexo de la persona Categórica
EDAD Edad de la persona Cuantitativa
satisf_vida Que tan satisfecho está la persona con su vida Cuantitativa
PB1 Salud autopercibida Categórica

Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.

4. Satisfacción con la vida según sexo

Primero observe cuántos registros existen en cada categoría de SEXO.

table(base$SEXO)
## 
##   1   2 
## 473 518

Ahora calcule la media de satisfacción con la vida para cada grupo:

tapply(base$satisf_vida,
       base$SEXO,
       mean,
       na.rm = TRUE)
##        1        2 
## 8.718816 8.571429

Calcule también la mediana:

tapply(base$satisf_vida,
       base$SEXO,
       median,
       na.rm = TRUE)
## 1 2 
## 9 9

Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?

Respuesta:
El grupo 1 (hombres) presenta la media más alta de satisfacción con la vida, con 8.71, frente a al grupo 2 (mujeres) con 8.57.

Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.

Respuesta:
La diferencia entre ambos grupos parece pequeña. La media del grupo 1 es aproximadamente 0.15 puntos mayor que la del grupo 2, en una escala de 0 a 10. Además, abos grupos tienen la misma mediana, de 9, por lo que descriptivamente sus niveles de satisfacción con la vida son muy similares.

5. Una gráfica comparativa: boxplot

Construya un diagrama de caja:

boxplot(satisf_vida ~ SEXO,
        data = base,
        xlab = "Sexo",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según sexo")

Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?

Respuesta:
Los dos grupos presentan una distribución muy similar. En ambos, la mediana es 9 y la mitad central de las respuestas se concentra aproximadamente entre 8 y 10. También se observan valores atípicos bajos en ambos grupos, pero son más numerosos y más extremos en el grupo 1. El boxplot nos permite ver no sólo el valor central, sino también la dispersión de las respuestas y la presencia de casos extremos, información que no se aprecia al comparar únicamente las medias.

6. Trabajar con la edad

Observe primero la distribución general de la edad:

summary(base$EDAD)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   18.00   30.00   42.00   43.59   55.00   92.00

En lugar de trabajar únicamente con la edad exacta, construiremos grupos.

base$grupo_edad <- cut(
  base$EDAD,
  breaks = c(17, 29, 44, 59, 74, Inf),
  labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)

Compruebe cuántos casos quedaron en cada grupo:

table(base$grupo_edad)
## 
## 18-29 30-44 45-59 60-74   75+ 
##   246   299   254   146    46

Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?

Respuesta:
El grupo de edad de 30 a 44 años, con 299 personas.

7. Satisfacción con la vida según grupo de edad

Calcule la media por grupo de edad:

tapply(base$satisf_vida,
       base$grupo_edad,
       mean,
       na.rm = TRUE)
##    18-29    30-44    45-59    60-74      75+ 
## 8.560976 8.782609 8.696850 8.431507 8.521739

Calcule también la mediana:

tapply(base$satisf_vida,
       base$grupo_edad,
       median,
       na.rm = TRUE)
## 18-29 30-44 45-59 60-74   75+ 
##     9     9     9     9     9

Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?

Respuesta:
El grupo de 30 a 44 años de edad, con una media aproximada de 8.76

Pregunta 8. ¿Cuál presenta la más baja?

Respuesta:
El grupo de 60 a 74 años de edad, con una media aproximada de 8.43

Construya ahora un boxplot:

boxplot(satisf_vida ~ grupo_edad,
        data = base,
        xlab = "Grupo de edad",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según grupo de edad")

Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.

Respuesta:
En general, la satisfacción con la vida es alta y bastante similar entre distintos grupos de edad. El grupo de 30 a 44 años presenta la media mas alta, mientras que el de 60 a 74 años presenta la más baja, aunque las diferencias son pequeñas. En todos los grupos la mediana es de 9, por lo qe no se observa una relación lineal clara entre mayor edad y mayor o menor satisfacción. Las diferencias parecen concentrarse más en algunos valores bajos o atípicos que en el centro de las distribuciones.

8. Comparar dos variables categóricas

Ahora trabajaremos con SEXO y PB1 (salud autopercibida).

Antes de analizarla, recuerde cómo está codificada PB1.

table(base$PB1)
## 
##   1   2   3   4   5 
##  14  39 292 446 200

Pregunta 10. ¿Qué significan las categorías de PB1?

Respuesta:
1= muy mala (14) 2= mala (39) 3= regular (292) 4= Buena (446) 5= muy buena (200)

Construya una tabla de contingencia:

tabla_salud <- table(base$SEXO, base$PB1)

tabla_salud
##    
##       1   2   3   4   5
##   1   7  11 116 230 109
##   2   7  28 176 216  91

La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:

prop.table(tabla_salud, 1) * 100
##    
##             1         2         3         4         5
##   1  1.479915  2.325581 24.524313 48.625793 23.044397
##   2  1.351351  5.405405 33.976834 41.698842 17.567568

Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?

Respuesta:
Se observan diferencias entre los dos grupos en la salud autopercibida. El grupo 1 (hombres) concentra una mayor proporción de respuestas en “buena” y “muy buena” salud (48.63% y 23.04%), mientras que en el grupo 2 (mujeres) estas porcentajes son menores (41.70% y 17.57%). En cambio, el grupo 2 presenta una mayor proporción de respuesta de salud “regular” y “mala”. DScriptivamente el grupo 1 (hombres) tiende a reportar una mejor percepción de su salud que el grupo 2 (mujeres)

9. Elegir una comparación propia

Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.

Puede utilizar, por ejemplo:

Variable elegida: PB4

¿Qué mide? La frecuencia con la que la persona reporta sentirse sola

Formule una pregunta comparativa.

Ejemplos:

Mi pregunta:
¿La frecuencia con que las personas reportan sentirse solas varía entre los distintos grupos de edad?

Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:

tabla_soledad=
table(base$grupo_edad,
base$PB4)
tabla_soledad
##        
##           1   2   3   4   5
##   18-29 122  72  37  10   5
##   30-44 176  68  37   7  11
##   45-59 143  50  33  16  12
##   60-74  77  34  18   8   9
##   75+    31   6   7   1   1
prop.table(tabla_soledad,1)* 100
##        
##                 1         2         3         4         5
##   18-29 49.593496 29.268293 15.040650  4.065041  2.032520
##   30-44 58.862876 22.742475 12.374582  2.341137  3.678930
##   45-59 56.299213 19.685039 12.992126  6.299213  4.724409
##   60-74 52.739726 23.287671 12.328767  5.479452  6.164384
##   75+   67.391304 13.043478 15.217391  2.173913  2.173913

Pregunta 12. ¿Qué encontró?

Respuesta:
El grupo de 75 años y más presenta la menor frecuencia de soledad reportada, mientras que el grupo de 60 a 74 años presenta la mayor proporción en las categorías de mayor frecuencia de soledad. Sin embargo, en todos los grupos de edad la respuesta más frecuente fue “nunca”por lo que en esta muestra no se observa que la soledad aumente de manera progresiva con la edad.Lo únicoq que debemos tomar con cautela en esta intepretación, ya que el grupo de 75+ tiene sólo 46 personas, bastante menos que los demás, así que conviene no hacer una conclusión demasiado fuerte con ese grupo.

10. Interpretación antropológica

Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.

Incluya:

  1. una diferencia observada por sexo;
  2. una diferencia observada por grupos de edad;
  3. una posible explicación antropológica o social;
  4. una aclaración sobre lo que estos resultados todavía no permiten afirmar.

Interpretación final:

Los resultados nos permiten observar que existen algunas diferencias según sexo y edad, aunque en general no son muy grandes. En satisfacción con la vida, ambos grupos de sexo presentan una mediana de 9, aunque el grupo 1 tiene una media ligeramente mayor que el grupo 2. También observamos diferencias en la salud autopercibida: el grupo 1 concentra una mayor proporción de respuestas de buena y muy buena salud. Por edad, la satisfacción con la vida se mantiene relativamente alta en todos los grupos; el grupo 30 a 44 años presenta la media más alta y el de 60 a 74 la más baja. Además, al analizar la soledad, no encontramos qué esta aumente de manera directa con la edad.Estas diferencias podrían relacionarse con condicioens sociales distintas a lo largo del curso de la vida, como las redes de apoyo, las responsabilidades familiares, las condiciones económicas o las experiencias de género. Sin embargo, estos resultados son descriptivos y no permiten afirmar que el sexo o la edad causen estas diferencias ni que éstas sean estadísticamente significativas.

11. Comparación entre entidades durante la sesión

Al final de la práctica compartiremos algunos resultados en el grupo.

Prepare tres datos para comunicar en la sesión:

Observe qué tan similares o diferentes son los resultados entre entidades.

Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?

Cierre

Al terminar esta práctica deberá poder:

Para guardar su trabajo

Guarde el archivo con un nombre que permita identificarlo, por ejemplo:

Apellido_Nombre_Practica2_ENBIARE.Rmd

En esta práctica puede intentar generar el documento final con Knit → HTML.

Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.

Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.