Propósito

En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.

En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.

Trabajaremos principalmente con:

Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.

1. Recuperar nuestra base

Confirme que el objeto que contiene los datos de su entidad se llama base.

base_veracruz <- readRDS("base_veracruz.rds")
dim(base_veracruz)
## [1] 961 282

Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?

Entidad: Veracruz

Número de casos: 961

2. Recordar nuestra variable de satisfacción con la vida

En la práctica anterior generamos la variable numérica satisf_vida a partir de PA1.

Compruebe que sigue disponible:

str(base_veracruz$satisf_vida)
##  num [1:961] 7 8 9 7 8 7 10 3 9 10 ...
summary(base_veracruz$satisf_vida)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.000   8.000   9.000   8.454  10.000  10.000

Si no aparece en la base, vuelva a crearla:

base_veracruz$satisf_vida <- as.numeric(base_veracruz$PA1)

Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.

Media: 8.454

Mediana: 9.000

3. Tipos de variables

Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.

Ejecute:

str(base_veracruz$SEXO)
##  num [1:961] 2 1 1 2 1 1 1 1 2 2 ...
str(base_veracruz$EDAD)
##  num [1:961] 19 44 26 89 62 51 55 46 52 51 ...
str(base_veracruz$satisf_vida)
##  num [1:961] 7 8 9 7 8 7 10 3 9 10 ...
str(base_veracruz$PB1)
##  num [1:961] 4 4 4 3 4 4 3 4 3 4 ...

Complete:

Variable ¿Qué representa? Tipo de variable
SEXO Género del encuestado numérica
EDAD Edad del encuestado numérica
satisf_vida Satisfacción con la vida numérica
PB1 Salud autopercibida numérica

Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.

4. Satisfacción con la vida según sexo

Primero observe cuántos registros existen en cada categoría de SEXO.

table(base_veracruz$SEXO)
## 
##   1   2 
## 416 545

Ahora calcule la media de satisfacción con la vida para cada grupo:

tapply(base_veracruz$satisf_vida,
       base_veracruz$SEXO,
       mean,
       na.rm = TRUE)
##        1        2 
## 8.454327 8.453211

Calcule también la mediana:

tapply(base_veracruz$satisf_vida,
       base_veracruz$SEXO,
       median,
       na.rm = TRUE)
## 1 2 
## 9 9

Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?

Respuesta:
Los hombres tienen la media más alta respecto a su satisfacción con la vida, con un resultado de 8.454327.

Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.

Respuesta:
No es tan diferente porque los hombres tienen: 8.454327 y las mujeres tienen: 8.453211. Entonces solo son decimales de diferencia.

5. Una gráfica comparativa: boxplot

Construya un diagrama de caja:

boxplot(satisf_vida ~ SEXO,
        data = base_veracruz,
        xlab = "Sexo",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según sexo")

Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?

Respuesta:
El boxplot nos ayuda a observar mejor los valores numéricos por los cuales fueron medidas sus respuestas, por un lado están los hombres donde sus valores van del 0.3 al 4 y los valores de las mujeres van del 0 al 5.

6. Trabajar con la edad

Observe primero la distribución general de la edad:

summary(base_veracruz$EDAD)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   18.00   34.00   48.00   48.21   62.00   99.00

En lugar de trabajar únicamente con la edad exacta, construiremos grupos.

base_veracruz$grupo_edad <- cut(
  base_veracruz$EDAD,
  breaks = c(17, 29, 44, 59, 74, Inf),
  labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)

Compruebe cuántos casos quedaron en cada grupo:

table(base_veracruz$grupo_edad)
## 
## 18-29 30-44 45-59 60-74   75+ 
##   156   288   236   210    71

Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?

Respuesta:
El grupo de 30-44 años

7. Satisfacción con la vida según grupo de edad

Calcule la media por grupo de edad:

tapply(base_veracruz$satisf_vida,
       base_veracruz$grupo_edad,
       mean,
       na.rm = TRUE)
##    18-29    30-44    45-59    60-74      75+ 
## 8.589744 8.673611 8.224576 8.376190 8.253521

Calcule también la mediana:

tapply(base_veracruz$satisf_vida,
       base_veracruz$grupo_edad,
       median,
       na.rm = TRUE)
## 18-29 30-44 45-59 60-74   75+ 
##     9     9     9     9     9

Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?

Respuesta:
El grupo de 30-44 años con 8.673611.

Pregunta 8. ¿Cuál presenta la más baja?

Respuesta:
El grupo de 45-59 años con 8.224576.

Construya ahora un boxplot:

boxplot(satisf_vida ~ grupo_edad,
        data = base_veracruz,
        xlab = "Grupo de edad",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según grupo de edad")

Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.

Respuesta:
Muestra la media de todos los rangos de edad en 8, eso quiere decir que las personas en Veracruz gozan de un nivel alto de satisfacción con la vida. Los 3 primeros grupos de edad (18-19,30-44 y 45-59) Tienen un mismo nivel de satisfacción con la vida. Sin embargo a partir de los dos últimos grupos de edades (60-74 y 75+) los resultados son variados y por ende desiguales.

8. Comparar dos variables categóricas

Ahora trabajaremos con SEXO y PB1 (salud autopercibida).

Antes de analizarla, recuerde cómo está codificada PB1.

table(base_veracruz$PB1)
## 
##   1   2   3   4   5 
##  14  44 376 386 141

Pregunta 10. ¿Qué significan las categorías de PB1?

Respuesta:
1 significa una salud autopercibida muy mala, 2 significa mala y 3 significa regular. 4 significa buena, mientras que 5 significa una salud autopercibida muy buena.

Construya una tabla de contingencia:

tabla_salud <- table(base_veracruz$SEXO, base_veracruz$PB1)

tabla_salud
##    
##       1   2   3   4   5
##   1   5  19 136 193  63
##   2   9  25 240 193  78

La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:

prop.table(tabla_salud, 1) * 100
##    
##             1         2         3         4         5
##   1  1.201923  4.567308 32.692308 46.394231 15.144231
##   2  1.651376  4.587156 44.036697 35.412844 14.311927

Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?

Respuesta:
En el inciso 1 que significa muy mala salud autopercibida, los hombres tuvieron menos frecuencia (1.201923) de dicha respuesta respecto a las mujeres (1.651376). En el segundo inciso que significa mala salud autopercibida, lo mismo, los hombres tuvieron menos frecuencia (4.567308) de dicha respuesta con respecto a las mujeres (4.587156). Aunque se diferencien solo por decimales, son muy similares las respuestas. Mientras que en el inciso 3 referente a una salud autopercibida regular, los hombres (32.692308) y mujeres (44.036697) sí mantienen un diferencia considerable en las frecuencias absolutas. En el caso del número 4 que indica una buena salud autopercibida, los valores de las frecuencias de mención se intercambian, ahora los hombres (46.394231) tienen una frecuencia más alta a diferencia de las mujeres (35.412844). Por último, La respuesta 5 de salud autopercibida como muy buena es casi similar, los hombres( 15.144231) por poco tienen más frecuencia en esa respuesta a diferencia de las mujeres (14.311927).

9. Elegir una comparación propia

Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.

Puede utilizar, por ejemplo:

Variable elegida: PB4

¿Qué mide? frecuencia de soledad

Formule una pregunta comparativa.

Ejemplos:

Mi pregunta:
¿La frecuencia de soledad autopercibida incrementa con la edad?

Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:

tabla_soledad <- table(base_veracruz$EDAD, base_veracruz$PB4)

tabla_soledad
##     
##       1  2  3  4  5
##   18  7  2  0  0  0
##   19  5  3  6  1  0
##   20  5  3  2  0  0
##   21  7  4  1  1  1
##   22  9  9  0  0  0
##   23  5  3  0  0  0
##   24  5  3  3  1  0
##   25  7  5  1  0  0
##   26  8  2  4  0  0
##   27  8  7  1  1  1
##   28  9  3  2  0  0
##   29  6  2  1  1  1
##   30  5  8  1  0  1
##   31 14  6  0  2  0
##   32 13  5  2  0  0
##   33  9  3  2  1  0
##   34 13  3  0  0  1
##   35 10  3  2  1  0
##   36 15  6  5  2  0
##   37 13  4  4  0  0
##   38  8  3  3  2  1
##   39 15  4  4  1  1
##   40 16  6  3  1  0
##   41  6  4  0  0  0
##   42 13  4  3  0  2
##   43  5  4  3  0  0
##   44 13  3  5  1  0
##   45  4  1  2  0  0
##   46  8  6  1  0  1
##   47  4  1  2  0  0
##   48  7  3  4  0  0
##   49  5  4  2  1  0
##   50 18  8  1  0  2
##   51 12  4  1  0  0
##   52 12  1  3  1  0
##   53  7  4  1  1  0
##   54 13  2  3  0  0
##   55  9  4  3  1  0
##   56  6  4  5  0  0
##   57 12  5  2  2  0
##   58 11  2  5  1  1
##   59  6  1  3  0  3
##   60  7  1  3  2  2
##   61 12  5  2  0  2
##   62 16  5  3  1  0
##   63 16  4  0  1  0
##   64 13  1  1  2  2
##   65  7  3  2  0  1
##   66  5  1  2  0  0
##   67  6  3  1  0  0
##   68  4  2  3  1  1
##   69 10  2  5  1  0
##   70  9  3  2  2  0
##   71  3  2  2  0  0
##   72  5  2  1  0  1
##   73  7  4  0  0  0
##   74  3  1  1  0  1
##   75  5  3  0  0  1
##   76  3  2  0  2  2
##   77  3  2  0  0  0
##   78  4  3  2  0  0
##   79  1  1  0  1  0
##   80  4  0  1  0  1
##   81  1  1  1  0  0
##   82  3  0  1  1  0
##   83  2  0  0  0  0
##   84  0  2  2  0  0
##   85  1  1  1  0  0
##   86  1  0  0  0  0
##   87  1  1  0  0  0
##   88  1  0  1  0  0
##   89  0  1  2  0  0
##   90  1  0  0  0  0
##   92  0  1  0  0  0
##   95  0  0  0  1  0
##   99  0  1  0  1  0

Pregunta 12. ¿Qué encontró?

Respuesta:
No hay un incremento de soledad percibida de acuerdo con la edad,

10. Interpretación antropológica

Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.

Incluya:

  1. una diferencia observada por sexo;
  2. una diferencia observada por grupos de edad;
  3. una posible explicación antropológica o social;
  4. una aclaración sobre lo que estos resultados todavía no permiten afirmar.

Interpretación final:
Considero que en Veracruz los niveles de satisfacción con la vida de acuerdo a los grupos etarios presentados, son muy cercanos entre sí, habrá algunas variaciones pero no es algo determinante como para pensar que son los ancianos los más insatisfechos con la vida o que los jovenes son los más satisfechos con la vida. Lo mismo sucede con los hombres y mujeres, tienen valores casi similares, con diferencia de decimales. Lo cual puede explicar la vida en la periferia del país puede llegar a tener menos complicaciones que en las grandes urbes del país o en los estados colindantes con dichas metrópolis. En la periferia del país la situación suele estar más tranquila a nivel social, político y económico. Asimismo, la concentración de población en el centro del país suele causar más problema en las unidades habitacionales. En cambio, en la periferia o provincia, los espacios son más amplios y se concentra menos población, las distancias entre cada componente de los pueblos o ciudades pequeñas no es tanta en comparación con las ciudades grandes.

11. Comparación entre entidades durante la sesión

Al final de la práctica compartiremos algunos resultados en el grupo.

Prepare tres datos para comunicar en la sesión:

Observe qué tan similares o diferentes son los resultados entre entidades.

Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?

Cierre

Al terminar esta práctica deberá poder:

Para guardar su trabajo

Guarde el archivo con un nombre que permita identificarlo, por ejemplo:

Apellido_Nombre_Practica2_ENBIARE.Rmd

En esta práctica puede intentar generar el documento final con Knit → HTML.

Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.

Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.