En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.
En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.
Trabajaremos principalmente con:
SEXOEDADsatisf_vidaPB1 (salud autopercibida)Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.
Confirme que el objeto que contiene los datos de su entidad se llama
base_mex.
base_mex <- readRDS("base_mex.rds")
dim(base_mex)
## [1] 1025 276
Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?
Entidad: Estado de México
Número de casos: 1025 participantes
En la práctica anterior generamos la variable numérica
satisf_vida a partir de PA1.
Compruebe que sigue disponible:
str(base_mex$satisf_vida)
## num [1:1025] 9 9 10 10 8 7 10 10 7 10 ...
summary(base_mex$satisf_vida)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 1.00 8.00 9.00 8.55 10.00 10.00
Si no aparece en la base, vuelva a crearla: #Si apareció la base
Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.
Media: 8.55
Mediana: 9
Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.
Ejecute:
str(base_mex$SEXO)
## num [1:1025] 2 1 2 2 2 2 1 1 1 2 ...
str(base_mex$EDAD)
## num [1:1025] 30 50 37 37 54 68 40 37 59 72 ...
str(base_mex$satisf_vida)
## num [1:1025] 9 9 10 10 8 7 10 10 7 10 ...
str(base_mex$PB1)
## num [1:1025] 5 4 4 4 3 3 5 4 3 4 ...
Complete:
| Variable | ¿Qué representa? | Tipo de variable |
|---|---|---|
SEXO |
sexo de las personas (1=hombre y 2=mujer) | variable numérica |
EDAD |
edad de la persona | variable numérica |
satisf_vida |
¿qué tan satisfecho se encuentra actualmente con su vida? | variable numérica |
PB1 |
¿cómo considera su salud actualmente? | variable numérica |
Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.
Primero observe cuántos registros existen en cada categoría de
SEXO.
table(base_mex$SEXO)
##
## 1 2
## 470 555
Ahora calcule la media de satisfacción con la vida para cada grupo:
tapply(base_mex$satisf_vida,
base_mex$SEXO,
mean,
na.rm = TRUE)
## 1 2
## 8.634043 8.479279
Calcule también la mediana:
tapply(base_mex$satisf_vida,
base_mex$SEXO,
median,
na.rm = TRUE)
## 1 2
## 9 9
Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?
Respuesta:
Los hombres tienen una media más alta, con valor de 8.63.
Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.
Respuesta:
La diferencia parece pequeña, tienen una diferencia aproximada de dos
decimales.
Construya un diagrama de caja:
boxplot(satisf_vida ~ SEXO,
data = base_mex,
xlab = "Sexo",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según sexo")
Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?
Respuesta:
El comportamiento de los grupos se aprecia de forma similar, sin embargo
en las mujeres se observa un mayor número de valores atípicos ya que
algunas eligieron la categoría 1, 2, 3 y 4 para evaluar su satisfacción
con la vida. En los hombres hubo casos en los que se elegió la categoría
3 y 4. La gráfica permite ver la disperción de los datos y los valores
extremos que no se apreciaban con el valor de la media.
Observe primero la distribución general de la edad:
summary(base_mex$EDAD)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.00 31.00 43.00 44.99 57.00 95.00
En lugar de trabajar únicamente con la edad exacta, construiremos grupos.
base_mex$grupo_edad <- cut(
base_mex$EDAD,
breaks = c(17, 29, 44, 59, 74, Inf),
labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)
Compruebe cuántos casos quedaron en cada grupo:
table(base_mex$grupo_edad)
##
## 18-29 30-44 45-59 60-74 75+
## 218 325 258 175 49
Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?
Respuesta:
El grupo de 30 a 44 años con 325 personas.
Calcule la media por grupo de edad:
tapply(base_mex$satisf_vida,
base_mex$grupo_edad,
mean,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 8.715596 8.630769 8.414729 8.502857 8.163265
Calcule también la mediana:
tapply(base_mex$satisf_vida,
base_mex$grupo_edad,
median,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 9 9 9 9 8
Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?
Respuesta:
El grupo etario más joven de 18 a 29 presentan una media de 8.71.
Pregunta 8. ¿Cuál presenta la más baja?
Respuesta:
El grupo etario más grande de 75 o más años, presentan una media de
8.16.
Construya ahora un boxplot:
boxplot(satisf_vida ~ grupo_edad,
data = base_mex,
xlab = "Grupo de edad",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según grupo de edad")
Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.
Respuesta:
La mayoría de los grupos de edad presentan una mediana de 9, sin embargo
el grupo de 75 años y más tiene una mediana más baja con valor de 8,
también en este grupo se presentan un rango más amplio de respuestas que
van de 7 a 10, probablemente relacionado a problemas de salud.
Ahora trabajaremos con SEXO y PB1 (salud
autopercibida).
Antes de analizarla, recuerde cómo está codificada
PB1.
table(base_mex$PB1)
##
## 1 2 3 4 5
## 10 34 357 468 156
Pregunta 10. ¿Qué significan las categorías de
PB1?
Respuesta:
1=muy mala, 2=mala, 3=regular, 4=buena y 5=muy buena.La frecuencia
absoluta más alta se encuentra en la categoría “buena” (con 468
personas) y lo que menos se repite es muy mala (10 personas).
Construya una tabla de contingencia:
tabla_salud <- table(base_mex$SEXO, base_mex$PB1)
tabla_salud
##
## 1 2 3 4 5
## 1 6 13 132 241 78
## 2 4 21 225 227 78
La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:
prop.table(tabla_salud, 1) * 100
##
## 1 2 3 4 5
## 1 1.2765957 2.7659574 28.0851064 51.2765957 16.5957447
## 2 0.7207207 3.7837838 40.5405405 40.9009009 14.0540541
Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?
Respuesta:
Los hombres se autoperciben con una mejor salud, ya que el 51.3% eligió
la clasificación “buena” y el 16.6% “muy buena”; mientras que en las
mujeres participantes, el 40.9% seleccionó la categoría “buena” y el 14%
“muy buena”. También se observa que la categoría “muy mala” fue elegida
por el 1.3% de los hombres y el 0.7% de las mujeres.
Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.
Puede utilizar, por ejemplo:
PB4: frecuencia de soledad.PC1: capacidad del hogar para llegar a fin de mes.PF1_1: confianza en la mayoría de la gente.Variable elegida: PC1
¿Qué mide? Capacidad del hogar para llegar a fin de mes
Formule una pregunta comparativa.
Ejemplos:
Mi pregunta:
¿Cómo se relaciona la capacidad para llegar a fin de mes con el sexo de
los participantes?.
Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:
tabla_mia <- table(base_mex$SEXO, base_mex$PC1)
tabla_mia
##
## 1 2 3 4 5 6
## 1 20 55 93 110 146 46
## 2 31 67 124 134 164 35
Pregunta 12. ¿Qué encontró?
Respuesta:
Los datos de frecuencia absoluta muestran un mayor número de casos de
mujeres en todas las categorías, excepto en la 6=con mucha facilidad; ya
que en esta hay 46 casos de hombres vs 35 de mujeres.En ambos sexos la
mayoría de los datos se concentran en las categorías 3, 4 y 5 (con poca
dificultad, con poca facilidad y con facilidad). Dado que en la encuesta
hay más participantes mujeres, sería conveniente calcular los
percentajes para identificar la proporción por sexo que se encuentra en
cada una de las categorías.
Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.
Incluya:
Interpretación final:
En México una de las expresiones de desigualdad de género se muestra en la brecha salarial entre hombres y mujeres con preparación profesional y laboral similares; situaciones como la maternidad y actividades de cuidado en el hogar y con familiares, pueden influir en que las mujeres pausen o dediquen menos horas a las actividades económicas remuneradas. Por ello, es probable que al calcular los porcentajes con los datos de frecuencia absoluta presentados en la tabla, la proporción de hombres en las categorías 3, 4, 5 y 6 sean más altas que la de las mujeres. Sin embargo, lo anterior solo se podrá verificar cuando se realice el cálculo. Es importante mencionar que hay otros factores que pueden intervenir en la capacidad del hogar para llegar a fin de mes, como son el número de personas que contribuyen monetariamente en el ingreso familiar, la edad de la persona encuestada, e incluso puede influir si la persona participante es quien administra los recursos en el hogar y desde luego, la propia percepción del encuestado. .
Al final de la práctica compartiremos algunos resultados en el grupo.
Prepare tres datos para comunicar en la sesión:
Observe qué tan similares o diferentes son los resultados entre entidades.
Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?
Al terminar esta práctica deberá poder:
Guarde el archivo con un nombre que permita identificarlo, por ejemplo:
Apellido_Nombre_Practica2_ENBIARE.Rmd
En esta práctica puede intentar generar el documento final con Knit → HTML.
Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.
Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.