En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.
En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.
Trabajaremos principalmente con:
SEXOEDADsatisf_vidaPB1 (salud autopercibida)Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.
Confirme que el objeto que contiene los datos de su entidad se llama
base_tbc
load("C:/Users/HP Envy/Desktop/Tanya María/1 ENAH 2026/Maestría/materias/Metodologia cuanti/Práctica 2/base.RData")
load("C:/Users/HP Envy/Desktop/Tanya María/1 ENAH 2026/Maestría/materias/Metodologia cuanti/Práctica 2/base_tbc.RData")
Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?
Entidad: Tabasco
Número de casos: 1029
En la práctica anterior generamos la variable numérica
satisf_vida a partir de PA1.
Compruebe que sigue disponible:
str(base_tbc$satisf_vida)
## num [1:1029] 8 10 10 10 6 8 10 9 10 10 ...
summary(base_tbc$satisf_vida)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.000 8.000 9.000 8.325 10.000 10.000
Si no aparece en la base, vuelva a crearla:
base_tbc$satisf_vida <- as.numeric(base_tbc$PA1)
Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.
Media: 8.32
Mediana: 9
Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.
Ejecute:
str(base_tbc$SEXO)
## num [1:1029] 2 2 2 2 2 1 2 2 2 1 ...
str(base_tbc$EDAD)
## num [1:1029] 29 76 78 42 65 43 47 52 32 18 ...
str(base_tbc$satisf_vida)
## num [1:1029] 8 10 10 10 6 8 10 9 10 10 ...
str(base_tbc$PB1)
## num [1:1029] 2 3 3 5 3 3 4 4 5 5 ...
Complete:
| Variable | ¿Qué representa? | Tipo de variable |
|---|---|---|
SEXO |
sexo del participante (1=hombre, 2=mujer) | numérica |
EDAD |
# edad del participante | numérica |
satisf_vida |
nivel de satisfacción de vida del participante | numérica |
PB1 |
salud autopercibida de cada participante | categórica |
Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.
Primero observe cuántos registros existen en cada categoría de
SEXO.
table(base_tbc$SEXO)
##
## 1 2
## 478 551
Ahora calcule la media de satisfacción con la vida para cada grupo:
tapply(base_tbc$satisf_vida,
base_tbc$SEXO,
mean,
na.rm = TRUE)
## 1 2
## 8.430962 8.232305
Calcule también la mediana:
tapply(base_tbc$satisf_vida,
base_tbc$SEXO,
median,
na.rm = TRUE)
## 1 2
## 9 9
Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?
Respuesta:
Hombres
Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.
Respuesta:
Pequeña (0.20)
Construya un diagrama de caja:
boxplot(satisf_vida ~ SEXO,
data = base_tbc,
xlab = "Sexo",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según sexo")
Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?
Respuesta:
Permite ver la disperción de los datos con mayor detalle. de lo que
podemos concluir que, ambos grupos tienen una media y datos atípicos muy
similares. Lo mismo para el nivel de dispersión, se comportan de un modo
muy semejante
Observe primero la distribución general de la edad:
summary(base_tbc$EDAD)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.00 31.00 43.00 45.23 59.00 99.00
En lugar de trabajar únicamente con la edad exacta, construiremos grupos.
base_tbc$grupo_edad <- cut(
base_tbc$EDAD,
breaks = c(17, 29, 44, 59, 74, Inf),
labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)
Compruebe cuántos casos quedaron en cada grupo:
table(base_tbc$grupo_edad)
##
## 18-29 30-44 45-59 60-74 75+
## 218 336 229 183 63
Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?
Respuesta:
Personas de 30 a 44, con un número de 336
Calcule la media por grupo de edad:
tapply(base_tbc$satisf_vida,
base_tbc$grupo_edad,
mean,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 8.500000 8.401786 8.192140 8.185792 8.190476
Calcule también la mediana:
tapply(base_tbc$satisf_vida,
base_tbc$grupo_edad,
median,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 9 9 8 9 9
Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?
Respuesta:
Las personas de 18 a 29 años
Pregunta 8. ¿Cuál presenta la más baja?
Respuesta:
Las personas de 60 a 74 años
Construya ahora un boxplot:
boxplot(satisf_vida ~ grupo_edad,
data = base_tbc,
xlab = "Grupo de edad",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según grupo de edad")
Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.
Respuesta:
A grandes rasgos, el grado de satisfacción con la vida va disminuyendo
con forme pasan los años
Ahora trabajaremos con SEXO y PB1 (salud
autopercibida).
Antes de analizarla, recuerde cómo está codificada
PB1.
table(base_tbc$PB1)
##
## 1 2 3 4 5
## 10 46 392 414 167
Pregunta 10. ¿Qué significan las categorías de
PB1?
Respuesta:
1= muy mala 2= mala 3= regular 4= buena 5= muy buena
Lo que más se repite es la categoría “regular”
Construya una tabla de contingencia:
tabla_salud <- table(base_tbc$SEXO, base_tbc$PB1)
tabla_salud
##
## 1 2 3 4 5
## 1 3 17 163 200 95
## 2 7 29 229 214 72
La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila (1=filas; 2=columnas):
prop.table(tabla_salud, 1) * 100
##
## 1 2 3 4 5
## 1 0.6276151 3.5564854 34.1004184 41.8410042 19.8744770
## 2 1.2704174 5.2631579 41.5607985 38.8384755 13.0671506
Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?
Respuesta:
Los hombres tienen un mayor número de aciertos en la categoría de bien y
muy bien, las mujeres en muy mala, mala y regular. Por lo tanto, los
hombres se autoperciben más saludables que las mujeres
Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.
Puede utilizar, por ejemplo:
PB4: frecuencia de soledad.PC1: capacidad del hogar para llegar a fin de mes.PF1_1: confianza en la mayoría de la gente.Variable elegida: Confianza en la mayoría de la gente
¿Qué mide? Nivel de confianza que se le tiene a los demás individuos
Formule una pregunta comparativa.
Ejemplos:
Mi pregunta:
¿La confianza reportada en otros individuos presenta diferencias según
el sexo?
Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:
summary(base_tbc$PF1_1)
## Length N.unique N.blank Min.nchar Max.nchar
## 1029 11 0 2 2
Pregunta 12. ¿Qué encontró?
Respuesta:
Escriba aquí su interpretación.
Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.
Incluya:
Interpretación final:
Escriba aquí su texto.
Al final de la práctica compartiremos algunos resultados en el grupo.
Prepare tres datos para comunicar en la sesión:
Observe qué tan similares o diferentes son los resultados entre entidades.
Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?
Al terminar esta práctica deberá poder:
Guarde el archivo con un nombre que permita identificarlo, por ejemplo:
Apellido_Nombre_Practica2_ENBIARE.Rmd
En esta práctica puede intentar generar el documento final con Knit → HTML.
Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.
Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.