En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.
En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.
Trabajaremos principalmente con:
SEXOEDADsatisf_vidaPB1 (salud autopercibida)Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.
Confirme que el objeto que contiene los datos de su entidad se llama
base.
base_veracruz <- readRDS("base_veracruz.rds")
dim(base_veracruz)
## [1] 961 282
Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?
Entidad: Veracruz
Número de casos: 961
En la práctica anterior generamos la variable numérica
satisf_vida a partir de PA1.
Compruebe que sigue disponible:
str(base_veracruz$satisf_vida)
## num [1:961] 7 8 9 7 8 7 10 3 9 10 ...
summary(base_veracruz$satisf_vida)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 0.000 8.000 9.000 8.454 10.000 10.000
Si no aparece en la base, vuelva a crearla:
base_veracruz$satisf_vida <- as.numeric(base_veracruz$PA1)
Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.
Media: 8.454
Mediana: 9.000
Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.
Ejecute:
str(base_veracruz$SEXO)
## num [1:961] 2 1 1 2 1 1 1 1 2 2 ...
str(base_veracruz$EDAD)
## num [1:961] 19 44 26 89 62 51 55 46 52 51 ...
str(base_veracruz$satisf_vida)
## num [1:961] 7 8 9 7 8 7 10 3 9 10 ...
str(base_veracruz$PB1)
## num [1:961] 4 4 4 3 4 4 3 4 3 4 ...
Complete:
| Variable | ¿Qué representa? | Tipo de variable |
|---|---|---|
SEXO |
Género del encuestado | numérica |
EDAD |
Edad del encuestado | numérica |
satisf_vida |
Satisfacción con la vida | numérica |
PB1 |
Salud autopercibida | numérica |
Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.
Primero observe cuántos registros existen en cada categoría de
SEXO.
table(base_veracruz$SEXO)
##
## 1 2
## 416 545
Ahora calcule la media de satisfacción con la vida para cada grupo:
tapply(base_veracruz$satisf_vida,
base_veracruz$SEXO,
mean,
na.rm = TRUE)
## 1 2
## 8.454327 8.453211
Calcule también la mediana:
tapply(base_veracruz$satisf_vida,
base_veracruz$SEXO,
median,
na.rm = TRUE)
## 1 2
## 9 9
Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?
Respuesta:
Los hombres tienen la media más alta respecto a su satisfacción con la
vida, con un resultado de 8.454327.
Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.
Respuesta:
No es tan diferente porque los hombres tienen: 8.454327 y las mujeres
tienen: 8.453211. Entonces solo son decimales de diferencia.
Construya un diagrama de caja:
boxplot(satisf_vida ~ SEXO,
data = base_veracruz,
xlab = "Sexo",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según sexo")
Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?
Respuesta:
El boxplot nos ayuda a observar mejor los valores numéricos por los
cuales fueron medidas sus respuestas, por un lado están los hombres
donde sus valores van del 0.3 al 4 y los valores de las mujeres van del
0 al 5.
Observe primero la distribución general de la edad:
summary(base_veracruz$EDAD)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 18.00 34.00 48.00 48.21 62.00 99.00
En lugar de trabajar únicamente con la edad exacta, construiremos grupos.
base_veracruz$grupo_edad <- cut(
base_veracruz$EDAD,
breaks = c(17, 29, 44, 59, 74, Inf),
labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)
Compruebe cuántos casos quedaron en cada grupo:
table(base_veracruz$grupo_edad)
##
## 18-29 30-44 45-59 60-74 75+
## 156 288 236 210 71
Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?
Respuesta:
El grupo de 30-44 años
Calcule la media por grupo de edad:
tapply(base_veracruz$satisf_vida,
base_veracruz$grupo_edad,
mean,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 8.589744 8.673611 8.224576 8.376190 8.253521
Calcule también la mediana:
tapply(base_veracruz$satisf_vida,
base_veracruz$grupo_edad,
median,
na.rm = TRUE)
## 18-29 30-44 45-59 60-74 75+
## 9 9 9 9 9
Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?
Respuesta:
El grupo de 30-44 años con 8.673611.
Pregunta 8. ¿Cuál presenta la más baja?
Respuesta:
El grupo de 45-59 años con 8.224576.
Construya ahora un boxplot:
boxplot(satisf_vida ~ grupo_edad,
data = base_veracruz,
xlab = "Grupo de edad",
ylab = "Satisfacción con la vida",
main = "Satisfacción con la vida según grupo de edad")
Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.
Respuesta:
Muestra la media de todos los rangos de edad en 8, eso quiere decir que
las personas en Veracruz gozan de un nivel alto de satisfacción con la
vida. Los 3 primeros grupos de edad (18-19,30-44 y 45-59) Tienen un
mismo nivel de satisfacción con la vida. Sin embargo a partir de los dos
últimos grupos de edades (60-74 y 75+) los resultados son variados y por
ende desiguales.
Ahora trabajaremos con SEXO y PB1 (salud
autopercibida).
Antes de analizarla, recuerde cómo está codificada
PB1.
table(base_veracruz$PB1)
##
## 1 2 3 4 5
## 14 44 376 386 141
Pregunta 10. ¿Qué significan las categorías de
PB1?
Respuesta:
1 significa una salud autopercibida muy mala, 2 significa mala y 3
significa regular. 4 significa buena, mientras que 5 significa una salud
autopercibida muy buena.
Construya una tabla de contingencia:
tabla_salud <- table(base_veracruz$SEXO, base_veracruz$PB1)
tabla_salud
##
## 1 2 3 4 5
## 1 5 19 136 193 63
## 2 9 25 240 193 78
La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:
prop.table(tabla_salud, 1) * 100
##
## 1 2 3 4 5
## 1 1.201923 4.567308 32.692308 46.394231 15.144231
## 2 1.651376 4.587156 44.036697 35.412844 14.311927
Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?
Respuesta:
En el inciso 1 que significa muy mala salud autopercibida, los hombres
tuvieron menos frecuencia (1.201923) de dicha respuesta respecto a las
mujeres (1.651376). En el segundo inciso que significa mala salud
autopercibida, lo mismo, los hombres tuvieron menos frecuencia
(4.567308) de dicha respuesta con respecto a las mujeres (4.587156).
Aunque se diferencien solo por decimales, son muy similares las
respuestas. Mientras que en el inciso 3 referente a una salud
autopercibida regular, los hombres (32.692308) y mujeres (44.036697) sí
mantienen un diferencia considerable en las frecuencias absolutas. En el
caso del número 4 que indica una buena salud autopercibida, los valores
de las frecuencias de mención se intercambian, ahora los hombres
(46.394231) tienen una frecuencia más alta a diferencia de las mujeres
(35.412844). Por último, La respuesta 5 de salud autopercibida como muy
buena es casi similar, los hombres( 15.144231) por poco tienen más
frecuencia en esa respuesta a diferencia de las mujeres (14.311927).
Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.
Puede utilizar, por ejemplo:
PB4: frecuencia de soledad.PC1: capacidad del hogar para llegar a fin de mes.PF1_1: confianza en la mayoría de la gente.Variable elegida: PB4
¿Qué mide? frecuencia de soledad
Formule una pregunta comparativa.
Ejemplos:
Mi pregunta:
¿La frecuencia de soledad autopercibida incrementa con la edad?
Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:
tabla_soledad <- table(base_veracruz$EDAD, base_veracruz$PB4)
tabla_soledad
##
## 1 2 3 4 5
## 18 7 2 0 0 0
## 19 5 3 6 1 0
## 20 5 3 2 0 0
## 21 7 4 1 1 1
## 22 9 9 0 0 0
## 23 5 3 0 0 0
## 24 5 3 3 1 0
## 25 7 5 1 0 0
## 26 8 2 4 0 0
## 27 8 7 1 1 1
## 28 9 3 2 0 0
## 29 6 2 1 1 1
## 30 5 8 1 0 1
## 31 14 6 0 2 0
## 32 13 5 2 0 0
## 33 9 3 2 1 0
## 34 13 3 0 0 1
## 35 10 3 2 1 0
## 36 15 6 5 2 0
## 37 13 4 4 0 0
## 38 8 3 3 2 1
## 39 15 4 4 1 1
## 40 16 6 3 1 0
## 41 6 4 0 0 0
## 42 13 4 3 0 2
## 43 5 4 3 0 0
## 44 13 3 5 1 0
## 45 4 1 2 0 0
## 46 8 6 1 0 1
## 47 4 1 2 0 0
## 48 7 3 4 0 0
## 49 5 4 2 1 0
## 50 18 8 1 0 2
## 51 12 4 1 0 0
## 52 12 1 3 1 0
## 53 7 4 1 1 0
## 54 13 2 3 0 0
## 55 9 4 3 1 0
## 56 6 4 5 0 0
## 57 12 5 2 2 0
## 58 11 2 5 1 1
## 59 6 1 3 0 3
## 60 7 1 3 2 2
## 61 12 5 2 0 2
## 62 16 5 3 1 0
## 63 16 4 0 1 0
## 64 13 1 1 2 2
## 65 7 3 2 0 1
## 66 5 1 2 0 0
## 67 6 3 1 0 0
## 68 4 2 3 1 1
## 69 10 2 5 1 0
## 70 9 3 2 2 0
## 71 3 2 2 0 0
## 72 5 2 1 0 1
## 73 7 4 0 0 0
## 74 3 1 1 0 1
## 75 5 3 0 0 1
## 76 3 2 0 2 2
## 77 3 2 0 0 0
## 78 4 3 2 0 0
## 79 1 1 0 1 0
## 80 4 0 1 0 1
## 81 1 1 1 0 0
## 82 3 0 1 1 0
## 83 2 0 0 0 0
## 84 0 2 2 0 0
## 85 1 1 1 0 0
## 86 1 0 0 0 0
## 87 1 1 0 0 0
## 88 1 0 1 0 0
## 89 0 1 2 0 0
## 90 1 0 0 0 0
## 92 0 1 0 0 0
## 95 0 0 0 1 0
## 99 0 1 0 1 0
Pregunta 12. ¿Qué encontró?
Respuesta:
No hay un incremento de soledad percibida de acuerdo con la edad,
Con base en los resultados obtenidos en esta práctica, redacte un comentario breve de 150 a 200 palabras.
Incluya:
Interpretación final:
Considero que en Veracruz los niveles de satisfacción con la vida de
acuerdo a los grupos etarios presentados, son muy cercanos entre sí,
habrá algunas variaciones pero no es algo determinante como para pensar
que son los ancianos los más insatisfechos con la vida o que los jovenes
son los más satisfechos con la vida. Lo mismo sucede con los hombres y
mujeres, tienen valores casi similares, con diferencia de decimales. Lo
cual puede explicar la vida en la periferia del país puede llegar a
tener menos complicaciones que en las grandes urbes del país o en los
estados colindantes con dichas metrópolis. En la periferia del país la
situación suele estar más tranquila a nivel social, político y
económico. Asimismo, la concentración de población en el centro del país
suele causar más problema en las unidades habitacionales. En cambio, en
la periferia o provincia, los espacios son más amplios y se concentra
menos población, las distancias entre cada componente de los pueblos o
ciudades pequeñas no es tanta en comparación con las ciudades
grandes.
Al final de la práctica compartiremos algunos resultados en el grupo.
Prepare tres datos para comunicar en la sesión:
Observe qué tan similares o diferentes son los resultados entre entidades.
Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?
Al terminar esta práctica deberá poder:
Guarde el archivo con un nombre que permita identificarlo, por ejemplo:
Apellido_Nombre_Practica2_ENBIARE.Rmd
En esta práctica puede intentar generar el documento final con Knit → HTML.
Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.
Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.