Propósito

En la Práctica 1 comenzamos a trabajar con la base de la Encuesta Nacional de Bienestar Autorreportado (ENBIARE) 2025 correspondiente a la entidad seleccionada por cada estudiante.

En esta segunda práctica continuaremos trabajando con la misma entidad y la misma base. El objetivo será dar un paso adicional: pasar de describir una sola variable a comparar grupos de población.

Trabajaremos principalmente con:

Importante: todavía no realizaremos pruebas de significancia estadística. Primero aprenderemos a describir y comparar resultados de manera correcta.

1. Recuperar nuestra base

Confirme que el objeto que contiene los datos de su entidad se llama base_gto.

setwd("~/Desktop/METODOLOGÍA CUANTITATIVA/ejercicio ENBIARE")
base_gto <- readRDS("base_gto.rds")
dim(base_gto)
## [1] 1013  276

Pregunta 1. ¿Qué entidad está analizando y cuántos casos contiene su base?

Entidad: Guanajuato

Número de casos: 1013 personas

2. Recordar nuestra variable de satisfacción con la vida

En la práctica anterior generamos la variable numérica satisf_vida a partir de PA1.

Compruebe que sigue disponible:

str(base_gto$satisf_vida)
##  num [1:1013] 3 10 10 10 8 9 9 9 9 9 ...
summary(base_gto$satisf_vida)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   0.000   8.000   9.000   8.554  10.000  10.000

Si no aparece en la base, vuelva a crearla:

base_gto$satisf_vida <- as.numeric(base_gto$PA1)

Pregunta 2. Registre nuevamente la media y la mediana de satisfacción con la vida en su entidad.

Media: 8.55

Mediana: 9.000

3. Tipos de variables

Antes de comparar grupos, identifique la naturaleza de las variables que utilizaremos.

Ejecute:

str(base_gto$SEXO)
##  num [1:1013] 2 1 2 1 2 2 1 2 1 2 ...
str(base_gto$EDAD)
##  num [1:1013] 43 65 56 56 30 24 35 40 19 70 ...
str(base_gto$satisf_vida)
##  num [1:1013] 3 10 10 10 8 9 9 9 9 9 ...
str(base_gto$PB1)
##  num [1:1013] 3 5 4 3 3 5 4 4 4 5 ...

Complete:

Variable ¿Qué representa? Tipo de variable
SEXO sexo de las personas (1=hombre, 2=mujer) numérica
EDAD edad en las personas numérica
satisf_vida En una escala de 0 a 10, ¿qué tan satisfecha(o) se encuentra actualmente con su vida?
PB1 En general, ¿cómo considera su salud actualmente?

Para esta práctica basta distinguir entre variables categóricas y cuantitativas. Más adelante revisaremos con mayor detalle las escalas de medición.

4. Satisfacción con la vida según sexo

Primero observe cuántos registros existen en cada categoría de SEXO.

table(base_gto$SEXO)
## 
##   1   2 
## 434 579

Ahora calcule la media de satisfacción con la vida para cada grupo:

tapply(base_gto$satisf_vida,
       base_gto$SEXO,
       mean,
       na.rm = TRUE)
##        1        2 
## 8.732719 8.419689

Calcule también la mediana:

tapply(base_gto$satisf_vida,
       base_gto$SEXO,
       median,
       na.rm = TRUE)
## 1 2 
## 9 9

Pregunta 3. ¿Qué grupo presenta la media más alta de satisfacción con la vida?

Respuesta:
En Guanajuato los hombres son más felices (8.73) que las mujeres (8.41)

Pregunta 4. ¿La diferencia entre los grupos parece grande o pequeña? Descríbala sin hablar todavía de significancia estadística.

Respuesta:
La diferencia es pequeña entre los hombres y mujeres, este diferencias es por 3 decimales

5. Una gráfica comparativa: boxplot

Construya un diagrama de caja:

boxplot(satisf_vida ~ SEXO,
        data = base_gto,
        xlab = "Sexo",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según sexo")

Pregunta 5. Observe la posición de las medianas, la dispersión y los valores extremos. ¿Qué información aporta el boxplot que no se aprecia únicamente comparando las medias?

Respuesta:
El comportamiento de los datos entre hombres y mujeres es muy similar; la mediana es igual, la disperción es igual y los valores externos son los mismos.

6. Trabajar con la edad

Observe primero la distribución general de la edad:

summary(base_gto$EDAD)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   18.00   31.00   43.00   45.17   57.00   90.00

En lugar de trabajar únicamente con la edad exacta, construiremos grupos.

base_gto$grupo_edad <- cut(
  base_gto$EDAD,
  breaks = c(17, 29, 44, 59, 74, Inf),
  labels = c("18-29", "30-44", "45-59", "60-74", "75+")
)

Compruebe cuántos casos quedaron en cada grupo:

table(base_gto$grupo_edad)
## 
## 18-29 30-44 45-59 60-74   75+ 
##   221   307   263   154    68

Pregunta 6. ¿Cuál es el grupo de edad con mayor número de casos en su entidad?

Respuesta:
En Guanajuato el grupo de edad con mayor número de casos es de 30-44 con 307 personas

7. Satisfacción con la vida según grupo de edad

Calcule la media por grupo de edad:

tapply(base_gto$satisf_vida,
       base_gto$grupo_edad,
       mean,
       na.rm = TRUE)
##    18-29    30-44    45-59    60-74      75+ 
## 8.642534 8.736156 8.406844 8.551948 8.014706

Calcule también la mediana:

tapply(base_gto$satisf_vida,
       base_gto$grupo_edad,
       median,
       na.rm = TRUE)
## 18-29 30-44 45-59 60-74   75+ 
##     9     9     9     9     9

Pregunta 7. ¿Qué grupo presenta la media de satisfacción con la vida más alta?

Respuesta:
En Guanajuato el grupo de edad que representa la media de satisfacción con la vida más alta es de 30-44. (8.73)

Pregunta 8. ¿Cuál presenta la más baja?

Respuesta:
En Guanajuato el grupo de edad que representa la media de satisfacción con la vida más baja es de 75 o más. (8.01)

Construya ahora un boxplot:

boxplot(satisf_vida ~ grupo_edad,
        data = base_gto,
        xlab = "Grupo de edad",
        ylab = "Satisfacción con la vida",
        main = "Satisfacción con la vida según grupo de edad")

Pregunta 9. Describa el patrón general que observa entre edad y satisfacción con la vida.

Respuesta:
-En el plotbox se puede interpretar que en el rango de edades donde se encuentran más valores atípicos es en el de 45-59, y en el que se encuentra menos es en el de 60-74. -La mediana en todos los rangos de edades es de 9. -El Límite inferior de todos es igual (5) a excepción del rango de edad más avanzado de 75+ con 4. - Para todos los rangos de edad el rango intercuartil es de 8 a 10, a excpeción del rango de 75+ que es de 7 al 10.

8. Comparar dos variables categóricas

Ahora trabajaremos con SEXO y PB1 (salud autopercibida).

Antes de analizarla, recuerde cómo está codificada PB1.

table(base_gto$PB1)
## 
##   1   2   3   4   5 
##  13  30 323 453 194

Pregunta 10. ¿Qué significan las categorías de PB1?

Respuesta:
En general, ¿cómo considera su salud actualmente? 1 Muy mala 2 Mala 3 Regular 4 Buena 5 Muy buena

Lo que más se repite es la categoría 4-Buena (453) y la que menos se repite es 1-Muy Mala (13)

Construya una tabla de contingencia:

tabla_salud <- table(base_gto$SEXO, base_gto$PB1)

tabla_salud
##    
##       1   2   3   4   5
##   1   4  15 104 212  99
##   2   9  15 219 241  95

La tabla anterior muestra frecuencias absolutas. Para facilitar la comparación entre los grupos, obtenga porcentajes por fila:

prop.table(tabla_salud, 1) * 100
##    
##             1         2         3         4         5
##   1  0.921659  3.456221 23.963134 48.847926 22.811060
##   2  1.554404  2.590674 37.823834 41.623489 16.407599

Pregunta 11. ¿Qué diferencias observa en la salud autopercibida según sexo?

Respuesta:
En Guanajuato tanto los hombres (48.8%) como las mujeres (41.6%) consideran su salud como “buena”. Ambos son los valores más altos por género.

9. Elegir una comparación propia

Seleccione ahora una variable adicional de ENBIARE que considere interesante para su proyecto o para una pregunta antropológica.

Puede utilizar, por ejemplo:

Variable elegida: PC1 Capacidad del hogar para llegar a fin de mes

¿Qué mide? La variable PC1 mide con que tanta dificultad se logran cubrir los gastos en la casa para poder llegar a fin de mes en términos económimcos de la familia.

Formule una pregunta comparativa.

Ejemplos:

Mi pregunta:
- ¿La capacidad para llegar a fin de mes cubriendo los gastos habituales será más dificil para hombres o para las mujeres?

Obtenga una tabla o un resumen adecuado. Escriba su código en el siguiente bloque:

tabla_salud <- table(base_gto$SEXO, base_gto$PC1)

tabla_salud
##    
##       1   2   3   4   5   6
##   1  18  58  77 102 131  48
##   2  41  94 104 104 178  58

Pregunta 12. ¿Qué encontró?

Respuesta:
Se puede ver que, con la representatividad en Guanajuato, a la mayoría de la población tanto de hombres como mujeres llegan “con facilidad” a fin de mes, les es fácil cubrir los gastos del hogar. También es importante resalta que al género que “llega con más dificultad” a fin de mes es a las mujeres.

10. Interpretación antropológica

El caso de Guanajuato ha resultado sumamente interesante de analizar desde la perspectiva cualitativa. Sin quitar el dedo del renglón sobre que es una región del país sumamente religiosa, hay ciertos fenómenos sociales que son dignos de resaltar bajo los ejes que hemos trabajado en las primeras dos prácticas. En los resultados de esta segunda práctica resalta que fueron intervenidos en la encuesta más mujeres que hombres (del total que son 1013 casos, 579 fueron mujeres y 434 fueron hombres), y cuando se realizó el cruce con la variable de satisfacción de vida encontramos que la media de hombres en tanto a satisfacción de vida es de 8.73, mientras que la de las mujeres es de 8.41 (esto medido en una escala del 0 al 10 donde 0 es “totalmente insatisfecho” y 10 es “totalmente satisfecho” ). En la ultima variable analizada sobre la capacidad de llegar a fin de mes que cruzamos con el sexo, encontramos que a ambos sexos se les facilita llegar a fin de mes cubriendo los gastos esenciales del hogar (en una medición del 1 al 6 donde 1 es “con mucha dificultad” y 6 es “con mucha facilidad”) teniendo los hombres 131 casos y las mujeres 178 en el número 5 de las opciones, que es “con facilidad”. Resaltar que a las mujeres es el sexo que más se le dificulta llegar a fin de mes, con 41 casos en la categoría 1 que es “con mucha dificultad”. Me parece sensato entender que haya más mujeres que hombres en el muestreo de Gto dado que en México si hay más mujeres que hombres, lo cual cuadra muy bien con la representatividad. Considero que una posible explicación antropológica y, sobre todo, social, al aspecto de la satisfacción de vida es que México es una nación con mucha violencia hacia las mujeres, en todos los aspectos, incluyendo la seguridad, lo laboral, etc. Sería interesante analizar que tipo de trabajos son los que realizan las mujeres en Gto, comparar los salarios ganados entre hombres y mujeres para comprender tambien porque les es más complicado llegar a fin de mes.

Incluya:

  1. una diferencia observada por sexo;
  2. una diferencia observada por grupos de edad;
  3. una posible explicación antropológica o social;
  4. una aclaración sobre lo que estos resultados todavía no permiten afirmar.

Interpretación final:
Con los resultados que nos arrojo el análisis de la base de datos de Gto, es interesante observar que tiene una satisfacción de vida buena, a pesar de ser un estado de la república violento. Considero que la religión -y la fe- juegan un papel importante en la percepción de vida general en Guanajuato.

11. Comparación entre entidades durante la sesión

Al final de la práctica compartiremos algunos resultados en el grupo.

Prepare tres datos para comunicar en la sesión:

Observe qué tan similares o diferentes son los resultados entre entidades.

Pregunta para discusión: si diferentes entidades muestran patrones distintos, ¿qué factores sociales, culturales, económicos o demográficos podrían estar relacionados con esas diferencias?

Cierre

Al terminar esta práctica deberá poder:

Para guardar su trabajo

Guarde el archivo con un nombre que permita identificarlo, por ejemplo:

Apellido_Nombre_Practica2_ENBIARE.Rmd

En esta práctica puede intentar generar el documento final con Knit → HTML.

Si al generar el documento aparece algún error, no borre el código ni empiece de nuevo. Revise el mensaje de error y consérvelo para comentarlo durante la sesión.

Nota metodológica: en esta práctica seguimos trabajando con los registros de la muestra de ENBIARE correspondientes a cada entidad. Las medias y porcentajes calculados aquí son descriptivos de esos registros. Más adelante incorporaremos el factor de expansión y el diseño muestral para producir estimaciones poblacionales.