Análisis descriptivo de la variable Smoke según Gender y Region en la base de datos Survey

Estadística Inferencial
Proyecto 1 — Grupo 06

Integrantes: Valeria Ortiz · Angie Serrano · Laura Guevara · Maria Angel Gutiérrez

Profesor: Humberto Llinás Solano

Fecha de entrega: 29 de agosto de 2026

Resumen

Este trabajo realiza un análisis estadístico descriptivo sobre los hábitos de fumadores y su relación con el género y la región de residencia, utilizando la base de datos survey del paquete lsm de R. Se seleccionó una muestra de 150 observaciones, analizando las variables cualitativas Gender, Region y Smoke. La metodología correspondió a estadística descriptiva: tablas de distribución de frecuencias absolutas y relativas por variable, tablas de contingencia cruzando Gender–Smoke, Gender–Region y Smoke–Region con proporciones por fila, y gráficos de barras elaborados en ggplot2. Los resultados muestran una muestra compuesta por 52.7 % de hombres y 47.3 % de mujeres, distribuida en las regiones Center (34 %), North (30 %) y South (36 %). El 46 % de la muestra reportó fumar, frente a un 54 % que no fuma. Al cruzar Smoke con Gender y con Region, las proporciones de fumadores resultaron muy similares entre categorías (entre 44 % y 47 % aproximadamente), sin diferencias marcadas. Esto evidencia que, en la muestra analizada, el hábito de fumar se distribuye de manera homogénea entre géneros y regiones, sin indicios de una asociación fuerte. Se concluye que, a nivel descriptivo, ni el género ni la región parecen estar asociados con la condición de fumador, aunque confirmarlo de forma rigurosa requeriría estadística inferencial, como una prueba de independencia Chi-cuadrado.

Palabras clave

Estadística descriptiva Tabaquismo Tablas de contingencia Variables cualitativas Distribución de frecuencias

Introducción

El tabaquismo continúa siendo, en la actualidad, uno de los principales factores de riesgo prevenibles para la salud pública a nivel mundial, al estar asociado directamente con enfermedades cardiovasculares, respiratorias y oncológicas (Rincón Castillo et al., 2014). Comprender cómo se distribuye este hábito dentro de una población, y si dicha distribución varía según características como el género o el lugar de residencia, resulta relevante tanto para el diseño de políticas de prevención como para la planeación de estrategias de intervención en salud pública focalizadas. Este es precisamente el problema que aborda el presente trabajo: describir, a partir de una muestra de la base de datos survey, cómo se comporta la variable Smoke (condición de fumador) y si existen patrones diferenciales asociados a Gender y Region.

Los antecedentes sobre el tema muestran que la relación entre el hábito de fumar y el género ha sido documentada de forma extensa en la literatura epidemiológica, aunque con resultados que no siempre apuntan en la misma dirección. Por un lado, algunos estudios poblacionales han encontrado que las consecuencias en la salud derivadas del consumo de cigarrillo tienden a manifestarse más tardíamente en las mujeres que en los hombres, debido a diferencias en el momento de inicio y en la cronología del consumo entre ambos grupos, lo que ha llevado a distinguir con cuidado entre los conceptos de género (una construcción sociocultural) y sexo (una condición biológica) al momento de analizar este tipo de datos (Nerín, 2005). En la misma línea, se ha señalado que el abordaje del tabaquismo femenino requiere un enfoque diferenciado, dado que en ciertos contextos las mujeres jóvenes llegan a mostrar tasas de consumo incluso superiores a las de los hombres de su misma edad (De la Rosa & Otero, 2004). Por otro lado, estudios realizados en poblaciones laborales específicas han reportado el patrón contrario: una mayor proporción de fumadoras que de fumadores dentro de la muestra analizada (Rincón Castillo et al., 2014), lo que sugiere que la relación entre género y tabaquismo puede depender fuertemente del contexto poblacional y sociocultural estudiado, y no responde a un patrón universal.

A nivel de cifras globales más recientes, los reportes técnicos de la Organización Mundial de la Salud confirman que, aunque la prevalencia mundial del tabaquismo ha descendido de manera sostenida en las últimas dos décadas, el consumo continúa siendo marcadamente más alto entre los hombres que entre las mujeres, correspondiendo a población masculina más de cuatro de cada cinco consumidores de tabaco en el mundo (Organización Mundial de la Salud [OMS], 2025). Esta asimetría a nivel global contrasta con los hallazgos de estudios locales como el mencionado anteriormente, y refuerza la pertinencia de examinar la relación entre Gender y Smoke en muestras concretas, en lugar de asumir que los patrones globales se replican de manera automática en cualquier población.Desde el punto de vista metodológico, este tipo de preguntas —relacionar variables cualitativas nominales como Gender, Region y Smoke— se abordan apropiadamente mediante herramientas de estadística descriptiva las cuales permiten explorar de forma organizada si dos variables categóricas parecen estar asociadas antes de recurrir a pruebas de estadística inferencial (Triola, 2018).

La importancia de este estudio radica en que ofrece una primera caracterización, de carácter descriptivo, de los hábitos de fumadores en la muestra seleccionada de la base survey, y de su relación aparente con el género y la región de residencia. Con base en lo anterior, el objetivo general de este trabajo es realizar un análisis estadístico descriptivo de la variable Smoke en función de las variables Gender y Region en una muestra de 150 observaciones de la base de datos survey, mediante la construcción de tablas de distribución de frecuencias, tablas de contingencia y gráficos de barras, con el fin de identificar posibles patrones de asociación entre el hábito de fumar, el género y la región de residencia.

Marco teórico

Unidad experimental y población

En este trabajo, cada persona encuestada en la base de datos survey constituye una unidad experimental, es decir, el objeto individual sobre el que se recogió información (su género, región y si fuma o no). El conjunto total de estas unidades conforma la población en estudio.

Muestra

Debido a que no se trabajó con la totalidad de los registros, sino con las primeras 150 observaciones de la base, se define una muestra: un subconjunto de la población. Idealmente, una muestra debe ser representativa (reflejar las características de la población) y aleatoria (seleccionada al azar), condición que en este caso se simplificó al tomar un bloque fijo de observaciones, lo cual es una limitación metodológica que vale la pena mencionar.

Variable, dato y observación

Gender, Region y Smoke son variables: características que cambian de un individuo a otro dentro de la muestra. Cada valor puntual que toma una variable en una persona específica (por ejemplo, “Female” o “Yes”) es un dato, mientras que el conjunto de datos correspondientes a un mismo individuo constituye una observación (una fila de la base de datos).

Tipos de variable

Las tres variables analizadas son cualitativas, es decir, no se miden numéricamente sino que expresan categorías. Dentro de las cualitativas, son de tipo nominal porque sus categorías no tienen un orden natural (por ejemplo, las regiones no se pueden jerarquizar entre sí, y lo mismo ocurre con género y con fumar/no fumar). Esto es relevante porque determina qué herramientas descriptivas son apropiadas: para variables cualitativas se usan tablas de frecuencia y gráficos de barras, y no medidas como la media o la desviación estándar, que están reservadas para variables cuantitativas.

Distribución de frecuencias

Es una forma de organizar los datos de una variable categórica mostrando cuántas veces aparece cada categoría (frecuencia absoluta) y qué proporción representa del total (frecuencia relativa). En el proyecto, esto se aplicó a Gender, Region y Smoke para conocer, por ejemplo, qué porcentaje de la muestra fuma.

Tabla de contingencia

Cuando se quiere estudiar la relación entre dos variables cualitativas al mismo tiempo, se construye una tabla de contingencia, que cruza las categorías de ambas variables y muestra cuántas observaciones caen en cada combinación. En este trabajo se usaron para explorar si, por ejemplo, la proporción de fumadores cambia según el género o según la región, calculando además proporciones por fila para facilitar la comparación entre grupos.

Estadística descriptiva vs. inferencial

Todo el análisis realizado en este proyecto corresponde a estadística descriptiva: se limita a recolectar, organizar y presentar la información de la muestra tal como es, sin intentar generalizar conclusiones a toda la población ni realizar pruebas de hipótesis. Esto se diferencia de la estadística inferencial, que buscaría, a partir de la muestra, sacar conclusiones válidas para la población completa con un nivel de confianza determinado — etapa que queda fuera del alcance de este primer proyecto.

Metodología

Origen de los datos

Los datos utilizados en este trabajo provienen de la base de datos survey, incluida en el paquete lsm de R. Esta base contiene características sociodemográficas y hábitos de un conjunto de individuos, entre ellas el género, la región de residencia y la condición de fumador.

Variables analizadas

Se analizaron tres variables cualitativas nominales de la base de datos:

  • Gender: género de la persona encuestada (Male / Female).
  • Region: región de residencia (Center, North, South).
  • Smoke: condición de fumador (Yes / No).

Estas variables se analizaron de forma individual,con el fin de explorar posibles patrones de asociación entre ellas.

Población y muestra

La población de estudio corresponde al conjunto total de individuos registrados en la base de datos survey. Debido a que no se trabajó con la totalidad de los registros, se definió una muestra de 150 observaciones, correspondiente a las primeras 150 filas de la base de datos.

Procedimientos estadísticos utilizados

El análisis se desarrolló en las siguientes etapas, iniciando con estadística descriptiva:

  1. Construcción de tablas de distribución de frecuencias absolutas y relativas para cada una de las variables Gender, Region y Smoke.
  2. Construcción de tablas de contingencia para las combinaciones Gender–Smoke, Gender–Region y Smoke–Region, con el fin de observar la distribución conjunta de las variables.
  3. Cálculo de proporciones por fila sobre las tablas de contingencia, para facilitar la comparación de la condición de fumador entre categorías de Gender y de Region.
  4. Elaboración de gráficos de barras (simples y comparativos) para representar visualmente las distribuciones y las comparaciones entre grupos.

Software empleado

El procesamiento y análisis de los datos se realizó en el software estadístico R, utilizando RStudio como entorno de desarrollo. El desarrollo del proyecto siguió, además, los lineamientos generales establecidos para la elaboración de un análisis exploratorio de datos (Llinás, s.f.).

Técnicas de procesamiento y transformación de los datos

A partir de la base de datos completa (datosCompleto), se exploró su estructura con la función str() y se listaron sus variables con names(). Posteriormente, se extrajeron las variables de interés y se generó la muestra de trabajo (Muestra) mediante indexación de las primeras 150 filas. Sobre esta muestra se construyeron las tablas de frecuencia con la función table() y sus proporciones asociadas con prop.table(),incluyendo el cálculo de proporciones por fila (margin = 1) para las tablas de contingencia. Los resultados se presentaron mediante la función kable() del paquete `knitr y luego se pudo realizar la visualización.

Justificación de las técnicas seleccionadas

Las variables Gender, Region y Smoke son de naturaleza cualitativa nominal, es decir, no admiten un orden natural entre sus categorías.Por esta razón, las herramientas apropiadas para su análisis son las tablas de frecuencia y los gráficos de barras, y no medidas de tendencia central o de dispersión como la media o la desviación estándar, que están reservadas para variables cuantitativas. De igual forma, las tablas de contingencia se seleccionaron por ser la técnica estándar para estudiar la relación entre dos variables cualitativas, permitiendo identificar si la distribución de una variable cambia según las categorías de otra, sin necesidad de recurrir todavía a pruebas de hipótesis formales, las cuales exceden el alcance descriptivo de este primer proyecto.

Importar bases de datos

library(lsm)      # Para descargar una base de datos
library(dplyr)
## 
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
## 
##     filter, lag
## The following objects are masked from 'package:base':
## 
##     intersect, setdiff, setequal, union
library(moments)  # Para hallar las medidas de forma
library(e1071)
## 
## Attaching package: 'e1071'
## The following objects are masked from 'package:moments':
## 
##     kurtosis, moment, skewness
library(ggplot2)
## 
## Attaching package: 'ggplot2'
## The following object is masked from 'package:e1071':
## 
##     element
library(knitr)

En este chunk se cargan las librerías necesarias para el desarrollo del proyecto. Cada paquete proporciona funciones específicas para manipular datos, realizar cálculos estadísticos, crear gráficos y presentar tablas de manera organizada.

Cargar bases de datos

datosCompleto <- lsm::survey

Se carga la base de datos survey del paquete lsm, la cual contiene la información que será utilizada durante todo el análisis estadístico.

Explorar la estructura de la base de datos

str(datosCompleto)   #A) Estructura de los datos
## tibble [800 × 66] (S3: tbl_df/tbl/data.frame)
##  $ Observation : num [1:800] 1 2 3 4 5 6 7 8 9 10 ...
##  $ ID          : chr [1:800] "SB11201910010435" "SB11201910004475" "SB11201910011427" "SB11201910041975" ...
##  $ Gender      : chr [1:800] "Female" "Male" "Male" "Male" ...
##  $ Like        : chr [1:800] "TV" "Network" "Network" "TV" ...
##  $ Age         : num [1:800] 21.4 21.1 20.9 18.4 16.6 ...
##  $ Smoke       : chr [1:800] "No" "Yes" "Yes" "Yes" ...
##  $ Height      : num [1:800] 1.58 1.6 1.5 1.53 1.78 1.65 1.73 1.53 1.64 1.52 ...
##  $ Weight      : num [1:800] 75 80 64 49 82 80 90 55 50 78 ...
##  $ BMI         : num [1:800] 30 31.2 28.4 20.9 25.9 ...
##  $ School      : chr [1:800] "Private" "Public" "Private" "Public" ...
##  $ SES         : chr [1:800] "Medium" "High" "High" "Low" ...
##  $ Enrollment  : chr [1:800] "Credit" "Scholarship" "Scholarship" "Credit" ...
##  $ Score       : num [1:800] 81 78 77 70 68 65 54 50 36 35 ...
##  $ MotherHeight: chr [1:800] "Short_M" "Normal_M" "Normal_M" "Tall_M" ...
##  $ MotherAge   : num [1:800] 41 45 45 45 46 46 47 48 48 48 ...
##  $ MotherCHD   : num [1:800] 0 0 0 0 1 0 0 0 0 1 ...
##  $ FatherHeight: chr [1:800] "Normal_F" "Short_F" "Tall_F" "Short_F" ...
##  $ FatherAge   : num [1:800] 40 43 44 45 45 46 46 48 48 49 ...
##  $ FatherCHD   : num [1:800] 1 1 1 2 1 1 1 1 1 1 ...
##  $ Status      : chr [1:800] "Distinguished" "Distinguished" "Distinguished" "Regular" ...
##  $ SemAcum     : num [1:800] 4.25 2.8 4.15 3.2 3.45 2.75 2.7 4.35 4.3 2.8 ...
##  $ Exam1       : num [1:800] 1.5 2.3 3.4 2.5 3.1 3.8 5 4 2.5 2.4 ...
##  $ Exam2       : num [1:800] 5 4.9 3.6 4.2 3.5 4.4 3 2.3 3.3 2.6 ...
##  $ Exam3       : num [1:800] 5 3.7 2 5 5 4.2 3.5 4.6 3.8 4.3 ...
##  $ Exam4       : num [1:800] 4.5 3.3 1.9 2.5 3 5 3.6 4.3 1.9 5 ...
##  $ ExamAcum    : num [1:800] 16 14.2 10.9 14.2 14.6 17.4 15.1 15.2 11.5 14.3 ...
##  $ Definitive  : num [1:800] 4 3.55 2.73 3.55 3.65 ...
##  $ Expense     : num [1:800] 48.9 72.1 85.2 56.6 64.6 63 40.8 65.4 37.3 63 ...
##  $ Income      : num [1:800] 1.61 2.07 2.84 1.55 2.32 2.1 1.69 2.18 1.71 2.1 ...
##  $ Gas         : num [1:800] 27.4 24.2 22.3 23.1 27.3 ...
##  $ Course      : chr [1:800] "Face-to-Face" "Virtual" "Face-to-Face" "Virtual" ...
##  $ Law         : chr [1:800] "Agree" "Agree" "Agree" "Agree" ...
##  $ Economic    : chr [1:800] "Regular" "Good" "Regular" "Bad" ...
##  $ Race        : chr [1:800] "Ethnic" "Ethnic" "Ethnic" "Ethnic" ...
##  $ Region      : chr [1:800] "North" "Center" "North" "Center" ...
##  $ EMO1        : num [1:800] 1 4 3 4 2 3 2 3 4 2 ...
##  $ EMO2        : num [1:800] 2 4 1 2 1 1 4 1 2 2 ...
##  $ EMO3        : num [1:800] 2 1 3 3 2 4 2 4 3 3 ...
##  $ EMO4        : num [1:800] 1 2 3 1 4 2 3 2 1 1 ...
##  $ EMO5        : num [1:800] 4 1 2 2 2 2 1 1 2 2 ...
##  $ GOAL1       : chr [1:800] "Strongly agree" "Undecided" "Agree" "Agree" ...
##  $ GOAL2       : chr [1:800] "Agree" "Disagree" "Disagree" "Undecided" ...
##  $ GOAL3       : chr [1:800] "Strongly agree" "Disagree" "Agree" "Strongly agree" ...
##  $ Pre_STAT1   : num [1:800] 2 1 5 4 1 4 4 2 2 2 ...
##  $ Pre_STAT2   : num [1:800] 4 1 1 3 4 1 2 3 3 5 ...
##  $ Pre_STAT3   : num [1:800] 2 1 3 1 1 5 4 3 3 2 ...
##  $ Pre_STAT4   : num [1:800] 5 1 1 2 2 3 2 3 2 4 ...
##  $ Post_STAT1  : num [1:800] 4 5 5 3 5 2 3 3 2 5 ...
##  $ Post_STAT2  : num [1:800] 5 1 2 2 3 3 2 3 2 3 ...
##  $ Post_STAT3  : num [1:800] 2 3 3 4 3 5 5 4 5 4 ...
##  $ Post_STAT4  : num [1:800] 2 3 3 5 4 4 3 5 5 1 ...
##  $ Pre_IDARE1  : chr [1:800] "Quite a bit" "Quite a bit" "Quite a bit" "Little" ...
##  $ Pre_IDARE2  : chr [1:800] "Little" "Little" "Little" "Nothing" ...
##  $ Pre_IDARE3  : chr [1:800] "Quite a bit" "A lot" "Quite a bit" "Quite a bit" ...
##  $ Pre_IDARE4  : chr [1:800] "Quite a bit" "Nothing" "Quite a bit" "Quite a bit" ...
##  $ Pre_IDARE5  : chr [1:800] "Little" "Quite a bit" "Little" "Nothing" ...
##  $ Post_IDARE1 : chr [1:800] "A lot" "A little" "Nothing" "Quite a bit" ...
##  $ Post_IDARE2 : chr [1:800] "A lot" "Nothing" "Quite a bit" "A little" ...
##  $ Post_IDARE3 : chr [1:800] "A little" "Quite a bit" "Nothing" "A lot" ...
##  $ Post_IDARE4 : chr [1:800] "Quite a bit" "A lot" "Nothing" "Quite a bit" ...
##  $ Post_IDARE5 : chr [1:800] "A lot" "Quite a bit" "Nothing" "A lot" ...
##  $ PSICO1      : chr [1:800] "Frequently" "Frequently" "Sometimes" "Almost always" ...
##  $ PSICO2      : chr [1:800] "Almost always" "Sometimes" "Sometimes" "Frequently" ...
##  $ PSICO3      : chr [1:800] "Frequently" "Sometimes" "Sometimes" "Frequently" ...
##  $ PSICO4      : chr [1:800] "Almost always" "Frequently" "Frequently" "Almost never" ...
##  $ PSICO5      : chr [1:800] "Almost always" "Frequently" "Sometimes" "Sometimes" ...

La función str() permite conocer la estructura de la base de datos, identificando el número de observaciones, las variables disponibles y el tipo de dato de cada una. Esto facilita verificar que los datos sean adecuados para el análisis.

Visualizar los nombres de las variables

names(datosCompleto)    #A) Muestra los nombres de las columnas (variables).
##  [1] "Observation"  "ID"           "Gender"       "Like"         "Age"         
##  [6] "Smoke"        "Height"       "Weight"       "BMI"          "School"      
## [11] "SES"          "Enrollment"   "Score"        "MotherHeight" "MotherAge"   
## [16] "MotherCHD"    "FatherHeight" "FatherAge"    "FatherCHD"    "Status"      
## [21] "SemAcum"      "Exam1"        "Exam2"        "Exam3"        "Exam4"       
## [26] "ExamAcum"     "Definitive"   "Expense"      "Income"       "Gas"         
## [31] "Course"       "Law"          "Economic"     "Race"         "Region"      
## [36] "EMO1"         "EMO2"         "EMO3"         "EMO4"         "EMO5"        
## [41] "GOAL1"        "GOAL2"        "GOAL3"        "Pre_STAT1"    "Pre_STAT2"   
## [46] "Pre_STAT3"    "Pre_STAT4"    "Post_STAT1"   "Post_STAT2"   "Post_STAT3"  
## [51] "Post_STAT4"   "Pre_IDARE1"   "Pre_IDARE2"   "Pre_IDARE3"   "Pre_IDARE4"  
## [56] "Pre_IDARE5"   "Post_IDARE1"  "Post_IDARE2"  "Post_IDARE3"  "Post_IDARE4" 
## [61] "Post_IDARE5"  "PSICO1"       "PSICO2"       "PSICO3"       "PSICO4"      
## [66] "PSICO5"

Con names() se listan todas las variables de la base de datos, lo que permite identificar cuáles serán utilizadas en el desarrollo del proyecto.

Seleccionar variables de interés

Edad <- datosCompleto$Age  
Sexo <- datosCompleto$Gender

En este chunk se extraen las variables Age y Gender para facilitar su uso en análisis posteriores, aunque posteriormente también se trabaja con la base de datos completa.

Seleccionar la muestra de estudio

Muestra <- datosCompleto[1:150,]

Se seleccionan las primeras 150 observaciones de la base de datos para conformar la muestra con la que se realizarán los análisis descriptivos.

Verificar el tamaño de la muestra

dim(Muestra)
## [1] 150  66
cat("Tamaño de la muestra seleccionada:", nrow(Muestra), "observaciones\n")
## Tamaño de la muestra seleccionada: 150 observaciones

Se verifica que la muestra seleccionada tenga 150 observaciones, asegurando que el conjunto de datos utilizado corresponda al tamaño definido para el estudio.

Tablas de distribución de frecuencias

# Variable categórica 1: Gender
tabla_gender <- table(Muestra$Gender)
tabla_gender_rel <- prop.table(tabla_gender)

kable (data.frame(Categoria = names(tabla_gender),
                  Frecuencia = as.vector(tabla_gender),
                  Frec_Relativa = round(as.vector(tabla_gender_rel), 3)),
      caption = "Tabla 1. Distribución de frecuencias - Gender")
Tabla 1. Distribución de frecuencias - Gender
Categoria Frecuencia Frec_Relativa
Female 71 0.473
Male 79 0.527
# Variable categórica 2: Region
tabla_region <- table(Muestra$Region)
tabla_region_rel <- prop.table(tabla_region)

kable(data.frame(Categoria = names(tabla_region),
                  Frecuencia = as.vector(tabla_region),
                  Frec_Relativa = round(as.vector(tabla_region_rel), 3)),
      caption = "Tabla 2. Distribución de frecuencias - Region")
Tabla 2. Distribución de frecuencias - Region
Categoria Frecuencia Frec_Relativa
Center 51 0.34
North 45 0.30
South 54 0.36
# Variable categórica 3: Smoke
tabla_smoke <- table(Muestra$Smoke)
tabla_smoke_rel <- prop.table(tabla_smoke)

kable(data.frame(Categoria = names(tabla_smoke),
                  Frecuencia = as.vector(tabla_smoke),
                  Frec_Relativa = round(as.vector(tabla_smoke_rel), 3)),
      caption = "Tabla 3. Distribución de frecuencias - Smoke")
Tabla 3. Distribución de frecuencias - Smoke
Categoria Frecuencia Frec_Relativa
No 81 0.54
Yes 69 0.46

Se construyen tablas de frecuencias absolutas y relativas para las variables Gender, Region y Smoke, permitiendo conocer cómo se distribuyen los individuos dentro de cada categoría.

Tablas de contingencia

# Tabla de contingencia: Gender x Smoke
tabla_gender_smoke <- table(Muestra$Gender, Muestra$Smoke)

kable(tabla_gender_smoke,
      caption = "Tabla 4. Tabla de contingencia entre Gender y Smoke")
Tabla 4. Tabla de contingencia entre Gender y Smoke
No Yes
Female 38 33
Male 43 36
# Tabla de contingencia adicional: Gender x Region
tabla_gender_region <- table(Muestra$Gender, Muestra$Region)


kable(tabla_gender_region,
      caption = "Tabla 5. Tabla de contingencia entre Gender y Region")
Tabla 5. Tabla de contingencia entre Gender y Region
Center North South
Female 24 22 25
Male 27 23 29
# Tabla de contingencia: Smoke x Region
tabla_smoke_region <- table(Muestra$Smoke, Muestra$Region)

kable(tabla_smoke_region,
      caption = "Tabla 6. Tabla de contingencia entre Smoke y Region")
Tabla 6. Tabla de contingencia entre Smoke y Region
Center North South
No 27 24 30
Yes 24 21 24
# Proporciones por fila (para comparar la distribución de Smoke dentro de cada Region)
prop_smoke_region <- round(prop.table(tabla_smoke_region, margin = 1), 3)

kable(prop_smoke_region,
      caption = "Tabla 7. Proporción de Smoke por fila, según Region")
Tabla 7. Proporción de Smoke por fila, según Region
Center North South
No 0.333 0.296 0.370
Yes 0.348 0.304 0.348
# Proporciones por fila (para comparar distribuciones)
prop_gender_smoke <- round(prop.table(tabla_gender_smoke, margin = 1), 3)

kable(prop_gender_smoke,
      caption = "Tabla 8. Proporción de Smoke por fila, según Gender")
Tabla 8. Proporción de Smoke por fila, según Gender
No Yes
Female 0.535 0.465
Male 0.544 0.456

En este chunk se elaboran tablas de contingencia (Tabla 4, Tabla 5 y Tabla 6) para analizar la distribución conjunta entre las variables Gender, Region y Smoke. Además, en la Tabla 7 y la Tabla 8 se calculan proporciones por fila, lo que permite comparar directamente el porcentaje de fumadores dentro de cada región y dentro de cada género, respectivamente, en lugar de solo comparar frecuencias absolutas.

Gráfico de barras: Distribución de género

ggplot(Muestra, aes(x = Gender)) +
  geom_bar(fill = "#B03060") +
  geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
  labs(title = "Figura 1. Distribución de Genero",
       x = "Genero",
       y = "Frecuencia absoluta") +
  theme_minimal()

La Figura 1 representa la frecuencia de cada categoría de la variable Gender, permitiendo visualizar de forma rápida la distribución de hombres y mujeres en la muestra.

Gráfico de barras: Distribución de fumadores

ggplot(Muestra, aes(x = Smoke)) +
   geom_bar(fill = "#BA55D3") +
  geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
  labs(title = "Figura 2. Distribución de Fumadores",
       x = "Fuma",
       y = "Frecuencia absoluta") +
  theme_minimal()

La Figura 2 muestra la cantidad de personas fumadoras y no fumadoras presentes en la muestra, facilitando la comparación entre ambas categorías.

Gráfico de barras: Distribución por región

ggplot(Muestra, aes(x = Region)) +
  geom_bar(fill = "lightsteelblue") +
  geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
  labs(title = "Figura 3. Distribución de Region",
       x = "Region",
       y = "Frecuencia absoluta") +
  theme_minimal() +
  theme(axis.text.x = element_text(angle = 45, hjust = 1))

La Figura 3 presenta la distribución de los participantes según la variable Region, permitiendo identificar visualmente la frecuencia de cada región en la muestra.

Gráfico comparativo: Género según condición de fumador

ggplot(Muestra, aes(x = Gender, fill = Smoke)) +
  geom_bar(position = "dodge") +
   scale_fill_manual(values = c("Yes" = "#FFB6C1", "No" = "#8B5F65")) +
  labs(title = "Figura 4. Comparación de Gender según Smoke",
       x = "Gender",
       y = "Frecuencia absoluta",
       fill = "Smoke") +
  theme_minimal()

La Figura 4 compara la distribución del hábito de fumar entre hombres y mujeres, permitiendo observar posibles diferencias entre ambos grupos.

Gráfico comparativo: Género según región

# Diagrama de barras: Gender x Region
ggplot(Muestra, aes(x = Region, fill = Gender)) +
  geom_bar(position = "dodge") +
   scale_fill_manual(values = c("Male" = "#8B5742", "Female" = "#FFA07A")) +
  labs(title = "Figura 5. Distribución de Gender según Region",
       x = "Region",
       y = "Frecuencia absoluta",
       fill = "Gender") +
  theme_minimal() +
  theme(axis.text.x = element_text(angle = 45, hjust = 1))

La Figura 5, en conjunto con la Tabla 5, permite comparar la distribución de hombres y mujeres dentro de cada región. Por ejemplo, en Center hay 24 mujeres frente a 27 hombres, y en South 25 mujeres frente a 29 hombres, lo que indica que la composición por género se mantiene relativamente similar entre regiones, sin que la muestra esté concentrada por género en una zona particular.

Gráfico comparativo: Fumadores según región

# Diagrama de barras: Smoke x Region
ggplot(Muestra, aes(x = Region, fill = Smoke)) +
  geom_bar(position = "dodge") +
  scale_fill_manual(values = c("Yes" = "#FFE4E1", "No" = "#CDB7B5")) +
   labs(title = "Figura 6. Distribución de Smoke según Region",
       x = "Region",
       y = "Frecuencia absoluta",
       fill = "Smoke") +
  theme_minimal() +
  theme(axis.text.x = element_text(angle = 45, hjust = 1))

La Figura 6, junto con la Tabla 7, compara la distribución de fumadores y no fumadores en cada región, permitiendo observar que el hábito de fumar no varía de forma apreciable según la ubicación geográfica.

Conclusiones

  1. La muestra estudiada resultó razonablemente equilibrada tanto en género como en región de residencia, lo que la hace apropiada como punto de partida descriptivo antes de plantear comparaciones entre subgrupos.
  2. El hábito de fumar no es mayoritario dentro de la muestra: menos de la mitad de las personas encuestadas reportó ser fumadora, lo que da una primera caracterización general del comportamiento de esta variable en el grupo analizado.
  3. Al comparar la condición de fumador entre hombres y mujeres, y entre las distintas regiones, no se observaron diferencias apreciables en las proporciones, lo que sugiere que, en esta muestra, el hábito de fumar no parece estar condicionado por el género ni por la región de residencia.
  4. La composición por género de la muestra resultó consistente en las tres regiones analizadas, sin que se observara una concentración particular de hombres o mujeres en alguna zona específica, lo que refuerza que las comparaciones entre regiones no están sesgadas por diferencias marcadas en su composición de género.
  5. En conjunto, el ejercicio permitió cumplir el objetivo general del trabajo: describir la distribución de Gender, Region y Smoke en la muestra seleccionada, dejando además una base metodológica clara (selección de muestra, construcción de tablas y visualización gráfica) sobre la cual se podrían apoyar análisis inferenciales futuros.

Bibliografía

Declaración de uso de Inteligencia Artificial

kable(data.frame(
  Aspecto = c("Uso de IA",
              "Herramienta utilizada",
              "Uso realizado",
              "Porcentaje estimado de utilización"),
  Informacion = c("Sí",
                  "Claude (Anthropic)",
                  "Corrección de estilo, redacción y ajuste de estructura del documento (numeración de tablas y figuras, formato APA de referencias, verificación del conteo de palabras del resumen)",
                  "40 %")
), caption = "Declaración de uso de Inteligencia Artificial")
Declaración de uso de Inteligencia Artificial
Aspecto Informacion
Uso de IA
Herramienta utilizada Claude (Anthropic)
Uso realizado Corrección de estilo, redacción y ajuste de estructura del documento (numeración de tablas y figuras, formato APA de referencias, verificación del conteo de palabras del resumen)
Porcentaje estimado de utilización 40 %