Integrantes: Valeria Ortiz · Angie Serrano · Laura Guevara · Maria Angel Gutiérrez
Profesor: Humberto Llinás Solano
Fecha de entrega: 29 de agosto de 2026
Este trabajo realiza un análisis estadístico descriptivo sobre los
hábitos de fumadores y su relación con el género y la región de
residencia, utilizando la base de datos survey del paquete
lsm de R. Se seleccionó una muestra de 150 observaciones,
analizando las variables cualitativas Gender, Region y Smoke. La
metodología correspondió a estadística descriptiva: tablas de
distribución de frecuencias absolutas y relativas por variable, tablas
de contingencia cruzando Gender–Smoke, Gender–Region y Smoke–Region con
proporciones por fila, y gráficos de barras elaborados en
ggplot2. Los resultados muestran una muestra compuesta por
52.7 % de hombres y 47.3 % de mujeres, distribuida en las regiones
Center (34 %), North (30 %) y South (36 %). El 46 % de la muestra
reportó fumar, frente a un 54 % que no fuma. Al cruzar Smoke con Gender
y con Region, las proporciones de fumadores resultaron muy similares
entre categorías (entre 44 % y 47 % aproximadamente), sin diferencias
marcadas. Esto evidencia que, en la muestra analizada, el hábito de
fumar se distribuye de manera homogénea entre géneros y regiones, sin
indicios de una asociación fuerte. Se concluye que, a nivel descriptivo,
ni el género ni la región parecen estar asociados con la condición de
fumador, aunque confirmarlo de forma rigurosa requeriría estadística
inferencial, como una prueba de independencia Chi-cuadrado.
Estadística descriptiva Tabaquismo Tablas de contingencia Variables cualitativas Distribución de frecuencias
El tabaquismo continúa siendo, en la actualidad, uno de los principales factores de riesgo prevenibles para la salud pública a nivel mundial, al estar asociado directamente con enfermedades cardiovasculares, respiratorias y oncológicas (Rincón Castillo et al., 2014). Comprender cómo se distribuye este hábito dentro de una población, y si dicha distribución varía según características como el género o el lugar de residencia, resulta relevante tanto para el diseño de políticas de prevención como para la planeación de estrategias de intervención en salud pública focalizadas. Este es precisamente el problema que aborda el presente trabajo: describir, a partir de una muestra de la base de datos survey, cómo se comporta la variable Smoke (condición de fumador) y si existen patrones diferenciales asociados a Gender y Region.
Los antecedentes sobre el tema muestran que la relación entre el hábito de fumar y el género ha sido documentada de forma extensa en la literatura epidemiológica, aunque con resultados que no siempre apuntan en la misma dirección. Por un lado, algunos estudios poblacionales han encontrado que las consecuencias en la salud derivadas del consumo de cigarrillo tienden a manifestarse más tardíamente en las mujeres que en los hombres, debido a diferencias en el momento de inicio y en la cronología del consumo entre ambos grupos, lo que ha llevado a distinguir con cuidado entre los conceptos de género (una construcción sociocultural) y sexo (una condición biológica) al momento de analizar este tipo de datos (Nerín, 2005). En la misma línea, se ha señalado que el abordaje del tabaquismo femenino requiere un enfoque diferenciado, dado que en ciertos contextos las mujeres jóvenes llegan a mostrar tasas de consumo incluso superiores a las de los hombres de su misma edad (De la Rosa & Otero, 2004). Por otro lado, estudios realizados en poblaciones laborales específicas han reportado el patrón contrario: una mayor proporción de fumadoras que de fumadores dentro de la muestra analizada (Rincón Castillo et al., 2014), lo que sugiere que la relación entre género y tabaquismo puede depender fuertemente del contexto poblacional y sociocultural estudiado, y no responde a un patrón universal.
A nivel de cifras globales más recientes, los reportes técnicos de la Organización Mundial de la Salud confirman que, aunque la prevalencia mundial del tabaquismo ha descendido de manera sostenida en las últimas dos décadas, el consumo continúa siendo marcadamente más alto entre los hombres que entre las mujeres, correspondiendo a población masculina más de cuatro de cada cinco consumidores de tabaco en el mundo (Organización Mundial de la Salud [OMS], 2025). Esta asimetría a nivel global contrasta con los hallazgos de estudios locales como el mencionado anteriormente, y refuerza la pertinencia de examinar la relación entre Gender y Smoke en muestras concretas, en lugar de asumir que los patrones globales se replican de manera automática en cualquier población.Desde el punto de vista metodológico, este tipo de preguntas —relacionar variables cualitativas nominales como Gender, Region y Smoke— se abordan apropiadamente mediante herramientas de estadística descriptiva las cuales permiten explorar de forma organizada si dos variables categóricas parecen estar asociadas antes de recurrir a pruebas de estadística inferencial (Triola, 2018).
La importancia de este estudio radica en que ofrece una primera caracterización, de carácter descriptivo, de los hábitos de fumadores en la muestra seleccionada de la base survey, y de su relación aparente con el género y la región de residencia. Con base en lo anterior, el objetivo general de este trabajo es realizar un análisis estadístico descriptivo de la variable Smoke en función de las variables Gender y Region en una muestra de 150 observaciones de la base de datos survey, mediante la construcción de tablas de distribución de frecuencias, tablas de contingencia y gráficos de barras, con el fin de identificar posibles patrones de asociación entre el hábito de fumar, el género y la región de residencia.
En este trabajo, cada persona encuestada en la base de datos survey constituye una unidad experimental, es decir, el objeto individual sobre el que se recogió información (su género, región y si fuma o no). El conjunto total de estas unidades conforma la población en estudio.
Debido a que no se trabajó con la totalidad de los registros, sino con las primeras 150 observaciones de la base, se define una muestra: un subconjunto de la población. Idealmente, una muestra debe ser representativa (reflejar las características de la población) y aleatoria (seleccionada al azar), condición que en este caso se simplificó al tomar un bloque fijo de observaciones, lo cual es una limitación metodológica que vale la pena mencionar.
Gender, Region y Smoke son variables: características que cambian de un individuo a otro dentro de la muestra. Cada valor puntual que toma una variable en una persona específica (por ejemplo, “Female” o “Yes”) es un dato, mientras que el conjunto de datos correspondientes a un mismo individuo constituye una observación (una fila de la base de datos).
Las tres variables analizadas son cualitativas, es decir, no se miden numéricamente sino que expresan categorías. Dentro de las cualitativas, son de tipo nominal porque sus categorías no tienen un orden natural (por ejemplo, las regiones no se pueden jerarquizar entre sí, y lo mismo ocurre con género y con fumar/no fumar). Esto es relevante porque determina qué herramientas descriptivas son apropiadas: para variables cualitativas se usan tablas de frecuencia y gráficos de barras, y no medidas como la media o la desviación estándar, que están reservadas para variables cuantitativas.
Es una forma de organizar los datos de una variable categórica mostrando cuántas veces aparece cada categoría (frecuencia absoluta) y qué proporción representa del total (frecuencia relativa). En el proyecto, esto se aplicó a Gender, Region y Smoke para conocer, por ejemplo, qué porcentaje de la muestra fuma.
Cuando se quiere estudiar la relación entre dos variables cualitativas al mismo tiempo, se construye una tabla de contingencia, que cruza las categorías de ambas variables y muestra cuántas observaciones caen en cada combinación. En este trabajo se usaron para explorar si, por ejemplo, la proporción de fumadores cambia según el género o según la región, calculando además proporciones por fila para facilitar la comparación entre grupos.
Todo el análisis realizado en este proyecto corresponde a estadística descriptiva: se limita a recolectar, organizar y presentar la información de la muestra tal como es, sin intentar generalizar conclusiones a toda la población ni realizar pruebas de hipótesis. Esto se diferencia de la estadística inferencial, que buscaría, a partir de la muestra, sacar conclusiones válidas para la población completa con un nivel de confianza determinado — etapa que queda fuera del alcance de este primer proyecto.
Los datos utilizados en este trabajo provienen de la base de datos
survey, incluida en el paquete lsm de R. Esta base
contiene características sociodemográficas y hábitos de un conjunto de
individuos, entre ellas el género, la región de residencia y la
condición de fumador.
Se analizaron tres variables cualitativas nominales de la base de datos:
Estas variables se analizaron de forma individual,con el fin de explorar posibles patrones de asociación entre ellas.
La población de estudio corresponde al conjunto total de individuos registrados en la base de datos survey. Debido a que no se trabajó con la totalidad de los registros, se definió una muestra de 150 observaciones, correspondiente a las primeras 150 filas de la base de datos.
El análisis se desarrolló en las siguientes etapas, iniciando con estadística descriptiva:
El procesamiento y análisis de los datos se realizó en el software estadístico R, utilizando RStudio como entorno de desarrollo. El desarrollo del proyecto siguió, además, los lineamientos generales establecidos para la elaboración de un análisis exploratorio de datos (Llinás, s.f.).
A partir de la base de datos completa (datosCompleto),
se exploró su estructura con la función str() y se listaron
sus variables con names(). Posteriormente, se extrajeron
las variables de interés y se generó la muestra de trabajo
(Muestra) mediante indexación de las primeras 150 filas.
Sobre esta muestra se construyeron las tablas de frecuencia con la
función table() y sus proporciones asociadas con
prop.table(),incluyendo el cálculo de proporciones por fila
(margin = 1) para las tablas de contingencia. Los
resultados se presentaron mediante la función kable() del
paquete `knitr y luego se pudo realizar la visualización.
Las variables Gender, Region y Smoke son de naturaleza cualitativa nominal, es decir, no admiten un orden natural entre sus categorías.Por esta razón, las herramientas apropiadas para su análisis son las tablas de frecuencia y los gráficos de barras, y no medidas de tendencia central o de dispersión como la media o la desviación estándar, que están reservadas para variables cuantitativas. De igual forma, las tablas de contingencia se seleccionaron por ser la técnica estándar para estudiar la relación entre dos variables cualitativas, permitiendo identificar si la distribución de una variable cambia según las categorías de otra, sin necesidad de recurrir todavía a pruebas de hipótesis formales, las cuales exceden el alcance descriptivo de este primer proyecto.
library(lsm) # Para descargar una base de datos
library(dplyr)
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
library(moments) # Para hallar las medidas de forma
library(e1071)
##
## Attaching package: 'e1071'
## The following objects are masked from 'package:moments':
##
## kurtosis, moment, skewness
library(ggplot2)
##
## Attaching package: 'ggplot2'
## The following object is masked from 'package:e1071':
##
## element
library(knitr)
En este chunk se cargan las librerías necesarias para el desarrollo del proyecto. Cada paquete proporciona funciones específicas para manipular datos, realizar cálculos estadísticos, crear gráficos y presentar tablas de manera organizada.
datosCompleto <- lsm::survey
Se carga la base de datos survey del paquete lsm, la cual contiene la información que será utilizada durante todo el análisis estadístico.
str(datosCompleto) #A) Estructura de los datos
## tibble [800 × 66] (S3: tbl_df/tbl/data.frame)
## $ Observation : num [1:800] 1 2 3 4 5 6 7 8 9 10 ...
## $ ID : chr [1:800] "SB11201910010435" "SB11201910004475" "SB11201910011427" "SB11201910041975" ...
## $ Gender : chr [1:800] "Female" "Male" "Male" "Male" ...
## $ Like : chr [1:800] "TV" "Network" "Network" "TV" ...
## $ Age : num [1:800] 21.4 21.1 20.9 18.4 16.6 ...
## $ Smoke : chr [1:800] "No" "Yes" "Yes" "Yes" ...
## $ Height : num [1:800] 1.58 1.6 1.5 1.53 1.78 1.65 1.73 1.53 1.64 1.52 ...
## $ Weight : num [1:800] 75 80 64 49 82 80 90 55 50 78 ...
## $ BMI : num [1:800] 30 31.2 28.4 20.9 25.9 ...
## $ School : chr [1:800] "Private" "Public" "Private" "Public" ...
## $ SES : chr [1:800] "Medium" "High" "High" "Low" ...
## $ Enrollment : chr [1:800] "Credit" "Scholarship" "Scholarship" "Credit" ...
## $ Score : num [1:800] 81 78 77 70 68 65 54 50 36 35 ...
## $ MotherHeight: chr [1:800] "Short_M" "Normal_M" "Normal_M" "Tall_M" ...
## $ MotherAge : num [1:800] 41 45 45 45 46 46 47 48 48 48 ...
## $ MotherCHD : num [1:800] 0 0 0 0 1 0 0 0 0 1 ...
## $ FatherHeight: chr [1:800] "Normal_F" "Short_F" "Tall_F" "Short_F" ...
## $ FatherAge : num [1:800] 40 43 44 45 45 46 46 48 48 49 ...
## $ FatherCHD : num [1:800] 1 1 1 2 1 1 1 1 1 1 ...
## $ Status : chr [1:800] "Distinguished" "Distinguished" "Distinguished" "Regular" ...
## $ SemAcum : num [1:800] 4.25 2.8 4.15 3.2 3.45 2.75 2.7 4.35 4.3 2.8 ...
## $ Exam1 : num [1:800] 1.5 2.3 3.4 2.5 3.1 3.8 5 4 2.5 2.4 ...
## $ Exam2 : num [1:800] 5 4.9 3.6 4.2 3.5 4.4 3 2.3 3.3 2.6 ...
## $ Exam3 : num [1:800] 5 3.7 2 5 5 4.2 3.5 4.6 3.8 4.3 ...
## $ Exam4 : num [1:800] 4.5 3.3 1.9 2.5 3 5 3.6 4.3 1.9 5 ...
## $ ExamAcum : num [1:800] 16 14.2 10.9 14.2 14.6 17.4 15.1 15.2 11.5 14.3 ...
## $ Definitive : num [1:800] 4 3.55 2.73 3.55 3.65 ...
## $ Expense : num [1:800] 48.9 72.1 85.2 56.6 64.6 63 40.8 65.4 37.3 63 ...
## $ Income : num [1:800] 1.61 2.07 2.84 1.55 2.32 2.1 1.69 2.18 1.71 2.1 ...
## $ Gas : num [1:800] 27.4 24.2 22.3 23.1 27.3 ...
## $ Course : chr [1:800] "Face-to-Face" "Virtual" "Face-to-Face" "Virtual" ...
## $ Law : chr [1:800] "Agree" "Agree" "Agree" "Agree" ...
## $ Economic : chr [1:800] "Regular" "Good" "Regular" "Bad" ...
## $ Race : chr [1:800] "Ethnic" "Ethnic" "Ethnic" "Ethnic" ...
## $ Region : chr [1:800] "North" "Center" "North" "Center" ...
## $ EMO1 : num [1:800] 1 4 3 4 2 3 2 3 4 2 ...
## $ EMO2 : num [1:800] 2 4 1 2 1 1 4 1 2 2 ...
## $ EMO3 : num [1:800] 2 1 3 3 2 4 2 4 3 3 ...
## $ EMO4 : num [1:800] 1 2 3 1 4 2 3 2 1 1 ...
## $ EMO5 : num [1:800] 4 1 2 2 2 2 1 1 2 2 ...
## $ GOAL1 : chr [1:800] "Strongly agree" "Undecided" "Agree" "Agree" ...
## $ GOAL2 : chr [1:800] "Agree" "Disagree" "Disagree" "Undecided" ...
## $ GOAL3 : chr [1:800] "Strongly agree" "Disagree" "Agree" "Strongly agree" ...
## $ Pre_STAT1 : num [1:800] 2 1 5 4 1 4 4 2 2 2 ...
## $ Pre_STAT2 : num [1:800] 4 1 1 3 4 1 2 3 3 5 ...
## $ Pre_STAT3 : num [1:800] 2 1 3 1 1 5 4 3 3 2 ...
## $ Pre_STAT4 : num [1:800] 5 1 1 2 2 3 2 3 2 4 ...
## $ Post_STAT1 : num [1:800] 4 5 5 3 5 2 3 3 2 5 ...
## $ Post_STAT2 : num [1:800] 5 1 2 2 3 3 2 3 2 3 ...
## $ Post_STAT3 : num [1:800] 2 3 3 4 3 5 5 4 5 4 ...
## $ Post_STAT4 : num [1:800] 2 3 3 5 4 4 3 5 5 1 ...
## $ Pre_IDARE1 : chr [1:800] "Quite a bit" "Quite a bit" "Quite a bit" "Little" ...
## $ Pre_IDARE2 : chr [1:800] "Little" "Little" "Little" "Nothing" ...
## $ Pre_IDARE3 : chr [1:800] "Quite a bit" "A lot" "Quite a bit" "Quite a bit" ...
## $ Pre_IDARE4 : chr [1:800] "Quite a bit" "Nothing" "Quite a bit" "Quite a bit" ...
## $ Pre_IDARE5 : chr [1:800] "Little" "Quite a bit" "Little" "Nothing" ...
## $ Post_IDARE1 : chr [1:800] "A lot" "A little" "Nothing" "Quite a bit" ...
## $ Post_IDARE2 : chr [1:800] "A lot" "Nothing" "Quite a bit" "A little" ...
## $ Post_IDARE3 : chr [1:800] "A little" "Quite a bit" "Nothing" "A lot" ...
## $ Post_IDARE4 : chr [1:800] "Quite a bit" "A lot" "Nothing" "Quite a bit" ...
## $ Post_IDARE5 : chr [1:800] "A lot" "Quite a bit" "Nothing" "A lot" ...
## $ PSICO1 : chr [1:800] "Frequently" "Frequently" "Sometimes" "Almost always" ...
## $ PSICO2 : chr [1:800] "Almost always" "Sometimes" "Sometimes" "Frequently" ...
## $ PSICO3 : chr [1:800] "Frequently" "Sometimes" "Sometimes" "Frequently" ...
## $ PSICO4 : chr [1:800] "Almost always" "Frequently" "Frequently" "Almost never" ...
## $ PSICO5 : chr [1:800] "Almost always" "Frequently" "Sometimes" "Sometimes" ...
La función str() permite conocer la estructura de la base de datos, identificando el número de observaciones, las variables disponibles y el tipo de dato de cada una. Esto facilita verificar que los datos sean adecuados para el análisis.
names(datosCompleto) #A) Muestra los nombres de las columnas (variables).
## [1] "Observation" "ID" "Gender" "Like" "Age"
## [6] "Smoke" "Height" "Weight" "BMI" "School"
## [11] "SES" "Enrollment" "Score" "MotherHeight" "MotherAge"
## [16] "MotherCHD" "FatherHeight" "FatherAge" "FatherCHD" "Status"
## [21] "SemAcum" "Exam1" "Exam2" "Exam3" "Exam4"
## [26] "ExamAcum" "Definitive" "Expense" "Income" "Gas"
## [31] "Course" "Law" "Economic" "Race" "Region"
## [36] "EMO1" "EMO2" "EMO3" "EMO4" "EMO5"
## [41] "GOAL1" "GOAL2" "GOAL3" "Pre_STAT1" "Pre_STAT2"
## [46] "Pre_STAT3" "Pre_STAT4" "Post_STAT1" "Post_STAT2" "Post_STAT3"
## [51] "Post_STAT4" "Pre_IDARE1" "Pre_IDARE2" "Pre_IDARE3" "Pre_IDARE4"
## [56] "Pre_IDARE5" "Post_IDARE1" "Post_IDARE2" "Post_IDARE3" "Post_IDARE4"
## [61] "Post_IDARE5" "PSICO1" "PSICO2" "PSICO3" "PSICO4"
## [66] "PSICO5"
Con names() se listan todas las variables de la base de datos, lo que permite identificar cuáles serán utilizadas en el desarrollo del proyecto.
Edad <- datosCompleto$Age
Sexo <- datosCompleto$Gender
En este chunk se extraen las variables Age y Gender para facilitar su uso en análisis posteriores, aunque posteriormente también se trabaja con la base de datos completa.
Muestra <- datosCompleto[1:150,]
Se seleccionan las primeras 150 observaciones de la base de datos para conformar la muestra con la que se realizarán los análisis descriptivos.
dim(Muestra)
## [1] 150 66
cat("Tamaño de la muestra seleccionada:", nrow(Muestra), "observaciones\n")
## Tamaño de la muestra seleccionada: 150 observaciones
Se verifica que la muestra seleccionada tenga 150 observaciones, asegurando que el conjunto de datos utilizado corresponda al tamaño definido para el estudio.
# Variable categórica 1: Gender
tabla_gender <- table(Muestra$Gender)
tabla_gender_rel <- prop.table(tabla_gender)
kable (data.frame(Categoria = names(tabla_gender),
Frecuencia = as.vector(tabla_gender),
Frec_Relativa = round(as.vector(tabla_gender_rel), 3)),
caption = "Tabla 1. Distribución de frecuencias - Gender")
| Categoria | Frecuencia | Frec_Relativa |
|---|---|---|
| Female | 71 | 0.473 |
| Male | 79 | 0.527 |
# Variable categórica 2: Region
tabla_region <- table(Muestra$Region)
tabla_region_rel <- prop.table(tabla_region)
kable(data.frame(Categoria = names(tabla_region),
Frecuencia = as.vector(tabla_region),
Frec_Relativa = round(as.vector(tabla_region_rel), 3)),
caption = "Tabla 2. Distribución de frecuencias - Region")
| Categoria | Frecuencia | Frec_Relativa |
|---|---|---|
| Center | 51 | 0.34 |
| North | 45 | 0.30 |
| South | 54 | 0.36 |
# Variable categórica 3: Smoke
tabla_smoke <- table(Muestra$Smoke)
tabla_smoke_rel <- prop.table(tabla_smoke)
kable(data.frame(Categoria = names(tabla_smoke),
Frecuencia = as.vector(tabla_smoke),
Frec_Relativa = round(as.vector(tabla_smoke_rel), 3)),
caption = "Tabla 3. Distribución de frecuencias - Smoke")
| Categoria | Frecuencia | Frec_Relativa |
|---|---|---|
| No | 81 | 0.54 |
| Yes | 69 | 0.46 |
Se construyen tablas de frecuencias absolutas y relativas para las variables Gender, Region y Smoke, permitiendo conocer cómo se distribuyen los individuos dentro de cada categoría.
# Tabla de contingencia: Gender x Smoke
tabla_gender_smoke <- table(Muestra$Gender, Muestra$Smoke)
kable(tabla_gender_smoke,
caption = "Tabla 4. Tabla de contingencia entre Gender y Smoke")
| No | Yes | |
|---|---|---|
| Female | 38 | 33 |
| Male | 43 | 36 |
# Tabla de contingencia adicional: Gender x Region
tabla_gender_region <- table(Muestra$Gender, Muestra$Region)
kable(tabla_gender_region,
caption = "Tabla 5. Tabla de contingencia entre Gender y Region")
| Center | North | South | |
|---|---|---|---|
| Female | 24 | 22 | 25 |
| Male | 27 | 23 | 29 |
# Tabla de contingencia: Smoke x Region
tabla_smoke_region <- table(Muestra$Smoke, Muestra$Region)
kable(tabla_smoke_region,
caption = "Tabla 6. Tabla de contingencia entre Smoke y Region")
| Center | North | South | |
|---|---|---|---|
| No | 27 | 24 | 30 |
| Yes | 24 | 21 | 24 |
# Proporciones por fila (para comparar la distribución de Smoke dentro de cada Region)
prop_smoke_region <- round(prop.table(tabla_smoke_region, margin = 1), 3)
kable(prop_smoke_region,
caption = "Tabla 7. Proporción de Smoke por fila, según Region")
| Center | North | South | |
|---|---|---|---|
| No | 0.333 | 0.296 | 0.370 |
| Yes | 0.348 | 0.304 | 0.348 |
# Proporciones por fila (para comparar distribuciones)
prop_gender_smoke <- round(prop.table(tabla_gender_smoke, margin = 1), 3)
kable(prop_gender_smoke,
caption = "Tabla 8. Proporción de Smoke por fila, según Gender")
| No | Yes | |
|---|---|---|
| Female | 0.535 | 0.465 |
| Male | 0.544 | 0.456 |
En este chunk se elaboran tablas de contingencia (Tabla 4, Tabla 5 y Tabla 6) para analizar la distribución conjunta entre las variables Gender, Region y Smoke. Además, en la Tabla 7 y la Tabla 8 se calculan proporciones por fila, lo que permite comparar directamente el porcentaje de fumadores dentro de cada región y dentro de cada género, respectivamente, en lugar de solo comparar frecuencias absolutas.
ggplot(Muestra, aes(x = Gender)) +
geom_bar(fill = "#B03060") +
geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
labs(title = "Figura 1. Distribución de Genero",
x = "Genero",
y = "Frecuencia absoluta") +
theme_minimal()
La Figura 1 representa la frecuencia de cada categoría de la variable Gender, permitiendo visualizar de forma rápida la distribución de hombres y mujeres en la muestra.
ggplot(Muestra, aes(x = Smoke)) +
geom_bar(fill = "#BA55D3") +
geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
labs(title = "Figura 2. Distribución de Fumadores",
x = "Fuma",
y = "Frecuencia absoluta") +
theme_minimal()
La Figura 2 muestra la cantidad de personas fumadoras y no fumadoras presentes en la muestra, facilitando la comparación entre ambas categorías.
ggplot(Muestra, aes(x = Region)) +
geom_bar(fill = "lightsteelblue") +
geom_text(stat = "count", aes(label = after_stat(count)), vjust = -0.3) +
labs(title = "Figura 3. Distribución de Region",
x = "Region",
y = "Frecuencia absoluta") +
theme_minimal() +
theme(axis.text.x = element_text(angle = 45, hjust = 1))
La Figura 3 presenta la distribución de los participantes según la variable Region, permitiendo identificar visualmente la frecuencia de cada región en la muestra.
ggplot(Muestra, aes(x = Gender, fill = Smoke)) +
geom_bar(position = "dodge") +
scale_fill_manual(values = c("Yes" = "#FFB6C1", "No" = "#8B5F65")) +
labs(title = "Figura 4. Comparación de Gender según Smoke",
x = "Gender",
y = "Frecuencia absoluta",
fill = "Smoke") +
theme_minimal()
La Figura 4 compara la distribución del hábito de fumar entre hombres y mujeres, permitiendo observar posibles diferencias entre ambos grupos.
# Diagrama de barras: Gender x Region
ggplot(Muestra, aes(x = Region, fill = Gender)) +
geom_bar(position = "dodge") +
scale_fill_manual(values = c("Male" = "#8B5742", "Female" = "#FFA07A")) +
labs(title = "Figura 5. Distribución de Gender según Region",
x = "Region",
y = "Frecuencia absoluta",
fill = "Gender") +
theme_minimal() +
theme(axis.text.x = element_text(angle = 45, hjust = 1))
La Figura 5, en conjunto con la Tabla 5, permite comparar la distribución de hombres y mujeres dentro de cada región. Por ejemplo, en Center hay 24 mujeres frente a 27 hombres, y en South 25 mujeres frente a 29 hombres, lo que indica que la composición por género se mantiene relativamente similar entre regiones, sin que la muestra esté concentrada por género en una zona particular.
# Diagrama de barras: Smoke x Region
ggplot(Muestra, aes(x = Region, fill = Smoke)) +
geom_bar(position = "dodge") +
scale_fill_manual(values = c("Yes" = "#FFE4E1", "No" = "#CDB7B5")) +
labs(title = "Figura 6. Distribución de Smoke según Region",
x = "Region",
y = "Frecuencia absoluta",
fill = "Smoke") +
theme_minimal() +
theme(axis.text.x = element_text(angle = 45, hjust = 1))
La Figura 6, junto con la Tabla 7, compara la distribución de fumadores y no fumadores en cada región, permitiendo observar que el hábito de fumar no varía de forma apreciable según la ubicación geográfica.
kable(data.frame(
Aspecto = c("Uso de IA",
"Herramienta utilizada",
"Uso realizado",
"Porcentaje estimado de utilización"),
Informacion = c("Sí",
"Claude (Anthropic)",
"Corrección de estilo, redacción y ajuste de estructura del documento (numeración de tablas y figuras, formato APA de referencias, verificación del conteo de palabras del resumen)",
"40 %")
), caption = "Declaración de uso de Inteligencia Artificial")
| Aspecto | Informacion |
|---|---|
| Uso de IA | Sí |
| Herramienta utilizada | Claude (Anthropic) |
| Uso realizado | Corrección de estilo, redacción y ajuste de estructura del documento (numeración de tablas y figuras, formato APA de referencias, verificación del conteo de palabras del resumen) |
| Porcentaje estimado de utilización | 40 % |