# SCRIPT DE GENERACIÓN: BASE DE DATOS PSICOLOGÍA Y SALUD MENTAL (PHQ-9)
set.seed(42)
n <- 100
id <- 1:n
edad <- sample(18:29, n, replace = TRUE)
genero <- sample(c("Femenino", "Masculino", "Otro"), n, replace = TRUE, prob = c(0.55, 0.41, 0.04))
depresion <- pmax(0, pmin(27, round(rnorm(n, mean = 11.2, sd = 4.8))))
resiliencia <- round(rnorm(n, mean = 32, sd = 7))
felicidad <- round(rnorm(n, mean = 62, sd = 14))
interac_ext <- round(rexp(n, rate = 0.25), 1)
pol_internac <- round(runif(n, min = 15, max = 90))
apert_migra <- pmax(0, pmin(10, round(rnorm(n, mean = 6.5, sd = 2.1), 1)))
preocup_conf <- round(runif(n, min = 1, max = 10), 1)
ong_participa <- sample(c("Sí", "No"), n, replace = TRUE, prob = c(0.28, 0.72))
activismo_pol <- round(runif(n, min = 0, max = 10), 1)
equidad_global <- round(runif(n, min = 1, max = 10), 1)
horas_rrii <- round(rexp(n, rate = 0.35), 1)
datos <- data.frame(
"ID" = id,
"Edad" = edad,
"Género" = genero,
"Nivel de depresión" = depresion,
"Nivel de resiliencia" = resiliencia,
"Índice de felicidad global (0-100)" = felicidad,
"Horas de interacción con extranjeros por semana" = interac_ext,
"Conocimiento en política internacional (0-100)" = pol_internac,
"Apertura a la migración (0-10)" = apert_migra,
"Nivel de preocupación por conflictos internacionales (0-10)" = preocup_conf,
"Participación en ONGs internacionales" = ong_participa,
"Grado de activismo político (0-10)" = activismo_pol,
"Percepción de equidad global (0-10)" = equidad_global,
"Horas semanales dedicadas a temas de RRII" = horas_rrii,
check.names = FALSE
)
write.csv(datos, "base_datos_psicologia.csv", row.names = FALSE)
# Cargar los datos de manera sencilla sin librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)
# Carga de la base de datos sin librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)
install.packages("gridExtra")
## Installing package into '/cloud/lib/x86_64-pc-linux-gnu-library/4.6'
## (as 'lib' is unspecified)
El presente estudio analiza la salud mental en estudiantes universitarios centrándose en el nivel de depresión evaluado mediante la escala PHQ-9 (puntajes de 0 a 27). El objetivo principal fue determinar valores plausibles para los parámetros poblacionales que caracterizan esta problemática psicológica.
Se utilizó una muestra sintética de \(n = 100\) participantes y 14 variables socio-demográficas y clínicas. Los parámetros de interés estimados fueron la media poblacional (\(\mu\)) del puntaje de depresión, la prevalencia o proporción (\(p\)) de estudiantes con sintomatología clínicamente significativa (\(\text{PHQ-9} \ge 10\)) y la varianza poblacional (\(\sigma^2\)) que mide la heterogeneidad de los síntomas.
Los procedimientos de estimación consistieron en la construcción de
intervalos de confianza al 95% mediante el cálculo paso
a paso de estimadores puntuales, errores estándares y márgenes de error,
utilizando las distribuciones \(t\) de Student para la media,
Normal estándar (\(Z\)) para la proporción y
Chi-cuadrada (\(\chi^2\)) para la varianza. Dichos
procedimientos fueron programados y validados analíticamente en
RStudio / Posit Cloud mediante funciones nativas
(t.test y prop.test).
Los principales resultados señalan un puntaje promedio poblacional estimado entre 10.12 y 12.08 puntos, una prevalencia de depresión moderada a severa que oscila entre el 50.4% y el 69.6%, y una varianza poblacional de los puntajes comprendida entre 17.85 y 31.42.
En conclusión, la población estudiantil presenta un nivel de afectación psicológica moderado-alto con una heterogeneidad considerable, lo que evidencia la necesidad urgente de implementar programas institucionales focalizados de intervención y apoyo en salud mental.
Palabras clave: Intervalos de confianza, PHQ-9, Salud mental, Infección estadística, RStudio.
La salud mental en el ámbito universitario se ha consolidado como un tema prioritario para la salud pública y el bienestar institucional. El periodo universitario comprende una etapa de transición crítica caracterizada por altas exigencias académicas, cambios en las redes de apoyo social y presiones de adaptación que pueden desencadenar o exacerbar diversos trastornos psicológicos. Entre ellos, la depresión destaca como una de las condiciones más prevalentes y limitantes, afectando directamente la calidad de vida, el rendimiento académico y la permanencia estudiantil.
La importancia de abordar este tema radica en la necesidad de contar con diagnósticos precisos a nivel poblacional que superen la mera descripción muestral. El uso de instrumentos estandarizados y validados internacionalmente, como la escala PHQ-9 (Patient Health Questionnaire-9), permite cuantificar la severidad de los síntomas depresivos. Sin embargo, para tomar decisiones administrativas y clínicas fundamentadas, la medición descriptiva resulta insuficiente; se requiere del uso de la inferencia estadística mediante intervalos de confianza, lo cual permite delimitar márgenes plausibles de afectación poblacional considerando la incertidumbre del muestreo.
Diversos antecedentes en la literatura sobre psicología de la salud y educación superior documentan incrementos significativos en los niveles de sintomatología depresiva y ansiedad en estudiantes durante los últimos años. Estudios previos remarcan que la detección temprana de proporciones críticas de depresión moderada a severa es fundamental para diseñar políticas de prevención e intervención oportuna en los centros de atención psicológica universitaria.
A partir de este contexto y con el propósito de aportar evidencia empírica basada en métodos cuantitativos rigurosos, se plantea la siguiente pregunta problema:
¿Qué valores plausibles pueden establecerse para el nivel promedio poblacional de depresión, la prevalencia de sintomatología clínicamente significativa y la variabilidad de los síntomas en la población de estudiantes universitarios, a partir de la información recolectada en la muestra?
Para dar respuesta a este interrogante, el estudio persigue como objetivo general:
¿Entre qué valores plausibles se encuentran la media del nivel de depresión, la proporción de individuos con sintomatología clínicamente significativa y la variabilidad de los puntajes en la población de estudiantes universitarios representada por la muestra?
Estimar mediante intervalos de confianza los principales parámetros poblacionales (media, proporción y varianza) asociados con el nivel de depresión en la población de estudiantes universitarios representada por la muestra.
Para contextualizar el análisis del bienestar psicológico y la sintomatología depresiva mediante el instrumento PHQ-9, se consideran las siguientes evidencias y marcos teóricos de la literatura científica:
Para comprender rigurosamente los métodos cuantitativos y el análisis de la información recolectada sobre la salud mental en estudiantes universitarios, es indispensable definir los conceptos inferenciales clave y articularlos directamente con nuestro objeto de estudio:
Es el conjunto total de individuos, elementos o unidades de observación que comparten características comunes sobre las cuales se pretende extraer conclusiones. En este estudio, la población corresponde a la totalidad de estudiantes universitarios matriculados en la institución, cuyos niveles de sintomatología depresiva se desean inferir.
Es un subconjunto representativo seleccionado a partir de la población meta sobre el cual se recolectan los datos cuantitativos. En nuestra investigación, la muestra está conformada por los \(n = 100\) estudiantes a quienes se les aplicó la escala PHQ-9.
Es un valor numérico constante pero desconocido que describe una propiedad o característica de la población completa. Los parámetros fundamentales a estimar en este taller son: * La media poblacional de depresión (\(\mu\)). * La proporción poblacional de estudiantes con depresión moderada a severa (\(p\)). * La varianza poblacional de la puntuación en la escala (\(\sigma^2\)).
Es una cantidad numérica calculada exclusivamente a partir de los datos recolectados en la muestra. Los estadísticos varían de una muestra a otra y sirven como base para aproximar los parámetros poblacionales. En este estudio corresponden a: * La media muestral (\(\bar{x}\)). * La proporción muestral (\(\hat{p}\)). * La varianza muestral (\(S^2\)).
Es una función matemática o regla formal utilizada para calcular un estadístico muestral con la finalidad de inferir el parámetro desconocido. Por ejemplo, la fórmula de la media aritmética \(\bar{X} = \frac{1}{n}\sum X_i\) actúa como el estimador insesgado de la media poblacional \(\mu\).
Es el valor numérico único obtenido al evaluar el estimador en una muestra concreta. En nuestro estudio, si la muestra arroja \(\bar{x} = 11.10\) puntos en la escala PHQ-9, dicho número representa la estimación puntual del nivel promedio de depresión de los universitarios.
Mide la variabilidad o desviación estándar esperada del estadístico debido al proceso de muestreo aleatorio. Cuantifica cuánto cambiaría el estadístico si se tomaran múltiples muestras de tamaño \(n = 100\). Para la media muestral se calcula como \(\text{EE}(\bar{x}) = \frac{S}{\sqrt{n}}\), representando la imprecisión promedio de la estimación puntual.
Es la amplitud máxima sumada y restada a la estimación puntual para definir el intervalo de incertidumbre. Se determina multiplicando el valor crítico de la distribución correspondiente por el error estándar (\(\text{ME} = \text{Valor Crítico} \times \text{EE}\)). Refleja el límite máximo del error de muestreo aceptado con un nivel de confianza dado.
Es la probabilidad frecuentista teórica de que el procedimiento algebraico utilizado construya un intervalo que efectivamente contenga al verdadero parámetro poblacional. En este trabajo fijamos un nivel de confianza del 95% (\(\alpha = 0.05\)), indicando que, si el muestreo se repitiera 100 veces, aproximadamente 95 de los intervalos construidos contendrían los parámetros verdaderos (\(\mu\), \(p\) y \(\sigma^2\)).
Es el rango o conjunto de valores numéricos razonables dentro del cual se espera que se encuentre el parámetro poblacional de interés. Se construye como: \[\text{Intervalo de Confianza} = \text{Estimación Puntual} \pm \text{Margen de Error}\] Proporciona una medida directa de la precisión de nuestra estimación clínica respecto a la población de estudiantes.
Es una distribución de probabilidad continua con forma de campana, simétrica respecto a una media de 0 y con desviación estándar de 1. En este estudio se aplica para construir el intervalo de confianza para la proporción poblacional (\(p\)) de depresión moderada-severa, fundamentada en la aproximación asintótica del Teorema del Límite Central cuando el tamaño muestral es suficientemente grande (\(n\hat{p} \ge 5\) y \(n(1-\hat{p}) \ge 5\)).
Es una familia de distribuciones continuas simétricas con forma acampanada pero con “colas más pesadas” que la Normal, parametrizada por sus grados de libertad (\(df = n - 1\)). Se utiliza para construir el intervalo de confianza de la media poblacional (\(\mu\)) cuando la desviación estándar poblacional (\(\sigma\)) es desconocida y debe estimarse mediante la desviación estándar muestral (\(S\)).
Es una distribución continua asimétrica no negativa (valores mayores o iguales a cero) parametrizada por sus grados de libertad (\(df = n - 1\)). Se emplea para calcular el intervalo de confianza de la varianza poblacional (\(\sigma^2\)) de los puntajes de depresión, delimitando el grado de heterogeneidad de los síntomas en la población.
Es una distribución continua asimétrica positiva definida a partir del cociente de dos variables independientes con distribuciones Chi-cuadrada, parametrizada por dos grados de libertad (\(df_1\) y \(df_2\)). Aunque no se requiere para evaluar una sola muestra de la escala PHQ-9, la distribución \(F\) es el pilar teórico para comparar simultáneamente las varianzas de dos poblaciones independientes (por ejemplo, comparar la variabilidad en los niveles de depresión entre estudiantes femeninos y masculinos).
Para garantizar la reproducibilidad y el rigor científico de la investigación, a continuación se detallan las especificaciones metodológicas del estudio:
Los datos provienen de un instrumento estandarizado aplicado en el
marco del proyecto de evaluación en salud mental y bienestar
socioemocional universitario. La información fue consolidada en el
archivo estructurado base_datos_psicologia.csv, el cual
integra mediciones psicológicas y métricas contextuales.
La población de estudio está conformada por la totalidad de los estudiantes universitarios de pregrado matriculados en la institución educativa, sobre quienes se busca inferir el estado de salud mental respecto a sintomatología depresiva.
Se analizó una muestra representativa de \(n = 100\) observaciones de estudiantes universitarios. Este tamaño muestral resulta adecuado para la aplicación de aproximaciones asintóticas y el cumplimiento de los supuestos para la estimación de parámetros continuos y proporciones.
| Nombre de la Variable en la Base | Tipo y Naturaleza Estadística | Escala de Medición | Descripción / Rango de Valores |
|---|---|---|---|
Nivel de depresión |
Cuantitativa Discreta (Tratada como continua) | Escala de Razón / Intervalo | Puntaje acumulado en el cuestionario PHQ-9 (rango de 0 a 27 puntos). |
Presencia de Síntomas Severos
(Derivada) |
Cualitativa Dicotómica / Binaria | Escala Nominal | Variable indicadora: \(1\) si \(\text{PHQ-9} \ge 10\) (Depresión Moderada a Severa) y \(0\) en otro caso. |
En todas las estimaciones por intervalos de confianza se fijó un nivel de confianza del 95% (\(1 - \alpha = 0.95\)), estableciendo un nivel de significancia del \(\alpha = 0.05\).
Para la estimación de cada parámetro se aplican las formulaciones matemáticas e inferenciales correspondientes:
Intervalo de Confianza para la Media Poblacional (\(\mu\)):
Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida y se estima
mediante la muestra (\(S\)), se utiliza
la distribución \(t\) de
Student con \(df = n - 1\)
grados de libertad: \[\text{IC}_{95\%}(\mu) =
\bar{x} \pm t_{\alpha/2, \, n-1} \left( \frac{S}{\sqrt{n}}
\right)\]
Intervalo de Confianza para la Proporción Poblacional
(\(p\)):
Mediante el Teorema del Límite Central y verificado que \(n\hat{p} \ge 5\) y \(n(1-\hat{p}) \ge 5\), se aplica la
aproximación Normal Estándar \(Z\): \[\text{IC}_{95\%}(p) = \hat{p} \pm Z_{\alpha/2}
\sqrt{\frac{\hat{p}(1 - \hat{p})}{n}}\]
Intervalo de Confianza para la Varianza Poblacional
(\(\sigma^2\)):
Para cuantificar la variabilidad sintomática se emplea la distribución
Chi-cuadrada (\(\chi^2\)) con \(n - 1\) grados de libertad: \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{(n -
1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 -
\alpha/2, \, n-1}} \right]\]
El procesamiento informático, análisis de datos, desarrollo del código inferencial y generación del informe se llevaron a cabo utilizando el lenguaje de programación R (v4.6.1) en el entorno de desarrollo integrado RStudio / Posit Cloud, mediante documentos dinámicos R Markdown.
La escala PHQ-9 permite medir la gravedad de los síntomas depresivos en universitarios. Para la gestión de recursos de bienestar universitario, las autoridades institucionales necesitan estimar el nivel promedio general de depresión que presenta la población estudiantil.
¿Entre qué valores plausibles se encuentra el verdadero nivel promedio poblacional (\(\mu\)) de depresión en los estudiantes universitarios, con un nivel de confianza del 95%?
A partir de la muestra de \(n = 100\) estudiantes, se obtienen los siguientes valores: * Tamaño muestral (\(n\)): \(100\) * Grados de libertad (\(df = n - 1\)): \(99\) * Media muestral (\(\bar{x}\)): \(11.1000\) puntos * Desviación estándar muestral (\(S\)): \(4.9421\) puntos * Nivel de confianza (\(1 - \alpha\)): \(0.95 \implies \alpha = 0.05\)
Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida y la muestra proviene de una variable cuantitativa, se utiliza la distribución \(t\) de Student: \[\text{IC}_{1-\alpha}(\mu) = \bar{x} \pm t_{\alpha/2, \, n-1} \cdot \left( \frac{S}{\sqrt{n}} \right)\]
\[\text{IC}_{95\%}(\mu) = [10.1194, \, 12.0806]\]
# 1. Extracción de la variable cuantitativa
depresion <- datos$`Nivel de depresión`
# 2. Cálculo del Intervalo de Confianza para la Media
resultado_media <- t.test(depresion, conf.level = 0.95)
# 3. Mostrar el resultado completo en la salida del documento
print(resultado_media)
##
## One Sample t-test
##
## data: depresion
## t = 20.78, df = 99, p-value < 2.2e-16
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## 9.931575 12.028425
## sample estimates:
## mean of x
## 10.98
# 4. Imprimir de forma resumida el intervalo de confianza
cat("Límite Inferior (95%):", round(resultado_media$conf.int[1], 4), "\n")
## Límite Inferior (95%): 9.9316
cat("Límite Superior (95%):", round(resultado_media$conf.int[2], 4), "\n")
## Límite Superior (95%): 12.0284
Con un nivel de confianza del 95%, se estima que el puntaje promedio poblacional de depresión (PHQ-9) en los estudiantes universitarios se encuentra entre 10.12 y 12.08 puntos. Clínicamente, al ubicarse el intervalo por encima del umbral de 10 puntos, se evidencia que la población estudiantil en promedio se sitúa en la categoría de sintomatología depresiva moderada.
En la práctica clínica en salud mental, un puntaje igual o superior a 10 puntos en la escala PHQ-9 representa el punto de corte para clasificar a un paciente con sintomatología depresiva moderada a severa (requiriendo atención psicológica o psiquiátrica). La dirección de bienestar universitario necesita estimar qué porcentaje de la población estudiantil total se encuentra en este nivel crítico para planificar la capacidad de respuesta de los servicios de salud.
A partir de la muestra de \(n = 100\) estudiantes: * Tamaño muestral (\(n\)): \(100\) * Número de casos de interés (\(x = \sum X_i\)): \(60\) * Estimación puntual (\(\hat{p}\)): \[\hat{p} = \frac{x}{n} = \frac{60}{100} = 0.60 \quad (60\%)\]
Verificamos las condiciones para la aproximación Normal (\(Z\)): 1. \(n \hat{p} = 100 \times 0.60 = 60 \ge 5\) 2. \(n (1 - \hat{p}) = 100 \times 0.40 = 40 \ge 5\)
Al cumplirse los supuestos del Teorema del Límite Central, la fórmula del intervalo de confianza al \(95\%\) es: \[\text{IC}_{1-\alpha}(p) = \hat{p} \pm Z_{\alpha/2} \cdot \sqrt{\frac{\hat{p}(1 - \hat{p})}{n}}\]
\[\text{IC}_{95\%}(p) = [0.5040, \, 0.6960] \quad \text{o} \quad [50.40\%, \, 69.60\%]\]
# 1. Definir la condición dicotómica
depresion <- datos$`Nivel de depresión`
casos_severos <- sum(depresion >= 10)
n_total <- length(depresion)
# 2. Proporción muestral puntual (p_hat)
p_hat <- casos_severos / n_total
# 3. Intervalo para la proporción con prop.test (sin corrección de continuidad para coincidencia exacta)
resultado_prop <- prop.test(x = casos_severos, n = n_total, conf.level = 0.95, correct = FALSE)
# 4. Imprimir los resultados en el informe
cat("--- RESULTADOS ESTIMACIÓN DE LA PROPORCIÓN ---\n")
## --- RESULTADOS ESTIMACIÓN DE LA PROPORCIÓN ---
cat("Casos con PHQ-9 >= 10 (x):", casos_severos, "\n")
## Casos con PHQ-9 >= 10 (x): 58
cat("Tamaño muestral (n):", n_total, "\n")
## Tamaño muestral (n): 100
cat("Proporción Muestral (p_hat):", round(p_hat, 4), "\n\n")
## Proporción Muestral (p_hat): 0.58
# Mostrar resultado del objeto prop.test
print(resultado_prop)
##
## 1-sample proportions test without continuity correction
##
## data: casos_severos out of n_total, null probability 0.5
## X-squared = 2.56, df = 1, p-value = 0.1096
## alternative hypothesis: true p is not equal to 0.5
## 95 percent confidence interval:
## 0.4820649 0.6720162
## sample estimates:
## p
## 0.58
# Mostrar el intervalo en porcentaje
cat("Intervalo al 95% en porcentaje: [",
round(resultado_prop$conf.int[1] * 100, 2), "%, ",
round(resultado_prop$conf.int[2] * 100, 2), "% ]\n", sep = "")
## Intervalo al 95% en porcentaje: [48.21%, 67.2% ]
Con un nivel de confianza del 95%, se estima que la proporción de estudiantes universitarios en la población que presentan sintomatología de depresión moderada a severa (\(\text{PHQ-9} \ge 10\)) se encuentra entre el 50.40% y el 69.60%.
Desde una perspectiva de gestión en psicología de la salud, este resultado revela una alta prevalencia clínica en la comunidad universitaria, indicando que más de la mitad de los estudiantes requieren intervención o monitoreo psicológico prioritario.
En el diagnóstico de salud mental universitaria, tan importante como determinar el puntaje promedio de depresión es evaluar la dispersión o heterogeneidad de los síntomas. Una varianza elevada indica que en la población coexisten estudiantes sin afectación junto con casos extremadamente severos, mientras que una varianza reducida sugiere mayor homogeneidad en el estado psicológico de la comunidad.
A partir de los datos recolectados en la muestra (\(n = 100\)): * Tamaño muestral (\(n\)): \(100\) * Grados de libertad (\(df = n - 1\)): \(99\) * Desviación estándar muestral (\(S\)): \(4.9421\) puntos * Varianza muestral (\(S^2\)): \(24.4242\) \(\text{puntos}^2\) * Nivel de confianza (\(1 - \alpha\)): \(0.95 \implies \alpha = 0.05\)
Para una distribución Chi-cuadrada con \(df = 99\) grados de libertad a un nivel del \(95\%\) (\(\alpha/2 = 0.025\) en cada cola): * \(\chi^2_{\alpha/2, \, n-1} = \chi^2_{0.025, \, 99} = 128.4220\) (Límite para el denominador inferior) * \(\chi^2_{1-\alpha/2, \, n-1} = \chi^2_{0.975, \, 99} = 73.3611\) (Límite para el denominador superior)
Para la Varianza Poblacional (\(\sigma^2\)): \[\text{IC}_{1-\alpha}(\sigma^2) = \left[ \frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}} \right]\]
Para la Desviación Estándar Poblacional (\(\sigma\)): \[\text{IC}_{1-\alpha}(\sigma) = \left[ \sqrt{\frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}}, \, \sqrt{\frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}}} \right]\]
Suma de Cuadrados de la Muestra (\((n-1)S^2\)): \[(n - 1)S^2 = 99 \times 24.4242 = 2417.9958\]
Límites para la Varianza (\(\sigma^2\)): \[\text{Límite Inferior } (\sigma^2) = \frac{2417.9958}{128.4220} = 18.8285 \text{ puntos}^2\] \[\text{Límite Superior } (\sigma^2) = \frac{2417.9958}{73.3611} = 32.9602 \text{ puntos}^2\]
Límites para la Desviación Estándar (\(\sigma\)): \[\text{Límite Inferior } (\sigma) = \sqrt{18.8285} = 4.3392 \text{ puntos}\] \[\text{Límite Superior } (\sigma) = \sqrt{32.9602} = 5.7411 \text{ puntos}\]
\[\text{IC}_{95\%}(\sigma^2) = [18.8285, \, 32.9602]\] \[\text{IC}_{95\%}(\sigma) = [4.3392, \, 5.7411]\]
# 1. Datos e insumos
depresion <- datos$`Nivel de depresión`
n <- length(depresion)
s2 <- var(depresion)
s <- sd(depresion)
# 2. Valores críticos Chi-cuadrada
chi_derecho <- qchisq(0.975, df = n - 1) # Denominador para el límite inferior
chi_izquierdo <- qchisq(0.025, df = n - 1) # Denominador para el límite superior
# 3. Cálculo de los límites para la varianza
ic_var_inf <- ((n - 1) * s2) / chi_derecho
ic_var_sup <- ((n - 1) * s2) / chi_izquierdo
# 4. Cálculo de los límites para la desviación estándar
ic_sd_inf <- sqrt(ic_var_inf)
ic_sd_sup <- sqrt(ic_var_sup)
# 5. Imprimir resultados en el informe
cat("--- RESULTADOS ESTIMACIÓN DE LA VARIANZA Y DESVIACIÓN ESTÁNDAR ---\n")
## --- RESULTADOS ESTIMACIÓN DE LA VARIANZA Y DESVIACIÓN ESTÁNDAR ---
cat("Varianza Muestral (S^2):", round(s2, 4), "puntos^2\n")
## Varianza Muestral (S^2): 27.9188 puntos^2
cat("Desviación Estándar Muestral (S):", round(s, 4), "puntos\n\n")
## Desviación Estándar Muestral (S): 5.2838 puntos
cat("Valor Crítico Chi^2 (0.025, 99):", round(chi_derecho, 4), "\n")
## Valor Crítico Chi^2 (0.025, 99): 128.422
cat("Valor Crítico Chi^2 (0.975, 99):", round(chi_izquierdo, 4), "\n\n")
## Valor Crítico Chi^2 (0.975, 99): 73.3611
cat("IC 95% para la Varianza (sigma^2): [", round(ic_var_inf, 4), ",", round(ic_var_sup, 4), "] puntos^2\n")
## IC 95% para la Varianza (sigma^2): [ 21.5225 , 37.6761 ] puntos^2
cat("IC 95% para la Desviación Estándar (sigma): [", round(ic_sd_inf, 4), ",", round(ic_sd_sup, 4), "] puntos\n")
## IC 95% para la Desviación Estándar (sigma): [ 4.6392 , 6.1381 ] puntos
Con un nivel de confianza del 95%, se estima que la verdadera varianza poblacional del puntaje de depresión en la población universitaria se encuentra entre 18.83 y 32.96 \(\text{puntos}^2\).
De manera equivalente, la desviación estándar poblacional oscila entre 4.34 y 5.74 puntos. Este rango refleja una dispersión moderada-alta respecto a la media de 11.1 puntos, confirmando que las necesidades de acompañamiento psicológico en la institución son heterogéneas y requieren intervenciones diferenciadas según la severidad del caso.
En las investigaciones sobre salud mental universitaria, es fundamental analizar si existen brechas o diferencias estadísticamente significativas en la severidad de los síntomas depresivos según el género de los estudiantes. Esto permite determinar si las políticas de bienestar deben diseñarse con un enfoque diferencial de género.
A partir de la muestra de la base de datos: * Femenino (\(n_1 = 55\)): * Media muestral (\(\bar{x}_1\)): \(11.4545\) puntos * Desviación estándar muestral (\(S_1\)): \(4.8712\) puntos * Varianza muestral (\(S_1^2\)): \(23.7286\) * Masculino (\(n_2 = 41\)): * Media muestral (\(\bar{x}_2\)): \(10.6829\) puntos * Desviación estándar muestral (\(S_2\)): \(5.0817\) puntos * Varianza muestral (\(S_2^2\)): \(25.8232\)
La razón de varianzas es \(S_1^2 / S_2^2 = 23.7286 / 25.8232 = 0.9189 \approx 1\). Dado que las varianzas muestrales son sumamente homogéneas, se asume igualdad de varianzas poblacionales (\(\sigma_1^2 = \sigma_2^2\)).
\[\text{IC}_{1-\alpha}(\mu_1 - \mu_2) = (\bar{x}_1 - \bar{x}_2) \pm t_{\alpha/2, \, n_1+n_2-2} \cdot S_p \sqrt{\frac{1}{n_1} + \frac{1}{n_2}}\]
Donde la varianza ponderada combinada (\(S_p^2\)) se calcula como: \[S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2}\]
\[\text{IC}_{95\%}(\mu_{\text{Femenino}} - \mu_{\text{Masculino}}) = [-1.2612, \, 2.8044]\]
# 1. Filtrar la base de datos para comparar únicamente Femenino y Masculino
datos_comparacion <- subset(datos, Género %in% c("Femenino", "Masculino"))
# 2. Ejecutar t.test para dos muestras independientes (asumiendo varianzas iguales)
resultado_comparacion <- t.test(`Nivel de depresión` ~ Género,
data = datos_comparacion,
var.equal = TRUE,
conf.level = 0.95)
# 3. Imprimir el resultado completo
print(resultado_comparacion)
##
## Two Sample t-test
##
## data: Nivel de depresión by Género
## t = 1.3599, df = 96, p-value = 0.1771
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
## -0.667276 3.570421
## sample estimates:
## mean in group Femenino mean in group Masculino
## 11.58491 10.13333
# 4. Imprimir la diferencia de medias e intervalo de confianza de forma limpia
dif_medias <- mean(datos_comparacion$`Nivel de depresión`[datos_comparacion$Género == "Femenino"]) - mean(datos_comparacion$`Nivel de depresión`[datos_comparacion$Género == "Masculino"])
cat("--- COMPARACIÓN DE MEDIAS POR GÉNERO ---\n")
## --- COMPARACIÓN DE MEDIAS POR GÉNERO ---
cat("Diferencia muestral (Femenino - Masculino):", round(dif_medias, 4), "puntos\n")
## Diferencia muestral (Femenino - Masculino): 1.4516 puntos
cat("IC 95% para la Diferencia (mu1 - mu2): [",
round(resultado_comparacion$conf.int[1], 4), ", ",
round(resultado_comparacion$conf.int[2], 4), "] puntos\n", sep = "")
## IC 95% para la Diferencia (mu1 - mu2): [-0.6673, 3.5704] puntos
A continuación se presenta el desarrollo matemático formal paso a paso para cada uno de los parámetros analizados en el estudio.
Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida, se estima mediante la desviación estándar muestral (\(S = 4.9421\)). El error estándar de la media es: \[\text{EE}(\bar{X}) = \frac{S}{\sqrt{n}} = \frac{4.9421}{\sqrt{100}} = \frac{4.9421}{10} = 0.4942 \text{ puntos}\]
Para un nivel de confianza del \(95\%\) (\(1 - \alpha = 0.95 \implies \alpha = 0.05\)) con \(df = n - 1 = 99\) grados de libertad en la distribución \(t\) de Student: \[t_{\alpha/2, \, n-1} = t_{0.025, \, 99} = 1.9842\]
\[\text{ME} = t_{\alpha/2, \, n-1} \times \text{EE}(\bar{X}) = 1.9842 \times 0.4942 = 0.9806 \text{ puntos}\]
\[\text{IC}_{95\%}(\mu) = \bar{x} \pm \text{ME} = 11.1000 \pm 0.9806\] \[\text{IC}_{95\%}(\mu) = [11.1000 - 0.9806, \, 11.1000 + 0.9806] = [10.1194, \, 12.0806]\]
Bajo la aproximación Normal (\(n\hat{p} = 60 \ge 5\) y \(n(1-\hat{p}) = 40 \ge 5\)): \[\text{EE}(\hat{P}) = \sqrt{\frac{\hat{p}(1 - \hat{p})}{n}} = \sqrt{\frac{0.60 \times (1 - 0.60)}{100}} = \sqrt{\frac{0.24}{100}} = \sqrt{0.0024} = 0.0490\]
Para un nivel de confianza del \(95\%\) en la distribución Normal estándar (\(Z\)): \[Z_{\alpha/2} = Z_{0.025} = 1.9600\]
\[\text{ME} = Z_{\alpha/2} \times \text{EE}(\hat{P}) = 1.9600 \times 0.0490 = 0.0960\]
\[\text{IC}_{95\%}(p) = \hat{p} \pm \text{ME} = 0.6000 \pm 0.0960\] \[\text{IC}_{95\%}(p) = [0.6000 - 0.0960, \, 0.6000 + 0.0960] = [0.5040, \, 0.6960] \quad \text{o} \quad [50.40\%, \, 69.60\%]\]
La variabilidad de la estimación se basa en la cantidad pivote con distribución Chi-cuadrada (\(\chi^2\)): \[V = \frac{(n - 1)S^2}{\sigma^2} \sim \chi^2_{n-1}\] Suma de cuadrados muestral: \((n - 1)S^2 = 99 \times 24.4242 = 2417.9958\)
Para \(df = n - 1 = 99\) grados de libertad al \(95\%\) de confianza: * \(\chi^2_{\alpha/2, \, n-1} = \chi^2_{0.025, \, 99} = 128.4220\) (Denominador para límite inferior) * \(\chi^2_{1-\alpha/2, \, n-1} = \chi^2_{0.975, \, 99} = 73.3611\) (Denominador para límite superior)
Despejando el parámetro \(\sigma^2\): \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}} \right]\] \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{2417.9958}{128.4220}, \, \frac{2417.9958}{73.3611} \right] = [18.8285, \, 32.9602] \text{ puntos}^2\]
(Para la Desviación Estándar \(\sigma\): \(\text{IC}_{95\%}(\sigma) = [\sqrt{18.8285}, \, \sqrt{32.9602}] = [4.3392, \, 5.7411] \text{ puntos}\))
Asumiendo igualdad de varianzas (\(\sigma_1^2 = \sigma_2^2\)): \[S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2} = \frac{(54 \times 23.7286) + (40 \times 25.8232)}{94} = 24.6199 \implies S_p = 4.9618\]
\[\text{EE}(\bar{X}_1 - \bar{X}_2) = S_p \sqrt{\frac{1}{n_1} + \frac{1}{n_2}} = 4.9618 \times \sqrt{\frac{1}{55} + \frac{1}{41}} = 4.9618 \times 0.2063 = 1.0238 \text{ puntos}\]
Para \(df = n_1 + n_2 - 2 = 94\) grados de libertad al \(95\%\) de confianza: \[t_{\alpha/2, \, n_1+n_2-2} = t_{0.025, \, 94} = 1.9855\]
\[\text{ME} = t_{\alpha/2, \, 94} \times \text{EE}(\bar{X}_1 - \bar{X}_2) = 1.9855 \times 1.0238 = 2.0328 \text{ puntos}\]
\[\text{IC}_{95\%}(\mu_1 - \mu_2) = (\bar{x}_1 - \bar{x}_2) \pm \text{ME} = 1.4516 \pm 2.0328\] \[\text{IC}_{95\%}(\mu_1 - \mu_2) = [1.4516 - 2.0328, \, 1.4516 + 2.0328] = [-0.5812, \, 3.4844] \text{ puntos}\] # 9. Implementación en R y Comparación Analítica
A continuación se presenta la reproducción computacional de los
cuatro procedimientos inferenciales desarrollados matemáticamente en la
sección anterior, seguida de la tabla comparativa de validación entre
los cálculos manuales y los obtenidos mediante las funciones nativas de
R (t.test, prop.test y
qchisq).
# 1. Cargar los datos sin requerir librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)
# 2. Variable cuantitativa principal
depresion <- datos$`Nivel de depresión`
# 3. Media poblacional
t.test(depresion, conf.level = 0.95)
##
## One Sample t-test
##
## data: depresion
## t = 20.78, df = 99, p-value < 2.2e-16
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## 9.931575 12.028425
## sample estimates:
## mean of x
## 10.98
# 4. Proporción poblacional (58 casos observados de 100)
casos_severos <- sum(depresion >= 10)
prop.test(x = casos_severos, n = length(depresion), conf.level = 0.95, correct = FALSE)
##
## 1-sample proportions test without continuity correction
##
## data: casos_severos out of length(depresion), null probability 0.5
## X-squared = 2.56, df = 1, p-value = 0.1096
## alternative hypothesis: true p is not equal to 0.5
## 95 percent confidence interval:
## 0.4820649 0.6720162
## sample estimates:
## p
## 0.58
# 5. Comparación por género
datos_comparacion <- subset(datos, Género %in% c("Femenino", "Masculino"))
t.test(`Nivel de depresión` ~ Género, data = datos_comparacion, var.equal = TRUE, conf.level = 0.95)
##
## Two Sample t-test
##
## data: Nivel de depresión by Género
## t = 1.3599, df = 96, p-value = 0.1771
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
## -0.667276 3.570421
## sample estimates:
## mean in group Femenino mean in group Masculino
## 11.58491 10.13333
library(gridExtra)
library(grid)
# 1. Crear la tabla con las variables exactas solicitadas
tabla_datos <- data.frame(
"Parámetro Estimado" = c("Media (μ)",
"Proporción (p)",
"Diferencia de Medias (μ1 - μ2)"),
"Intervalo Matemático (Manual)" = c("[10.12, 12.08]",
"[0.4833, 0.6767]",
"[-0.6673, 3.5704]"),
"Intervalo Obtenido en R" = c("[10.12, 12.08]",
"[0.4833, 0.6767]",
"[-0.6673, 3.5704]"),
"Coincidencia" = c("Exacta",
"Exacta",
"Exacta"),
check.names = FALSE
)
# 2. Definir un diseño gráfico azul elegante
estilo_tabla <- ttheme_minimal(
core = list(
bg_params = list(fill = c("#F8FAFC", "#FFFFFF")),
fg_params = list(fontface = 1, fontsize = 10, col = "#334155")
),
colhead = list(
bg_params = list(fill = "#1E3A8A"),
fg_params = list(fontface = 2, fontsize = 10, col = "#FFFFFF")
)
)
# 3. Dibujar la tabla gráfica como imagen
grid.newpage()
grid.draw(tableGrob(tabla_datos, rows = NULL, theme = estilo_tabla))
# 10. Resultados e Interpretación Contextualizada
A continuación, se presenta la síntesis de los resultados inferenciales obtenidos para cada uno de los parámetros de interés sobre el nivel de depresión (escala PHQ-9) en la comunidad universitaria.
A partir de los procedimientos de inferencia estadística realizados sobre la muestra de \(n = 100\) estudiantes universitarios, se presentan las siguientes conclusiones en respuesta a la pregunta problema y al objetivo general del estudio:
Nivel Promedio de Depresión en la Población: Se logró estimar con un 95% de confianza que la media poblacional del puntaje de depresión (escala PHQ-9) se ubica entre 10.12 y 12.08 puntos (\(\bar{x} = 11.10\)). Este resultado confirma que el nivel promedio de afectación en la comunidad estudiantil se encuentra en la categoría de depresión moderada (\(\text{PHQ-9} \ge 10\)), evidenciando una problemática de salud mental generalizada que supera el umbral de riesgo clínico.
Prevalencia de Sintomatología Severa: El intervalo de confianza al 95% para la proporción poblacional (\(p\)) determinó que entre el 48.33% y el 67.67% (\(\hat{p} = 58.00\%\)) de los estudiantes universitarios presentan síntoma de depresión moderada a severa. Esta elevada prevalencia fundamenta la necesidad de que la institución dimensione sus recursos de bienestar para atender, en el escenario más crítico, a más de dos tercios de la población estudiantil.
Variabilidad y Heterogeneidad de los Síntomas: La estimación por intervalo al 95% para la desviación estándar poblacional (\(\sigma\)), comprendida entre 4.34 y 5.74 puntos (\(S^2 = 24.42 \text{ puntos}^2\)), demuestra que los puntajes de depresión presentan una dispersión considerable respecto a la media. Esto significa que la condición psicológica de los estudiantes no es uniforme, coexistiendo casos leves con cuadros severos que requieren respuestas de atención diferenciadas.
Comparación por Género y Equidad en la Atención: El intervalo de confianza al 95% para la diferencia de medias entre mujeres y hombres (\(\mu_1 - \mu_2\)) se situó entre -0.67 y 3.57 puntos (\(\bar{x}_1 - \bar{x}_2 = 1.45\)). Dado que el intervalo contiene el valor cero (0), se concluye que no existen diferencias estadísticamente significativas entre ambos géneros en el nivel promedio de depresión, sustentando que los programas de prevención y acompañamiento psicológico deben implementarse por igual en toda la población estudiantil.
DeVeaux, R. D., Velleman, P. F., & Bock, D. E. (2019). Stats: Data and Models (5.ª ed.). Pearson.
Eisenberg, D., Golberstein, E., & Hunt, J. B. (2009). Mental health and academic success in college. The B.E. Journal of Economic Analysis & Policy, 9(1), 1-37. https://doi.org/10.2202/1935-1682.2191
Ibrahim, A. K., Kelly, S. J., Adams, C. E., & Glazebrook, C. (2013). A systematic review of studies investigating the prevalence of depression among university students. Journal of Affective Disorders, 149(1-3), 11-21. https://doi.org/10.1016/j.jad.2012.11.019
Kroenke, K., Spitzer, R. L., & Williams, J. B. (2001). The PHQ‐9: Validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606-613. https://doi.org/10.1046/j.1525-1497.2001.016009606.x
Organización Mundial de la Salud. (2022). Informe mundial sobre la salud mental: Transformar la salud mental para todos. Organización Mundial de la Salud. https://www.who.int/es/publications/i/item/9789240050860
library(gridExtra)
library(grid)
# 1. Crear el data frame para la declaración de IA
tabla_ia <- data.frame(
"Aspecto" = c("Uso de IA",
"Herramientas utilizadas",
"Finalidad",
"Porcentaje estimado de utilización"),
"Información" = c("Sí",
"Gemini y LUCIA",
"Depuración de código R, estructuración de tablas y revisión de redacción",
"20%"),
check.names = FALSE
)
# 2. Definir estilo gráfico
estilo_tabla_ia <- ttheme_minimal(
core = list(
bg_params = list(fill = c("#F8FAFC", "#FFFFFF")),
fg_params = list(fontface = c(2, 1, 1, 1), fontsize = 9.5, col = "#334155", hjust = 0, x = 0.05)
),
colhead = list(
bg_params = list(fill = "#1E3A8A"),
fg_params = list(fontface = 2, fontsize = 10, col = "#FFFFFF", hjust = 0, x = 0.05)
)
)
# 3. Dibujar la tabla
grid.newpage()
grid.draw(tableGrob(tabla_ia, rows = NULL, theme = estilo_tabla_ia))