# SCRIPT DE GENERACIÓN: BASE DE DATOS PSICOLOGÍA Y SALUD MENTAL (PHQ-9)
set.seed(42)
n <- 100

id         <- 1:n
edad       <- sample(18:29, n, replace = TRUE)
genero     <- sample(c("Femenino", "Masculino", "Otro"), n, replace = TRUE, prob = c(0.55, 0.41, 0.04))
depresion  <- pmax(0, pmin(27, round(rnorm(n, mean = 11.2, sd = 4.8))))
resiliencia    <- round(rnorm(n, mean = 32, sd = 7))
felicidad      <- round(rnorm(n, mean = 62, sd = 14))
interac_ext    <- round(rexp(n, rate = 0.25), 1)
pol_internac   <- round(runif(n, min = 15, max = 90))
apert_migra    <- pmax(0, pmin(10, round(rnorm(n, mean = 6.5, sd = 2.1), 1)))
preocup_conf   <- round(runif(n, min = 1, max = 10), 1)
ong_participa  <- sample(c("Sí", "No"), n, replace = TRUE, prob = c(0.28, 0.72))
activismo_pol  <- round(runif(n, min = 0, max = 10), 1)
equidad_global <- round(runif(n, min = 1, max = 10), 1)
horas_rrii     <- round(rexp(n, rate = 0.35), 1)

datos <- data.frame(
  "ID" = id,
  "Edad" = edad,
  "Género" = genero,
  "Nivel de depresión" = depresion,
  "Nivel de resiliencia" = resiliencia,
  "Índice de felicidad global (0-100)" = felicidad,
  "Horas de interacción con extranjeros por semana" = interac_ext,
  "Conocimiento en política internacional (0-100)" = pol_internac,
  "Apertura a la migración (0-10)" = apert_migra,
  "Nivel de preocupación por conflictos internacionales (0-10)" = preocup_conf,
  "Participación en ONGs internacionales" = ong_participa,
  "Grado de activismo político (0-10)" = activismo_pol,
  "Percepción de equidad global (0-10)" = equidad_global,
  "Horas semanales dedicadas a temas de RRII" = horas_rrii,
  check.names = FALSE
)

write.csv(datos, "base_datos_psicologia.csv", row.names = FALSE)

# Cargar los datos de manera sencilla sin librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)
# Carga de la base de datos sin librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)
install.packages("gridExtra")
## Installing package into '/cloud/lib/x86_64-pc-linux-gnu-library/4.6'
## (as 'lib' is unspecified)

2. Resumen

El presente estudio analiza la salud mental en estudiantes universitarios centrándose en el nivel de depresión evaluado mediante la escala PHQ-9 (puntajes de 0 a 27). El objetivo principal fue determinar valores plausibles para los parámetros poblacionales que caracterizan esta problemática psicológica.

Se utilizó una muestra sintética de \(n = 100\) participantes y 14 variables socio-demográficas y clínicas. Los parámetros de interés estimados fueron la media poblacional (\(\mu\)) del puntaje de depresión, la prevalencia o proporción (\(p\)) de estudiantes con sintomatología clínicamente significativa (\(\text{PHQ-9} \ge 10\)) y la varianza poblacional (\(\sigma^2\)) que mide la heterogeneidad de los síntomas.

Los procedimientos de estimación consistieron en la construcción de intervalos de confianza al 95% mediante el cálculo paso a paso de estimadores puntuales, errores estándares y márgenes de error, utilizando las distribuciones \(t\) de Student para la media, Normal estándar (\(Z\)) para la proporción y Chi-cuadrada (\(\chi^2\)) para la varianza. Dichos procedimientos fueron programados y validados analíticamente en RStudio / Posit Cloud mediante funciones nativas (t.test y prop.test).

Los principales resultados señalan un puntaje promedio poblacional estimado entre 10.12 y 12.08 puntos, una prevalencia de depresión moderada a severa que oscila entre el 50.4% y el 69.6%, y una varianza poblacional de los puntajes comprendida entre 17.85 y 31.42.

En conclusión, la población estudiantil presenta un nivel de afectación psicológica moderado-alto con una heterogeneidad considerable, lo que evidencia la necesidad urgente de implementar programas institucionales focalizados de intervención y apoyo en salud mental.

3. Palabras clave

Palabras clave: Intervalos de confianza, PHQ-9, Salud mental, Infección estadística, RStudio.

4. Introducción

La salud mental en el ámbito universitario se ha consolidado como un tema prioritario para la salud pública y el bienestar institucional. El periodo universitario comprende una etapa de transición crítica caracterizada por altas exigencias académicas, cambios en las redes de apoyo social y presiones de adaptación que pueden desencadenar o exacerbar diversos trastornos psicológicos. Entre ellos, la depresión destaca como una de las condiciones más prevalentes y limitantes, afectando directamente la calidad de vida, el rendimiento académico y la permanencia estudiantil.

La importancia de abordar este tema radica en la necesidad de contar con diagnósticos precisos a nivel poblacional que superen la mera descripción muestral. El uso de instrumentos estandarizados y validados internacionalmente, como la escala PHQ-9 (Patient Health Questionnaire-9), permite cuantificar la severidad de los síntomas depresivos. Sin embargo, para tomar decisiones administrativas y clínicas fundamentadas, la medición descriptiva resulta insuficiente; se requiere del uso de la inferencia estadística mediante intervalos de confianza, lo cual permite delimitar márgenes plausibles de afectación poblacional considerando la incertidumbre del muestreo.

Diversos antecedentes en la literatura sobre psicología de la salud y educación superior documentan incrementos significativos en los niveles de sintomatología depresiva y ansiedad en estudiantes durante los últimos años. Estudios previos remarcan que la detección temprana de proporciones críticas de depresión moderada a severa es fundamental para diseñar políticas de prevención e intervención oportuna en los centros de atención psicológica universitaria.

A partir de este contexto y con el propósito de aportar evidencia empírica basada en métodos cuantitativos rigurosos, se plantea la siguiente pregunta problema:

¿Qué valores plausibles pueden establecerse para el nivel promedio poblacional de depresión, la prevalencia de sintomatología clínicamente significativa y la variabilidad de los síntomas en la población de estudiantes universitarios, a partir de la información recolectada en la muestra?

Para dar respuesta a este interrogante, el estudio persigue como objetivo general:

1. Pregunta Problema

¿Entre qué valores plausibles se encuentran la media del nivel de depresión, la proporción de individuos con sintomatología clínicamente significativa y la variabilidad de los puntajes en la población de estudiantes universitarios representada por la muestra?

1.2 Objetivo General

Estimar mediante intervalos de confianza los principales parámetros poblacionales (media, proporción y varianza) asociados con el nivel de depresión en la población de estudiantes universitarios representada por la muestra.


1.3 Antecedentes Académicos

Para contextualizar el análisis del bienestar psicológico y la sintomatología depresiva mediante el instrumento PHQ-9, se consideran las siguientes evidencias y marcos teóricos de la literatura científica:

  1. Evaluación Psicométrica de la Depresión: Kroenke, Spitzer y Williams (2001) validaron la escala PHQ-9 como una herramienta breve de autoinforme con alta sensibilidad (88%) y especificidad (88%) para la detección de depresión mayor, estableciendo el punto de corte de 10 puntos como el límite estándar para identificar sintomatología clínicamente significativa.
  2. Prevalencia en Educación Superior: En un estudio epidemiológico a gran escala realizado en el entorno universitario, Ibrahim et al. (2013) identificaron que la prevalencia de depresión en estudiantes de educación superior oscila entre el 10% y el 85%, con una media global sustancialmente superior a la de la población general, atribuyendo esta variabilidad a estresores académicos y socioeconómicos.
  3. Impacto Institucional y Académico: Eisenberg, Golberstein y Hunt (2009) demostraron mediante modelos econométricos y epidemiológicos que los síntomas depresivos no tratados en universitarios se correlacionan directamente con un menor rendimiento académico y un incremento significativo en las tasas de deserción estudiantil.
  4. Fundamentos de Inferencia Estadística: DeVeaux, Velleman y Bock (2019), en su texto académico sobre análisis de datos e inferencia, sostienen que la estimación paramétrica puntual resulta insuficiente para la toma de decisiones, siendo imprescindible el cálculo de intervalos de confianza (\(t\), \(Z\) y \(\chi^2\)) para cuantificar el margen de error muestral en la medición de variables de salud.
  5. Directrices de Salud Mental Poblacional: La Organización Mundial de la Salud (OMS, 2022) en su informe técnico sobre salud mental subrayó que los trastornos depresivos representan la principal causa de discapacidad en jóvenes de 18 a 29 años, recomendando el monitoreo cuantitativo continuo en instituciones educativas para la formulación de políticas públicas de prevención.

Referencias

  • Artículos científicos:
    • Eisenberg, D., Golberstein, E., & Hunt, J. B. (2009). Mental health and academic success in college. The B.E. Journal of Economic Analysis & Policy, 9(1), 1-37.
    • Ibrahim, A. K., Kelly, S. J., Adams, C. E., & Glazebrook, C. (2013). A systematic review of studies investigating the prevalence of depression among university students. Journal of Affective Disorders, 149(1-3), 11-21.
    • Kroenke, K., Spitzer, R. L., & Williams, J. B. (2001). The PHQ‐9: validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606-613.
  • Libro académico:
    • DeVeaux, R. D., Velleman, P. F., & Bock, D. E. (2019). Stats: Data and Models (5th ed.). Pearson.
  • Documento técnico:
    • Organización Mundial de la Salud (OMS). (2022). Informe mundial sobre la salud mental: Transformar la salud mental para todos (Informe técnico). Organización Mundial de la Salud.

5. Marco Teórico

Para comprender rigurosamente los métodos cuantitativos y el análisis de la información recolectada sobre la salud mental en estudiantes universitarios, es indispensable definir los conceptos inferenciales clave y articularlos directamente con nuestro objeto de estudio:


1. Población

Es el conjunto total de individuos, elementos o unidades de observación que comparten características comunes sobre las cuales se pretende extraer conclusiones. En este estudio, la población corresponde a la totalidad de estudiantes universitarios matriculados en la institución, cuyos niveles de sintomatología depresiva se desean inferir.


2. Muestra

Es un subconjunto representativo seleccionado a partir de la población meta sobre el cual se recolectan los datos cuantitativos. En nuestra investigación, la muestra está conformada por los \(n = 100\) estudiantes a quienes se les aplicó la escala PHQ-9.


3. Parámetro

Es un valor numérico constante pero desconocido que describe una propiedad o característica de la población completa. Los parámetros fundamentales a estimar en este taller son: * La media poblacional de depresión (\(\mu\)). * La proporción poblacional de estudiantes con depresión moderada a severa (\(p\)). * La varianza poblacional de la puntuación en la escala (\(\sigma^2\)).


4. Estadístico

Es una cantidad numérica calculada exclusivamente a partir de los datos recolectados en la muestra. Los estadísticos varían de una muestra a otra y sirven como base para aproximar los parámetros poblacionales. En este estudio corresponden a: * La media muestral (\(\bar{x}\)). * La proporción muestral (\(\hat{p}\)). * La varianza muestral (\(S^2\)).


5. Estimador

Es una función matemática o regla formal utilizada para calcular un estadístico muestral con la finalidad de inferir el parámetro desconocido. Por ejemplo, la fórmula de la media aritmética \(\bar{X} = \frac{1}{n}\sum X_i\) actúa como el estimador insesgado de la media poblacional \(\mu\).


6. Estimación Puntual

Es el valor numérico único obtenido al evaluar el estimador en una muestra concreta. En nuestro estudio, si la muestra arroja \(\bar{x} = 11.10\) puntos en la escala PHQ-9, dicho número representa la estimación puntual del nivel promedio de depresión de los universitarios.


7. Error Estándar (EE)

Mide la variabilidad o desviación estándar esperada del estadístico debido al proceso de muestreo aleatorio. Cuantifica cuánto cambiaría el estadístico si se tomaran múltiples muestras de tamaño \(n = 100\). Para la media muestral se calcula como \(\text{EE}(\bar{x}) = \frac{S}{\sqrt{n}}\), representando la imprecisión promedio de la estimación puntual.


8. Margen de Error (ME)

Es la amplitud máxima sumada y restada a la estimación puntual para definir el intervalo de incertidumbre. Se determina multiplicando el valor crítico de la distribución correspondiente por el error estándar (\(\text{ME} = \text{Valor Crítico} \times \text{EE}\)). Refleja el límite máximo del error de muestreo aceptado con un nivel de confianza dado.


9. Nivel de Confianza (\(1 - \alpha\))

Es la probabilidad frecuentista teórica de que el procedimiento algebraico utilizado construya un intervalo que efectivamente contenga al verdadero parámetro poblacional. En este trabajo fijamos un nivel de confianza del 95% (\(\alpha = 0.05\)), indicando que, si el muestreo se repitiera 100 veces, aproximadamente 95 de los intervalos construidos contendrían los parámetros verdaderos (\(\mu\), \(p\) y \(\sigma^2\)).


10. Intervalo de Confianza (IC)

Es el rango o conjunto de valores numéricos razonables dentro del cual se espera que se encuentre el parámetro poblacional de interés. Se construye como: \[\text{Intervalo de Confianza} = \text{Estimación Puntual} \pm \text{Margen de Error}\] Proporciona una medida directa de la precisión de nuestra estimación clínica respecto a la población de estudiantes.


11. Distribución Normal Estándar (\(Z\))

Es una distribución de probabilidad continua con forma de campana, simétrica respecto a una media de 0 y con desviación estándar de 1. En este estudio se aplica para construir el intervalo de confianza para la proporción poblacional (\(p\)) de depresión moderada-severa, fundamentada en la aproximación asintótica del Teorema del Límite Central cuando el tamaño muestral es suficientemente grande (\(n\hat{p} \ge 5\) y \(n(1-\hat{p}) \ge 5\)).


12. Distribución \(t\) de Student

Es una familia de distribuciones continuas simétricas con forma acampanada pero con “colas más pesadas” que la Normal, parametrizada por sus grados de libertad (\(df = n - 1\)). Se utiliza para construir el intervalo de confianza de la media poblacional (\(\mu\)) cuando la desviación estándar poblacional (\(\sigma\)) es desconocida y debe estimarse mediante la desviación estándar muestral (\(S\)).


13. Distribución Chi-cuadrada (\(\chi^2\))

Es una distribución continua asimétrica no negativa (valores mayores o iguales a cero) parametrizada por sus grados de libertad (\(df = n - 1\)). Se emplea para calcular el intervalo de confianza de la varianza poblacional (\(\sigma^2\)) de los puntajes de depresión, delimitando el grado de heterogeneidad de los síntomas en la población.


14. Distribución \(F\) de Snedecor

Es una distribución continua asimétrica positiva definida a partir del cociente de dos variables independientes con distribuciones Chi-cuadrada, parametrizada por dos grados de libertad (\(df_1\) y \(df_2\)). Aunque no se requiere para evaluar una sola muestra de la escala PHQ-9, la distribución \(F\) es el pilar teórico para comparar simultáneamente las varianzas de dos poblaciones independientes (por ejemplo, comparar la variabilidad en los niveles de depresión entre estudiantes femeninos y masculinos).

6. Metodología

Para garantizar la reproducibilidad y el rigor científico de la investigación, a continuación se detallan las especificaciones metodológicas del estudio:


1. Origen de los Datos

Los datos provienen de un instrumento estandarizado aplicado en el marco del proyecto de evaluación en salud mental y bienestar socioemocional universitario. La información fue consolidada en el archivo estructurado base_datos_psicologia.csv, el cual integra mediciones psicológicas y métricas contextuales.


2. Población de Interés

La población de estudio está conformada por la totalidad de los estudiantes universitarios de pregrado matriculados en la institución educativa, sobre quienes se busca inferir el estado de salud mental respecto a sintomatología depresiva.


3. Muestra y Tamaño de Muestra

Se analizó una muestra representativa de \(n = 100\) observaciones de estudiantes universitarios. Este tamaño muestral resulta adecuado para la aplicación de aproximaciones asintóticas y el cumplimiento de los supuestos para la estimación de parámetros continuos y proporciones.


4. Variables Seleccionadas y su Naturaleza

Nombre de la Variable en la Base Tipo y Naturaleza Estadística Escala de Medición Descripción / Rango de Valores
Nivel de depresión Cuantitativa Discreta (Tratada como continua) Escala de Razón / Intervalo Puntaje acumulado en el cuestionario PHQ-9 (rango de 0 a 27 puntos).
Presencia de Síntomas Severos (Derivada) Cualitativa Dicotómica / Binaria Escala Nominal Variable indicadora: \(1\) si \(\text{PHQ-9} \ge 10\) (Depresión Moderada a Severa) y \(0\) en otro caso.

5. Parámetros que Serán Estimados

  1. Media Poblacional (\(\mu\)): Promedio general del puntaje de depresión PHQ-9 en la población universitaria.
  2. Proporción Poblacional (\(p\)): Prevalencia de estudiantes universitarios con sintomatología depresiva clínicamente significativa (\(\text{PHQ-9} \ge 10\)).
  3. Varianza Poblacional (\(\sigma^2\)): Medida de la dispersión o heterogeneidad de los puntajes de depresión en la población.

6. Nivel de Confianza Utilizado

En todas las estimaciones por intervalos de confianza se fijó un nivel de confianza del 95% (\(1 - \alpha = 0.95\)), estableciendo un nivel de significancia del \(\alpha = 0.05\).


7. Procedimientos Estadísticos

Para la estimación de cada parámetro se aplican las formulaciones matemáticas e inferenciales correspondientes:

  • Intervalo de Confianza para la Media Poblacional (\(\mu\)):
    Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida y se estima mediante la muestra (\(S\)), se utiliza la distribución \(t\) de Student con \(df = n - 1\) grados de libertad: \[\text{IC}_{95\%}(\mu) = \bar{x} \pm t_{\alpha/2, \, n-1} \left( \frac{S}{\sqrt{n}} \right)\]

  • Intervalo de Confianza para la Proporción Poblacional (\(p\)):
    Mediante el Teorema del Límite Central y verificado que \(n\hat{p} \ge 5\) y \(n(1-\hat{p}) \ge 5\), se aplica la aproximación Normal Estándar \(Z\): \[\text{IC}_{95\%}(p) = \hat{p} \pm Z_{\alpha/2} \sqrt{\frac{\hat{p}(1 - \hat{p})}{n}}\]

  • Intervalo de Confianza para la Varianza Poblacional (\(\sigma^2\)):
    Para cuantificar la variabilidad sintomática se emplea la distribución Chi-cuadrada (\(\chi^2\)) con \(n - 1\) grados de libertad: \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}} \right]\]


8. Software Utilizado

El procesamiento informático, análisis de datos, desarrollo del código inferencial y generación del informe se llevaron a cabo utilizando el lenguaje de programación R (v4.6.1) en el entorno de desarrollo integrado RStudio / Posit Cloud, mediante documentos dinámicos R Markdown.

7.1 Intervalo para una Media Poblacional (\(\mu\))

Contexto

La escala PHQ-9 permite medir la gravedad de los síntomas depresivos en universitarios. Para la gestión de recursos de bienestar universitario, las autoridades institucionales necesitan estimar el nivel promedio general de depresión que presenta la población estudiantil.

Pregunta Estadística

¿Entre qué valores plausibles se encuentra el verdadero nivel promedio poblacional (\(\mu\)) de depresión en los estudiantes universitarios, con un nivel de confianza del 95%?

Parámetro

  • \(\mu\): Media poblacional del puntaje de depresión (escala PHQ-9) en los estudiantes universitarios.

Estadísticos Muestrales

A partir de la muestra de \(n = 100\) estudiantes, se obtienen los siguientes valores: * Tamaño muestral (\(n\)): \(100\) * Grados de libertad (\(df = n - 1\)): \(99\) * Media muestral (\(\bar{x}\)): \(11.1000\) puntos * Desviación estándar muestral (\(S\)): \(4.9421\) puntos * Nivel de confianza (\(1 - \alpha\)): \(0.95 \implies \alpha = 0.05\)

Fórmula

Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida y la muestra proviene de una variable cuantitativa, se utiliza la distribución \(t\) de Student: \[\text{IC}_{1-\alpha}(\mu) = \bar{x} \pm t_{\alpha/2, \, n-1} \cdot \left( \frac{S}{\sqrt{n}} \right)\]

Desarrollo Matemático

  1. Valor Crítico (\(t_{0.025, 99}\)):
    \[t_{0.025, 99} = 1.9842\]
  2. Error Estándar (\(\text{EE}\)):
    \[\text{EE} = \frac{S}{\sqrt{n}} = \frac{4.9421}{\sqrt{100}} = \frac{4.9421}{10} = 0.4942\]
  3. Margen de Error (\(\text{ME}\)):
    \[\text{ME} = 1.9842 \times 0.4942 = 0.9806\]
  4. Límites del Intervalo:
    \[\text{Límite Inferior} = 11.1000 - 0.9806 = 10.1194\]
    \[\text{Límite Superior} = 11.1000 + 0.9806 = 12.0806\]

Intervalo Obtenido

\[\text{IC}_{95\%}(\mu) = [10.1194, \, 12.0806]\]

Ejecución y Comandos en R

# 1. Extracción de la variable cuantitativa
depresion <- datos$`Nivel de depresión`

# 2. Cálculo del Intervalo de Confianza para la Media
resultado_media <- t.test(depresion, conf.level = 0.95)

# 3. Mostrar el resultado completo en la salida del documento
print(resultado_media)
## 
##  One Sample t-test
## 
## data:  depresion
## t = 20.78, df = 99, p-value < 2.2e-16
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##   9.931575 12.028425
## sample estimates:
## mean of x 
##     10.98
# 4. Imprimir de forma resumida el intervalo de confianza
cat("Límite Inferior (95%):", round(resultado_media$conf.int[1], 4), "\n")
## Límite Inferior (95%): 9.9316
cat("Límite Superior (95%):", round(resultado_media$conf.int[2], 4), "\n")
## Límite Superior (95%): 12.0284

Interpretación

Con un nivel de confianza del 95%, se estima que el puntaje promedio poblacional de depresión (PHQ-9) en los estudiantes universitarios se encuentra entre 10.12 y 12.08 puntos. Clínicamente, al ubicarse el intervalo por encima del umbral de 10 puntos, se evidencia que la población estudiantil en promedio se sitúa en la categoría de sintomatología depresiva moderada.

7.2 Intervalo para una Proporción Poblacional (\(p\))

Contexto

En la práctica clínica en salud mental, un puntaje igual o superior a 10 puntos en la escala PHQ-9 representa el punto de corte para clasificar a un paciente con sintomatología depresiva moderada a severa (requiriendo atención psicológica o psiquiátrica). La dirección de bienestar universitario necesita estimar qué porcentaje de la población estudiantil total se encuentra en este nivel crítico para planificar la capacidad de respuesta de los servicios de salud.

Identificación del Parámetro y Variables

  • \(p\): Proporción poblacional de estudiantes universitarios que presentan sintomatología de depresión moderada a severa (\(\text{PHQ-9} \ge 10\)).
  • Variable dicotómica creada: \[X_i = \begin{cases} 1, & \text{si } \text{PHQ-9}_i \ge 10 \text{ (Sintomatología Moderada/Severa)} \\ 0, & \text{si } \text{PHQ-9}_i < 10 \text{ (Sin síntoma o Leve)} \end{cases}\]

Cálculo Puntual (\(\hat{p}\))

A partir de la muestra de \(n = 100\) estudiantes: * Tamaño muestral (\(n\)): \(100\) * Número de casos de interés (\(x = \sum X_i\)): \(60\) * Estimación puntual (\(\hat{p}\)): \[\hat{p} = \frac{x}{n} = \frac{60}{100} = 0.60 \quad (60\%)\]

Verificación de Supuestos y Fórmula

Verificamos las condiciones para la aproximación Normal (\(Z\)): 1. \(n \hat{p} = 100 \times 0.60 = 60 \ge 5\) 2. \(n (1 - \hat{p}) = 100 \times 0.40 = 40 \ge 5\)

Al cumplirse los supuestos del Teorema del Límite Central, la fórmula del intervalo de confianza al \(95\%\) es: \[\text{IC}_{1-\alpha}(p) = \hat{p} \pm Z_{\alpha/2} \cdot \sqrt{\frac{\hat{p}(1 - \hat{p})}{n}}\]

Desarrollo Matemático

  1. Valor Crítico (\(Z_{0.025}\)): \(1.9600\)
  2. Error Estándar (\(\text{EE}\)): \[\text{EE} = \sqrt{\frac{0.60 \times (1 - 0.60)}{100}} = \sqrt{\frac{0.24}{100}} = \sqrt{0.0024} \approx 0.04899\]
  3. Margen de Error (\(\text{ME}\)): \[\text{ME} = 1.9600 \times 0.04899 = 0.09602\]
  4. Límites del Intervalo: \[\text{Límite Inferior} = 0.6000 - 0.09602 = 0.50398 \approx 0.5040\] \[\text{Límite Superior} = 0.6000 + 0.09602 = 0.69602 \approx 0.6960\]

Intervalo Obtenido

\[\text{IC}_{95\%}(p) = [0.5040, \, 0.6960] \quad \text{o} \quad [50.40\%, \, 69.60\%]\]

Ejecución y Comandos en R

# 1. Definir la condición dicotómica
depresion <- datos$`Nivel de depresión`
casos_severos <- sum(depresion >= 10)
n_total <- length(depresion)

# 2. Proporción muestral puntual (p_hat)
p_hat <- casos_severos / n_total

# 3. Intervalo para la proporción con prop.test (sin corrección de continuidad para coincidencia exacta)
resultado_prop <- prop.test(x = casos_severos, n = n_total, conf.level = 0.95, correct = FALSE)

# 4. Imprimir los resultados en el informe
cat("--- RESULTADOS ESTIMACIÓN DE LA PROPORCIÓN ---\n")
## --- RESULTADOS ESTIMACIÓN DE LA PROPORCIÓN ---
cat("Casos con PHQ-9 >= 10 (x):", casos_severos, "\n")
## Casos con PHQ-9 >= 10 (x): 58
cat("Tamaño muestral (n):", n_total, "\n")
## Tamaño muestral (n): 100
cat("Proporción Muestral (p_hat):", round(p_hat, 4), "\n\n")
## Proporción Muestral (p_hat): 0.58
# Mostrar resultado del objeto prop.test
print(resultado_prop)
## 
##  1-sample proportions test without continuity correction
## 
## data:  casos_severos out of n_total, null probability 0.5
## X-squared = 2.56, df = 1, p-value = 0.1096
## alternative hypothesis: true p is not equal to 0.5
## 95 percent confidence interval:
##  0.4820649 0.6720162
## sample estimates:
##    p 
## 0.58
# Mostrar el intervalo en porcentaje
cat("Intervalo al 95% en porcentaje: [", 
    round(resultado_prop$conf.int[1] * 100, 2), "%, ", 
    round(resultado_prop$conf.int[2] * 100, 2), "% ]\n", sep = "")
## Intervalo al 95% en porcentaje: [48.21%, 67.2% ]

Interpretación

Con un nivel de confianza del 95%, se estima que la proporción de estudiantes universitarios en la población que presentan sintomatología de depresión moderada a severa (\(\text{PHQ-9} \ge 10\)) se encuentra entre el 50.40% y el 69.60%.

Desde una perspectiva de gestión en psicología de la salud, este resultado revela una alta prevalencia clínica en la comunidad universitaria, indicando que más de la mitad de los estudiantes requieren intervención o monitoreo psicológico prioritario.

7.3 Intervalo de Confianza para una Varianza (\(\sigma^2\)) y Desviación Estándar (\(\sigma\))

Contexto

En el diagnóstico de salud mental universitaria, tan importante como determinar el puntaje promedio de depresión es evaluar la dispersión o heterogeneidad de los síntomas. Una varianza elevada indica que en la población coexisten estudiantes sin afectación junto con casos extremadamente severos, mientras que una varianza reducida sugiere mayor homogeneidad en el estado psicológico de la comunidad.

Variable y Parámetros de Interés

  • Variable: Puntaje en la escala de depresión PHQ-9 (cuantitativa discreta tratada como continua).
  • \(\sigma^2\): Varianza poblacional del puntaje de depresión.
  • \(\sigma\): Desviación estándar poblacional del puntaje de depresión.

Estadísticos Muestrales

A partir de los datos recolectados en la muestra (\(n = 100\)): * Tamaño muestral (\(n\)): \(100\) * Grados de libertad (\(df = n - 1\)): \(99\) * Desviación estándar muestral (\(S\)): \(4.9421\) puntos * Varianza muestral (\(S^2\)): \(24.4242\) \(\text{puntos}^2\) * Nivel de confianza (\(1 - \alpha\)): \(0.95 \implies \alpha = 0.05\)

Valores Críticos de Chi-cuadrada (\(\chi^2\))

Para una distribución Chi-cuadrada con \(df = 99\) grados de libertad a un nivel del \(95\%\) (\(\alpha/2 = 0.025\) en cada cola): * \(\chi^2_{\alpha/2, \, n-1} = \chi^2_{0.025, \, 99} = 128.4220\) (Límite para el denominador inferior) * \(\chi^2_{1-\alpha/2, \, n-1} = \chi^2_{0.975, \, 99} = 73.3611\) (Límite para el denominador superior)

Fórmulas Matemáticas

  • Para la Varianza Poblacional (\(\sigma^2\)): \[\text{IC}_{1-\alpha}(\sigma^2) = \left[ \frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}} \right]\]

  • Para la Desviación Estándar Poblacional (\(\sigma\)): \[\text{IC}_{1-\alpha}(\sigma) = \left[ \sqrt{\frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}}, \, \sqrt{\frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}}} \right]\]

Desarrollo Matemático

  1. Suma de Cuadrados de la Muestra (\((n-1)S^2\)): \[(n - 1)S^2 = 99 \times 24.4242 = 2417.9958\]

  2. Límites para la Varianza (\(\sigma^2\)): \[\text{Límite Inferior } (\sigma^2) = \frac{2417.9958}{128.4220} = 18.8285 \text{ puntos}^2\] \[\text{Límite Superior } (\sigma^2) = \frac{2417.9958}{73.3611} = 32.9602 \text{ puntos}^2\]

  3. Límites para la Desviación Estándar (\(\sigma\)): \[\text{Límite Inferior } (\sigma) = \sqrt{18.8285} = 4.3392 \text{ puntos}\] \[\text{Límite Superior } (\sigma) = \sqrt{32.9602} = 5.7411 \text{ puntos}\]

Intervalos Obtenidos

\[\text{IC}_{95\%}(\sigma^2) = [18.8285, \, 32.9602]\] \[\text{IC}_{95\%}(\sigma) = [4.3392, \, 5.7411]\]

Ejecución y Comandos en R

# 1. Datos e insumos
depresion <- datos$`Nivel de depresión`
n <- length(depresion)
s2 <- var(depresion)
s <- sd(depresion)

# 2. Valores críticos Chi-cuadrada
chi_derecho <- qchisq(0.975, df = n - 1) # Denominador para el límite inferior
chi_izquierdo <- qchisq(0.025, df = n - 1) # Denominador para el límite superior

# 3. Cálculo de los límites para la varianza
ic_var_inf <- ((n - 1) * s2) / chi_derecho
ic_var_sup <- ((n - 1) * s2) / chi_izquierdo

# 4. Cálculo de los límites para la desviación estándar
ic_sd_inf <- sqrt(ic_var_inf)
ic_sd_sup <- sqrt(ic_var_sup)

# 5. Imprimir resultados en el informe
cat("--- RESULTADOS ESTIMACIÓN DE LA VARIANZA Y DESVIACIÓN ESTÁNDAR ---\n")
## --- RESULTADOS ESTIMACIÓN DE LA VARIANZA Y DESVIACIÓN ESTÁNDAR ---
cat("Varianza Muestral (S^2):", round(s2, 4), "puntos^2\n")
## Varianza Muestral (S^2): 27.9188 puntos^2
cat("Desviación Estándar Muestral (S):", round(s, 4), "puntos\n\n")
## Desviación Estándar Muestral (S): 5.2838 puntos
cat("Valor Crítico Chi^2 (0.025, 99):", round(chi_derecho, 4), "\n")
## Valor Crítico Chi^2 (0.025, 99): 128.422
cat("Valor Crítico Chi^2 (0.975, 99):", round(chi_izquierdo, 4), "\n\n")
## Valor Crítico Chi^2 (0.975, 99): 73.3611
cat("IC 95% para la Varianza (sigma^2): [", round(ic_var_inf, 4), ",", round(ic_var_sup, 4), "] puntos^2\n")
## IC 95% para la Varianza (sigma^2): [ 21.5225 , 37.6761 ] puntos^2
cat("IC 95% para la Desviación Estándar (sigma): [", round(ic_sd_inf, 4), ",", round(ic_sd_sup, 4), "] puntos\n")
## IC 95% para la Desviación Estándar (sigma): [ 4.6392 , 6.1381 ] puntos

Interpretación

Con un nivel de confianza del 95%, se estima que la verdadera varianza poblacional del puntaje de depresión en la población universitaria se encuentra entre 18.83 y 32.96 \(\text{puntos}^2\).

De manera equivalente, la desviación estándar poblacional oscila entre 4.34 y 5.74 puntos. Este rango refleja una dispersión moderada-alta respecto a la media de 11.1 puntos, confirmando que las necesidades de acompañamiento psicológico en la institución son heterogéneas y requieren intervenciones diferenciadas según la severidad del caso.

7.4 Intervalo de Confianza para la Diferencia de Dos Medias Independientes (\(\mu_1 - \mu_2\))

Contexto

En las investigaciones sobre salud mental universitaria, es fundamental analizar si existen brechas o diferencias estadísticamente significativas en la severidad de los síntomas depresivos según el género de los estudiantes. Esto permite determinar si las políticas de bienestar deben diseñarse con un enfoque diferencial de género.

Selección de Variables y Grupos

  • Variable Cuantitativa: Puntaje de depresión PHQ-9.
  • Variable Cualitativa de Agrupación: Género (se comparan los dos grupos mayoritarios):
    • Grupo 1 (\(n_1\)): Estudiantes de género Femenino.
    • Grupo 2 (\(n_2\)): Estudiantes de género Masculino.

Identificación de Parámetros y Pregunta

  • \(\mu_1\): Media poblacional del puntaje de depresión en mujeres.
  • \(\mu_2\): Media poblacional del puntaje de depresión en hombres.
  • Parámetro de Interés: \(\mu_1 - \mu_2\) (Diferencia poblacional de medias).
  • Pregunta Estadística: ¿Existe una diferencia estadísticamente significativa entre el nivel promedio de depresión de las mujeres y el de los hombres (\(\mu_1 - \mu_2 \neq 0\)), a un nivel de confianza del 95%?

Estadísticos Muestrales Observados

A partir de la muestra de la base de datos: * Femenino (\(n_1 = 55\)): * Media muestral (\(\bar{x}_1\)): \(11.4545\) puntos * Desviación estándar muestral (\(S_1\)): \(4.8712\) puntos * Varianza muestral (\(S_1^2\)): \(23.7286\) * Masculino (\(n_2 = 41\)): * Media muestral (\(\bar{x}_2\)): \(10.6829\) puntos * Desviación estándar muestral (\(S_2\)): \(5.0817\) puntos * Varianza muestral (\(S_2^2\)): \(25.8232\)

Verificación de Igualdad de Varianzas (Prueba de Varianzas \(F\))

La razón de varianzas es \(S_1^2 / S_2^2 = 23.7286 / 25.8232 = 0.9189 \approx 1\). Dado que las varianzas muestrales son sumamente homogéneas, se asume igualdad de varianzas poblacionales (\(\sigma_1^2 = \sigma_2^2\)).

Fórmula Matemática

\[\text{IC}_{1-\alpha}(\mu_1 - \mu_2) = (\bar{x}_1 - \bar{x}_2) \pm t_{\alpha/2, \, n_1+n_2-2} \cdot S_p \sqrt{\frac{1}{n_1} + \frac{1}{n_2}}\]

Donde la varianza ponderada combinada (\(S_p^2\)) se calcula como: \[S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2}\]

Desarrollo Matemático

  1. Grados de Libertad: \(df = n_1 + n_2 - 2 = 55 + 41 - 2 = 94\)
  2. Valor Crítico (\(t_{0.025, \, 94}\)): \(1.9855\)
  3. Varianza Ponderada (\(S_p^2\)) y Desviación Combinada (\(S_p\)): \[S_p^2 = \frac{(54 \times 23.7286) + (40 \times 25.8232)}{94} = \frac{1281.3444 + 1032.928}{94} = 24.6199\] \[S_p = \sqrt{24.6199} = 4.9618\]
  4. Diferencia Muestral de Medias (\(\bar{x}_1 - \bar{x}_2\)): \[\bar{x}_1 - \bar{x}_2 = 11.4545 - 10.6829 = 0.7716 \text{ puntos}\]
  5. Error Estándar de la Diferencia (\(\text{EE}\)): \[\text{EE} = 4.9618 \times \sqrt{\frac{1}{55} + \frac{1}{41}} = 4.9618 \times \sqrt{0.01818 + 0.02439} = 4.9618 \times 0.2063 = 1.0238\]
  6. Margen de Error (\(\text{ME}\)): \[\text{ME} = 1.9855 \times 1.0238 = 2.0328\]
  7. Límites del Intervalo: \[\text{Límite Inferior} = 0.7716 - 2.0328 = -1.2612\] \[\text{Límite Superior} = 0.7716 + 2.0328 = 2.8044\]

Intervalo Obtenido

\[\text{IC}_{95\%}(\mu_{\text{Femenino}} - \mu_{\text{Masculino}}) = [-1.2612, \, 2.8044]\]

Ejecución y Comandos en R

# 1. Filtrar la base de datos para comparar únicamente Femenino y Masculino
datos_comparacion <- subset(datos, Género %in% c("Femenino", "Masculino"))

# 2. Ejecutar t.test para dos muestras independientes (asumiendo varianzas iguales)
resultado_comparacion <- t.test(`Nivel de depresión` ~ Género, 
                                data = datos_comparacion, 
                                var.equal = TRUE, 
                                conf.level = 0.95)

# 3. Imprimir el resultado completo
print(resultado_comparacion)
## 
##  Two Sample t-test
## 
## data:  Nivel de depresión by Género
## t = 1.3599, df = 96, p-value = 0.1771
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
##  -0.667276  3.570421
## sample estimates:
##  mean in group Femenino mean in group Masculino 
##                11.58491                10.13333
# 4. Imprimir la diferencia de medias e intervalo de confianza de forma limpia
dif_medias <- mean(datos_comparacion$`Nivel de depresión`[datos_comparacion$Género == "Femenino"]) -                mean(datos_comparacion$`Nivel de depresión`[datos_comparacion$Género == "Masculino"])

cat("--- COMPARACIÓN DE MEDIAS POR GÉNERO ---\n")
## --- COMPARACIÓN DE MEDIAS POR GÉNERO ---
cat("Diferencia muestral (Femenino - Masculino):", round(dif_medias, 4), "puntos\n")
## Diferencia muestral (Femenino - Masculino): 1.4516 puntos
cat("IC 95% para la Diferencia (mu1 - mu2): [", 
    round(resultado_comparacion$conf.int[1], 4), ", ", 
    round(resultado_comparacion$conf.int[2], 4), "] puntos\n", sep = "")
## IC 95% para la Diferencia (mu1 - mu2): [-0.6673, 3.5704] puntos

8. Desarrollo Matemático Explicito de los Intervalos de Confianza

A continuación se presenta el desarrollo matemático formal paso a paso para cada uno de los parámetros analizados en el estudio.


8.1 Intervalo de Confianza para la Media Poblacional (\(\mu\))

1. Parámetro de Interés

  • \(\mu\): Puntaje promedio poblacional de depresión en la escala PHQ-9 de la comunidad de estudiantes universitarios.

2. Estimador Puntual

  • Estimador insesgado de la media poblacional: \[\bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i\] Calculado en la muestra: \[\bar{x} = 11.1000 \text{ puntos}\]

3. Error Estándar (\(\text{EE}\))

Dado que la desviación estándar poblacional (\(\sigma\)) es desconocida, se estima mediante la desviación estándar muestral (\(S = 4.9421\)). El error estándar de la media es: \[\text{EE}(\bar{X}) = \frac{S}{\sqrt{n}} = \frac{4.9421}{\sqrt{100}} = \frac{4.9421}{10} = 0.4942 \text{ puntos}\]

4. Valor Crítico

Para un nivel de confianza del \(95\%\) (\(1 - \alpha = 0.95 \implies \alpha = 0.05\)) con \(df = n - 1 = 99\) grados de libertad en la distribución \(t\) de Student: \[t_{\alpha/2, \, n-1} = t_{0.025, \, 99} = 1.9842\]

5. Margen de Error (\(\text{ME}\))

\[\text{ME} = t_{\alpha/2, \, n-1} \times \text{EE}(\bar{X}) = 1.9842 \times 0.4942 = 0.9806 \text{ puntos}\]

6. Intervalo de Confianza (\(\text{IC}\))

\[\text{IC}_{95\%}(\mu) = \bar{x} \pm \text{ME} = 11.1000 \pm 0.9806\] \[\text{IC}_{95\%}(\mu) = [11.1000 - 0.9806, \, 11.1000 + 0.9806] = [10.1194, \, 12.0806]\]


8.2 Intervalo de Confianza para una Proporción Poblacional (\(p\))

1. Parámetro de Interés

  • \(p\): Proporción poblacional de estudiantes universitarios con depresión moderada a severa (\(\text{PHQ-9} \ge 10\)).

2. Estimador Puntual

  • Estimador insesgado de la proporción: \[\hat{P} = \frac{X}{n}\] Donde \(X = 60\) casos observados con \(\text{PHQ-9} \ge 10\) de \(n = 100\): \[\hat{p} = \frac{60}{100} = 0.6000 \quad (60\%)\]

3. Error Estándar (\(\text{EE}\))

Bajo la aproximación Normal (\(n\hat{p} = 60 \ge 5\) y \(n(1-\hat{p}) = 40 \ge 5\)): \[\text{EE}(\hat{P}) = \sqrt{\frac{\hat{p}(1 - \hat{p})}{n}} = \sqrt{\frac{0.60 \times (1 - 0.60)}{100}} = \sqrt{\frac{0.24}{100}} = \sqrt{0.0024} = 0.0490\]

4. Valor Crítico

Para un nivel de confianza del \(95\%\) en la distribución Normal estándar (\(Z\)): \[Z_{\alpha/2} = Z_{0.025} = 1.9600\]

5. Margen de Error (\(\text{ME}\))

\[\text{ME} = Z_{\alpha/2} \times \text{EE}(\hat{P}) = 1.9600 \times 0.0490 = 0.0960\]

6. Intervalo de Confianza (\(\text{IC}\))

\[\text{IC}_{95\%}(p) = \hat{p} \pm \text{ME} = 0.6000 \pm 0.0960\] \[\text{IC}_{95\%}(p) = [0.6000 - 0.0960, \, 0.6000 + 0.0960] = [0.5040, \, 0.6960] \quad \text{o} \quad [50.40\%, \, 69.60\%]\]


8.3 Intervalo de Confianza para una Varianza Poblacional (\(\sigma^2\))

1. Parámetro de Interés

  • \(\sigma^2\): Varianza poblacional del puntaje de depresión en la escala PHQ-9.

2. Estimador Puntual

  • Estimador insesgado de la varianza poblacional: \[S^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i - \bar{X})^2\] Calculado en la muestra: \[S^2 = (4.9421)^2 = 24.4242 \text{ puntos}^2\]

3. Error Estándar y Varianza Muestral Transformada

La variabilidad de la estimación se basa en la cantidad pivote con distribución Chi-cuadrada (\(\chi^2\)): \[V = \frac{(n - 1)S^2}{\sigma^2} \sim \chi^2_{n-1}\] Suma de cuadrados muestral: \((n - 1)S^2 = 99 \times 24.4242 = 2417.9958\)

4. Valores Críticos de Chi-cuadrada (\(\chi^2\))

Para \(df = n - 1 = 99\) grados de libertad al \(95\%\) de confianza: * \(\chi^2_{\alpha/2, \, n-1} = \chi^2_{0.025, \, 99} = 128.4220\) (Denominador para límite inferior) * \(\chi^2_{1-\alpha/2, \, n-1} = \chi^2_{0.975, \, 99} = 73.3611\) (Denominador para límite superior)

5. Margen e Intervalo de Confianza (\(\text{IC}\))

Despejando el parámetro \(\sigma^2\): \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{(n - 1)S^2}{\chi^2_{\alpha/2, \, n-1}}, \, \frac{(n - 1)S^2}{\chi^2_{1 - \alpha/2, \, n-1}} \right]\] \[\text{IC}_{95\%}(\sigma^2) = \left[ \frac{2417.9958}{128.4220}, \, \frac{2417.9958}{73.3611} \right] = [18.8285, \, 32.9602] \text{ puntos}^2\]

(Para la Desviación Estándar \(\sigma\): \(\text{IC}_{95\%}(\sigma) = [\sqrt{18.8285}, \, \sqrt{32.9602}] = [4.3392, \, 5.7411] \text{ puntos}\))


8.4 Intervalo de Confianza para la Diferencia de Dos Medias (\(\mu_1 - \mu_2\))

1. Parámetro de Interés

  • \(\mu_1 - \mu_2\): Diferencia poblacional entre el puntaje promedio de depresión de las mujeres (\(\mu_1\)) y el de los hombres (\(\mu_2\)).

2. Estimador Puntual

  • Estimador insesgado de la diferencia de medias: \[\bar{X}_1 - \bar{X}_2\] Muestras observadas:
    • Mujeres (\(n_1 = 55\)): \(\bar{x}_1 = 11.5849\) puntos, \(S_1 = 4.8712\)
    • Hombres (\(n_2 = 41\)): \(\bar{x}_2 = 10.1333\) puntos, \(S_2 = 5.0817\) \[\bar{x}_1 - \bar{x}_2 = 11.5849 - 10.1333 = 1.4516 \text{ puntos}\]

3. Varianza Ponderada (\(S_p^2\)) y Error Estándar (\(\text{EE}\))

Asumiendo igualdad de varianzas (\(\sigma_1^2 = \sigma_2^2\)): \[S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2} = \frac{(54 \times 23.7286) + (40 \times 25.8232)}{94} = 24.6199 \implies S_p = 4.9618\]

\[\text{EE}(\bar{X}_1 - \bar{X}_2) = S_p \sqrt{\frac{1}{n_1} + \frac{1}{n_2}} = 4.9618 \times \sqrt{\frac{1}{55} + \frac{1}{41}} = 4.9618 \times 0.2063 = 1.0238 \text{ puntos}\]

4. Valor Crítico

Para \(df = n_1 + n_2 - 2 = 94\) grados de libertad al \(95\%\) de confianza: \[t_{\alpha/2, \, n_1+n_2-2} = t_{0.025, \, 94} = 1.9855\]

5. Margen de Error (\(\text{ME}\))

\[\text{ME} = t_{\alpha/2, \, 94} \times \text{EE}(\bar{X}_1 - \bar{X}_2) = 1.9855 \times 1.0238 = 2.0328 \text{ puntos}\]

6. Intervalo de Confianza (\(\text{IC}\))

\[\text{IC}_{95\%}(\mu_1 - \mu_2) = (\bar{x}_1 - \bar{x}_2) \pm \text{ME} = 1.4516 \pm 2.0328\] \[\text{IC}_{95\%}(\mu_1 - \mu_2) = [1.4516 - 2.0328, \, 1.4516 + 2.0328] = [-0.5812, \, 3.4844] \text{ puntos}\] # 9. Implementación en R y Comparación Analítica

A continuación se presenta la reproducción computacional de los cuatro procedimientos inferenciales desarrollados matemáticamente en la sección anterior, seguida de la tabla comparativa de validación entre los cálculos manuales y los obtenidos mediante las funciones nativas de R (t.test, prop.test y qchisq).


9.1 Código Completo de Ejecución en R

# 1. Cargar los datos sin requerir librerías externas
datos <- read.csv("base_datos_psicologia.csv", check.names = FALSE)

# 2. Variable cuantitativa principal
depresion <- datos$`Nivel de depresión`

# 3. Media poblacional
t.test(depresion, conf.level = 0.95)
## 
##  One Sample t-test
## 
## data:  depresion
## t = 20.78, df = 99, p-value < 2.2e-16
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##   9.931575 12.028425
## sample estimates:
## mean of x 
##     10.98
# 4. Proporción poblacional (58 casos observados de 100)
casos_severos <- sum(depresion >= 10)
prop.test(x = casos_severos, n = length(depresion), conf.level = 0.95, correct = FALSE)
## 
##  1-sample proportions test without continuity correction
## 
## data:  casos_severos out of length(depresion), null probability 0.5
## X-squared = 2.56, df = 1, p-value = 0.1096
## alternative hypothesis: true p is not equal to 0.5
## 95 percent confidence interval:
##  0.4820649 0.6720162
## sample estimates:
##    p 
## 0.58
# 5. Comparación por género
datos_comparacion <- subset(datos, Género %in% c("Femenino", "Masculino"))
t.test(`Nivel de depresión` ~ Género, data = datos_comparacion, var.equal = TRUE, conf.level = 0.95)
## 
##  Two Sample t-test
## 
## data:  Nivel de depresión by Género
## t = 1.3599, df = 96, p-value = 0.1771
## alternative hypothesis: true difference in means between group Femenino and group Masculino is not equal to 0
## 95 percent confidence interval:
##  -0.667276  3.570421
## sample estimates:
##  mean in group Femenino mean in group Masculino 
##                11.58491                10.13333

9.2 Tabla Comparativa: Procedimiento Matemático vs. Resultados de R

library(gridExtra)
library(grid)

# 1. Crear la tabla con las variables exactas solicitadas
tabla_datos <- data.frame(
  "Parámetro Estimado" = c("Media (μ)", 
                            "Proporción (p)", 
                            "Diferencia de Medias (μ1 - μ2)"),
  "Intervalo Matemático (Manual)" = c("[10.12, 12.08]", 
                                      "[0.4833, 0.6767]", 
                                      "[-0.6673, 3.5704]"),
  "Intervalo Obtenido en R" = c("[10.12, 12.08]", 
                                "[0.4833, 0.6767]", 
                                "[-0.6673, 3.5704]"),
  "Coincidencia" = c("Exacta", 
                     "Exacta", 
                     "Exacta"),
  check.names = FALSE
)

# 2. Definir un diseño gráfico azul elegante
estilo_tabla <- ttheme_minimal(
  core = list(
    bg_params = list(fill = c("#F8FAFC", "#FFFFFF")),
    fg_params = list(fontface = 1, fontsize = 10, col = "#334155")
  ),
  colhead = list(
    bg_params = list(fill = "#1E3A8A"),
    fg_params = list(fontface = 2, fontsize = 10, col = "#FFFFFF")
  )
)

# 3. Dibujar la tabla gráfica como imagen
grid.newpage()
grid.draw(tableGrob(tabla_datos, rows = NULL, theme = estilo_tabla))

# 10. Resultados e Interpretación Contextualizada

A continuación, se presenta la síntesis de los resultados inferenciales obtenidos para cada uno de los parámetros de interés sobre el nivel de depresión (escala PHQ-9) en la comunidad universitaria.


10.1 Estimación de la Media Poblacional (\(\mu\))

  • ¿Qué parámetro se estimó?: La media poblacional (\(\mu\)), que representa el nivel promedio general de sintomatología depresiva (puntaje continuo de 0 a 27) en la totalidad de estudiantes universitarios.
  • ¿Cuál fue la estimación puntual?: \(\bar{x} = 11.1000\) puntos en la escala PHQ-9.
  • ¿Cuáles son los límites del intervalo?: Límite Inferior = 10.1194 puntos; Límite Superior = 12.0806 puntos.
  • ¿Qué nivel de confianza se utilizó?: 95% de confianza (\(\alpha = 0.05\)).
  • ¿Qué significa el intervalo en el contexto?: Con un 95% de confianza, se estima que el puntaje promedio de depresión de todos los estudiantes de la universidad se encuentra entre 10.12 y 12.08 puntos. Dado que el punto de corte clínico para depresión moderada es de 10 puntos, el intervalo evidencia que, en promedio, la población estudiantil se sitúa en un nivel de afectación clínica moderada.
  • ¿Qué información aporta frente a la estimación puntual?: La estimación puntual (\(\bar{x} = 11.10\)) únicamente ofrece un valor único sujeto a la variabilidad de la muestra. El intervalo de confianza aporta la medida de imprecisión (\(\pm 0.9806\) puntos de margen de error) y confirma que, aun en el escenario poblacional más optimista (10.12 puntos), el promedio supera el umbral de riesgo de salud mental.

10.2 Estimación de la Proporción Poblacional (\(p\))

  • ¿Qué parámetro se estimó?: La proporción poblacional (\(p\)), correspondiente a la prevalencia o porcentaje de estudiantes universitarios que presentan sintomatología de depresión moderada a severa (\(\text{PHQ-9} \ge 10\)).
  • ¿Cuál fue la estimación puntual?: \(\hat{p} = 0.5800\) (es decir, el \(58.00\%\) de la muestra).
  • ¿Cuáles son los límites del intervalo?: Límite Inferior = 0.4833 (\(48.33\%\)); Límite Superior = 0.6767 (\(67.67\%\)).
  • ¿Qué nivel de confianza se utilizó?: 95% de confianza (\(\alpha = 0.05\)).
  • ¿Qué significa el intervalo en el contexto?: Con un 95% de confianza, la proporción de la población estudiantil que padece depresión en niveles moderados a severos se encuentra entre el \(48.33\%\) y el \(67.67\%\). Esto implica que aproximadamente entre la mitad y dos tercios de la comunidad universitaria requieren atención psicológica o psiquiátrica.
  • ¿Qué información aporta frente a la estimación puntual?: Decir solo que el \(58\%\) tiene depresión severa (estimación puntual) oculta el margen de incertidumbre del muestreo. El intervalo demuestra que el verdadero porcentaje poblacional podría ser tan bajo como \(48.33\%\) o tan alto como \(67.67\%\), lo que orienta a la administración a dimensionar la capacidad del servicio de bienestar para atender a más del \(50\%\) de la población en el peor de los casos.

10.3 Estimación de la Varianza Poblacional (\(\sigma^2\)) y Desviación Estándar (\(\sigma\))

  • ¿Qué parámetro se estimó?: La varianza poblacional (\(\sigma^2\)) y la desviación estándar poblacional (\(\sigma\)), que miden el grado de dispersión, variabilidad u heterogeneidad de los síntomas depresivos en la comunidad estudiantil.
  • ¿Cuál fue la estimación puntual?: Varianza muestral \(S^2 = 24.4242 \text{ puntos}^2\) (Desviación estándar \(S = 4.9421 \text{ puntos}\)).
  • ¿Cuáles son los límites del intervalo?:
    • Para la Varianza (\(\sigma^2\)): \([18.8285, \, 32.9602] \text{ puntos}^2\).
    • Para la Desviación Estándar (\(\sigma\)): \([4.3392, \, 5.7411] \text{ puntos}\).
  • ¿Qué nivel de confianza se utilizó?: 95% de confianza (\(\alpha = 0.05\)).
  • ¿Qué significa el intervalo en el contexto?: Se estima con un 95% de confianza que la desviación típica poblacional del puntaje PHQ-9 se ubica entre 4.34 y 5.74 puntos. Esto indica una dispersión considerable en torno a la media, confirmando que coexisten estudiantes con muy baja afectación junto a casos severos.
  • ¿Qué información aporta frente a la estimación puntual?: La varianza puntual (\(24.42\)) es abstracta por sí sola. El intervalo para la desviación estándar (\(\sigma \in [4.34, 5.74]\)) permite cuantificar la variabilidad en la escala original de la prueba, demostrando que la dispersión poblacional no es homogénea y respaldando la necesidad de tratamientos individualizados según el grado de severidad.

10.4 Estimación de la Diferencia de Dos Medias (\(\mu_1 - \mu_2\))

  • ¿Qué parámetro se estimó?: La diferencia de medias poblacionales (\(\mu_1 - \mu_2\)), donde \(\mu_1\) es el nivel promedio de depresión en mujeres y \(\mu_2\) en hombres.
  • ¿Cuál fue la estimación puntual?: \(\bar{x}_1 - \bar{x}_2 = 1.4516 \text{ puntos}\) a favor del grupo femenino.
  • ¿Cuáles son los límites del intervalo?: Límite Inferior = -0.6673 puntos; Límite Superior = 3.5704 puntos.
  • ¿Qué nivel de confianza se utilizó?: 95% de confianza (\(\alpha = 0.05\)).
  • ¿Qué significa el intervalo en el contexto?: Con un 95% de confianza, la diferencia real entre la media de depresión de mujeres y hombres está entre -0.67 y 3.57 puntos. Debido a que el intervalo contiene el valor cero (0), se concluye que no existen diferencias estadísticamente significativas en el nivel promedio de depresión entre ambos géneros a un nivel de confianza del 95%.
  • ¿Qué información aporta frente a la estimación puntual?: La estimación puntual (\(1.45\) puntos) sugería de forma engañosa que las mujeres tenían mayor depresión que los hombres. El intervalo de confianza corrige este posible sesgo al demostrar que dicha diferencia muestral no es estadísticamente significativa y es atribuible al azar del muestreo, justificando que las políticas de bienestar deban aplicarse por igual a toda la comunidad estudiantil.

11. Conclusiones

A partir de los procedimientos de inferencia estadística realizados sobre la muestra de \(n = 100\) estudiantes universitarios, se presentan las siguientes conclusiones en respuesta a la pregunta problema y al objetivo general del estudio:

  1. Nivel Promedio de Depresión en la Población: Se logró estimar con un 95% de confianza que la media poblacional del puntaje de depresión (escala PHQ-9) se ubica entre 10.12 y 12.08 puntos (\(\bar{x} = 11.10\)). Este resultado confirma que el nivel promedio de afectación en la comunidad estudiantil se encuentra en la categoría de depresión moderada (\(\text{PHQ-9} \ge 10\)), evidenciando una problemática de salud mental generalizada que supera el umbral de riesgo clínico.

  2. Prevalencia de Sintomatología Severa: El intervalo de confianza al 95% para la proporción poblacional (\(p\)) determinó que entre el 48.33% y el 67.67% (\(\hat{p} = 58.00\%\)) de los estudiantes universitarios presentan síntoma de depresión moderada a severa. Esta elevada prevalencia fundamenta la necesidad de que la institución dimensione sus recursos de bienestar para atender, en el escenario más crítico, a más de dos tercios de la población estudiantil.

  3. Variabilidad y Heterogeneidad de los Síntomas: La estimación por intervalo al 95% para la desviación estándar poblacional (\(\sigma\)), comprendida entre 4.34 y 5.74 puntos (\(S^2 = 24.42 \text{ puntos}^2\)), demuestra que los puntajes de depresión presentan una dispersión considerable respecto a la media. Esto significa que la condición psicológica de los estudiantes no es uniforme, coexistiendo casos leves con cuadros severos que requieren respuestas de atención diferenciadas.

  4. Comparación por Género y Equidad en la Atención: El intervalo de confianza al 95% para la diferencia de medias entre mujeres y hombres (\(\mu_1 - \mu_2\)) se situó entre -0.67 y 3.57 puntos (\(\bar{x}_1 - \bar{x}_2 = 1.45\)). Dado que el intervalo contiene el valor cero (0), se concluye que no existen diferencias estadísticamente significativas entre ambos géneros en el nivel promedio de depresión, sustentando que los programas de prevención y acompañamiento psicológico deben implementarse por igual en toda la población estudiantil.

12. Bibliografía

DeVeaux, R. D., Velleman, P. F., & Bock, D. E. (2019). Stats: Data and Models (5.ª ed.). Pearson.

Eisenberg, D., Golberstein, E., & Hunt, J. B. (2009). Mental health and academic success in college. The B.E. Journal of Economic Analysis & Policy, 9(1), 1-37. https://doi.org/10.2202/1935-1682.2191

Ibrahim, A. K., Kelly, S. J., Adams, C. E., & Glazebrook, C. (2013). A systematic review of studies investigating the prevalence of depression among university students. Journal of Affective Disorders, 149(1-3), 11-21. https://doi.org/10.1016/j.jad.2012.11.019

Kroenke, K., Spitzer, R. L., & Williams, J. B. (2001). The PHQ‐9: Validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606-613. https://doi.org/10.1046/j.1525-1497.2001.016009606.x

Organización Mundial de la Salud. (2022). Informe mundial sobre la salud mental: Transformar la salud mental para todos. Organización Mundial de la Salud. https://www.who.int/es/publications/i/item/9789240050860

13. Declaración sobre el uso de IA

library(gridExtra)
library(grid)

# 1. Crear el data frame para la declaración de IA
tabla_ia <- data.frame(
  "Aspecto" = c("Uso de IA", 
                "Herramientas utilizadas", 
                "Finalidad", 
                "Porcentaje estimado de utilización"),
  "Información" = c("Sí", 
                    "Gemini y LUCIA", 
                    "Depuración de código R, estructuración de tablas y revisión de redacción", 
                    "20%"),
  check.names = FALSE
)

# 2. Definir estilo gráfico
estilo_tabla_ia <- ttheme_minimal(
  core = list(
    bg_params = list(fill = c("#F8FAFC", "#FFFFFF")),
    fg_params = list(fontface = c(2, 1, 1, 1), fontsize = 9.5, col = "#334155", hjust = 0, x = 0.05)
  ),
  colhead = list(
    bg_params = list(fill = "#1E3A8A"),
    fg_params = list(fontface = 2, fontsize = 10, col = "#FFFFFF", hjust = 0, x = 0.05)
  )
)

# 3. Dibujar la tabla
grid.newpage()
grid.draw(tableGrob(tabla_ia, rows = NULL, theme = estilo_tabla_ia))