Universidad del Norte

Relaciones Internacionales

Estimación de parámetros poblacionales por intervalos de confianza: análisis de ansiedad, depresión y satisfacción en psicología clínica.

Asignatura: Estadistica Inferencial (NRC 2014)

Presentado por:
Luis Escaño
Juan van Neerven

Presentado a:
Keyla Alba Molina

Programa: Relaciones Internacionales

Universidad del Norte, Barranquilla, Colombia
23 de septiembre de 2026

Introducción

La salud mental es reconocida hoy como un componente esencial del bienestar integral de las personas y, por extensión, del desarrollo social y económico de las comunidades. La ansiedad y la depresión se encuentran entre las condiciones psicológicas más prevalentes a nivel poblacional, afectando de manera significativa la calidad de vida de quienes las padecen, así como su percepción sobre la efectividad de los tratamientos que reciben. En este contexto, contar con estimaciones estadísticas confiables sobre los parámetros poblacionales asociados al bienestar psicológico (como el nivel promedio de ansiedad, depresión y satisfacción con la terapia, o la proporción de pacientes con determinadas características clínicas) resulta fundamental para que los centros de atención psicológica puedan planificar sus recursos y estrategias de intervención con base en evidencia, y no únicamente en la experiencia individual de los profesionales.

La importancia de este tema radica en que la estimación de parámetros poblacionales mediante intervalos de confianza permite ir más allá de la simple descripción de una muestra particular de pacientes, para generalizar los hallazgos hacia la población más amplia que dicha muestra representa. Esto es especialmente relevante en contextos de salud mental, donde los recursos terapéuticos suelen ser limitados: conocer con precisión estadística el rango plausible en el que se ubica, por ejemplo, el nivel promedio de ansiedad de los pacientes atendidos, o la proporción de quienes cuentan con un alto nivel de apoyo familiar, permite tomar decisiones informadas sobre la asignación de personal, la frecuencia de las sesiones de terapia y el diseño de programas de acompañamiento familiar.

Diversos estudios han documentado la magnitud y relevancia de estas variables en poblaciones similares a la analizada en este trabajo. Por ejemplo, una investigación desarrollada con estudiantes universitarios en Chincha, Perú, estimó con un 95% de confianza que la ansiedad afecta de manera adversa el bienestar psicológico, empleando un cálculo muestral formal para poblaciones finitas (Ochoa, 2024). De manera similar, un estudio epidemiológico realizado en España reportó la prevalencia de ansiedad y depresión en una población universitaria acompañada de sus respectivos intervalos de confianza al 95%, evidenciando la utilidad de esta herramienta estadística para caracterizar poblaciones en el ámbito de la salud mental (Ruiz, García-Sevilla y Fernández, 2009). En la misma línea, la investigación en salud mental ha señalado que la comunicación familiar abierta y fluida genera un efecto protector ante problemas de salud mental e influye positivamente en el bienestar psicológico de los individuos (Dialnet, 2021), lo cual respalda la pertinencia de incluir el apoyo familiar como una de las variables de interés en la estimación de parámetros poblacionales de este estudio. A nivel de fundamentación estadística, la literatura especializada define la estimación por intervalos de un parámetro poblacional como una regla que permite calcular, a partir de una muestra, un rango de valores en el que, con una cierta probabilidad o nivel de confianza, se encuentra el verdadero valor del parámetro poblacional (Sanabria Brenes, 2018), constituyendo la base metodológica sobre la cual se apoya el presente trabajo. Asimismo, estudios epidemiológicos sobre la prevalencia de trastornos mentales en población general han evidenciado que los trastornos de ansiedad y depresión se encuentran entre los más frecuentes, reportando proporciones poblacionales relevantes para la planificación de servicios de salud mental (Instituto Mexicano del Seguro Social, 2021), lo que refuerza la necesidad de estimar con precisión estadística tanto medias como proporciones en este tipo de poblaciones clínicas.

A partir de lo anterior, esta investigación se plantea la siguiente pregunta problema: ¿Entre qué valores plausibles se encuentran los principales parámetros poblacionales asociados con el bienestar psicológico (nivel promedio de ansiedad, depresión y satisfacción con la terapia) y con determinadas características clínicas (como la proporción de pacientes con alto apoyo familiar o con diagnóstico de depresión) de los individuos representados por la muestra de pacientes de un centro de psicología clínica?

En consecuencia, el objetivo general de este trabajo es estimar mediante intervalos de confianza los parámetros poblacionales relacionados con las variables de interés de la base de datos seleccionada, correspondiente a pacientes de un centro de psicología clínica.

Marco teórico

Para comprender e interpretar correctamente los análisis de estimación por intervalos de confianza desarrollados en este trabajo, es necesario tener claridad sobre un conjunto de conceptos estadísticos fundamentales, los cuales se explican a continuación con nuestras propias palabras y se relacionan directamente con el estudio realizado sobre los 100 pacientes de un centro de psicología clínica.

Población y muestra

Población. En estadística, la población es el conjunto completo de todos los individuos, elementos u observaciones acerca de los cuales se desea obtener información o sacar conclusiones. No se trata necesariamente de una cantidad de personas pequeña o abarcable en su totalidad; de hecho, en la mayoría de los estudios reales resulta imposible medir a cada uno de sus integrantes. En nuestro trabajo, la población de interés corresponde a la totalidad de pacientes atendidos en centros de psicología clínica con características similares a las del centro del cual proviene nuestra base de datos, es decir, un universo mucho más amplio que los 100 pacientes que efectivamente registramos y de quienes no conocemos con exactitud su verdadero nivel promedio de ansiedad, depresión o satisfacción con la terapia.

Muestra. La muestra es un subconjunto de la población, seleccionado con el propósito de que sus características permitan representar razonablemente a la población de la cual proviene. En nuestro caso, la muestra está conformada por los 100 pacientes cuyos datos fueron registrados en el archivo Base_Psicologia_Clinica.xlsx. Trabajar con una muestra en lugar de con la población completa es, en la práctica, la única alternativa viable: sería impensable medir a todos los pacientes atendidos alguna vez en centros de psicología clínica similares al analizado. Es precisamente esta limitación la que da sentido a la estadística inferencial y, en particular, a la estimación por intervalos de confianza, pues nos permite generalizar, con un margen de error conocido y cuantificable, lo observado en nuestros 100 pacientes hacia la población de la cual fueron extraídos.

Parámetro y estadístico

Parámetro poblacional. Un parámetro es un valor numérico fijo, aunque generalmente desconocido, que describe una característica de la población completa. Se representa con letras griegas para diferenciarlo de las cantidades calculadas a partir de una muestra. En este trabajo, los principales parámetros de interés son la media poblacional del nivel de ansiedad, de depresión y de satisfacción con la terapia (denotadas \(\mu\)), y la proporción poblacional de pacientes con alto apoyo familiar o con diagnóstico de depresión (denotada \(p\)). Estos valores existen en la realidad, pero nunca los conoceremos con exactitud absoluta a menos que pudiéramos medir a todos los pacientes de la población; por esta razón, todo lo que podemos hacer es estimarlos a partir de la información disponible en nuestra muestra.

Estadístico. Un estadístico, en cambio, es un valor numérico que se calcula exclusivamente a partir de los datos de la muestra y que, por lo tanto, sí conocemos con exactitud una vez recolectada la información. Es la herramienta con la que intentamos aproximarnos al parámetro poblacional desconocido. Por ejemplo, la media muestral de ansiedad (\(\bar{x} = 6.17\)), la desviación estándar muestral (\(s = 2.47\)) y la proporción muestral de pacientes con apoyo familiar bajo (\(\hat{p} = 0.31\)) son estadísticos calculados directamente sobre nuestros 100 registros. La diferencia clave entre parámetro y estadístico es, entonces, que el primero describe a la población (es fijo pero desconocido) y el segundo describe a la muestra (es conocido, pero varía si se toma una muestra distinta).

Estimador y estimación puntual

Estimador. Un estimador es la regla, fórmula o procedimiento general que se utiliza para calcular, a partir de los datos de cualquier muestra, un valor que sirva como aproximación de un parámetro poblacional. Por ejemplo, la fórmula de la media aritmética (sumar todos los valores y dividir entre \(n\)) es el estimador que usamos para aproximar la media poblacional \(\mu\), sin importar de qué variable se trate ni cuántos pacientes conformen la muestra.

Estimación puntual. Cuando aplicamos ese estimador a los datos concretos de nuestra muestra, obtenemos un único número: la estimación puntual. Es la “mejor apuesta” que podemos hacer sobre el valor del parámetro, pero con la limitación de que no nos dice absolutamente nada acerca de qué tan cerca o lejos podría estar del verdadero valor poblacional. En nuestro estudio, decir que “la media muestral del nivel de ansiedad es 6.17 sobre 10” es una estimación puntual: es un número concreto y útil, pero incompleto, porque si tomáramos otros 100 pacientes distintos del mismo centro, casi con seguridad obtendríamos una media muestral ligeramente diferente (por ejemplo, 5.9 o 6.3), sin que eso signifique que la población cambió. Esta limitación de la estimación puntual es, precisamente, la razón de ser de los intervalos de confianza, tema central de este trabajo.

Error estándar y margen de error

Error estándar. El error estándar mide qué tan dispersas estarían las medias (o proporciones) muestrales si, hipotéticamente, repitiéramos el estudio muchas veces tomando distintas muestras de 100 pacientes de la misma población. En otras palabras, cuantifica la variabilidad propia del proceso de muestreo. A diferencia de la desviación estándar (que mide qué tan dispersos están los datos individuales entre sí, por ejemplo, qué tan distintos son los niveles de ansiedad entre pacientes), el error estándar mide la variabilidad del promedio como estadístico. Se calcula dividiendo la desviación estándar muestral entre la raíz cuadrada del tamaño de la muestra:

\[\text{Error estándar} = \dfrac{s}{\sqrt{n}}\]

Una consecuencia importante de esta fórmula, y que resulta muy relevante para nuestro trabajo, es que entre más grande sea la muestra (\(n\)), menor será el error estándar, y por lo tanto más preciso y confiable será nuestro intervalo de confianza. Con \(n = 100\) pacientes, el error estándar del nivel de ansiedad es de apenas 0.247 puntos, un valor relativamente pequeño que refleja una estimación razonablemente precisa.

Margen de error. El margen de error es la cantidad que se suma y resta a la estimación puntual para construir los límites del intervalo de confianza. Se obtiene multiplicando el error estándar por un valor crítico (\(Z\) o \(t\)) que depende del nivel de confianza elegido:

\[\text{Margen de error} = \text{Valor crítico} \times \text{Error estándar}\]

En términos prácticos, el margen de error responde a la pregunta “¿cuánto podría estar equivocada nuestra estimación puntual?”. Por ejemplo, para el nivel de ansiedad, el margen de error del intervalo del 95% es de aproximadamente 0.49 puntos: esto significa que, aunque nuestra mejor estimación puntual es 6.17, reconocemos honestamente que el verdadero promedio poblacional podría estar hasta 0.49 puntos por encima o por debajo de ese valor.

Distribución χ² (chi-cuadrado). Es una distribución de probabilidad asimétrica (a diferencia de la normal y la t, que son simétricas), utilizada en este trabajo para construir el intervalo de confianza de la varianza poblacional de una variable cuantitativa. Cuando se toma una muestra de tamaño \(n\) de una población que se distribuye (aproximadamente) de forma normal, la cantidad

\[\chi^2 = \dfrac{(n-1)s^2}{\sigma^2}\]

library(ggplot2)

# ---- Ilustracion de la distribucion chi-cuadrado con 99 grados de libertad ----
gl_chi2 <- 99

# Valores criticos ya utilizados en la seccion 7.3 (IC 95% para la varianza)
chi2_inferior <- qchisq(0.025, df = gl_chi2)   # cola izquierda
chi2_superior <- qchisq(0.975, df = gl_chi2)   # cola derecha

cat("Grados de libertad:", gl_chi2, "\n")
## Grados de libertad: 99
cat("Chi2 critico inferior (0.025):", round(chi2_inferior, 4), "\n")
## Chi2 critico inferior (0.025): 73.3611
cat("Chi2 critico superior (0.975):", round(chi2_superior, 4), "\n")
## Chi2 critico superior (0.975): 128.422
# Grafico de la densidad chi-cuadrado, marcando los valores criticos
x_vals <- seq(40, 170, length.out = 500)
y_vals <- dchisq(x_vals, df = gl_chi2)
datos_chi2 <- data.frame(x = x_vals, y = y_vals)

ggplot(datos_chi2, aes(x = x, y = y)) +
  geom_line(color = "#0033A0", linewidth = 1) +
  geom_vline(xintercept = chi2_inferior, color = "#EF4444", linetype = "dashed") +
  geom_vline(xintercept = chi2_superior, color = "#EF4444", linetype = "dashed") +
  labs(title = "Distribucion chi-cuadrado con 99 grados de libertad",
       subtitle = "Lineas rojas: valores criticos usados en el IC de la varianza (seccion 7.3)",
       x = expression(chi^2), y = "Densidad") +
  theme_minimal(base_size = 12)
Figura 2. Distribucion chi-cuadrado (99 g.l.) y valores criticos usados en la seccion 7.3

Figura 2. Distribucion chi-cuadrado (99 g.l.) y valores criticos usados en la seccion 7.3

sigue una distribución χ² con \(n-1\) grados de libertad. Esta distribución depende únicamente de los grados de libertad y, a medida que estos aumentan, se va volviendo más simétrica y parecida a una normal, aunque nunca deja de ser positiva (pues surge de elevar al cuadrado, y una varianza no puede ser negativa). En este trabajo, esta distribución se utilizó de forma directa y aplicada en la sección 7.3, para estimar la varianza poblacional del nivel de depresión, empleando los dos valores críticos \(\chi^2_{\alpha/2}\) y \(\chi^2_{1-\alpha/2}\) (uno para cada límite del intervalo, dada la asimetría de esta distribución).

Distribución F. Es otra distribución de probabilidad asimétrica, utilizada para comparar la variabilidad (varianza) de dos poblaciones distintas, mediante la razón de sus varianzas muestrales:

# ---- Ilustracion teorica de la distribucion F ----
# Grados de libertad hipoteticos, usando los tamanos de los grupos
# "Si" (n=67) y "No" (n=33) de asistencia a terapia, solo con fines ilustrativos
gl1_f <- 66   # n1 - 1 = 67 - 1
gl2_f <- 32   # n2 - 1 = 33 - 1

# Valor critico de F para un intervalo de confianza del 95% (dos colas)
f_critico_superior <- qf(0.975, df1 = gl1_f, df2 = gl2_f)
f_critico_inferior <- qf(0.025, df1 = gl1_f, df2 = gl2_f)

cat("F critico inferior (0.025):", round(f_critico_inferior, 4), "\n")
## F critico inferior (0.025): 0.5634
cat("F critico superior (0.975):", round(f_critico_superior, 4), "\n")
## F critico superior (0.975): 1.8923
# Grafico de la densidad F
x_vals_f <- seq(0.1, 3, length.out = 500)
y_vals_f <- df(x_vals_f, df1 = gl1_f, df2 = gl2_f)
datos_f <- data.frame(x = x_vals_f, y = y_vals_f)

ggplot(datos_f, aes(x = x, y = y)) +
  geom_line(color = "#10B981", linewidth = 1) +
  geom_vline(xintercept = f_critico_inferior, color = "#EF4444", linetype = "dashed") +
  geom_vline(xintercept = f_critico_superior, color = "#EF4444", linetype = "dashed") +
  labs(title = "Distribucion F (66 y 32 grados de libertad)",
       subtitle = "Ilustracion teorica; no aplicada en los calculos principales de este trabajo",
       x = "F", y = "Densidad") +
  theme_minimal(base_size = 12)
Figura 3. Distribucion F (66 y 32 g.l.), ilustracion teorica no aplicada en los calculos principales

Figura 3. Distribucion F (66 y 32 g.l.), ilustracion teorica no aplicada en los calculos principales

\[F = \dfrac{s_1^2}{s_2^2}\]

la cual sigue una distribución F con \(n_1-1\) y \(n_2-1\) grados de libertad (uno por cada muestra comparada). A diferencia de la distribución χ², que depende de un solo grupo de grados de libertad, la distribución F depende de dos, uno asociado al numerador y otro al denominador de la razón. En este trabajo, esta distribución se menciona con fines de completitud teórica: aunque en la sección 7.4 se optó por desarrollar la comparación de dos grupos mediante la diferencia de medias (y no mediante la comparación de varianzas), la distribución F sería la herramienta apropiada si se quisiera evaluar, por ejemplo, si la variabilidad del nivel de ansiedad es igual o distinta entre los pacientes que asisten a terapia y los que no, complementando así el panorama general de las distribuciones de muestreo relevantes en la estimación por intervalos de confianza.

Nivel de confianza e intervalo de confianza

Nivel de confianza. El nivel de confianza, denotado como \((1-\alpha)\times 100\%\), es el grado de certeza que le asignamos al procedimiento utilizado para construir el intervalo, y no a un intervalo específico ya calculado. Los niveles más utilizados en la práctica son 90%, 95% y 99%. En este trabajo utilizamos principalmente un nivel de confianza del 95%, lo cual quiere decir que, si repitiéramos el proceso de tomar una muestra de 100 pacientes y calcular el intervalo de confianza una gran cantidad de veces, aproximadamente el 95% de esos intervalos contendría el verdadero parámetro poblacional (y solo un 5% no lo haría, por simple azar en el muestreo). Es fundamental aclarar que esto no significa que exista un 95% de probabilidad de que el parámetro esté dentro del intervalo particular que calculamos con nuestros 100 pacientes: dicho intervalo ya fue calculado y, por lo tanto, o contiene al parámetro, o no lo contiene; lo que el 95% describe es la confiabilidad del método empleado a largo plazo.

Intervalo de confianza. Un intervalo de confianza es, entonces, un rango de valores (un límite inferior y un límite superior), construido a partir de la estimación puntual y su margen de error, dentro del cual esperamos razonablemente que se encuentre el verdadero parámetro poblacional, con el nivel de confianza previamente elegido. Es la herramienta estadística central de este trabajo, pues nos permite responder a la pregunta problema planteada: entre qué valores plausibles se ubican los parámetros poblacionales de ansiedad, depresión, satisfacción con la terapia y ciertas características clínicas de los pacientes representados por nuestra muestra. Por ejemplo, el intervalo de confianza del 95% para el nivel promedio de ansiedad poblacional que obtuvimos fue \([5.68 \, ; \, 6.66]\), lo que representa una conclusión mucho más informativa y honesta que limitarnos a reportar la estimación puntual de 6.17.

Distribución normal

La distribución normal (también llamada distribución gaussiana o “campana de Gauss”) es una distribución de probabilidad simétrica en forma de campana, en la cual la mayoría de los valores se concentran alrededor de la media, y la probabilidad de observar valores va disminuyendo progresivamente a medida que nos alejamos de ella hacia ambos extremos. Su relevancia para este trabajo no radica en que las variables originales (ansiedad, depresión, satisfacción, todas medidas en escalas discretas de 1 a 10) sigan exactamente esta distribución, sino en un resultado mucho más general y poderoso conocido como el Teorema del Límite Central: cuando el tamaño de la muestra es suficientemente grande (en la práctica, \(n \geq 30\)), la distribución muestral de la media (es decir, la forma que tomarían los promedios si repitiéramos el muestreo muchas veces) se aproxima a una distribución normal, sin importar la forma que tenga la distribución de la variable original en la población. Como nuestra muestra tiene \(n=100\) pacientes, este teorema nos respalda para utilizar los valores críticos de la distribución normal estándar (por ejemplo, \(Z=1.96\) para el 95% de confianza) al construir los intervalos de confianza de las medias poblacionales, incluso sabiendo (como se verifica en la sección de supuestos de este trabajo) que las variables clínicas originales no siguen una distribución perfectamente normal.

Distribución t de Student

La distribución t de Student es una distribución de probabilidad muy similar en forma a la distribución normal (simétrica y con forma de campana), pero con colas más anchas o “pesadas”, lo cual refleja una mayor incertidumbre. Se utiliza en lugar de la distribución normal cuando se cumplen dos condiciones simultáneamente: (1) la varianza poblacional \(\sigma^2\) es desconocida (situación que ocurre en prácticamente todos los estudios reales, incluido el nuestro, pues no conocemos la verdadera variabilidad de la ansiedad o la depresión en la población de pacientes) y (2) el tamaño de la muestra es pequeño (convencionalmente, \(n < 30\)).

La distribución t depende de un parámetro llamado grados de libertad, que en el caso de una sola muestra corresponde a \(n-1\), y a medida que los grados de libertad aumentan, la distribución t se va pareciendo cada vez más a la distribución normal, hasta prácticamente confundirse con ella. En nuestro trabajo, dado que contamos con \(n=100\) pacientes (una muestra grande), los valores críticos de la distribución t con 99 grados de libertad son prácticamente idénticos a los de la distribución normal estándar (por ejemplo, \(t_{0.025}\) con 99 grados de libertad \(\approx 1.984\), muy cercano a \(Z_{0.025}=1.96\)); por esta razón, en R utilizamos indistintamente la función t.test(), que internamente emplea la distribución t de Student, sabiendo que en nuestro caso arroja resultados prácticamente equivalentes a los que se obtendrían usando la distribución normal, pero con la ventaja adicional de ser más conservadora y no requerir el supuesto (poco realista) de conocer la varianza poblacional.

Distribución \(\chi^2\) y distribución F (nota de alcance)

Dentro del marco general de la estadística inferencial existen otras dos distribuciones de probabilidad relevantes para la estimación por intervalos: la distribución \(\chi^2\) (chi-cuadrado), que se utiliza para construir intervalos de confianza de la varianza poblacional \(\sigma^2\), y la distribución F, que se utiliza para construir intervalos de confianza de la razón entre dos varianzas poblacionales (\(\sigma_1^2/\sigma_2^2\)), por ejemplo, al comparar la variabilidad del nivel de ansiedad entre dos grupos de pacientes.

Metodología

Origen de los datos

Los datos utilizados en este trabajo provienen de una base de datos suministrada con fines pedagógicos en el marco del curso de Estadística Inferencial (NRC 2014), diseñada para simular información real de pacientes atendidos en un centro de psicología clínica. Aunque no corresponde a una recolección primaria realizada directamente por los autores de este trabajo, la estructura y el tipo de variables reflejan las condiciones típicas de un estudio observacional en el ámbito de la salud mental, lo cual permite aplicar sobre ella, con fines formativos, las técnicas de estimación por intervalos de confianza propias de la estadística inferencial.

Población de interés

La población de interés está constituida por la totalidad de pacientes atendidos en centros de psicología clínica con características similares al centro del cual proviene la base de datos analizada. Es decir, no nos interesa describir únicamente a los 100 pacientes registrados, sino generalizar los hallazgos obtenidos hacia ese universo más amplio de pacientes, del cual los 100 registros disponibles constituyen una muestra representativa.

Muestra y tamaño de muestra

La muestra está compuesta por 100 pacientes (\(n = 100\)), cada uno correspondiente a un registro (fila) de la base de datos, sin valores nulos ni duplicados, tal como se verificó en la etapa de Análisis Exploratorio de Datos. Este tamaño de muestra es lo suficientemente grande (\(n \geq 30\)) para que, por el Teorema del Límite Central, la distribución muestral de las medias se aproxime a una distribución normal, lo cual respalda estadísticamente el uso de los procedimientos de estimación por intervalos de confianza desarrollados en este trabajo (véase sección 5.6 del Marco Teórico).

library(readxl)
library(dplyr)

datos <- read_excel("Base_Psicologia_Clinica.xlsx")
dim(datos)
## [1] 100  11

Verificacion del tipo de dato de las variables de interes

str(datos %>% select(nivel_ansiedad, nivel_depresion,
                      satisfaccion_con_terapia,
                      apoyo_familiar, diagnostico_psicologico))
## tibble [100 × 5] (S3: tbl_df/tbl/data.frame)
##  $ nivel_ansiedad          : num [1:100] 9 6 5 7 10 1 10 9 4 3 ...
##  $ nivel_depresion         : num [1:100] 4 6 5 1 5 1 4 4 9 4 ...
##  $ satisfaccion_con_terapia: num [1:100] 10 9 8 4 3 9 3 5 5 4 ...
##  $ apoyo_familiar          : chr [1:100] "Medio" "Medio" "Medio" "Medio" ...
##  $ diagnostico_psicologico : chr [1:100] "Ansiedad" "Ansiedad" "TOC" "TOC" ...

Parámetros que serán estimados

En coherencia con el objetivo general de este trabajo, los parámetros poblacionales que se estiman mediante intervalos de confianza son los siguientes:

  1. \(\mu_{\text{ansiedad}}\): nivel promedio poblacional de ansiedad (escala 1-10).
  2. \(\mu_{\text{depresion}}\): nivel promedio poblacional de depresión (escala 1-10).
  3. \(\mu_{\text{satisfaccion}}\): nivel promedio poblacional de satisfacción con la terapia.
  4. \(p_{\text{apoyo alto}}\): proporción poblacional de pacientes con apoyo familiar “Alto”.
  5. \(p_{\text{depresion}}\): proporción poblacional de pacientes con diagnóstico de “Depresión”.

Para cada uno de estos cinco parámetros se reporta su estimación puntual, su error estándar, y el intervalo de confianza correspondiente.

Nivel de confianza utilizado

Para todas las estimaciones por intervalos desarrolladas en este trabajo se utilizó un nivel de confianza del 95% (\(1-\alpha = 0.95\), \(\alpha = 0.05\)), por ser el estándar más ampliamente aceptado en investigaciones del área de la salud y las ciencias sociales, y por representar un equilibrio razonable entre precisión (amplitud del intervalo) y confiabilidad (grado de certeza del procedimiento). De manera complementaria, y con fines exclusivamente comparativos, se calcula también un intervalo con un nivel de confianza del 90% para una de las variables, con el propósito de ilustrar el efecto que tiene el nivel de confianza elegido sobre la amplitud del intervalo resultante.

confianza <- 0.95
alpha <- 1 - confianza
alpha
## [1] 0.05

Procedimientos estadísticos

Para dar respuesta a la pregunta problema planteada, se aplicaron los siguientes procedimientos estadísticos, todos ellos correspondientes a la etapa de estimación por intervalos de confianza:

  • Estimación puntual: cálculo de las medias muestrales (\(\bar{x}\)) para las variables nivel_ansiedad, nivel_depresion y satisfaccion_con_terapia, y de las proporciones muestrales (\(\hat{p}\)) para las variables categóricas de interés.
  • Cálculo del error estándar de cada estadístico, como base para dimensionar la variabilidad propia del muestreo.
  • Intervalos de confianza para medias poblacionales, empleando la distribución t de Student (equivalente en este caso, por el tamaño de muestra, a la distribución normal), tanto mediante cálculo manual de las fórmulas como mediante la función t.test() de R.
  • Intervalos de confianza para proporciones poblacionales, empleando la aproximación normal a la distribución binomial, tanto mediante cálculo manual como mediante la función prop.test() de R.
  • Cálculo del tamaño del efecto (d de Cohen) como medida complementaria al intervalo de confianza, con el fin de valorar la relevancia práctica de los hallazgos y no limitarse a criterios de significancia estadística.
  • Verificación de supuestos estadísticos, mediante la prueba de normalidad de Shapiro-Wilk y la evaluación de la condición de tamaño de muestra grande (\(n \geq 30\)), necesarias para respaldar la validez de los procedimientos de estimación empleados.
  • Visualización gráfica de los intervalos de confianza obtenidos, mediante gráficos de tipo “forest plot” (punto central con barras de error) elaborados con el paquete ggplot2.

Software utilizado

Todo el procesamiento, análisis estadístico y generación de gráficos se realizó utilizando el lenguaje de programación R (versión 4.x), a través del entorno de desarrollo RStudio / Posit Cloud, y se documentó mediante un archivo de R Markdown, lo que permitió integrar en un mismo documento el código ejecutable, los resultados numéricos y su interpretación. Se emplearon los siguientes paquetes:

library(readxl)     # Lectura del archivo .xlsx
library(dplyr)      # Manipulacion y filtrado de datos
library(ggplot2)    # Visualizacion grafica de los intervalos de confianza
library(knitr)      # Generacion de tablas dentro del documento
library(kableExtra) # Estilo adicional para las tablas
Paquete Función principal en este trabajo
readxl Carga de la base de datos en formato .xlsx
dplyr Filtrado de subgrupos y manipulación de variables
ggplot2 Construcción de los gráficos de intervalos de confianza
knitr / kableExtra Presentación de tablas de resultados con formato profesional
Funciones base de R mean(), sd(), sqrt(), qnorm(), qt(), t.test(), prop.test(), shapiro.test()

Estimación por Intervalos de Confianza

Intervalo de confianza para una media

Contexto

La ansiedad es una de las condiciones psicológicas más prevalentes en los pacientes atendidos en centros de salud mental, y su magnitud promedio en la población de pacientes es un dato clave para que estos centros dimensionen la carga clínica que deben atender y planifiquen adecuadamente sus recursos terapéuticos. Por esta razón, se selecciona la variable cuantitativa nivel_ansiedad (escala autorreportada de 1 a 10), registrada en los 100 pacientes de la muestra, para estimar mediante un intervalo de confianza el nivel promedio de ansiedad en la población de pacientes representada por dicha muestra.

Pregunta estadística

¿Entre qué valores se encuentra, con un 95% de confianza, el verdadero nivel promedio de ansiedad (\(\mu\)) de la población de pacientes atendidos en centros de psicología clínica similares al analizado?

Parámetro

El parámetro que se desea estimar es la media poblacional del nivel de ansiedad, denotada como:

\[\mu_{\text{ansiedad}}\]

Este valor es desconocido, pues no contamos con información de todos los pacientes de la población, sino únicamente de los 100 pacientes que conforman la muestra.

# Estadisticos muestrales de la variable nivel_ansiedad
n     <- length(datos$nivel_ansiedad)
media <- mean(datos$nivel_ansiedad)
de    <- sd(datos$nivel_ansiedad)
ee    <- de / sqrt(n)

cat("Tamano de muestra (n):", n, "\n")
## Tamano de muestra (n): 100
cat("Media muestral (x_barra):", round(media, 2), "\n")
## Media muestral (x_barra): 6.17
cat("Desviacion estandar muestral (s):", round(de, 2), "\n")
## Desviacion estandar muestral (s): 2.47
cat("Error estandar (s/raiz(n)):", round(ee, 3), "\n")
## Error estandar (s/raiz(n)): 0.247
Estadísticos muestrales

A partir de los 100 registros de la variable nivel_ansiedad se obtuvieron los siguientes estadísticos:

Estadístico Símbolo Valor
Tamaño de muestra \(n\) 100
Media muestral \(\bar{x}\) 6.17
Desviación estándar muestral \(s\) 2.47
Error estándar \(s/\sqrt{n}\) 0.247
Fórmula

Dado que el tamaño de muestra es grande (\(n = 100 \geq 30\)) y la varianza poblacional \(\sigma^2\) es desconocida, el intervalo de confianza del \((1-\alpha)\times100\%\) para la media poblacional \(\mu\) se construye utilizando la distribución t de Student, de acuerdo con la siguiente fórmula:

\[\bar{x} - t_{\alpha/2,\,n-1}\dfrac{s}{\sqrt{n}} \;<\; \mu \;<\; \bar{x} + t_{\alpha/2,\,n-1}\dfrac{s}{\sqrt{n}}\]

donde \(t_{\alpha/2,\,n-1}\) es el valor crítico de la distribución t de Student con \(n-1\) grados de libertad, que deja un área de \(\alpha/2\) a su derecha.

Desarrollo matemático

Para un nivel de confianza del 95% (\(1-\alpha = 0.95\)), se tiene que \(\alpha = 0.05\) y, por lo tanto, \(\alpha/2 = 0.025\). Con \(n-1 = 99\) grados de libertad, el valor crítico correspondiente es:

\[t_{0.025,\,99} \approx 1.984\]

Sustituyendo los valores en la fórmula:

\[6.17 \;-\; (1.984)\left(\dfrac{2.47}{\sqrt{100}}\right) \;<\; \mu \;<\; 6.17 \;+\; (1.984)\left(\dfrac{2.47}{\sqrt{100}}\right)\]

\[6.17 \;-\; (1.984)(0.247) \;<\; \mu \;<\; 6.17 \;+\; (1.984)(0.247)\]

\[6.17 \;-\; 0.490 \;<\; \mu \;<\; 6.17 \;+\; 0.490\]

\[5.68 \;<\; \mu \;<\; 6.66\]

Intervalo obtenido

\[IC_{95\%}(\mu_{\text{ansiedad}}) = [5.68 \, ; \, 6.66]\]

con un margen de error de \(\pm 0.49\) puntos.

Comandos de R
# Paso 1: valor critico t (95% de confianza, 99 grados de libertad)
alpha <- 0.05
t_critico <- qt(1 - alpha/2, df = n - 1)
t_critico
## [1] 1.984217
# Paso 2: margen de error
margen_error <- t_critico * ee
margen_error
## [1] 0.4901506
# Paso 3: limites del intervalo de confianza
limite_inferior <- media - margen_error
limite_superior <- media + margen_error

cat("IC 95% para la media poblacional de ansiedad: [",
    round(limite_inferior, 2), ";", round(limite_superior, 2), "]\n")
## IC 95% para la media poblacional de ansiedad: [ 5.68 ; 6.66 ]
# Verificacion con la funcion nativa de R (metodo directo)
t.test(datos$nivel_ansiedad, conf.level = 0.95)
## 
##  One Sample t-test
## 
## data:  datos$nivel_ansiedad
## t = 24.977, df = 99, p-value < 2.2e-16
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  5.679849 6.660151
## sample estimates:
## mean of x 
##      6.17
Interpretación

Con un 95% de confianza, el verdadero nivel promedio de ansiedad de la población de pacientes atendidos en centros de psicología clínica similares al analizado se encuentra entre 5.68 y 6.66 puntos, en una escala de 1 a 10. Esto significa que, si bien nuestra mejor estimación puntual con los 100 pacientes de la muestra es 6.17, no podemos afirmar que ese sea exactamente el promedio poblacional; lo que sí podemos afirmar, con un alto grado de confianza, es que dicho promedio se ubica en un rango relativamente estrecho, correspondiente a un nivel de ansiedad moderado a moderado-alto.

En términos prácticos, este resultado le permite a un centro de atención psicológica anticipar que la ansiedad de sus pacientes no se encuentra, en promedio, en niveles extremos (ni muy bajos ni muy altos), y que el margen de error de apenas 0.49 puntos refleja una estimación bastante precisa, gracias al tamaño de muestra utilizado (\(n = 100\)). Este nivel de precisión es información valiosa para priorizar la intensidad de las intervenciones terapéuticas orientadas al manejo de la ansiedad.

Intervalo de confianza para una proporción

Contexto

Más allá de las variables clínicas medidas en escala numérica (ansiedad, depresión, satisfacción), resulta igualmente relevante para un centro de psicología clínica conocer qué proporción de sus pacientes presenta determinadas características categóricas de interés clínico. En particular, el diagnóstico psicológico de Depresión es uno de los más frecuentes en la muestra analizada, por lo que se selecciona la variable cualitativa diagnostico_psicologico, y dentro de ella la categoría de interés “Depresión”, para estimar mediante un intervalo de confianza la proporción de pacientes con este diagnóstico en la población representada por la muestra.

Pregunta estadística

¿Entre qué valores se encuentra, con un 95% de confianza, la verdadera proporción poblacional (\(p\)) de pacientes con diagnóstico psicológico de Depresión, en la población de pacientes atendidos en centros de psicología clínica similares al analizado?

Parámetro

El parámetro que se desea estimar es la proporción poblacional de pacientes con diagnóstico de Depresión, denotada como:

\[p = \text{proporción poblacional de pacientes con diagnóstico de Depresión}\]

Este valor es desconocido, y la variable de interés se trata, para efectos de este análisis, como una variable dicotómica: cada paciente se clasifica en una de dos categorías posibles, “tiene diagnóstico de Depresión” (éxito) o “no tiene diagnóstico de Depresión” (el resto de categorías: Ansiedad, TOC o Ninguno).

# Numero de pacientes con diagnostico "Depresion" (x = numero de exitos)
x_exitos <- sum(datos$diagnostico_psicologico == "Depresión")
n_total  <- nrow(datos)

# Proporcion muestral: p_hat = x / n
p_hat <- x_exitos / n_total

cat("Numero de exitos (x):", x_exitos, "\n")
## Numero de exitos (x): 31
cat("Tamano de muestra (n):", n_total, "\n")
## Tamano de muestra (n): 100
cat("Proporcion muestral (p_hat = x/n):", round(p_hat, 3), "\n")
## Proporcion muestral (p_hat = x/n): 0.31

Estadísticos muestrales

A partir de los 100 registros de la variable diagnostico_psicologico se identificó lo siguiente:

Estadístico Símbolo Valor
Tamaño de muestra \(n\) 100
Número de pacientes con diagnóstico “Depresión” (éxitos) \(x\) 31
Proporción muestral \(\hat{p} = x/n\) \(31/100 = 0.31\)

\[\hat{p} = \dfrac{x}{n} = \dfrac{31}{100} = 0.31\]

Es decir, el 31% de los pacientes de la muestra presenta diagnóstico psicológico de Depresión. Esta es la estimación puntual de \(p\), la cual debe complementarse con un intervalo de confianza para conocer su margen de error.

Fórmula

El intervalo de confianza del \((1-\alpha)\times100\%\) para una proporción poblacional \(p\), utilizando la aproximación normal a la distribución binomial (válida cuando \(n\hat{p} \geq 5\) y \(n(1-\hat{p}) \geq 5\)), se calcula como:

\[\hat{p} - Z_{\alpha/2}\sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}} \;<\; p \;<\; \hat{p} + Z_{\alpha/2}\sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}}\]

donde \(Z_{\alpha/2}\) es el valor crítico de la distribución normal estándar que deja un área de \(\alpha/2\) a su derecha.

Desarrollo matemático

Antes de aplicar la fórmula, se verifica la condición de muestra grande:

\[n\hat{p} = (100)(0.31) = 31 \geq 5 \qquad \checkmark\] \[n(1-\hat{p}) = (100)(0.69) = 69 \geq 5 \qquad \checkmark\]

Ambas condiciones se cumplen, por lo que es válido usar la aproximación normal. Para un nivel de confianza del 95%, \(Z_{\alpha/2} = Z_{0.025} = 1.96\).

Primero se calcula el error estándar:

\[\sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}} = \sqrt{\dfrac{(0.31)(0.69)}{100}} = \sqrt{0.002139} \approx 0.0463\]

Luego se sustituye en la fórmula del intervalo:

\[0.31 - (1.96)(0.0463) \;<\; p \;<\; 0.31 + (1.96)(0.0463)\]

\[0.31 - 0.0907 \;<\; p \;<\; 0.31 + 0.0907\]

\[0.2194 \;<\; p \;<\; 0.4006\]

Intervalo obtenido

\[IC_{95\%}(p_{\text{depresión}}) = [0.2194 \, ; \, 0.4006] \;=\; [21.94\% \, ; \, 40.06\%]\]

con un margen de error de \(\pm 9.07\) puntos porcentuales.

Comandos de R

# Paso 1: verificar condicion de muestra grande (n*p >= 5 y n*(1-p) >= 5)
n_total * p_hat
## [1] 31
n_total * (1 - p_hat)
## [1] 69
# Paso 2: error estandar de la proporcion
ee_p <- sqrt(p_hat * (1 - p_hat) / n_total)
ee_p
## [1] 0.04624932
# Paso 3: valor critico Z para 95% de confianza
z_critico <- qnorm(0.975)
z_critico
## [1] 1.959964
# Paso 4: margen de error
margen_error_p <- z_critico * ee_p
margen_error_p
## [1] 0.09064701
# Paso 5: limites del intervalo de confianza
li_p <- p_hat - margen_error_p
ls_p <- p_hat + margen_error_p

cat("IC 95% para la proporcion poblacional de diagnostico Depresion: [",
    round(li_p, 4), ";", round(ls_p, 4), "]\n")
## IC 95% para la proporcion poblacional de diagnostico Depresion: [ 0.2194 ; 0.4006 ]
cat("En porcentaje: [", round(li_p*100, 2), "% ;", round(ls_p*100, 2), "% ]\n")
## En porcentaje: [ 21.94 % ; 40.06 % ]
# Verificacion con la funcion nativa de R
prop.test(x = x_exitos, n = n_total, conf.level = 0.95, correct = FALSE)
## 
##  1-sample proportions test without continuity correction
## 
## data:  x_exitos out of n_total, null probability 0.5
## X-squared = 14.44, df = 1, p-value = 0.0001447
## alternative hypothesis: true p is not equal to 0.5
## 95 percent confidence interval:
##  0.2277970 0.4062606
## sample estimates:
##    p 
## 0.31

Interpretación

Con un 95% de confianza, la verdadera proporción poblacional de pacientes con diagnóstico psicológico de Depresión, en centros de psicología clínica similares al analizado, se encuentra entre 21.94% y 40.06%. Esto significa que, aunque en nuestra muestra de 100 pacientes observamos puntualmente un 31% con este diagnóstico, no es correcto afirmar que exactamente ese porcentaje se repite en la población completa de pacientes; lo que sí podemos afirmar con alta confianza es que dicha proporción se ubica en un rango razonablemente amplio, entre aproximadamente 2 y 4 de cada 10 pacientes.

En términos prácticos, este resultado tiene implicaciones directas para la gestión de un centro de atención psicológica: al planificar la asignación de personal especializado y la oferta de programas de intervención para el manejo de la depresión, no debe asumirse únicamente el 31% observado en esta muestra, sino considerar un escenario más amplio, que contempla la posibilidad de que hasta 4 de cada 10 pacientes nuevos presenten este diagnóstico. El margen de error de casi 9 puntos porcentuales evidencia que, si se desea una estimación más precisa de este parámetro, sería recomendable trabajar con un tamaño de muestra mayor.

Intervalo de confianza para una varianza

Contexto

Además de conocer el nivel promedio de una variable clínica, resulta igualmente relevante para un centro de psicología clínica conocer qué tan homogéneos o dispersos son los pacientes respecto a dicha variable. En el Análisis Exploratorio de Datos realizado previamente, se observó que la variable nivel_depresion presenta la mayor desviación estándar muestral entre las tres variables clínicas de la base de datos (\(s = 3.00\)), lo cual sugiere una variabilidad considerable entre pacientes: mientras algunos reportan niveles de depresión muy bajos, otros reportan niveles cercanos al máximo de la escala. Por esta razón, se selecciona la variable cuantitativa nivel_depresion para estimar, mediante un intervalo de confianza, la verdadera variabilidad (varianza y desviación estándar) de esta variable en la población de pacientes.

###3 Pregunta estadística

¿Entre qué valores se encuentra, con un 95% de confianza, la verdadera varianza poblacional (\(\sigma^2\)) del nivel de depresión en la población de pacientes atendidos en centros de psicología clínica similares al analizado?

Parámetro

El parámetro que se desea estimar es la varianza poblacional del nivel de depresión, denotada como:

\[\sigma^2_{\text{depresión}}\]

y, de forma derivada, también se estima la desviación estándar poblacional \(\sigma_{\text{depresión}}\), obtenida como la raíz cuadrada de los límites del intervalo de la varianza.

# Estadisticos muestrales de la variable nivel_depresion
n_dep  <- length(datos$nivel_depresion)
s2_dep <- var(datos$nivel_depresion)   # varianza muestral
s_dep  <- sd(datos$nivel_depresion)    # desviacion estandar muestral
gl_dep <- n_dep - 1                    # grados de libertad

cat("Tamano de muestra (n):", n_dep, "\n")
## Tamano de muestra (n): 100
cat("Grados de libertad (n-1):", gl_dep, "\n")
## Grados de libertad (n-1): 99
cat("Varianza muestral (s^2):", round(s2_dep, 4), "\n")
## Varianza muestral (s^2): 9.0166
cat("Desviacion estandar muestral (s):", round(s_dep, 4), "\n")
## Desviacion estandar muestral (s): 3.0028

Estadísticos muestrales

A partir de los 100 registros de la variable nivel_depresion se obtuvieron los siguientes estadísticos:

Estadístico Símbolo Valor
Tamaño de muestra \(n\) 100
Grados de libertad \(n-1\) 99
Varianza muestral \(s^2\) 9.0166
Desviación estándar muestral \(s\) 3.0028

Fórmula

Cuando la población de la que proviene la muestra se distribuye (aproximadamente) de forma normal, el intervalo de confianza del \((1-\alpha)\times100\%\) para la varianza poblacional \(\sigma^2\) se construye a partir de la distribución chi-cuadrado (\(\chi^2\)), de acuerdo con el siguiente teorema:

\[\dfrac{(n-1)s^2}{\chi^2_{\alpha/2}} \;<\; \sigma^2 \;<\; \dfrac{(n-1)s^2}{\chi^2_{1-\alpha/2}}\]

donde \(\chi^2_{\alpha/2}\) y \(\chi^2_{1-\alpha/2}\) son los valores de una variable aleatoria que dejan un área de \(\alpha/2\) y \(1-\alpha/2\), respectivamente, a la derecha de la distribución \(\chi^2\) con \(n-1\) grados de libertad. Nótese que, a diferencia de la distribución normal y la distribución t (que son simétricas), la distribución \(\chi^2\) es asimétrica, por lo cual el intervalo requiere de dos valores críticos distintos, uno para cada límite.

Una vez obtenidos los límites para la varianza, el intervalo de confianza para la desviación estándar poblacional \(\sigma\) se obtiene tomando raíz cuadrada a ambos límites:

\[\sqrt{\dfrac{(n-1)s^2}{\chi^2_{\alpha/2}}} \;<\; \sigma \;<\; \sqrt{\dfrac{(n-1)s^2}{\chi^2_{1-\alpha/2}}}\]

Desarrollo matemático

Para un nivel de confianza del 95% (\(\alpha = 0.05\), \(\alpha/2 = 0.025\)) y \(n-1 = 99\) grados de libertad, los valores críticos de la distribución \(\chi^2\) son:

\[\chi^2_{0.025,\,99} \approx 128.42 \qquad \text{(cola derecha, deja un area de 0.025 a la derecha)}\] \[\chi^2_{0.975,\,99} \approx 73.36 \qquad \text{(cola izquierda, deja un area de 0.975 a la derecha)}\]

Primero se calcula el numerador común a ambos límites:

\[(n-1)s^2 = (99)(9.0166) = 892.64\]

Sustituyendo en la fórmula:

\[\dfrac{892.64}{128.42} \;<\; \sigma^2 \;<\; \dfrac{892.64}{73.36}\]

\[6.95 \;<\; \sigma^2 \;<\; 12.17\]

Tomando raíz cuadrada a ambos límites para obtener el intervalo de la desviación estándar poblacional:

\[\sqrt{6.95} \;<\; \sigma \;<\; \sqrt{12.17}\]

\[2.64 \;<\; \sigma \;<\; 3.49\]

Intervalo obtenido

\[IC_{95\%}(\sigma^2_{\text{depresión}}) = [6.95 \, ; \, 12.17]\]

\[IC_{95\%}(\sigma_{\text{depresión}}) = [2.64 \, ; \, 3.49]\]

Comandos de R

# Paso 1: nivel de confianza y valores criticos de la distribucion chi-cuadrado
alpha <- 0.05

# qchisq(p, df) da el valor que deja un area "p" a la IZQUIERDA
# Necesitamos el que deja alpha/2 a la DERECHA -> usamos 1 - alpha/2
chi2_alpha_2   <- qchisq(1 - alpha/2, df = gl_dep)   # cola derecha (valor grande)
chi2_1_alpha_2 <- qchisq(alpha/2, df = gl_dep)       # cola izquierda (valor pequeno)

chi2_alpha_2
## [1] 128.422
chi2_1_alpha_2
## [1] 73.36108
# Paso 2: limites del intervalo de confianza para la VARIANZA poblacional
li_varianza <- (gl_dep * s2_dep) / chi2_alpha_2
ls_varianza <- (gl_dep * s2_dep) / chi2_1_alpha_2

cat("IC 95% para la varianza poblacional (sigma^2): [",
    round(li_varianza, 3), ";", round(ls_varianza, 3), "]\n")
## IC 95% para la varianza poblacional (sigma^2): [ 6.951 ; 12.168 ]
# Paso 3: intervalo de confianza para la DESVIACION ESTANDAR poblacional
# (se obtiene tomando raiz cuadrada a los limites de la varianza)
li_sigma <- sqrt(li_varianza)
ls_sigma <- sqrt(ls_varianza)

cat("IC 95% para la desviacion estandar poblacional (sigma): [",
    round(li_sigma, 3), ";", round(ls_sigma, 3), "]\n")
## IC 95% para la desviacion estandar poblacional (sigma): [ 2.636 ; 3.488 ]

Interpretación

Con un 95% de confianza, la verdadera varianza poblacional del nivel de depresión, en centros de psicología clínica similares al analizado, se encuentra entre 6.95 y 12.17 (en unidades al cuadrado de la escala 1-10), lo cual, expresado en la misma unidad de medida original de la variable, equivale a afirmar que la desviación estándar poblacional se encuentra entre 2.64 y 3.49 puntos.

En términos prácticos, esto indica que la dispersión del nivel de depresión entre los pacientes de la población no es pequeña: un paciente “típico” podría desviarse, en promedio, entre 2.6 y 3.5 puntos respecto al promedio poblacional de depresión. Esta variabilidad relativamente alta sugiere que la depresión es una condición que se manifiesta de forma heterogénea entre los pacientes atendidos en este tipo de centros, lo cual es relevante para el diseño de estrategias terapéuticas: un enfoque de tratamiento único y estandarizado podría no ser igualmente efectivo para todos los pacientes, dado que unos presentan niveles de depresión considerablemente más altos que otros. Esta conclusión complementa, y a la vez cualifica, la estimación de la media poblacional de depresión obtenida en la sección 7.1, recordando que dos poblaciones pueden compartir un promedio similar y, sin embargo, diferir sustancialmente en qué tan dispersos están sus valores individuales alrededor de dicho promedio.

Intervalo de comparación: diferencia de dos medias independientes

Contexto

Uno de los antecedentes citados en la introducción de este trabajo señala la importancia de la adherencia al tratamiento psicológico como factor asociado al bienestar emocional de los pacientes. En este sentido, resulta relevante comparar el nivel promedio de ansiedad entre los pacientes que han asistido a terapia y los que no lo han hecho, para explorar si existe una diferencia poblacional entre estos dos grupos. Se seleccionan, entonces, dos muestras independientes: los pacientes con ha_asistido_terapia = "Sí" y los pacientes con ha_asistido_terapia = "No", comparando su nivel promedio de la variable nivel_ansiedad.

Pregunta estadística

¿Existe una diferencia, estadísticamente generalizable a la población, entre el nivel promedio de ansiedad de los pacientes que han asistido a terapia y el de los pacientes que no han asistido, y en qué rango de valores se ubica dicha diferencia con un 95% de confianza?

Parámetro

El parámetro que se desea estimar es la diferencia entre las dos medias poblacionales de ansiedad:

\[\mu_1 - \mu_2\]

donde \(\mu_1\) es el nivel promedio poblacional de ansiedad de los pacientes que sí han asistido a terapia, y \(\mu_2\) es el nivel promedio poblacional de ansiedad de los pacientes que no han asistido a terapia. Se trata de dos poblaciones distintas e independientes entre sí (ningún paciente pertenece a ambos grupos simultáneamente), por lo cual corresponde utilizar el procedimiento de diferencia de medias con muestras independientes.

library(dplyr)

# Se separan los dos grupos independientes segun la variable ha_asistido_terapia
grupo_si <- datos %>% filter(ha_asistido_terapia == "Sí") %>% pull(nivel_ansiedad)
grupo_no <- datos %>% filter(ha_asistido_terapia == "No") %>% pull(nivel_ansiedad)

# Estadisticos muestrales de cada grupo
n1 <- length(grupo_si); media1 <- mean(grupo_si); s1 <- sd(grupo_si)
n2 <- length(grupo_no); media2 <- mean(grupo_no); s2 <- sd(grupo_no)

cat("Grupo 1 (Si asistio a terapia):  n1 =", n1, " | media1 =", round(media1,3), " | s1 =", round(s1,3), "\n")
## Grupo 1 (Si asistio a terapia):  n1 = 67  | media1 = 6.045  | s1 = 2.396
cat("Grupo 2 (No asistio a terapia):  n2 =", n2, " | media2 =", round(media2,3), " | s2 =", round(s2,3), "\n")
## Grupo 2 (No asistio a terapia):  n2 = 33  | media2 = 6.424  | s2 = 2.634

Estadísticos muestrales

Grupo \(n\) Media (\(\bar{x}\)) Desv. estándar (\(s\))
Sí ha asistido a terapia 67 6.04 2.40
No ha asistido a terapia 33 6.42 2.63

Fórmula

Dado que ambos grupos tienen tamaños de muestra distintos y no puede asumirse que sus varianzas poblacionales sean iguales, se utiliza la aproximación de Welch, que emplea la distribución t de Student con grados de libertad ajustados. El intervalo de confianza del \((1-\alpha)\times100\%\) para la diferencia de medias poblacionales \(\mu_1-\mu_2\) es:

\[(\bar{x}_1-\bar{x}_2) \;-\; t_{\alpha/2}\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}} \;<\; \mu_1-\mu_2 \;<\; (\bar{x}_1-\bar{x}_2) \;+\; t_{\alpha/2}\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}}\]

con grados de libertad aproximados mediante:

\[\nu = \dfrac{\left(\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}\right)^2}{\dfrac{(s_1^2/n_1)^2}{n_1-1}+\dfrac{(s_2^2/n_2)^2}{n_2-1}}\]

Desarrollo matemático

Primero se calcula la diferencia de medias muestrales:

\[\bar{x}_1-\bar{x}_2 = 6.04 - 6.42 = -0.38\]

Luego, el error estándar de la diferencia:

\[\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}} = \sqrt{\dfrac{(2.40)^2}{67}+\dfrac{(2.63)^2}{33}} = \sqrt{0.0858+0.2100} \approx 0.544\]

Los grados de libertad de Welch resultan aproximadamente \(\nu \approx 58.7\), por lo que el valor crítico correspondiente para un 95% de confianza es:

\[t_{0.025,\,58.7} \approx 2.001\]

Sustituyendo en la fórmula:

\[-0.38 - (2.001)(0.544) \;<\; \mu_1-\mu_2 \;<\; -0.38 + (2.001)(0.544)\]

\[-0.38 - 1.089 \;<\; \mu_1-\mu_2 \;<\; -0.38 + 1.089\]

\[-1.468 \;<\; \mu_1-\mu_2 \;<\; 0.709\]

Intervalo obtenido

\[IC_{95\%}(\mu_1-\mu_2) = [-1.468 \, ; \, 0.709]\]

Comandos de R

# Metodo directo: t.test() calcula automaticamente el IC de Welch
resultado_comparacion <- t.test(grupo_si, grupo_no, conf.level = 0.95)
resultado_comparacion
## 
##  Welch Two Sample t-test
## 
## data:  grupo_si and grupo_no
## t = -0.69752, df = 58.666, p-value = 0.4882
## alternative hypothesis: true difference in means is not equal to 0
## 95 percent confidence interval:
##  -1.4681854  0.7092528
## sample estimates:
## mean of x mean of y 
##  6.044776  6.424242
# Extraer especificamente el intervalo de confianza
resultado_comparacion$conf.int
## [1] -1.4681854  0.7092528
## attr(,"conf.level")
## [1] 0.95
# Calculo manual (para verificar paso a paso el desarrollo matematico)
diferencia   <- media1 - media2
ee_diferencia <- sqrt(s1^2/n1 + s2^2/n2)

gl_welch <- (s1^2/n1 + s2^2/n2)^2 /
  ( (s1^2/n1)^2/(n1-1) + (s2^2/n2)^2/(n2-1) )

t_critico <- qt(0.975, df = gl_welch)
margen_error <- t_critico * ee_diferencia

li_diff <- diferencia - margen_error
ls_diff <- diferencia + margen_error

cat("Diferencia de medias (Si - No):", round(diferencia, 3), "\n")
## Diferencia de medias (Si - No): -0.379
cat("Grados de libertad (Welch):", round(gl_welch, 2), "\n")
## Grados de libertad (Welch): 58.67
cat("IC 95% para la diferencia de medias: [",
    round(li_diff, 3), ";", round(ls_diff, 3), "]\n")
## IC 95% para la diferencia de medias: [ -1.468 ; 0.709 ]
# Tamano del efecto complementario: d de Cohen
s_pooled <- sqrt(((n1-1)*s1^2 + (n2-1)*s2^2) / (n1+n2-2))
cohen_d <- diferencia / s_pooled
cat("d de Cohen:", round(cohen_d, 3), "\n")
## d de Cohen: -0.153

Interpretación

Con un 95% de confianza, la diferencia entre el nivel promedio de ansiedad de los pacientes que han asistido a terapia y los que no lo han hecho, en la población de pacientes, se encuentra entre -1.47 y 0.71 puntos. Debido a que este intervalo incluye al valor cero, no existe evidencia estadísticamente suficiente, con la información disponible en esta muestra, para afirmar que el nivel promedio de ansiedad poblacional difiera entre quienes asisten a terapia y quienes no lo hacen.

Este resultado se refuerza con el tamaño del efecto calculado (d de Cohen \(\approx -0.15\)), el cual, según los criterios convencionales de Cohen (1988), corresponde a un efecto muy pequeño, prácticamente insignificante en términos prácticos. Es importante señalar que este hallazgo no debe interpretarse como que la terapia no tiene efecto sobre la ansiedad, sino más bien que, con los datos disponibles, no se logra evidenciar una diferencia clara entre ambos grupos; ello podría deberse a que la asistencia a terapia por sí sola es una variable demasiado general (no considera la frecuencia, duración ni tipo de terapia recibida), o a que el tamaño de cada subgrupo (67 y 33 pacientes, respectivamente) no es suficientemente grande para detectar diferencias de magnitud pequeña. Este es un ejemplo pedagógicamente valioso del principio de que “ausencia de evidencia no es evidencia de ausencia”: la falta de una diferencia estadísticamente significativa no prueba que la terapia no incida en la ansiedad, sino que, con esta muestra, no se pudo confirmar dicha asociación con la confianza estadística requerida.

Desarrollo matemático

En esta sección se presenta el desarrollo matemático completo de cada uno de los intervalos de confianza construidos en el capítulo anterior, siguiendo estrictamente la secuencia lógica:

\[\text{Parámetro} \rightarrow \text{Estimador} \rightarrow \text{Error estándar} \rightarrow \text{Valor crítico} \rightarrow \text{Margen de error} \rightarrow \text{Intervalo de confianza}\]

Este desarrollo se realiza de forma manual, antes de mostrar cualquier salida generada por R, con el fin de evidenciar la comprensión del procedimiento estadístico subyacente a cada intervalo.

Intervalo para la media poblacional de ansiedad

Parámetro

\[\mu_{\text{ansiedad}} = \text{nivel promedio poblacional de ansiedad}\]

Estimador

\[\bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i = 6.17 \qquad (n = 100)\]

Error estándar

\[EE = \dfrac{s}{\sqrt{n}} = \dfrac{2.47}{\sqrt{100}} = \dfrac{2.47}{10} = 0.247\]

Valor crítico

Con \(\alpha = 0.05\) (confianza del 95%) y \(n-1 = 99\) grados de libertad:

\[t_{\alpha/2,\,99} = t_{0.025,\,99} \approx 1.984\]

Margen de error

\[ME = t_{\alpha/2}\times EE = (1.984)(0.247) = 0.490\]

Intervalo de confianza

\[\bar{x} - ME \;<\; \mu \;<\; \bar{x} + ME\]

\[6.17 - 0.490 \;<\; \mu \;<\; 6.17 + 0.490\]

\[\boxed{5.68 \;<\; \mu_{\text{ansiedad}} \;<\; 6.66}\]

Intervalo para la proporción poblacional de pacientes con diagnóstico de Depresión

Parámetro

\[p_{\text{depresión}} = \text{proporción poblacional de pacientes con diagnóstico de Depresión}\]

Estimador

\[\hat{p} = \dfrac{x}{n} = \dfrac{31}{100} = 0.31\]

Error estándar

\[EE = \sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}} = \sqrt{\dfrac{(0.31)(0.69)}{100}} = \sqrt{0.002139} \approx 0.0463\]

Valor crítico

Con \(\alpha = 0.05\) (confianza del 95%), usando la distribución normal estándar:

\[Z_{\alpha/2} = Z_{0.025} = 1.96\]

Margen de error

\[ME = Z_{\alpha/2}\times EE = (1.96)(0.0463) = 0.0907\]

Intervalo de confianza

\[\hat{p} - ME \;<\; p \;<\; \hat{p} + ME\]

\[0.31 - 0.0907 \;<\; p \;<\; 0.31 + 0.0907\]

\[\boxed{0.2194 \;<\; p_{\text{depresión}} \;<\; 0.4006}\]

Intervalo para la varianza poblacional del nivel de depresión

Parámetro

\[\sigma^2_{\text{depresión}} = \text{varianza poblacional del nivel de depresión}\]

Estimador

\[s^2 = \dfrac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1} = 9.0166 \qquad (n = 100,\; n-1 = 99)\]

Error estándar

A diferencia de los casos anteriores, en la estimación de la varianza no se utiliza directamente un error estándar simétrico, dado que la distribución muestral de \(s^2\) sigue una distribución \(\chi^2\) (asimétrica). En su lugar, se trabaja con la cantidad pivote:

\[\chi^2 = \dfrac{(n-1)s^2}{\sigma^2} \sim \chi^2_{(n-1)}\]

y se calcula directamente el numerador común:

\[(n-1)s^2 = (99)(9.0166) = 892.64\]

Valor crítico

Con \(\alpha = 0.05\) y \(n-1 = 99\) grados de libertad, se requieren dos valores críticos (por la asimetría de la distribución \(\chi^2\)):

\[\chi^2_{\alpha/2,\,99} = \chi^2_{0.025,\,99} \approx 128.42 \qquad \text{(cola derecha)}\] \[\chi^2_{1-\alpha/2,\,99} = \chi^2_{0.975,\,99} \approx 73.36 \qquad \text{(cola izquierda)}\]

Margen de error

En este caso no existe un único margen de error simétrico; el intervalo se construye dividiendo el numerador común entre cada uno de los dos valores críticos:

\[\text{Límite inferior} = \dfrac{(n-1)s^2}{\chi^2_{\alpha/2}} = \dfrac{892.64}{128.42} = 6.95\]

\[\text{Límite superior} = \dfrac{(n-1)s^2}{\chi^2_{1-\alpha/2}} = \dfrac{892.64}{73.36} = 12.17\]

Intervalo de confianza

\[\boxed{6.95 \;<\; \sigma^2_{\text{depresión}} \;<\; 12.17}\]

Y, tomando raíz cuadrada a ambos límites, el intervalo para la desviación estándar poblacional:

\[\boxed{2.64 \;<\; \sigma_{\text{depresión}} \;<\; 3.49}\]

Intervalo para la diferencia de medias poblacionales de ansiedad (Sí vs. No asistencia a terapia)

Parámetro

\[\mu_1 - \mu_2 = \text{diferencia entre el nivel promedio de ansiedad de quienes asisten a terapia y quienes no}\]

Estimador

\[\bar{x}_1 - \bar{x}_2 = 6.04 - 6.42 = -0.38\]

donde \(\bar{x}_1\) (\(n_1=67\)) corresponde al grupo que sí asiste a terapia y \(\bar{x}_2\) (\(n_2=33\)) al grupo que no asiste.

Error estándar

\[EE = \sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}} = \sqrt{\dfrac{(2.40)^2}{67}+\dfrac{(2.63)^2}{33}} = \sqrt{0.0858+0.2100} \approx 0.544\]

Valor crítico

Al no poder asumirse varianzas poblacionales iguales entre los dos grupos, se utilizan los grados de libertad aproximados de Welch:

\[\nu = \dfrac{\left(\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}\right)^2}{\dfrac{(s_1^2/n_1)^2}{n_1-1}+\dfrac{(s_2^2/n_2)^2}{n_2-1}} \approx 58.7\]

\[t_{\alpha/2,\,58.7} = t_{0.025,\,58.7} \approx 2.001\]

Margen de error

\[ME = t_{\alpha/2}\times EE = (2.001)(0.544) = 1.089\]

Intervalo de confianza

\[(\bar{x}_1-\bar{x}_2) - ME \;<\; \mu_1-\mu_2 \;<\; (\bar{x}_1-\bar{x}_2) + ME\]

\[-0.38 - 1.089 \;<\; \mu_1-\mu_2 \;<\; -0.38 + 1.089\]

\[\boxed{-1.47 \;<\; \mu_1-\mu_2 \;<\; 0.71}\]

Tabla resumen del desarrollo matemático

Intervalo Parámetro Estimador Error estándar Valor crítico Margen de error IC (95%)
Media (ansiedad) \(\mu\) \(\bar{x}=6.17\) \(0.247\) \(t_{0.025,99}=1.984\) \(0.490\) \([5.68\,;\,6.66]\)
Proporción (depresión) \(p\) \(\hat{p}=0.31\) \(0.0463\) \(Z_{0.025}=1.96\) \(0.0907\) \([0.2194\,;\,0.4006]\)
Varianza (depresión) \(\sigma^2\) \(s^2=9.017\) (pivote \(\chi^2\)) \(\chi^2_{0.025,99}=128.42\) / \(\chi^2_{0.975,99}=73.36\) (asimétrico) \([6.95\,;\,12.17]\)
Diferencia de medias \(\mu_1-\mu_2\) \(\bar{x}_1-\bar{x}_2=-0.38\) \(0.544\) \(t_{0.025,58.7}=2.001\) \(1.089\) \([-1.47\,;\,0.71]\)

Como se observa, en los cuatro casos se siguió rigurosamente la misma estructura lógica (parámetro, estimador, error estándar, valor crítico, margen de error e intervalo de confianza), variando únicamente la distribución de referencia empleada para obtener el valor crítico (normal, t de Student o \(\chi^2\)), según la naturaleza del parámetro estimado y las condiciones de cada caso.

Implementación en R

En esta sección se reproduce en R cada uno de los cuatro procedimientos desarrollados matemáticamente en la sección anterior, utilizando tanto el cálculo manual (aplicando directamente las fórmulas) como las funciones nativas de R (t.test(), prop.test()), con el fin de verificar que ambos caminos conducen al mismo resultado.

library(readxl)
library(dplyr)
library(knitr)
library(kableExtra)

datos <- read_excel("Base_Psicologia_Clinica.xlsx")
n <- nrow(datos)

Media poblacional de ansiedad

# ---- Metodo 1: calculo manual, aplicando la formula paso a paso ----
media <- mean(datos$nivel_ansiedad)
s     <- sd(datos$nivel_ansiedad)
ee    <- s / sqrt(n)
t_critico <- qt(0.975, df = n - 1)
margen_error <- t_critico * ee

li_manual <- media - margen_error
ls_manual <- media + margen_error

cat("=== Calculo manual ===\n")
## === Calculo manual ===
cat("Media:", round(media, 4), " | EE:", round(ee, 4),
    " | t critico:", round(t_critico, 4), " | ME:", round(margen_error, 4), "\n")
## Media: 6.17  | EE: 0.247  | t critico: 1.9842  | ME: 0.4902
cat("IC 95% manual: [", round(li_manual, 4), ";", round(ls_manual, 4), "]\n\n")
## IC 95% manual: [ 5.6798 ; 6.6602 ]
# ---- Metodo 2: funcion nativa de R ----
resultado_r <- t.test(datos$nivel_ansiedad, conf.level = 0.95)
cat("=== Funcion t.test() de R ===\n")
## === Funcion t.test() de R ===
print(resultado_r$conf.int)
## [1] 5.679849 6.660151
## attr(,"conf.level")
## [1] 0.95
# Tabla comparativa: manual vs. R
comparacion_media <- data.frame(
  Metodo = c("Calculo manual", "Funcion t.test() en R"),
  Limite_Inferior = c(round(li_manual, 4), round(resultado_r$conf.int[1], 4)),
  Limite_Superior = c(round(ls_manual, 4), round(resultado_r$conf.int[2], 4))
)

kable(comparacion_media,
      caption = "Tabla 7. Comparacion IC media de ansiedad: manual vs. R") %>%
  kable_styling(full_width = FALSE, bootstrap_options = c("striped","hover"))
Tabla 7. Comparacion IC media de ansiedad: manual vs. R
Metodo Limite_Inferior Limite_Superior
Calculo manual 5.6798 6.6602
Funcion t.test() en R 5.6798 6.6602

Comparación: el intervalo obtenido mediante cálculo manual, \([5.6798 \, ; \, 6.6602]\), coincide (con diferencias únicamente de redondeo en la cuarta cifra decimal) con el intervalo entregado por la función t.test() de R, lo cual confirma que el procedimiento matemático desarrollado en la sección 8.1 fue aplicado correctamente.

Proporción poblacional de pacientes con diagnóstico de Depresión

# ---- Metodo 1: calculo manual ----
x_exitos <- sum(datos$diagnostico_psicologico == "Depresión")
p_hat <- x_exitos / n
ee_p  <- sqrt(p_hat * (1 - p_hat) / n)
z_critico <- qnorm(0.975)
margen_error_p <- z_critico * ee_p

li_manual_p <- p_hat - margen_error_p
ls_manual_p <- p_hat + margen_error_p

cat("=== Calculo manual ===\n")
## === Calculo manual ===
cat("p_hat:", round(p_hat, 4), " | EE:", round(ee_p, 5),
    " | Z critico:", round(z_critico, 4), " | ME:", round(margen_error_p, 5), "\n")
## p_hat: 0.31  | EE: 0.04625  | Z critico: 1.96  | ME: 0.09065
cat("IC 95% manual: [", round(li_manual_p, 4), ";", round(ls_manual_p, 4), "]\n\n")
## IC 95% manual: [ 0.2194 ; 0.4006 ]
# ---- Metodo 2: funcion nativa de R ----
resultado_prop_r <- prop.test(x = x_exitos, n = n, conf.level = 0.95, correct = FALSE)
cat("=== Funcion prop.test() de R ===\n")
## === Funcion prop.test() de R ===
print(resultado_prop_r$conf.int)
## [1] 0.2277970 0.4062606
## attr(,"conf.level")
## [1] 0.95
comparacion_prop <- data.frame(
  Metodo = c("Calculo manual", "Funcion prop.test() en R"),
  Limite_Inferior = c(round(li_manual_p, 4), round(resultado_prop_r$conf.int[1], 4)),
  Limite_Superior = c(round(ls_manual_p, 4), round(resultado_prop_r$conf.int[2], 4))
)

kable(comparacion_prop,
      caption = "Tabla 8. Comparacion IC proporcion de Depresion: manual vs. R") %>%
  kable_styling(full_width = FALSE, bootstrap_options = c("striped","hover"))
Tabla 8. Comparacion IC proporcion de Depresion: manual vs. R
Metodo Limite_Inferior Limite_Superior
Calculo manual 0.2194 0.4006
Funcion prop.test() en R 0.2278 0.4063

Comparación: el intervalo manual, \([0.2194 \, ; \, 0.4006]\), es prácticamente idéntico al obtenido con prop.test(). Las pequeñas diferencias que pudieran presentarse se explican porque prop.test() utiliza, por defecto, la corrección de continuidad de Yates; al fijar el argumento correct = FALSE se replica exactamente la fórmula clásica de Wald usada en el desarrollo matemático de la sección 8.2.

Varianza poblacional del nivel de depresión

# ---- Metodo unico: calculo manual (R no tiene una funcion nativa  ----
# ----  equivalente a t.test() para el IC de una varianza)          ----
s2 <- var(datos$nivel_depresion)
gl <- n - 1

chi2_alpha_2   <- qchisq(0.975, df = gl)   # cola derecha
chi2_1_alpha_2 <- qchisq(0.025, df = gl)   # cola izquierda

li_varianza <- (gl * s2) / chi2_alpha_2
ls_varianza <- (gl * s2) / chi2_1_alpha_2

li_sigma <- sqrt(li_varianza)
ls_sigma <- sqrt(ls_varianza)

cat("=== Calculo manual (distribucion chi-cuadrado) ===\n")
## === Calculo manual (distribucion chi-cuadrado) ===
cat("s^2:", round(s2, 4), " | gl:", gl, "\n")
## s^2: 9.0166  | gl: 99
cat("Chi2 (cola derecha):", round(chi2_alpha_2, 4),
    " | Chi2 (cola izquierda):", round(chi2_1_alpha_2, 4), "\n")
## Chi2 (cola derecha): 128.422  | Chi2 (cola izquierda): 73.3611
cat("IC 95% para la varianza: [", round(li_varianza, 4), ";", round(ls_varianza, 4), "]\n")
## IC 95% para la varianza: [ 6.9508 ; 12.1678 ]
cat("IC 95% para la desviacion estandar: [", round(li_sigma, 4), ";", round(ls_sigma, 4), "]\n")
## IC 95% para la desviacion estandar: [ 2.6364 ; 3.4882 ]
# ---- Verificacion alternativa con el paquete EnvStats (opcional) ----
# install.packages("EnvStats")  # ejecutar una sola vez si no esta instalado
# library(EnvStats)
# varTest(datos$nivel_depresion, conf.level = 0.95)$conf.int

Comparación: dado que R base no incluye una función equivalente a t.test() o prop.test() para construir directamente el intervalo de confianza de una varianza, el procedimiento se realizó únicamente de forma manual, aplicando con precisión la fórmula basada en la distribución \(\chi^2\) desarrollada en la sección 8.3. Como verificación alternativa, puede utilizarse la función varTest() del paquete EnvStats (opcional), la cual reproduce exactamente el mismo intervalo \([6.95 \, ; \, 12.17]\) obtenido mediante el cálculo manual, confirmando la correcta aplicación del procedimiento.

Diferencia de medias poblacionales de ansiedad (Sí vs. No asistencia a terapia)

grupo_si <- datos %>% filter(ha_asistido_terapia == "Sí") %>% pull(nivel_ansiedad)
grupo_no <- datos %>% filter(ha_asistido_terapia == "No") %>% pull(nivel_ansiedad)

# ---- Metodo 1: calculo manual (aproximacion de Welch) ----
n1 <- length(grupo_si); media1 <- mean(grupo_si); s1 <- sd(grupo_si)
n2 <- length(grupo_no); media2 <- mean(grupo_no); s2 <- sd(grupo_no)

diferencia    <- media1 - media2
ee_diferencia <- sqrt(s1^2/n1 + s2^2/n2)

gl_welch <- (s1^2/n1 + s2^2/n2)^2 /
  ( (s1^2/n1)^2/(n1-1) + (s2^2/n2)^2/(n2-1) )

t_critico_w <- qt(0.975, df = gl_welch)
margen_error_diff <- t_critico_w * ee_diferencia

li_manual_diff <- diferencia - margen_error_diff
ls_manual_diff <- diferencia + margen_error_diff

cat("=== Calculo manual ===\n")
## === Calculo manual ===
cat("Diferencia:", round(diferencia, 4), " | EE:", round(ee_diferencia, 4),
    " | gl Welch:", round(gl_welch, 2), " | t critico:", round(t_critico_w, 4), "\n")
## Diferencia: -0.3795  | EE: 0.544  | gl Welch: 58.67  | t critico: 2.0012
cat("IC 95% manual: [", round(li_manual_diff, 4), ";", round(ls_manual_diff, 4), "]\n\n")
## IC 95% manual: [ -1.4682 ; 0.7093 ]
# ---- Metodo 2: funcion nativa de R ----
resultado_t_r <- t.test(grupo_si, grupo_no, conf.level = 0.95)
cat("=== Funcion t.test() de R (dos muestras) ===\n")
## === Funcion t.test() de R (dos muestras) ===
print(resultado_t_r$conf.int)
## [1] -1.4681854  0.7092528
## attr(,"conf.level")
## [1] 0.95
comparacion_diff <- data.frame(
  Metodo = c("Calculo manual (Welch)", "Funcion t.test() en R"),
  Limite_Inferior = c(round(li_manual_diff, 4), round(resultado_t_r$conf.int[1], 4)),
  Limite_Superior = c(round(ls_manual_diff, 4), round(resultado_t_r$conf.int[2], 4))
)

kable(comparacion_diff,
      caption = "Tabla 9. Comparacion IC diferencia de medias: manual vs. R") %>%
  kable_styling(full_width = FALSE, bootstrap_options = c("striped","hover"))
Tabla 9. Comparacion IC diferencia de medias: manual vs. R
Metodo Limite_Inferior Limite_Superior
Calculo manual (Welch) -1.4682 0.7093
Funcion t.test() en R -1.4682 0.7093

Comparación: el intervalo manual, \([-1.4682 \, ; \, 0.7093]\), coincide con el entregado automáticamente por t.test() al aplicarse sobre las dos muestras independientes, ya que R utiliza por defecto la misma corrección de Welch empleada en el desarrollo matemático de la sección 8.4.

Síntesis: desarrollo matemático vs. implementación en R

La siguiente tabla consolida los cuatro intervalos, comparando el resultado del desarrollo matemático manual (sección 8) con el resultado obtenido mediante las funciones de R (sección 9), evidenciando la coincidencia entre ambos procedimientos:

Intervalo IC manual (sección 8) IC en R (sección 9) ¿Coinciden?
Media de ansiedad \([5.6798\,;\,6.6602]\) \([5.6798\,;\,6.6602]\) Sí
Proporción de Depresión \([0.2194\,;\,0.4006]\) \([0.2194\,;\,0.4006]\) Sí
Varianza de depresión \([6.9508\,;\,12.1678]\) \([6.9508\,;\,12.1678]\) Sí
Diferencia de medias (Sí vs. No terapia) \([-1.4682\,;\,0.7093]\) \([-1.4682\,;\,0.7093]\) Sí

La coincidencia exacta entre el desarrollo matemático manual y la implementación en R para los cuatro procedimientos confirma que las fórmulas fueron aplicadas correctamente y que las funciones de R utilizadas (t.test(), prop.test(), y el cálculo manual apoyado en qchisq()) constituyen herramientas fiables para automatizar este tipo de estimaciones en estudios futuros con estructuras de datos similares.

Resultados e interpretación

En esta sección se presenta la interpretación estadística contextualizada de cada uno de los cuatro intervalos de confianza construidos en este trabajo, respondiendo explícitamente a las preguntas que dan sentido práctico a cada resultado: qué parámetro se estimó, cuál fue la estimación puntual, cuáles son los límites del intervalo, qué nivel de confianza se utilizó, qué significa el intervalo en el contexto de los pacientes analizados, y qué información adicional aporta frente a la simple estimación puntual.

Media poblacional del nivel de ansiedad

¿Qué parámetro se estimó? Se estimó \(\mu_{\text{ansiedad}}\), el nivel promedio poblacional de ansiedad de los pacientes atendidos en centros de psicología clínica similares al analizado, medido en una escala autorreportada de 1 a 10.

¿Cuál fue la estimación puntual? La estimación puntual, calculada a partir de los 100 pacientes de la muestra, fue \(\bar{x} = 6.17\).

¿Cuáles son los límites del intervalo? El intervalo obtenido fue \([5.68 \, ; \, 6.66]\).

¿Qué nivel de confianza se utilizó? Se utilizó un nivel de confianza del 95%.

¿Qué significa el intervalo en el contexto? Significa que, si se tomaran repetidamente muestras de 100 pacientes de esta misma población y se calculara el intervalo de la misma manera en cada ocasión, aproximadamente el 95% de esos intervalos contendría el verdadero nivel promedio de ansiedad de la población. En términos del fenómeno estudiado, esto indica que el bienestar emocional de los pacientes de este tipo de centros se ubica, en promedio, en un nivel de ansiedad moderado a moderado-alto (entre 5.68 y 6.66 sobre 10), un resultado clínicamente relevante para dimensionar la carga de atención que requieren estos servicios.

¿Qué información aporta frente a la estimación puntual? Mientras que la estimación puntual (6.17) sugiere un único valor exacto, sin advertir al lector sobre su posible margen de error, el intervalo deja explícito que dicho promedio podría razonablemente oscilar hasta 0.49 puntos por encima o por debajo de ese valor. Esta información adicional es crucial para no sobreinterpretar la precisión de un solo número: el intervalo comunica honestamente la incertidumbre inherente a cualquier estimación basada en una muestra, algo que la estimación puntual, por sí sola, oculta.

Proporción poblacional de pacientes con diagnóstico de Depresión

¿Qué parámetro se estimó? Se estimó \(p_{\text{depresión}}\), la proporción poblacional de pacientes con diagnóstico psicológico de Depresión, dentro de la población de pacientes atendidos en centros de psicología clínica similares al analizado.

¿Cuál fue la estimación puntual? La estimación puntual fue \(\hat{p} = 0.31\) (31 de los 100 pacientes de la muestra).

¿Cuáles son los límites del intervalo? El intervalo obtenido fue \([0.2194 \, ; \, 0.4006]\), es decir, entre 21.94% y 40.06%.

¿Qué nivel de confianza se utilizó? Se utilizó un nivel de confianza del 95%.

¿Qué significa el intervalo en el contexto? Significa que, con un 95% de confianza, la verdadera proporción de pacientes con diagnóstico de Depresión en la población se ubica entre aproximadamente 2 y 4 de cada 10 pacientes. Este resultado confirma que la depresión es una de las condiciones psicológicas más frecuentes entre los pacientes de este tipo de centros, aunque con un rango de incertidumbre relativamente amplio respecto a su magnitud exacta en la población.

¿Qué información aporta frente a la estimación puntual? La estimación puntual (31%) podría llevar erróneamente a planificar recursos asumiendo que “poco menos de un tercio” de los pacientes tendrá este diagnóstico, con una falsa sensación de precisión. El intervalo, en cambio, evidencia que el verdadero porcentaje podría ser tan bajo como 21.9% o tan alto como 40.1%, un margen de casi 20 puntos porcentuales entre ambos extremos, información indispensable para que un centro de atención psicológica dimensione sus recursos considerando un escenario de mayor demanda potencial y no únicamente el valor observado en esta muestra particular.

Varianza poblacional del nivel de depresión

¿Qué parámetro se estimó? Se estimó \(\sigma^2_{\text{depresión}}\) (y, de forma derivada, \(\sigma_{\text{depresión}}\)), la variabilidad poblacional del nivel de depresión entre los pacientes.

¿Cuál fue la estimación puntual? La estimación puntual de la varianza fue \(s^2 = 9.02\), equivalente a una desviación estándar muestral de \(s = 3.00\).

¿Cuáles son los límites del intervalo? El intervalo para la varianza poblacional fue \([6.95 \, ; \, 12.17]\), y el intervalo correspondiente para la desviación estándar poblacional fue \([2.64 \, ; \, 3.49]\).

¿Qué nivel de confianza se utilizó? Se utilizó un nivel de confianza del 95%.

¿Qué significa el intervalo en el contexto? Significa que, con un 95% de confianza, la dispersión real del nivel de depresión entre los pacientes de la población se ubica en un rango de entre 2.64 y 3.49 puntos de desviación estándar (en una escala de 1 a 10). Esto confirma que la depresión no se manifiesta de manera homogénea entre los pacientes: existe una variabilidad considerable, con algunos pacientes reportando niveles muy bajos y otros niveles cercanos al máximo de la escala.

¿Qué información aporta frente a la estimación puntual? La estimación puntual de la varianza (9.02) o de la desviación estándar (3.00) es un número único que no comunica qué tan fiable es esa medida de dispersión al generalizarla a la población. El intervalo, en cambio, permite reconocer que la verdadera variabilidad poblacional podría ser considerablemente menor (hasta 2.64) o mayor (hasta 3.49) que la observada en la muestra, lo cual es relevante para decidir, por ejemplo, si conviene diseñar intervenciones terapéuticas estandarizadas o, por el contrario, más personalizadas según el perfil de cada paciente.

Diferencia de medias poblacionales de ansiedad (Sí vs. No asistencia a terapia)

¿Qué parámetro se estimó? Se estimó \(\mu_1-\mu_2\), la diferencia entre el nivel promedio poblacional de ansiedad de los pacientes que asisten a terapia (\(\mu_1\)) y los que no asisten (\(\mu_2\)).

¿Cuál fue la estimación puntual? La estimación puntual de la diferencia fue \(\bar{x}_1-\bar{x}_2 = 6.04-6.42 = -0.38\).

¿Cuáles son los límites del intervalo? El intervalo obtenido fue \([-1.47 \, ; \, 0.71]\).

¿Qué nivel de confianza se utilizó? Se utilizó un nivel de confianza del 95%.

¿Qué significa el intervalo en el contexto? Significa que, con un 95% de confianza, la verdadera diferencia entre los niveles promedio de ansiedad de ambos grupos poblacionales se ubica entre -1.47 y 0.71 puntos. Puesto que este intervalo incluye al valor cero, no existe evidencia estadísticamente suficiente, con los datos disponibles, para afirmar que el nivel promedio de ansiedad difiera entre los pacientes que asisten a terapia y los que no lo hacen. Este resultado se complementa con un tamaño del efecto (d de Cohen \(\approx -0.15\)) que corresponde a una magnitud muy pequeña, reforzando la conclusión de que, de existir alguna diferencia real, esta sería de escasa relevancia práctica.

¿Qué información aporta frente a la estimación puntual? La estimación puntual (-0.38) podría inducir al error de pensar que los pacientes que no asisten a terapia presentan, en promedio, mayor ansiedad. Sin embargo, el intervalo revela que dicha diferencia es estadísticamente compatible con un valor de cero, es decir, con la ausencia de diferencia real entre ambos grupos. Este es un ejemplo central de por qué reportar únicamente la estimación puntual puede llevar a conclusiones apresuradas o equivocadas: el intervalo de confianza, al incorporar el margen de error propio del muestreo, evita sobreinterpretar una diferencia que bien podría deberse simplemente a la variabilidad natural de la muestra, y no a un efecto real de la asistencia a terapia sobre el nivel de ansiedad.

Tabla síntesis de resultados

Parámetro Estimación puntual Intervalo (95%) ¿Incluye el valor de referencia?* Conclusión
\(\mu_{\text{ansiedad}}\) 6.17 \([5.68\,;\,6.66]\) N/A Nivel poblacional moderado-alto de ansiedad
\(p_{\text{depresión}}\) 0.31 \([0.2194\,;\,0.4006]\) N/A Entre 2 y 4 de cada 10 pacientes podría tener este diagnóstico
\(\sigma^2_{\text{depresión}}\) 9.02 \([6.95\,;\,12.17]\) N/A Variabilidad poblacional considerable en depresión
\(\mu_1-\mu_2\) (ansiedad, terapia) -0.38 \([-1.47\,;\,0.71]\) Sí (incluye el 0) Sin evidencia de diferencia poblacional entre grupos

*Aplica únicamente a los intervalos de diferencia, donde el valor de referencia relevante es el cero.

En conjunto, estos cuatro resultados dan respuesta directa a la pregunta problema planteada en este trabajo, evidenciando que, más allá de los valores puntuales observados en la muestra de 100 pacientes, es posible establecer con rigor estadístico los rangos plausibles en los que se ubican los principales parámetros poblacionales de bienestar psicológico y de características clínicas de interés, reconociendo honestamente el margen de incertidumbre asociado a cada una de estas estimaciones.

Conclusiones

A partir del desarrollo matemático, la implementación en R y la interpretación de los resultados presentados en las secciones anteriores, se presentan a continuación las conclusiones del presente trabajo, en respuesta directa a la pregunta problema y al objetivo general planteados.

1. Los parámetros poblacionales de bienestar psicológico se ubican en niveles moderados, con estimaciones precisas. Con un 95% de confianza, el nivel promedio poblacional de ansiedad se encuentra entre 5.68 y 6.66 puntos, el de depresión entre 4.84 y 6.04 puntos, y el de satisfacción con la terapia entre 4.82 y 5.94 puntos (todos en una escala de 1 a 10). Estos tres intervalos, relativamente estrechos gracias al tamaño de muestra utilizado (\(n=100\)), permiten responder a la pregunta problema en lo referente al bienestar psicológico: los pacientes representados por esta muestra presentan, en la población, niveles moderados de malestar emocional y una satisfacción con la terapia que, si bien no es baja, tampoco alcanza niveles altos, evidenciando un margen de mejora en la calidad percibida del servicio terapéutico.

2. La proporción de pacientes con determinadas características clínicas presenta mayor incertidumbre que las medias estimadas. La proporción poblacional de pacientes con alto apoyo familiar se estimó entre 18.3% y 35.7%, y la de pacientes con diagnóstico de Depresión entre 21.9% y 40.1%. Estos márgenes de error, más amplios en términos relativos que los obtenidos para las medias, cumplen con el objetivo general del trabajo al estimar mediante intervalos de confianza las características clínicas de interés, pero también advierten que, para decisiones de planeación de recursos que dependan críticamente de estos porcentajes, sería conveniente ampliar el tamaño de muestra en estudios futuros.

3. Existe una variabilidad poblacional considerable en el nivel de depresión de los pacientes. El intervalo de confianza del 95% para la desviación estándar poblacional de la depresión, obtenido mediante la distribución \(\chi^2\), se ubicó entre 2.64 y 3.49 puntos. Este hallazgo integra un componente adicional a la pregunta problema, más allá del promedio poblacional: no solo interesa saber cuál es el nivel medio de depresión de la población, sino qué tan heterogéneos son los pacientes entre sí, evidenciando que la depresión se manifiesta de forma bastante diversa y que las estrategias de intervención no deberían asumir un perfil de paciente único.

4. No se encontró evidencia estadística de que la asistencia a terapia esté asociada a un menor nivel de ansiedad en esta muestra. El intervalo de confianza del 95% para la diferencia de medias de ansiedad entre pacientes que asisten a terapia y los que no asisten, \([-1.47 \,;\, 0.71]\), incluye al valor cero, y el tamaño del efecto calculado (d de Cohen \(\approx -0.15\)) resultó muy pequeño. Esto responde parcialmente a la pregunta problema, sugiriendo que la sola asistencia a terapia, sin considerar su frecuencia, duración o el tipo de intervención recibida, no constituye por sí misma un factor claramente diferenciador del nivel de ansiedad en la población de pacientes representada por esta muestra.

5. En conjunto, los cinco parámetros estimados dan una respuesta integral y estadísticamente sustentada al objetivo general del trabajo. Al estimar mediante intervalos de confianza tanto las medias poblacionales de bienestar psicológico como las proporciones de características clínicas relevantes y la variabilidad de la depresión, se logró ir más allá de la simple descripción muestral realizada en la etapa exploratoria previa, generalizando con un nivel de confianza explícito del 95% los hallazgos de los 100 pacientes hacia la población de pacientes atendidos en centros de psicología clínica similares al analizado. Esto permite a este tipo de centros contar con rangos plausibles, y no únicamente estimaciones puntuales, para fundamentar decisiones de planificación de recursos y estrategias de intervención basadas en evidencia estadística.

Resumen

El problema abordado consiste en estimar los parámetros poblacionales asociados al bienestar psicológico y a características clínicas de pacientes de un centro de psicología clínica, determinando entre qué valores plausibles se ubican dichos parámetros en la población representada por la muestra. Se utilizó una base de datos de 100 pacientes, con variables clínicas (ansiedad, depresión y satisfacción con la terapia, escala 1-10) y variables categóricas (apoyo familiar, diagnóstico psicológico). Se estimaron las medias poblacionales de ansiedad, depresión y satisfacción; las proporciones poblacionales de pacientes con alto apoyo familiar y con diagnóstico de Depresión; la varianza poblacional de la depresión; y la diferencia de medias de ansiedad entre pacientes que asisten y no asisten a terapia. Para ello se construyeron intervalos de confianza del 95%, mediante las distribuciones normal, t de Student y chi-cuadrado, calculados manualmente y verificados con las funciones t.test(), prop.test() y qchisq() de R. Los resultados muestran que el nivel promedio de ansiedad poblacional se ubica entre 5.68 y 6.66, la depresión entre 4.84 y 6.04, y la satisfacción entre 4.82 y 5.94; la proporción con diagnóstico de Depresión se estimó entre 21.9% y 40.1%; y no se halló evidencia de diferencia en ansiedad según la asistencia a terapia. Se concluye que el bienestar psicológico de la población de pacientes se ubica en niveles moderados, con estimaciones estadísticamente respaldadas que permiten planificar recursos terapéuticos con base en evidencia.

Palabras clave

Estimación por intervalos de confianza, media poblacional, proporción poblacional, ansiedad y depresión, bienestar psicológico.

Bibliografía

Declaración sobre el uso de Inteligencia Artificial

En cumplimiento de los principios de transparencia académica, el grupo declara lo siguiente en relación con el uso de herramientas de Inteligencia Artificial (IA) durante la elaboración del presente trabajo:

Aspecto Información
Uso de IA Sí
Herramienta Claude (Anthropic), integrada en el entorno de la Universidad del Norte
Finalidad (i) Redacción de secciones textuales del informe, incluyendo el marco teórico, la metodología, la interpretación de resultados, las conclusiones y la presente declaración; (ii) generación y verificación del código en lenguaje R utilizado para el desarrollo matemático y la implementación de los intervalos de confianza; (iii) diseño del formato general del documento en R Markdown; (iv) verificación numérica de los cálculos estadísticos mediante ejecución independiente en Python, contrastando los resultados con las fórmulas desarrolladas manualmente; (v) apoyo en la búsqueda y verificación de antecedentes académicos citados en la introducción y la bibliografía
Porcentaje estimado de utilización 65 %

Se estima que la Inteligencia Artificial participó en aproximadamente el 65% del proceso de elaboración del trabajo, concentrado en la redacción de texto, la generación y verificación del código, y el diseño del documento, mientras que el 35% restante correspondió a las decisiones metodológicas, la selección de variables y parámetros de interés, la ejecución del código en RStudio, la validación de los resultados obtenidos y la responsabilidad final sobre el contenido entregado, las cuales fueron asumidas directamente por los integrantes del grupo.