hllinas2023

1 Paquetes

Primero, debemos instalar, si es necesario, y cargar los paquetes que vamos a utilizar.

library(lsm)        # Para acceder a la base de datos survey
library(knitr)      # Para construir tablas
library(kableExtra) # Para mejorar la presentación de las tablas

2 Introducción

2.0.1 Conceptos básicos

La hipótesis nula, denotada por \(H_0\), representa la afirmación que se somete a evaluación. La hipótesis alternativa, denotada por \(H_1\), expresa la posibilidad que se desea contrastar.

El nivel de significancia se representa mediante \(\alpha\). En este documento se utilizará, salvo indicación contraria,

\[ \alpha=0.05. \]

La regla de decisión basada en el \(p\)-valor es:

  • si \(p\text{-valor}\leq\alpha\), se rechaza \(H_0\);

  • si \(p\text{-valor}>\alpha\), no se rechaza \(H_0\).

No rechazar \(H_0\) no significa demostrar que sea verdadera; únicamente indica que la muestra no proporciona evidencia estadística suficiente para rechazarla.

2.0.2 Argumento para definir el tipo de prueba

Todas las funciones permiten especificar el tipo de hipótesis alternativa mediante el argumento alternative. Este argumento determina si la prueba es bilateral, de cola derecha o de cola izquierda.

Selección del tipo de prueba mediante el argumento alternative.
Valor de alternative Tipo de prueba Hipótesis alternativa
"two.sided" Bilateral \(H_1:\ \theta \neq \theta_0\)
"greater" Cola derecha \(H_1:\ \theta \gt \theta_0\)
"less" Cola izquierda \(H_1:\ \theta \lt \theta_0\)

De acuerdo con el tipo de hipótesis alternativa, en el código de R se escribiría así:

alternative = "two.sided"  # Prueba bilateral
alternative = "greater"    # Prueba de cola derecha
alternative = "less"       # Prueba de cola izquierda

3 Resumen de funciones implementadas

La siguiente tabla resume las funciones desarrolladas en este capítulo y el procedimiento estadístico para el cual fueron diseñadas.

Resumen de las funciones implementadas.
Función Descripción
  1. Funciones auxiliares
Funciones de apoyo para formato numérico, definición de la hipótesis alternativa, cálculo del valor p, decisión de la prueba, conclusión y validación de argumentos.
  1. ph_media_z()
Prueba Z para una media (σ conocida).
  1. ph_media_t()
Prueba t para una media (σ desconocida).
  1. ph_proporcion()
Prueba Z para una proporción.

4 Funciones para pruebas de hipótesis

A continuación se presentan funciones desarrolladas para realizar las pruebas de hipótesis estudiadas en este capítulo. Cada función recibe las estadísticas muestrales necesarias y devuelve una tabla con las hipótesis, el estadístico de prueba, el p-valor, la decisión y una conclusión breve.

# ============================================================
# 1. Funciones auxiliares
# ============================================================

formato_num <- function(x, digitos = 4) {
  format(
    round(x, digitos),
    nsmall = 0,
    trim = TRUE,
    scientific = FALSE
  )
}

nombre_alternativa <- function(alternative) {
  switch(
    alternative,
    "two.sided" = "Bilateral",
    "greater"   = "Cola derecha",
    "less"      = "Cola izquierda"
  )
}

valor_p_normal <- function(estadistico, alternative) {
  switch(
    alternative,
    "two.sided" = 2 * pnorm(-abs(estadistico)),
    "greater"   = pnorm(estadistico, lower.tail = FALSE),
    "less"      = pnorm(estadistico)
  )
}

valor_p_t <- function(estadistico, gl, alternative) {
  switch(
    alternative,
    "two.sided" = 2 * pt(-abs(estadistico), df = gl),
    "greater"   = pt(estadistico, df = gl, lower.tail = FALSE),
    "less"      = pt(estadistico, df = gl)
  )
}

valor_p_chi <- function(estadistico, gl, alternative) {
  switch(
    alternative,
    "two.sided" = min(
      1,
      2 * min(
        pchisq(estadistico, df = gl),
        pchisq(estadistico, df = gl, lower.tail = FALSE)
      )
    ),
    "greater" = pchisq(estadistico, df = gl, lower.tail = FALSE),
    "less"    = pchisq(estadistico, df = gl)
  )
}

valor_p_f <- function(estadistico, gl1, gl2, alternative) {
  switch(
    alternative,
    "two.sided" = min(
      1,
      2 * min(
        pf(estadistico, df1 = gl1, df2 = gl2),
        pf(estadistico, df1 = gl1, df2 = gl2, lower.tail = FALSE)
      )
    ),
    "greater" = pf(
      estadistico,
      df1 = gl1,
      df2 = gl2,
      lower.tail = FALSE
    ),
    "less" = pf(
      estadistico,
      df1 = gl1,
      df2 = gl2
    )
  )
}

decision_prueba <- function(valor_p, alpha) {
  if (valor_p <= alpha) {
    "Rechazar H0"
  } else {
    "No rechazar H0"
  }
}

conclusion_prueba <- function(valor_p, alpha) {
  if (valor_p <= alpha) {
    paste0(
      "Existe evidencia estadística suficiente, al nivel α = ",
      formato_num(alpha),
      ", para apoyar H1"
    )
  } else {
    paste0(
      "No existe evidencia estadística suficiente, al nivel α = ",
      formato_num(alpha),
      ", para apoyar H1"
    )
  }
}

validar_alternativa <- function(alternative) {
  match.arg(alternative, c("two.sided", "greater", "less"))
}


# ============================================================
# 2. Prueba Z para una media con sigma conocida
#    H0: mu = mu0
# ============================================================

ph_media_z <- function(media, sigma, n, mu0,
                       alpha = 0.05,
                       alternative = "two.sided",
                       digitos = 4) {
  
  alternative <- validar_alternativa(alternative)
  
  if (sigma <= 0 || n <= 1) {
    stop("sigma debe ser positiva y n debe ser mayor que 1.")
  }
  
  error_estandar <- sigma / sqrt(n)
  estadistico <- (media - mu0) / error_estandar
  valor_p <- valor_p_normal(estadistico, alternative)
  
  resultado <- data.frame(
    Medida = c(
      "Media muestral",
      "Media bajo H0",
      "σ",
      "n",
      "Error estándar",
      "Tipo de prueba",
      "Nivel de significancia",
      "Estadístico Z",
      "p-valor",
      "Decisión",
      "Conclusión"
    ),
    Valor = c(
      formato_num(media, digitos),
      formato_num(mu0, digitos),
      formato_num(sigma, digitos),
      n,
      formato_num(error_estandar, digitos),
      nombre_alternativa(alternative),
      formato_num(alpha, digitos),
      formato_num(estadistico, digitos),
      formato_num(valor_p, digitos),
      decision_prueba(valor_p, alpha),
      conclusion_prueba(valor_p, alpha)
    ),
    check.names = FALSE
  )
  
  knitr::kable(
    resultado,
    format = "html",
    col.names = c("Medida", "Valor"),
    align = c("l", "r")
  )
}


# ============================================================
# 3. Prueba t para una media con sigma desconocida
#    H0: mu = mu0
# ============================================================

ph_media_t <- function(media, s, n, mu0,
                       alpha = 0.05,
                       alternative = "two.sided",
                       digitos = 4) {
  
  alternative <- validar_alternativa(alternative)
  
  if (s <= 0 || n <= 1) {
    stop("s debe ser positiva y n debe ser mayor que 1.")
  }
  
  gl <- n - 1
  error_estandar <- s / sqrt(n)
  estadistico <- (media - mu0) / error_estandar
  valor_p <- valor_p_t(estadistico, gl, alternative)
  
  resultado <- data.frame(
    Medida = c(
      "Media muestral",
      "Media bajo H0",
      "s",
      "n",
      "Grados de libertad",
      "Error estándar",
      "Tipo de prueba",
      "Nivel de significancia",
      "Estadístico t",
      "p-valor",
      "Decisión",
      "Conclusión"
    ),
    Valor = c(
      formato_num(media, digitos),
      formato_num(mu0, digitos),
      formato_num(s, digitos),
      n,
      gl,
      formato_num(error_estandar, digitos),
      nombre_alternativa(alternative),
      formato_num(alpha, digitos),
      formato_num(estadistico, digitos),
      formato_num(valor_p, digitos),
      decision_prueba(valor_p, alpha),
      conclusion_prueba(valor_p, alpha)
    ),
    check.names = FALSE
  )
  
  knitr::kable(
    resultado,
    format = "html",
    col.names = c("Medida", "Valor"),
    align = c("l", "r")
  )
}


# ============================================================
# 4. Prueba Z para una proporción
#    H0: p = p0
# ============================================================

ph_proporcion <- function(exitos, n, p0,
                          alpha = 0.05,
                          alternative = "two.sided",
                          digitos = 4) {
  
  alternative <- validar_alternativa(alternative)
  
  if (exitos < 0 || exitos > n) {
    stop("El número de éxitos debe estar entre 0 y n.")
  }
  
  if (p0 <= 0 || p0 >= 1) {
    stop("p0 debe estar entre 0 y 1.")
  }
  
  proporcion <- exitos / n
  error_estandar <- sqrt(p0 * (1 - p0) / n)
  estadistico <- (proporcion - p0) / error_estandar
  valor_p <- valor_p_normal(estadistico, alternative)
  
  resultado <- data.frame(
    Medida = c(
      "Éxitos",
      "n",
      "Proporción muestral",
      "Proporción bajo H0",
      "ES bajo H0",
      "Tipo de prueba",
      "Nivel de significancia",
      "Estadístico Z",
      "p-valor",
      "Decisión",
      "Conclusión"
    ),
    Valor = c(
      exitos,
      n,
      formato_num(proporcion, digitos),
      formato_num(p0, digitos),
      formato_num(error_estandar, digitos),
      nombre_alternativa(alternative),
      formato_num(alpha, digitos),
      formato_num(estadistico, digitos),
      formato_num(valor_p, digitos),
      decision_prueba(valor_p, alpha),
      conclusion_prueba(valor_p, alpha)
    ),
    check.names = FALSE
  )
  
  knitr::kable(
    resultado,
    format = "html",
    col.names = c("Medida", "Valor"),
    align = c("l", "r")
  )
}

5 Ejemplos utilizando estadísticas resumidas

En esta sección se presentan ejemplos sencillos a partir de estadísticas resumidas.

5.0.1 Prueba para la media (con \(Z\))

Cuando la desviación estándar poblacional (\(\sigma\)) es conocida, se puede usar la distribución normal estándar para evaluar. En todos los casos se utiliza un nivel de significancia de \(\alpha=0.05\).

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 70 \qquad \text{frente a} \qquad H_1:\ \mu > 70. \]

resultado <- ph_media_z(
  media = 71.8,
  sigma = 8.9,
  n = 100,
  mu0 = 70,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 71.8
Media bajo H0 70
σ 8.9
n 100
Error estándar 0.89
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico Z 2.0225
p-valor 0.0216
Decisión Rechazar H0
Conclusión Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 70 \qquad \text{frente a} \qquad H_1:\ \mu < 70. \]

resultado <- ph_media_z(
  media = 71.8,
  sigma = 8.9,
  n = 100,
  mu0 = 70,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 71.8
Media bajo H0 70
σ 8.9
n 100
Error estándar 0.89
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico Z 2.0225
p-valor 0.9784
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 70 \qquad \text{frente a} \qquad H_1:\ \mu \neq 70. \]

resultado <- ph_media_z(
  media = 71.8,
  sigma = 8.9,
  n = 100,
  mu0 = 70,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 71.8
Media bajo H0 70
σ 8.9
n 100
Error estándar 0.89
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico Z 2.0225
p-valor 0.0431
Decisión Rechazar H0
Conclusión Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

5.0.2 Prueba para la media (con \(t\))

Cuando la desviación estándar poblacional es desconocida y la población es normal, se utiliza la desviación estándar muestral (\(s\)) y la distribución t de Student.

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 50 \qquad \text{frente a} \qquad H_1:\ \mu > 50. \]

resultado <- ph_media_t(
  media = 54,
  s = 15,
  n = 20,
  mu0 = 50,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 54
Media bajo H0 50
s 15
n 20
Grados de libertad 19
Error estándar 3.3541
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico t 1.1926
p-valor 0.1239
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 50 \qquad \text{frente a} \qquad H_1:\ \mu < 50. \]

resultado <- ph_media_t(
  media = 54,
  s = 15,
  n = 20,
  mu0 = 50,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 54
Media bajo H0 50
s 15
n 20
Grados de libertad 19
Error estándar 3.3541
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico t 1.1926
p-valor 0.8761
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 50 \qquad \text{frente a} \qquad H_1:\ \mu \neq 50. \]

resultado <- ph_media_t(
  media = 54,
  s = 15,
  n = 20,
  mu0 = 50,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 54
Media bajo H0 50
s 15
n 20
Grados de libertad 19
Error estándar 3.3541
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico t 1.1926
p-valor 0.2477
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

5.0.3 Prueba para la proporción

Este ejemplo realizamos pruebas de hipótesis relacionadas con una proporción poblacional a partir del número de éxitos observados en una muestra.

1. Prueba de una cola a la derecha

\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]

resultado <- ph_proporcion(
  exitos = 378,
  n = 802,
  p0 = 0.5,
  alpha = 0.1,
  alternative = "greater"
)

resultado
Medida Valor
Éxitos 378
n 802
Proporción muestral 0.4713
Proporción bajo H0 0.5
ES bajo H0 0.0177
Tipo de prueba Cola derecha
Nivel de significancia 0.1
Estadístico Z -1.6243
p-valor 0.9478
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]

resultado <- ph_proporcion(
  exitos = 378,
  n = 802,
  p0 = 0.5,
  alpha = 0.1,
  alternative = "less"
)

resultado
Medida Valor
Éxitos 378
n 802
Proporción muestral 0.4713
Proporción bajo H0 0.5
ES bajo H0 0.0177
Tipo de prueba Cola izquierda
Nivel de significancia 0.1
Estadístico Z -1.6243
p-valor 0.0522
Decisión Rechazar H0
Conclusión Existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]

resultado <- ph_proporcion(
  exitos = 378,
  n = 802,
  p0 = 0.5,
  alpha = 0.1,
  alternative = "two.sided"
)

resultado
Medida Valor
Éxitos 378
n 802
Proporción muestral 0.4713
Proporción bajo H0 0.5
ES bajo H0 0.0177
Tipo de prueba Bilateral
Nivel de significancia 0.1
Estadístico Z -1.6243
p-valor 0.1043
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1

6 Ejemplos utilizando un data frame simulado

En esta sección construiremos un data frame sencillo a partir de vectores definidos manualmente. Posteriormente calcularemos las estadísticas muestrales necesarias y las utilizaremos como argumentos de las funciones definidas anteriormente. Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.

6.0.1 Construcción del data frame

El siguiente código crea un data frame con dos variables cuantitativas (puntaje e edad), una variable dicotómica (fumador) y una variable de agrupación (grupo), la cual identifica las dos muestras que se compararán en algunos de los ejemplos.

grupo <- c(
  rep("Grupo 1",10),
  rep("Grupo 2",10)
)

puntaje <- c(
  72,68,75,70,73,71,69,74,70,72,
  65,63,67,69,64,66,62,68,65,67
)

edad <- c(
  38,42,41,39,40,37,43,40,39,41,
  35,37,34,36,38,35,39,37,36,34
)

fumador <- c(
  "Sí","Sí","No","Sí","No", "Sí","Sí","No","Sí","Sí",
  "No","Sí","No","No","Sí", "No","Sí","No","Sí","No"
)

datos <- data.frame(
  grupo,
  puntaje,
  edad,
  fumador
)

datos
Data frame utilizado en los ejemplos simulados.
grupo puntaje edad fumador
Grupo 1 72 38 Sí
Grupo 1 68 42 Sí
Grupo 1 75 41 No
Grupo 1 70 39 Sí
Grupo 1 73 40 No
Grupo 1 71 37 Sí
Grupo 1 69 43 Sí
Grupo 1 74 40 No
Grupo 1 70 39 Sí
Grupo 1 72 41 Sí
Grupo 2 65 35 No
Grupo 2 63 37 Sí
Grupo 2 67 34 No
Grupo 2 69 36 No
Grupo 2 64 38 Sí
Grupo 2 66 35 No
Grupo 2 62 39 Sí
Grupo 2 68 37 No
Grupo 2 65 36 Sí
Grupo 2 67 34 No

La variable grupo identifica las dos muestras; puntaje y edad son cuantitativas, mientras que fumador toma los valores Si para éxito y No para fracaso.

6.0.2 Prueba para la media (con \(Z\))

Para ilustrar el procedimiento con \(Z\), se calcula la media de \(x\) y se supone conocida una desviación estándar poblacional igual a \(9\).

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 68 \qquad \text{frente a} \qquad H_1:\ \mu > 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_puntaje,
  sigma = 9,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
σ 9
n 20
Error estándar 2.0125
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico Z 0.2485
p-valor 0.4019
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 68 \qquad \text{frente a} \qquad H_1:\ \mu < 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_puntaje,
  sigma = 9,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
σ 9
n 20
Error estándar 2.0125
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico Z 0.2485
p-valor 0.5981
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 68 \qquad \text{frente a} \qquad H_1:\ \mu \neq 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_puntaje,
  sigma = 9,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
σ 9
n 20
Error estándar 2.0125
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico Z 0.2485
p-valor 0.8038
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

6.0.3 Prueba para la media (con \(t\))

Como normalmente la desviación estándar poblacional es desconocida y la población es normal, se estima mediante la desviación estándar muestral del puntaje.

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 68 \qquad \text{frente a} \qquad H_1:\ \mu > 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_puntaje,
  s = s_puntaje,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
s 3.6778
n 20
Grados de libertad 19
Error estándar 0.8224
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico t 0.608
p-valor 0.2752
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 68 \qquad \text{frente a} \qquad H_1:\ \mu < 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_puntaje,
  s = s_puntaje,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
s 3.6778
n 20
Grados de libertad 19
Error estándar 0.8224
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico t 0.608
p-valor 0.7248
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 68 \qquad \text{frente a} \qquad H_1:\ \mu \neq 68. \]

# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_puntaje,
  s = s_puntaje,
  n = n_puntaje,
  mu0 = 68,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 68.5
Media bajo H0 68
s 3.6778
n 20
Grados de libertad 19
Error estándar 0.8224
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico t 0.608
p-valor 0.5504
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

6.0.4 Prueba para una proporción

En este caso, un valor igual a Sí en la variable exito representa un éxito. La suma del número de categorías de esta variable proporciona el número total de éxitos.

1. Prueba de una cola a la derecha

\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]

# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fumador,
  n = n_fumador,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Éxitos 11
n 20
Proporción muestral 0.55
Proporción bajo H0 0.5
ES bajo H0 0.1118
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico Z 0.4472
p-valor 0.3274
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]

# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fumador,
  n = n_fumador,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Éxitos 11
n 20
Proporción muestral 0.55
Proporción bajo H0 0.5
ES bajo H0 0.1118
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico Z 0.4472
p-valor 0.6726
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]

# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fumador,
  n = n_fumador,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Éxitos 11
n 20
Proporción muestral 0.55
Proporción bajo H0 0.5
ES bajo H0 0.1118
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico Z 0.4472
p-valor 0.6547
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

7 Ejemplos utilizando una base de datos

En esta sección se utiliza el conjunto de datos survey del paquete lsm, recopilado mediante una encuesta aplicada a una muestra de estudiantes universitarios. La descripción de sus variables puede consultarse en este enlace (clic aquí).

Las estadísticas resumidas se calcularán directamente a partir de las variables de la base de datos. Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.

7.0.1 Nuestro data frame

Para acceder a la base de datos, hacemos:

#Base de datos
datosCompleto <- lsm::survey

# Para algunos ejemplos de esta sección utilizaremos únicamente las primeras 100 observaciones
df1 <- datosCompleto[1:100,]

# Para otros ejemplos de esta sección utilizaremos únicamente las primeras 29 observaciones
df2 <- datosCompleto[1:29,]

# Dimensión de las dos bases de datos (observaciones, variables)
dim(datosCompleto)
dim(df1)
## Dimensión de la base de datos original: 800 observaciones y 66 variables.
## Dimensión del primer data frame (df1) utilizado en los ejemplos: 100 observaciones y 66 variables.
## Dimensión del segundo data frame (df2) utilizado en los ejemplos: 29 observaciones y 66 variables.

7.0.2 Variables que vamos a utilizar para los ejemplos

En los siguientes ejemplos utilizaremos las variables Age, Gender y School.

  • Age representa la edad del estudiante.

  • Gender tiene las categorías Female y male.

  • School tiene, entre otros, los niveles Private y Public.

7.0.3 Verificar los niveles de las variables seleccionadas

Antes de continuar, se verifican los niveles observados.

unique(df1$Gender)
unique(df1$School)
## Niveles de Gender: Female Male
## Niveles de School: Private Public

7.0.4 Prueba para la media (con \(Z\))

Para ilustrar el procedimiento con \(Z\), se evalúa si la edad media poblacional es igual a 20 años, suponiendo conocida una desviación estándar poblacional de 6 años.

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 20 \qquad \text{frente a} \qquad H_1:\ \mu > 20. \]

# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)] 

# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_edad,
  sigma = 6,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 18.9374
Media bajo H0 20
σ 6
n 100
Error estándar 0.6
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico Z -1.771
p-valor 0.9617
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 20 \qquad \text{frente a} \qquad H_1:\ \mu < 20. \]

# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)] 

# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_edad,
  sigma = 6,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 18.9374
Media bajo H0 20
σ 6
n 100
Error estándar 0.6
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico Z -1.771
p-valor 0.0383
Decisión Rechazar H0
Conclusión Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 20 \qquad \text{frente a} \qquad H_1:\ \mu \neq 20. \]

# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)] 

# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_z(
  media = media_edad,
  sigma = 6,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 18.9374
Media bajo H0 20
σ 6
n 100
Error estándar 0.6
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico Z -1.771
p-valor 0.0766
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

7.0.5 Prueba para la media (con \(t\))

Cuando la desviación estándar poblacional es desconocida y la población es normal, se utiliza la desviación estándar muestral (\(s\)) de la variable Age y la distribución \(t\) de Student.

1. Prueba de una cola a la derecha

\[ H_0:\ \mu \leq 20 \qquad \text{frente a} \qquad H_1:\ \mu > 20. \]

# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)] 

# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_edad,
  s = s_edad,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Media muestral 19.2641
Media bajo H0 20
s 2.0637
n 29
Grados de libertad 28
Error estándar 0.3832
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico t -1.9202
p-valor 0.9675
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ \mu \geq 20 \qquad \text{frente a} \qquad H_1:\ \mu < 20. \]

# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)] 

# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_edad,
  s = s_edad,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Media muestral 19.2641
Media bajo H0 20
s 2.0637
n 29
Grados de libertad 28
Error estándar 0.3832
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico t -1.9202
p-valor 0.0325
Decisión Rechazar H0
Conclusión Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ \mu = 20 \qquad \text{frente a} \qquad H_1:\ \mu \neq 20. \]

# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)] 

# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)

# Realiza la prueba
resultado <- ph_media_t(
  media = media_edad,
  s = s_edad,
  n = n_edad,
  mu0 = 20,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Media muestral 19.2641
Media bajo H0 20
s 2.0637
n 29
Grados de libertad 28
Error estándar 0.3832
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico t -1.9202
p-valor 0.0651
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

7.0.6 Prueba para una proporción

En este ejemplo se estima la proporción poblacional de estudiantes de género Female. El número de éxitos corresponde al número de observaciones clasificadas como Female.

1. Prueba de una cola a la derecha

\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]

# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]

# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fem,
  n = n_fem,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "greater"
)

resultado
Medida Valor
Éxitos 49
n 100
Proporción muestral 0.49
Proporción bajo H0 0.5
ES bajo H0 0.05
Tipo de prueba Cola derecha
Nivel de significancia 0.05
Estadístico Z -0.2
p-valor 0.5793
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

2. Prueba de una cola a la izquierda

\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]

# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]

# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fem,
  n = n_fem,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "less"
)

resultado
Medida Valor
Éxitos 49
n 100
Proporción muestral 0.49
Proporción bajo H0 0.5
ES bajo H0 0.05
Tipo de prueba Cola izquierda
Nivel de significancia 0.05
Estadístico Z -0.2
p-valor 0.4207
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

3. Prueba de dos colas o bilateral

\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]

# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]

# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)

# Realiza la prueba
resultado <- ph_proporcion(
  exitos = total_fem,
  n = n_fem,
  p0 = 0.50,
  alpha = 0.05,
  alternative = "two.sided"
)

resultado
Medida Valor
Éxitos 49
n 100
Proporción muestral 0.49
Proporción bajo H0 0.5
ES bajo H0 0.05
Tipo de prueba Bilateral
Nivel de significancia 0.05
Estadístico Z -0.2
p-valor 0.8415
Decisión No rechazar H0
Conclusión No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1

8 Proyecto: Pruebas de Hipótesis

8.0.1 Tema

Pruebas de hipótesis para uno y dos parámetros.

8.0.2 Objetivo

Aplicar los procedimientos estudiados para formular, ejecutar e interpretar pruebas de hipótesis para medias y proporciones poblacionales utilizando un conjunto de datos real. Asimismo, fortalecer las habilidades para seleccionar muestras, obtener las estadísticas muestrales necesarias a partir de una base de datos y documentar adecuadamente todo el proceso mediante R Markdown.

8.0.3 Base de datos

Utilice el conjunto de datos survey del paquete lsm, empleado durante las clases.

8.0.4 Lineamientos

Los lineamientos generales para la elaboración, entrega y evaluación de esta actividad se encuentran disponibles en:

https://rpubs.com/hllinas/R_Lineamiento_EstInf

No es necesario repetir dichos lineamientos en este documento.

8.0.5 Actividades

  1. Conociendo la base de datos

    Responda las siguientes preguntas:

    1. ¿Cuántas observaciones tiene la base de datos?

    2. ¿Cuántas variables contiene?

    3. Muestre los nombres de todas las variables.

    4. Seleccione:

      • Dos variables cuantitativas que utilizará con el fin de realizar pruebas para la media y la varianza;

      • Dos variables dicotómicas que utilizará con el fin de realizar pruebas para una proporción;

      • una variable categórica con exactamente dos niveles que utilizará para comparar dos poblaciones.

    5. Justifique brevemente la selección realizada.

    Importante:

    • Las variables seleccionadas no podrán ser las mismas utilizadas durante las clases o en los ejemplos de las notas del curso. Cada estudiante deberá elegir un conjunto diferente de variables que cumpla las condiciones anteriores.
  1. Selección de una muestra

    1. Construya un nuevo data frame denominado Muestra1, compuesto por más de 100 observaciones seleccionadas de la base de datos original.

    2. Construya un segundo data frame denominado Muestra2, compuesto por menos de 29 observaciones seleccionadas de la base de datos original.

    3. Todas las estimaciones realizadas en la actividad deberán calcularse utilizando únicamente Muestra1 o Muestra2, según corresponda.

  1. Supuestos

    Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.

  1. Pruebas de hipótesis para un parámetro

    Considere las muestras construidas en el punto 2 y realice las siguientes estimaciones:

    1. Utilizando Muestra1 (muestra grande), realice una prueba de hipótesis sobre la media poblacional, empleando la aproximación basada en la distribución normal.

    2. Utilizando Muestra1 (muestra grande), realice una prueba de hipótesis sobre la media poblacional, empleando la aproximación basada en la distribución normal y utilizando una variable cuantitativa diferente de la empleada en el inciso anterior.

    3. Utilizando Muestra2 (muestra pequeña), realice una prueba de hipótesis sobre la media poblacional, suponiendo que la desviación estándar poblacional es desconocida. Emplee la distribución \(t\) de Student.

    4. Utilizando nuevamente Muestra2, realice otra prueba de hipótesis sobre la media poblacional mediante la distribución \(t\) de Student, utilizando una variable cuantitativa diferente de la empleada en el inciso anterior.

    5. Utilizando Muestra1, realice una prueba de hipótesis sobre una proporción poblacional, a partir de una las variables dicotómicas seleccionadas.

    6. Utilizando Muestra1, realice una prueba de hipótesis sobre una proporción poblacional, a partir de la segunda variable dicotómica seleccionada.

    Para cada prueba:

    • Presente claramente los resultados obtenidos.

    • Identifique el parámetro poblacional que se está evaluando.

    • Presente e interprete los principales elementos del procedimiento: \(H_0\), \(H_1\), estimación puntual, tipo de prueba, p-valor y decisión.

    • Interprete el resultado obtenido en el contexto de la variable y del problema analizado.

    • Organice el desarrollo de acuerdo con la plantilla utilizada en clase: datos, supuestos, conclusión, fórmula, procedimiento, resultados e interpretación.

  1. Comparación entre procedimientos

    A partir de los resultados obtenidos, responda las siguientes preguntas:

    1. ¿Qué diferencias conceptuales y prácticas existen entre una prueba de hipótesis para la media basada en la distribución \(Z\) y una basada en la distribución \(t\) de Student? Explique en qué situaciones resulta apropiado utilizar cada una.

    2. Compare los resultados obtenidos con Muestra1 y Muestra2. ¿Qué efecto parece tener el tamaño de la muestra sobre el error estándar, el estadístico de prueba y el p-valor? Explique a partir de los resultados obtenidos.

    3. ¿Qué diferencias observa entre los valores críticos asociados con las distribuciones \(Z\) y \(t\) de Student? Explique por qué se presentan estas diferencias y qué ocurre con ellas a medida que aumenta el tamaño de la muestra.

    4. Compare las pruebas de hipótesis realizadas para proporciones. ¿Qué diferencias observa en los estadísticos de prueba, los p-valores y las decisiones obtenidas? Explique los resultados en el contexto de las variables analizadas.

  1. Conclusión

    Escriba una conclusión de dos o tres párrafos en la que analice los principales resultados obtenidos en las pruebas de hipótesis realizadas.

    Entre otros aspectos, responda:

    1. ¿Qué conclusiones pueden obtenerse sobre los parámetros poblacionales a partir de las pruebas realizadas?

    2. ¿Qué efecto tuvo el tamaño de la muestra sobre el error estándar, el estadístico de prueba y el p-valor?

    3. ¿Qué diferencias encontró entre los procedimientos basados en las distribuciones \(Z\) y \(t\) de Student?

    4. ¿Qué limitaciones deben tenerse en cuenta al interpretar los resultados de las pruebas de hipótesis realizadas?

8.0.6 Recomendaciones

  • Todas las hipótesis deben escribirse con notación estadística.

  • Todas las tablas deberán estar numeradas y tituladas.

  • Todas las afirmaciones deberán sustentarse con los resultados obtenidos.

  • Todas las decisiones deben justificarse mediante el p-valor y el nivel de significancia.

  • No escriba “se acepta \(H_0\)“; utilice “no se rechaza \(H_0\)”.

  • Muestre el código utilizado para obtener las estadísticas resumidas antes de realizar cada prueba.

  • Justifique cualquier supuesto realizado (por ejemplo, la desviación estándar poblacional utilizada en los procedimientos con el estadístico \(Z\)).

  • El código debe estar comentado y ejecutarse sin errores.

  • Recuerde consultar los lineamientos generales del curso para conocer los requisitos de reproducibilidad, entrega y evaluación.

9 Ejercicios (pruebas de hipótesis para una media)

15. Gasto mensual en servicios de apoyo psicológico

Un informe universitario afirmó que los estudiantes que utilizan servicios particulares de apoyo psicológico gastan, en promedio, 95 mil pesos mensuales en este tipo de atención.

Considerando que este promedio podría ser demasiado alto, un investigador seleccionó una muestra aleatoria de 50 estudiantes y encontró un gasto promedio de 92.25 miles de pesos, con una desviación estándar de 10 miles de pesos.

Con estos resultados, ponga a prueba, con un nivel de significancia de 0.05, la afirmación del informe acerca del gasto promedio mensual.

Además, calcule e interprete el p-valor correspondiente.


16. Puntaje promedio de bienestar psicológico

Un programa de promoción de la salud mental considera que, después de participar en una intervención psicológica, los estudiantes deberían obtener un puntaje promedio de bienestar psicológico de al menos 10 puntos.

Una muestra aleatoria de 15 estudiantes que participaron en el programa presentó un puntaje promedio de 9.5 puntos y una desviación estándar de 0.9 puntos.

Suponiendo que la distribución de los puntajes es normal, determine si existe evidencia de que el puntaje promedio de bienestar psicológico de los estudiantes que participan en el programa es menor de 10 puntos, utilizando un nivel de significancia de 0.01.

Además, calcule e interprete el p-valor correspondiente.


17. Puntaje en una prueba psicológica

Los puntajes, en una escala de 1 a 100, obtenidos por 10 participantes en una prueba psicológica fueron:

\[ 76 \qquad 79 \qquad 85 \qquad 94 \qquad 81 \qquad 43 \qquad 61 \qquad 67 \qquad 70 \qquad 74. \]

Suponga que estos puntajes proceden de una población normal y determine si existe evidencia de que el puntaje promedio de la población es diferente de 70 puntos, utilizando un nivel de significancia de 0.05.

Además, calcule e interprete el p-valor correspondiente.


18. Mejoría porcentual después de una intervención psicológica

Los incrementos porcentuales en un indicador de bienestar psicológico observados en una muestra aleatoria de 8 participantes después de una intervención fueron:

\[ 16.1 \qquad 14.4 \qquad 12.9 \qquad 13.7 \qquad 14.9 \qquad 14.6 \qquad 12.5 \qquad 15.3. \]

Realice una prueba con un nivel de significancia del 5% para determinar si el incremento porcentual promedio del indicador de bienestar psicológico en la población es diferente de 14.

Suponga que la población de valores se distribuye normalmente.

Además, calcule e interprete el p-valor correspondiente.


19. Intervalo de confianza para la mejoría psicológica

Para los datos del ejercicio 18, construya un intervalo del 95% de confianza para el incremento porcentual promedio del indicador de bienestar psicológico en la población.

¿Contiene el intervalo el valor de referencia de 14%?

Compare la conclusión obtenida mediante el intervalo de confianza con la obtenida en la prueba de hipótesis del ejercicio anterior y con el p-valor correspondiente.


20. Tiempo de respuesta en una tarea cognitiva

En una prueba de atención, el tiempo de respuesta de los participantes se distribuye aproximadamente de forma normal, con una media de 800 milisegundos y una desviación estándar de 40 milisegundos.

Se desea determinar si el tiempo promedio de respuesta ha cambiado. Para ello, se selecciona una muestra aleatoria de 30 participantes, obteniéndose un tiempo promedio de respuesta de 788 milisegundos.

Determine si existe evidencia de que el tiempo promedio de respuesta de los participantes es diferente de 800 milisegundos, utilizando un nivel de significancia de 0.04.

Además, calcule e interprete el p-valor correspondiente.


21. Horas promedio de sueño

Una muestra aleatoria de 64 estudiantes universitarios reportó dormir, en promedio, 5.23 horas por noche, con una desviación estándar de 0.24 horas.

Determine si existe evidencia de que el número promedio de horas de sueño por noche de los estudiantes universitarios es menor de 5.5 horas, utilizando un nivel de significancia de 0.05.

Además, calcule e interprete el p-valor correspondiente.


22. Puntaje de resiliencia después de una intervención

En estudios anteriores se ha observado que un determinado grupo de personas presenta un puntaje promedio de resiliencia de 35 puntos. Se plantea que, después de participar en un programa de intervención psicológica, el puntaje promedio podría alcanzar aproximadamente 40 puntos.

Una muestra aleatoria de 64 participantes que realizaron la intervención obtuvo un puntaje promedio de 38 puntos, con una desviación estándar de 5.8 puntos.

Determine si existe evidencia de que el puntaje promedio de resiliencia de las personas que participan en la intervención es menor de 40 puntos, utilizando un nivel de significancia de 0.025.

Además, calcule e interprete el p-valor correspondiente.


23. Puntaje promedio en una escala psicológica

Un investigador desea evaluar si el puntaje promedio de una población en una determinada escala psicológica es igual a 10 puntos.

Los puntajes obtenidos en una muestra aleatoria de 10 participantes fueron:

\[ 10.2 \qquad 9.7 \qquad 10.1 \qquad 10.3 \qquad 10.1 \qquad 9.8 \qquad 9.9 \qquad 10.4 \qquad 10.3 \qquad 9.8. \]

Pruebe la hipótesis de que el puntaje promedio poblacional es de 10 puntos.

Utilice un nivel de significancia de 0.01 y suponga que la distribución de los puntajes es normal.

Además, calcule e interprete el p-valor correspondiente.


24. Tiempo de respuesta en una prueba de atención

En una prueba computarizada de atención se considera como referencia un tiempo promedio de respuesta de 220 milisegundos.

Una muestra aleatoria de 20 participantes presentó un tiempo medio de respuesta de 224 milisegundos y una desviación estándar de 24.5 milisegundos.

¿Sugieren estos resultados, con un nivel de significancia de 0.05, que el tiempo promedio de respuesta de la población es mayor de 220 milisegundos?

Suponga que la distribución de los tiempos de respuesta es normal.

Además, calcule e interprete el p-valor correspondiente.


25. Tiempo para completar una evaluación psicológica

Por experiencia de años anteriores, se sabe que el tiempo requerido por los estudiantes para completar una determinada evaluación psicológica es una variable aleatoria normal con una media de 35 minutos.

Una muestra aleatoria de 20 estudiantes requirió, en promedio, 33.1 minutos para completar la evaluación, con una desviación estándar de 4.3 minutos.

Determine si existe evidencia de que el tiempo promedio requerido por los estudiantes para completar la evaluación psicológica es menor de 35 minutos, utilizando un nivel de significancia de 0.025.

Suponga que la población en cuestión es normal.

Además, calcule e interprete el p-valor correspondiente.


26. Puntaje de estrés académico

En una escala de estrés académico, estudios anteriores indican que los estudiantes universitarios presentan un puntaje promedio de 30 puntos.

Un psicólogo considera que los estudiantes que participan en un programa de manejo del estrés podrían presentar un puntaje promedio menor que este valor.

Para evaluar esta afirmación, se selecciona una muestra aleatoria de 16 estudiantes que participaron en el programa. Al finalizar, se obtiene un puntaje promedio de 27.5 puntos, con una desviación estándar de 4.8 puntos.

Suponga que los puntajes de estrés académico se distribuyen normalmente.

Determine si existe evidencia de que el puntaje promedio de estrés académico de los estudiantes que participan en el programa es menor de 30 puntos, utilizando un nivel de significancia de 0.05.

Calcule el estadístico de prueba y el p-valor correspondiente. Con base en los resultados, formule una conclusión en el contexto del problema.


27. Puntaje promedio de regulación emocional

Un centro de atención psicológica evalúa un programa de intervención antes de adoptarlo de manera general. El centro considera que el verdadero puntaje promedio de regulación emocional después de la intervención debe ser por lo menos de 50 puntos.

Por experiencias anteriores, se considera razonable asumir que la distribución poblacional de los puntajes es normal, con una desviación estándar de 3 puntos.

Para una muestra aleatoria de 9 participantes, el puntaje promedio observado fue de 48.2 puntos.

Contraste, con un nivel de significancia del 10%, la hipótesis nula de que el puntaje promedio poblacional es al menos de 50 puntos.

Además, calcule e interprete el p-valor correspondiente.


28. Cambio en un indicador psicológico

Después de aplicar un nuevo programa de intervención psicológica, se examinaron los cambios observados en un indicador estandarizado de bienestar en 76 participantes seleccionados aleatoriamente.

El cambio promedio observado en la muestra fue de 0.078 y la desviación estándar fue de 0.201.

Contraste, con un nivel de significancia del 10%, la hipótesis nula de que el cambio promedio en la población es 0 frente a una alternativa bilateral.

Además, calcule e interprete el p-valor correspondiente.


29. Puntaje de bienestar psicológico e intervalos de confianza

En una escala de bienestar psicológico, se considera como valor de referencia poblacional un puntaje promedio de 50 puntos.

Un psicólogo desea determinar si los estudiantes que participan en un programa de promoción del bienestar presentan, en promedio, un puntaje superior a este valor de referencia.

Se selecciona una muestra aleatoria de 25 estudiantes que participaron en el programa y se obtiene un puntaje promedio de 52.8 puntos, con una desviación estándar de 8 puntos.

Suponga que los puntajes de bienestar psicológico se distribuyen normalmente.

  1. Determine si existe evidencia de que el puntaje promedio de bienestar psicológico de los estudiantes que participan en el programa es mayor de 50 puntos, utilizando un nivel de significancia de 0.05.

Calcule el estadístico de prueba y el p-valor correspondiente. Interprete el resultado en el contexto del problema.

  1. Construya un intervalo bilateral del 95% de confianza para el puntaje promedio de bienestar psicológico de la población. ¿El intervalo contiene el valor de referencia de 50 puntos?

  2. Construya un intervalo bilateral del 90% de confianza para el puntaje promedio de bienestar psicológico de la población. ¿El intervalo contiene el valor de referencia de 50 puntos?

  3. Compare los resultados obtenidos mediante la prueba de hipótesis y los dos intervalos de confianza. ¿Qué relación observa entre la prueba unilateral realizada con un nivel de significancia del 5% y el intervalo bilateral del 90% de confianza?


30. Tiempo de reacción en una tarea psicológica

Cuando una tarea computarizada de evaluación psicológica funciona correctamente, los participantes presentan un tiempo promedio de reacción de 200 milisegundos.

Una muestra aleatoria de 9 participantes presentó los siguientes tiempos de reacción, en milisegundos:

\[ 208\qquad 201\qquad 197\qquad 203 \qquad 209\qquad 214\qquad 197\qquad 197\qquad 206. \]

Suponiendo que la distribución poblacional es normal, contraste, con un nivel de significancia del 5%, la hipótesis nula de que el tiempo promedio de reacción es de 200 milisegundos frente a una alternativa bilateral.

Además, calcule e interprete el p-valor correspondiente.


31. Efecto de una intervención sobre el tiempo de sueño

Un equipo de psicólogos afirma que una determinada intervención incrementa el tiempo de sueño de los participantes en una media de al menos 50 minutos.

En una muestra de 20 participantes, el incremento promedio observado fue de 41.3 minutos, con una desviación estándar de 12.2 minutos.

Contraste, con un nivel de significancia del 5%, la hipótesis nula de que el incremento medio poblacional es al menos de 50 minutos.

Indique cualquier supuesto necesario para realizar el contraste.

Suponga que la población en cuestión es normal.

Además, calcule e interprete el p-valor correspondiente.


32. Tiempo dedicado a redes sociales

En una población de estudiantes universitarios se considera que el tiempo promedio esperado de uso de redes sociales es de 160 minutos diarios, con una desviación estándar poblacional de 30 minutos.

Se selecciona una muestra aleatoria de 36 estudiantes y se observa un tiempo promedio de uso de 172 minutos diarios.

Utilizando un nivel de significancia de 0.05, determine si existe evidencia de que el tiempo promedio verdadero de uso de redes sociales sea mayor que 160 minutos.

Además, calcule e interprete el p-valor correspondiente.


33. Puntaje promedio de satisfacción con una intervención

Un programa de atención psicológica considera que funciona adecuadamente si produce un puntaje promedio de satisfacción de al menos 2.8 puntos, con una desviación estándar de 0.20 puntos.

Los puntajes más altos se consideran satisfactorios, mientras que los puntajes bajos pueden indicar que es necesario realizar ajustes al programa.

Se selecciona una muestra aleatoria de 25 participantes y se obtiene un puntaje promedio de 2.73 puntos.

Utilizando un nivel de significancia de 0.05, determine si existe evidencia suficiente para considerar que el programa requiere ajustes.

Suponga que la población en cuestión es normal.

Además, calcule e interprete el p-valor correspondiente.


34. Puntaje obtenido después de un programa de entrenamiento cognitivo

Los responsables de un programa de entrenamiento cognitivo aseguran que los participantes que completan el programa alcanzan un puntaje promedio de al menos 140 puntos en una determinada prueba psicológica.

Un grupo de investigadores independientes desea evaluar esta afirmación y mide el puntaje de una muestra aleatoria de 20 participantes que finalizaron recientemente el programa.

Los resultados obtenidos fueron:

\[ 136.7 \qquad 134.1 \qquad 138.8 \qquad 139.1 \qquad 141.8 \qquad 137.3 \qquad 133.5 \qquad 138.2 \qquad 144.4 \qquad 139.2 \]

\[ 136.3 \qquad 135.6 \qquad 138.0 \qquad 140.9 \qquad 140.6 \qquad 141.1 \qquad 139.7 \qquad 136.7 \qquad 137.4 \qquad 140.0 \]

  1. Utilice un nivel de significancia de 0.05 para determinar si existe evidencia de que los responsables del programa están sobreestimando el puntaje promedio alcanzado por los participantes. Calcule e interprete también el p-valor correspondiente.
  1. ¿Cuál sería su respuesta en el inciso (a) si los dos primeros valores fueran 146.7 y 144.1 en lugar de 136.7 y 134.1? Calcule nuevamente el estadístico de prueba y el p-valor correspondiente.

10 Ejercicios (pruebas de hipótesis para una proporción)

35. Preferencia por atención psicológica presencial

Un centro de bienestar universitario afirma que el 40% de los estudiantes prefieren recibir atención psicológica de manera presencial en lugar de utilizar modalidades virtuales.

Para evaluar esta afirmación, se seleccionó una muestra aleatoria de 200 estudiantes universitarios, de los cuales 92 manifestaron preferir la atención psicológica presencial.

Utilizando un nivel de significancia de 0.05, determine si existe evidencia suficiente para concluir que la proporción de estudiantes que prefieren la atención psicológica presencial es diferente del 40%.

Plantee las hipótesis correspondientes, realice la prueba de hipótesis y calcule e interprete el p-valor.


36. Uso de servicios de atención psicológica

Una universidad afirma que una quinta parte de sus estudiantes utiliza algún servicio de atención psicológica durante el semestre.

¿Tenemos razones para dudar de esta afirmación si, en una muestra aleatoria de 1.000 estudiantes, se encuentra que 136 utilizaron estos servicios?

Utilice un nivel de significancia de 0.01.

Plantee las hipótesis correspondientes, realice la prueba y calcule e interprete el p-valor.


37. Síntomas elevados de ansiedad

De una muestra aleatoria de 150 estudiantes universitarios, 50 manifestaron presentar síntomas elevados de ansiedad durante gran parte del día.

Contraste, con un nivel de significancia del 5%, la hipótesis nula de que como máximo el 25% de los estudiantes universitarios presentan estos síntomas.

Además, calcule e interprete el p-valor correspondiente.


38. Desacuerdo con una afirmación sobre atención psicológica

En una muestra aleatoria de 998 estudiantes universitarios, el 17.3% se mostró, en alguna medida, en desacuerdo con la afirmación:

“Todos los estudiantes universitarios deberían participar periódicamente en actividades de promoción de la salud mental.”

Contraste, con un nivel de significancia del 5%, la hipótesis nula de que al menos el 25% de los estudiantes universitarios estarían en desacuerdo con dicha afirmación.

Además, calcule e interprete el p-valor correspondiente.


39. Percepción de estrés académico

De una muestra aleatoria de 199 estudiantes universitarios, 104 se mostraron, en alguna medida, de acuerdo con la afirmación:

“Mi nivel de estrés académico es elevado.”

Contraste, con un nivel de significancia del 10%, la hipótesis nula de que la mitad de los miembros de esta población estarían de acuerdo con esta afirmación.

Además, calcule e interprete el p-valor correspondiente.


40. Participación en programas de bienestar psicológico

De una muestra aleatoria de 172 estudiantes universitarios, 118 afirmaron haberse acogido a programas institucionales de bienestar psicológico durante su permanencia en la universidad.

Contraste la hipótesis nula de que estos programas han sido utilizados por el 75% de los estudiantes frente a la alternativa de que el porcentaje poblacional es menor del 75%.

Utilice un nivel de significancia de 0.05.

Además, calcule e interprete el p-valor correspondiente.


41. Abandono de un programa de intervención psicológica

Los registros históricos de un centro de atención psicológica indican que el 25% de las personas que comienzan un programa de intervención lo abandonan antes de finalizarlo.

Con el propósito de reducir esta proporción, se implementó una nueva estrategia de acompañamiento en una muestra de 150 participantes. Al finalizar el programa, se encontró que 29 de ellos lo habían abandonado.

Para un nivel de significancia de 0.01, determine si existe evidencia de que la proporción de participantes que abandonan el programa con la nueva estrategia es menor que 0.25.

Además, calcule e interprete el p-valor correspondiente.


42. Efectividad de una campaña de promoción de la salud mental

Una universidad desea aumentar la proporción de 0.40 estudiantes que participan en actividades de promoción de la salud mental.

Con este propósito, se diseña y distribuye material informativo sobre los beneficios de estas actividades entre los estudiantes del campus durante una semana.

Posteriormente, se selecciona una muestra aleatoria de 500 estudiantes y 227 de ellos indican haber participado en alguna de las actividades promovidas.

Para un nivel de significancia de 0.05, determine si existe evidencia de que la proporción de participación es mayor que el valor anterior de 0.40.

Además, calcule e interprete el p-valor correspondiente.


43. Uso de estrategias para el manejo del estrés

Un psicólogo afirma que el 30% de los estudiantes universitarios no utiliza ninguna estrategia específica para manejar el estrés académico.

Una muestra de 480 estudiantes indicó que 128 de ellos no utilizan ninguna estrategia para el manejo del estrés.

Pruebe la afirmación del psicólogo utilizando un nivel de significancia de 0.05.

Además, calcule e interprete el p-valor correspondiente.


44. Síntomas persistentes de estrés académico

Un investigador considera que los problemas de bienestar psicológico observados en un grupo de estudiantes podrían estar relacionados con la persistencia del estrés académico y sostiene que al menos el 70% de los estudiantes presentan síntomas de estrés desde hace más de dos meses.

Una muestra aleatoria de 120 estudiantes indica que 78 presentan síntomas de estrés desde hace más de dos meses.

Pruebe la afirmación del investigador con un nivel de significancia de 0.05.

Además, calcule e interprete el p-valor correspondiente.


45. Implementación de un programa de apoyo psicológico

Una universidad planea implementar un programa especial de apoyo psicológico para sus estudiantes y ha establecido que el programa se implementará de manera permanente si más del 15% de los estudiantes manifiestan interés en participar.

En una prueba preliminar realizada con una muestra de 500 estudiantes, 88 manifestaron interés en participar en el programa.

¿Se debe implementar el programa?

Realice una prueba de hipótesis que permita sustentar su decisión, utilizando un nivel de significancia de 0.01.

Calcule e interprete el p-valor correspondiente y formule una conclusión en el contexto del problema.

Anexos

  1. RStudio, R Markdown y R (por lo menos, el capítulo 1): Click derecho aquí.

  2. Lineamientos (actividades de análisis de datos): Click derecho aquí.

  3. Tablas estadísticas: Click derecho aquí.

  4. Tabla de supuestos: Click derecho aquí.

Texto guía

  1. LLinás, H. (2006); Estadística inferencial. Barranquilla: Editorial Universidad del Norte.

Bibliografía complementaria

  1. LLinás, H., Rojas, C. (2005). Estadística descriptiva y distribuciones de probabilidad. Barranquilla: Editorial Universidad del Norte.

  2. Consultar mis notas de clase: Estadística inferencial

  3. Consultar el documento RPubs :: Enlace y materiales de ayuda.

  4. Agresti, A., Franklin, C., & Klingenberg, B. (2018). Statistics: The Art and Science of Learning from Data, 4/E.

  5. Puede consultarse mis siguientes documentos:

 

 
If you found any ERRORS or have SUGGESTIONS, please report them to my email. Thanks.