23/09/26
Abstract
La teoría mencionada puede revisarse en el TEXTO GUÍA o en la BIBLIOGRAFÍA COMPLEMENTARIA. En Rpubs:: toc se pueden ver otros documentos de posible interés.
Primero, debemos instalar, si es necesario, y cargar los paquetes que vamos a utilizar.
library(lsm) # Para acceder a la base de datos survey
library(knitr) # Para construir tablas
library(kableExtra) # Para mejorar la presentación de las tablas
La hipótesis nula, denotada por \(H_0\), representa la afirmación que se somete a evaluación. La hipótesis alternativa, denotada por \(H_1\), expresa la posibilidad que se desea contrastar.
El nivel de significancia se representa mediante \(\alpha\). En este documento se utilizará, salvo indicación contraria,
\[ \alpha=0.05. \]
La regla de decisión basada en el \(p\)-valor es:
si \(p\text{-valor}\leq\alpha\), se rechaza \(H_0\);
si \(p\text{-valor}>\alpha\), no se rechaza \(H_0\).
No rechazar \(H_0\) no significa demostrar que sea verdadera; únicamente indica que la muestra no proporciona evidencia estadística suficiente para rechazarla.
Todas las funciones permiten especificar el tipo de hipótesis
alternativa mediante el argumento alternative. Este
argumento determina si la prueba es bilateral, de cola derecha o de cola
izquierda.
| Valor de alternative | Tipo de prueba | Hipótesis alternativa |
|---|---|---|
"two.sided"
|
Bilateral | \(H_1:\ \theta \neq \theta_0\) |
"greater"
|
Cola derecha | \(H_1:\ \theta \gt \theta_0\) |
"less"
|
Cola izquierda | \(H_1:\ \theta \lt \theta_0\) |
De acuerdo con el tipo de hipótesis alternativa, en el código de R se escribiría así:
alternative = "two.sided" # Prueba bilateral
alternative = "greater" # Prueba de cola derecha
alternative = "less" # Prueba de cola izquierda
La siguiente tabla resume las funciones desarrolladas en este capítulo y el procedimiento estadístico para el cual fueron diseñadas.
| Función | Descripción |
|---|---|
|
Funciones de apoyo para formato numérico, definición de la hipótesis alternativa, cálculo del valor p, decisión de la prueba, conclusión y validación de argumentos. |
|
Prueba Z para una media (σ conocida). |
|
Prueba t para una media (σ desconocida). |
|
Prueba Z para una proporción. |
A continuación se presentan funciones desarrolladas para realizar las pruebas de hipótesis estudiadas en este capítulo. Cada función recibe las estadísticas muestrales necesarias y devuelve una tabla con las hipótesis, el estadístico de prueba, el p-valor, la decisión y una conclusión breve.
# ============================================================
# 1. Funciones auxiliares
# ============================================================
formato_num <- function(x, digitos = 4) {
format(
round(x, digitos),
nsmall = 0,
trim = TRUE,
scientific = FALSE
)
}
nombre_alternativa <- function(alternative) {
switch(
alternative,
"two.sided" = "Bilateral",
"greater" = "Cola derecha",
"less" = "Cola izquierda"
)
}
valor_p_normal <- function(estadistico, alternative) {
switch(
alternative,
"two.sided" = 2 * pnorm(-abs(estadistico)),
"greater" = pnorm(estadistico, lower.tail = FALSE),
"less" = pnorm(estadistico)
)
}
valor_p_t <- function(estadistico, gl, alternative) {
switch(
alternative,
"two.sided" = 2 * pt(-abs(estadistico), df = gl),
"greater" = pt(estadistico, df = gl, lower.tail = FALSE),
"less" = pt(estadistico, df = gl)
)
}
valor_p_chi <- function(estadistico, gl, alternative) {
switch(
alternative,
"two.sided" = min(
1,
2 * min(
pchisq(estadistico, df = gl),
pchisq(estadistico, df = gl, lower.tail = FALSE)
)
),
"greater" = pchisq(estadistico, df = gl, lower.tail = FALSE),
"less" = pchisq(estadistico, df = gl)
)
}
valor_p_f <- function(estadistico, gl1, gl2, alternative) {
switch(
alternative,
"two.sided" = min(
1,
2 * min(
pf(estadistico, df1 = gl1, df2 = gl2),
pf(estadistico, df1 = gl1, df2 = gl2, lower.tail = FALSE)
)
),
"greater" = pf(
estadistico,
df1 = gl1,
df2 = gl2,
lower.tail = FALSE
),
"less" = pf(
estadistico,
df1 = gl1,
df2 = gl2
)
)
}
decision_prueba <- function(valor_p, alpha) {
if (valor_p <= alpha) {
"Rechazar H0"
} else {
"No rechazar H0"
}
}
conclusion_prueba <- function(valor_p, alpha) {
if (valor_p <= alpha) {
paste0(
"Existe evidencia estadística suficiente, al nivel α = ",
formato_num(alpha),
", para apoyar H1"
)
} else {
paste0(
"No existe evidencia estadística suficiente, al nivel α = ",
formato_num(alpha),
", para apoyar H1"
)
}
}
validar_alternativa <- function(alternative) {
match.arg(alternative, c("two.sided", "greater", "less"))
}
# ============================================================
# 2. Prueba Z para una media con sigma conocida
# H0: mu = mu0
# ============================================================
ph_media_z <- function(media, sigma, n, mu0,
alpha = 0.05,
alternative = "two.sided",
digitos = 4) {
alternative <- validar_alternativa(alternative)
if (sigma <= 0 || n <= 1) {
stop("sigma debe ser positiva y n debe ser mayor que 1.")
}
error_estandar <- sigma / sqrt(n)
estadistico <- (media - mu0) / error_estandar
valor_p <- valor_p_normal(estadistico, alternative)
resultado <- data.frame(
Medida = c(
"Media muestral",
"Media bajo H0",
"σ",
"n",
"Error estándar",
"Tipo de prueba",
"Nivel de significancia",
"Estadístico Z",
"p-valor",
"Decisión",
"Conclusión"
),
Valor = c(
formato_num(media, digitos),
formato_num(mu0, digitos),
formato_num(sigma, digitos),
n,
formato_num(error_estandar, digitos),
nombre_alternativa(alternative),
formato_num(alpha, digitos),
formato_num(estadistico, digitos),
formato_num(valor_p, digitos),
decision_prueba(valor_p, alpha),
conclusion_prueba(valor_p, alpha)
),
check.names = FALSE
)
knitr::kable(
resultado,
format = "html",
col.names = c("Medida", "Valor"),
align = c("l", "r")
)
}
# ============================================================
# 3. Prueba t para una media con sigma desconocida
# H0: mu = mu0
# ============================================================
ph_media_t <- function(media, s, n, mu0,
alpha = 0.05,
alternative = "two.sided",
digitos = 4) {
alternative <- validar_alternativa(alternative)
if (s <= 0 || n <= 1) {
stop("s debe ser positiva y n debe ser mayor que 1.")
}
gl <- n - 1
error_estandar <- s / sqrt(n)
estadistico <- (media - mu0) / error_estandar
valor_p <- valor_p_t(estadistico, gl, alternative)
resultado <- data.frame(
Medida = c(
"Media muestral",
"Media bajo H0",
"s",
"n",
"Grados de libertad",
"Error estándar",
"Tipo de prueba",
"Nivel de significancia",
"Estadístico t",
"p-valor",
"Decisión",
"Conclusión"
),
Valor = c(
formato_num(media, digitos),
formato_num(mu0, digitos),
formato_num(s, digitos),
n,
gl,
formato_num(error_estandar, digitos),
nombre_alternativa(alternative),
formato_num(alpha, digitos),
formato_num(estadistico, digitos),
formato_num(valor_p, digitos),
decision_prueba(valor_p, alpha),
conclusion_prueba(valor_p, alpha)
),
check.names = FALSE
)
knitr::kable(
resultado,
format = "html",
col.names = c("Medida", "Valor"),
align = c("l", "r")
)
}
# ============================================================
# 4. Prueba Z para una proporción
# H0: p = p0
# ============================================================
ph_proporcion <- function(exitos, n, p0,
alpha = 0.05,
alternative = "two.sided",
digitos = 4) {
alternative <- validar_alternativa(alternative)
if (exitos < 0 || exitos > n) {
stop("El número de éxitos debe estar entre 0 y n.")
}
if (p0 <= 0 || p0 >= 1) {
stop("p0 debe estar entre 0 y 1.")
}
proporcion <- exitos / n
error_estandar <- sqrt(p0 * (1 - p0) / n)
estadistico <- (proporcion - p0) / error_estandar
valor_p <- valor_p_normal(estadistico, alternative)
resultado <- data.frame(
Medida = c(
"Éxitos",
"n",
"Proporción muestral",
"Proporción bajo H0",
"ES bajo H0",
"Tipo de prueba",
"Nivel de significancia",
"Estadístico Z",
"p-valor",
"Decisión",
"Conclusión"
),
Valor = c(
exitos,
n,
formato_num(proporcion, digitos),
formato_num(p0, digitos),
formato_num(error_estandar, digitos),
nombre_alternativa(alternative),
formato_num(alpha, digitos),
formato_num(estadistico, digitos),
formato_num(valor_p, digitos),
decision_prueba(valor_p, alpha),
conclusion_prueba(valor_p, alpha)
),
check.names = FALSE
)
knitr::kable(
resultado,
format = "html",
col.names = c("Medida", "Valor"),
align = c("l", "r")
)
}
En esta sección se presentan ejemplos sencillos a partir de estadísticas resumidas.
Cuando la desviación estándar poblacional (\(\sigma\)) es conocida, se puede usar la distribución normal estándar para evaluar. En todos los casos se utiliza un nivel de significancia de \(\alpha=0.05\).
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 70 \qquad \text{frente a} \qquad H_1:\ \mu > 70. \]
resultado <- ph_media_z(
media = 71.8,
sigma = 8.9,
n = 100,
mu0 = 70,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 71.8 |
| Media bajo H0 | 70 |
| σ | 8.9 |
| n | 100 |
| Error estándar | 0.89 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico Z | 2.0225 |
| p-valor | 0.0216 |
| Decisión | Rechazar H0 |
| Conclusión | Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 70 \qquad \text{frente a} \qquad H_1:\ \mu < 70. \]
resultado <- ph_media_z(
media = 71.8,
sigma = 8.9,
n = 100,
mu0 = 70,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 71.8 |
| Media bajo H0 | 70 |
| σ | 8.9 |
| n | 100 |
| Error estándar | 0.89 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico Z | 2.0225 |
| p-valor | 0.9784 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 70 \qquad \text{frente a} \qquad H_1:\ \mu \neq 70. \]
resultado <- ph_media_z(
media = 71.8,
sigma = 8.9,
n = 100,
mu0 = 70,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 71.8 |
| Media bajo H0 | 70 |
| σ | 8.9 |
| n | 100 |
| Error estándar | 0.89 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico Z | 2.0225 |
| p-valor | 0.0431 |
| Decisión | Rechazar H0 |
| Conclusión | Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
Cuando la desviación estándar poblacional es desconocida y la población es normal, se utiliza la desviación estándar muestral (\(s\)) y la distribución t de Student.
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 50 \qquad \text{frente a} \qquad H_1:\ \mu > 50. \]
resultado <- ph_media_t(
media = 54,
s = 15,
n = 20,
mu0 = 50,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 54 |
| Media bajo H0 | 50 |
| s | 15 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 3.3541 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico t | 1.1926 |
| p-valor | 0.1239 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 50 \qquad \text{frente a} \qquad H_1:\ \mu < 50. \]
resultado <- ph_media_t(
media = 54,
s = 15,
n = 20,
mu0 = 50,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 54 |
| Media bajo H0 | 50 |
| s | 15 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 3.3541 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico t | 1.1926 |
| p-valor | 0.8761 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 50 \qquad \text{frente a} \qquad H_1:\ \mu \neq 50. \]
resultado <- ph_media_t(
media = 54,
s = 15,
n = 20,
mu0 = 50,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 54 |
| Media bajo H0 | 50 |
| s | 15 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 3.3541 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico t | 1.1926 |
| p-valor | 0.2477 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
Este ejemplo realizamos pruebas de hipótesis relacionadas con una proporción poblacional a partir del número de éxitos observados en una muestra.
1. Prueba de una cola a la derecha
\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]
resultado <- ph_proporcion(
exitos = 378,
n = 802,
p0 = 0.5,
alpha = 0.1,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 378 |
| n | 802 |
| Proporción muestral | 0.4713 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.0177 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.1 |
| Estadístico Z | -1.6243 |
| p-valor | 0.9478 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]
resultado <- ph_proporcion(
exitos = 378,
n = 802,
p0 = 0.5,
alpha = 0.1,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 378 |
| n | 802 |
| Proporción muestral | 0.4713 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.0177 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.1 |
| Estadístico Z | -1.6243 |
| p-valor | 0.0522 |
| Decisión | Rechazar H0 |
| Conclusión | Existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]
resultado <- ph_proporcion(
exitos = 378,
n = 802,
p0 = 0.5,
alpha = 0.1,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 378 |
| n | 802 |
| Proporción muestral | 0.4713 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.0177 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.1 |
| Estadístico Z | -1.6243 |
| p-valor | 0.1043 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.1, para apoyar H1 |
En esta sección construiremos un data frame sencillo a partir de vectores definidos manualmente. Posteriormente calcularemos las estadísticas muestrales necesarias y las utilizaremos como argumentos de las funciones definidas anteriormente. Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.
El siguiente código crea un data frame con dos
variables cuantitativas (puntaje e edad), una
variable dicotómica (fumador) y una variable de agrupación
(grupo), la cual identifica las dos muestras que se
compararán en algunos de los ejemplos.
grupo <- c(
rep("Grupo 1",10),
rep("Grupo 2",10)
)
puntaje <- c(
72,68,75,70,73,71,69,74,70,72,
65,63,67,69,64,66,62,68,65,67
)
edad <- c(
38,42,41,39,40,37,43,40,39,41,
35,37,34,36,38,35,39,37,36,34
)
fumador <- c(
"Sí","Sí","No","Sí","No", "Sí","Sí","No","Sí","Sí",
"No","Sí","No","No","Sí", "No","Sí","No","Sí","No"
)
datos <- data.frame(
grupo,
puntaje,
edad,
fumador
)
datos
| grupo | puntaje | edad | fumador |
|---|---|---|---|
| Grupo 1 | 72 | 38 | Sí |
| Grupo 1 | 68 | 42 | Sí |
| Grupo 1 | 75 | 41 | No |
| Grupo 1 | 70 | 39 | Sí |
| Grupo 1 | 73 | 40 | No |
| Grupo 1 | 71 | 37 | Sí |
| Grupo 1 | 69 | 43 | Sí |
| Grupo 1 | 74 | 40 | No |
| Grupo 1 | 70 | 39 | Sí |
| Grupo 1 | 72 | 41 | Sí |
| Grupo 2 | 65 | 35 | No |
| Grupo 2 | 63 | 37 | Sí |
| Grupo 2 | 67 | 34 | No |
| Grupo 2 | 69 | 36 | No |
| Grupo 2 | 64 | 38 | Sí |
| Grupo 2 | 66 | 35 | No |
| Grupo 2 | 62 | 39 | Sí |
| Grupo 2 | 68 | 37 | No |
| Grupo 2 | 65 | 36 | Sí |
| Grupo 2 | 67 | 34 | No |
La variable grupo identifica las dos muestras;
puntaje y edad son cuantitativas, mientras que
fumador toma los valores Si para éxito y
No para fracaso.
Para ilustrar el procedimiento con \(Z\), se calcula la media de \(x\) y se supone conocida una desviación estándar poblacional igual a \(9\).
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 68 \qquad \text{frente a} \qquad H_1:\ \mu > 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_z(
media = media_puntaje,
sigma = 9,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| σ | 9 |
| n | 20 |
| Error estándar | 2.0125 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.2485 |
| p-valor | 0.4019 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 68 \qquad \text{frente a} \qquad H_1:\ \mu < 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_z(
media = media_puntaje,
sigma = 9,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| σ | 9 |
| n | 20 |
| Error estándar | 2.0125 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.2485 |
| p-valor | 0.5981 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 68 \qquad \text{frente a} \qquad H_1:\ \mu \neq 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_z(
media = media_puntaje,
sigma = 9,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| σ | 9 |
| n | 20 |
| Error estándar | 2.0125 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.2485 |
| p-valor | 0.8038 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
Como normalmente la desviación estándar poblacional es desconocida y la población es normal, se estima mediante la desviación estándar muestral del puntaje.
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 68 \qquad \text{frente a} \qquad H_1:\ \mu > 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_t(
media = media_puntaje,
s = s_puntaje,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| s | 3.6778 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 0.8224 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico t | 0.608 |
| p-valor | 0.2752 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 68 \qquad \text{frente a} \qquad H_1:\ \mu < 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_t(
media = media_puntaje,
s = s_puntaje,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| s | 3.6778 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 0.8224 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico t | 0.608 |
| p-valor | 0.7248 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 68 \qquad \text{frente a} \qquad H_1:\ \mu \neq 68. \]
# Calcula media y tamaño
media_puntaje <- mean(datos$puntaje)
s_puntaje <- sd(datos$puntaje)
n_puntaje <- length(datos$puntaje)
# Realiza la prueba
resultado <- ph_media_t(
media = media_puntaje,
s = s_puntaje,
n = n_puntaje,
mu0 = 68,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 68.5 |
| Media bajo H0 | 68 |
| s | 3.6778 |
| n | 20 |
| Grados de libertad | 19 |
| Error estándar | 0.8224 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico t | 0.608 |
| p-valor | 0.5504 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
En este caso, un valor igual a Sí en la variable exito
representa un éxito. La suma del número de categorías de esta variable
proporciona el número total de éxitos.
1. Prueba de una cola a la derecha
\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]
# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fumador,
n = n_fumador,
p0 = 0.50,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 11 |
| n | 20 |
| Proporción muestral | 0.55 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.1118 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.4472 |
| p-valor | 0.3274 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]
# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fumador,
n = n_fumador,
p0 = 0.50,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 11 |
| n | 20 |
| Proporción muestral | 0.55 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.1118 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.4472 |
| p-valor | 0.6726 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]
# Calcula total de éxitos y tamaño
total_fumador <- sum(datos$fumador == "Sí")
n_fumador <- length(datos$fumador)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fumador,
n = n_fumador,
p0 = 0.50,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 11 |
| n | 20 |
| Proporción muestral | 0.55 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.1118 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico Z | 0.4472 |
| p-valor | 0.6547 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
En esta sección se utiliza el conjunto de datos survey
del paquete lsm, recopilado mediante una encuesta aplicada
a una muestra de estudiantes universitarios. La descripción de sus
variables puede consultarse en este enlace (clic
aquí).
Las estadísticas resumidas se calcularán directamente a partir de las variables de la base de datos. Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.
Para acceder a la base de datos, hacemos:
#Base de datos
datosCompleto <- lsm::survey
# Para algunos ejemplos de esta sección utilizaremos únicamente las primeras 100 observaciones
df1 <- datosCompleto[1:100,]
# Para otros ejemplos de esta sección utilizaremos únicamente las primeras 29 observaciones
df2 <- datosCompleto[1:29,]
# Dimensión de las dos bases de datos (observaciones, variables)
dim(datosCompleto)
dim(df1)
## Dimensión de la base de datos original: 800 observaciones y 66 variables.
## Dimensión del primer data frame (df1) utilizado en los ejemplos: 100 observaciones y 66 variables.
## Dimensión del segundo data frame (df2) utilizado en los ejemplos: 29 observaciones y 66 variables.
En los siguientes ejemplos utilizaremos las variables
Age, Gender y School.
Age representa la edad del estudiante.
Gender tiene las categorías Female y
male.
School tiene, entre otros, los niveles
Private y Public.
Antes de continuar, se verifican los niveles observados.
unique(df1$Gender)
unique(df1$School)
## Niveles de Gender: Female Male
## Niveles de School: Private Public
Para ilustrar el procedimiento con \(Z\), se evalúa si la edad media poblacional es igual a 20 años, suponiendo conocida una desviación estándar poblacional de 6 años.
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 20 \qquad \text{frente a} \qquad H_1:\ \mu > 20. \]
# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)]
# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_z(
media = media_edad,
sigma = 6,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 18.9374 |
| Media bajo H0 | 20 |
| σ | 6 |
| n | 100 |
| Error estándar | 0.6 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico Z | -1.771 |
| p-valor | 0.9617 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 20 \qquad \text{frente a} \qquad H_1:\ \mu < 20. \]
# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)]
# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_z(
media = media_edad,
sigma = 6,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 18.9374 |
| Media bajo H0 | 20 |
| σ | 6 |
| n | 100 |
| Error estándar | 0.6 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico Z | -1.771 |
| p-valor | 0.0383 |
| Decisión | Rechazar H0 |
| Conclusión | Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 20 \qquad \text{frente a} \qquad H_1:\ \mu \neq 20. \]
# Elimina los valores perdidos (NA)
edad <- df1$Age[!is.na(df1$Age)]
# Calcula media y tamaño
media_edad <- mean(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_z(
media = media_edad,
sigma = 6,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 18.9374 |
| Media bajo H0 | 20 |
| σ | 6 |
| n | 100 |
| Error estándar | 0.6 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico Z | -1.771 |
| p-valor | 0.0766 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
Cuando la desviación estándar poblacional es desconocida y la
población es normal, se utiliza la desviación estándar muestral (\(s\)) de la variable Age y la
distribución \(t\) de Student.
1. Prueba de una cola a la derecha
\[ H_0:\ \mu \leq 20 \qquad \text{frente a} \qquad H_1:\ \mu > 20. \]
# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)]
# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_t(
media = media_edad,
s = s_edad,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 19.2641 |
| Media bajo H0 | 20 |
| s | 2.0637 |
| n | 29 |
| Grados de libertad | 28 |
| Error estándar | 0.3832 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico t | -1.9202 |
| p-valor | 0.9675 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ \mu \geq 20 \qquad \text{frente a} \qquad H_1:\ \mu < 20. \]
# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)]
# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_t(
media = media_edad,
s = s_edad,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 19.2641 |
| Media bajo H0 | 20 |
| s | 2.0637 |
| n | 29 |
| Grados de libertad | 28 |
| Error estándar | 0.3832 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico t | -1.9202 |
| p-valor | 0.0325 |
| Decisión | Rechazar H0 |
| Conclusión | Existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ \mu = 20 \qquad \text{frente a} \qquad H_1:\ \mu \neq 20. \]
# Elimina los valores perdidos (NA)
edad <- df2$Age[!is.na(df2$Age)]
# Calcula media, desviación y tamaño
media_edad <- mean(edad)
s_edad <- sd(edad)
n_edad <- length(edad)
# Realiza la prueba
resultado <- ph_media_t(
media = media_edad,
s = s_edad,
n = n_edad,
mu0 = 20,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Media muestral | 19.2641 |
| Media bajo H0 | 20 |
| s | 2.0637 |
| n | 29 |
| Grados de libertad | 28 |
| Error estándar | 0.3832 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico t | -1.9202 |
| p-valor | 0.0651 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
En este ejemplo se estima la proporción poblacional de estudiantes de
género Female. El número de éxitos corresponde al número de
observaciones clasificadas como Female.
1. Prueba de una cola a la derecha
\[ H_0:\ p \leq 0.5 \qquad \text{frente a} \qquad H_1:\ p > 0.5. \]
# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]
# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fem,
n = n_fem,
p0 = 0.50,
alpha = 0.05,
alternative = "greater"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 49 |
| n | 100 |
| Proporción muestral | 0.49 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.05 |
| Tipo de prueba | Cola derecha |
| Nivel de significancia | 0.05 |
| Estadístico Z | -0.2 |
| p-valor | 0.5793 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
2. Prueba de una cola a la izquierda
\[ H_0:\ p \geq 0.5 \qquad \text{frente a} \qquad H_1:\ p < 0.5. \]
# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]
# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fem,
n = n_fem,
p0 = 0.50,
alpha = 0.05,
alternative = "less"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 49 |
| n | 100 |
| Proporción muestral | 0.49 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.05 |
| Tipo de prueba | Cola izquierda |
| Nivel de significancia | 0.05 |
| Estadístico Z | -0.2 |
| p-valor | 0.4207 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
3. Prueba de dos colas o bilateral
\[ H_0:\ p = 0.5 \qquad \text{frente a} \qquad H_1:\ p \neq 0.5. \]
# Elimina los valores perdidos (NA)
genero <- df1$Gender[!is.na(df1$Gender)]
# Calcula número de estudiantes de género Female (éxitos) y tamaño total de la muestra.
total_fem <- sum(genero == "Female")
n_fem <- length(genero)
# Realiza la prueba
resultado <- ph_proporcion(
exitos = total_fem,
n = n_fem,
p0 = 0.50,
alpha = 0.05,
alternative = "two.sided"
)
resultado
| Medida | Valor |
|---|---|
| Éxitos | 49 |
| n | 100 |
| Proporción muestral | 0.49 |
| Proporción bajo H0 | 0.5 |
| ES bajo H0 | 0.05 |
| Tipo de prueba | Bilateral |
| Nivel de significancia | 0.05 |
| Estadístico Z | -0.2 |
| p-valor | 0.8415 |
| Decisión | No rechazar H0 |
| Conclusión | No existe evidencia estadística suficiente, al nivel α = 0.05, para apoyar H1 |
Pruebas de hipótesis para uno y dos parámetros.
Aplicar los procedimientos estudiados para formular, ejecutar e interpretar pruebas de hipótesis para medias y proporciones poblacionales utilizando un conjunto de datos real. Asimismo, fortalecer las habilidades para seleccionar muestras, obtener las estadísticas muestrales necesarias a partir de una base de datos y documentar adecuadamente todo el proceso mediante R Markdown.
Utilice el conjunto de datos survey del
paquete lsm, empleado durante las
clases.
Los lineamientos generales para la elaboración, entrega y evaluación de esta actividad se encuentran disponibles en:
https://rpubs.com/hllinas/R_Lineamiento_EstInf
No es necesario repetir dichos lineamientos en este documento.
Conociendo la base de datos
Responda las siguientes preguntas:
¿Cuántas observaciones tiene la base de datos?
¿Cuántas variables contiene?
Muestre los nombres de todas las variables.
Seleccione:
Dos variables cuantitativas que utilizará con el fin de realizar pruebas para la media y la varianza;
Dos variables dicotómicas que utilizará con el fin de realizar pruebas para una proporción;
una variable categórica con exactamente dos niveles que utilizará para comparar dos poblaciones.
Justifique brevemente la selección realizada.
Importante:
Selección de una muestra
Construya un nuevo data frame denominado
Muestra1, compuesto por más de 100
observaciones seleccionadas de la base de datos original.
Construya un segundo data frame denominado
Muestra2, compuesto por menos de 29
observaciones seleccionadas de la base de datos original.
Todas las estimaciones realizadas en la actividad deberán
calcularse utilizando únicamente Muestra1
o Muestra2, según corresponda.
Supuestos
Suponga, en todos los casos, que las variables cuantitativas poblacionales seleccionadas siguen una distribución normal.
Pruebas de hipótesis para un parámetro
Considere las muestras construidas en el punto 2 y realice las siguientes estimaciones:
Utilizando Muestra1 (muestra
grande), realice una prueba de hipótesis sobre la media
poblacional, empleando la aproximación basada en la
distribución normal.
Utilizando Muestra1 (muestra
grande), realice una prueba de hipótesis sobre la media
poblacional, empleando la aproximación basada en la
distribución normal y utilizando una variable cuantitativa
diferente de la empleada en el inciso anterior.
Utilizando Muestra2 (muestra
pequeña), realice una prueba de hipótesis sobre la media
poblacional, suponiendo que la desviación estándar poblacional es
desconocida. Emplee la distribución \(t\) de Student.
Utilizando nuevamente Muestra2,
realice otra prueba de hipótesis sobre la media poblacional
mediante la distribución \(t\) de
Student, utilizando una variable cuantitativa diferente de la empleada
en el inciso anterior.
Utilizando Muestra1, realice una
prueba de hipótesis sobre una proporción poblacional, a partir de una
las variables dicotómicas seleccionadas.
Utilizando Muestra1, realice una
prueba de hipótesis sobre una proporción poblacional, a partir de la
segunda variable dicotómica seleccionada.
Para cada prueba:
Presente claramente los resultados obtenidos.
Identifique el parámetro poblacional que se está evaluando.
Presente e interprete los principales elementos del procedimiento: \(H_0\), \(H_1\), estimación puntual, tipo de prueba, p-valor y decisión.
Interprete el resultado obtenido en el contexto de la variable y del problema analizado.
Organice el desarrollo de acuerdo con la plantilla utilizada en clase: datos, supuestos, conclusión, fórmula, procedimiento, resultados e interpretación.
Comparación entre procedimientos
A partir de los resultados obtenidos, responda las siguientes preguntas:
¿Qué diferencias conceptuales y prácticas existen entre una prueba de hipótesis para la media basada en la distribución \(Z\) y una basada en la distribución \(t\) de Student? Explique en qué situaciones resulta apropiado utilizar cada una.
Compare los resultados obtenidos con
Muestra1 y
Muestra2. ¿Qué efecto parece tener el
tamaño de la muestra sobre el error estándar, el estadístico de prueba y
el p-valor? Explique a partir de los resultados obtenidos.
¿Qué diferencias observa entre los valores críticos asociados con las distribuciones \(Z\) y \(t\) de Student? Explique por qué se presentan estas diferencias y qué ocurre con ellas a medida que aumenta el tamaño de la muestra.
Compare las pruebas de hipótesis realizadas para proporciones. ¿Qué diferencias observa en los estadísticos de prueba, los p-valores y las decisiones obtenidas? Explique los resultados en el contexto de las variables analizadas.
Conclusión
Escriba una conclusión de dos o tres párrafos en la que analice los principales resultados obtenidos en las pruebas de hipótesis realizadas.
Entre otros aspectos, responda:
¿Qué conclusiones pueden obtenerse sobre los parámetros poblacionales a partir de las pruebas realizadas?
¿Qué efecto tuvo el tamaño de la muestra sobre el error estándar, el estadístico de prueba y el p-valor?
¿Qué diferencias encontró entre los procedimientos basados en las distribuciones \(Z\) y \(t\) de Student?
¿Qué limitaciones deben tenerse en cuenta al interpretar los resultados de las pruebas de hipótesis realizadas?
Todas las hipótesis deben escribirse con notación estadística.
Todas las tablas deberán estar numeradas y tituladas.
Todas las afirmaciones deberán sustentarse con los resultados obtenidos.
Todas las decisiones deben justificarse mediante el p-valor y el nivel de significancia.
No escriba “se acepta \(H_0\)“; utilice “no se rechaza \(H_0\)”.
Muestre el código utilizado para obtener las estadísticas resumidas antes de realizar cada prueba.
Justifique cualquier supuesto realizado (por ejemplo, la desviación estándar poblacional utilizada en los procedimientos con el estadístico \(Z\)).
El código debe estar comentado y ejecutarse sin errores.
Recuerde consultar los lineamientos generales del curso para conocer los requisitos de reproducibilidad, entrega y evaluación.
Un informe universitario afirmó que los estudiantes que utilizan servicios particulares de apoyo psicológico gastan, en promedio, 95 mil pesos mensuales en este tipo de atención.
Considerando que este promedio podría ser demasiado alto, un investigador seleccionó una muestra aleatoria de 50 estudiantes y encontró un gasto promedio de 92.25 miles de pesos, con una desviación estándar de 10 miles de pesos.
Con estos resultados, ponga a prueba, con un nivel de significancia de 0.05, la afirmación del informe acerca del gasto promedio mensual.
Además, calcule e interprete el p-valor correspondiente.
Un programa de promoción de la salud mental considera que, después de participar en una intervención psicológica, los estudiantes deberían obtener un puntaje promedio de bienestar psicológico de al menos 10 puntos.
Una muestra aleatoria de 15 estudiantes que participaron en el programa presentó un puntaje promedio de 9.5 puntos y una desviación estándar de 0.9 puntos.
Suponiendo que la distribución de los puntajes es normal, determine si existe evidencia de que el puntaje promedio de bienestar psicológico de los estudiantes que participan en el programa es menor de 10 puntos, utilizando un nivel de significancia de 0.01.
Además, calcule e interprete el p-valor correspondiente.
Los puntajes, en una escala de 1 a 100, obtenidos por 10 participantes en una prueba psicológica fueron:
\[ 76 \qquad 79 \qquad 85 \qquad 94 \qquad 81 \qquad 43 \qquad 61 \qquad 67 \qquad 70 \qquad 74. \]
Suponga que estos puntajes proceden de una población normal y determine si existe evidencia de que el puntaje promedio de la población es diferente de 70 puntos, utilizando un nivel de significancia de 0.05.
Además, calcule e interprete el p-valor correspondiente.
Los incrementos porcentuales en un indicador de bienestar psicológico observados en una muestra aleatoria de 8 participantes después de una intervención fueron:
\[ 16.1 \qquad 14.4 \qquad 12.9 \qquad 13.7 \qquad 14.9 \qquad 14.6 \qquad 12.5 \qquad 15.3. \]
Realice una prueba con un nivel de significancia del 5% para determinar si el incremento porcentual promedio del indicador de bienestar psicológico en la población es diferente de 14.
Suponga que la población de valores se distribuye normalmente.
Además, calcule e interprete el p-valor correspondiente.
Para los datos del ejercicio 18, construya un intervalo del 95% de confianza para el incremento porcentual promedio del indicador de bienestar psicológico en la población.
¿Contiene el intervalo el valor de referencia de 14%?
Compare la conclusión obtenida mediante el intervalo de confianza con la obtenida en la prueba de hipótesis del ejercicio anterior y con el p-valor correspondiente.
En una prueba de atención, el tiempo de respuesta de los participantes se distribuye aproximadamente de forma normal, con una media de 800 milisegundos y una desviación estándar de 40 milisegundos.
Se desea determinar si el tiempo promedio de respuesta ha cambiado. Para ello, se selecciona una muestra aleatoria de 30 participantes, obteniéndose un tiempo promedio de respuesta de 788 milisegundos.
Determine si existe evidencia de que el tiempo promedio de respuesta de los participantes es diferente de 800 milisegundos, utilizando un nivel de significancia de 0.04.
Además, calcule e interprete el p-valor correspondiente.
Una muestra aleatoria de 64 estudiantes universitarios reportó dormir, en promedio, 5.23 horas por noche, con una desviación estándar de 0.24 horas.
Determine si existe evidencia de que el número promedio de horas de sueño por noche de los estudiantes universitarios es menor de 5.5 horas, utilizando un nivel de significancia de 0.05.
Además, calcule e interprete el p-valor correspondiente.
En estudios anteriores se ha observado que un determinado grupo de personas presenta un puntaje promedio de resiliencia de 35 puntos. Se plantea que, después de participar en un programa de intervención psicológica, el puntaje promedio podría alcanzar aproximadamente 40 puntos.
Una muestra aleatoria de 64 participantes que realizaron la intervención obtuvo un puntaje promedio de 38 puntos, con una desviación estándar de 5.8 puntos.
Determine si existe evidencia de que el puntaje promedio de resiliencia de las personas que participan en la intervención es menor de 40 puntos, utilizando un nivel de significancia de 0.025.
Además, calcule e interprete el p-valor correspondiente.
Un investigador desea evaluar si el puntaje promedio de una población en una determinada escala psicológica es igual a 10 puntos.
Los puntajes obtenidos en una muestra aleatoria de 10 participantes fueron:
\[ 10.2 \qquad 9.7 \qquad 10.1 \qquad 10.3 \qquad 10.1 \qquad 9.8 \qquad 9.9 \qquad 10.4 \qquad 10.3 \qquad 9.8. \]
Pruebe la hipótesis de que el puntaje promedio poblacional es de 10 puntos.
Utilice un nivel de significancia de 0.01 y suponga que la distribución de los puntajes es normal.
Además, calcule e interprete el p-valor correspondiente.
En una prueba computarizada de atención se considera como referencia un tiempo promedio de respuesta de 220 milisegundos.
Una muestra aleatoria de 20 participantes presentó un tiempo medio de respuesta de 224 milisegundos y una desviación estándar de 24.5 milisegundos.
¿Sugieren estos resultados, con un nivel de significancia de 0.05, que el tiempo promedio de respuesta de la población es mayor de 220 milisegundos?
Suponga que la distribución de los tiempos de respuesta es normal.
Además, calcule e interprete el p-valor correspondiente.
Por experiencia de años anteriores, se sabe que el tiempo requerido por los estudiantes para completar una determinada evaluación psicológica es una variable aleatoria normal con una media de 35 minutos.
Una muestra aleatoria de 20 estudiantes requirió, en promedio, 33.1 minutos para completar la evaluación, con una desviación estándar de 4.3 minutos.
Determine si existe evidencia de que el tiempo promedio requerido por los estudiantes para completar la evaluación psicológica es menor de 35 minutos, utilizando un nivel de significancia de 0.025.
Suponga que la población en cuestión es normal.
Además, calcule e interprete el p-valor correspondiente.
En una escala de estrés académico, estudios anteriores indican que los estudiantes universitarios presentan un puntaje promedio de 30 puntos.
Un psicólogo considera que los estudiantes que participan en un programa de manejo del estrés podrían presentar un puntaje promedio menor que este valor.
Para evaluar esta afirmación, se selecciona una muestra aleatoria de 16 estudiantes que participaron en el programa. Al finalizar, se obtiene un puntaje promedio de 27.5 puntos, con una desviación estándar de 4.8 puntos.
Suponga que los puntajes de estrés académico se distribuyen normalmente.
Determine si existe evidencia de que el puntaje promedio de estrés académico de los estudiantes que participan en el programa es menor de 30 puntos, utilizando un nivel de significancia de 0.05.
Calcule el estadístico de prueba y el p-valor correspondiente. Con base en los resultados, formule una conclusión en el contexto del problema.
Un centro de atención psicológica evalúa un programa de intervención antes de adoptarlo de manera general. El centro considera que el verdadero puntaje promedio de regulación emocional después de la intervención debe ser por lo menos de 50 puntos.
Por experiencias anteriores, se considera razonable asumir que la distribución poblacional de los puntajes es normal, con una desviación estándar de 3 puntos.
Para una muestra aleatoria de 9 participantes, el puntaje promedio observado fue de 48.2 puntos.
Contraste, con un nivel de significancia del 10%, la hipótesis nula de que el puntaje promedio poblacional es al menos de 50 puntos.
Además, calcule e interprete el p-valor correspondiente.
Después de aplicar un nuevo programa de intervención psicológica, se examinaron los cambios observados en un indicador estandarizado de bienestar en 76 participantes seleccionados aleatoriamente.
El cambio promedio observado en la muestra fue de 0.078 y la desviación estándar fue de 0.201.
Contraste, con un nivel de significancia del 10%, la hipótesis nula de que el cambio promedio en la población es 0 frente a una alternativa bilateral.
Además, calcule e interprete el p-valor correspondiente.
En una escala de bienestar psicológico, se considera como valor de referencia poblacional un puntaje promedio de 50 puntos.
Un psicólogo desea determinar si los estudiantes que participan en un programa de promoción del bienestar presentan, en promedio, un puntaje superior a este valor de referencia.
Se selecciona una muestra aleatoria de 25 estudiantes que participaron en el programa y se obtiene un puntaje promedio de 52.8 puntos, con una desviación estándar de 8 puntos.
Suponga que los puntajes de bienestar psicológico se distribuyen normalmente.
Calcule el estadístico de prueba y el p-valor correspondiente. Interprete el resultado en el contexto del problema.
Construya un intervalo bilateral del 95% de confianza para el puntaje promedio de bienestar psicológico de la población. ¿El intervalo contiene el valor de referencia de 50 puntos?
Construya un intervalo bilateral del 90% de confianza para el puntaje promedio de bienestar psicológico de la población. ¿El intervalo contiene el valor de referencia de 50 puntos?
Compare los resultados obtenidos mediante la prueba de hipótesis y los dos intervalos de confianza. ¿Qué relación observa entre la prueba unilateral realizada con un nivel de significancia del 5% y el intervalo bilateral del 90% de confianza?
Cuando una tarea computarizada de evaluación psicológica funciona correctamente, los participantes presentan un tiempo promedio de reacción de 200 milisegundos.
Una muestra aleatoria de 9 participantes presentó los siguientes tiempos de reacción, en milisegundos:
\[ 208\qquad 201\qquad 197\qquad 203 \qquad 209\qquad 214\qquad 197\qquad 197\qquad 206. \]
Suponiendo que la distribución poblacional es normal, contraste, con un nivel de significancia del 5%, la hipótesis nula de que el tiempo promedio de reacción es de 200 milisegundos frente a una alternativa bilateral.
Además, calcule e interprete el p-valor correspondiente.
Un equipo de psicólogos afirma que una determinada intervención incrementa el tiempo de sueño de los participantes en una media de al menos 50 minutos.
En una muestra de 20 participantes, el incremento promedio observado fue de 41.3 minutos, con una desviación estándar de 12.2 minutos.
Contraste, con un nivel de significancia del 5%, la hipótesis nula de que el incremento medio poblacional es al menos de 50 minutos.
Indique cualquier supuesto necesario para realizar el contraste.
Suponga que la población en cuestión es normal.
Además, calcule e interprete el p-valor correspondiente.
Un programa de atención psicológica considera que funciona adecuadamente si produce un puntaje promedio de satisfacción de al menos 2.8 puntos, con una desviación estándar de 0.20 puntos.
Los puntajes más altos se consideran satisfactorios, mientras que los puntajes bajos pueden indicar que es necesario realizar ajustes al programa.
Se selecciona una muestra aleatoria de 25 participantes y se obtiene un puntaje promedio de 2.73 puntos.
Utilizando un nivel de significancia de 0.05, determine si existe evidencia suficiente para considerar que el programa requiere ajustes.
Suponga que la población en cuestión es normal.
Además, calcule e interprete el p-valor correspondiente.
Los responsables de un programa de entrenamiento cognitivo aseguran que los participantes que completan el programa alcanzan un puntaje promedio de al menos 140 puntos en una determinada prueba psicológica.
Un grupo de investigadores independientes desea evaluar esta afirmación y mide el puntaje de una muestra aleatoria de 20 participantes que finalizaron recientemente el programa.
Los resultados obtenidos fueron:
\[ 136.7 \qquad 134.1 \qquad 138.8 \qquad 139.1 \qquad 141.8 \qquad 137.3 \qquad 133.5 \qquad 138.2 \qquad 144.4 \qquad 139.2 \]
\[ 136.3 \qquad 135.6 \qquad 138.0 \qquad 140.9 \qquad 140.6 \qquad 141.1 \qquad 139.7 \qquad 136.7 \qquad 137.4 \qquad 140.0 \]
Un centro de bienestar universitario afirma que el 40% de los estudiantes prefieren recibir atención psicológica de manera presencial en lugar de utilizar modalidades virtuales.
Para evaluar esta afirmación, se seleccionó una muestra aleatoria de 200 estudiantes universitarios, de los cuales 92 manifestaron preferir la atención psicológica presencial.
Utilizando un nivel de significancia de 0.05, determine si existe evidencia suficiente para concluir que la proporción de estudiantes que prefieren la atención psicológica presencial es diferente del 40%.
Plantee las hipótesis correspondientes, realice la prueba de hipótesis y calcule e interprete el p-valor.
Una universidad afirma que una quinta parte de sus estudiantes utiliza algún servicio de atención psicológica durante el semestre.
¿Tenemos razones para dudar de esta afirmación si, en una muestra aleatoria de 1.000 estudiantes, se encuentra que 136 utilizaron estos servicios?
Utilice un nivel de significancia de 0.01.
Plantee las hipótesis correspondientes, realice la prueba y calcule e interprete el p-valor.
De una muestra aleatoria de 150 estudiantes universitarios, 50 manifestaron presentar síntomas elevados de ansiedad durante gran parte del día.
Contraste, con un nivel de significancia del 5%, la hipótesis nula de que como máximo el 25% de los estudiantes universitarios presentan estos síntomas.
Además, calcule e interprete el p-valor correspondiente.
En una muestra aleatoria de 998 estudiantes universitarios, el 17.3% se mostró, en alguna medida, en desacuerdo con la afirmación:
“Todos los estudiantes universitarios deberían participar periódicamente en actividades de promoción de la salud mental.”
Contraste, con un nivel de significancia del 5%, la hipótesis nula de que al menos el 25% de los estudiantes universitarios estarían en desacuerdo con dicha afirmación.
Además, calcule e interprete el p-valor correspondiente.
De una muestra aleatoria de 199 estudiantes universitarios, 104 se mostraron, en alguna medida, de acuerdo con la afirmación:
“Mi nivel de estrés académico es elevado.”
Contraste, con un nivel de significancia del 10%, la hipótesis nula de que la mitad de los miembros de esta población estarían de acuerdo con esta afirmación.
Además, calcule e interprete el p-valor correspondiente.
De una muestra aleatoria de 172 estudiantes universitarios, 118 afirmaron haberse acogido a programas institucionales de bienestar psicológico durante su permanencia en la universidad.
Contraste la hipótesis nula de que estos programas han sido utilizados por el 75% de los estudiantes frente a la alternativa de que el porcentaje poblacional es menor del 75%.
Utilice un nivel de significancia de 0.05.
Además, calcule e interprete el p-valor correspondiente.
Los registros históricos de un centro de atención psicológica indican que el 25% de las personas que comienzan un programa de intervención lo abandonan antes de finalizarlo.
Con el propósito de reducir esta proporción, se implementó una nueva estrategia de acompañamiento en una muestra de 150 participantes. Al finalizar el programa, se encontró que 29 de ellos lo habían abandonado.
Para un nivel de significancia de 0.01, determine si existe evidencia de que la proporción de participantes que abandonan el programa con la nueva estrategia es menor que 0.25.
Además, calcule e interprete el p-valor correspondiente.
Una universidad desea aumentar la proporción de 0.40 estudiantes que participan en actividades de promoción de la salud mental.
Con este propósito, se diseña y distribuye material informativo sobre los beneficios de estas actividades entre los estudiantes del campus durante una semana.
Posteriormente, se selecciona una muestra aleatoria de 500 estudiantes y 227 de ellos indican haber participado en alguna de las actividades promovidas.
Para un nivel de significancia de 0.05, determine si existe evidencia de que la proporción de participación es mayor que el valor anterior de 0.40.
Además, calcule e interprete el p-valor correspondiente.
Un psicólogo afirma que el 30% de los estudiantes universitarios no utiliza ninguna estrategia específica para manejar el estrés académico.
Una muestra de 480 estudiantes indicó que 128 de ellos no utilizan ninguna estrategia para el manejo del estrés.
Pruebe la afirmación del psicólogo utilizando un nivel de significancia de 0.05.
Además, calcule e interprete el p-valor correspondiente.
Un investigador considera que los problemas de bienestar psicológico observados en un grupo de estudiantes podrían estar relacionados con la persistencia del estrés académico y sostiene que al menos el 70% de los estudiantes presentan síntomas de estrés desde hace más de dos meses.
Una muestra aleatoria de 120 estudiantes indica que 78 presentan síntomas de estrés desde hace más de dos meses.
Pruebe la afirmación del investigador con un nivel de significancia de 0.05.
Además, calcule e interprete el p-valor correspondiente.
Una universidad planea implementar un programa especial de apoyo psicológico para sus estudiantes y ha establecido que el programa se implementará de manera permanente si más del 15% de los estudiantes manifiestan interés en participar.
En una prueba preliminar realizada con una muestra de 500 estudiantes, 88 manifestaron interés en participar en el programa.
¿Se debe implementar el programa?
Realice una prueba de hipótesis que permita sustentar su decisión, utilizando un nivel de significancia de 0.01.
Calcule e interprete el p-valor correspondiente y formule una conclusión en el contexto del problema.
RStudio, R Markdown y R (por lo menos, el capítulo 1): Click derecho aquí.
Lineamientos (actividades de análisis de datos): Click derecho aquí.
Tablas estadísticas: Click derecho aquí.
Tabla de supuestos: Click derecho aquí.
LLinás, H., Rojas, C. (2005). Estadística descriptiva y distribuciones de probabilidad. Barranquilla: Editorial Universidad del Norte.
Consultar mis notas de clase: Estadística inferencial
Consultar el documento RPubs :: Enlace y materiales de ayuda.
Agresti, A., Franklin, C., & Klingenberg, B. (2018). Statistics: The Art and Science of Learning from Data, 4/E.
Puede consultarse mis siguientes documentos:
If you found any ERRORS or have SUGGESTIONS, please report them to my email. Thanks.