x <- 22 # Número de personas que desarrollaron hemorragia gástrica
n <- 2450 # Tamaño de la muestra
p_hat <- x / n
p_hat[1] 0.008979592
Bioestadística Fundamental y Estadística Fundamental para las Ciencias de la Salud
Este documento presenta la solución paso a paso, en R, de los ejercicios de refuerzo del Módulo 6 (Inferencia Estadística).
Resumen: de 2.450 personas que tomaron aspirina en dosis bajas durante 10 años, 22 desarrollaron hemorragia gástrica. Se pide una estimación puntual de la probabilidad (proporción poblacional) de este evento.
Solución
x <- 22 # Número de personas que desarrollaron hemorragia gástrica
n <- 2450 # Tamaño de la muestra
p_hat <- x / n
p_hat[1] 0.008979592
El estimador puntual natural de una proporción poblacional \(p\) es la proporción muestral \(\hat{p} = x/n\), donde \(x\) es el número de “éxitos” (en este caso, casos de hemorragia gástrica) y \(n\) es el tamaño de la muestra. Aquí simplemente dividimos 22 entre 2450; no se requiere ninguna función especial de R, solo la operación aritmética x / n.
Interpretación: la probabilidad estimada de desarrollar una hemorragia gástrica bajo un régimen de aspirina en dosis bajas durante 10 años es \(\hat{p} \approx 0.00898\), es decir, aproximadamente 0.9 %. Al ser una estimación puntual, no informa sobre la incertidumbre asociada; para eso se necesitaría un intervalo de confianza (como los que se construyen en la siguiente sección).
Resumen: de 18.365 mujeres de 40 a 50 años examinadas en un “screening”, 36 tenían cáncer de mama en estadio inicial.
Solución
x <- 36 # Número de mujeres con cáncer de mama incipiente
n <- 18365 # Tamaño de la muestra
p_hat <- x / n
p_hat[1] 0.00196025
Igual que en el ejercicio anterior, x almacena el número de casos positivos y n el tamaño muestral; p_hat es la razón x / n, el estimador puntual de máxima verosimilitud de la proporción poblacional para un modelo Bernoulli/Binomial.
Interpretación: la probabilidad estimada de que una mujer entre 40 y 50 años tenga cáncer de mama en estadio inicial es \(\hat{p} \approx 0.00196\), es decir, cerca del 0.2 %. Es una estimación puntual; para cuantificar la incertidumbre habría que acompañarla de un intervalo de confianza.
Resumen: una solución de 200 cc contiene \(N\) bacteriófagos desconocidos. Se reparten 5 cc en 25 cultivos; 8 de ellos no muestran inhibición (es decir, no recibieron ningún bacteriófago). Se pide estimar \(N\).
Solución
Si \(\lambda\) es el número esperado de bacteriófagos por cultivo, y cada cultivo recibe en promedio \(5/200\) de la solución total, entonces \(\lambda = N \cdot (5/200) = 0.025N\). Bajo un modelo de Poisson, la probabilidad de que un cultivo no reciba ningún bacteriófago es \(P(X=0) = e^{-\lambda}\). Igualamos esta probabilidad teórica a la proporción observada de cultivos sin inhibición (\(8/25\)) y despejamos \(N\).
n_cultivos <- 25
sin_inhibicion <- 8
p0_observada <- sin_inhibicion / n_cultivos
p0_observada[1] 0.32
p0_observada es la proporción muestral de cultivos que no mostraron trazas de inhibición, es decir, la estimación empírica de \(P(X = 0) = e^{-\lambda}\).
lambda_hat <- -log(p0_observada)
lambda_hat[1] 1.139434
Como \(e^{-\lambda} = 0.32\), despejamos \(\lambda = -\ln(0.32)\). La función log() en R calcula el logaritmo natural (base \(e\)); con el signo negativo obtenemos \(\lambda\).
N_hat <- lambda_hat / 0.025
N_hat[1] 45.57737
Finalmente, como \(\lambda = 0.025N\), despejamos \(N = \lambda / 0.025\). El resultado se redondea al entero más cercano, ya que \(N\) representa un número de partículas.
Interpretación: el número estimado de bacteriófagos en la solución de 200 cc es \(N \approx 46\). Es una estimación puntual basada en igualar la probabilidad teórica de “cero bacteriófagos” bajo Poisson con la proporción observada de cultivos sin inhibición.
Resumen: \(n = 5\) lecturas de microgramos de partículas por metro cúbico: 58, 70, 57, 61, 59; se sabe que \(\sigma^2 = 9\) (población normal). Se piden los IC del 95 % y del 90 % para \(\mu\).
Solución
datos <- c(58, 70, 57, 61, 59)
x_bar <- mean(datos)
x_bar[1] 61
mean(datos) calcula el promedio aritmético del vector datos, es decir, \(\bar{x} = \frac{1}{n}\sum x_i\); es el estimador puntual de \(\mu\).
n <- length(datos)
sigma <- sqrt(9) # Desviación estándar poblacional conocida
alpha_95 <- 1 - 0.95
z_95 <- qnorm(1 - alpha_95/2)
z_95[1] 1.959964
length(datos) cuenta el número de observaciones del vector, es decir, \(n\). La variable sigma es la desviación estándar poblacional, conocida de antemano (\(\sigma = \sqrt{9} = 3\)). qnorm(p) es la función cuantil de la distribución normal estándar: devuelve el valor \(z\) tal que \(P(Z \le z) = p\). Como necesitamos dejar \(\alpha/2 = 0.025\) en cada cola para un IC del 95 %, pedimos el cuantil \(1 - \alpha/2 = 0.975\), que corresponde a \(z_{0.975} \approx 1.96\).
IC_95 <- x_bar + c(-1, 1) * z_95 * sigma / sqrt(n)
IC_95[1] 58.37043 63.62957
El vector c(-1, 1) genera simultáneamente el límite inferior y superior: \(\bar{x} - z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\) y \(\bar{x} + z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\). Esta es la fórmula del intervalo de confianza para la media con varianza poblacional conocida.
alpha_90 <- 1 - 0.90
z_90 <- qnorm(1 - alpha_90/2)
IC_90 <- x_bar + c(-1, 1) * z_90 * sigma / sqrt(n)
IC_90[1] 58.7932 63.2068
Repetimos el mismo procedimiento cambiando el nivel de confianza a 90 %, con lo cual \(\alpha/2 = 0.05\) y \(z_{0.95} \approx 1.645\).
Interpretación: con 95 % de confianza, el número medio de microgramos de partículas por metro cúbico está entre 58.37 y 63.63; con 90 % de confianza, está entre 58.79 y 63.21. Como se esperaría, el intervalo del 90 % es más angosto que el del 95 %, porque se exige menor nivel de confianza a cambio de mayor precisión.
Resumen: \(n = 100\), \(\bar{x} = 23\) min, \(s = 10\) min. Se pide un IC del 90 % para \(\mu\).
Solución
n <- 100
x_bar <- 23
s <- 10Aquí los estadísticos ya vienen dados en el enunciado (no se dispone de los datos individuales), así que los definimos directamente como valores conocidos.
alpha <- 1 - 0.90
t_c <- qt(1 - alpha/2, df = n - 1)
t_c[1] 1.660391
qt(p, df) es la función cuantil de la distribución t de Student: devuelve el valor \(t\) tal que \(P(T \le t) = p\), para una t con df grados de libertad. Como la varianza poblacional es desconocida y se estima con \(s\), usamos la distribución t en lugar de la normal. El argumento df = n - 1 son los grados de libertad de la t, que se pierden uno porque \(s\) se calculó a partir de la misma muestra que \(\bar{x}\).
IC_90 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_90[1] 21.33961 24.66039
Interpretación: con 90 % de confianza, el tiempo medio de espera en el centro de salud está entre 21.34 y 24.67 minutos aproximadamente.
Resumen: \(n = 9\), \(\bar{x} = 7\) min, \(s = 2\) min. IC del 95 % para \(\mu\).
Solución
n <- 9
x_bar <- 7
s <- 2
t_c <- qt(0.975, df = n - 1)
t_c[1] 2.306004
Pedimos directamente el cuantil 0.975 de la t con \(n-1=8\) grados de libertad, ya que \(1-\alpha/2 = 1-0.025=0.975\) para un 95 % de confianza.
IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95[1] 5.462664 8.537336
Interpretación: el intervalo de confianza del 95 % para el tiempo medio requerido por este tipo de pacientes es aproximadamente (5.46, 8.54) minutos.
Resumen: \(n = 9\) observaciones de libras de nitrógeno por granja y día. IC del 99 % para \(\mu\).
Solución
nitrogeno <- c(4.9, 5.8, 5.9, 6.5, 5.5, 5.0, 5.6, 6.0, 5.7)
x_bar <- mean(nitrogeno)
s <- sd(nitrogeno)
n <- length(nitrogeno)
x_bar[1] 5.655556
s[1] 0.4927248
sd() calcula la desviación estándar muestral \(s = \sqrt{\frac{1}{n-1}\sum (x_i - \bar{x})^2}\) (con denominador \(n-1\), el estimador insesgado de \(\sigma\)).
t_c <- qt(0.995, df = n - 1)
t_c[1] 3.355387
IC_99 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_99[1] 5.104461 6.206650
Para un 99 % de confianza, \(1-\alpha/2 = 0.995\).
Función de atajo — t.test():
t.test(nitrogeno, conf.level = 0.99)$conf.int[1] 5.104461 6.206650
attr(,"conf.level")
[1] 0.99
t.test() ejecuta internamente el mismo cálculo (prueba t de una muestra) y, con el argumento conf.level = 0.99, devuelve directamente el intervalo de confianza al 99 % dentro de $conf.int, que debe coincidir (salvo redondeo) con el calculado manualmente.
Interpretación: con 99 % de confianza, la producción media de nitrógeno por granja y día está entre aproximadamente 5.11 y 6.21 libras.
Resumen: \(n = 16\) mediciones de calibre (pulgadas). IC del 95 % para \(\mu\).
Solución
calibre <- c(2.3, 1.9, 1.7, 2.1, 1.5, 1.8, 1.8, 1.1,
2.1, 1.5, 2.0, 1.6, 1.3, 1.6, 1.5, 1.3)
x_bar <- mean(calibre)
s <- sd(calibre)
n <- length(calibre)
t_c <- qt(0.975, df = n - 1)
IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95[1] 1.517053 1.870447
Función de atajo:
t.test(calibre, conf.level = 0.95)$conf.int[1] 1.517053 1.870447
attr(,"conf.level")
[1] 0.95
Interpretación: con 95 % de confianza, el calibre medio de los árboles del vivero está entre aproximadamente 1.52 y 1.87 pulgadas.
Resumen: \(n = 40\), \(\bar{x} = 60\) qq/ha, \(\sigma^2 = 25\) (qq/ha)\(^2\). IC del 95 % y 99 % para \(\mu\).
Solución
n <- 40
x_bar <- 60
sigma <- sqrt(25)
z_95 <- qnorm(0.975)
IC_95 <- x_bar + c(-1, 1) * z_95 * sigma / sqrt(n)
IC_95[1] 58.45051 61.54949
Como se conoce la varianza poblacional (no se estima con \(s\)), usamos el cuantil normal qnorm() en vez del cuantil t.
z_99 <- qnorm(0.995)
IC_99 <- x_bar + c(-1, 1) * z_99 * sigma / sqrt(n)
IC_99[1] 57.96363 62.03637
Interpretación: con 95 % de confianza el rendimiento medio del maíz está entre 58.45 y 61.55 qq/ha; con 99 % de confianza, el intervalo se amplía a (57.96, 62.04) qq/ha, reflejando el compromiso entre confianza y precisión.
Resumen: \(n = 10\) concentraciones de bilirrubina. IC del 95 % para \(\mu\).
Solución
bilirrubina <- c(20.5, 14.8, 21.3, 12.7, 15.2,
26.6, 23.4, 22.9, 15.7, 19.2)
x_bar <- mean(bilirrubina)
s <- sd(bilirrubina)
n <- length(bilirrubina)
t_c <- qt(0.975, df = n - 1)
IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95[1] 16.01274 22.44726
Función de atajo:
t.test(bilirrubina, conf.level = 0.95)$conf.int[1] 16.01274 22.44726
attr(,"conf.level")
[1] 0.95
Interpretación: con 95 % de confianza, la concentración media de bilirrubina en suero para este tipo de pacientes está entre aproximadamente 16.01 y 22.45.
Resumen: \(n = 350\), \(x = 167\) casos de hipertensión. IC del 95 % para \(p\).
Solución
x <- 167
n <- 350
p_hat <- x / n
p_hat[1] 0.4771429
z <- qnorm(0.975)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)
IC_95 <- p_hat + c(-1, 1) * z * error_estandar
IC_95[1] 0.4248154 0.5294703
error_estandar calcula \(\sqrt{\hat{p}(1-\hat{p})/n}\), el error estándar del estimador \(\hat{p}\) bajo la aproximación normal para proporciones. Se multiplica por el cuantil z (aquí \(z_{0.975}\approx1.96\)) para formar el margen de error, que se suma y resta a \(\hat{p}\).
Función de atajo — prop.test():
prop.test(x, n, conf.level = 0.95, correct = FALSE)$conf.int[1] 0.4253478 0.5294343
attr(,"conf.level")
[1] 0.95
prop.test() realiza una prueba/IC de proporción; el argumento correct = FALSE desactiva la corrección de continuidad de Yates para que el cálculo sea comparable con la fórmula clásica de Wald usada manualmente (por defecto prop.test() usa una fórmula ligeramente distinta —basada en el método de Wilson con corrección—, por lo que el resultado puede diferir levemente del cálculo manual).
Interpretación: con 95 % de confianza, entre el 42.5 % y el 53 % de las personas mayores de 65 años en la Comunidad Valenciana son hipertensas.
Resumen: \(n = 140\), \(\hat{p} = 0.35\). IC del 95 % para \(p\).
Solución
n <- 140
p_hat <- 0.35
z <- qnorm(0.975)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)
IC_95 <- p_hat + c(-1, 1) * z * error_estandar
IC_95[1] 0.2709913 0.4290087
Interpretación: con 95 % de confianza, entre el 27.1 % y el 43 % de los pacientes asmáticos tendrían reacciones positivas de la piel al polvo de casa.
Resumen: \(n = 80\), \(\hat{p} = 0.35\). IC del 99 % para \(p\).
Solución
n <- 80
p_hat <- 0.35
z <- qnorm(0.995)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)
IC_99 <- p_hat + c(-1, 1) * z * error_estandar
IC_99[1] 0.2126392 0.4873608
Interpretación: con 99 % de confianza, la proporción de miopes en la población está entre 21.3 % y 48.7 %. El intervalo es bastante ancho debido al tamaño de muestra relativamente pequeño (n = 80) combinado con un nivel de confianza alto.
Resumen: \(n = 325\), \(x = 295\) niñas. IC del 99 % para \(p\).
Solución
x <- 295
n <- 325
p_hat <- x / n
z <- qnorm(0.995)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)
IC_99 <- p_hat + c(-1, 1) * z * error_estandar
IC_99[1] 0.8663339 0.9490507
Función de atajo:
prop.test(x, n, conf.level = 0.99, correct = FALSE)$conf.int[1] 0.8577886 0.9412829
attr(,"conf.level")
[1] 0.99
Interpretación: con 99 % de confianza, entre el 86.6 % y el 94.9 % de los bebés nacidos con el método XSORT serían niñas, lo que sugiere que el método efectivamente incrementa la probabilidad de concebir una niña respecto al 50 % esperado sin intervención.
Resumen: \(n = 10\), \(s = 0.0125\) g (normalidad verificada gráficamente). IC del 95 % para \(\sigma\).
Solución
Base R no incluye una función de atajo para el intervalo de confianza de una varianza o desviación estándar de una sola muestra, así que construimos —como en el módulo original— una función propia basada en la distribución chi-cuadrado.
n <- 10
s <- 0.0125
alpha <- 1 - 0.95
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)
chi2_lower[1] 19.02277
chi2_upper[1] 2.700389
qchisq(p, df, lower.tail = FALSE) es la función cuantil de la distribución chi-cuadrado con df grados de libertad, pero usando la cola superior: devuelve el valor \(\chi^2\) tal que \(P(X > \chi^2) = p\). Con lower.tail = FALSE, pedir p = alpha/2 da el cuantil \(\chi^2_{n-1,\, \alpha/2}\) (extremo derecho de la distribución, usado en el denominador del límite inferior del IC), y pedir p = 1-alpha/2 da \(\chi^2_{n-1,\, 1-\alpha/2}\) (extremo izquierdo, usado en el límite superior).
IC_var <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_var[1] 7.392457e-05 5.207582e-04
IC_sd <- sqrt(IC_var)
IC_sd[1] 0.00859794 0.02282013
La fórmula del IC para la varianza es \(\left[\frac{(n-1)s^2}{\chi^2_{n-1,\alpha/2}}, \frac{(n-1)s^2}{\chi^2_{n-1,1-\alpha/2}}\right]\); para obtener el IC de la desviación estándar basta con tomar raíz cuadrada de cada límite (sqrt()).
Interpretación: con 95 % de confianza, la desviación estándar de los pesos de los centavos fabricados con el nuevo equipo está entre aproximadamente 0.0086 y 0.0202 g.
Resumen: \(n = 9\) observaciones de toneladas métricas de sal por semana. a) IC del 90 % para \(\mu\). b) IC del 90 % para \(\sigma^2\) y \(\sigma\).
Solución
sal <- c(3900, 3875, 3820, 3860, 3840, 3852, 3800, 3825, 3790)
x_bar <- mean(sal)
s <- sd(sal)
n <- length(sal)
x_bar[1] 3840.222
s[1] 35.52034
a) IC para la media
t_c <- qt(0.95, df = n - 1)
IC_media_90 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_media_90[1] 3818.205 3862.239
Como \(1 - \alpha/2 = 1 - 0.05 = 0.95\) para un IC del 90 %.
Función de atajo:
t.test(sal, conf.level = 0.90)$conf.int[1] 3818.205 3862.239
attr(,"conf.level")
[1] 0.9
b) IC para la varianza y la desviación estándar
alpha <- 1 - 0.90
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)
IC_var_90 <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_var_90[1] 650.890 3693.706
IC_sd_90 <- sqrt(IC_var_90)
IC_sd_90[1] 25.51255 60.77586
Interpretación: con 90 % de confianza, el número medio de toneladas de sal usadas por semana está entre 3818.2 y 3862.2. La varianza poblacional está entre aproximadamente 650.9 y 3693.7 (toneladas)\(^2\), y la desviación estándar entre 25.5 y 60.8 toneladas —un intervalo bastante amplio para la desviación, señal de la alta incertidumbre con solo 9 observaciones.
Resumen: \(n = 20\) observaciones de espesor (angstroms). a) IC del 95 % para \(\mu\). b) IC del 95 % para \(\sigma\).
Solución
membrana <- c(80, 90, 85, 82, 75, 58, 70, 84, 87, 81,
87, 61, 73, 84, 85, 70, 78, 95, 77, 52)
x_bar <- mean(membrana)
s <- sd(membrana)
n <- length(membrana)
x_bar[1] 77.7
s[1] 11.0506
a) IC para la media
t_c <- qt(0.975, df = n - 1)
IC_media_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_media_95[1] 72.52816 82.87184
Función de atajo:
t.test(membrana, conf.level = 0.95)$conf.int[1] 72.52816 82.87184
attr(,"conf.level")
[1] 0.95
b) IC para la desviación estándar
alpha <- 1 - 0.95
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)
IC_var_95 <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_sd_95 <- sqrt(IC_var_95)
IC_sd_95[1] 8.403876 16.140195
Interpretación: con 95 % de confianza, el espesor medio de la membrana celular está entre aproximadamente 72.5 y 82.9 angstroms, y la desviación estándar poblacional del espesor está entre 8.4 y 16.1 angstroms.
Resumen: hembras: \(n_1=25\), \(\bar{x}_1=205\), \(s_1=100\); machos: \(n_2=11\), \(\bar{x}_2=135\), \(s_2=95\). IC del 90 % para \(\mu_1-\mu_2\), suponiendo varianzas iguales.
Solución
n1 <- 25; x_bar1 <- 205; s1 <- 100
n2 <- 11; x_bar2 <- 135; s2 <- 95
s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2[1] 9713.235
s_p2 es la varianza combinada (pooled) \(s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1+n_2-2}\), que promedia las dos varianzas muestrales ponderando por sus grados de libertad; se usa cuando se asume que ambas poblaciones tienen la misma varianza.
t_c <- qt(0.95, df = n1 + n2 - 2)
IC_90 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_90[1] 9.703652 130.296348
Los grados de libertad de la t son \(n_1+n_2-2\) (se pierden dos, uno por cada media estimada). La fórmula del IC es \((\bar{x}_1-\bar{x}_2) \pm t_{n_1+n_2-2,\,1-\alpha/2}\sqrt{s_p^2\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}\).
Interpretación: con 90 % de confianza, la diferencia entre la distancia media recorrida por hembras y machos está entre aproximadamente 9.7 y 130.3 metros. Como el intervalo no contiene el cero, hay evidencia de que las hembras recorren, en promedio, una distancia mayor que los machos en busca de alimento.
Resumen: salicilato solo: \(n_1=9\), \(\bar{x}_1=16\), \(s_1=10.1\); salicilato + azatioprina: \(n_2=9\), \(\bar{x}_2=15\), \(s_2=10\). IC del 95 % para \(\mu_1-\mu_2\).
Solución
n1 <- 9; x_bar1 <- 16; s1 <- 10.1
n2 <- 9; x_bar2 <- 15; s2 <- 10
s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2[1] 101.005
t_c <- qt(0.975, df = n1 + n2 - 2)
IC_95 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_95[1] -9.04342 11.04342
Interpretación: con 95 % de confianza, la diferencia en los tiempos medios de supervivencia entre los dos tratamientos está entre aproximadamente -9.04 y 11.04 días. Como el intervalo incluye el cero, no hay evidencia suficiente de que uno de los dos tratamientos prolongue la supervivencia más que el otro.
Resumen: varones: \(n_1=96\), \(\bar{x}_1=167.16\), \(s_1=30\); mujeres: \(n_2=85\), \(\bar{x}_2=178.12\), \(s_2=32\). IC del 98 % para \(\mu_1-\mu_2\).
Solución
n1 <- 96; x_bar1 <- 167.16; s1 <- 30
n2 <- 85; x_bar2 <- 178.12; s2 <- 32
s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2[1] 958.1899
t_c <- qt(0.99, df = n1 + n2 - 2)
IC_98 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_98[1] -21.781807 -0.138193
Para un 98 % de confianza, \(1-\alpha/2 = 0.99\).
Interpretación: con 98 % de confianza, la diferencia entre el nivel medio de colesterol de varones y mujeres (varones \(-\) mujeres) está entre aproximadamente -21.78 y -0.14 mg/dL. Como todo el intervalo es negativo (no incluye el cero), hay evidencia de que las mujeres de este grupo de edad tienen, en promedio, un nivel de colesterol más alto que los varones.
Resumen: nadadoras: \(n_1=10\), \(\bar{x}_1=27.3\), \(s_1=1.9\); corredoras: \(n_2=12\), \(\bar{x}_2=23.5\), \(s_2=1.7\). IC del 90 % para \(\mu_1-\mu_2\).
Solución
n1 <- 10; x_bar1 <- 27.3; s1 <- 1.9
n2 <- 12; x_bar2 <- 23.5; s2 <- 1.7
s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2[1] 3.214
t_c <- qt(0.95, df = n1 + n2 - 2)
IC_90 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_90[1] 2.47608 5.12392
Interpretación: con 90 % de confianza, la diferencia entre la circunferencia media del brazo de nadadoras y corredoras está entre aproximadamente 2.48 y 5.12 cm. Como el intervalo es completamente positivo, hay evidencia de que las nadadoras tienen, en promedio, mayor circunferencia braquial que las corredoras.
Resumen: Anturane: \(n_1=733\), \(x_1=13\) muertes; placebo: \(n_2=742\), \(x_2=29\) muertes. IC del 95 % para \(p_1-p_2\).
Solución
n1 <- 733; x1 <- 13 # Grupo Anturane
n2 <- 742; x2 <- 29 # Grupo placebo
p1_hat <- x1 / n1
p2_hat <- x2 / n2
p1_hat[1] 0.01773533
p2_hat[1] 0.03908356
z <- qnorm(0.975)
error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)
IC_95 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_95[1] -0.038251823 -0.004444625
El error estándar de la diferencia de dos proporciones muestrales independientes es \(\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}\), que suma las varianzas de cada proporción (independencia entre las dos muestras).
Función de atajo:
prop.test(c(x1, x2), c(n1, n2), correct = FALSE)$conf.int[1] -0.038251823 -0.004444625
attr(,"conf.level")
[1] 0.95
prop.test() acepta vectores c(x1, x2) y c(n1, n2) para comparar dos proporciones simultáneamente y devuelve el IC para \(p_1 - p_2\) en $conf.int.
Interpretación: con 95 % de confianza, la diferencia entre la proporción de muertes por segundo ataque cardíaco en el grupo Anturane y en el grupo placebo está entre aproximadamente -0.0383 y -0.0044. Como el intervalo es completamente negativo, hay evidencia de que Anturane reduce la proporción de muertes por segundo ataque cardíaco respecto al placebo.
Resumen: negras: \(n_1=100\), recobradas 40 %; claras: \(n_2=100\), recobradas 19 %. IC del 98 % para \(p_1-p_2\).
Solución
n1 <- 100; p1_hat <- 0.40 # Polillas negras
n2 <- 100; p2_hat <- 0.19 # Polillas claras
z <- qnorm(0.99)
error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)
IC_98 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_98[1] 0.06399503 0.35600497
Interpretación: con 98 % de confianza, la diferencia entre la tasa de supervivencia de las polillas negras y las de color claro está entre aproximadamente 0.064 y 0.356. El intervalo es completamente positivo, lo que respalda la hipótesis de Kettlewell de que, en un ambiente ennegrecido por la industrialización, las polillas negras tienen una tasa de supervivencia mayor que las claras.
Resumen: mujeres: \(n_1=205\), \(\hat{p}_1=0.24\); hombres: \(n_2=260\), \(\hat{p}_2=0.27\). IC del 99 % para \(p_1-p_2\).
Solución
n1 <- 205; p1_hat <- 0.24
n2 <- 260; p2_hat <- 0.27
z <- qnorm(0.995)
error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)
IC_99 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_99[1] -0.13456195 0.07456195
Interpretación: con 99 % de confianza, la diferencia entre la proporción de mujeres y hombres solteros que definitivamente desean casarse está entre aproximadamente -0.135 y 0.075. Como el intervalo contiene el cero, no hay evidencia suficiente de que exista una diferencia real entre ambas proporciones poblacionales.
Resumen: parturientas con contracciones: \(n_1=25\), \(s_1^2=40000\); sin contracciones: \(n_2=16\), \(s_2^2=10000\). IC del 95 % para \(\sigma_1^2/\sigma_2^2\).
Solución
s1_sq <- 40000; n1 <- 25
s2_sq <- 10000; n2 <- 16
F_ratio <- s1_sq / s2_sq
F_ratio[1] 4
El estadístico pivote para la razón de varianzas es \(F = \frac{s_1^2/\sigma_1^2}{s_2^2/\sigma_2^2} \sim F_{n_1-1,\,n_2-1}\); despejando obtenemos que el IC para \(\sigma_1^2/\sigma_2^2\) se construye a partir de la razón muestral \(s_1^2/s_2^2\).
alpha <- 1 - 0.95
F_critico_sup <- qf(1 - alpha/2, df1 = n1 - 1, df2 = n2 - 1)
F_critico_inf <- qf(alpha/2, df1 = n1 - 1, df2 = n2 - 1)
F_critico_sup[1] 2.70064
F_critico_inf[1] 0.4102683
qf(p, df1, df2) es la función cuantil de la distribución F con df1 y df2 grados de libertad en el numerador y denominador, respectivamente. Se necesitan dos cuantiles, uno en cada cola, para construir el intervalo bilateral.
limite_inferior <- F_ratio / F_critico_sup
limite_superior <- F_ratio * (1 / F_critico_inf) # equivalente a F_ratio / F_critico_inf si se invierte el cuantil
# Forma más directa usada en el módulo original:
limite_inferior <- F_ratio / qf(1 - alpha/2, df1 = n1 - 1, df2 = n2 - 1)
limite_superior <- F_ratio * qf(1 - alpha/2, df2 = n1 - 1, df1 = n2 - 1)
IC_95 <- c(limite_inferior, limite_superior)
IC_95[1] 1.481131 9.749716
Aquí qf(1 - alpha/2, df2 = n1-1, df1 = n2-1) (con los grados de libertad intercambiados) equivale a \(1/F_{\alpha/2, n_1-1,n_2-1}\) por la propiedad de reciprocidad de la distribución F, y se usa para construir el límite superior del intervalo.
Función de atajo — var.test():
# Requiere los datos originales; con solo los estadísticos resumidos se simula un vector con la misma varianza y tamaño
# var.test() se ilustra conceptualmente:
# var.test(muestra1, muestra2, conf.level = 0.95)Como en este ejercicio solo se dispone de los estadísticos resumidos (\(n\), \(s^2\)) y no de los datos originales, no es posible aplicar var.test() directamente (esta función requiere los dos vectores de datos); se deja indicado el llamado que se usaría si se tuvieran los datos crudos.
Interpretación: con 95 % de confianza, la razón de varianzas \(\sigma_1^2/\sigma_2^2\) (mujeres con contracciones respecto a mujeres sin contracciones) está entre aproximadamente 1.48 y 10.80. Como el intervalo no contiene el 1, hay evidencia de que las varianzas de las dos poblaciones son diferentes (la variabilidad en la concentración de oxitocina es mayor en mujeres con contracciones de parto).
Resumen: grupo 1 (sanos): \(n_1=25\), \(s_1^2=1.00\); grupo 2 (cáncer de vejiga): \(n_2=31\), \(s_2^2=3.5\). IC del 90 % para \(\sigma_2^2/\sigma_1^2\).
Solución
s1_sq <- 1.00; n1 <- 25
s2_sq <- 3.5; n2 <- 31
# Para sigma2^2 / sigma1^2 usamos F = s2^2 / s1^2
F_ratio <- s2_sq / s1_sq
F_ratio[1] 3.5
alpha <- 1 - 0.90
F_critico_sup <- qf(1 - alpha/2, df1 = n2 - 1, df2 = n1 - 1)
F_critico_inf <- qf(alpha/2, df1 = n2 - 1, df2 = n1 - 1)
limite_inferior <- F_ratio / F_critico_sup
limite_superior <- F_ratio / F_critico_inf
IC_90 <- c(limite_inferior, limite_superior)
IC_90[1] 1.805095 6.605760
Como ahora se pide el IC para \(\sigma_2^2/\sigma_1^2\) (grupo 2 sobre grupo 1), se invierte el orden de los grados de libertad en qf(): df1 = n2 - 1 (numerador, grupo 2) y df2 = n1 - 1 (denominador, grupo 1).
Interpretación: con 90 % de confianza, la razón \(\sigma_2^2/\sigma_1^2\) está entre aproximadamente 0.151 y 0.539. Como el intervalo no incluye el 1, hay evidencia de que la varianza del contenido de nicotina en el grupo de fumadores con cáncer de vejiga es distinta —de hecho, en esta muestra, la razón sugiere una relación inversa a lo que cabría esperar; se recomienda revisar los supuestos de normalidad e independencia antes de sacar conclusiones clínicas definitivas.
Resumen: 6 semanas con 2, 1, 0, 2, 1, 3 casos. ¿Cuántas semanas se necesitan para estimar la media semanal con precisión de 0.5?
Solución
casos <- c(2, 1, 0, 2, 1, 3)
sd_casos <- sd(casos)
sd_casos[1] 1.048809
Usamos la desviación estándar de la muestra piloto como una estimación preliminar de \(\sigma\), necesaria para calcular el tamaño de muestra.
z_95 <- qnorm(0.975)
E <- 0.5 # Precisión (margen de error) deseada
n_necesario <- (z_95 * sd_casos / E)^2
n_necesario <- ceiling(n_necesario)
n_necesario[1] 17
La fórmula del tamaño de muestra para estimar una media con margen de error \(E\) y confianza \(1-\alpha\) es \(n = \left(\frac{z_{1-\alpha/2}\,\sigma}{E}\right)^2\); se sustituye \(\sigma\) por la desviación estándar muestral piloto. ceiling() redondea hacia arriba al entero más cercano, ya que el tamaño de muestra siempre debe ser un número entero suficiente para garantizar (al menos) la precisión deseada.
Interpretación: se necesitan al menos 17 semanas de observación para estimar la media semanal de casos de triquinosis con una precisión de 0.5 casos, con 95 % de confianza.
Resumen: muestra piloto de 15 empleados, 3 con caries. ¿Cuántos empleados observar para una precisión del 2 %?
Solución
n_piloto <- 15
x_piloto <- 3
p_hat <- x_piloto / n_piloto
p_hat[1] 0.2
z_95 <- qnorm(0.975)
E <- 0.02
n_necesario <- (z_95^2 * p_hat * (1 - p_hat)) / E^2
n_necesario <- ceiling(n_necesario)
n_necesario[1] 1537
La fórmula del tamaño de muestra para estimar una proporción con margen de error \(E\) es \(n = \frac{z_{1-\alpha/2}^2\,\hat{p}(1-\hat{p})}{E^2}\), usando la proporción muestral piloto \(\hat{p} = 3/15 = 0.20\) como estimación preliminar.
Interpretación: se necesitarían al menos 1.537 empleados (redondeando hacia arriba, 1.538) para estimar el porcentaje de empleados con caries con una precisión del 2 %, con 95 % de confianza.
Resumen: \(n=20\), estadístico \(T\) observado \(= 1.5\). ¿Valor P? ¿Se rechaza \(H_0\) con \(\alpha=0.05\)?
Solución
n <- 20
T_obs <- 1.5
p_valor <- 2 * pt(abs(T_obs), df = n - 1, lower.tail = FALSE)
p_valor[1] 0.1500485
pt(q, df, lower.tail = FALSE) calcula \(P(T > q)\) para una t de Student con df grados de libertad. Como la prueba es de dos colas (\(H_1: \mu \neq 2\)), el valor P es el doble de la probabilidad de observar un valor tan extremo como \(|T_{obs}|\) en una sola cola; por eso se multiplica por 2 y se usa abs(T_obs).
Interpretación: el valor P es aproximadamente 0.15, mayor que \(\alpha = 0.05\). Por lo tanto, no se rechaza \(H_0\): no hay evidencia suficiente, con este tamaño de muestra y este valor del estadístico, para afirmar que \(\mu \neq 2\).
Resumen: se afirma \(\mu = 2.5\) s. \(n=10\) observaciones. Prueba de dos colas, \(\alpha = 0.10\).
Solución
a) Sistema de hipótesis: \[H_0: \mu = 2.5 \quad \text{versus} \quad H_1: \mu \neq 2.5\]
b) Cálculo del valor P
tiempos <- c(3.0, 2.9, 2.8, 2.7, 2.6, 2.4, 2.5, 2.4, 2.6, 2.7)
x_bar <- mean(tiempos)
s <- sd(tiempos)
n <- length(tiempos)
x_bar[1] 2.66
s[1] 0.201108
mu0 <- 2.5
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c[1] 2.515884
El estadístico de prueba t de una muestra es \(t_c = \frac{\bar{x}-\mu_0}{s/\sqrt{n}}\): mide cuántos errores estándar separa la media muestral del valor hipotético \(\mu_0\).
p_valor <- 2 * pt(abs(t_c), df = n - 1, lower.tail = FALSE)
p_valor[1] 0.03299073
Función de atajo:
t.test(tiempos, mu = 2.5, alternative = "two.sided")
One Sample t-test
data: tiempos
t = 2.5159, df = 9, p-value = 0.03299
alternative hypothesis: true mean is not equal to 2.5
95 percent confidence interval:
2.516136 2.803864
sample estimates:
mean of x
2.66
t.test(x, mu = valor, alternative = "two.sided") realiza la prueba t de una muestra contra el valor hipotético indicado en mu; el argumento alternative = "two.sided" especifica que la hipótesis alternativa es bilateral (\(\neq\)). El resultado incluye el estadístico t, los grados de libertad y el valor P, que deben coincidir con el cálculo manual.
Interpretación: el valor P es aproximadamente 0.033, menor que \(\alpha = 0.10\). Por lo tanto, se rechaza \(H_0\): los datos sugieren que el tiempo medio desde el contacto hasta el cierre completo de las hojas de Mimosa pudica es diferente de 2.5 segundos.
Resumen: valor histórico \(\mu_0 = 17\) días; se espera que el nuevo programa reduzca la cifra. \(n=16\) datos. \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \mu \ge 17\) versus \(H_1: \mu < 17\).
dias <- c(3, 18, 38, 5, 9, 43, 12, 8, 7, 20, 22, 15, 6, 3, 2, 36)
x_bar <- mean(dias)
s <- sd(dias)
n <- length(dias)
x_bar[1] 15.4375
s[1] 13.24119
mu0 <- 17
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c[1] -0.4720119
p_valor <- pt(t_c, df = n - 1, lower.tail = TRUE)
p_valor[1] 0.3218558
Como la hipótesis alternativa es de cola izquierda (\(\mu < 17\)), el valor P es \(P(T \le t_c)\), que se obtiene con pt(t_c, df, lower.tail = TRUE) (el argumento lower.tail = TRUE, que es el valor por defecto, pide el área acumulada a la izquierda de t_c).
Función de atajo:
t.test(dias, mu = 17, alternative = "less")
One Sample t-test
data: dias
t = -0.47201, df = 15, p-value = 0.3219
alternative hypothesis: true mean is less than 17
95 percent confidence interval:
-Inf 21.24062
sample estimates:
mean of x
15.4375
alternative = "less" indica una prueba de cola izquierda, coherente con \(H_1: \mu < 17\).
Interpretación: el valor P es aproximadamente 0.32, mayor que \(\alpha = 0.05\). No se rechaza \(H_0\): los datos no proporcionan evidencia suficiente de que el nuevo programa haya reducido significativamente el número medio de días de clínica requeridos.
Resumen: \(n=40\), \(\bar{x}=-2.1\) lb, \(\sigma=4.8\) lb (conocida). Probar que el cambio medio es menor que 0. \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \mu \ge 0\) versus \(H_1: \mu < 0\).
n <- 40
x_bar <- -2.1
sigma <- 4.8
mu0 <- 0
Z_c <- (x_bar - mu0) / (sigma / sqrt(n))
Z_c[1] -2.766993
Como la desviación estándar poblacional \(\sigma\) es conocida (no estimada con \(s\)), se usa el estadístico Z en lugar de t.
p_valor <- pnorm(Z_c, lower.tail = TRUE)
p_valor[1] 0.002828799
pnorm(q, lower.tail = TRUE) calcula \(P(Z \le q)\) para la normal estándar; como \(H_1\) es de cola izquierda, el valor P es exactamente esta probabilidad acumulada.
Nota: t.test() no admite un \(\sigma\) poblacional conocido (siempre estima la desviación con \(s\) y usa la distribución t), por lo que en este caso solo es posible replicar el resultado con el cálculo manual mostrado arriba, o de forma aproximada usando pnorm() como cálculo independiente de verificación:
2 * (1 - pnorm(abs(Z_c))) # valor P equivalente para una prueba bilateral, solo a modo de referencia[1] 0.005657598
Interpretación: el valor P es aproximadamente 0.0028, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente para afirmar que el cambio medio de peso con la dieta Atkins es menor que 0 libras, es decir, que en promedio las personas sí pierden peso.
Resumen: \(n=14\) mediciones, \(\sigma = 10\) (conocida). Probar que la media es menor que 140. \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \mu \ge 140\) versus \(H_1: \mu < 140\).
presion <- c(138, 130, 135, 140, 120, 125, 120, 130,
130, 144, 143, 140, 130, 150)
x_bar <- mean(presion)
n <- length(presion)
sigma <- 10
mu0 <- 140
x_bar[1] 133.9286
Z_c <- (x_bar - mu0) / (sigma / sqrt(n))
Z_c[1] -2.271721
p_valor <- pnorm(Z_c, lower.tail = TRUE)
p_valor[1] 0.0115517
Interpretación: el valor P es aproximadamente 0.0116, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia de que la presión sanguínea media de esta persona es menor que 140 mmHg. Sin embargo, dado que varios valores individuales de la muestra sí alcanzan o superan 140 (el umbral de hipertensión), no es posible concluir de manera absoluta que la persona nunca tenga hipertensión; la prueba se refiere únicamente al promedio de las mediciones.
Resumen: \(n=40\), \(\bar{x}=92.67\), \(s=1.79\), \(\mu_0=92.84\). Prueba de dos colas, \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \mu = 92.84\) versus \(H_1: \mu \neq 92.84\).
n <- 40
x_bar <- 92.67
s <- 1.79
mu0 <- 92.84
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c[1] -0.6006561
p_valor <- 2 * pt(abs(t_c), df = n - 1, lower.tail = FALSE)
p_valor[1] 0.551544
Interpretación: el valor P es aproximadamente 0.55, muy superior a \(\alpha = 0.05\). No se rechaza \(H_0\): no hay evidencia suficiente para afirmar que la altura media de rebote de las nuevas pelotas sea diferente de 92.84 pulgadas.
Resumen: \(n=9\), \(\bar{x}=70.2\), \(s=1.5\). Probar que la media es mayor que 63.6. \(\alpha=0.01\).
Solución
Sistema de hipótesis: \(H_0: \mu \le 63.6\) versus \(H_1: \mu > 63.6\).
n <- 9
x_bar <- 70.2
s <- 1.5
mu0 <- 63.6
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c[1] 13.2
p_valor <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor[1] 5.168745e-07
Como \(H_1\) es de cola derecha (\(\mu > 63.6\)), el valor P es \(P(T > t_c)\), es decir pt(t_c, df, lower.tail = FALSE).
Interpretación: el valor P es prácticamente 0 (mucho menor que \(\alpha = 0.01\)). Se rechaza \(H_0\): hay evidencia contundente de que la estatura media de las supermodelos es mayor que la de la población general de mujeres.
Resumen: \(n=9\), \(\bar{x}=6.2\), \(s=2\); valores normales: media 6, desviación 1.
a) ¿Media más alta de lo normal? \(\alpha = 0.05\)
Sistema de hipótesis: \(H_0: \mu \le 6\) versus \(H_1: \mu > 6\).
n <- 9
x_bar <- 6.2
s <- 2
mu0 <- 6
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c[1] 0.3
p_valor_media <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor_media[1] 0.3859122
Interpretación (a): el valor P es aproximadamente 0.386, mayor que \(\alpha=0.05\). No se rechaza \(H_0\): no hay evidencia de que el nivel medio de calcio de este paciente sea más alto de lo normal.
b) ¿Desviación estándar más alta de lo normal? \(\alpha = 0.05\)
Sistema de hipótesis: \(H_0: \sigma \le 1\) versus \(H_1: \sigma > 1\).
sigma0 <- 1
chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c[1] 32
El estadístico de prueba para la varianza/desviación es \(\chi^2_c = \frac{(n-1)s^2}{\sigma_0^2}\), que bajo \(H_0\) sigue una distribución chi-cuadrado con \(n-1\) grados de libertad.
p_valor_var <- pchisq(chi2_c, df = n - 1, lower.tail = FALSE)
p_valor_var[1] 9.314161e-05
pchisq(q, df, lower.tail = FALSE) calcula \(P(\chi^2 > q)\); como \(H_1\) es de cola derecha (\(\sigma > 1\)), el valor P es exactamente esta probabilidad.
Interpretación (b): el valor P es aproximadamente 0, mucho menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia sólida de que la variabilidad del nivel de calcio de este paciente es superior a la normal, lo cual —según el enunciado— podría relacionarse con trastornos en la coagulación de la sangre.
Resumen: \(n=10\) pares (antes/después). Probar que la condición experimental aumenta los latidos. \(\alpha=0.05\).
Solución
Sistema de hipótesis, con \(d = \text{después} - \text{antes}\): \(H_0: \mu_d \le 0\) versus \(H_1: \mu_d > 0\).
antes <- c(70, 84, 88, 110, 105, 100, 110, 67, 79, 86)
despues <- c(115, 148, 176, 191, 158, 178, 179, 140, 161, 157)
d <- despues - antes
d_bar <- mean(d)
s_d <- sd(d)
n <- length(d)
d_bar[1] 70.4
s_d[1] 13.3849
d es el vector de diferencias individuales (después \(-\) antes) para cada uno de los 10 animales; en un diseño pareado, el análisis se reduce a una prueba t de una muestra sobre estas diferencias.
t_c <- d_bar / (s_d / sqrt(n))
t_c[1] 16.6325
p_valor <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor[1] 2.29261e-08
Función de atajo:
t.test(despues, antes, paired = TRUE, alternative = "greater")
Paired t-test
data: despues and antes
t = 16.632, df = 9, p-value = 2.293e-08
alternative hypothesis: true mean difference is greater than 0
95 percent confidence interval:
62.64102 Inf
sample estimates:
mean difference
70.4
paired = TRUE le indica a t.test() que las dos muestras están relacionadas (mismos sujetos medidos dos veces) y que debe trabajar sobre las diferencias despues - antes; alternative = "greater" corresponde a \(H_1: \mu_d > 0\).
Interpretación: el valor P es extremadamente pequeño (del orden de \(10^{-8}\)), mucho menor que \(\alpha=0.05\). Se rechaza \(H_0\): hay evidencia contundente de que la condición experimental aumenta el número de latidos del corazón por minuto en estos animales.
Resumen: \(\sigma_0 = 1.5\) kg (maquinaria sin modificar). \(n=10\) pesos con el nuevo mecanismo. Probar que la varianza aumentó. \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \sigma^2 \le 1.5^2\) versus \(H_1: \sigma^2 > 1.5^2\).
fardos <- c(28.3, 27.8, 29.3, 30.1, 32.5, 27.2, 25.3, 32.2, 33.6, 30.7)
x_bar <- mean(fardos)
s2 <- var(fardos)
n <- length(fardos)
x_bar[1] 29.7
s2[1] 6.866667
var() calcula la varianza muestral \(s^2 = \frac{1}{n-1}\sum(x_i-\bar{x})^2\) directamente (equivalente a sd()^2).
sigma0_sq <- 1.5^2
chi2_c <- (n - 1) * s2 / sigma0_sq
chi2_c[1] 27.46667
p_valor <- pchisq(chi2_c, df = n - 1, lower.tail = FALSE)
p_valor[1] 0.001170491
Interpretación: el valor P es aproximadamente 0.0012, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente para afirmar que la varianza del peso de los fardos ha aumentado con el nuevo mecanismo, tal como sospechaba el ingeniero.
Resumen: \(\sigma_0=0.051\) oz. Nueva máquina: \(n=24\), \(s=0.039\) oz. Probar que \(\sigma < 0.051\). \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \sigma \ge 0.051\) versus \(H_1: \sigma < 0.051\).
n <- 24
s <- 0.039
sigma0 <- 0.051
chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c[1] 13.44983
p_valor <- pchisq(chi2_c, df = n - 1, lower.tail = TRUE)
p_valor[1] 0.05844857
Como \(H_1\) es de cola izquierda (\(\sigma < 0.051\), es decir, un \(\chi^2_c\) pequeño favorecería \(H_1\)), el valor P es \(P(\chi^2 \le \chi^2_c)\), que se obtiene con lower.tail = TRUE (el valor por defecto).
Interpretación: el valor P es aproximadamente 0.058, mayor que \(\alpha = 0.05\) (aunque muy cerca del límite). No se rechaza \(H_0\): no hay evidencia suficiente, al nivel del 5 %, para afirmar que la nueva máquina produce latas con una desviación estándar menor que 0.051 oz.
Resumen: \(n=190\), \(s=645\) g. Probar que \(\sigma\) difiere de 696 g. \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: \sigma = 696\) versus \(H_1: \sigma \neq 696\).
n <- 190
s <- 645
sigma0 <- 696
chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c[1] 162.3165
alpha <- 0.05
chi2_inf <- qchisq(alpha/2, df = n - 1)
chi2_sup <- qchisq(1 - alpha/2, df = n - 1)
chi2_inf[1] 152.8221
chi2_sup[1] 228.9636
Para una prueba de dos colas basada en \(\chi^2\), se comparan los valores críticos inferior y superior: se rechaza \(H_0\) si el estadístico calculado cae fuera del intervalo \([\chi^2_{n-1,\,\alpha/2}, \chi^2_{n-1,\,1-\alpha/2}]\).
rechazar <- chi2_c < chi2_inf | chi2_c > chi2_sup
rechazar[1] FALSE
rechazar es un valor lógico (TRUE/FALSE) que indica si el estadístico calculado cae en la región de rechazo (fuera del intervalo formado por los dos valores críticos).
Interpretación: como \(\chi^2_c \approx 162.3\) está dentro del intervalo \([152.8, 229.0]\) (aproximadamente), no se rechaza \(H_0\): no hay evidencia suficiente para afirmar que la desviación estándar de los pesos al nacer de hijos de consumidoras de cocaína sea diferente de 696 g.
Resumen: \(n=1500\), \(x=125\) positivos. Probar que \(p > 0.06\). \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: p = 0.06\) versus \(H_1: p > 0.06\).
n <- 1500
x <- 125
p0 <- 0.06
p_hat <- x / n
p_hat[1] 0.08333333
Z_c <- (p_hat - p0) / sqrt((p0 * (1 - p0)) / n)
Z_c[1] 3.805247
Nótese que el error estándar bajo \(H_0\) se calcula con p0 (el valor hipotético), no con p_hat, ya que la prueba de hipótesis evalúa la distribución del estadístico bajo el supuesto de que \(H_0\) es cierta.
p_valor <- pnorm(Z_c, lower.tail = FALSE)
p_valor[1] 7.083135e-05
Función de atajo:
prop.test(x, n, p = p0, alternative = "greater", correct = FALSE)
1-sample proportions test without continuity correction
data: x out of n, null probability p0
X-squared = 14.48, df = 1, p-value = 7.083e-05
alternative hypothesis: true p is greater than 0.06
95 percent confidence interval:
0.07233205 1.00000000
sample estimates:
p
0.08333333
prop.test(x, n, p = p0, alternative = "greater") realiza la prueba de proporción con hipótesis alternativa de cola derecha directamente; por defecto usa una versión con corrección de continuidad, por lo que se añadió correct = FALSE para que el estadístico chi-cuadrado reportado (\(X^2 = Z^2\)) sea comparable con el cálculo manual con Z.
Interpretación: el valor P es muy pequeño (menor que 0.001), por lo que se rechaza \(H_0\): hay evidencia suficiente de que la proporción de personas con anemia de células falciformes en esta población es mayor que 0.06.
Resumen: grupo 1: \(n_1=450\), \(x_1=105\); grupo 2: \(n_2=375\), \(x_2=120\). Probar que \(p_1 \neq p_2\). \(\alpha=0.05\).
Solución
Sistema de hipótesis: \(H_0: p_1 = p_2\) versus \(H_1: p_1 \neq p_2\).
n1 <- 450; x1 <- 105
n2 <- 375; x2 <- 120
p1_hat <- x1 / n1
p2_hat <- x2 / n2
p1_hat[1] 0.2333333
p2_hat[1] 0.32
p_comb <- (x1 + x2) / (n1 + n2)
p_comb[1] 0.2727273
Bajo \(H_0: p_1=p_2\), se estima una única proporción combinada (pooled) \(\hat{p} = \frac{x_1+x_2}{n_1+n_2}\), que se usa para calcular el error estándar del estadístico de prueba (a diferencia del IC, donde cada proporción usa su propio error estándar).
Z_c <- (p1_hat - p2_hat) / sqrt(p_comb * (1 - p_comb) * (1/n1 + 1/n2))
Z_c[1] -2.783134
p_valor <- 2 * (1 - pnorm(abs(Z_c)))
p_valor[1] 0.005383661
Función de atajo:
prop.test(c(x1, x2), c(n1, n2), correct = FALSE)
2-sample test for equality of proportions without continuity correction
data: c(x1, x2) out of c(n1, n2)
X-squared = 7.7458, df = 1, p-value = 0.005384
alternative hypothesis: two.sided
95 percent confidence interval:
-0.14795426 -0.02537907
sample estimates:
prop 1 prop 2
0.2333333 0.3200000
Interpretación: el valor P es aproximadamente 0.0054, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente de que la proporción de niños anémicos difiere significativamente entre los dos grupos étnicos estudiados.
Copyright © 2026 - Created with Quarto