Módulo 6: Inferencia Estadística — Soluciones en R

Bioestadística Fundamental y Estadística Fundamental para las Ciencias de la Salud

Authors
Affiliations

Jose Miguel Leon Puentes

Universidad Nacional de Colombia

Johann David Sanchez Niño

Andrés Felipe Rache

Laura Camila Matheus Barrios

Brayan Stiven Martínez Rodríguez

Departamento de Estadística

Este documento presenta la solución paso a paso, en R, de los ejercicios de refuerzo del Módulo 6 (Inferencia Estadística).

Ejercicio 1.

Resumen: de 2.450 personas que tomaron aspirina en dosis bajas durante 10 años, 22 desarrollaron hemorragia gástrica. Se pide una estimación puntual de la probabilidad (proporción poblacional) de este evento.

Solución

x <- 22     # Número de personas que desarrollaron hemorragia gástrica
n <- 2450   # Tamaño de la muestra

p_hat <- x / n
p_hat
[1] 0.008979592

El estimador puntual natural de una proporción poblacional \(p\) es la proporción muestral \(\hat{p} = x/n\), donde \(x\) es el número de “éxitos” (en este caso, casos de hemorragia gástrica) y \(n\) es el tamaño de la muestra. Aquí simplemente dividimos 22 entre 2450; no se requiere ninguna función especial de R, solo la operación aritmética x / n.

Interpretación: la probabilidad estimada de desarrollar una hemorragia gástrica bajo un régimen de aspirina en dosis bajas durante 10 años es \(\hat{p} \approx 0.00898\), es decir, aproximadamente 0.9 %. Al ser una estimación puntual, no informa sobre la incertidumbre asociada; para eso se necesitaría un intervalo de confianza (como los que se construyen en la siguiente sección).


Ejercicio 2.

Resumen: de 18.365 mujeres de 40 a 50 años examinadas en un “screening”, 36 tenían cáncer de mama en estadio inicial.

Solución

x <- 36       # Número de mujeres con cáncer de mama incipiente
n <- 18365    # Tamaño de la muestra

p_hat <- x / n
p_hat
[1] 0.00196025

Igual que en el ejercicio anterior, x almacena el número de casos positivos y n el tamaño muestral; p_hat es la razón x / n, el estimador puntual de máxima verosimilitud de la proporción poblacional para un modelo Bernoulli/Binomial.

Interpretación: la probabilidad estimada de que una mujer entre 40 y 50 años tenga cáncer de mama en estadio inicial es \(\hat{p} \approx 0.00196\), es decir, cerca del 0.2 %. Es una estimación puntual; para cuantificar la incertidumbre habría que acompañarla de un intervalo de confianza.

Ejercicio 3.

Resumen: una solución de 200 cc contiene \(N\) bacteriófagos desconocidos. Se reparten 5 cc en 25 cultivos; 8 de ellos no muestran inhibición (es decir, no recibieron ningún bacteriófago). Se pide estimar \(N\).

Solución

Si \(\lambda\) es el número esperado de bacteriófagos por cultivo, y cada cultivo recibe en promedio \(5/200\) de la solución total, entonces \(\lambda = N \cdot (5/200) = 0.025N\). Bajo un modelo de Poisson, la probabilidad de que un cultivo no reciba ningún bacteriófago es \(P(X=0) = e^{-\lambda}\). Igualamos esta probabilidad teórica a la proporción observada de cultivos sin inhibición (\(8/25\)) y despejamos \(N\).

n_cultivos <- 25
sin_inhibicion <- 8

p0_observada <- sin_inhibicion / n_cultivos
p0_observada
[1] 0.32

p0_observada es la proporción muestral de cultivos que no mostraron trazas de inhibición, es decir, la estimación empírica de \(P(X = 0) = e^{-\lambda}\).

lambda_hat <- -log(p0_observada)
lambda_hat
[1] 1.139434

Como \(e^{-\lambda} = 0.32\), despejamos \(\lambda = -\ln(0.32)\). La función log() en R calcula el logaritmo natural (base \(e\)); con el signo negativo obtenemos \(\lambda\).

N_hat <- lambda_hat / 0.025
N_hat
[1] 45.57737

Finalmente, como \(\lambda = 0.025N\), despejamos \(N = \lambda / 0.025\). El resultado se redondea al entero más cercano, ya que \(N\) representa un número de partículas.

Interpretación: el número estimado de bacteriófagos en la solución de 200 cc es \(N \approx 46\). Es una estimación puntual basada en igualar la probabilidad teórica de “cero bacteriófagos” bajo Poisson con la proporción observada de cultivos sin inhibición.

Ejercicio 4.

Resumen: \(n = 5\) lecturas de microgramos de partículas por metro cúbico: 58, 70, 57, 61, 59; se sabe que \(\sigma^2 = 9\) (población normal). Se piden los IC del 95 % y del 90 % para \(\mu\).

Solución

datos <- c(58, 70, 57, 61, 59)

x_bar <- mean(datos)
x_bar
[1] 61

mean(datos) calcula el promedio aritmético del vector datos, es decir, \(\bar{x} = \frac{1}{n}\sum x_i\); es el estimador puntual de \(\mu\).

n <- length(datos)
sigma <- sqrt(9)   # Desviación estándar poblacional conocida

alpha_95 <- 1 - 0.95
z_95 <- qnorm(1 - alpha_95/2)
z_95
[1] 1.959964

length(datos) cuenta el número de observaciones del vector, es decir, \(n\). La variable sigma es la desviación estándar poblacional, conocida de antemano (\(\sigma = \sqrt{9} = 3\)). qnorm(p) es la función cuantil de la distribución normal estándar: devuelve el valor \(z\) tal que \(P(Z \le z) = p\). Como necesitamos dejar \(\alpha/2 = 0.025\) en cada cola para un IC del 95 %, pedimos el cuantil \(1 - \alpha/2 = 0.975\), que corresponde a \(z_{0.975} \approx 1.96\).

IC_95 <- x_bar + c(-1, 1) * z_95 * sigma / sqrt(n)
IC_95
[1] 58.37043 63.62957

El vector c(-1, 1) genera simultáneamente el límite inferior y superior: \(\bar{x} - z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\) y \(\bar{x} + z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}\). Esta es la fórmula del intervalo de confianza para la media con varianza poblacional conocida.

alpha_90 <- 1 - 0.90
z_90 <- qnorm(1 - alpha_90/2)

IC_90 <- x_bar + c(-1, 1) * z_90 * sigma / sqrt(n)
IC_90
[1] 58.7932 63.2068

Repetimos el mismo procedimiento cambiando el nivel de confianza a 90 %, con lo cual \(\alpha/2 = 0.05\) y \(z_{0.95} \approx 1.645\).

Interpretación: con 95 % de confianza, el número medio de microgramos de partículas por metro cúbico está entre 58.37 y 63.63; con 90 % de confianza, está entre 58.79 y 63.21. Como se esperaría, el intervalo del 90 % es más angosto que el del 95 %, porque se exige menor nivel de confianza a cambio de mayor precisión.


Ejercicio 5.

Resumen: \(n = 100\), \(\bar{x} = 23\) min, \(s = 10\) min. Se pide un IC del 90 % para \(\mu\).

Solución

n <- 100
x_bar <- 23
s <- 10

Aquí los estadísticos ya vienen dados en el enunciado (no se dispone de los datos individuales), así que los definimos directamente como valores conocidos.

alpha <- 1 - 0.90
t_c <- qt(1 - alpha/2, df = n - 1)
t_c
[1] 1.660391

qt(p, df) es la función cuantil de la distribución t de Student: devuelve el valor \(t\) tal que \(P(T \le t) = p\), para una t con df grados de libertad. Como la varianza poblacional es desconocida y se estima con \(s\), usamos la distribución t en lugar de la normal. El argumento df = n - 1 son los grados de libertad de la t, que se pierden uno porque \(s\) se calculó a partir de la misma muestra que \(\bar{x}\).

IC_90 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_90
[1] 21.33961 24.66039

Interpretación: con 90 % de confianza, el tiempo medio de espera en el centro de salud está entre 21.34 y 24.67 minutos aproximadamente.


Ejercicio 6.

Resumen: \(n = 9\), \(\bar{x} = 7\) min, \(s = 2\) min. IC del 95 % para \(\mu\).

Solución

n <- 9
x_bar <- 7
s <- 2

t_c <- qt(0.975, df = n - 1)
t_c
[1] 2.306004

Pedimos directamente el cuantil 0.975 de la t con \(n-1=8\) grados de libertad, ya que \(1-\alpha/2 = 1-0.025=0.975\) para un 95 % de confianza.

IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95
[1] 5.462664 8.537336

Interpretación: el intervalo de confianza del 95 % para el tiempo medio requerido por este tipo de pacientes es aproximadamente (5.46, 8.54) minutos.


Ejercicio 7.

Resumen: \(n = 9\) observaciones de libras de nitrógeno por granja y día. IC del 99 % para \(\mu\).

Solución

nitrogeno <- c(4.9, 5.8, 5.9, 6.5, 5.5, 5.0, 5.6, 6.0, 5.7)

x_bar <- mean(nitrogeno)
s <- sd(nitrogeno)
n <- length(nitrogeno)

x_bar
[1] 5.655556
s
[1] 0.4927248

sd() calcula la desviación estándar muestral \(s = \sqrt{\frac{1}{n-1}\sum (x_i - \bar{x})^2}\) (con denominador \(n-1\), el estimador insesgado de \(\sigma\)).

t_c <- qt(0.995, df = n - 1)
t_c
[1] 3.355387
IC_99 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_99
[1] 5.104461 6.206650

Para un 99 % de confianza, \(1-\alpha/2 = 0.995\).

Función de atajo — t.test():

t.test(nitrogeno, conf.level = 0.99)$conf.int
[1] 5.104461 6.206650
attr(,"conf.level")
[1] 0.99

t.test() ejecuta internamente el mismo cálculo (prueba t de una muestra) y, con el argumento conf.level = 0.99, devuelve directamente el intervalo de confianza al 99 % dentro de $conf.int, que debe coincidir (salvo redondeo) con el calculado manualmente.

Interpretación: con 99 % de confianza, la producción media de nitrógeno por granja y día está entre aproximadamente 5.11 y 6.21 libras.

Ejercicio 8.

Resumen: \(n = 16\) mediciones de calibre (pulgadas). IC del 95 % para \(\mu\).

Solución

calibre <- c(2.3, 1.9, 1.7, 2.1, 1.5, 1.8, 1.8, 1.1,
             2.1, 1.5, 2.0, 1.6, 1.3, 1.6, 1.5, 1.3)

x_bar <- mean(calibre)
s <- sd(calibre)
n <- length(calibre)

t_c <- qt(0.975, df = n - 1)

IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95
[1] 1.517053 1.870447

Función de atajo:

t.test(calibre, conf.level = 0.95)$conf.int
[1] 1.517053 1.870447
attr(,"conf.level")
[1] 0.95

Interpretación: con 95 % de confianza, el calibre medio de los árboles del vivero está entre aproximadamente 1.52 y 1.87 pulgadas.


Ejercicio 9.

Resumen: \(n = 40\), \(\bar{x} = 60\) qq/ha, \(\sigma^2 = 25\) (qq/ha)\(^2\). IC del 95 % y 99 % para \(\mu\).

Solución

n <- 40
x_bar <- 60
sigma <- sqrt(25)

z_95 <- qnorm(0.975)
IC_95 <- x_bar + c(-1, 1) * z_95 * sigma / sqrt(n)
IC_95
[1] 58.45051 61.54949

Como se conoce la varianza poblacional (no se estima con \(s\)), usamos el cuantil normal qnorm() en vez del cuantil t.

z_99 <- qnorm(0.995)
IC_99 <- x_bar + c(-1, 1) * z_99 * sigma / sqrt(n)
IC_99
[1] 57.96363 62.03637

Interpretación: con 95 % de confianza el rendimiento medio del maíz está entre 58.45 y 61.55 qq/ha; con 99 % de confianza, el intervalo se amplía a (57.96, 62.04) qq/ha, reflejando el compromiso entre confianza y precisión.


Ejercicio 10.

Resumen: \(n = 10\) concentraciones de bilirrubina. IC del 95 % para \(\mu\).

Solución

bilirrubina <- c(20.5, 14.8, 21.3, 12.7, 15.2,
                 26.6, 23.4, 22.9, 15.7, 19.2)

x_bar <- mean(bilirrubina)
s <- sd(bilirrubina)
n <- length(bilirrubina)

t_c <- qt(0.975, df = n - 1)

IC_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_95
[1] 16.01274 22.44726

Función de atajo:

t.test(bilirrubina, conf.level = 0.95)$conf.int
[1] 16.01274 22.44726
attr(,"conf.level")
[1] 0.95

Interpretación: con 95 % de confianza, la concentración media de bilirrubina en suero para este tipo de pacientes está entre aproximadamente 16.01 y 22.45.

Ejercicio 11.

Resumen: \(n = 350\), \(x = 167\) casos de hipertensión. IC del 95 % para \(p\).

Solución

x <- 167
n <- 350

p_hat <- x / n
p_hat
[1] 0.4771429
z <- qnorm(0.975)

error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)

IC_95 <- p_hat + c(-1, 1) * z * error_estandar
IC_95
[1] 0.4248154 0.5294703

error_estandar calcula \(\sqrt{\hat{p}(1-\hat{p})/n}\), el error estándar del estimador \(\hat{p}\) bajo la aproximación normal para proporciones. Se multiplica por el cuantil z (aquí \(z_{0.975}\approx1.96\)) para formar el margen de error, que se suma y resta a \(\hat{p}\).

Función de atajo — prop.test():

prop.test(x, n, conf.level = 0.95, correct = FALSE)$conf.int
[1] 0.4253478 0.5294343
attr(,"conf.level")
[1] 0.95

prop.test() realiza una prueba/IC de proporción; el argumento correct = FALSE desactiva la corrección de continuidad de Yates para que el cálculo sea comparable con la fórmula clásica de Wald usada manualmente (por defecto prop.test() usa una fórmula ligeramente distinta —basada en el método de Wilson con corrección—, por lo que el resultado puede diferir levemente del cálculo manual).

Interpretación: con 95 % de confianza, entre el 42.5 % y el 53 % de las personas mayores de 65 años en la Comunidad Valenciana son hipertensas.

Ejercicio 12.

Resumen: \(n = 140\), \(\hat{p} = 0.35\). IC del 95 % para \(p\).

Solución

n <- 140
p_hat <- 0.35

z <- qnorm(0.975)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)

IC_95 <- p_hat + c(-1, 1) * z * error_estandar
IC_95
[1] 0.2709913 0.4290087

Interpretación: con 95 % de confianza, entre el 27.1 % y el 43 % de los pacientes asmáticos tendrían reacciones positivas de la piel al polvo de casa.


Ejercicio 13.

Resumen: \(n = 80\), \(\hat{p} = 0.35\). IC del 99 % para \(p\).

Solución

n <- 80
p_hat <- 0.35

z <- qnorm(0.995)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)

IC_99 <- p_hat + c(-1, 1) * z * error_estandar
IC_99
[1] 0.2126392 0.4873608

Interpretación: con 99 % de confianza, la proporción de miopes en la población está entre 21.3 % y 48.7 %. El intervalo es bastante ancho debido al tamaño de muestra relativamente pequeño (n = 80) combinado con un nivel de confianza alto.


Ejercicio 14.

Resumen: \(n = 325\), \(x = 295\) niñas. IC del 99 % para \(p\).

Solución

x <- 295
n <- 325
p_hat <- x / n

z <- qnorm(0.995)
error_estandar <- sqrt((p_hat * (1 - p_hat)) / n)

IC_99 <- p_hat + c(-1, 1) * z * error_estandar
IC_99
[1] 0.8663339 0.9490507

Función de atajo:

prop.test(x, n, conf.level = 0.99, correct = FALSE)$conf.int
[1] 0.8577886 0.9412829
attr(,"conf.level")
[1] 0.99

Interpretación: con 99 % de confianza, entre el 86.6 % y el 94.9 % de los bebés nacidos con el método XSORT serían niñas, lo que sugiere que el método efectivamente incrementa la probabilidad de concebir una niña respecto al 50 % esperado sin intervención.

Ejercicio 15.

Resumen: \(n = 10\), \(s = 0.0125\) g (normalidad verificada gráficamente). IC del 95 % para \(\sigma\).

Solución

Base R no incluye una función de atajo para el intervalo de confianza de una varianza o desviación estándar de una sola muestra, así que construimos —como en el módulo original— una función propia basada en la distribución chi-cuadrado.

n <- 10
s <- 0.0125

alpha <- 1 - 0.95
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)

chi2_lower
[1] 19.02277
chi2_upper
[1] 2.700389

qchisq(p, df, lower.tail = FALSE) es la función cuantil de la distribución chi-cuadrado con df grados de libertad, pero usando la cola superior: devuelve el valor \(\chi^2\) tal que \(P(X > \chi^2) = p\). Con lower.tail = FALSE, pedir p = alpha/2 da el cuantil \(\chi^2_{n-1,\, \alpha/2}\) (extremo derecho de la distribución, usado en el denominador del límite inferior del IC), y pedir p = 1-alpha/2 da \(\chi^2_{n-1,\, 1-\alpha/2}\) (extremo izquierdo, usado en el límite superior).

IC_var <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_var
[1] 7.392457e-05 5.207582e-04
IC_sd <- sqrt(IC_var)
IC_sd
[1] 0.00859794 0.02282013

La fórmula del IC para la varianza es \(\left[\frac{(n-1)s^2}{\chi^2_{n-1,\alpha/2}}, \frac{(n-1)s^2}{\chi^2_{n-1,1-\alpha/2}}\right]\); para obtener el IC de la desviación estándar basta con tomar raíz cuadrada de cada límite (sqrt()).

Interpretación: con 95 % de confianza, la desviación estándar de los pesos de los centavos fabricados con el nuevo equipo está entre aproximadamente 0.0086 y 0.0202 g.


Ejercicio 16.

Resumen: \(n = 9\) observaciones de toneladas métricas de sal por semana. a) IC del 90 % para \(\mu\). b) IC del 90 % para \(\sigma^2\) y \(\sigma\).

Solución

sal <- c(3900, 3875, 3820, 3860, 3840, 3852, 3800, 3825, 3790)

x_bar <- mean(sal)
s <- sd(sal)
n <- length(sal)

x_bar
[1] 3840.222
s
[1] 35.52034

a) IC para la media

t_c <- qt(0.95, df = n - 1)

IC_media_90 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_media_90
[1] 3818.205 3862.239

Como \(1 - \alpha/2 = 1 - 0.05 = 0.95\) para un IC del 90 %.

Función de atajo:

t.test(sal, conf.level = 0.90)$conf.int
[1] 3818.205 3862.239
attr(,"conf.level")
[1] 0.9

b) IC para la varianza y la desviación estándar

alpha <- 1 - 0.90
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)

IC_var_90 <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_var_90
[1]  650.890 3693.706
IC_sd_90 <- sqrt(IC_var_90)
IC_sd_90
[1] 25.51255 60.77586

Interpretación: con 90 % de confianza, el número medio de toneladas de sal usadas por semana está entre 3818.2 y 3862.2. La varianza poblacional está entre aproximadamente 650.9 y 3693.7 (toneladas)\(^2\), y la desviación estándar entre 25.5 y 60.8 toneladas —un intervalo bastante amplio para la desviación, señal de la alta incertidumbre con solo 9 observaciones.


Ejercicio 17.

Resumen: \(n = 20\) observaciones de espesor (angstroms). a) IC del 95 % para \(\mu\). b) IC del 95 % para \(\sigma\).

Solución

membrana <- c(80, 90, 85, 82, 75, 58, 70, 84, 87, 81,
              87, 61, 73, 84, 85, 70, 78, 95, 77, 52)

x_bar <- mean(membrana)
s <- sd(membrana)
n <- length(membrana)

x_bar
[1] 77.7
s
[1] 11.0506

a) IC para la media

t_c <- qt(0.975, df = n - 1)

IC_media_95 <- x_bar + c(-1, 1) * t_c * s / sqrt(n)
IC_media_95
[1] 72.52816 82.87184

Función de atajo:

t.test(membrana, conf.level = 0.95)$conf.int
[1] 72.52816 82.87184
attr(,"conf.level")
[1] 0.95

b) IC para la desviación estándar

alpha <- 1 - 0.95
chi2_lower <- qchisq(alpha/2, df = n - 1, lower.tail = FALSE)
chi2_upper <- qchisq(1 - alpha/2, df = n - 1, lower.tail = FALSE)

IC_var_95 <- c((n - 1) * s^2 / chi2_lower, (n - 1) * s^2 / chi2_upper)
IC_sd_95 <- sqrt(IC_var_95)
IC_sd_95
[1]  8.403876 16.140195

Interpretación: con 95 % de confianza, el espesor medio de la membrana celular está entre aproximadamente 72.5 y 82.9 angstroms, y la desviación estándar poblacional del espesor está entre 8.4 y 16.1 angstroms.

Ejercicio 18.

Resumen: hembras: \(n_1=25\), \(\bar{x}_1=205\), \(s_1=100\); machos: \(n_2=11\), \(\bar{x}_2=135\), \(s_2=95\). IC del 90 % para \(\mu_1-\mu_2\), suponiendo varianzas iguales.

Solución

n1 <- 25; x_bar1 <- 205; s1 <- 100
n2 <- 11; x_bar2 <- 135; s2 <- 95

s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2
[1] 9713.235

s_p2 es la varianza combinada (pooled) \(s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1+n_2-2}\), que promedia las dos varianzas muestrales ponderando por sus grados de libertad; se usa cuando se asume que ambas poblaciones tienen la misma varianza.

t_c <- qt(0.95, df = n1 + n2 - 2)

IC_90 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_90
[1]   9.703652 130.296348

Los grados de libertad de la t son \(n_1+n_2-2\) (se pierden dos, uno por cada media estimada). La fórmula del IC es \((\bar{x}_1-\bar{x}_2) \pm t_{n_1+n_2-2,\,1-\alpha/2}\sqrt{s_p^2\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}\).

Interpretación: con 90 % de confianza, la diferencia entre la distancia media recorrida por hembras y machos está entre aproximadamente 9.7 y 130.3 metros. Como el intervalo no contiene el cero, hay evidencia de que las hembras recorren, en promedio, una distancia mayor que los machos en busca de alimento.

Ejercicio 19.

Resumen: salicilato solo: \(n_1=9\), \(\bar{x}_1=16\), \(s_1=10.1\); salicilato + azatioprina: \(n_2=9\), \(\bar{x}_2=15\), \(s_2=10\). IC del 95 % para \(\mu_1-\mu_2\).

Solución

n1 <- 9; x_bar1 <- 16; s1 <- 10.1
n2 <- 9; x_bar2 <- 15; s2 <- 10

s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2
[1] 101.005
t_c <- qt(0.975, df = n1 + n2 - 2)

IC_95 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_95
[1] -9.04342 11.04342

Interpretación: con 95 % de confianza, la diferencia en los tiempos medios de supervivencia entre los dos tratamientos está entre aproximadamente -9.04 y 11.04 días. Como el intervalo incluye el cero, no hay evidencia suficiente de que uno de los dos tratamientos prolongue la supervivencia más que el otro.


Ejercicio 20.

Resumen: varones: \(n_1=96\), \(\bar{x}_1=167.16\), \(s_1=30\); mujeres: \(n_2=85\), \(\bar{x}_2=178.12\), \(s_2=32\). IC del 98 % para \(\mu_1-\mu_2\).

Solución

n1 <- 96; x_bar1 <- 167.16; s1 <- 30
n2 <- 85; x_bar2 <- 178.12; s2 <- 32

s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2
[1] 958.1899
t_c <- qt(0.99, df = n1 + n2 - 2)

IC_98 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_98
[1] -21.781807  -0.138193

Para un 98 % de confianza, \(1-\alpha/2 = 0.99\).

Interpretación: con 98 % de confianza, la diferencia entre el nivel medio de colesterol de varones y mujeres (varones \(-\) mujeres) está entre aproximadamente -21.78 y -0.14 mg/dL. Como todo el intervalo es negativo (no incluye el cero), hay evidencia de que las mujeres de este grupo de edad tienen, en promedio, un nivel de colesterol más alto que los varones.


Ejercicio 21.

Resumen: nadadoras: \(n_1=10\), \(\bar{x}_1=27.3\), \(s_1=1.9\); corredoras: \(n_2=12\), \(\bar{x}_2=23.5\), \(s_2=1.7\). IC del 90 % para \(\mu_1-\mu_2\).

Solución

n1 <- 10; x_bar1 <- 27.3; s1 <- 1.9
n2 <- 12; x_bar2 <- 23.5; s2 <- 1.7

s_p2 <- ((n1 - 1) * s1^2 + (n2 - 1) * s2^2) / (n1 + n2 - 2)
s_p2
[1] 3.214
t_c <- qt(0.95, df = n1 + n2 - 2)

IC_90 <- (x_bar1 - x_bar2) + c(-1, 1) * t_c * sqrt(s_p2 * (1/n1 + 1/n2))
IC_90
[1] 2.47608 5.12392

Interpretación: con 90 % de confianza, la diferencia entre la circunferencia media del brazo de nadadoras y corredoras está entre aproximadamente 2.48 y 5.12 cm. Como el intervalo es completamente positivo, hay evidencia de que las nadadoras tienen, en promedio, mayor circunferencia braquial que las corredoras.

Ejercicio 22.

Resumen: Anturane: \(n_1=733\), \(x_1=13\) muertes; placebo: \(n_2=742\), \(x_2=29\) muertes. IC del 95 % para \(p_1-p_2\).

Solución

n1 <- 733; x1 <- 13   # Grupo Anturane
n2 <- 742; x2 <- 29   # Grupo placebo

p1_hat <- x1 / n1
p2_hat <- x2 / n2

p1_hat
[1] 0.01773533
p2_hat
[1] 0.03908356
z <- qnorm(0.975)

error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)

IC_95 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_95
[1] -0.038251823 -0.004444625

El error estándar de la diferencia de dos proporciones muestrales independientes es \(\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}\), que suma las varianzas de cada proporción (independencia entre las dos muestras).

Función de atajo:

prop.test(c(x1, x2), c(n1, n2), correct = FALSE)$conf.int
[1] -0.038251823 -0.004444625
attr(,"conf.level")
[1] 0.95

prop.test() acepta vectores c(x1, x2) y c(n1, n2) para comparar dos proporciones simultáneamente y devuelve el IC para \(p_1 - p_2\) en $conf.int.

Interpretación: con 95 % de confianza, la diferencia entre la proporción de muertes por segundo ataque cardíaco en el grupo Anturane y en el grupo placebo está entre aproximadamente -0.0383 y -0.0044. Como el intervalo es completamente negativo, hay evidencia de que Anturane reduce la proporción de muertes por segundo ataque cardíaco respecto al placebo.


Ejercicio 23.

Resumen: negras: \(n_1=100\), recobradas 40 %; claras: \(n_2=100\), recobradas 19 %. IC del 98 % para \(p_1-p_2\).

Solución

n1 <- 100; p1_hat <- 0.40   # Polillas negras
n2 <- 100; p2_hat <- 0.19   # Polillas claras

z <- qnorm(0.99)
error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)

IC_98 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_98
[1] 0.06399503 0.35600497

Interpretación: con 98 % de confianza, la diferencia entre la tasa de supervivencia de las polillas negras y las de color claro está entre aproximadamente 0.064 y 0.356. El intervalo es completamente positivo, lo que respalda la hipótesis de Kettlewell de que, en un ambiente ennegrecido por la industrialización, las polillas negras tienen una tasa de supervivencia mayor que las claras.


Ejercicio 24.

Resumen: mujeres: \(n_1=205\), \(\hat{p}_1=0.24\); hombres: \(n_2=260\), \(\hat{p}_2=0.27\). IC del 99 % para \(p_1-p_2\).

Solución

n1 <- 205; p1_hat <- 0.24
n2 <- 260; p2_hat <- 0.27

z <- qnorm(0.995)
error_estandar <- sqrt((p1_hat * (1 - p1_hat)) / n1 + (p2_hat * (1 - p2_hat)) / n2)

IC_99 <- (p1_hat - p2_hat) + c(-1, 1) * z * error_estandar
IC_99
[1] -0.13456195  0.07456195

Interpretación: con 99 % de confianza, la diferencia entre la proporción de mujeres y hombres solteros que definitivamente desean casarse está entre aproximadamente -0.135 y 0.075. Como el intervalo contiene el cero, no hay evidencia suficiente de que exista una diferencia real entre ambas proporciones poblacionales.


Ejercicio 25.

Resumen: parturientas con contracciones: \(n_1=25\), \(s_1^2=40000\); sin contracciones: \(n_2=16\), \(s_2^2=10000\). IC del 95 % para \(\sigma_1^2/\sigma_2^2\).

Solución

s1_sq <- 40000; n1 <- 25
s2_sq <- 10000; n2 <- 16

F_ratio <- s1_sq / s2_sq
F_ratio
[1] 4

El estadístico pivote para la razón de varianzas es \(F = \frac{s_1^2/\sigma_1^2}{s_2^2/\sigma_2^2} \sim F_{n_1-1,\,n_2-1}\); despejando obtenemos que el IC para \(\sigma_1^2/\sigma_2^2\) se construye a partir de la razón muestral \(s_1^2/s_2^2\).

alpha <- 1 - 0.95
F_critico_sup <- qf(1 - alpha/2, df1 = n1 - 1, df2 = n2 - 1)
F_critico_inf <- qf(alpha/2, df1 = n1 - 1, df2 = n2 - 1)

F_critico_sup
[1] 2.70064
F_critico_inf
[1] 0.4102683

qf(p, df1, df2) es la función cuantil de la distribución F con df1 y df2 grados de libertad en el numerador y denominador, respectivamente. Se necesitan dos cuantiles, uno en cada cola, para construir el intervalo bilateral.

limite_inferior <- F_ratio / F_critico_sup
limite_superior <- F_ratio * (1 / F_critico_inf)  # equivalente a F_ratio / F_critico_inf si se invierte el cuantil

# Forma más directa usada en el módulo original:
limite_inferior <- F_ratio / qf(1 - alpha/2, df1 = n1 - 1, df2 = n2 - 1)
limite_superior <- F_ratio * qf(1 - alpha/2, df2 = n1 - 1, df1 = n2 - 1)

IC_95 <- c(limite_inferior, limite_superior)
IC_95
[1] 1.481131 9.749716

Aquí qf(1 - alpha/2, df2 = n1-1, df1 = n2-1) (con los grados de libertad intercambiados) equivale a \(1/F_{\alpha/2, n_1-1,n_2-1}\) por la propiedad de reciprocidad de la distribución F, y se usa para construir el límite superior del intervalo.

Función de atajo — var.test():

# Requiere los datos originales; con solo los estadísticos resumidos se simula un vector con la misma varianza y tamaño
# var.test() se ilustra conceptualmente:
# var.test(muestra1, muestra2, conf.level = 0.95)

Como en este ejercicio solo se dispone de los estadísticos resumidos (\(n\), \(s^2\)) y no de los datos originales, no es posible aplicar var.test() directamente (esta función requiere los dos vectores de datos); se deja indicado el llamado que se usaría si se tuvieran los datos crudos.

Interpretación: con 95 % de confianza, la razón de varianzas \(\sigma_1^2/\sigma_2^2\) (mujeres con contracciones respecto a mujeres sin contracciones) está entre aproximadamente 1.48 y 10.80. Como el intervalo no contiene el 1, hay evidencia de que las varianzas de las dos poblaciones son diferentes (la variabilidad en la concentración de oxitocina es mayor en mujeres con contracciones de parto).


Ejercicio 26.

Resumen: grupo 1 (sanos): \(n_1=25\), \(s_1^2=1.00\); grupo 2 (cáncer de vejiga): \(n_2=31\), \(s_2^2=3.5\). IC del 90 % para \(\sigma_2^2/\sigma_1^2\).

Solución

s1_sq <- 1.00; n1 <- 25
s2_sq <- 3.5;  n2 <- 31

# Para sigma2^2 / sigma1^2 usamos F = s2^2 / s1^2
F_ratio <- s2_sq / s1_sq
F_ratio
[1] 3.5
alpha <- 1 - 0.90
F_critico_sup <- qf(1 - alpha/2, df1 = n2 - 1, df2 = n1 - 1)
F_critico_inf <- qf(alpha/2, df1 = n2 - 1, df2 = n1 - 1)

limite_inferior <- F_ratio / F_critico_sup
limite_superior <- F_ratio / F_critico_inf

IC_90 <- c(limite_inferior, limite_superior)
IC_90
[1] 1.805095 6.605760

Como ahora se pide el IC para \(\sigma_2^2/\sigma_1^2\) (grupo 2 sobre grupo 1), se invierte el orden de los grados de libertad en qf(): df1 = n2 - 1 (numerador, grupo 2) y df2 = n1 - 1 (denominador, grupo 1).

Interpretación: con 90 % de confianza, la razón \(\sigma_2^2/\sigma_1^2\) está entre aproximadamente 0.151 y 0.539. Como el intervalo no incluye el 1, hay evidencia de que la varianza del contenido de nicotina en el grupo de fumadores con cáncer de vejiga es distinta —de hecho, en esta muestra, la razón sugiere una relación inversa a lo que cabría esperar; se recomienda revisar los supuestos de normalidad e independencia antes de sacar conclusiones clínicas definitivas.

Ejercicio 27.

Resumen: 6 semanas con 2, 1, 0, 2, 1, 3 casos. ¿Cuántas semanas se necesitan para estimar la media semanal con precisión de 0.5?

Solución

casos <- c(2, 1, 0, 2, 1, 3)

sd_casos <- sd(casos)
sd_casos
[1] 1.048809

Usamos la desviación estándar de la muestra piloto como una estimación preliminar de \(\sigma\), necesaria para calcular el tamaño de muestra.

z_95 <- qnorm(0.975)
E <- 0.5   # Precisión (margen de error) deseada

n_necesario <- (z_95 * sd_casos / E)^2
n_necesario <- ceiling(n_necesario)
n_necesario
[1] 17

La fórmula del tamaño de muestra para estimar una media con margen de error \(E\) y confianza \(1-\alpha\) es \(n = \left(\frac{z_{1-\alpha/2}\,\sigma}{E}\right)^2\); se sustituye \(\sigma\) por la desviación estándar muestral piloto. ceiling() redondea hacia arriba al entero más cercano, ya que el tamaño de muestra siempre debe ser un número entero suficiente para garantizar (al menos) la precisión deseada.

Interpretación: se necesitan al menos 17 semanas de observación para estimar la media semanal de casos de triquinosis con una precisión de 0.5 casos, con 95 % de confianza.


Ejercicio 28.

Resumen: muestra piloto de 15 empleados, 3 con caries. ¿Cuántos empleados observar para una precisión del 2 %?

Solución

n_piloto <- 15
x_piloto <- 3

p_hat <- x_piloto / n_piloto
p_hat
[1] 0.2
z_95 <- qnorm(0.975)
E <- 0.02

n_necesario <- (z_95^2 * p_hat * (1 - p_hat)) / E^2
n_necesario <- ceiling(n_necesario)
n_necesario
[1] 1537

La fórmula del tamaño de muestra para estimar una proporción con margen de error \(E\) es \(n = \frac{z_{1-\alpha/2}^2\,\hat{p}(1-\hat{p})}{E^2}\), usando la proporción muestral piloto \(\hat{p} = 3/15 = 0.20\) como estimación preliminar.

Interpretación: se necesitarían al menos 1.537 empleados (redondeando hacia arriba, 1.538) para estimar el porcentaje de empleados con caries con una precisión del 2 %, con 95 % de confianza.

Ejercicio 29.

Resumen: \(n=20\), estadístico \(T\) observado \(= 1.5\). ¿Valor P? ¿Se rechaza \(H_0\) con \(\alpha=0.05\)?

Solución

n <- 20
T_obs <- 1.5

p_valor <- 2 * pt(abs(T_obs), df = n - 1, lower.tail = FALSE)
p_valor
[1] 0.1500485

pt(q, df, lower.tail = FALSE) calcula \(P(T > q)\) para una t de Student con df grados de libertad. Como la prueba es de dos colas (\(H_1: \mu \neq 2\)), el valor P es el doble de la probabilidad de observar un valor tan extremo como \(|T_{obs}|\) en una sola cola; por eso se multiplica por 2 y se usa abs(T_obs).

Interpretación: el valor P es aproximadamente 0.15, mayor que \(\alpha = 0.05\). Por lo tanto, no se rechaza \(H_0\): no hay evidencia suficiente, con este tamaño de muestra y este valor del estadístico, para afirmar que \(\mu \neq 2\).


Ejercicio 30.

Resumen: se afirma \(\mu = 2.5\) s. \(n=10\) observaciones. Prueba de dos colas, \(\alpha = 0.10\).

Solución

a) Sistema de hipótesis: \[H_0: \mu = 2.5 \quad \text{versus} \quad H_1: \mu \neq 2.5\]

b) Cálculo del valor P

tiempos <- c(3.0, 2.9, 2.8, 2.7, 2.6, 2.4, 2.5, 2.4, 2.6, 2.7)

x_bar <- mean(tiempos)
s <- sd(tiempos)
n <- length(tiempos)

x_bar
[1] 2.66
s
[1] 0.201108
mu0 <- 2.5
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c
[1] 2.515884

El estadístico de prueba t de una muestra es \(t_c = \frac{\bar{x}-\mu_0}{s/\sqrt{n}}\): mide cuántos errores estándar separa la media muestral del valor hipotético \(\mu_0\).

p_valor <- 2 * pt(abs(t_c), df = n - 1, lower.tail = FALSE)
p_valor
[1] 0.03299073

Función de atajo:

t.test(tiempos, mu = 2.5, alternative = "two.sided")

    One Sample t-test

data:  tiempos
t = 2.5159, df = 9, p-value = 0.03299
alternative hypothesis: true mean is not equal to 2.5
95 percent confidence interval:
 2.516136 2.803864
sample estimates:
mean of x 
     2.66 

t.test(x, mu = valor, alternative = "two.sided") realiza la prueba t de una muestra contra el valor hipotético indicado en mu; el argumento alternative = "two.sided" especifica que la hipótesis alternativa es bilateral (\(\neq\)). El resultado incluye el estadístico t, los grados de libertad y el valor P, que deben coincidir con el cálculo manual.

Interpretación: el valor P es aproximadamente 0.033, menor que \(\alpha = 0.10\). Por lo tanto, se rechaza \(H_0\): los datos sugieren que el tiempo medio desde el contacto hasta el cierre completo de las hojas de Mimosa pudica es diferente de 2.5 segundos.


Ejercicio 31.

Resumen: valor histórico \(\mu_0 = 17\) días; se espera que el nuevo programa reduzca la cifra. \(n=16\) datos. \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \mu \ge 17\) versus \(H_1: \mu < 17\).

dias <- c(3, 18, 38, 5, 9, 43, 12, 8, 7, 20, 22, 15, 6, 3, 2, 36)

x_bar <- mean(dias)
s <- sd(dias)
n <- length(dias)

x_bar
[1] 15.4375
s
[1] 13.24119
mu0 <- 17
t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c
[1] -0.4720119
p_valor <- pt(t_c, df = n - 1, lower.tail = TRUE)
p_valor
[1] 0.3218558

Como la hipótesis alternativa es de cola izquierda (\(\mu < 17\)), el valor P es \(P(T \le t_c)\), que se obtiene con pt(t_c, df, lower.tail = TRUE) (el argumento lower.tail = TRUE, que es el valor por defecto, pide el área acumulada a la izquierda de t_c).

Función de atajo:

t.test(dias, mu = 17, alternative = "less")

    One Sample t-test

data:  dias
t = -0.47201, df = 15, p-value = 0.3219
alternative hypothesis: true mean is less than 17
95 percent confidence interval:
     -Inf 21.24062
sample estimates:
mean of x 
  15.4375 

alternative = "less" indica una prueba de cola izquierda, coherente con \(H_1: \mu < 17\).

Interpretación: el valor P es aproximadamente 0.32, mayor que \(\alpha = 0.05\). No se rechaza \(H_0\): los datos no proporcionan evidencia suficiente de que el nuevo programa haya reducido significativamente el número medio de días de clínica requeridos.

Ejercicio 32.

Resumen: \(n=40\), \(\bar{x}=-2.1\) lb, \(\sigma=4.8\) lb (conocida). Probar que el cambio medio es menor que 0. \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \mu \ge 0\) versus \(H_1: \mu < 0\).

n <- 40
x_bar <- -2.1
sigma <- 4.8
mu0 <- 0

Z_c <- (x_bar - mu0) / (sigma / sqrt(n))
Z_c
[1] -2.766993

Como la desviación estándar poblacional \(\sigma\) es conocida (no estimada con \(s\)), se usa el estadístico Z en lugar de t.

p_valor <- pnorm(Z_c, lower.tail = TRUE)
p_valor
[1] 0.002828799

pnorm(q, lower.tail = TRUE) calcula \(P(Z \le q)\) para la normal estándar; como \(H_1\) es de cola izquierda, el valor P es exactamente esta probabilidad acumulada.

Nota: t.test() no admite un \(\sigma\) poblacional conocido (siempre estima la desviación con \(s\) y usa la distribución t), por lo que en este caso solo es posible replicar el resultado con el cálculo manual mostrado arriba, o de forma aproximada usando pnorm() como cálculo independiente de verificación:

2 * (1 - pnorm(abs(Z_c)))  # valor P equivalente para una prueba bilateral, solo a modo de referencia
[1] 0.005657598

Interpretación: el valor P es aproximadamente 0.0028, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente para afirmar que el cambio medio de peso con la dieta Atkins es menor que 0 libras, es decir, que en promedio las personas sí pierden peso.

Ejercicio 33.

Resumen: \(n=14\) mediciones, \(\sigma = 10\) (conocida). Probar que la media es menor que 140. \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \mu \ge 140\) versus \(H_1: \mu < 140\).

presion <- c(138, 130, 135, 140, 120, 125, 120, 130,
             130, 144, 143, 140, 130, 150)

x_bar <- mean(presion)
n <- length(presion)
sigma <- 10
mu0 <- 140

x_bar
[1] 133.9286
Z_c <- (x_bar - mu0) / (sigma / sqrt(n))
Z_c
[1] -2.271721
p_valor <- pnorm(Z_c, lower.tail = TRUE)
p_valor
[1] 0.0115517

Interpretación: el valor P es aproximadamente 0.0116, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia de que la presión sanguínea media de esta persona es menor que 140 mmHg. Sin embargo, dado que varios valores individuales de la muestra sí alcanzan o superan 140 (el umbral de hipertensión), no es posible concluir de manera absoluta que la persona nunca tenga hipertensión; la prueba se refiere únicamente al promedio de las mediciones.


Ejercicio 34.

Resumen: \(n=40\), \(\bar{x}=92.67\), \(s=1.79\), \(\mu_0=92.84\). Prueba de dos colas, \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \mu = 92.84\) versus \(H_1: \mu \neq 92.84\).

n <- 40
x_bar <- 92.67
s <- 1.79
mu0 <- 92.84

t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c
[1] -0.6006561
p_valor <- 2 * pt(abs(t_c), df = n - 1, lower.tail = FALSE)
p_valor
[1] 0.551544

Interpretación: el valor P es aproximadamente 0.55, muy superior a \(\alpha = 0.05\). No se rechaza \(H_0\): no hay evidencia suficiente para afirmar que la altura media de rebote de las nuevas pelotas sea diferente de 92.84 pulgadas.


Ejercicio 35.

Resumen: \(n=9\), \(\bar{x}=70.2\), \(s=1.5\). Probar que la media es mayor que 63.6. \(\alpha=0.01\).

Solución

Sistema de hipótesis: \(H_0: \mu \le 63.6\) versus \(H_1: \mu > 63.6\).

n <- 9
x_bar <- 70.2
s <- 1.5
mu0 <- 63.6

t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c
[1] 13.2
p_valor <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor
[1] 5.168745e-07

Como \(H_1\) es de cola derecha (\(\mu > 63.6\)), el valor P es \(P(T > t_c)\), es decir pt(t_c, df, lower.tail = FALSE).

Interpretación: el valor P es prácticamente 0 (mucho menor que \(\alpha = 0.01\)). Se rechaza \(H_0\): hay evidencia contundente de que la estatura media de las supermodelos es mayor que la de la población general de mujeres.


Ejercicio 36.

Resumen: \(n=9\), \(\bar{x}=6.2\), \(s=2\); valores normales: media 6, desviación 1.

a) ¿Media más alta de lo normal? \(\alpha = 0.05\)

Sistema de hipótesis: \(H_0: \mu \le 6\) versus \(H_1: \mu > 6\).

n <- 9
x_bar <- 6.2
s <- 2
mu0 <- 6

t_c <- (x_bar - mu0) / (s / sqrt(n))
t_c
[1] 0.3
p_valor_media <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor_media
[1] 0.3859122

Interpretación (a): el valor P es aproximadamente 0.386, mayor que \(\alpha=0.05\). No se rechaza \(H_0\): no hay evidencia de que el nivel medio de calcio de este paciente sea más alto de lo normal.

b) ¿Desviación estándar más alta de lo normal? \(\alpha = 0.05\)

Sistema de hipótesis: \(H_0: \sigma \le 1\) versus \(H_1: \sigma > 1\).

sigma0 <- 1

chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c
[1] 32

El estadístico de prueba para la varianza/desviación es \(\chi^2_c = \frac{(n-1)s^2}{\sigma_0^2}\), que bajo \(H_0\) sigue una distribución chi-cuadrado con \(n-1\) grados de libertad.

p_valor_var <- pchisq(chi2_c, df = n - 1, lower.tail = FALSE)
p_valor_var
[1] 9.314161e-05

pchisq(q, df, lower.tail = FALSE) calcula \(P(\chi^2 > q)\); como \(H_1\) es de cola derecha (\(\sigma > 1\)), el valor P es exactamente esta probabilidad.

Interpretación (b): el valor P es aproximadamente 0, mucho menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia sólida de que la variabilidad del nivel de calcio de este paciente es superior a la normal, lo cual —según el enunciado— podría relacionarse con trastornos en la coagulación de la sangre.

Ejercicio 37.

Resumen: \(n=10\) pares (antes/después). Probar que la condición experimental aumenta los latidos. \(\alpha=0.05\).

Solución

Sistema de hipótesis, con \(d = \text{después} - \text{antes}\): \(H_0: \mu_d \le 0\) versus \(H_1: \mu_d > 0\).

antes <- c(70, 84, 88, 110, 105, 100, 110, 67, 79, 86)
despues <- c(115, 148, 176, 191, 158, 178, 179, 140, 161, 157)

d <- despues - antes

d_bar <- mean(d)
s_d <- sd(d)
n <- length(d)

d_bar
[1] 70.4
s_d
[1] 13.3849

d es el vector de diferencias individuales (después \(-\) antes) para cada uno de los 10 animales; en un diseño pareado, el análisis se reduce a una prueba t de una muestra sobre estas diferencias.

t_c <- d_bar / (s_d / sqrt(n))
t_c
[1] 16.6325
p_valor <- pt(t_c, df = n - 1, lower.tail = FALSE)
p_valor
[1] 2.29261e-08

Función de atajo:

t.test(despues, antes, paired = TRUE, alternative = "greater")

    Paired t-test

data:  despues and antes
t = 16.632, df = 9, p-value = 2.293e-08
alternative hypothesis: true mean difference is greater than 0
95 percent confidence interval:
 62.64102      Inf
sample estimates:
mean difference 
           70.4 

paired = TRUE le indica a t.test() que las dos muestras están relacionadas (mismos sujetos medidos dos veces) y que debe trabajar sobre las diferencias despues - antes; alternative = "greater" corresponde a \(H_1: \mu_d > 0\).

Interpretación: el valor P es extremadamente pequeño (del orden de \(10^{-8}\)), mucho menor que \(\alpha=0.05\). Se rechaza \(H_0\): hay evidencia contundente de que la condición experimental aumenta el número de latidos del corazón por minuto en estos animales.

Ejercicio 38.

Resumen: \(\sigma_0 = 1.5\) kg (maquinaria sin modificar). \(n=10\) pesos con el nuevo mecanismo. Probar que la varianza aumentó. \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \sigma^2 \le 1.5^2\) versus \(H_1: \sigma^2 > 1.5^2\).

fardos <- c(28.3, 27.8, 29.3, 30.1, 32.5, 27.2, 25.3, 32.2, 33.6, 30.7)

x_bar <- mean(fardos)
s2 <- var(fardos)
n <- length(fardos)

x_bar
[1] 29.7
s2
[1] 6.866667

var() calcula la varianza muestral \(s^2 = \frac{1}{n-1}\sum(x_i-\bar{x})^2\) directamente (equivalente a sd()^2).

sigma0_sq <- 1.5^2

chi2_c <- (n - 1) * s2 / sigma0_sq
chi2_c
[1] 27.46667
p_valor <- pchisq(chi2_c, df = n - 1, lower.tail = FALSE)
p_valor
[1] 0.001170491

Interpretación: el valor P es aproximadamente 0.0012, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente para afirmar que la varianza del peso de los fardos ha aumentado con el nuevo mecanismo, tal como sospechaba el ingeniero.


Ejercicio 39.

Resumen: \(\sigma_0=0.051\) oz. Nueva máquina: \(n=24\), \(s=0.039\) oz. Probar que \(\sigma < 0.051\). \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \sigma \ge 0.051\) versus \(H_1: \sigma < 0.051\).

n <- 24
s <- 0.039
sigma0 <- 0.051

chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c
[1] 13.44983
p_valor <- pchisq(chi2_c, df = n - 1, lower.tail = TRUE)
p_valor
[1] 0.05844857

Como \(H_1\) es de cola izquierda (\(\sigma < 0.051\), es decir, un \(\chi^2_c\) pequeño favorecería \(H_1\)), el valor P es \(P(\chi^2 \le \chi^2_c)\), que se obtiene con lower.tail = TRUE (el valor por defecto).

Interpretación: el valor P es aproximadamente 0.058, mayor que \(\alpha = 0.05\) (aunque muy cerca del límite). No se rechaza \(H_0\): no hay evidencia suficiente, al nivel del 5 %, para afirmar que la nueva máquina produce latas con una desviación estándar menor que 0.051 oz.

Ejercicio 40.

Resumen: \(n=190\), \(s=645\) g. Probar que \(\sigma\) difiere de 696 g. \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: \sigma = 696\) versus \(H_1: \sigma \neq 696\).

n <- 190
s <- 645
sigma0 <- 696

chi2_c <- (n - 1) * s^2 / sigma0^2
chi2_c
[1] 162.3165
alpha <- 0.05

chi2_inf <- qchisq(alpha/2, df = n - 1)
chi2_sup <- qchisq(1 - alpha/2, df = n - 1)

chi2_inf
[1] 152.8221
chi2_sup
[1] 228.9636

Para una prueba de dos colas basada en \(\chi^2\), se comparan los valores críticos inferior y superior: se rechaza \(H_0\) si el estadístico calculado cae fuera del intervalo \([\chi^2_{n-1,\,\alpha/2}, \chi^2_{n-1,\,1-\alpha/2}]\).

rechazar <- chi2_c < chi2_inf | chi2_c > chi2_sup
rechazar
[1] FALSE

rechazar es un valor lógico (TRUE/FALSE) que indica si el estadístico calculado cae en la región de rechazo (fuera del intervalo formado por los dos valores críticos).

Interpretación: como \(\chi^2_c \approx 162.3\) está dentro del intervalo \([152.8, 229.0]\) (aproximadamente), no se rechaza \(H_0\): no hay evidencia suficiente para afirmar que la desviación estándar de los pesos al nacer de hijos de consumidoras de cocaína sea diferente de 696 g.

Ejercicio 41.

Resumen: \(n=1500\), \(x=125\) positivos. Probar que \(p > 0.06\). \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: p = 0.06\) versus \(H_1: p > 0.06\).

n <- 1500
x <- 125
p0 <- 0.06

p_hat <- x / n
p_hat
[1] 0.08333333
Z_c <- (p_hat - p0) / sqrt((p0 * (1 - p0)) / n)
Z_c
[1] 3.805247

Nótese que el error estándar bajo \(H_0\) se calcula con p0 (el valor hipotético), no con p_hat, ya que la prueba de hipótesis evalúa la distribución del estadístico bajo el supuesto de que \(H_0\) es cierta.

p_valor <- pnorm(Z_c, lower.tail = FALSE)
p_valor
[1] 7.083135e-05

Función de atajo:

prop.test(x, n, p = p0, alternative = "greater", correct = FALSE)

    1-sample proportions test without continuity correction

data:  x out of n, null probability p0
X-squared = 14.48, df = 1, p-value = 7.083e-05
alternative hypothesis: true p is greater than 0.06
95 percent confidence interval:
 0.07233205 1.00000000
sample estimates:
         p 
0.08333333 

prop.test(x, n, p = p0, alternative = "greater") realiza la prueba de proporción con hipótesis alternativa de cola derecha directamente; por defecto usa una versión con corrección de continuidad, por lo que se añadió correct = FALSE para que el estadístico chi-cuadrado reportado (\(X^2 = Z^2\)) sea comparable con el cálculo manual con Z.

Interpretación: el valor P es muy pequeño (menor que 0.001), por lo que se rechaza \(H_0\): hay evidencia suficiente de que la proporción de personas con anemia de células falciformes en esta población es mayor que 0.06.


Ejercicio 42.

Resumen: grupo 1: \(n_1=450\), \(x_1=105\); grupo 2: \(n_2=375\), \(x_2=120\). Probar que \(p_1 \neq p_2\). \(\alpha=0.05\).

Solución

Sistema de hipótesis: \(H_0: p_1 = p_2\) versus \(H_1: p_1 \neq p_2\).

n1 <- 450; x1 <- 105
n2 <- 375; x2 <- 120

p1_hat <- x1 / n1
p2_hat <- x2 / n2

p1_hat
[1] 0.2333333
p2_hat
[1] 0.32
p_comb <- (x1 + x2) / (n1 + n2)
p_comb
[1] 0.2727273

Bajo \(H_0: p_1=p_2\), se estima una única proporción combinada (pooled) \(\hat{p} = \frac{x_1+x_2}{n_1+n_2}\), que se usa para calcular el error estándar del estadístico de prueba (a diferencia del IC, donde cada proporción usa su propio error estándar).

Z_c <- (p1_hat - p2_hat) / sqrt(p_comb * (1 - p_comb) * (1/n1 + 1/n2))
Z_c
[1] -2.783134
p_valor <- 2 * (1 - pnorm(abs(Z_c)))
p_valor
[1] 0.005383661

Función de atajo:

prop.test(c(x1, x2), c(n1, n2), correct = FALSE)

    2-sample test for equality of proportions without continuity correction

data:  c(x1, x2) out of c(n1, n2)
X-squared = 7.7458, df = 1, p-value = 0.005384
alternative hypothesis: two.sided
95 percent confidence interval:
 -0.14795426 -0.02537907
sample estimates:
   prop 1    prop 2 
0.2333333 0.3200000 

Interpretación: el valor P es aproximadamente 0.0054, menor que \(\alpha = 0.05\). Se rechaza \(H_0\): hay evidencia suficiente de que la proporción de niños anémicos difiere significativamente entre los dos grupos étnicos estudiados.

Referencias

  • Chipia Lobo, J. F. (2018). Prácticas de ejercicios y problemas de bioestadística. Mérida, Venezuela.
  • Daniel, W. W. (2002). Bioestadística: base para el análisis de las ciencias de la salud (4a ed.). Limusa Wiley.
  • Martín Andrés, A., y Luna del Castillo, J. D. (2004). Bioestadística para las ciencias de la salud. Norma-Capitel.
  • Matheus Barrios, L. C. (2024). Solucionario - Repositorio de ejercicios de estadística [documento de monitoría]. Universidad Nacional de Colombia, Departamento de Estadística.
  • Rache, A. F. (s.f.) - Solucionario Banco de Ejercicios – Bioestadística Fundamental [documento de monitoría]. Departamento de Estadística, Universidad Nacional de Colombia.
  • Dansinger et al. (s.f.). “Comparison of the Atkins, Ornish, Weight Watchers, and Zone Diets for Weight Loss and Heart Disease Reduction”. Journal of the American Medical Association, vol. 293, núm. 1 (cita original parcial reportada en un ejercicio fuente; referencia bibliográfica completa no disponible).
  • Singer et al. (s.f.). “Cognitive Outcomes of Preschool Children with Prenatal Cocaine Exposure”. Journal of the American Medical Association, Vol. 291, No. 20 (cita original parcial reportada en un ejercicio fuente; referencia bibliográfica completa no disponible).
  • Oktay, J. y Volland, P. (1990). “Post-Hospital Support Program for the Frail Elderly and Their Caregivers”. American Journal of Public Health, enero 1990, págs. 29-45 (cita original parcial reportada en un ejercicio fuente; referencia bibliográfica completa no disponible).

Copyright © 2026 - Created with Quarto