output: html_document
Se quiere comparar la variación de una sustancia tóxica en dos ríos contaminados. Se tomaron:
Se supone que ambas poblaciones son normales e independientes.
Primero se calcula la varianza para cada muestra.
Río 1:
\[
\bar{x}_1 = \frac{9 + 8 + 10 + 12 + 13 + 12 + 10 + 14 + 10 + 12}{10} =
11
\]
\[
s_1^2 = \frac{\sum (x_i - \bar{x}_1)^2}{n_1 - 1} \approx 3.33
\]
Río 2:
\[
\bar{x}_2 = \frac{7 + 10 + 8 + 8 + 9 + 10 + 8}{7} \approx 8.57
\]
\[
s_2^2 = \frac{\sum (x_i - \bar{x}_2)^2}{n_2 - 1} \approx 1.29
\]
Para un intervalo del 95%, se tienen los percentiles:
Se calcula el cociente de varianzas:
\[ \frac{s_1^2}{s_2^2} = \frac{3.33}{1.29} \approx 2.58 \]
El intervalo de confianza es:
\[ \left( \frac{3.33}{1.29} \cdot \frac{1}{5.12}, \frac{3.33}{1.29} \cdot \frac{1}{0.25} \right) = (0.50, 10.32) \]
Como el IC del cociente de varianzas contiene al 1, se asume igualdad de varianzas.
Cálculo de varianza combinada:
\[ s_p^2 = \frac{(n_1 - 1)s_1^2 + (n_2 - 1)s_2^2}{n_1 + n_2 - 2} \approx 2.47 \]
Error estándar:
\[ SE = \sqrt{s_p^2 \left( \frac{1}{n_1} + \frac{1}{n_2} \right)} \approx 0.79 \]
Grados de libertad: \(gl =
15\)
\(t_{0.975, 15} \approx 2.131\)
Intervalo de confianza:
\[ (11 - 8.57) \pm 2.131 \cdot 0.79 = 2.43 \pm 1.68 = (0.75, 4.11) \]
Se quiere comparar la variación de cierta sustancia tóxica en dos ríos contaminados. Se toman:
Asumimos que las poblaciones son normales e independientes.
# Datos
rio1 <- c(9, 8, 10, 12, 13, 12, 10, 14, 10, 12)
rio2 <- c(7, 10, 8, 8, 9, 10, 8)
# Estadísticos
n1 <- length(rio1)
n2 <- length(rio2)
s1 <- sd(rio1)
s2 <- sd(rio2)
m1 <- mean(rio1)
m2 <- mean(rio2)
list(n1 = n1, n2 = n2, s1 = s1, s2 = s2, m1 = m1, m2 = m2)
## $n1
## [1] 10
##
## $n2
## [1] 7
##
## $s1
## [1] 1.885618
##
## $s2
## [1] 1.133893
##
## $m1
## [1] 11
##
## $m2
## [1] 8.571429
\[ \left( \frac{s_1^2}{s_2^2} \cdot \frac{1}{F_{1-\alpha/2}},\ \frac{s_1^2}{s_2^2} \cdot \frac{1}{F_{\alpha/2}} \right) \]
# Cociente observado
ratio_observado <- (s1^2) / (s2^2)
# Grados de libertad
gl1 <- n1 - 1
gl2 <- n2 - 1
# Valores críticos F
alpha <- 0.05
f_izq <- qf(1 - alpha/2, df1 = gl1, df2 = gl2)
f_der <- qf(alpha/2, df1 = gl1, df2 = gl2)
# Intervalo
lower_var <- ratio_observado / f_izq
upper_var <- ratio_observado / f_der
IC_varianzas <- c(lower_var, upper_var)
IC_varianzas
## [1] 0.5006751 11.9458974
¿Son diferentes las varianzas? Si el intervalo contiene al valor 1, no hay evidencia suficiente para decir que las varianzas son diferentes.
Si el IC anterior contiene al 1, asumimos varianzas iguales. Usamos fórmula para diferencia de medias:
# Pooled variance (si varianzas son iguales)
sp2 <- (((n1 - 1)*(s1^2)) + ((n2 - 1)*(s2^2))) / (n1 + n2 - 2)
sp <- sqrt(sp2)
# Error estándar
se_diff <- sp * sqrt(1/n1 + 1/n2)
# Grados de libertad para t
gl_t <- n1 + n2 - 2
# Valor crítico t
t_crit <- qt(1 - alpha/2, df = gl_t)
# Intervalo
diff_media <- m1 - m2
IC_media <- c(diff_media - t_crit * se_diff, diff_media + t_crit * se_diff)
IC_media
## [1] 0.719429 4.137714
¿Son diferentes las medias? Si el intervalo no contiene el 0, entonces sí hay diferencia significativa entre las medias poblacionales.
library(ggplot2)
# Data para gráfico de varianzas
df_var <- data.frame(
Estadistico = "Cociente de varianzas",
Valor = ratio_observado,
Lower = lower_var,
Upper = upper_var
)
# Gráfico pastel de varianzas
ggplot(df_var, aes(x = Estadistico, y = Valor)) +
geom_point(size = 4, color = "#89CFF0") +
geom_errorbar(aes(ymin = Lower, ymax = Upper), width = 0.2, color = "#FFB6C1", linewidth = 1.5) +
geom_hline(yintercept = 1, linetype = "dashed", color = "#90EE90") +
labs(title = "IC del cociente de varianzas", y = expression(frac(sigma[1]^2, sigma[2]^2)), x = "") +
theme_minimal()
Con base en los resultados obtenidos:
El intervalo de confianza del 95% para el cociente de varianzas fue aproximadamente (0.50, 10.32), lo cual incluye el valor 1. Esto sugiere que no hay evidencia suficiente para afirmar que las varianzas poblacionales son diferentes, por lo que se puede asumir que la variabilidad en los niveles de toxicidad es similar en ambos ríos.
El intervalo de confianza del 95% para la diferencia de medias fue aproximadamente (0.75, 4.11), lo cual no incluye el valor 0. Esto indica que sí hay evidencia de una diferencia significativa entre las medias poblacionales, y por tanto, los niveles promedio de toxicidad difieren entre ambos ríos.
En términos prácticos, estos resultados permiten concluir que aunque la variabilidad de los niveles de la sustancia tóxica no parece ser diferente entre los ríos, el promedio de concentración sí lo es, por lo que se recomienda realizar un seguimiento más detallado al río con mayor nivel medio de contaminación.