1 Resumen

El análisis de varianza suele introducirse mediante la comparación entre la variabilidad entre grupos y la variabilidad dentro de los grupos. Sin embargo, para comprender con rigor por qué la estadística \(F\) funciona y qué representa cada cuadrado medio, es necesario avanzar desde la descomposición algebraica de la variabilidad observada hacia la interpretación probabilística de los cuadrados medios.

Este documento desarrolla el siguiente recorrido conceptual:

\[ \text{variabilidad} \longrightarrow \text{sumas de cuadrados} \longrightarrow \text{grados de libertad} \longrightarrow \text{cuadrados medios} \longrightarrow \text{tabla ANOVA} \longrightarrow \text{esperanza de los cuadrados medios}. \]

El desarrollo se realiza para un diseño balanceado de un factor aleatorio, con énfasis en la interpretación de

\[ E(CM_E)=\sigma^2 \]

y

\[ E(CM_A)=\sigma^2+n\sigma_\alpha^2. \]

2 Objetivos de aprendizaje

Al finalizar este documento, el lector podrá:

  1. Explicar cómo se descompone la variabilidad total en un ANOVA de un factor.
  2. Interpretar las sumas de cuadrados de factor, error y total.
  3. Justificar el uso de los grados de libertad.
  4. Diferenciar una suma de cuadrados de un cuadrado medio.
  5. Interpretar la tabla ANOVA desde un punto de vista descriptivo.
  6. Comprender por qué los cuadrados medios son variables aleatorias.
  7. Derivar la esperanza del cuadrado medio del error.
  8. Derivar la esperanza del cuadrado medio del factor aleatorio.
  9. Relacionar los cuadrados medios esperados con la prueba \(F\).

3 1. Punto de partida: la variabilidad de las observaciones

Supóngase que se estudian \(a\) sucursales y que en cada sucursal se observan \(n\) unidades. El número total de observaciones es

\[ N=an. \]

La observación

\[ Y_{ij} \]

representa el valor correspondiente a la observación \(j\) dentro de la sucursal \(i\), donde

\[ i=1,\ldots,a, \qquad j=1,\ldots,n. \]

La media de la sucursal \(i\) es

\[ \bar Y_{i\cdot} = \frac{1}{n} \sum_{j=1}^{n}Y_{ij}, \]

mientras que la media general es

\[ \bar Y_{\cdot\cdot} = \frac{1}{N} \sum_{i=1}^{a} \sum_{j=1}^{n}Y_{ij}. \]

La variabilidad total se estudia preguntando:

¿Qué tan lejos se encuentra cada observación de la media general?

La desviación total de una observación es

\[ Y_{ij}-\bar Y_{\cdot\cdot}. \]

Esta desviación puede descomponerse sumando y restando la media de su propia sucursal:

\[ Y_{ij}-\bar Y_{\cdot\cdot} = \left( Y_{ij}-\bar Y_{i\cdot} \right) + \left( \bar Y_{i\cdot}-\bar Y_{\cdot\cdot} \right). \]

El primer término,

\[ Y_{ij}-\bar Y_{i\cdot}, \]

representa la desviación de la observación respecto de la media de su sucursal.

El segundo término,

\[ \bar Y_{i\cdot}-\bar Y_{\cdot\cdot}, \]

representa la desviación de la media de la sucursal respecto de la media general.

Por tanto,

\[ \boxed{ \text{desviación total} = \text{desviación dentro de la sucursal} + \text{desviación de la sucursal} } \]

Esta identidad es el punto de partida de la descomposición ANOVA.

4 2. ¿Por qué se elevan al cuadrado las desviaciones?

La suma simple de las desviaciones respecto de una media siempre es igual a cero:

\[ \sum_{i=1}^{N} (Y_i-\bar Y)=0. \]

Las desviaciones positivas y negativas se cancelan. Para medir la magnitud de la variabilidad es necesario utilizar una transformación que evite esta cancelación.

El ANOVA utiliza desviaciones al cuadrado porque:

  1. convierten todas las desviaciones en cantidades no negativas;
  2. otorgan mayor peso a desviaciones grandes;
  3. permiten construir medidas relacionadas directamente con la varianza;
  4. producen una descomposición algebraica exacta de la variabilidad.

A partir de estas desviaciones cuadráticas se construyen las sumas de cuadrados.

5 3. Suma de cuadrados total

La suma de cuadrados total se define como

\[ SC_T = \sum_{i=1}^{a} \sum_{j=1}^{n} \left( Y_{ij}-\bar Y_{\cdot\cdot} \right)^2. \]

Esta cantidad mide toda la variabilidad observada alrededor de la media general.

Su interpretación es:

¿Qué tan dispersas están todas las observaciones respecto de la media general, sin considerar todavía a qué sucursal pertenecen?

La suma de cuadrados total combina tanto las diferencias existentes entre sucursales como la variabilidad observada dentro de cada sucursal.

6 4. Suma de cuadrados dentro de las sucursales

La suma de cuadrados del error es

\[ SC_E = \sum_{i=1}^{a} \sum_{j=1}^{n} \left( Y_{ij}-\bar Y_{i\cdot} \right)^2. \]

También se denomina

\[ SC_{\text{dentro}} \]

o suma de cuadrados residual.

Esta cantidad mide la dispersión de cada observación respecto de la media de su propia sucursal.

Su interpretación es:

¿Cuánto difieren entre sí las observaciones que pertenecen a una misma sucursal?

Esta variabilidad no puede atribuirse a diferencias entre sucursales, porque todas las comparaciones se realizan dentro de cada una.

7 5. Suma de cuadrados entre sucursales

La suma de cuadrados del factor es

\[ SC_A = n \sum_{i=1}^{a} \left( \bar Y_{i\cdot} - \bar Y_{\cdot\cdot} \right)^2. \]

También se denomina

\[ SC_{\text{entre}}. \]

Esta cantidad mide cuánto se alejan las medias de las sucursales respecto de la media general.

El factor \(n\) aparece porque cada media de sucursal representa \(n\) observaciones.

Su interpretación es:

¿Cuánta variabilidad está asociada con el hecho de que las observaciones pertenezcan a sucursales con medias distintas?

La expresión “variabilidad entre sucursales” indica cómo se calcula esta suma de cuadrados: se basa en las diferencias entre las medias observadas. No implica que toda esa variabilidad sea causada exclusivamente por diferencias reales entre sucursales, porque las medias muestrales también fluctúan debido al error aleatorio.

8 6. Descomposición de la variabilidad total

Partiendo de

\[ Y_{ij}-\bar Y_{\cdot\cdot} = \left( Y_{ij}-\bar Y_{i\cdot} \right) + \left( \bar Y_{i\cdot}-\bar Y_{\cdot\cdot} \right), \]

se eleva al cuadrado:

\[ \begin{aligned} \left( Y_{ij}-\bar Y_{\cdot\cdot} \right)^2 &= \left( Y_{ij}-\bar Y_{i\cdot} \right)^2 \\ &\quad+ \left( \bar Y_{i\cdot}-\bar Y_{\cdot\cdot} \right)^2 \\ &\quad+ 2 \left( Y_{ij}-\bar Y_{i\cdot} \right) \left( \bar Y_{i\cdot}-\bar Y_{\cdot\cdot} \right). \end{aligned} \]

Al sumar sobre todas las observaciones, el término cruzado desaparece porque dentro de cada sucursal

\[ \sum_{j=1}^{n} \left( Y_{ij}-\bar Y_{i\cdot} \right) =0. \]

Por tanto,

\[ \boxed{ SC_T = SC_A+SC_E } \]

o, conceptualmente,

\[ \boxed{ \text{variabilidad total} = \text{variabilidad entre sucursales} + \text{variabilidad dentro de sucursales} } \]

Esta identidad es algebraica. Se cumple para cualquier conjunto de datos, sin requerir normalidad ni una clasificación previa del factor como fijo o aleatorio.

9 7. ¿Por qué no se comparan directamente las sumas de cuadrados?

Las sumas de cuadrados dependen de la cantidad de información independiente utilizada para calcularlas.

Por ejemplo:

  • \(SC_A\) se construye a partir de las \(a\) medias de las sucursales;
  • \(SC_E\) se construye con las \(N\) observaciones, después de estimar una media en cada sucursal.

Por ello, no sería apropiado comparar directamente \(SC_A\) y \(SC_E\). Ambas cantidades deben normalizarse según sus grados de libertad.

10 8. Grados de libertad

10.1 8.1 Grados de libertad totales

La suma de cuadrados total tiene

\[ gl_T=N-1. \]

Se pierde un grado de libertad porque se estima la media general.

10.2 8.2 Grados de libertad del factor

La suma de cuadrados del factor tiene

\[ gl_A=a-1. \]

Aunque existen \(a\) medias de sucursal, sus desviaciones respecto de la media general cumplen una restricción lineal:

\[ \sum_{i=1}^{a} \left( \bar Y_{i\cdot} - \bar Y_{\cdot\cdot} \right) =0. \]

Por tanto, solo \(a-1\) de esas desviaciones son independientes.

10.3 8.3 Grados de libertad del error

La suma de cuadrados del error tiene

\[ gl_E=N-a. \]

En un diseño balanceado,

\[ N-a = an-a = a(n-1). \]

Dentro de cada sucursal existen \(n-1\) desviaciones independientes. Como hay \(a\) sucursales, el total es

\[ a(n-1). \]

Además,

\[ gl_T = gl_A+gl_E, \]

porque

\[ N-1 = (a-1)+(N-a). \]

11 9. Cuadrados medios

Un cuadrado medio se obtiene al dividir una suma de cuadrados entre sus grados de libertad:

\[ CM = \frac{SC}{gl}. \]

El cuadrado medio del factor es

\[ CM_A = \frac{SC_A}{a-1}. \]

El cuadrado medio del error es

\[ CM_E = \frac{SC_E}{N-a}. \]

El cuadrado medio puede interpretarse como una cantidad promedio de variabilidad cuadrática por grado de libertad.

Un cuadrado medio no es una media aritmética de las observaciones. Es una medida de variabilidad normalizada por la cantidad de información independiente que interviene en su cálculo.

12 10. Interpretación de la tabla ANOVA

Para un diseño balanceado de un factor, la tabla ANOVA tiene la siguiente estructura:

Fuente Suma de cuadrados Grados de libertad Cuadrado medio Interpretación
Sucursal \(SC_A\) \(a-1\) \(\displaystyle CM_A=\frac{SC_A}{a-1}\) Variabilidad de las medias de sucursal respecto de la media general
Error \(SC_E\) \(N-a\) \(\displaystyle CM_E=\frac{SC_E}{N-a}\) Variabilidad de las observaciones respecto de la media de su propia sucursal
Total \(SC_T\) \(N-1\) Generalmente no se utiliza Variabilidad de todas las observaciones respecto de la media general

La fila Sucursal responde descriptivamente:

¿Qué tan diferentes son las medias observadas de las sucursales?

La fila Error responde:

¿Qué tan variables son las observaciones dentro de una misma sucursal?

La fila Total responde:

¿Qué tan variables son todas las observaciones en conjunto?

Hasta este punto, la tabla ANOVA realiza una descripción algebraica de la variabilidad observada.

13 11. Del análisis descriptivo al modelo probabilístico

Si el estudio se repitiera con nuevas observaciones, cambiarían:

\[ SC_A, \qquad SC_E, \qquad CM_A, \qquad CM_E. \]

Por tanto, los cuadrados medios son variables aleatorias.

La expresión

\[ E(CM_E) \]

representa el valor promedio que tomaría el cuadrado medio del error si el experimento se repitiera indefinidamente bajo el mismo modelo probabilístico.

No significa que

\[ CM_E=\sigma^2 \]

en cada muestra. Significa que, a través de muchas repeticiones,

\[ CM_E \]

está centrado en \(\sigma^2\).

14 12. Modelo probabilístico de un factor aleatorio

Considérese el modelo

\[ Y_{ij} = \mu+\alpha_i+\varepsilon_{ij}, \]

donde:

\[ \mu \]

es la media general;

\[ \alpha_i \]

es el efecto aleatorio de la sucursal \(i\);

\[ \varepsilon_{ij} \]

es el error individual.

Se supone que

\[ E(\alpha_i)=0, \qquad \operatorname{Var}(\alpha_i)=\sigma_\alpha^2, \]

y

\[ E(\varepsilon_{ij})=0, \qquad \operatorname{Var}(\varepsilon_{ij})=\sigma^2. \]

Además,

\[ \alpha_i\perp\varepsilon_{ij}. \]

La varianza de una observación es

\[ \operatorname{Var}(Y_{ij}) = \operatorname{Var}(\alpha_i+\varepsilon_{ij}). \]

Por independencia,

\[ \boxed{ \operatorname{Var}(Y_{ij}) = \sigma_\alpha^2+\sigma^2 } \]

Aquí,

\[ \sigma_\alpha^2 \]

representa la variabilidad entre sucursales, mientras que

\[ \sigma^2 \]

representa la variabilidad entre observaciones dentro de las sucursales.

15 13. Esperanza del cuadrado medio del error

Dentro de una sucursal,

\[ Y_{ij} = \mu+\alpha_i+\varepsilon_{ij}. \]

La media de la sucursal es

\[ \bar Y_{i\cdot} = \mu+\alpha_i+\bar\varepsilon_{i\cdot}. \]

Al restar,

\[ \begin{aligned} Y_{ij}-\bar Y_{i\cdot} &= \left( \mu+\alpha_i+\varepsilon_{ij} \right) - \left( \mu+\alpha_i+\bar\varepsilon_{i\cdot} \right) \\ &= \varepsilon_{ij}-\bar\varepsilon_{i\cdot}. \end{aligned} \]

Los términos \(\mu\) y \(\alpha_i\) se cancelan.

Por ello, las desviaciones dentro de cada sucursal dependen únicamente de los errores.

La suma de cuadrados residual satisface

\[ E(SC_E) = (N-a)\sigma^2. \]

Como

\[ CM_E = \frac{SC_E}{N-a}, \]

entonces

\[ E(CM_E) = E\left( \frac{SC_E}{N-a} \right). \]

Dado que \(N-a\) es una constante,

\[ E(CM_E) = \frac{E(SC_E)}{N-a}. \]

Sustituyendo,

\[ E(CM_E) = \frac{(N-a)\sigma^2}{N-a}. \]

Finalmente,

\[ \boxed{ E(CM_E)=\sigma^2 } \]

El cuadrado medio del error es un estimador insesgado de la varianza residual:

\[ CM_E \longrightarrow \sigma^2. \]

Esta propiedad se cumple tanto bajo la hipótesis nula como bajo la hipótesis alternativa.

16 14. Esperanza del cuadrado medio de sucursal

La media de la sucursal \(i\) es

\[ \bar Y_{i\cdot} = \mu+\alpha_i+\bar\varepsilon_{i\cdot}. \]

Su varianza es

\[ \operatorname{Var}(\bar Y_{i\cdot}) = \operatorname{Var} \left( \alpha_i+\bar\varepsilon_{i\cdot} \right). \]

Por independencia,

\[ \operatorname{Var}(\bar Y_{i\cdot}) = \operatorname{Var}(\alpha_i) + \operatorname{Var}(\bar\varepsilon_{i\cdot}). \]

Como

\[ \operatorname{Var}(\alpha_i) = \sigma_\alpha^2 \]

y

\[ \operatorname{Var}(\bar\varepsilon_{i\cdot}) = \frac{\sigma^2}{n}, \]

se obtiene

\[ \boxed{ \operatorname{Var}(\bar Y_{i\cdot}) = \sigma_\alpha^2+\frac{\sigma^2}{n} } \]

Las medias de las sucursales varían por dos razones:

\[ \underbrace{ \sigma_\alpha^2 }_{\text{diferencias reales entre sucursales}} + \underbrace{ \frac{\sigma^2}{n} }_{\text{error de muestreo de cada media}}. \]

La suma de cuadrados entre sucursales es

\[ SC_A = n \sum_{i=1}^{a} \left( \bar Y_{i\cdot} - \bar Y_{\cdot\cdot} \right)^2. \]

Para \(a\) variables independientes con la misma varianza se cumple

\[ E\left[ \sum_{i=1}^{a} (X_i-\bar X)^2 \right] = (a-1)\operatorname{Var}(X_i). \]

Aplicando esta identidad a las medias de sucursal,

\[ E(SC_A) = n(a-1) \left( \sigma_\alpha^2+\frac{\sigma^2}{n} \right). \]

Distribuyendo \(n\),

\[ E(SC_A) = (a-1) \left( n\sigma_\alpha^2+\sigma^2 \right). \]

Como

\[ CM_A = \frac{SC_A}{a-1}, \]

entonces

\[ E(CM_A) = \frac{E(SC_A)}{a-1}. \]

Finalmente,

\[ \boxed{ E(CM_A) = \sigma^2+n\sigma_\alpha^2 } \]

El cuadrado medio de sucursal contiene dos componentes:

\[ CM_A \longrightarrow \underbrace{\sigma^2}_{\text{variación residual}} + \underbrace{n\sigma_\alpha^2}_{\text{variación atribuible a la sucursal}}. \]

17 15. Interpretación conjunta de los cuadrados medios

El cuadrado medio del error contiene únicamente la variabilidad residual:

\[ \boxed{ E(CM_E)=\sigma^2 } \]

El cuadrado medio del factor contiene la variabilidad residual más el componente atribuible al factor:

\[ \boxed{ E(CM_A)=\sigma^2+n\sigma_\alpha^2 } \]

Por tanto, \(CM_A\) no es una medida pura de \(\sigma_\alpha^2\).

Para aislar el componente entre sucursales se resta:

\[ E(CM_A)-E(CM_E) = n\sigma_\alpha^2. \]

De esta relación surge el estimador por método de momentos:

\[ \boxed{ \widehat{\sigma}_\alpha^2 = \frac{CM_A-CM_E}{n} } \]

Además,

\[ \boxed{ \widehat{\sigma}^2 = CM_E } \]

18 16. Conexión con la prueba \(F\)

La hipótesis nula para el factor aleatorio es

\[ H_0: \sigma_\alpha^2=0. \]

Bajo \(H_0\),

\[ E(CM_A) = \sigma^2+n(0) = \sigma^2. \]

También,

\[ E(CM_E)=\sigma^2. \]

Por tanto,

\[ \boxed{ E(CM_A\mid H_0) = E(CM_E) = \sigma^2 } \]

La estadística de prueba es

\[ F = \frac{CM_A}{CM_E}. \]

Conceptualmente, esta razón compara

\[ \frac{ \text{estimador de }\sigma^2 + \text{posible componente del factor} }{ \text{estimador de }\sigma^2 }. \]

Bajo \(H_0\), el componente del factor desaparece. Bajo \(H_1\), el numerador incorpora variabilidad adicional.

La afirmación de que \(F\) debe estar “cerca de uno” bajo \(H_0\) es una interpretación heurística. La prueba formal se basa en la distribución \(F\) y no únicamente en comparar el cociente con uno.

19 17. Ejemplo numérico ilustrativo

Supóngase un diseño con

\[ a=6 \]

sucursales y

\[ n=5 \]

observaciones por sucursal. El total es

\[ N=30. \]

Considérese que la tabla ANOVA produce

\[ CM_A=30 \]

y

\[ CM_E=10. \]

La varianza residual estimada es

\[ \widehat{\sigma}^2 = CM_E = 10. \]

La varianza entre sucursales es

\[ \widehat{\sigma}_\alpha^2 = \frac{CM_A-CM_E}{n}. \]

Sustituyendo,

\[ \widehat{\sigma}_\alpha^2 = \frac{30-10}{5} = 4. \]

La varianza total estimada de una observación es

\[ \widehat{\operatorname{Var}}(Y_{ij}) = \widehat{\sigma}_\alpha^2 + \widehat{\sigma}^2. \]

Por tanto,

\[ \widehat{\operatorname{Var}}(Y_{ij}) = 4+10 = 14. \]

El coeficiente de correlación intraclase es

\[ ICC = \frac{ \sigma_\alpha^2 }{ \sigma_\alpha^2+\sigma^2 }. \]

Su estimación es

\[ \widehat{ICC} = \frac{4}{4+10} = 0.2857. \]

Esto indica que aproximadamente el \(28.57\%\) de la variabilidad total se atribuye a diferencias entre sucursales.

20 18. Ejemplo reproducible en R

A continuación se construye una tabla ANOVA a partir de datos simulados.

a <- 6
n <- 5
mu <- 50
sigma_alpha <- 3
sigma_error <- 4

efectos_sucursal <- rnorm(
  n = a,
  mean = 0,
  sd = sigma_alpha
)

datos <- data.frame(
  sucursal = factor(
    rep(seq_len(a), each = n)
  )
)

datos$efecto_sucursal <- efectos_sucursal[
  datos$sucursal
]

datos$error <- rnorm(
  n = nrow(datos),
  mean = 0,
  sd = sigma_error
)

datos$respuesta <- (
  mu +
  datos$efecto_sucursal +
  datos$error
)

head(datos)

Se ajusta un ANOVA de un factor:

modelo_anova <- aov(
  respuesta ~ sucursal,
  data = datos
)

summary(modelo_anova)
##             Df Sum Sq Mean Sq F value Pr(>F)  
## sucursal     5  277.0   55.40   3.722 0.0123 *
## Residuals   24  357.2   14.88                 
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Se extraen los cuadrados medios:

tabla_anova <- summary(modelo_anova)[[1]]

CM_sucursal <- tabla_anova[
  "sucursal",
  "Mean Sq"
]

CM_error <- tabla_anova[
  "Residuals",
  "Mean Sq"
]

c(
  CM_sucursal = CM_sucursal,
  CM_error = CM_error
)
## CM_sucursal    CM_error 
##    55.40028    14.88472

Los componentes de varianza por método de momentos son:

varianza_error <- CM_error

varianza_sucursal <- (
  CM_sucursal -
  CM_error
) / n

c(
  varianza_error = varianza_error,
  varianza_sucursal = varianza_sucursal
)
##    varianza_error varianza_sucursal 
##          14.88472           8.10311

21 19. Representación gráfica de la descomposición

medias_sucursal <- aggregate(
  respuesta ~ sucursal,
  data = datos,
  FUN = mean
)

media_general <- mean(datos$respuesta)

boxplot(
  respuesta ~ sucursal,
  data = datos,
  xlab = "Sucursal",
  ylab = "Respuesta",
  main = "Variabilidad dentro y entre sucursales"
)

abline(
  h = media_general,
  lwd = 2,
  lty = 2
)

points(
  x = seq_len(a),
  y = medias_sucursal$respuesta,
  pch = 19
)

Las cajas muestran la variabilidad dentro de cada sucursal. Los puntos representan las medias de las sucursales y la línea horizontal discontinua representa la media general.

22 20. Síntesis conceptual

La tabla ANOVA separa algebraicamente la variabilidad observada:

\[ SC_T = SC_A+SC_E. \]

Los cuadrados medios normalizan las sumas de cuadrados:

\[ CM_A = \frac{SC_A}{a-1}, \qquad CM_E = \frac{SC_E}{N-a}. \]

La esperanza identifica qué parámetro o combinación de parámetros estima cada cuadrado medio en repetidas muestras:

\[ \boxed{ E(CM_E)=\sigma^2 } \]

y

\[ \boxed{ E(CM_A)=\sigma^2+n\sigma_\alpha^2 } \]

Por tanto, el análisis avanza desde una descomposición descriptiva de los datos hacia una interpretación probabilística de las fuentes de variabilidad.

23 Referencias recomendadas

  • Montgomery, D. C. Design and Analysis of Experiments.
  • Searle, S. R., Casella, G. y McCulloch, C. E. Variance Components.
  • Kutner, M. H., Nachtsheim, C. J., Neter, J. y Li, W. Applied Linear Statistical Models.
  • Pinheiro, J. C. y Bates, D. M. Mixed-Effects Models in S and S-PLUS.