A continuación, se presenta la estructura diseñada para ser copiada en el tablero. Está dividida en 5 Bloques (Pizarras) para que pueda organizar el espacio, borrar lo necesario y permitir que las estudiantes transcriban las fórmulas y definiciones de manera ordenada en sus cuadernos físicos.
Se asume el uso del ejemplo agrícola ancla: Lámina de Riego (\(X\)) vs. Rendimiento de Maíz (\(Y\)).
(Objetivo: Diferenciar determinismo de incertidumbre)
1. Relación Funcional (Determinística)
Cada valor de \(X\) determina exactamente un valor de \(Y\).
Ecuación: \(Y = f(X)\)
Ejemplo: Ventas = Precio \(\times\) Cantidad.
2. Relación Estadística (Estocástica)
Existe una tendencia general, pero hay dispersión (variabilidad aleatoria).
No hay una línea perfecta, sino una “nube de puntos”.
Ejemplo: A mayor lámina de riego (\(X\)), mayor rendimiento (\(Y\)), pero el suelo, la genética y el clima introducen variabilidad.
3. Diagrama de Dispersión (Scatterplot)
(Objetivo: Medir la fuerza y dirección de la asociación)
Definición: Mide la fuerza de la asociación lineal entre \(X\) e \(Y\).
Rango: \([-1, +1]\)
1. Coeficiente de Correlación de Pearson (\(r\))
Uso: Variables cuantitativas continuas con distribución normal.
Fórmula Muestral: \[ r = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2 \sum_{i=1}^{n}(y_i - \bar{y})^2}} \]
Interpretación: \(0\) (Nula), \(\pm 0.3\) (Débil), \(\pm 0.7\) (Alta), \(\pm 1\) (Perfecta).
2. Alternativas No Paramétricas (Rangos)
Rho de Spearman (\(\rho\)): Para datos ordinales o cuando no hay normalidad. Mide relación monótona. \[ r_s = 1 - \frac{6\sum d_i^2}{n(n^2 - 1)} \] (Donde \(d_i\) es la diferencia de rangos)
Tau de Kendall (\(\tau\)): Para muestras pequeñas o muchos empates (ligaduras).
⚠️ Advertencia Cognitiva: Correlación \(\neq\) Causalidad. La correlación es sensible a valores atípicos (outliers).
(Objetivo: Pasar de la asociación a la predicción)
Propósito: Encontrar la ecuación de la recta que mejor describe la relación estadística para predecir \(Y\) a partir de \(X\).
1. Modelo Poblacional (Verdad desconocida)
\[ Y_i = \beta_0 + \beta_1 X_i + \epsilon_i \]
\(\beta_0\): Intercepto poblacional (Valor de \(Y\) cuando \(X=0\)).
\(\beta_1\): Pendiente poblacional (Cambio en \(Y\) por cada unidad de cambio en \(X\)).
\(\epsilon_i\): Error aleatorio (ruido, variables no medidas).
2. Supuestos del Error (\(\epsilon_i\))
Media cero: \(E(\epsilon) = 0\)
Varianza constante: \(Var(\epsilon) = \sigma^2\) (Homocedasticidad)
Independencia: \(Cov(\epsilon_i, \epsilon_j) = 0\)
Normalidad: \(\epsilon_i \sim N(0, \sigma^2)\)
3. Modelo Muestral Estimado (La recta de predicción)
\[ \hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i \]
(Donde \(\hat{Y}_i\) es el valor predicho o ajustado).
(Objetivo: ¿Cómo calculamos \(\hat{\beta}_0\) y \(\hat{\beta}_1\) a mano?)
Principio: Encontrar la recta que minimiza la suma de los cuadrados de los residuos (las distancias verticales entre los puntos reales y la recta).
1. Definición de Residuo (\(e_i\)) \[ e_i = Y_i - \hat{Y}_i \] (Diferencia entre el valor observado y el valor predicho por el modelo).
2. Fórmulas de Estimación (MCO)
Pendiente (\(\hat{\beta}_1\)): \[ \hat{\beta}_1 = \frac{S_{xy}}{S_{xx}} = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sum_{i=1}^{n}(x_i - \bar{x})^2} \]
Intercepto (\(\hat{\beta}_0\)): \[ \hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} \]
(Nota: La recta de MCO siempre pasa por el punto promedio \((\bar{x}, \bar{y})\)).
(Objetivo: Evaluar la calidad del modelo)
1. Coeficiente de Determinación (\(R^2\))
Pregunta: ¿Qué porcentaje de la variabilidad total de \(Y\) es explicado por el modelo lineal con \(X\)?
Fórmula: \[ R^2 = \frac{SC_{Regresión}}{SC_{Total}} = 1 - \frac{SC_{Residual}}{SC_{Total}} \]
Rango: \([0, 1]\). Un \(R^2 = 0.85\) significa que el 85% de la variación del rendimiento se explica por la lámina de riego.
Relación con Pearson: En regresión simple, \(R^2 = r^2\).
2. Error Estándar de Estimación (RSE)
3. Inferencia (Test de Hipótesis para la Pendiente)
\(H_0: \beta_1 = 0\) (No hay relación lineal; \(X\) no sirve para predecir \(Y\)).
\(H_a: \beta_1 \neq 0\) (Sí hay relación lineal).
Estadístico de prueba: \[ t = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)} \]
Regla: Si el p-value \(< \alpha\) (ej. 0.05), se rechaza \(H_0\). La variable \(X\) es estadísticamente significativa.
Código de Colores: Use Rojo para las variables dependientes (\(Y\), Rendimiento), Azul para las independientes (\(X\), Riego) y Verde para los parámetros/predicciones (\(\beta\), \(\hat{Y}\)).
Pausa Activa: Al terminar la Pizarra 4, pida a las estudiantes que calculen \(\bar{x}\) y \(\bar{y}\) con los 5 puntos simulados que dibujaron en la clase anterior, y estimen visualmente dónde estaría el intercepto.
Reserva Cognitiva: Antes de pasar a la Pizarra 5, pregunte: “Si el software nos da un \(R^2\) de 0.99, ¿significa que el modelo es perfecto para tomar decisiones de riego en la vida real?” (Esto abre la puerta a discutir la extrapolación y los supuestos no observados).