En la Ingeniería Agrícola, el diseño de obras hidráulicas (como muros de contención, canales de drenaje, presas y alcantarillados) requiere la estimación de eventos extremos, como los caudales máximos anuales de un río. Al analizar datos históricos, es común que múltiples distribuciones teóricas (por ejemplo, Gamma, Lognormal o Gumbel) superen las pruebas de bondad de ajuste tradicionales (como Kolmogorov-Smirnov).
Cuando varios modelos parecen describir los datos adecuadamente, se requiere un criterio matemático objetivo para “desempatar” y seleccionar el modelo más robusto. A continuación, se detallan los conceptos teóricos fundamentales para la selección de modelos y la estimación de variables de diseño.
La verosimilitud (o Likelihood) es una medida estadística que cuantifica qué tan bien un modelo probabilístico, con unos parámetros específicos, explica los datos observados. A diferencia de la probabilidad (que predice datos futuros a partir de parámetros conocidos), la verosimilitud evalúa los parámetros a partir de los datos ya recogidos.
Dado un conjunto de datos observados \(x = (x_1, x_2, ..., x_n)\) y una función de densidad de probabilidad \(f(x|\theta)\) dependiente de unos parámetros \(\theta\), la función de verosimilitud \(L\) se define como el producto de las densidades de cada observación:
\[L(\theta | x) = \prod_{i=1}^{n} f(x_i | \theta)\]
Dado que multiplicar muchas probabilidades pequeñas (valores entre 0 y 1) resulta en números extremadamente cercanos a cero (lo que causa errores de subflujo en los computadores), se utiliza la Log-Verosimilitud (\(LL\)), aplicando el logaritmo natural (\(\ln\)) a la ecuación anterior, transformando el producto en una suma:
\[LL(\theta | x) = \sum_{i=1}^{n} \ln(f(x_i | \theta))\]
En la práctica, los algoritmos de optimización (como los
implementados en Python con scipy.stats o en R) calculan
los parámetros \(\theta\) que maximizan
esta función de Log-Verosimilitud (Método de Máxima Verosimilitud o
MLE). El valor máximo alcanzado (\(LL_{max}\)) se utiliza posteriormente como
insumo para calcular criterios de información como el AIC.
Permite comparar matemáticamente distribuciones con diferentes formas (ej. la asimetría de la distribución Lognormal frente a la simetría de la Normal) para ver cuál representa mejor fenómenos agrícolas e hidrológicos que, por su naturaleza física, no pueden ser negativos y suelen presentar valores extremos.
También conocido como la “Navaja de Ockham” en la modelación estadística, el principio de parsimonia establece que, ante dos modelos con una capacidad predictiva similar, debe preferirse siempre el modelo más simple (el que requiere menos parámetros para ser definido).
Los modelos complejos (con muchos parámetros) tienden a “sobreajustarse” (overfitting) a los datos de la muestra, capturando incluso el ruido o error aleatorio, lo que reduce su capacidad para predecir eventos futuros no observados. El principio de parsimonia actúa como una penalización: se añade complejidad (más parámetros) solo si el mejora en el ajuste lo justifica ampliamente.
El AIC es un estimador de la calidad relativa de un modelo estadístico. Fue diseñado para equilibrar la bondad de ajuste del modelo (medida por la verosimilitud) y su complejidad (medida por el número de parámetros), aplicando matemáticamente el principio de parsimonia.
La fórmula del AIC es:
\[AIC = 2k - 2\ln(L)\]
Donde: * \(k\) = Número de parámetros estimados en la distribución (ej. Normal tiene \(k=2\); Gamma tiene \(k=3\)). * \(\ln(L)\) = Log-Verosimilitud maximizada del modelo.
El AIC no proporciona un valor absoluto de “bondad”, sino que se utiliza para comparación relativa entre múltiples modelos ajustados a los mismos datos. * Regla de oro: El modelo ganador es aquel que presenta el valor de AIC más bajo. * Si un modelo tiene un AIC significativamente menor (diferencia > 2) que otro, se considera sustancialmente mejor, incluso si el otro modelo tiene una verosimilitud ligeramente mayor, porque el modelo con menor AIC logra un mejor equilibrio entre precisión y simplicidad.
En hidrología agrícola, el AIC es la herramienta definitiva para seleccionar la distribución de frecuencias (ej. Lognormal vs. Gamma vs. Pearson III) que regirá el diseño de una obra. Evita que el ingeniero elija un modelo complejo innecesariamente, garantizando que las predicciones de eventos extremos sean robustas y no producto del sobreajuste a un registro histórico limitado.
Una vez seleccionado el modelo matemático ganador (la distribución teórica que mejor describe los caudales históricos), se utiliza para estimar la magnitud de eventos futuros. El Periodo de Retorno es el tiempo promedio estimado, en años, para que un evento igual o superior a una magnitud específica ocurra.
La relación entre el periodo de retorno (\(T_r\)) y la probabilidad de excedencia (\(P\)) de un evento en un año cualquiera es:
\[P(X \ge x) = \frac{1}{T_r}\]
Dado que las distribuciones de probabilidad se expresan comúnmente como probabilidad de no excedencia (o probabilidad acumulada, \(F(x)\)), la ecuación se transforma en:
\[F(x) = P(X < x) = 1 - \frac{1}{T_r}\]
Para encontrar el Caudal de Diseño (\(x_d\) o \(Q_d\)) asociado a un periodo de retorno específico (por ejemplo, 100 años), se utiliza la función inversa de la distribución acumulada (cuantil):
\[Q_d = F^{-1}\left(1 - \frac{1}{T_r}\right)\]
Se define el \(T_r\) según la normativa y la importancia de la obra (ej. 10 años para drenajes viales, 50 o 100 años para presas o muros de contención).
Se calcula la probabilidad acumulada objetivo: \(p = 1 - (1/T_r)\).
Se evalúa la función cuantil (en Python dist.ppf(p)
o en R qdist(p)) de la distribución ganadora (ej.
Lognormal) usando sus parámetros previamente estimados.
Es el pilar del diseño hidrológico. Permite dimensionar:
Estructuras de control de inundaciones: Muros de contención en ríos que atraviesan zonas de cultivo o asentamientos rurales.
Sistemas de drenaje agrícola: Canales y tuberías para evacuar excesos hídricos en parcelas.
Obras de cosecha de agua: Diseño de vertederos y aliviaderos en embalses para riego.
Nota crucial de modelación: En Ingeniería Agrícola, para variables como caudales o precipitaciones máximas, se prefieren distribuciones con colas pesadas a la derecha (como Lognormal o Gamma). La distribución Normal suele subestimar los eventos extremos, lo que podría llevar al diseño de obras hidráulicas insuficientes y al consecuente colapso de la estructura ante eventos raros pero catastróficos.
La estrategia de reserva cognitiva y escritura manual antes de pasar al código es fundamental para que los estudiantes de Ingeniería Agrícola construyan el criterio técnico necesario. Si solo ven el código, lo percibirán como una “caja negra” mágica; si primero entienden el porqué físico y estadístico, el código se convertirá en una herramienta lógica.
A continuación, se presenta una estructura de 4 prompts (instrucciones) diseñados para que sus estudiantes los copien y peguen en el chat con la IA. Están redactados para obligar a la IA a devolver respuestas breves, estructuradas y perfectas para ser transcritas a mano en sus cuadernos en un lapso de 30 minutos.
Dinámica de la Sesión (30 minutos):
Tengan su cuaderno físico y bolígrafo a la mano.
Copien y peguen el Prompt 1 en el chat con la IA. Lean la respuesta, destilen lo esencial y escríbanlo a mano en su cuaderno (5-7 min).
Repitan el proceso con los Prompts 2, 3 y 4.
Al finalizar, tendrán un “mini-capítulo” manuscrito que servirá de base para entender el notebook de Python/R que veremos a continuación.
“Actúa como mi tutor de estadística para Ingeniería Agrícola. Explícame en máximo 3 viñetas (bullet points) qué es la Verosimilitud (Likelihood) y por qué es necesaria evaluarla cuando varias distribuciones (como Gamma y Lognormal) parecen ajustarse bien a mis datos históricos de caudales máximos anuales. Usa un lenguaje técnico pero claro, ideal para tomar notas a mano.”
“Ahora necesito anotar el concepto de desempate. Explícame brevemente el Principio de Parsimonia y el Criterio de Información de Akaike (AIC). Dame una analogía sencilla relacionada con el diseño de una obra en el campo (ej. un canal o un muro) y termina con la ‘regla de oro’ matemática para saber qué distribución gana según el AIC. Estructúralo para copiarlo en mi cuaderno.”
“Conectemos la estadística con mi futura profesión. Explícame en 2 párrafos cortos qué significa hidrológicamente el Periodo de Retorno (\(T_r\)) de 100 años. ¿Por qué un Ingeniero Agrícola no puede usar solo la distribución Normal para calcular el Caudal de Diseño (\(Q_d\)) de un muro de contención? Menciona el concepto de ‘colas pesadas’.”
“Para cerrar esta sesión de 30 minutos, genérame una tabla de 4 filas con un mini-glosario manuscrito. Las columnas deben ser: ‘Concepto’ y ‘Definición Ingenieril (en una sola línea)’. Los conceptos son: Verosimilitud, Parsimonia, AIC y Caudal de Diseño. Asegúrate de que las definiciones sean contundentes y fáciles de memorizar.”
Cuando los estudiantes terminen esta actividad y abran el notebook de
la Semana 8, usted podrá preguntarles: “¿Recuerdan
la analogía del campo que la IA les dio para el AIC?” o “¿Por
qué dijimos que la Normal era peligrosa para los muros?”. La
escritura manual habrá fijado el conocimiento previo para que el código
de scipy.stats o fitdistrplus tenga un
significado profundo.