“Actúa como mi tutor de estadística para Ingeniería Agrícola. Explícame en máximo 3 viñetas (bullet points) qué es la Verosimilitud (Likelihood) y por qué es necesaria evaluarla cuando varias distribuciones (como Gamma y Lognormal) parecen ajustarse bien a mis datos históricos de caudales máximos anuales. Usa un lenguaje técnico pero claro, ideal para tomar notas a mano.”
Qué es la verosimilitud: Es la probabilidad (o densidad) de haber observado exactamente tus datos de caudales máximos, dados unos parámetros de una distribución. Se escribe L(θ | x₁,…,xₙ) = ∏ f(xᵢ | θ). Al trabajar con la log-verosimilitud (ℓ = Σ ln f(xᵢ | θ)), el producto pasa a suma y es más fácil de calcular. Los parámetros de máxima verosimilitud (MLE) son los valores de θ que hacen más “probables” tus datos observados.
Por qué no basta el “buen ajuste visual”: Gamma y Lognormal tienen formas muy parecidas en la zona central de los datos y ambas pueden pasar bien por el papel de probabilidad o por una prueba de bondad de ajuste (Kolmogorov-Smirnov, χ²). La verosimilitud da una medida cuantitativa común: se calcula ℓ máxima de cada modelo con los mismos datos, y la que tenga mayor ℓ explica mejor la muestra. Ojo: solo es comparable entre modelos ajustados a la misma serie y con la misma variable (sin transformar).
Cómo usarla para decidir (y por qué importa en ingeniería): Como un modelo con más parámetros siempre ajusta mejor, se penaliza la complejidad con AIC = 2k − 2ℓ y BIC = k·ln(n) − 2ℓ (k = nº de parámetros, n = años de registro); gana el menor valor. Esto es crítico porque Gamma y Lognormal divergen en la cola superior: dan caudales muy distintos para periodos de retorno altos (Tr = 50, 100 años), que es justo lo que dimensiona obras como alcantarillas, canales de drenaje o diques de protección de cultivos. Una diferencia de AIC < 2 indica que los modelos son prácticamente equivalentes; en ese caso conviene comparar también los cuantiles de diseño y ser conservador.
“Ahora necesito anotar el concepto de desempate. Explícame brevemente el Principio de Parsimonia y el Criterio de Información de Akaike (AIC). Dame una analogía sencilla relacionada con el diseño de una obra en el campo (ej. un canal o un muro) y termina con la ‘regla de oro’ matemática para saber qué distribución gana según el AIC. Estructúralo para copiarlo en mi cuaderno.”
Desempate: Parsimonia y AIC
Principio de Parsimonia (navaja de Occam) Si dos modelos explican igual de bien los datos, se elige el más simple, es decir, el que tiene menos parámetros. Un modelo complejo puede “memorizar” el ruido de la muestra y fallar al predecir caudales futuros (sobreajuste).
Criterio de Información de Akaike (AIC) Mide el ajuste y la complejidad a la vez:
AIC = 2k − 2ℓ
donde k es el número de parámetros y ℓ la log-verosimilitud máxima. El término −2ℓ premia el buen ajuste y el término 2k castiga la complejidad. Es la forma matemática de aplicar la parsimonia.
Analogía de campo Imagina que diseñas un muro de contención y dos ingenieros te proponen soluciones que resisten igual de bien el empuje del suelo. Uno plantea un muro simple de concreto ciclópeo. El otro, un muro con contrafuertes, anclajes y juntas especiales que cuesta el doble y exige más control de obra. Si ambos cumplen lo mismo, eliges el simple: menos piezas, menos puntos de falla y el mismo desempeño. Lo mismo con las distribuciones: si Gamma y Lognormal ajustan igual, no pagas “costo extra” en parámetros que no mejoran la predicción. Solo justificas el muro complejo si su desempeño es claramente superior.
Regla de oro - Se calcula el AIC de cada distribución con la misma serie de datos. - Gana el de menor AIC. - ΔAIC = AIC_i − AIC_mín - ΔAIC < 2: prácticamente equivalentes (desempata la parsimonia o el cuantil más conservador) - 4 < ΔAIC < 7: el de mayor AIC tiene poco soporte - ΔAIC > 10: se descarta el de mayor AIC
Nota: Gamma y Lognormal de 2 parámetros tienen el mismo k, así que la comparación se reduce a ver cuál tiene mayor ℓ.