Contexto general: La superficie plantada de maíz suave seco en Chimborazo es de 1.263 ha, con una producción de 5.130 toneladas en 2025. Este cultivo, en la Sierra del Ecuador es de fundamental importancia por el rol que cumple el grano en la seguridad alimentaria de la población. Este es uno de los más importantes en la producción nacional debido a la superficie destinada para su cultivo y al papel que cumple como componente básico de la dieta de la población ecuatoriana. La distribución de algunos de los tipos de maíces más cultivados en las provincias de Ia Sierra se debe a los gustos y costumbres de los agricultores. Así, en la Sierra norte (provincias de Carchi, Imbabura, Pichincha) se produce principalmente maíces con granos de tipo amarillo harinoso, en la parte central (Tungurahua, Chimborazo y Bolívar) se cultiva los maíces de grano blanco harinoso y en la Sierra sur (Cañar y Azuay) el maíz denominado “Zhima”, de grano blanco dentado o amorochado (Zambrano et.al, 2021).
Pregunta: ¿Cómo se comporta el rendimiento agrícola de maíz entre diferentes unidades productivas y cómo cambia la precisión de su promedio estimado cuando aumenta el tamaño de la muestra?
1. Parámetros de análisis:
X = Rendimiento de maíz de maíz suave seco, medido en toneladas por hectárea (t/ha) en Chimborazo.
Unidad de medida = toneladas por hectárea
Tipo variable = cuantitativa continua
Distribución = log normal Media poblacional = 1,21 t/ha
Desviación estándar poblacional = 0,25 t/ha
Valores posibles = X > 0
Fuente: SIPA, 2026. Información Productiva Territorial. ESPAC - 2025.
Nota de elección de la distribución:
Se ha elegido en este caso la distribución lognormal puesto que tiene tres propiedades que nos interesan:
1. Solo toma valores positivos, coherentes con el rendimiento de un cultivo.
2. Puede representar una distribución asimétrica, con una cola hacia rendimientos altos.
3. Permite estudiar la variabilidad de una actividad productiva en la que intervienen múltiples factores.
# Rendimiento de maíz suave seco
# Chimborazo, 2025, Tomado de la encuesta ESPAC - INEC
# Media de referencia provincial
media_x <- 1.21
# Desviación estándar
sd_x <- 0.25
# Parámetros de la distribución lognormal
sdlog <- sqrt(log(1 + (sd_x / media_x)^2))
meanlog <- log(media_x) - (sdlog^2 / 2)
# Verificar los parámetros
meanlog
## [1] 0.1697192
sdlog
## [1] 0.2044562
La función de densidad de probabilidad (PDF) describe cómo se distribuyen los posibles rendimientos. La función de distribución acumulada (CDF) nos permite calcular la probabilidad de que el rendimiento sea menor o igual a determinado valor.
# Valores de rendimiento
x <- seq(0.01, 3, length.out = 500)
# Densidad de probabilidad
densidad <- dlnorm(
x,
meanlog = meanlog,
sdlog = sdlog
)
plot(
x, densidad,
type = "l",
col = "darkgreen",
lwd = 2,
main = "Función de densidad lognormal",
xlab = "Rendimiento de maíz (t/ha)",
ylab = "Densidad"
)
abline(v = media_x, col = "red", lty = 2)
legend(
"topright",
legend = c("Densidad", "Media teórica"),
col = c("darkgreen", "red"),
lty = c(1, 2),
bty = "n"
)
# Función de distribución acumulada
acumulada <- plnorm(
x,
meanlog = meanlog,
sdlog = sdlog
)
plot(
x, acumulada,
type = "l",
col = "blue",
lwd = 2,
main = "Distribución acumulada lognormal",
xlab = "Rendimiento de maíz (t/ha)",
ylab = "Probabilidad acumulada"
)
# Probabilidad de rendimiento <= 1 t/ha
prob_1 <- plnorm(
1,
meanlog = meanlog,
sdlog = sdlog
)
prob_1
## [1] 0.2032409
Donde: n = 10, 50, 100, 1.000,10.000 Primero generaremos una secuencia de 10.000 rendimientos. Luego analizaremos sus primeros 10, 50, 100, 1.000 y 10.000 valores.Este procedimiento permite comparar cómo evoluciona una misma secuencia aleatoria al aumentar la muestra.
set.seed(123)
# Simular 10000 rendimientos
rendimientos <- rlnorm(
n = 10000,
meanlog = meanlog,
sdlog = sdlog
)
# Tamaños de muestra
tamanos <- c(10, 50, 100, 1000, 10000)
# Calcular medias por tamaño
medias <- sapply(tamanos, function(n) {
mean(rendimientos[1:n])
})
# Crear tabla de resultados
resultados <- data.frame(
n = tamanos,
media_muestral = medias,
media_teorica = media_x,
error_absoluto = abs(medias - media_x)
)
knitr::kable(
resultados,
digits = 4,
caption = "Comparación de medias muestrales"
)
| n | media_muestral | media_teorica | error_absoluto |
|---|---|---|---|
| 10 | 1.2247 | 1.21 | 0.0147 |
| 50 | 1.2147 | 1.21 | 0.0047 |
| 100 | 1.2281 | 1.21 | 0.0181 |
| 1000 | 1.2137 | 1.21 | 0.0037 |
| 10000 | 1.2094 | 1.21 | 0.0006 |
Según la Ley de los Grandes Números a medida que aumentamos el número de observaciones, el promedio muestral tiende a acercarse al valor esperado de la población, bajo los supuestos correspondientes. Y conforme al Teorema del Límite Central, cuando el tamaño de la muestra es suficientemente grande, la distribución de los promedios muestrales tiende a aproximarse a una distribución normal, bajo condiciones habituales de independencia y varianza finita.
Para visualizar la fluctuación de la media muestral, construiremos cinco gráficos: uno para cada tamaño de muestra. En cada gráfico se observa: - La línea azul muestra cómo cambia el promedio acumulado al incorporar observaciones. - La línea roja horizontal representa la media poblacional teórica de 1,21 t/ha.
Aquí la curva roja es la distribución normal teórica. A medida que aumentamos el número de observaciones, esperamos que los histogramas representen mejor esa distribución.
par(mfrow = c(3, 2))
for (n in tamanos) {
datos <- rendimientos[1:n]
media_acumulada <- cumsum(datos) /
seq_along(datos)
plot(
seq_along(datos),
media_acumulada,
type = "l",
col = "blue",
lwd = 1.5,
main = paste("Tamaño de muestra:", n),
xlab = "Número de observaciones",
ylab = "Media acumulada",
ylim = range(c(media_acumulada, media_x))
)
abline(
h = media_x,
col = "red",
lty = 2,
lwd = 2
)
}
par(mfrow = c(1, 1))
Al observar los cinco gráficos, se observa que las oscilaciones de la media acumulada se hacen relativamente menores al incorporar más observaciones.
En estos histogramas, la línea azul representa la densidad lognormal teórica, la línea roja discontinua señala la media de referencia de 1,21 t/ha y las barras verdes representan los rendimientos simulados. Con tamaños de muestra mayores, esperamos que el histograma se aproxime visualmente mejor a esa curva, cosa que se observa en los gráficos a continuación.
par(mfrow = c(3, 2))
for (n in tamanos) {
datos <- rendimientos[1:n]
hist(
datos,
probability = TRUE,
breaks = "FD",
col = "lightgreen",
border = "white",
xlim = c(0, 3),
main = paste("Histograma: n =", n),
xlab = "Rendimiento (t/ha)",
ylab = "Densidad"
)
curve(
dlnorm(
x,
meanlog = meanlog,
sdlog = sdlog
),
add = TRUE,
col = "blue",
lwd = 2
)
abline(
v = media_x,
col = "red",
lty = 2
)
}
par(mfrow = c(1, 1))
Resultados de los histogramas:
n=10, hay pocas barras y una representación irregular de los rendimientos.
n=50, comienza a distinguirse una concentración alrededor de los valores centrales.
n=100, la forma del histograma se aproxima mejor a la curva teórica.
n=1.000, la distribución es más estable y se aprecia su asimetría.
n=10.000, las barras siguen bastante bien la curva lognormal azul.
El punto más alto de la curva azul está ligeramente a la izquierda de la línea roja. Esto ocurre porque, en una distribución lognormal, la moda es menor que la media. La cola hacia la derecha desplaza la media hacia rendimientos más altos.
¿Qué relación tienen estos hallazgos con la ley de los grandes números?
Primero, la estabilidad de la media muestral. La ley de los grandes números establece que, conforme aumenta el número de observaciones independientes de una misma distribución con media finita, el promedio muestral converge hacia la media poblacional. Segundo, la forma del histograma. Al aumentar la muestra, el histograma representa mejor la distribución de los rendimientos individuales. Esto es coherente con la convergencia de la distribución empírica hacia la distribución teórica, pero no constituye por sí solo una demostración de la ley de los grandes números.
El teorema central del límite establece que, bajo ciertas condiciones, la distribución de las medias se aproxima a una normal a medida que aumenta el tamaño de cada muestra, incluso cuando los rendimientos individuales tienen una distribución lognormal.
Tenemos dos distribuciones distintas: Distribución de los rendimientos individuales: es lognormal, positiva y asimétrica hacia la derecha. Distribución de las medias muestrales: cuando aumentamos el número de fincas por muestra, tiende a aproximarse a una normal, aunque los rendimientos individuales no sean normales. La distinción es fundamental: el TCL no transforma los rendimientos agrícolas en una distribución normal; describe el comportamiento de sus promedios.
Ahora miremos lo siguiente en el siguiente chunk:
set.seed(456)
# Número de muestras independientes
B <- 1000
# Tamaños de cada muestra
tamanos <- c(10, 50, 100, 1000, 10000)
# Simular B medias para cada tamaño
medias_tcl <- lapply(tamanos, function(n) {
replicate(
B,
mean(rlnorm(n, meanlog = meanlog, sdlog = sdlog))
)
})
# Graficar las distribuciones de las medias
par(mfrow = c(3, 2))
for (i in seq_along(tamanos)) {
hist(
medias_tcl[[i]],
probability = TRUE,
breaks = 30,
col = "lightblue",
border = "white",
main = paste("Medias muestrales: n =", tamanos[i]),
xlab = "Rendimiento promedio (t/ha)",
ylab = "Densidad"
)
abline(v = media_x, col = "red", lty = 2, lwd = 2)
}
par(mfrow = c(1, 1))
A diferencia de los histogramas anteriores, aquí cada barra representa la frecuencia de los promedios de muchas muestras, no la de los rendimientos individuales de las fincas. A medida que aumenta n, esperamos que las medias muestrales estén más concentradas alrededor de 1,21 t/ha y que su distribución tenga una forma cada vez más cercana a una normal. La dispersión de esas medias se denomina error estándar.
Ahora más a detalle se puede observar en cada gráfico tres elementos: las barras celestes representan las 1.000 medias simuladas, la curva azul representa la aproximación normal y la línea roja indica la media teórica de 1,21 t/ha. Es normal que los cinco gráficos tengan escalas horizontales diferentes, porque la dispersión de las medias disminuye mucho cuando aumenta n.
# Comparar las distribuciones de las medias
# con su aproximación normal teórica
par(mfrow = c(3, 2))
for (i in seq_along(tamanos)) {
n <- tamanos[i]
medias <- medias_tcl[[i]]
# Error estándar teórico
error_estandar <- sd_x / sqrt(n)
hist(
medias,
probability = TRUE,
breaks = 30,
col = "lightblue",
border = "white",
main = paste("TCL: n =", n),
xlab = "Media muestral (t/ha)",
ylab = "Densidad"
)
# Aproximación normal del TCL
curve(
dnorm(
x,
mean = media_x,
sd = error_estandar
),
add = TRUE,
col = "darkblue",
lwd = 2
)
# Media teórica
abline(
v = media_x,
col = "red",
lty = 2,
lwd = 2
)
}
par(mfrow = c(1, 1))
Ahora podemos comparar la desviación estándar observada entre las 1.000 medias simuladas con el error estándar que predice la teoría:
# Tabla de resultados del TCL
resultados_tcl <- data.frame(
n = tamanos,
media_de_medias = sapply(
medias_tcl, mean
),
desviacion_simulada = sapply(
medias_tcl, sd
),
error_estandar_teorico = sd_x / sqrt(tamanos)
)
knitr::kable(
resultados_tcl,
digits = 4,
caption = "Resultados de la simulación del TCL"
)
| n | media_de_medias | desviacion_simulada | error_estandar_teorico |
|---|---|---|---|
| 10 | 1.2141 | 0.0792 | 0.0791 |
| 50 | 1.2114 | 0.0366 | 0.0354 |
| 100 | 1.2110 | 0.0248 | 0.0250 |
| 1000 | 1.2101 | 0.0077 | 0.0079 |
| 10000 | 1.2099 | 0.0025 | 0.0025 |
La columna de las medias de medias en n = 10.000 se aproxima a 1,21, y la desviación simulada y el error estándar teórico son idénticos en este caso.
Interpretación del Teorema: Para analizar el teorema central del límite se realizó una simulación de rendimientos de maíz suave seco mediante una distribución lognormal, tomando como referencia el rendimiento agregado provincial de Chimborazo de 2025 (1,21 t/ha) y una desviación estándar hipotética de 0,25 t/ha.
Se generaron 1.000 muestras independientes para cada uno de los siguientes tamaños: 10, 50, 100, 1.000 y 10.000 observaciones. Posteriormente, se calculó el rendimiento promedio de cada muestra y se analizó la distribución de las medias muestrales.
De acuerdo con el teorema central del límite, se espera que, conforme aumente el tamaño de muestra, la distribución de los promedios se aproxime a una distribución normal, aunque los rendimientos individuales sigan una distribución lognormal. Asimismo, la dispersión de las medias muestrales debería disminuir conforme aumenta el número de observaciones. Esta simulación permite comprender la importancia del tamaño de muestra para la precisión de las estimaciones estadísticas.
knitr::kable(
resultados,
digits = 4,
caption = "Convergencia de la media muestral"
)
| n | media_muestral | media_teorica | error_absoluto |
|---|---|---|---|
| 10 | 1.2247 | 1.21 | 0.0147 |
| 50 | 1.2147 | 1.21 | 0.0047 |
| 100 | 1.2281 | 1.21 | 0.0181 |
| 1000 | 1.2137 | 1.21 | 0.0037 |
| 10000 | 1.2094 | 1.21 | 0.0006 |
La columna de error absoluto nos indica que para las 10.000 observaciones es menor la distancia entre la media muestral y el valor teórico de 1,21.
b.En una distribución lognormal, la media y la mediana son diferentes. Podemos comprobarlo con este código:
# Media teórica
media_x
## [1] 1.21
# Mediana teórica
mediana_teorica <- exp(meanlog)
# Moda teórica
moda_teorica <- exp(meanlog - sdlog^2)
data.frame(
Medida = c("Media", "Mediana", "Moda"),
Valor = c(media_x, mediana_teorica, moda_teorica)
)
## Medida Valor
## 1 Media 1.210000
## 2 Mediana 1.184972
## 3 Moda 1.136459
Esto tiene una interpretación agrícola interesante: bajo nuestro modelo, el rendimiento más frecuente sería inferior al rendimiento medio, porque algunos valores altos contribuyen a elevar ese promedio. El 50 % de las fincas hipotéticas tendría un rendimiento inferior a 1,185 t/ha.El otro 50 % tendría un rendimiento superior a 1,185 t/ha.
# Comparación entre desviación estándar
# individual y error estándar de la media
comparacion <- data.frame(
n = tamanos,
sd_individual = rep(sd_x, length(tamanos)),
error_estandar = sd_x / sqrt(tamanos),
sd_medias_simuladas = sapply(medias_tcl, sd),
media_de_medias = sapply(medias_tcl, mean)
)
knitr::kable(
comparacion,
digits = 4,
caption = "Desviación estándar y error estándar"
)
| n | sd_individual | error_estandar | sd_medias_simuladas | media_de_medias |
|---|---|---|---|---|
| 10 | 0.25 | 0.0791 | 0.0792 | 1.2141 |
| 50 | 0.25 | 0.0354 | 0.0366 | 1.2114 |
| 100 | 0.25 | 0.0250 | 0.0248 | 1.2110 |
| 1000 | 0.25 | 0.0079 | 0.0077 | 1.2101 |
| 10000 | 0.25 | 0.0025 | 0.0025 | 1.2099 |
La simulación permitió estudiar el comportamiento probabilístico del rendimiento de maíz suave seco mediante una distribución lognormal. Se utilizó como referencia el rendimiento agregado provincial de Chimborazo correspondiente a 2025 (1,21 t/ha), mientras que la desviación estándar de 0,25 t/ha se estableció como un supuesto con fines didácticos.
1. Distribución de probabilidad. La distribución lognormal constituye una alternativa plausible para representar rendimientos agrícolas, porque admite únicamente valores positivos y permite incorporar asimetría hacia la derecha. Sin embargo, su adecuación a los rendimientos reales de Chimborazo no ha sido comprobada mediante datos desagregados por finca.
2. Tamaño de muestra y representación de la distribución. La comparación de los histogramas mostró que, con muestras pequeñas, la representación de los rendimientos es más irregular. Conforme aumentó el número de observaciones, los histogramas se aproximaron visualmente a la densidad lognormal utilizada para generar los datos.
3. Ley de los grandes números. El ejercicio permitió examinar cómo evoluciona la media acumulada conforme aumenta el tamaño de muestra. De acuerdo con esta ley, se espera que el promedio muestral converja hacia la media teórica de 1,21 t/ha. Esta convergencia no implica que el error disminuya necesariamente en cada nueva observación.
4. Teorema central del límite. La simulación de muestras independientes permitió analizar la distribución de las medias muestrales. Aunque los rendimientos individuales fueron generados mediante una distribución lognormal, se espera que la distribución de sus promedios se aproxime progresivamente a una normal al aumentar el tamaño de cada muestra.
5. Desviación estándar y error estándar. La desviación estándar del modelo describe la variabilidad de los rendimientos individuales, mientras que el error estándar representa la variabilidad de los promedios muestrales. El aumento del tamaño de muestra mejora la precisión de la estimación del promedio, sin modificar la dispersión de la población simulada. Finalmente, aunque la productividad de las fincas depende de múltiples factores, la disminución del error estándar no significa que esos factores ni las diferencias productivas hayan cambiado.
6. Limitaciones. El ejercicio combina un indicador agrícola provincial con supuestos estadísticos para desarrollar una simulación. En consecuencia, sus resultados no permiten inferir la distribución real de los rendimientos entre fincas ni identificar los efectos de las semillas, el acceso al agua, las condiciones del suelo o los sistemas de producción. Para ello se requerirían microdatos y un diseño de investigación específico.
Fuente de apoyo:
OpenAI. (2026). ChatGPT (versión del 08 de octubre 2026) [Modelo de lenguaje de gran tamaño]. https://chat.openai.com/chat
SIPA, 2026. Información Productiva Territorial. ESPAC - 2025. Revisado en https://sipa.agricultura.gob.ec/index.php/cifras-agroproductivas
Zambrano, J.L., Velásquez, J., Peñaherrera, D., Sangoquiza, C., Cartagena, Y., Villacrés, E., Garcés, S., Ortíz, R., León, J., Campaña, D.†, López, V., Asaquibay, C., Nieto, M., Sanmartín G., Pintado, P., Yánez, C., Racines, M. (2021). Guía para la producción sustentable de maíz en la Sierra ecuatoriana. INIAP, Manual No. 122. Quito, Ecuador.