Contexto general: La superficie plantada de maíz suave seco en Chimborazo es de 1.263 ha, con una producción de 5.130 toneladas en 2025. Este cultivo, en la Sierra del Ecuador es de fundamental importancia por el rol que cumple el grano en la seguridad alimentaria de la población. Este es uno de los más importantes en la producción nacional debido a la superficie destinada para su cultivo y al papel que cumple como componente básico de la dieta de la población ecuatoriana. La distribución de algunos de los tipos de maíces más cultivados en las provincias de Ia Sierra se debe a los gustos y costumbres de los agricultores. Así, en la Sierra norte (provincias de Carchi, Imbabura, Pichincha) se produce principalmente maíces con granos de tipo amarillo harinoso, en la parte central (Tungurahua, Chimborazo y Bolívar) se cultiva los maíces de grano blanco harinoso y en la Sierra sur (Cañar y Azuay) el maíz denominado “Zhima”, de grano blanco dentado o amorochado (Zambrano et.al, 2021).

Caso analizado para variable continua

Pregunta: ¿Cómo se comporta el rendimiento agrícola de maíz entre diferentes unidades productivas y cómo cambia la precisión de su promedio estimado cuando aumenta el tamaño de la muestra?

1. Parámetros de análisis:

Fuente: SIPA, 2026. Información Productiva Territorial. ESPAC - 2025.

Nota de elección de la distribución:

Se ha elegido en este caso la distribución lognormal puesto que tiene tres propiedades que nos interesan:

1. Solo toma valores positivos, coherentes con el rendimiento de un cultivo.

2. Puede representar una distribución asimétrica, con una cola hacia rendimientos altos.

3. Permite estudiar la variabilidad de una actividad productiva en la que intervienen múltiples factores.

# Rendimiento de maíz suave seco
# Chimborazo, 2025, Tomado de la encuesta ESPAC - INEC 

# Media de referencia provincial
media_x <- 1.21

# Desviación estándar 
sd_x <- 0.25

# Parámetros de la distribución lognormal
sdlog <- sqrt(log(1 + (sd_x / media_x)^2))

meanlog <- log(media_x) - (sdlog^2 / 2)

# Verificar los parámetros
meanlog
## [1] 0.1697192
sdlog
## [1] 0.2044562
  1. Comprender la función de densidad y la función acumulada:

La función de densidad de probabilidad (PDF) describe cómo se distribuyen los posibles rendimientos. La función de distribución acumulada (CDF) nos permite calcular la probabilidad de que el rendimiento sea menor o igual a determinado valor.

# Valores de rendimiento
x <- seq(0.01, 3, length.out = 500)

# Densidad de probabilidad
densidad <- dlnorm(
  x,
  meanlog = meanlog,
  sdlog = sdlog
)

plot(
  x, densidad,
  type = "l",
  col = "darkgreen",
  lwd = 2,
  main = "Función de densidad lognormal",
  xlab = "Rendimiento de maíz (t/ha)",
  ylab = "Densidad"
)

abline(v = media_x, col = "red", lty = 2)

legend(
  "topright",
  legend = c("Densidad", "Media teórica"),
  col = c("darkgreen", "red"),
  lty = c(1, 2),
  bty = "n"
)

# Función de distribución acumulada
acumulada <- plnorm(
  x,
  meanlog = meanlog,
  sdlog = sdlog
)

plot(
  x, acumulada,
  type = "l",
  col = "blue",
  lwd = 2,
  main = "Distribución acumulada lognormal",
  xlab = "Rendimiento de maíz (t/ha)",
  ylab = "Probabilidad acumulada"
)

# Probabilidad de rendimiento <= 1 t/ha
prob_1 <- plnorm(
  1,
  meanlog = meanlog,
  sdlog = sdlog
)

prob_1
## [1] 0.2032409
  1. Simulación de los cinco tamaños de muestra:

Donde: n = 10, 50, 100, 1.000,10.000 Primero generaremos una secuencia de 10.000 rendimientos. Luego analizaremos sus primeros 10, 50, 100, 1.000 y 10.000 valores.Este procedimiento permite comparar cómo evoluciona una misma secuencia aleatoria al aumentar la muestra.

set.seed(123)

# Simular 10000 rendimientos
rendimientos <- rlnorm(
  n = 10000,
  meanlog = meanlog,
  sdlog = sdlog
)

# Tamaños de muestra
tamanos <- c(10, 50, 100, 1000, 10000)

# Calcular medias por tamaño
medias <- sapply(tamanos, function(n) {
  mean(rendimientos[1:n])
})

# Crear tabla de resultados
resultados <- data.frame(
  n = tamanos,
  media_muestral = medias,
  media_teorica = media_x,
  error_absoluto = abs(medias - media_x)
)

knitr::kable(
  resultados,
  digits = 4,
  caption = "Comparación de medias muestrales"
)
Comparación de medias muestrales
n media_muestral media_teorica error_absoluto
10 1.2247 1.21 0.0147
50 1.2147 1.21 0.0047
100 1.2281 1.21 0.0181
1000 1.2137 1.21 0.0037
10000 1.2094 1.21 0.0006

Según la Ley de los Grandes Números a medida que aumentamos el número de observaciones, el promedio muestral tiende a acercarse al valor esperado de la población, bajo los supuestos correspondientes. Y conforme al Teorema del Límite Central, cuando el tamaño de la muestra es suficientemente grande, la distribución de los promedios muestrales tiende a aproximarse a una distribución normal, bajo condiciones habituales de independencia y varianza finita.

  1. Creación de los gráficos:

Para visualizar la fluctuación de la media muestral, construiremos cinco gráficos: uno para cada tamaño de muestra. En cada gráfico se observa: - La línea azul muestra cómo cambia el promedio acumulado al incorporar observaciones. - La línea roja horizontal representa la media poblacional teórica de 1,21 t/ha.

En los histogramas, las barras representan la distribución de los rendimientos simulados y la curva teórica corresponde a la distribución lognormal. A medida que aumenta el tamaño de la muestra, las frecuencias observadas tienden a representar mejor la distribución teórica del rendimiento agrícola.

par(mfrow = c(3, 2))

for (n in tamanos) {

  datos <- rendimientos[1:n]

  media_acumulada <- cumsum(datos) /
                     seq_along(datos)

  plot(
    seq_along(datos),
    media_acumulada,
    type = "l",
    col = "blue",
    lwd = 1.5,
    main = paste("Tamaño de muestra:", n),
    xlab = "Número de observaciones",
    ylab = "Media acumulada",
    ylim = range(c(media_acumulada, media_x))
  )

  abline(
    h = media_x,
    col = "red",
    lty = 2,
    lwd = 2
  )
}

par(mfrow = c(1, 1))

Al observar los cinco gráficos, se observa que las oscilaciones de la media acumulada se hacen relativamente menores al incorporar más observaciones.

  1. Creación de los histogramas de los rendimientos:

En estos histogramas, la línea azul representa la densidad lognormal teórica, la línea roja discontinua señala la media de referencia de 1,21 t/ha y las barras verdes representan los rendimientos simulados. Con tamaños de muestra mayores, esperamos que el histograma se aproxime visualmente mejor a esa curva, cosa que se observa en los gráficos a continuación.

par(mfrow = c(3, 2))

for (n in tamanos) {

  datos <- rendimientos[1:n]

  hist(
    datos,
    probability = TRUE,
    breaks = "FD",
    col = "lightgreen",
    border = "white",
    xlim = c(0, 3),
    main = paste("Histograma: n =", n),
    xlab = "Rendimiento (t/ha)",
    ylab = "Densidad"
  )

  curve(
    dlnorm(
      x,
      meanlog = meanlog,
      sdlog = sdlog
    ),
    add = TRUE,
    col = "blue",
    lwd = 2
  )

  abline(
    v = media_x,
    col = "red",
    lty = 2
  )
}

par(mfrow = c(1, 1))

Resultados de los histogramas:

El punto más alto de la curva azul está ligeramente a la izquierda de la línea roja. Esto ocurre porque, en una distribución lognormal, la moda es menor que la media. La cola hacia la derecha desplaza la media hacia rendimientos más altos.

¿Qué relación tienen estos hallazgos con la ley de los grandes números?

Primero, la estabilidad de la media muestral. La ley de los grandes números establece que, conforme aumenta el número de observaciones independientes de una misma distribución con media finita, el promedio muestral converge hacia la media poblacional. Segundo, la forma del histograma. Al aumentar la muestra, el histograma representa mejor la distribución de los rendimientos individuales. Esto es coherente con la convergencia de la distribución empírica hacia la distribución teórica, pero no constituye por sí solo una demostración de la ley de los grandes números.

  1. Teoría central del límite:

El teorema central del límite establece que, bajo ciertas condiciones, la distribución de las medias se aproxima a una normal a medida que aumenta el tamaño de cada muestra, incluso cuando los rendimientos individuales tienen una distribución lognormal.

Tenemos dos distribuciones distintas: Distribución de los rendimientos individuales: es lognormal, positiva y asimétrica hacia la derecha. Distribución de las medias muestrales: cuando aumentamos el número de fincas por muestra, tiende a aproximarse a una normal, aunque los rendimientos individuales no sean normales. La distinción es fundamental: el TCL no transforma los rendimientos agrícolas en una distribución normal; describe el comportamiento de sus promedios.

Ahora miremos lo siguiente en el siguiente chunk:

set.seed(456)

# Número de muestras independientes
B <- 1000

# Tamaños de cada muestra
tamanos <- c(10, 50, 100, 1000, 10000)

# Simular B medias para cada tamaño
medias_tcl <- lapply(tamanos, function(n) {
  replicate(
    B,
    mean(rlnorm(n, meanlog = meanlog, sdlog = sdlog))
  )
})

# Graficar las distribuciones de las medias
par(mfrow = c(3, 2))

for (i in seq_along(tamanos)) {

  hist(
    medias_tcl[[i]],
    probability = TRUE,
    breaks = 30,
    col = "lightblue",
    border = "white",
    main = paste("Medias muestrales: n =", tamanos[i]),
    xlab = "Rendimiento promedio (t/ha)",
    ylab = "Densidad"
  )

  abline(v = media_x, col = "red", lty = 2, lwd = 2)
}

par(mfrow = c(1, 1))

A diferencia de los histogramas anteriores, aquí cada barra representa la frecuencia de los promedios de muchas muestras, no la de los rendimientos individuales de las fincas. A medida que aumenta n, esperamos que las medias muestrales estén más concentradas alrededor de 1,21 t/ha y que su distribución tenga una forma cada vez más cercana a una normal. La dispersión de esas medias se denomina error estándar.

Ahora más a detalle se puede observar en cada gráfico tres elementos: las barras celestes representan las 1.000 medias simuladas, la curva azul representa la aproximación normal y la línea roja indica la media teórica de 1,21 t/ha. Es normal que los cinco gráficos tengan escalas horizontales diferentes, porque la dispersión de las medias disminuye mucho cuando aumenta n.

# Comparar las distribuciones de las medias
# con su aproximación normal teórica

par(mfrow = c(3, 2))

for (i in seq_along(tamanos)) {

  n <- tamanos[i]
  medias <- medias_tcl[[i]]

  # Error estándar teórico
  error_estandar <- sd_x / sqrt(n)

  hist(
    medias,
    probability = TRUE,
    breaks = 30,
    col = "lightblue",
    border = "white",
    main = paste("TCL: n =", n),
    xlab = "Media muestral (t/ha)",
    ylab = "Densidad"
  )

  # Aproximación normal del TCL
  curve(
    dnorm(
      x,
      mean = media_x,
      sd = error_estandar
    ),
    add = TRUE,
    col = "darkblue",
    lwd = 2
  )

  # Media teórica
  abline(
    v = media_x,
    col = "red",
    lty = 2,
    lwd = 2
  )
}

par(mfrow = c(1, 1))

Ahora podemos comparar la desviación estándar observada entre las 1.000 medias simuladas con el error estándar que predice la teoría:

# Tabla de resultados del TCL

resultados_tcl <- data.frame(
  n = tamanos,

  media_de_medias = sapply(
    medias_tcl, mean
  ),

  desviacion_simulada = sapply(
    medias_tcl, sd
  ),

  error_estandar_teorico = sd_x / sqrt(tamanos)
)

knitr::kable(
  resultados_tcl,
  digits = 4,
  caption = "Resultados de la simulación del TCL"
)
Resultados de la simulación del TCL
n media_de_medias desviacion_simulada error_estandar_teorico
10 1.2141 0.0792 0.0791
50 1.2114 0.0366 0.0354
100 1.2110 0.0248 0.0250
1000 1.2101 0.0077 0.0079
10000 1.2099 0.0025 0.0025

La columna de las medias de medias en n = 10.000 se aproxima a 1,21, y la desviación simulada y el error estándar teórico son idénticos en este caso.

Interpretación del Teorema: Para analizar el teorema central del límite se realizó una simulación de rendimientos de maíz suave seco mediante una distribución lognormal, tomando como referencia el rendimiento agregado provincial de Chimborazo de 2025 (1,21 t/ha) y una desviación estándar hipotética de 0,25 t/ha.

Se generaron 1.000 muestras independientes para cada uno de los siguientes tamaños: 10, 50, 100, 1.000 y 10.000 observaciones. Posteriormente, se calculó el rendimiento promedio de cada muestra y se analizó la distribución de las medias muestrales.

De acuerdo con el teorema central del límite, se espera que, conforme aumente el tamaño de muestra, la distribución de los promedios se aproxime a una distribución normal, aunque los rendimientos individuales sigan una distribución lognormal. Asimismo, la dispersión de las medias muestrales debería disminuir conforme aumenta el número de observaciones. Esta simulación permite comprender la importancia del tamaño de muestra para la precisión de las estimaciones estadísticas.

  1. Conclusiones
  1. Para saber exactamente cuánto se acercó cada media a 1,21, se ejecuta el siguiente código:
knitr::kable(
  resultados,
  digits = 4,
  caption = "Convergencia de la media muestral"
)
Convergencia de la media muestral
n media_muestral media_teorica error_absoluto
10 1.2247 1.21 0.0147
50 1.2147 1.21 0.0047
100 1.2281 1.21 0.0181
1000 1.2137 1.21 0.0037
10000 1.2094 1.21 0.0006

La columna de error absoluto nos indica que para las 10.000 observaciones es menor la distancia entre la media muestral y el valor teórico de 1,21.

b.En una distribución lognormal, la media y la mediana son diferentes. Podemos comprobarlo con este código:

# Media teórica
media_x
## [1] 1.21
# Mediana teórica
mediana_teorica <- exp(meanlog)

# Moda teórica
moda_teorica <- exp(meanlog - sdlog^2)

data.frame(
  Medida = c("Media", "Mediana", "Moda"),
  Valor = c(media_x, mediana_teorica, moda_teorica)
)
##    Medida    Valor
## 1   Media 1.210000
## 2 Mediana 1.184972
## 3    Moda 1.136459

Esto tiene una interpretación agrícola interesante: bajo nuestro modelo, el rendimiento más frecuente sería inferior al rendimiento medio, porque algunos valores altos contribuyen a elevar ese promedio. El 50 % de las fincas hipotéticas tendría un rendimiento inferior a 1,185 t/ha.El otro 50 % tendría un rendimiento superior a 1,185 t/ha.

  1. Resumen de resultados
# Comparación entre desviación estándar
# individual y error estándar de la media

comparacion <- data.frame(
  n = tamanos,
  sd_individual = rep(sd_x, length(tamanos)),
  error_estandar = sd_x / sqrt(tamanos),
  sd_medias_simuladas = sapply(medias_tcl, sd),
  media_de_medias = sapply(medias_tcl, mean)
)

knitr::kable(
  comparacion,
  digits = 4,
  caption = "Desviación estándar y error estándar"
)
Desviación estándar y error estándar
n sd_individual error_estandar sd_medias_simuladas media_de_medias
10 0.25 0.0791 0.0792 1.2141
50 0.25 0.0354 0.0366 1.2114
100 0.25 0.0250 0.0248 1.2110
1000 0.25 0.0079 0.0077 1.2101
10000 0.25 0.0025 0.0025 1.2099

La simulación permitió estudiar el comportamiento probabilístico del rendimiento de maíz suave seco mediante una distribución lognormal. Se utilizó como referencia el rendimiento agregado provincial de Chimborazo correspondiente a 2025 (1,21 t/ha), mientras que la desviación estándar de 0,25 t/ha se estableció como un supuesto con fines didácticos.

1. Distribución de probabilidad. La distribución lognormal constituye una alternativa plausible para representar rendimientos agrícolas, porque admite únicamente valores positivos y permite incorporar asimetría hacia la derecha. Sin embargo, su adecuación a los rendimientos reales de Chimborazo no ha sido comprobada mediante datos desagregados por finca.

2. Tamaño de muestra y representación de la distribución. La comparación de los histogramas mostró que, con muestras pequeñas, la representación de los rendimientos es más irregular. Conforme aumentó el número de observaciones, los histogramas se aproximaron visualmente a la densidad lognormal utilizada para generar los datos.

3. Ley de los grandes números. El ejercicio permitió examinar cómo evoluciona la media acumulada conforme aumenta el tamaño de muestra. De acuerdo con esta ley, se espera que el promedio muestral converja hacia la media teórica de 1,21 t/ha. Esta convergencia no implica que el error disminuya necesariamente en cada nueva observación.

4. Teorema central del límite. La simulación de muestras independientes permitió analizar la distribución de las medias muestrales. Aunque los rendimientos individuales fueron generados mediante una distribución lognormal, se espera que la distribución de sus promedios se aproxime progresivamente a una normal al aumentar el tamaño de cada muestra.

5. Desviación estándar y error estándar. La desviación estándar del modelo describe la variabilidad de los rendimientos individuales, mientras que el error estándar representa la variabilidad de los promedios muestrales. El aumento del tamaño de muestra mejora la precisión de la estimación del promedio, sin modificar la dispersión de la población simulada. Finalmente, aunque la productividad de las fincas depende de múltiples factores, la disminución del error estándar no significa que esos factores ni las diferencias productivas hayan cambiado.

6. Limitaciones. El ejercicio combina un indicador agrícola provincial con supuestos estadísticos para desarrollar una simulación. En consecuencia, sus resultados no permiten inferir la distribución real de los rendimientos entre fincas ni identificar los efectos de las semillas, el acceso al agua, las condiciones del suelo o los sistemas de producción. Para ello se requerirían microdatos y un diseño de investigación específico.

Fuente de apoyo:

SIPA, 2026. Información Productiva Territorial. ESPAC - 2025. Revisado en https://sipa.agricultura.gob.ec/index.php/cifras-agroproductivas

Zambrano, J.L., Velásquez, J., Peñaherrera, D., Sangoquiza, C., Cartagena, Y., Villacrés, E., Garcés, S., Ortíz, R., León, J., Campaña, D.†, López, V., Asaquibay, C., Nieto, M., Sanmartín G., Pintado, P., Yánez, C., Racines, M. (2021). Guía para la producción sustentable de maíz en la Sierra ecuatoriana. INIAP, Manual No. 122. Quito, Ecuador.

Caso analizado para variable discreta

En la provincia de Chimborazo, el rendimiento del maíz suave seco constituye un indicador importante de la producción agrícola. A partir del modelo lognormal previamente establecido para el rendimiento por hectárea, se propone analizar el número de parcelas que alcanzan una producción mínima de 1,20 t/ha. Para ello, se considera un grupo hipotético de 20 parcelas y se emplea la distribución binomial, con el propósito de estudiar el comportamiento de esta variable mediante simulaciones aleatorias.

Pregunta de investigación: ¿Cómo se distribuye el número de parcelas de maíz suave seco que alcanzan un rendimiento mínimo de 1,20 t/ha, considerando grupos hipotéticos de 20 parcelas en la provincia de Chimborazo?

Variable aleatoria (Y): número de parcelas que alcanzan un rendimiento igual o superior a 1,20 t/ha en cada grupo de 20 parcelas.

Tipo de variable: cuantitativa discreta.

Distribución de probabilidad: binomial.

Parámetros: número de ensayos (20 parcelas) y probabilidad de éxito, determinada a partir de la distribución lognormal del rendimiento agrícola previamente modelada.

Espacio muestral: {0, 1, 2, …, 20}.

Supuestos del modelo: se considera que las parcelas son independientes y presentan una probabilidad de éxito constante. Tanto el tamaño del grupo como el rendimiento mínimo establecido corresponden a criterios de simulación académica; por lo tanto, los resultados no representan observaciones individuales obtenidas directamente en campo.

# VARIABLE DISCRETA: DISTRIBUCION BINOMIAL

# Numero de parcelas por grupo
n_parcelas <- 20

# Rendimiento minimo establecido
umbral <- 1.20

# Probabilidad de alcanzar el rendimiento minimo
p_exito <- 1 - plnorm(
  umbral,
  meanlog = meanlog,
  sdlog = sdlog
)

# Media teorica de la distribucion binomial
media_y <- n_parcelas * p_exito

# Varianza teorica
varianza_y <- n_parcelas * p_exito * (1 - p_exito)

# Desviacion estandar teorica
sd_y <- sqrt(varianza_y)

# Verificar parametros
p_exito
## [1] 0.4754254
media_y
## [1] 9.508508
varianza_y
## [1] 4.987922
sd_y
## [1] 2.233366
# Valores posibles de la variable discreta
y <- 0:20

# Funcion de masa de probabilidad
probabilidad_y <- dbinom(
  y,
  size = n_parcelas,
  prob = p_exito
)

# Graficar FMP
plot(
  y, probabilidad_y,
  type = "h",
  col = "darkgreen",
  lwd = 4,
  main = "Funcion de masa de probabilidad binomial",
  xlab = "Numero de parcelas que alcanzan 1.20 t/ha",
  ylab = "Probabilidad"
)

# Linea de la media teorica
abline(
  v = media_y,
  col = "red",
  lty = 2,
  lwd = 2
)

legend(
  "topright",
  legend = c("Probabilidad binomial", "Media teorica"),
  col = c("darkgreen", "red"),
  lty = c(1, 2),
  lwd = c(4, 2),
  bty = "n"
)

# Funcion de distribucion acumulada
acumulada_y <- pbinom(
  y,
  size = n_parcelas,
  prob = p_exito
)

# Graficar FDA
plot(
  y, acumulada_y,
  type = "s",
  col = "blue",
  lwd = 2,
  main = "Distribucion acumulada binomial",
  xlab = "Numero de parcelas",
  ylab = "Probabilidad acumulada",
  ylim = c(0, 1)
)

# Probabilidad de que como maximo 10 parcelas
# alcancen el rendimiento minimo
prob_10 <- pbinom(
  10,
  size = n_parcelas,
  prob = p_exito
)

prob_10
## [1] 0.6719689

Simulación de muestras aleatorias

Para analizar el comportamiento de la variable discreta, se generan muestras aleatorias de tamaños 10, 50, 100, 1000 y 10000 mediante la función rbinom() de R. Cada observación representa el número de parcelas que alcanzan un rendimiento mínimo de 1,20 t/ha dentro de un grupo hipotético de 20 parcelas.

La simulación permite comparar las medias muestrales con la esperanza matemática de la distribución binomial y evaluar cómo cambia la precisión de las estimaciones a medida que aumenta el tamaño de la muestra.

# SIMULACION DE MUESTRAS ALEATORIAS BINOMIALES

# Fijar semilla para reproducibilidad
set.seed(123)

# Tamaños de muestra
tamanos_y <- c(10, 50, 100, 1000, 10000)

# Generar 10000 observaciones de la distribucion binomial
datos_y <- rbinom(
  10000,
  size = n_parcelas,
  prob = p_exito
)

# Calcular medias muestrales
medias_y <- sapply(
  tamanos_y,
  function(n) mean(datos_y[1:n])
)

# Calcular error absoluto respecto a la media teorica
errores_y <- abs(medias_y - media_y)

# Crear tabla de resultados
tabla_y <- data.frame(
  Tamano_muestra = tamanos_y,
  Media_muestral = round(medias_y, 4),
  Media_teorica = round(media_y, 4),
  Error_absoluto = round(errores_y, 4)
)

# Mostrar resultados
knitr::kable(
  tabla_y,
  caption = "Comparacion de medias muestrales y media teorica de la distribucion binomial"
)
Comparacion de medias muestrales y media teorica de la distribucion binomial
Tamano_muestra Media_muestral Media_teorica Error_absoluto
10 10.000 9.5085 0.4915
50 9.660 9.5085 0.1515
100 9.450 9.5085 0.0585
1000 9.476 9.5085 0.0325
10000 9.481 9.5085 0.0275

Interpretación de la simulación de muestras aleatorias

Los resultados muestran que, a medida que aumenta el tamaño de la muestra, la media muestral tiende a aproximarse a la media teórica de la distribución binomial (9,5085 parcelas). Para una muestra de 10 observaciones se obtuvo una media de 10,0000, con un error absoluto de 0,4915; mientras que, para 10 000 observaciones, la media fue de 9,4810, con un error de 0,0275. Este comportamiento es consistente con la Ley de los Grandes Números, según la cual el promedio muestral tiende a estabilizarse alrededor de la esperanza matemática cuando aumenta el número de observaciones. Los resultados corresponden a grupos hipotéticos de 20 parcelas y no a mediciones reales realizadas en campo.

# LEY DE LOS GRANDES NUMEROS
# Convergencia de la media muestral

# Graficar los cinco tamaños de muestra
par(mfrow = c(3, 2))

for (n in tamanos_y) {

  # Seleccionar las primeras n observaciones
  muestra_y <- datos_y[1:n]

  # Calcular media acumulada
  media_acumulada_y <- cumsum(muestra_y) /
    seq_along(muestra_y)

  # Grafico de convergencia
  plot(
    media_acumulada_y,
    type = "l",
    col = "blue",
    lwd = 2,
    main = paste("Convergencia de la media: n =", n),
    xlab = "Numero de observaciones",
    ylab = "Media acumulada"
  )

  # Media teorica de la distribucion binomial
  abline(
    h = media_y,
    col = "red",
    lty = 2,
    lwd = 2
  )
}

# Restaurar configuracion grafica
par(mfrow = c(1, 1))

Interpretación de la Ley de los Grandes Números

Los gráficos de convergencia muestran que la media acumulada de la variable binomial presenta mayores fluctuaciones cuando se consideran tamaños de muestra pequeños (n = 10 y n = 50). A medida que aumenta el número de observaciones, estas fluctuaciones disminuyen y la media se estabiliza alrededor de su valor teórico de 9,5085 parcelas por grupo. Este comportamiento se aprecia especialmente en las simulaciones de n = 1000 y n = 10000, donde la media acumulada permanece próxima a la esperanza matemática. Los resultados ilustran la Ley de los Grandes Números y muestran cómo el incremento del tamaño muestral favorece la estabilidad de las estimaciones.

# HISTOGRAMAS DE LAS MUESTRAS BINOMIALES

# Configurar cinco graficos
par(mfrow = c(3, 2))

for (n in tamanos_y) {

  # Seleccionar las primeras n observaciones
  muestra_y <- datos_y[1:n]

  # Histograma de la muestra
  hist(
    muestra_y,
    breaks = seq(-0.5, 20.5, by = 1),
    probability = TRUE,
    col = "lightblue",
    border = "white",
    main = paste("Histograma binomial: n =", n),
    xlab = "Numero de parcelas exitosas",
    ylab = "Frecuencia relativa",
    xlim = c(0, 20),
    ylim = c(0, 0.25)
  )

  # Agregar probabilidades teoricas de la binomial
  points(
    0:20,
    dbinom(0:20, size = n_parcelas, prob = p_exito),
    col = "darkgreen",
    pch = 16
  )

  # Agregar media teorica
  abline(
    v = media_y,
    col = "red",
    lty = 2,
    lwd = 2
  )
}

# Restaurar configuracion grafica
par(mfrow = c(1, 1))

Interpretación de los histogramas de la variable discreta

Los histogramas muestran la distribución de las observaciones simuladas para tamaños de muestra de 10, 50, 100, 1000 y 10000. En las muestras pequeñas se observan mayores diferencias entre las frecuencias relativas y las probabilidades teóricas de la distribución binomial. Conforme aumenta el tamaño de la muestra, las frecuencias simuladas se aproximan a las probabilidades esperadas, especialmente para n = 1000 y n = 10000. La mayor concentración de observaciones se encuentra alrededor de 9 y 10 parcelas exitosas por grupo, en concordancia con la media teórica de 9,5085. Estos resultados ilustran cómo el incremento del tamaño muestral mejora la representación empírica de la distribución de probabilidad.

Teorema del Límite Central

Para analizar el Teorema del Límite Central, se realizan 1000 repeticiones independientes de muestras aleatorias de tamaños 10, 50, 100, 1000 y 10000, utilizando la distribución binomial previamente definida. En cada repetición se calcula la media muestral, con el propósito de estudiar su distribución y comparar la desviación estándar simulada con el error estándar teórico.

De acuerdo con el Teorema del Límite Central, al aumentar el tamaño de la muestra, la distribución de las medias muestrales tiende a aproximarse a una distribución normal, centrada en la esperanza matemática de la variable original.

# TEOREMA DEL LIMITE CENTRAL - VARIABLE BINOMIAL

# Fijar semilla para reproducibilidad
set.seed(456)

# Numero de repeticiones
B_y <- 1000

# Simular medias muestrales
medias_tcl_y <- lapply(
  tamanos_y,
  function(n) {
    replicate(
      B_y,
      mean(
        rbinom(
          n,
          size = n_parcelas,
          prob = p_exito
        )
      )
    )
  }
)

# Calcular media de las medias simuladas
promedio_medias_y <- sapply(medias_tcl_y, mean)

# Calcular desviacion estandar de las medias
sd_medias_y <- sapply(medias_tcl_y, sd)

# Calcular error estandar teorico
error_estandar_y <- sqrt(varianza_y / tamanos_y)

# Crear tabla de resultados
tabla_tcl_y <- data.frame(
  Tamano_muestra = tamanos_y,
  Media_de_medias = round(promedio_medias_y, 4),
  Desviacion_simulada = round(sd_medias_y, 4),
  Error_estandar_teorico = round(error_estandar_y, 4)
)

# Mostrar tabla
knitr::kable(
  tabla_tcl_y,
  caption = "Resultados del Teorema del Limite Central para la variable binomial"
)
Resultados del Teorema del Limite Central para la variable binomial
Tamano_muestra Media_de_medias Desviacion_simulada Error_estandar_teorico
10 9.5337 0.7134 0.7063
50 9.5136 0.3193 0.3158
100 9.5159 0.2205 0.2233
1000 9.5101 0.0706 0.0706
10000 9.5087 0.0229 0.0223

Interpretación del Teorema del Límite Central

Los resultados obtenidos mediante 1000 repeticiones de muestras aleatorias muestran que las medias muestrales se concentran progresivamente alrededor de la esperanza teórica de 9,5085 parcelas por grupo. Para n = 10 se obtuvo una media de las medias de 9,5337 y una desviación estándar simulada de 0,7134; mientras que, para n = 10000, estos valores fueron 9,5087 y 0,0229, respectivamente. Asimismo, las desviaciones estándar simuladas presentan valores cercanos a los errores estándar teóricos, evidenciando una disminución de la variabilidad de las medias conforme aumenta el tamaño muestral. Estos resultados son consistentes con el Teorema del Límite Central, cuya aproximación a la distribución normal se examina mediante los histogramas de las medias simuladas.

# HISTOGRAMAS DEL TEOREMA DEL LIMITE CENTRAL

# Configurar cinco graficos
par(mfrow = c(3, 2))

for (i in seq_along(tamanos_y)) {

  # Tamano de muestra
  n <- tamanos_y[i]

  # Medias obtenidas en las 1000 repeticiones
  medias_simuladas <- medias_tcl_y[[i]]

  # Error estandar teorico
  error_teorico <- sqrt(varianza_y / n)

  # Histograma de las medias muestrales
  hist(
    medias_simuladas,
    probability = TRUE,
    col = "lightblue",
    border = "white",
    main = paste("TCL binomial: n =", n),
    xlab = "Media muestral de parcelas exitosas",
    ylab = "Densidad"
  )

  # Curva normal teorica
  curve(
    dnorm(
      x,
      mean = media_y,
      sd = error_teorico
    ),
    add = TRUE,
    col = "darkgreen",
    lwd = 2
  )

  # Media teorica
  abline(
    v = media_y,
    col = "red",
    lty = 2,
    lwd = 2
  )
}

# Restaurar configuracion grafica
par(mfrow = c(1, 1))

Interpretación gráfica del Teorema del Límite Central

Los histogramas de las 1000 medias muestrales simuladas muestran una aproximación a la distribución normal teórica para los cinco tamaños de muestra analizados. Para n = 10 se observa una mayor dispersión de las medias, mientras que, conforme aumenta el tamaño muestral, las distribuciones se concentran progresivamente alrededor de la esperanza matemática de 9,5085 parcelas por grupo. Este comportamiento es especialmente evidente para n = 1000 y n = 10000, donde la variabilidad de las medias es considerablemente menor. La proximidad entre los histogramas y las curvas normales teóricas, junto con la disminución del error estándar, proporciona evidencia numérica y gráfica consistente con el Teorema del Límite Central.

Variable Discreta: número de hijos de mujeres indígenas de la sierra ecuatoriana

Fase 1 - Definición de variables y ley de probabilidad

Contexto

Para el análisis de la variable discreta se ha escogido el número de hijos de mujeres indígenas de la sierra ecuatoriana. Esta es una variable de conteo. Hay estudios que indican que la Tasa Global de Fecundidad de mujeres indígenas de la sierra ecuatoriana es de 2,4 hijos por mujer. Los documentos que hacen mención a este indicador, se basan principalmente en el Censo del 2022.

Es importante resaltar que la fecundidad de las mujeres indígenas de la sierra ecuatoriana es distinta a la de las mujeres indígenas de la amazonía. Pues, generalmente en estas últimas, la fecundidad es más elevada. Para el caso de este trabajo nos ha interesado trabajar con la fecundidad de las mujeres indígenas de la sierra, de forma específica.

Tipo de variable y distribución

La variable número de hijos sigue una distribución de Poisson con parámetro lambda igual a 2,4. La literatura demográfica sustenta que la variable número de hijos, en varios contextos, sigue la distribución de Poisson.

Gráficos de distribución de la variable número de hijos de mujeres de la sierra ecuatoriana

knitr::opts_chunk$set(echo = TRUE)
# Definición del parámetro
lambda_numhij=2.4
x_pois_numhij <- 0:10
media_teorica_numhij=lambda_numhij
par(mfrow = c(1, 2),oma=c(1.5,1.5,1.5,1.5))
px_pois <- dpois(x_pois_numhij,lambda_numhij)

plot(x_pois_numhij, px_pois, type = "h", xlab= "Numero de hijos", ylab="f(x)",lwd = 2, col="blue", main = "FMP")

plot(stepfun(x_pois_numhij, c(0, ppois(x_pois_numhij, lambda_numhij))), xlab= "Numero de hijos", ylab="F(x)", lwd = 2, col = "red", main = "FDA")

# Título general en el margen exterior superior
mtext("Numero de hijos de mujeres indigenas de la sierra ecuatoriana", outer = TRUE, side = 3, line = 0.5, font = 2, cex = 1.2)
# Subtítulo general en el margen exterior superior
mtext("Distribucion de Poisson", outer = TRUE, side = 3, line = -1, cex = 0.9, col = "darkgray")

En el gráfico anterior se puede observar la Función de Masa de Probabilidad del número de hijos de mujeres indígenas de la sierra ecuatoriana. Esta variable sigue una distribución de Poisson. También se puede observar la Función de Probabilidad Acumulada. Se observa que al llegar al número de 10 hijos, la probalidad acumulada es cercana a 1.

Fase 2 - Simulación y visualización

Simulación de varios escenarios de repeticiones

Se realiza simulaciones de muestras de 100 mujeres haciendo repeticiones de 10, 50, 100, 1000 y 10.000, que son los escenarios. En cada simulación se generan medias del número de hijos. Para la generación de estos datos se toma en cuenta la distribución de Poisson con el parámetro lambda de 2,4 hijos por mujer.

knitr::opts_chunk$set(echo = TRUE)
n=100
B_10=10
B_50=50
B_100=100
B_1000=1000
B_10000=10000

set.seed(1234)
media_hijos_B10 <- replicate(B_10, mean(rpois(n, lambda = lambda_numhij)))
set.seed(1234)
media_hijos_B50 <- replicate(B_50, mean(rpois(n, lambda = lambda_numhij)))
set.seed(1234)
media_hijos_B100 <- replicate(B_100, mean(rpois(n, lambda = lambda_numhij)))
set.seed(1234)
media_hijos_B1000 <- replicate(B_1000, mean(rpois(n, lambda = lambda_numhij)))
set.seed(1234)
media_hijos_B10000 <- replicate(B_10000, mean(rpois(n, lambda = lambda_numhij)))

Se calula la media del número de hijos en cada simulación.

knitr::opts_chunk$set(echo = TRUE)
media_simulada_B10=mean(media_hijos_B10)
media_simulada_B50=mean(media_hijos_B50)
media_simulada_B100=mean(media_hijos_B100)
media_simulada_B1000=mean(media_hijos_B1000)
media_simulada_B10000=mean(media_hijos_B10000)

media_simulada_B10
## [1] 2.452
media_simulada_B50
## [1] 2.408
media_simulada_B100
## [1] 2.3947
media_simulada_B1000
## [1] 2.40233
media_simulada_B10000
## [1] 2.399947

Al calcular las medias de las diferentes simulaciones, se observa que al aumentar el número de simulaciones de muestreo, el valor de la media simulada se aproxima al valor del parámetro poblacional de 2,4 hijos por mujer. Por ejemplo, en la simulación con 10 escenarios de muestra, el número medio de hijos es de 2,45, mientras que en la simulación de 10.000 escenarios de muestra, la media de hijos es de 2,39 muy próximo de los 2,4 hijos por mujer.

Cálculo del error muestral

Se calcula el error muestral para la media de hijos en cada uno de los escenarios.

# Desviación estándar de las medias según cada B escenarios
knitr::opts_chunk$set(echo = TRUE)
se_simulado_numhij_B10= sd(media_hijos_B10)
se_simulado_numhij_B50= sd(media_hijos_B50)
se_simulado_numhij_B100= sd(media_hijos_B100)
se_simulado_numhij_B1000= sd(media_hijos_B1000)
se_simulado_numhij_B10000= sd(media_hijos_B10000)

se_simulado_numhij_B10
## [1] 0.2054697
se_simulado_numhij_B50
## [1] 0.1657882
se_simulado_numhij_B100
## [1] 0.1427327
se_simulado_numhij_B1000
## [1] 0.15617
se_simulado_numhij_B10000
## [1] 0.1540469

Las desviaciones estándar de las medias muestrales simuladas presentaron fluctuaciones conforme aumentó el número de repeticiones, aproximándose al error estándar teórico de 0,1549 hijos por mujer. Este resultado es coherente con una distribución de Poisson de parámetro λ = 2,4 y un tamaño muestral constante de 100 mujeres.

Histograma y gráfico de convergencia de número de hijos con 10 repeticiones

Se construyó un histograma de la variable número de hijos para los cinco escenarios de repeticiones y se realizó el gráfico de convergencia para observar cómo la media del número de hijos se estabiliza conforme aumenta el número de repeticiones.

Las líneas azules discontinuas representan los límites aproximados que abarcan el 95 % de la distribución de las medias muestrales simuladas, calculados mediante la media de las simulaciones ± 1,96 desviaciones estándar. Estos límites permiten visualizar la variabilidad de las medias obtenidas en los diferentes escenarios de simulación.

knitr::opts_chunk$set(echo = TRUE)

# Cálculo de z crítico al 95% de confianza, es decir alfa =0.05
z_critico= qnorm(1-(0.05/2))

ic_l_inferior_B10= media_simulada_B10 - (z_critico*se_simulado_numhij_B10)
ic_l_inferior_B10
## [1] 2.049287
ic_l_superior_B10= media_simulada_B10 + (z_critico*se_simulado_numhij_B10)
ic_l_superior_B10
## [1] 2.854713
par(mfrow = c(1, 2))
histo_B10=hist(media_hijos_B10,breaks=30,prob =TRUE ,col="gray",border="white",xlab="Numero de hijos", ylab="Densidad", main="Histograma de media de hijos con 10 escenarios",cex.main=0.7,xlim=c(1.8,3))

 abline(v=c(ic_l_inferior_B10,ic_l_superior_B10), col="blue",lty=2,lwd=2)
abline(v=media_simulada_B10,col="red",lty=2,lwd=2)
 curve(dnorm(x,mean=media_teorica_numhij,sd=se_simulado_numhij_B10),add=T,col="red", lwd=2)
  
 # Gráfico de convergencia
 
 prom_acumu= cumsum (media_hijos_B10)/(1:B_10)
 plot(prom_acumu, type = "l", col = "darkgreen", lwd = 2,
     main = "Convergencia de numero de hijos", cex.main=0.7,xlab = "Numero de escenarios",
     ylab = "Numero medio de hijos",
     log = "x")
abline(h = lambda_numhij, col = "red", lty = 2)

Histograma y gráfico de convergencia de número de hijos con 50 repeticiones

knitr::opts_chunk$set(echo = TRUE)

ic_l_inferior_B50= media_simulada_B50 - (z_critico*se_simulado_numhij_B50)
ic_l_inferior_B50
## [1] 2.083061
ic_l_superior_B50= media_simulada_B50 + (z_critico*se_simulado_numhij_B50)
ic_l_superior_B50
## [1] 2.732939
par(mfrow = c(1, 2))
histo_B50=hist(media_hijos_B50,breaks=30,prob=T,col="gray",border="white",xlab="Numero de hijos", ylab="Densidad", main="Histograma de media de hijos con 50 escenarios",cex.main=0.7,ylim=c(0,3),xlim=c(1.8,3))
 abline(v=c(ic_l_inferior_B50,ic_l_superior_B50), col="blue",lty=2,lwd=2)
abline(v=media_simulada_B50,col="red",lty=2,lwd=2)

 curve(dnorm(x,mean=media_teorica_numhij,sd=se_simulado_numhij_B50),add=T,col="red", lwd=2)
  # Gráfico de convergencia
 
 prom_acumu= cumsum (media_hijos_B50)/(1:B_50)
 plot(prom_acumu, type = "l", col = "darkgreen", lwd = 2,
     main = "Convergencia de numero de hijos",cex.main=0.7, xlab = "Numero de escenarios",
     ylab = "Numero medio de hijos",
     log = "x")
abline(h = lambda_numhij, col = "red", lty = 2)

Histograma y gráfico de convergencia de número de hijos con 100 repeticiones

knitr::opts_chunk$set(echo = TRUE)

ic_l_inferior_B100= media_simulada_B100 - (z_critico*se_simulado_numhij_B100)
ic_l_inferior_B100
## [1] 2.114949
ic_l_superior_B100= media_simulada_B100 + (z_critico*se_simulado_numhij_B100)
ic_l_superior_B100
## [1] 2.674451
par(mfrow = c(1, 2))
histo_B100=hist(media_hijos_B100,breaks=30,prob=T,col="gray",border="white",xlab="Numero de hijos", ylab="Densidad", main="Histograma de media de hijos con 100 escenarios",cex.main=0.7,ylim=c(0,5),xlim=c(1.8,3))
 abline(v=c(ic_l_inferior_B100,ic_l_superior_B100), col="blue",lty=2,lwd=2)
abline(v=media_simulada_B100,col="red",lty=2,lwd=2)
 curve(dnorm(x,mean=media_teorica_numhij,sd=se_simulado_numhij_B100),add=T,col="red", lwd=2)
  # Gráfico de convergencia
 
 prom_acumu= cumsum (media_hijos_B100)/(1:B_100)
 plot(prom_acumu, type = "l", col = "darkgreen", lwd = 2,
     main = "Convergencia de numero de hijos", cex.main=0.7,xlab = "Numero de escenarios",
     ylab = "Numero medio de hijos",
     log = "x")
abline(h = lambda_numhij, col = "red", lty = 2)

Histograma y gráfico de convergencia de número de hijos con 1000 repeticiones

knitr::opts_chunk$set(echo = TRUE)

ic_l_inferior_B1000= media_simulada_B1000 - (z_critico*se_simulado_numhij_B1000)
ic_l_inferior_B1000
## [1] 2.096242
ic_l_superior_B1000= media_simulada_B1000 + (z_critico*se_simulado_numhij_B1000)
ic_l_superior_B1000
## [1] 2.708418
par(mfrow = c(1, 2))
histo_B1000=hist(media_hijos_B1000,breaks=30,prob=T,col="gray",border="white",xlab="Numero de hijos", ylab="Densidad", main="Histograma de media de hijos con 1000 escenarios",cex.main=0.7,xlim=c(1.8,3))
 abline(v=c(ic_l_inferior_B1000,ic_l_superior_B1000), col="blue",lty=2,lwd=2)
abline(v=media_simulada_B1000,col="red",lty=2,lwd=2)
 curve(dnorm(x,mean=media_teorica_numhij,sd=se_simulado_numhij_B1000),add=T,col="red", lwd=2)
  # Gráfico de convergencia
 
 prom_acumu= cumsum (media_hijos_B1000)/(1:B_1000)
 plot(prom_acumu, type = "l", col = "darkgreen", lwd = 2,
     main = "Convergencia de numero de hijos", xlab = "Numero escenarios",
     ylab = "Numero medio de hijos",cex.main=0.7,
     log = "x")
abline(h = lambda_numhij, col = "red", lty = 2)

Histograma y gráfico de convergencia de número de hijos con 10000 repeticiones

knitr::opts_chunk$set(echo = TRUE)

ic_l_inferior_B10000= media_simulada_B10000 - (z_critico*se_simulado_numhij_B10000)
ic_l_inferior_B10000
## [1] 2.098021
ic_l_superior_B10000= media_simulada_B10000 + (z_critico*se_simulado_numhij_B10000)
ic_l_superior_B10000
## [1] 2.701873
par(mfrow = c(1, 2))
histo_B10000=hist(media_hijos_B10000,breaks=30,prob=T,col="gray",border="white",xlab="Numero de hijos", ylab="Densidad", main="Histograma de media de hijos con 10000 escenarios",cex.main=0.7,ylim=c(0,3))
 abline(v=c(ic_l_inferior_B10000,ic_l_superior_B10000), col="blue",lty=2,lwd=2)
abline(v=media_simulada_B10000,col="red",lty=2,lwd=2)
 curve(dnorm(x,mean=media_teorica_numhij,sd=se_simulado_numhij_B10000),add=T,col="red", lwd=2)
  # Gráfico de convergencia
 
 prom_acumu= cumsum (media_hijos_B10000)/(1:B_10000)
 plot(prom_acumu, type = "l", col = "darkgreen", lwd = 2,
     main = "Convergencia de numero de hijos", cex.main=0.7,xlab = "Numero de escenarios",
     ylab = "Numero medio de hijos",
     log = "x")
abline(h = lambda_numhij, col = "red", lty = 2)

Análisis

Razones para realizar la simulación de los datos

La simulación de los datos para el caso de este ejercicio es necesaria porque los estudios de fecundidad generalmente parten de encuestas de salud que alcanzan representatividad de mujeres a nivel nacional o hasta de privoncia. Sin embargo, cuando se estudia poblaciones más específicas como en este caso de un etnia en particular (índígenas) las encuestas mencionadas no permiten hacer inferencias a ese nivel. El tomar una muestra solo de mujeres indígenas de la sierra ecuatoriana, podría ser muy costoso.

Por otro lado, un estudio para conocer la fecundidad de las mujeres indígenas de la sierra ecuatoriana puede justificarse por su utilidad para políticas de salud sexual y reproductiva en esta población específica.

Punto de estabilización

Según el análisis gráfico el punto de estabilización puede ser con mil repeticiones. A partir de ese punto, presenta fluctuaciones cada vez menores alrededor del valor teórico en relación al parámetro poblacional de 2,4 hijos por mujer.

Aplicación de la Ley de los Grandes Números y del Teorema de Límite Central

En este ejercicio se puede ver la aplicación de la Ley de los Grandes Números, porque a medida que crece el número de secuencias, el valor de la media en esas secuencias se aproxima al parámetro poblacional que es 2,4 hijos por mujer, siendo casi igual para nuestro ejercicio.

Con relación al Teorema del Límite Central, las simulaciones permitieron observar que la distribución de las medias muestrales presenta una aproximación a la distribución normal, aun cuando la variable original sigue una distribución de Poisson. Este comportamiento se relaciona con el tamaño muestral de 100 mujeres utilizado en cada simulación. Al incrementar el número de repeticiones hasta 10.000, se obtiene una representación más estable de la distribución de las medias muestrales.

Conclusiones

La simulación de variables continuas y discretas permitió analizar el comportamiento probabilístico del rendimiento de maíz suave seco en la provincia de Chimborazo mediante distribuciones lognormal y binomial, así como el número de hijos de mujeres indígenas de la Sierra ecuatoriana mediante una distribución de Poisson con parámetro λ = 2,4. Los resultados permitieron comparar las medias simuladas con sus respectivas esperanzas matemáticas y analizar el comportamiento de las distribuciones bajo diferentes escenarios de simulación.

Asimismo, las simulaciones relacionadas con el Teorema del Límite Central evidenciaron la aproximación de las distribuciones de las medias muestrales a una distribución normal conforme aumentó el tamaño de muestra. Las desviaciones estándar simuladas presentaron valores cercanos a los errores estándar teóricos, lo que respalda la coherencia de los resultados obtenidos. En el caso de la distribución de Poisson, al mantener constante el tamaño muestral de 100 mujeres e incrementar el número de repeticiones de 10 a 10000, se observó una mayor estabilidad de la media simulada alrededor del valor teórico de 2,4 hijos por mujer, en concordancia con la Ley de los Grandes Números aplicada a las medias de las simulaciones.

Finalmente, este ejercicio permitió comprender la utilidad de las simulaciones computacionales para estudiar fenómenos agrícolas y demográficos cuando no se dispone de suficientes observaciones individuales. La aplicación de las distribuciones lognormal, binomial y de Poisson facilitó la interpretación de la variabilidad, la convergencia de las medias y el comportamiento de las distribuciones muestrales. No obstante, los resultados deben interpretarse como representaciones probabilísticas sustentadas en parámetros y supuestos definidos, y no como estimaciones empíricas obtenidas directamente de las poblaciones estudiadas.