Introducción

Una función de cuantía (o función de probabilidad discreta) de una variable aleatoria discreta \(X\) asigna a cada valor posible \(x\) su correspondiente probabilidad:

\[ p(x) = P(X = x), \qquad p(x) \ge 0, \qquad \sum_x p(x) = 1 \]

En R, cada distribución tiene cuatro funciones con un prefijo común:

Prefijo Qué calcula Ejemplo
d Función de cuantía \(P(X = x)\) dbinom(3, 10, 0.4)
p Función de distribución acumulada \(P(X \le x)\) pbinom(3, 10, 0.4)
q Cuantil: menor \(x\) tal que \(P(X \le x) \ge p\) qbinom(0.5, 10, 0.4)
r Genera valores aleatorios rbinom(100, 10, 0.4)

Función auxiliar para graficar las cuantías (solo R base):

graficar_cuantia <- function(x, px, titulo, destacar = NULL, col = "steelblue") {
  colores <- ifelse(x %in% destacar, "firebrick", col)
  plot(x, px, type = "h", lwd = 6, col = colores,
       main = titulo, xlab = "x", ylab = "P(X = x)",
       ylim = c(0, max(px) * 1.15), las = 1)
  points(x, px, pch = 19, col = colores)
  grid(nx = NA, ny = NULL)
}

Distribución Bernoulli

Definición

En un único experimento existe dos posibles resultados: éxito (\(X = 1\)) con probabilidad \(p\) o fracaso (\(X = 0\)) con probabilidad \(1-p\), denotados por S y F respectivamente.

\[ X \sim \text{Bernoulli}(p) \]

Función de cuantía

\[ P(X = x) = p^x (1-p)^{1-x}, \qquad x \in \{0, 1\} \]

\[ E[X] = p \qquad\qquad Var(X) = p(1-p) \]

En R

R no tiene funciones propias de Bernoulli; se usa la binomial con size = 1.

Ejemplo

La probabilidad de que una botella sea mal lleanada es \(p = 0{,}75\). ¿Cuál es la probabilidad de éxito y de fracaso en una inseminación?

p <- 0.75
x <- 0:1

px <- dbinom(x, size = 1, prob = p)
data.frame(x = x, resultado = c("Fracaso", "Éxito"), probabilidad = px)
##   x resultado probabilidad
## 1 0   Fracaso         0.25
## 2 1     Éxito         0.75
# Esperanza y varianza
c(media = p, varianza = p * (1 - p))
##    media varianza 
##   0.7500   0.1875


Distribución Binomial

Definición

La V.A.Binomial X, corresponde al número de éxitos en n pruebas de Bernoulli idénticas e independientes, cada una de las pruebas con la misma probabilidad de éxito \(p\) (muestreo con reposición).

\[ X \sim \text{Bin}(n, p) \]

Función de cuantía

\[ P(X = x) = \binom{n}{x} p^x (1-p)^{n-x}, \qquad x = 0, 1, \dots, n \]

\[ E[X] = np \qquad\qquad Var(X) = np(1-p) \]

En R

dbinom(x, size = n, prob = p), pbinom(), qbinom(), rbinom()

Ejemplo

Se toma una muestra de 24 botellas, que tan probable es: a) ¿Probabilidad de que exactamente 7 mal llenadas? b) ¿Probabilidad de que a lo más 5 mal llenadas? c) ¿Probabilidad de que al menos 8 mal llenadas?

n <- 24; p <- 0.25

# a) P(X = 7): fórmula manual vs. R
manual <- choose(n, 7) * p^7 * (1 - p)^(n - 7)
c(manual = manual, dbinom = dbinom(7, n, p))
##    manual    dbinom 
## 0.1587918 0.1587918
# b) P(X <= 5)
pbinom(5, n, p)
## [1] 0.4221552
# c) P(X >= 8) = 1 - P(X <= 7)
1 - pbinom(7, n, p)
## [1] 0.2337958
pbinom(7, n, p, lower.tail = FALSE)   # forma equivalente
## [1] 0.2337958
# Esperanza y varianza
c(media = n * p, varianza = n * p * (1 - p))
##    media varianza 
##      6.0      4.5


Distribución Hipergeométrica

Definición

El experimento consiste en extraer \(m\) elementos de \(N\), K de los cuales son éxito y N-K son fracaso. en un proceso de muestreo sin reposición

\[ X \sim \text{Hipergeométrica}(N, K, m) \]

Función de cuantía

\[ P(X = x) = \frac{\binom{K}{x}\binom{N-K}{m-x}}{\binom{N}{m}}, \qquad \max(0,\, n-N+K) \le x \le \min(m, K) \]

\[ E[X] = m\frac{K}{N} \qquad\qquad Var(X) = m\frac{K}{N}\left(1-\frac{K}{N}\right)\frac{N-m}{N-1} \]

El factor \(\frac{N-m}{N-1}\) es la corrección por población finita.

En R

⚠️ R usa otra notación: dhyper(x, m, n, k) donde

  • m = número de éxitos en la población (\(K\))
  • n = número de fracasos en la población (\(N - K\))
  • k = tamaño de la muestra (\(m\))

Ejemplo

En un lote de \(N = 50\) sacos de alimento hay \(K = 8\) contaminados. Se inspeccionan \(m = 6\) sacos sin reposición. a) ¿Probabilidad de encontrar exactamente 2 contaminados? b) ¿Probabilidad de encontrar al menos 1 contaminado?

N <- 50; K <- 8; m <- 6

# a) P(X = 2): fórmula manual vs. R
manual <- choose(K, 2) * choose(N - K, m - 2) / choose(N, m)
c(manual = manual, dhyper = dhyper(2, m = K, n = N - K, k = m))
##    manual    dhyper 
## 0.1972248 0.1972248
# b) P(X >= 1) = 1 - P(X = 0)
1 - dhyper(0, K, N - K, m)
## [1] 0.6698833
# Esperanza y varianza
media    <- m * K / N
varianza <- m * (K / N) * (1 - K / N) * (N - m) / (N - 1)
c(media = media, varianza = varianza)
##     media  varianza 
## 0.9600000 0.7241143

Comparación con la binomial: si se ignorara que el muestreo es sin reposición, se usaría \(\text{Bin}(6,\; 8/50)\):

c(hipergeometrica = dhyper(2, K, N - K, m),
  binomial        = dbinom(2, m, K / N))
## hipergeometrica        binomial 
##       0.1972248       0.1911826

Cuando \(n\) es pequeño respecto a \(N\) (regla práctica: \(m/N < 0{,}05\)), ambas son muy parecidas.


Distribución de Poisson

Definición

La V.A. Poisson, corresponde al Número de éxitos que ocurren en un UNIDAD (tiempo, área, volumen). Deben ocurrir de forma independiente a una tasa promedio constante \(\lambda\).

\[ X \sim \text{Poisson}(\lambda) \]

Función de cuantía

\[ P(X = x) = \frac{e^{-\lambda}\lambda^x}{x!}, \qquad x = 0, 1, 2, \dots \]

\[ E[X] = \lambda \qquad\qquad Var(X) = \lambda \]

En R

dpois(x, lambda), ppois(), qpois(), rpois()

Ejemplo

En una linea de llenado de botellas se sabe que en \(promedio = 3\) botellas por hora no son bien llenadas . a) ¿Probabilidad de que en una hora haya exactamente 5 botellas mal llenadas? b) ¿Probabilidad de que haya a lo más 2? c) ¿Probabilidad de que en dos semanas haya más de 8? (la tasa escala: \(\lambda = 6\))

lambda <- 3

# a) P(X = 5): fórmula manual vs. R
manual <- exp(-lambda) * lambda^5 / factorial(5)
c(manual = manual, dpois = dpois(5, lambda))
##    manual     dpois 
## 0.1008188 0.1008188
# b) P(X <= 2)
ppois(2, lambda)
## [1] 0.4231901
# c) Dos semanas: lambda = 6, P(X > 8)
ppois(8, lambda = 6, lower.tail = FALSE)
## [1] 0.1527625
# Esperanza y varianza
c(media = lambda, varianza = lambda)
##    media varianza 
##        3        3

Aproximación de la binomial por Poisson: si \(n\) es grande y \(p\) pequeño, \(\text{Bin}(n,p) \approx \text{Poisson}(np)\).

c(binomial = dbinom(2, size = 500, prob = 0.004),
  poisson  = dpois(2, lambda = 500 * 0.004))
##  binomial   poisson 
## 0.2712134 0.2706706

Distribución Binomial Negativa

Definición

La V.A. Binomial negativa es el numero de pruebas hasta encontrar r éxitos.
formulaciones equivalentes:

  • \(Y\) = número de fracasos antes del éxito \(r\) (la que usa R)
  • \(X = Y + r\) = número total de ensayos hasta el éxito \(r\)

Con \(r = 1\) se obtiene la distribución geométrica.

Función de cuantía

En número de fracasos (\(y = 0, 1, 2, \dots\)):

\[ P(Y = y) = \binom{y + r - 1}{y} p^r (1-p)^{y} \qquad E[Y] = \frac{r(1-p)}{p} \qquad Var(Y) = \frac{r(1-p)}{p^2} \]

En número de ensayos (\(x = r, r+1, \dots\)):

\[ P(X = x) = \binom{x-1}{r-1} p^r (1-p)^{x-r} \qquad E[X] = \frac{r}{p} \qquad Var(X) = \frac{r(1-p)}{p^2} \]

En R

dnbinom(y, size = r, prob = p) — ⚠️ y es el número de fracasos. Si el problema pregunta por el número de ensayos \(x\), se usa dnbinom(x - r, r, p).

Ejemplo

Un técnico necesita encontrar \(r = 3\) predios que acepten participar en un estudio. Cada predio contactado acepta con probabilidad \(p = 0{,}4\). a) ¿Probabilidad de que el tercer predio que acepta sea el 7.º contactado? b) ¿Probabilidad de necesitar a lo más 5 contactos? c) ¿Cuántos contactos se esperan en promedio?

r <- 3; p <- 0.4

# a) X = 7 ensayos  <=>  Y = 7 - 3 = 4 fracasos
manual <- choose(7 - 1, r - 1) * p^r * (1 - p)^(7 - r)
c(manual = manual, dnbinom = dnbinom(7 - r, size = r, prob = p))
##   manual  dnbinom 
## 0.124416 0.124416
# b) P(X <= 5) = P(Y <= 2)
pnbinom(5 - r, size = r, prob = p)
## [1] 0.31744
# c) Esperanza y varianza del número de ensayos
c(media_ensayos = r / p, varianza = r * (1 - p) / p^2)
## media_ensayos      varianza 
##          7.50         11.25


Resumen comparativo

Distribución Qué cuenta Parámetros \(E[X]\) \(Var(X)\) Función R
Bernoulli Éxito en 1 ensayo \(p\) \(p\) \(p(1-p)\) dbinom(x, 1, p)
Binomial Éxitos en \(n\) ensayos (con reposición) \(n, p\) \(np\) \(np(1-p)\) dbinom(x, n, p)
Hipergeométrica Éxitos en \(m\) extracciones sin reposición \(N, K, m\) \(m\frac{K}{N}\) \(m\frac{K}{N}(1-\frac{K}{N})\frac{N-m}{N-1}\) dhyper(x, K, N-K, m)
Poisson Eventos en un intervalo \(\lambda\) \(\lambda\) \(\lambda\) dpois(x, lambda)
Binomial negativa Ensayos hasta \(r\) éxitos \(r, p\) \(\frac{r}{p}\) \(\frac{r(1-p)}{p^2}\) dnbinom(x - r, r, p)

¿Cuál usar?

  • ¿Un solo ensayo? → Bernoulli
  • ¿Número fijo de ensayos independientes, contando éxitos? → Binomial
  • ¿Población finita, muestreo sin reposición? → Hipergeométrica
  • ¿Conteo de eventos en tiempo/espacio con tasa promedio? → Poisson
  • ¿Se repite hasta lograr \(r\) éxitos, contando intentos? → Binomial negativa

Verificación por simulación

Las medias empíricas de 100.000 simulaciones deben acercarse a los valores teóricos:

set.seed(123)
B <- 1e5
sim <- data.frame(
  distribucion = c("Bernoulli(0,65)", "Bin(10; 0,65)", "Hiper(50; 8; 6)",
                   "Poisson(3)", "BinNeg(3; 0,4) ensayos"),
  media_teorica = c(0.65, 10 * 0.65, 6 * 8 / 50, 3, 3 / 0.4),
  media_simulada = c(mean(rbinom(B, 1, 0.65)),
                     mean(rbinom(B, 10, 0.65)),
                     mean(rhyper(B, 8, 42, 6)),
                     mean(rpois(B, 3)),
                     mean(rnbinom(B, 3, 0.4) + 3))
)
knitr::kable(sim, digits = 4)
distribucion media_teorica media_simulada
Bernoulli(0,65) 0.65 0.6510
Bin(10; 0,65) 6.50 6.5012
Hiper(50; 8; 6) 0.96 0.9630
Poisson(3) 3.00 2.9987
BinNeg(3; 0,4) ensayos 7.50 7.4889