Propósito del material

En administración, contaduría y negocios rara vez se decide con certeza completa. Una empresa no conoce de antemano la demanda del próximo mes, si un cliente pagará a tiempo, si un lote tendrá defectos o si una campaña producirá compras. La probabilidad permite representar esa incertidumbre, combinar información y tomar decisiones coherentes con la evidencia disponible.

Este material no se limita a enseñar fórmulas. Busca que el estudiante pueda:

  1. describir correctamente un experimento aleatorio, sus resultados y sus eventos;
  2. contar posibilidades sin enumerarlas una por una;
  3. asignar e interpretar probabilidades;
  4. aplicar las reglas de complemento, adición y multiplicación;
  5. distinguir probabilidad conjunta, marginal y condicional;
  6. reconocer cuándo dos eventos son independientes;
  7. usar la probabilidad total y el teorema de Bayes para actualizar decisiones;
  8. verificar cálculos y explorar escenarios mediante R.

Idea central. Una probabilidad no es una predicción infalible sobre un caso individual. Es una medida de incertidumbre que describe qué tan compatible es un evento con la información y el modelo disponibles.

1. Lenguaje básico de la probabilidad

1.1 Experimentos determinísticos y aleatorios

Un experimento es un procedimiento que produce un resultado observable.

  • En un experimento determinístico, las mismas condiciones producen siempre el mismo resultado. Por ejemplo, calcular el IVA de una factura cuando la base y la tarifa ya están fijadas.
  • En un experimento aleatorio, se conocen los resultados posibles, pero antes de observar el proceso no puede saberse con certeza cuál ocurrirá. Por ejemplo, seleccionar una factura para auditoría y encontrarla correcta o con inconsistencia.

La palabra aleatorio no significa desordenado ni inexplicable. Significa que existe incertidumbre sobre el resultado particular.

1.2 Resultado y espacio muestral

Un resultado elemental o punto muestral es una realización individual del experimento. El espacio muestral, denotado por \(S\) o \(\Omega\), es el conjunto de todos los resultados posibles.

Ejemplo: estado de una cuenta por cobrar

Al revisar una cuenta al vencimiento, una clasificación simplificada puede ser:

\[ S=\{\text{pagada a tiempo},\ \text{pagada con retraso},\ \text{incumplida}\}. \]

Cada elemento es un resultado elemental. El espacio debe definirse de manera que los resultados sean:

  • mutuamente excluyentes: una observación no puede pertenecer simultáneamente a dos resultados elementales;
  • colectivamente exhaustivos: todo resultado posible debe quedar representado.

Si una cuenta puede estar parcialmente pagada y esa situación importa para la decisión, el espacio anterior es incompleto o su regla de clasificación debe precisarse.

1.3 Eventos

Un evento es cualquier subconjunto del espacio muestral. Puede contener uno o varios resultados.

En el ejemplo anterior, sea

\[ A=\{\text{pagada con retraso},\ \text{incumplida}\}. \]

\(A\) representa el evento “la cuenta presenta problema de pago”. Un evento simple contiene un único resultado; un evento compuesto contiene dos o más.

Dos eventos especiales son:

  • el evento seguro \(S\), que siempre ocurre;
  • el evento imposible \(\varnothing\), que no contiene resultados.

1.4 Operaciones entre eventos

Sean \(A\) y \(B\) dos eventos:

  • Unión: \(A\cup B\) ocurre si sucede \(A\), sucede \(B\) o suceden ambos.
  • Intersección: \(A\cap B\) ocurre si suceden simultáneamente \(A\) y \(B\).
  • Complemento: \(A^c\) ocurre cuando \(A\) no ocurre.
  • Diferencia: \(A\setminus B\) ocurre si sucede \(A\) pero no \(B\).

Ejemplo administrativo

En una base de clientes:

  • \(A\): el cliente compró durante el mes;
  • \(B\): el cliente usó un cupón.

Entonces \(A\cap B\) representa clientes que compraron y usaron cupón; \(A\cup B\), clientes que compraron, usaron cupón o hicieron ambas cosas; y \(A^c\), clientes que no compraron.

S <- paste0("C", 1:12)
A <- c("C1", "C2", "C4", "C7", "C9")       # compraron
B <- c("C2", "C3", "C4", "C8", "C10")     # usaron cupón

union(A, B)
## [1] "C1"  "C2"  "C4"  "C7"  "C9"  "C3"  "C8"  "C10"
intersect(A, B)
## [1] "C2" "C4"
setdiff(S, A)    # complemento de A respecto de S
## [1] "C3"  "C5"  "C6"  "C8"  "C10" "C11" "C12"
setdiff(A, B)    # A pero no B
## [1] "C1" "C7" "C9"

Error frecuente. En lenguaje cotidiano, “A o B” a veces se interpreta como una elección exclusiva. En probabilidad, \(A\cup B\) incluye por defecto el caso en que ambos ocurren. Si se quiere excluir la intersección, debe decirse “A o B, pero no ambos”.

2. Reglas de conteo

Contar correctamente es fundamental cuando las probabilidades se construyen a partir de resultados equiprobables. Enumerar manualmente puede funcionar con cinco casos, pero no con miles o millones.

2.1 Principio aditivo

Si una decisión puede realizarse mediante una de varias alternativas mutuamente excluyentes, con \(n_1,n_2,\ldots,n_k\) opciones respectivamente, el número total es

\[ n_1+n_2+\cdots+n_k. \]

Ejemplo: canal para radicar una solicitud

Una empresa permite radicar una solicitud por 3 tipos de formulario web o por 2 tipos de atención presencial. Si cada solicitud se radica por una sola vía, existen

\[3+2=5\]

formas de radicación.

El principio aditivo exige que las alternativas no se solapen. Si una opción puede contarse en dos grupos, aparecerá doble conteo.

2.2 Principio multiplicativo

Si un proceso tiene \(k\) etapas y la etapa \(i\) puede realizarse de \(n_i\) formas, el número de secuencias posibles es

\[ N=n_1n_2\cdots n_k. \]

Ejemplo: diseño de una campaña

Una campaña se define seleccionando:

  • uno de 3 segmentos de clientes;
  • uno de 4 canales;
  • una de 2 promociones.

Hay

\[3\times4\times2=24\]

configuraciones posibles.

campanias <- expand.grid(
  segmento = c("Nuevo", "Frecuente", "Inactivo"),
  canal = c("Correo", "Aplicación", "SMS", "Tienda"),
  promocion = c("Descuento", "Puntos")
)

nrow(campanias)
## [1] 24
head(campanias, 8)

2.3 Factorial

Para un entero no negativo \(n\),

\[ n!=n(n-1)(n-2)\cdots 2\cdot1, \]

con \(0!=1\). El número de maneras de ordenar \(n\) objetos distintos es \(n!\).

Si cinco informes diferentes deben presentarse en una reunión, existen

\[5!=120\]

órdenes posibles.

factorial(5)
## [1] 120

2.4 Permutaciones de parte de un conjunto

Si se seleccionan \(r\) elementos distintos entre \(n\) y el orden o el cargo importa, el número de arreglos es

\[ P(n,r)=\frac{n!}{(n-r)!}. \]

Ejemplo: asignación de cargos

De 8 analistas se eligen un coordinador, un revisor y un relator. No basta con saber quiénes fueron elegidos: los cargos son diferentes. Por ello,

\[ P(8,3)=\frac{8!}{5!}=8\times7\times6=336. \]

n <- 8
r <- 3
factorial(n) / factorial(n - r)
## [1] 336

2.5 Combinaciones

Si se seleccionan \(r\) elementos de \(n\) y el orden no importa, el número de grupos es

\[ {n\choose r}=\binom{n}{r}=\frac{n!}{r!(n-r)!}. \]

Ejemplo contable: selección para auditoría

De 12 facturas se seleccionan 4 para revisión. Como el conjunto de facturas es el mismo sin importar el orden de selección,

\[ \binom{12}{4}=495. \]

choose(12, 4)
## [1] 495
# Algunas muestras posibles, usando solo 6 facturas para no imprimir demasiado
combn(paste0("F", 1:6), 3)[, 1:5]
##      [,1] [,2] [,3] [,4] [,5]
## [1,] "F1" "F1" "F1" "F1" "F1"
## [2,] "F2" "F2" "F2" "F2" "F3"
## [3,] "F3" "F4" "F5" "F6" "F4"

2.6 ¿Permutación o combinación?

La pregunta decisiva es: si intercambio la posición de dos elementos, cambia el resultado relevante?

Situación ¿Importa el orden? Herramienta
Elegir 4 facturas para auditar No Combinación
Asignar gerente, tesorero y secretario Permutación
Definir segmento, canal y promoción Son etapas distintas Principio multiplicativo
Escoger entre atención virtual o presencial Alternativas excluyentes Principio aditivo

2.7 Selección con repetición

Si cada una de \(r\) posiciones admite cualquiera de \(n\) símbolos y se permite repetir, existen

\[n^r\]

secuencias. Por ejemplo, un código numérico de seis posiciones admite \(10^6=1\,000\,000\) secuencias desde 000000 hasta 999999.

Esto no implica que un código sea seguro: la seguridad también depende de intentos permitidos, filtraciones y comportamiento de los usuarios.

2.8 Conteo y probabilidad hipergeométrica

Una empresa recibe 20 facturas, de las cuales 5 tienen inconsistencia. Si el auditor selecciona 4 facturas sin reemplazo, ¿cuál es la probabilidad de encontrar exactamente 2 inconsistentes?

El número total de muestras es \(\binom{20}{4}\). Para el evento de interés se eligen 2 de las 5 inconsistentes y 2 de las 15 correctas:

\[ P(X=2)=\frac{\binom{5}{2}\binom{15}{2}}{\binom{20}{4}}. \]

p_exactamente_2 <- choose(5, 2) * choose(15, 2) / choose(20, 4)
p_exactamente_2
## [1] 0.2167183
porcentaje(p_exactamente_2, 2)
## [1] "21.67%"
# R también contiene la distribución hipergeométrica:
dhyper(x = 2, m = 5, n = 15, k = 4)
## [1] 0.2167183

Lectura para la decisión. El cálculo no prueba que dos facturas vayan a resultar inconsistentes. Cuantifica qué tan frecuente sería ese resultado si se repitiera muchas veces el procedimiento de seleccionar cuatro facturas bajo las mismas condiciones.

3. Asignación e interpretación de probabilidades

3.1 Axiomas de probabilidad

Una función de probabilidad \(P\) asigna un número a cada evento y satisface:

  1. No negatividad: \(P(A)\ge 0\) para cualquier evento \(A\).
  2. Normalización: \(P(S)=1\).
  3. Aditividad: si \(A_1,A_2,\ldots\) son mutuamente excluyentes, entonces

\[ P\left(\bigcup_i A_i\right)=\sum_i P(A_i). \]

De estos axiomas se deduce que \(P(\varnothing)=0\) y \(0\le P(A)\le1\).

3.2 Enfoque clásico

Si el espacio muestral contiene \(N\) resultados equiprobables y \(n(A)\) favorecen al evento \(A\), entonces

\[ P(A)=\frac{n(A)}{N}. \]

La palabra equiprobables es indispensable. No es correcto dividir “casos favorables entre casos posibles” si los resultados no tienen la misma posibilidad.

Ejemplo

Se selecciona al azar una de 10 propuestas, todas con igual posibilidad. Si 4 corresponden a proveedores locales,

\[P(\text{proveedor local})=\frac{4}{10}=0.40.\]

3.3 Enfoque de frecuencia relativa

Cuando existe información histórica, una probabilidad puede estimarse mediante

\[ \widehat{P}(A)=\frac{\text{número de veces que ocurrió }A}{\text{número total de observaciones}}. \]

El símbolo \(\widehat{P}\) recuerda que se trata de una estimación. Con más datos pertinentes y estables, la frecuencia relativa suele estabilizarse alrededor de la probabilidad del proceso.

Ejemplo: pagos de clientes

En 1 000 cuentas vencidas se observaron 720 pagos puntuales, 210 pagos tardíos y 70 incumplimientos.

estados <- c(Puntual = 720, Tardio = 210, Incumplimiento = 70)
probabilidades <- prop.table(estados)
probabilidades
##        Puntual         Tardio Incumplimiento 
##           0.72           0.21           0.07
sum(probabilidades)
## [1] 1
barplot(
  probabilidades,
  col = c("#159d8c", "#ef8a17", "#6b4ea0"),
  ylim = c(0, 0.8),
  ylab = "Frecuencia relativa",
  main = "Comportamiento histórico de pago"
)

3.4 Enfoque subjetivo

Una probabilidad subjetiva resume un grado de creencia fundamentado en información disponible, experiencia y juicio experto. Se usa cuando no hay suficientes repeticiones comparables: entrada a un mercado nuevo, éxito de una negociación única o impacto de una regulación inédita.

“Subjetiva” no significa arbitraria. La estimación debe declarar fuentes, supuestos y razones, y actualizarse al aparecer nueva evidencia.

3.5 Interpretación correcta

Si \(P(A)=0.20\), no significa que \(A\) ocurrirá exactamente una vez en cada cinco casos ni que deba ocurrir después de cuatro fracasos. Significa que, bajo el modelo y la información considerados, el evento tiene una posibilidad de 20%; en muchas repeticiones comparables se esperaría una frecuencia cercana a 20%.

Falacia del jugador. Después de varios resultados iguales, una persona puede creer que el resultado contrario “ya toca”. Si los ensayos son independientes y la probabilidad no cambia, el proceso no tiene memoria.

4. Relaciones básicas de probabilidad

4.1 Regla del complemento

Como \(A\) y \(A^c\) son mutuamente excluyentes y juntos forman \(S\),

\[ P(A^c)=1-P(A). \]

Esta regla es especialmente útil para eventos como “al menos uno”.

Ejemplo: al menos una devolución

Suponga que cada venta tiene probabilidad 0.04 de devolución y que las devoluciones de 10 ventas pueden modelarse como independientes. Es más sencillo calcular el complemento:

\[ P(\text{al menos una devolución}) =1-P(\text{ninguna devolución}) =1-(0.96)^{10}. \]

p_al_menos_una <- 1 - (1 - 0.04)^10
p_al_menos_una
## [1] 0.3351674
porcentaje(p_al_menos_una, 2)
## [1] "33.52%"

4.2 Regla general de adición

Para dos eventos cualesquiera,

\[ P(A\cup B)=P(A)+P(B)-P(A\cap B). \]

La intersección se resta porque fue contada una vez dentro de \(P(A)\) y otra dentro de \(P(B)\).

Ejemplo: compra y uso de cupón

En una campaña:

\[P(A)=0.38,\qquad P(B)=0.27,\qquad P(A\cap B)=0.16,\]

donde \(A\) es “compró” y \(B\) es “usó cupón”. Entonces

\[ P(A\cup B)=0.38+0.27-0.16=0.49. \]

p_compra <- 0.38
p_cupon <- 0.27
p_ambos <- 0.16
p_union <- p_compra + p_cupon - p_ambos
p_union
## [1] 0.49

Si \(A\) y \(B\) son mutuamente excluyentes, \(P(A\cap B)=0\) y la regla se reduce a

\[P(A\cup B)=P(A)+P(B).\]

4.3 Inclusión-exclusión para tres eventos

Para tres eventos,

\[ \begin{aligned} P(A\cup B\cup C)=\;&P(A)+P(B)+P(C)\\ &-P(A\cap B)-P(A\cap C)-P(B\cap C)\\ &+P(A\cap B\cap C). \end{aligned} \]

Primero se suman los eventos; luego se corrige el doble conteo de las intersecciones por pares; finalmente se devuelve la intersección triple, que se había restado demasiado.

4.4 Descomposición de un evento

Si \(B_1,\ldots,B_k\) forman una partición de \(S\) —son mutuamente excluyentes, exhaustivos y cada uno tiene probabilidad positiva—, entonces cualquier evento \(A\) puede escribirse como

\[ A=(A\cap B_1)\cup\cdots\cup(A\cap B_k). \]

Esta idea será la base de la ley de probabilidad total y del teorema de Bayes.

5. Probabilidad condicional

5.1 Definición

La probabilidad condicional de \(A\) dado que ocurrió \(B\) es

\[ P(A\mid B)=\frac{P(A\cap B)}{P(B)},\qquad P(B)>0. \]

La barra vertical se lee “dado que”. Al conocer \(B\), el universo relevante deja de ser todo \(S\): ahora se restringe a \(B\). Entre los casos compatibles con \(B\), se calcula qué proporción también pertenece a \(A\).

5.2 Una tabla de contingencia

Una empresa estudia 1 000 clientes:

Canal principal Compró No compró Total
Digital 180 120 300
Tienda física 140 560 700
Total 320 680 1 000

Sea \(A=\) “compró” y \(B=\) “su canal principal es digital”.

\[ P(A\mid B)=\frac{180}{300}=0.60. \]

Entre quienes usan principalmente el canal digital, 60% compró.

En cambio,

\[ P(B\mid A)=\frac{180}{320}=0.5625. \]

Entre quienes compraron, 56.25% usa principalmente el canal digital. Las dos preguntas condicionan sobre grupos diferentes.

clientes <- matrix(
  c(180, 120,
    140, 560),
  nrow = 2,
  byrow = TRUE,
  dimnames = list(
    Canal = c("Digital", "Tienda_fisica"),
    Compra = c("Si", "No")
  )
)

addmargins(clientes)
##                Compra
## Canal            Si  No  Sum
##   Digital       180 120  300
##   Tienda_fisica 140 560  700
##   Sum           320 680 1000
prop.table(clientes)              # probabilidades conjuntas
##                Compra
## Canal             Si   No
##   Digital       0.18 0.12
##   Tienda_fisica 0.14 0.56
prop.table(clientes, margin = 1)  # distribución de compra dentro de cada canal
##                Compra
## Canal            Si  No
##   Digital       0.6 0.4
##   Tienda_fisica 0.2 0.8
prop.table(clientes, margin = 2)  # distribución del canal dentro de cada compra
##                Compra
## Canal               Si        No
##   Digital       0.5625 0.1764706
##   Tienda_fisica 0.4375 0.8235294
mosaicplot(
  clientes,
  color = c("#6b4ea0", "#d9d9d9"),
  main = "Relación entre canal y compra",
  xlab = "Canal principal",
  ylab = "Resultado"
)
Compra según el canal principal del cliente.

Compra según el canal principal del cliente.

Error crítico. \(P(A\mid B)\) y \(P(B\mid A)\) no son intercambiables. Confundirlas produce interpretaciones erróneas en crédito, auditoría, pruebas de fraude, mercadeo y control de calidad.

5.3 Regla de multiplicación

Al reorganizar la definición de probabilidad condicional se obtiene

\[ P(A\cap B)=P(B)P(A\mid B)=P(A)P(B\mid A). \]

Para una secuencia de tres eventos,

\[ P(A\cap B\cap C)=P(A)P(B\mid A)P(C\mid A\cap B). \]

Ejemplo: aprobación de un crédito

Suponga que 40% de las solicitudes supera la revisión documental y, entre esas solicitudes, 70% supera el análisis financiero. La probabilidad de superar ambas etapas es

\[ 0.40\times0.70=0.28. \]

No se suman las probabilidades, porque se exige que ocurran ambas etapas.

5.4 Independencia

Dos eventos \(A\) y \(B\) son independientes si conocer uno no cambia la probabilidad del otro:

\[ P(A\mid B)=P(A). \]

De manera equivalente,

\[ P(A\cap B)=P(A)P(B). \]

En la tabla de clientes:

\[ P(A)=0.32,\qquad P(A\mid B)=0.60. \]

Como no son iguales, compra y canal digital no son independientes en estos datos.

p_A <- 320 / 1000
p_B <- 300 / 1000
p_A_inter_B <- 180 / 1000

c(
  producto_si_independientes = p_A * p_B,
  probabilidad_observada_conjunta = p_A_inter_B
)
##      producto_si_independientes probabilidad_observada_conjunta 
##                           0.096                           0.180

Independencia no es exclusión mutua

  • Si dos eventos son mutuamente excluyentes, no pueden ocurrir juntos: \(P(A\cap B)=0\).
  • Si dos eventos con probabilidad positiva son independientes, pueden ocurrir juntos y \(P(A\cap B)=P(A)P(B)>0\).

Por tanto, dos eventos mutuamente excluyentes con probabilidad positiva son dependientes: saber que ocurrió uno hace imposible el otro.

5.5 Árboles de probabilidad

Un árbol representa decisiones o resultados sucesivos. Cada ruta completa corresponde a una intersección; su probabilidad se obtiene multiplicando las ramas. Las rutas incompatibles que conducen al mismo evento se suman.

Ejemplo: pago según tipo de cliente

Una cartera contiene 70% de clientes empresariales y 30% de clientes personales. La probabilidad de pago puntual es 0.90 para los empresariales y 0.75 para los personales.

Las probabilidades de las cuatro rutas son:

rutas <- data.frame(
  tipo = c("Empresarial", "Empresarial", "Personal", "Personal"),
  estado = c("Puntual", "No puntual", "Puntual", "No puntual"),
  p_tipo = c(0.70, 0.70, 0.30, 0.30),
  p_estado_dado_tipo = c(0.90, 0.10, 0.75, 0.25)
)
rutas$p_conjunta <- rutas$p_tipo * rutas$p_estado_dado_tipo
rutas
sum(rutas$p_conjunta)
## [1] 1

6. Ley de probabilidad total

Si \(B_1,\ldots,B_k\) forman una partición de \(S\), entonces

\[ P(A)=\sum_{i=1}^{k}P(A\mid B_i)P(B_i). \]

La ley combina las probabilidades del evento \(A\) a través de todas las rutas posibles.

En el ejemplo de cartera:

\[ P(\text{puntual})=(0.90)(0.70)+(0.75)(0.30)=0.855. \]

p_puntual <- 0.90 * 0.70 + 0.75 * 0.30
p_puntual
## [1] 0.855
porcentaje(p_puntual)
## [1] "85.5%"

La respuesta no es el promedio simple \((0.90+0.75)/2\), porque los grupos no tienen el mismo peso.

7. Teorema de Bayes

7.1 De la probabilidad condicional a Bayes

Por la regla de multiplicación,

\[ P(A\cap B)=P(A)P(B\mid A)=P(B)P(A\mid B). \]

Al despejar,

\[ P(A\mid B)=\frac{P(B\mid A)P(A)}{P(B)}. \]

Si \(A_1,\ldots,A_k\) forman una partición, la forma general es

\[ P(A_j\mid B)= \frac{P(B\mid A_j)P(A_j)} {\sum_{i=1}^{k}P(B\mid A_i)P(A_i)}. \]

Bayes transforma una probabilidad previa \(P(A_j)\) en una probabilidad posterior \(P(A_j\mid B)\) después de observar evidencia \(B\).

Componente Significado
\(P(A_j)\) Probabilidad previa de la causa o categoría
\(P(B\mid A_j)\) Verosimilitud de observar la evidencia si la causa es \(A_j\)
\(P(B)\) Probabilidad total de la evidencia
\(P(A_j\mid B)\) Probabilidad posterior después de observar la evidencia

7.2 Caso de proveedores y productos defectuosos

Una empresa compra un componente a tres proveedores:

Proveedor Participación en las compras Tasa de defecto
A 0.50 0.01
B 0.30 0.03
C 0.20 0.08

Se selecciona un componente y resulta defectuoso. ¿Cuál es la probabilidad de que provenga del proveedor C?

Paso 1. Definir eventos

  • \(A\), \(B\) y \(C\): proveedor de origen;
  • \(D\): componente defectuoso.

Paso 2. Calcular la probabilidad total del defecto

\[ \begin{aligned} P(D)&=P(D\mid A)P(A)+P(D\mid B)P(B)+P(D\mid C)P(C)\\ &=(0.01)(0.50)+(0.03)(0.30)+(0.08)(0.20)\\ &=0.030. \end{aligned} \]

Paso 3. Actualizar con Bayes

\[ P(C\mid D)=\frac{(0.08)(0.20)}{0.030}=0.5333. \]

Aunque C suministra solo 20% de los componentes, explica aproximadamente 53.33% de los defectuosos debido a su mayor tasa de defecto.

proveedores <- data.frame(
  proveedor = c("A", "B", "C"),
  previa = c(0.50, 0.30, 0.20),
  p_defecto_dado_proveedor = c(0.01, 0.03, 0.08)
)

proveedores$p_conjunta_defecto <- with(
  proveedores,
  previa * p_defecto_dado_proveedor
)
p_defecto <- sum(proveedores$p_conjunta_defecto)
proveedores$posterior_dado_defecto <-
  proveedores$p_conjunta_defecto / p_defecto

proveedores
p_defecto
## [1] 0.03
sum(proveedores$posterior_dado_defecto)
## [1] 1
matplot(
  t(as.matrix(proveedores[, c("previa", "posterior_dado_defecto")])),
  type = "b", pch = 19, lty = 1,
  col = c("#6b4ea0", "#159d8c", "#ef8a17"),
  xaxt = "n", xlab = "Información disponible", ylab = "Probabilidad",
  main = "Probabilidad previa y posterior"
)
axis(1, at = 1:2, labels = c("Antes del defecto", "Después del defecto"))
legend("topleft", legend = proveedores$proveedor,
       col = c("#6b4ea0", "#159d8c", "#ef8a17"), pch = 19, lty = 1)
La evidencia de un defecto cambia la distribución probable del proveedor de origen.

La evidencia de un defecto cambia la distribución probable del proveedor de origen.

Implicación gerencial. El cálculo orienta dónde investigar primero, pero no demuestra que C haya producido un componente particular. Una probabilidad posterior de 0.5333 todavía deja 0.4667 de probabilidad para los otros proveedores.

7.3 Caso de alerta de fraude y efecto de la tasa base

Suponga que:

  • 2% de las transacciones son fraudulentas: \(P(F)=0.02\);
  • el sistema genera alerta en 92% de los fraudes: \(P(+\mid F)=0.92\);
  • genera alerta en 6% de las operaciones legítimas: \(P(+\mid F^c)=0.06\).

¿Cuál es la probabilidad de fraude cuando aparece una alerta?

\[ P(F\mid +)= \frac{(0.92)(0.02)}{(0.92)(0.02)+(0.06)(0.98)} =0.2383. \]

p_fraude <- 0.02
sensibilidad <- 0.92
tasa_falso_positivo <- 0.06

p_alerta <- sensibilidad * p_fraude +
  tasa_falso_positivo * (1 - p_fraude)

p_fraude_dado_alerta <- sensibilidad * p_fraude / p_alerta

c(
  p_alerta = p_alerta,
  p_fraude_dado_alerta = p_fraude_dado_alerta
)
##             p_alerta p_fraude_dado_alerta 
##             0.077200             0.238342

La alerta es informativa: eleva la probabilidad de fraude de 2% a aproximadamente 23.83%. Sin embargo, no significa que 92% de las alertas sean fraude. El 92% corresponde a \(P(+\mid F)\), no a \(P(F\mid +)\).

Verificación con frecuencias naturales

Imagine 10 000 transacciones:

  • 200 serían fraudulentas; aproximadamente 184 generarían alerta;
  • 9 800 serían legítimas; aproximadamente 588 generarían alerta falsa;
  • habría 772 alertas, de las cuales 184 corresponderían a fraude.

Así,

\[\frac{184}{772}\approx0.2383.\]

Las frecuencias naturales suelen hacer Bayes más comprensible que una fórmula aislada.

7.4 Cómo cambia el valor de una alerta

Mantengamos la sensibilidad y la tasa de falsos positivos, pero variemos la prevalencia del fraude.

prevalencia <- seq(0.001, 0.20, by = 0.001)
posterior <- sensibilidad * prevalencia /
  (sensibilidad * prevalencia +
     tasa_falso_positivo * (1 - prevalencia))

plot(
  prevalencia, posterior,
  type = "l", lwd = 3, col = "#6b4ea0",
  xlab = "Proporción previa de fraude",
  ylab = "P(Fraude | Alerta)",
  main = "Efecto de la tasa base sobre el valor de una alerta"
)
abline(a = 0, b = 1, lty = 2, col = "gray50")

Una misma alerta tiene distinto significado en poblaciones con riesgos previos diferentes. Ignorar la tasa base puede llevar a bloquear demasiadas transacciones legítimas o a subestimar un riesgo real.

8. Un caso integrado de decisión

Una empresa de servicios clasifica sus clientes en tres segmentos:

Segmento Participación Probabilidad de mora Probabilidad de alerta si hay mora Probabilidad de alerta si no hay mora
Consolidado 0.65 0.025 0.85 0.08
Crecimiento 0.25 0.060 0.85 0.08
Nuevo 0.10 0.140 0.85 0.08

Se quiere responder:

  1. ¿Cuál es la probabilidad global de mora?
  2. Si un cliente está en mora, ¿de qué segmento es más probable que provenga?
  3. Si el sistema genera una alerta, ¿cuál es la probabilidad de mora?
  4. ¿Qué información sería necesaria antes de convertir la alerta en rechazo automático?
segmentos <- data.frame(
  segmento = c("Consolidado", "Crecimiento", "Nuevo"),
  p_segmento = c(0.65, 0.25, 0.10),
  p_mora_dado_segmento = c(0.025, 0.060, 0.140)
)

# 1. Probabilidad total de mora
segmentos$p_segmento_y_mora <- with(
  segmentos,
  p_segmento * p_mora_dado_segmento
)
p_mora_total <- sum(segmentos$p_segmento_y_mora)

# 2. Segmento dado que existe mora
segmentos$p_segmento_dado_mora <-
  segmentos$p_segmento_y_mora / p_mora_total

# 3. Mora dado que existe alerta
p_alerta_dado_mora <- 0.85
p_alerta_dado_no_mora <- 0.08
p_alerta_total <- p_alerta_dado_mora * p_mora_total +
  p_alerta_dado_no_mora * (1 - p_mora_total)
p_mora_dado_alerta <-
  p_alerta_dado_mora * p_mora_total / p_alerta_total

segmentos
c(
  p_mora_total = p_mora_total,
  p_alerta_total = p_alerta_total,
  p_mora_dado_alerta = p_mora_dado_alerta
)
##       p_mora_total     p_alerta_total p_mora_dado_alerta 
##          0.0452500          0.1148425          0.3349152

La cuarta pregunta no se responde solo con probabilidad. También requiere comparar los costos de falsos positivos y falsos negativos, obligaciones normativas, equidad del procedimiento, posibilidad de revisión humana y calidad de los datos.

Probabilidad no es decisión automática. Una probabilidad posterior alimenta una decisión; no determina por sí sola qué debe hacerse. La acción óptima depende de costos, beneficios, restricciones y consecuencias.

9. Simulación Monte Carlo en R

La simulación permite representar un experimento muchas veces para aproximar probabilidades, comprobar resultados teóricos y estudiar situaciones difíciles de resolver de forma analítica.

9.1 Comprobación de una probabilidad condicional

Simulemos un millón de transacciones con el modelo de fraude anterior.

set.seed(2026)
n_sim <- 1000000

fraude <- rbinom(n_sim, size = 1, prob = p_fraude) == 1
p_alerta_individual <- ifelse(fraude, sensibilidad, tasa_falso_positivo)
alerta <- rbinom(n_sim, size = 1, prob = p_alerta_individual) == 1

estimaciones <- c(
  P_fraude = mean(fraude),
  P_alerta = mean(alerta),
  P_fraude_dado_alerta = mean(fraude[alerta])
)

estimaciones
##             P_fraude             P_alerta P_fraude_dado_alerta 
##            0.0199120            0.0772260            0.2371352
p_fraude_dado_alerta
## [1] 0.238342

La aproximación no coincide exactamente con el valor teórico porque la simulación tiene variación aleatoria. Al aumentar el número de repeticiones, la diferencia suele reducirse.

9.2 Evolución de una frecuencia relativa

set.seed(410)
lanzamientos <- rbinom(5000, size = 1, prob = 0.35)
frecuencia_acumulada <- cumsum(lanzamientos) / seq_along(lanzamientos)

plot(
  frecuencia_acumulada,
  type = "l", col = "#159d8c", lwd = 2,
  xlab = "Número de repeticiones",
  ylab = "Frecuencia relativa acumulada",
  main = "Estabilización de la frecuencia relativa"
)
abline(h = 0.35, col = "#ef8a17", lwd = 2, lty = 2)

El gráfico no dice que toda secuencia corta deba acercarse a 0.35. Muestra que, al acumular muchas observaciones independientes del mismo proceso, la frecuencia relativa tiende a estabilizarse.

10. Estrategia general para resolver problemas

Antes de buscar una fórmula, siga este orden:

  1. Defina el experimento. ¿Qué proceso genera el resultado?
  2. Defina eventos con palabras y símbolos. Evite operar con letras sin significado.
  3. Identifique la información. ¿Son conteos, probabilidades marginales, conjuntas o condicionales?
  4. Pregunte qué cambia el universo. Expresiones como “dado que”, “entre quienes” o “sabiendo que” indican condición.
  5. Elija una representación. Lista, tabla de contingencia, diagrama de árbol o partición.
  6. Seleccione la regla. Complemento, adición, multiplicación, probabilidad total o Bayes.
  7. Calcule y verifique. El resultado debe estar entre 0 y 1; las categorías exhaustivas deben sumar 1.
  8. Interprete en contexto. Indique población, condición, evento y consecuencia para la decisión.

Guía rápida de lenguaje

Expresión del problema Traducción probable
“No ocurre A” \(A^c\)
“A o B” \(A\cup B\)
“A y B” \(A\cap B\)
“Al menos uno” \(1-P(\text{ninguno})\)
“Dado que B” / “entre quienes cumplen B” \(P(A\mid B)\)
“Primero A y después B” Regla de multiplicación
“Puede venir de varias fuentes” Probabilidad total
“Conocida la evidencia, ¿cuál era la causa?” Bayes

11. Errores frecuentes que deben evitarse

  1. Suponer equiprobabilidad sin justificarla. Que existan tres resultados no implica que cada uno tenga probabilidad \(1/3\).
  2. Sumar cuando se requiere intersección. Si deben ocurrir dos etapas, normalmente se usa multiplicación condicional.
  3. Olvidar restar la intersección. En la unión general, sumar \(P(A)+P(B)\) cuenta dos veces los casos comunes.
  4. Confundir \(P(A\mid B)\) con \(P(B\mid A)\). La condición define el denominador y cambia la pregunta.
  5. Confundir independencia con exclusión mutua. Son conceptos diferentes y, para eventos no triviales, incompatibles.
  6. Promediar tasas sin ponderar. La probabilidad total debe considerar el tamaño o peso de cada grupo.
  7. Interpretar una probabilidad como certeza individual. Un riesgo de 80% todavía admite que el evento no ocurra.
  8. Tomar una asociación como causalidad. Una dependencia probabilística no demuestra que un evento cause el otro.
  9. Redondear demasiado pronto. Conserve suficientes decimales durante el cálculo y redondee al final.
  10. Dar un número sin contexto. “0.24” no es una conclusión; “entre las transacciones con alerta, el modelo estima 23.8% de fraude” sí lo es.

12. Ejercicios guiados

Ejercicio guiado 1: conteo

Una empresa debe elegir 3 de 10 proyectos para revisión, sin asignarles prioridad.

Anticipación. ¿El orden de los proyectos cambia el comité de revisión?

Como no cambia, se usa combinación:

\[\binom{10}{3}=120.\]

choose(10, 3)
## [1] 120

Si los tres proyectos recibieran prioridades alta, media y baja, el orden sí importaría y habría \(P(10,3)=720\) asignaciones.

Ejercicio guiado 2: unión

En una encuesta, 55% usa la aplicación móvil, 40% usa el portal web y 25% usa ambos. La probabilidad de usar al menos uno es

\[0.55+0.40-0.25=0.70.\]

La intersección se resta para no contar dos veces a quienes usan ambos canales.

Ejercicio guiado 3: condicional

De 500 facturas, 80 son internacionales; 20 de estas presentan inconsistencia. En total hay 50 facturas inconsistentes.

\[P(\text{inconsistencia}\mid\text{internacional})=\frac{20}{80}=0.25,\]

mientras que

\[P(\text{internacional}\mid\text{inconsistencia})=\frac{20}{50}=0.40.\]

Ejercicio guiado 4: probabilidad total

Una empresa vende 60% en línea y 40% en tienda. Las tasas de devolución son 8% y 3%, respectivamente.

\[P(D)=(0.08)(0.60)+(0.03)(0.40)=0.06.\]

La tasa global de devolución es 6%.

Ejercicio guiado 5: Bayes

Con los datos del ejercicio anterior, si una venta fue devuelta,

\[ P(\text{línea}\mid D)=\frac{(0.08)(0.60)}{0.06}=0.80. \]

Aunque las ventas en línea representan 60% del total, representan 80% de las devoluciones.

13. Problemas propuestos

Nivel 1: fundamentos

  1. Una empresa ofrece 4 planes, 3 medios de pago y 2 modalidades de soporte. ¿Cuántas configuraciones puede ofrecer si se elige una opción de cada categoría?
  2. De 15 comprobantes se eligen 5 para auditoría. ¿Cuántas muestras diferentes existen?
  3. De 9 empleados se asignan los cargos de presidente, secretario y tesorero. ¿Cuántas asignaciones son posibles?
  4. Si \(P(A)=0.37\), calcule \(P(A^c)\).
  5. Si \(P(A)=0.48\), \(P(B)=0.35\) y \(P(A\cap B)=0.18\), calcule \(P(A\cup B)\).

Nivel 2: interpretación y reglas

  1. En una base de 800 clientes, 260 compraron y 200 recibieron una campaña; 110 compraron y recibieron la campaña. Calcule \(P(\text{compra}\mid\text{campaña})\) y \(P(\text{campaña}\mid\text{compra})\). Interprete la diferencia.
  2. La probabilidad de que un cliente renueve es 0.70. Si se modelan cinco decisiones de renovación como independientes, calcule la probabilidad de que al menos un cliente no renueve.
  3. Dos eventos tienen \(P(A)=0.40\), \(P(B)=0.30\) y \(P(A\cap B)=0.12\). Determine si son independientes y justifique.
  4. Dos resultados de pago —puntual y tardío— son mutuamente excluyentes. ¿Pueden ser independientes si ambos tienen probabilidad positiva? Explique sin limitarse a responder sí o no.
  5. Una organización tiene tres sedes con 50%, 30% y 20% de las operaciones. Sus tasas de error son 1%, 2% y 5%. Calcule la tasa global de error.

Nivel 3: Bayes y decisión

  1. Con los datos del problema 10, si se observa un error, calcule la probabilidad de que provenga de cada sede.
  2. Un modelo identifica 88% de los clientes que caerán en mora y marca por error 10% de quienes no caerán en mora. Si la tasa de mora es 5%, calcule \(P(\text{mora}\mid\text{alerta})\).
  3. Repita el problema 12 si la tasa de mora aumenta a 20%. Explique por qué cambia el valor de la alerta aunque el desempeño técnico del modelo sea el mismo.
  4. Diseñe una tabla de contingencia con 1 000 observaciones que sea compatible, aproximadamente, con el problema 12. Verifique el resultado mediante frecuencias naturales.
  5. Una empresa afirma: “Como 90% de los clientes morosos recibió una alerta, 90% de las alertas corresponde a clientes morosos”. Identifique el error y escriba la expresión probabilística correcta para cada porcentaje.

Actividad aplicada en R

Construya una base simulada de 5 000 clientes que incluya:

  • segmento: consolidado, crecimiento o nuevo;
  • canal: digital o físico;
  • mora: sí o no;
  • alerta: sí o no.

Utilice las probabilidades del caso integrado y asigne una probabilidad de canal digital de 0.40, 0.65 y 0.80 según el segmento. Luego:

  1. construya tablas marginales y conjuntas;
  2. estime \(P(\text{mora})\), \(P(\text{alerta})\) y \(P(\text{mora}\mid\text{alerta})\);
  3. compare la mora por segmento;
  4. evalúe si canal y mora parecen independientes;
  5. escriba una conclusión ejecutiva de máximo 150 palabras que separe resultados, interpretación y recomendación.
set.seed(2026)
n <- 5000

segmento <- sample(
  c("Consolidado", "Crecimiento", "Nuevo"),
  size = n,
  replace = TRUE,
  prob = c(0.65, 0.25, 0.10)
)

p_mora <- c(
  Consolidado = 0.025,
  Crecimiento = 0.060,
  Nuevo = 0.140
)

p_digital <- c(
  Consolidado = 0.40,
  Crecimiento = 0.65,
  Nuevo = 0.80
)

mora <- rbinom(n, 1, p_mora[segmento]) == 1
canal <- ifelse(
  rbinom(n, 1, p_digital[segmento]) == 1,
  "Digital", "Fisico"
)

p_alerta <- ifelse(mora, 0.85, 0.08)
alerta <- rbinom(n, 1, p_alerta) == 1

datos <- data.frame(segmento, canal, mora, alerta)

# Complete el análisis a partir de aquí.

14. Respuestas breves a los problemas propuestos

  1. \(4\times3\times2=24\).
  2. \(\binom{15}{5}=3003\).
  3. \(P(9,3)=9\times8\times7=504\).
  4. \(0.63\).
  5. \(0.48+0.35-0.18=0.65\).
  6. \(P(\text{compra}\mid\text{campaña})=110/200=0.55\); \(P(\text{campaña}\mid\text{compra})=110/260\approx0.4231\).
  7. \(1-(0.70)^5\approx0.8319\).
  8. Sí: \(P(A)P(B)=(0.40)(0.30)=0.12=P(A\cap B)\).
  9. No. Si fueran independientes, \(P(A\cap B)=P(A)P(B)>0\), pero la exclusión mutua exige \(P(A\cap B)=0\).
  10. \((0.50)(0.01)+(0.30)(0.02)+(0.20)(0.05)=0.021\).
  11. Las probabilidades posteriores son \(0.005/0.021\approx0.2381\), \(0.006/0.021\approx0.2857\) y \(0.010/0.021\approx0.4762\).
  12. \(P(M\mid +)=\frac{(0.88)(0.05)}{(0.88)(0.05)+(0.10)(0.95)}\approx0.3165\).
  13. \(P(M\mid +)=\frac{(0.88)(0.20)}{(0.88)(0.20)+(0.10)(0.80)}\approx0.6875\). La tasa base mayor hace que una alerta tenga más probabilidad de corresponder a mora real.
  14. Una aproximación: 50 morosos, de los cuales 44 tienen alerta; 950 no morosos, de los cuales 95 tienen alerta. Así, \(44/(44+95)\approx0.3165\).
  15. El 90% informado es \(P(\text{alerta}\mid\text{mora})\). La afirmación concluye indebidamente que \(P(\text{mora}\mid\text{alerta})=0.90\).

15. Síntesis de fórmulas

Concepto Expresión Pregunta que responde
Complemento \(P(A^c)=1-P(A)\) ¿Cuál es la probabilidad de que no ocurra \(A\)?
Adición \(P(A\cup B)=P(A)+P(B)-P(A\cap B)\) ¿Cuál es la probabilidad de que ocurra al menos uno?
Condicional \(P(A\mid B)=P(A\cap B)/P(B)\) Dentro de \(B\), ¿qué proporción también cumple \(A\)?
Multiplicación \(P(A\cap B)=P(B)P(A\mid B)\) ¿Cuál es la probabilidad de que ocurran ambos?
Independencia \(P(A\cap B)=P(A)P(B)\) ¿Conocer un evento deja igual la probabilidad del otro?
Probabilidad total \(P(A)=\sum_iP(A\mid B_i)P(B_i)\) ¿Cuál es la probabilidad global a través de varios grupos?
Bayes \(P(B_j\mid A)=\frac{P(A\mid B_j)P(B_j)}{\sum_iP(A\mid B_i)P(B_i)}\) Conocido el resultado, ¿cómo se actualiza la probabilidad de su origen?

16. Cierre

El valor de la probabilidad en las ciencias administrativas y contables no está en producir decimales, sino en estructurar la incertidumbre. Un análisis sólido identifica eventos, reconoce condiciones, combina rutas correctamente, actualiza creencias con evidencia y comunica qué puede —y qué no puede— concluirse.

Antes de decidir, conviene formular cuatro preguntas:

  1. ¿Cuál era el riesgo antes de observar la nueva información?
  2. ¿Qué tan compatible es la evidencia con cada explicación posible?
  3. ¿Cómo cambia el riesgo después de observarla?
  4. ¿Qué costos y consecuencias tendría actuar o no actuar?

Referencias de apoyo

  • Anderson, D. R., Sweeney, D. J. y Williams, T. A. Estadística para administración y economía. Capítulo 4: Introducción a la probabilidad.
  • Lind, D. A., Marchal, W. G. y Wathen, S. A. Estadística aplicada a los negocios y la economía. Capítulo sobre conceptos de probabilidad.
  • Wackerly, D. D., Mendenhall, W. y Scheaffer, R. L. Estadística matemática con aplicaciones. Capítulo 2: Probabilidad.
  • R Core Team. R: A Language and Environment for Statistical Computing. R Foundation for Statistical Computing.