Asignatura: Estadística Aplicada con Python y R — Semana 5, Sesión 2
Modalidad: Desarrollo manuscrito en clase (lápiz y cuaderno), en parejas o individual
Duración sugerida: 30–35 minutos
Prerrequisito: Concepto de probabilidad condicional \(P(A\vert B)\) ya presentado en pizarra
Un ingeniero agrícola evalúa 170 lotes de una zona baja e inundable después de una temporada de lluvias fuertes. Cada lote tenía instalado uno de tres sistemas de manejo del agua: drenaje superficial (canales abiertos), drenaje subsuperficial (tubería enterrada) o sin ningún sistema de drenaje. Al final de la temporada, el ingeniero clasificó cada lote según el estado del cultivo: Sano o Dañado por encharcamiento.
A diferencia del ejercicio de la guía anterior (clima vs. estrés hídrico, con 100 días exactamente repartidos en 40/60), aquí partimos directamente de la tabla de frecuencias absolutas ya observada en campo, con un número distinto de lotes por sistema — como ocurre en la vida real, donde no todos los tratamientos tienen el mismo tamaño de muestra.
Esta es la información que el ingeniero trae directamente de campo. Cópiala en tu cuaderno tal cual, incluyendo los espacios en blanco:
| Sistema de drenaje \ Estado del cultivo | Sano | Dañado | Total fila |
|---|---|---|---|
| Superficial | 80 | 20 | ___ |
| Subsuperficial | 46 | 4 | ___ |
| Sin drenaje | 6 | 14 | ___ |
| Total columna | ___ | ___ | ___ |
Instrucción: completa los espacios en blanco sumando por fila y por columna, y verifica que el gran total (esquina inferior derecha) dé el mismo número sumando por filas que sumando por columnas.
Esto es exactamente lo que en el documento de funciones de R llamamos la notación general de una tabla \(r \times s\): cada celda es \(n_{ij}\) (por ejemplo, \(n_{11}=80\) es “lotes con drenaje Superficial y cultivo Sano”), cada total de fila es \(n_{i\cdot}\), cada total de columna es \(n_{\cdot j}\), y el gran total es \(n\). Cuando lo hagamos en R,
addmargins()hace exactamente este Paso 1 automáticamente.
Solución de referencia (para el profesor): Total fila Superficial = 100, Subsuperficial = 50, Sin drenaje = 20. Total columna Sano = 132, Dañado = 38. Gran total \(n = 170\).
Antes de calcular ninguna probabilidad, respondan solo mirando los conteos (sin dividir nada todavía). Esto entrena el ojo para leer una tabla cruzada:
Solución de referencia: (1) 170. (2) 50. (3) 38. (4) Superficial, con 20 lotes dañados. (5) Subsuperficial, con solo 4 lotes dañados.
Pregunta de discusión (guárdenla, la retomamos en el Paso 6): si el drenaje Superficial es el que más lotes dañados tiene en números absolutos, ¿significa eso que es el sistema más riesgoso? Anoten su respuesta intuitiva antes de continuar — la vamos a poner a prueba con probabilidades.
La tabla de frecuencias absolutas no se puede comparar directamente entre sistemas porque no todos tienen el mismo número de lotes. El primer paso para poder comparar es convertir cada celda en una proporción respecto al gran total:
\[\text{Proporción}_{ij} = \frac{n_{ij}}{n} = P(\text{Sistema}_i \cap \text{Estado}_j)\]
Completen la tabla de proporciones (redondeen a 4 decimales) usando los datos del Paso 1:
| Sistema \ Estado | Sano | Dañado | Total fila |
|---|---|---|---|
| Superficial | 80/170 = ___ | 20/170 = ___ | ___ |
| Subsuperficial | 46/170 = ___ | 4/170 = ___ | ___ |
| Sin drenaje | 6/170 = ___ | 14/170 = ___ | ___ |
| Total columna | ___ | ___ | 1.0000 |
Cada celda de esta tabla es una probabilidad conjunta: por ejemplo, la celda Superficial–Dañado se lee así: “la probabilidad de que un lote elegido al azar tenga drenaje superficial y al mismo tiempo haya resultado dañado es de…”.
Solución de referencia:
Sistema \ Estado Sano Dañado Total fila Superficial 0.4706 0.1176 0.5882 Subsuperficial 0.2706 0.0235 0.2941 Sin drenaje 0.0353 0.0824 0.1176 Total columna 0.7765 0.2235 1.0000
Fíjense en los totales de fila y de columna de la tabla de proporciones que acaban de completar — están literalmente en el margen de la tabla, por eso se llaman probabilidades marginales: describen una sola variable ignorando por completo la otra.
Probabilidad marginal de cada sistema de drenaje (ignorando si el cultivo quedó sano o dañado): \(P(\text{Superficial})\), \(P(\text{Subsuperficial})\), \(P(\text{Sin drenaje})\).
Probabilidad marginal del estado del cultivo (ignorando qué sistema tenía): \(P(\text{Sano})\), \(P(\text{Dañado})\).
Preguntas:
Solución de referencia: \(P(\text{Superficial})=0.5882\), \(P(\text{Subsuperficial})=0.2941\), \(P(\text{Sin drenaje})=0.1176\) (suman 1.0000). \(P(\text{Sano})=0.7765\), \(P(\text{Dañado})=0.2235\) (suman 1.0000).
La probabilidad condicional responde: “si ya sé algo, ¿cómo cambia la probabilidad de lo otro?”. En una tabla cruzada se puede condicionar por fila o por columna — son preguntas distintas y responden cosas distintas.
\[P(\text{Estado}\vert\text{Sistema}) = \frac{n(\text{Sistema} \cap \text{Estado})}{n(\text{Sistema})}\]
Completen dividiendo cada celda del Paso 1 entre el total de su propia fila:
| Sistema | P(Sano | Sistema) | P(Dañado | Sistema) |
|---|---|---|
| Superficial | 80/100 = ___ | 20/100 = ___ |
| Subsuperficial | 46/50 = ___ | 4/50 = ___ |
| Sin drenaje | 6/20 = ___ | 14/20 = ___ |
(cada fila debe sumar 1.00 — esa es su forma de comprobar que no se equivocaron)
\[P(\text{Sistema}\vert\text{Estado}) = \frac{n(\text{Sistema} \cap \text{Estado})}{n(\text{Estado})}\]
Completen ahora dividiendo cada celda del Paso 1 entre el total de su propia columna:
| Sistema | P(Sistema | Sano) | P(Sistema | Dañado) |
|---|---|---|
| Superficial | 80/132 = ___ | 20/38 = ___ |
| Subsuperficial | 46/132 = ___ | 4/38 = ___ |
| Sin drenaje | 6/132 = ___ | 14/38 = ___ |
(cada columna debe sumar 1.00)
Solución de referencia — 5a (por fila):
Sistema P(Sano|Sistema) P(Dañado|Sistema) Superficial 0.80 0.20 Subsuperficial 0.92 0.08 Sin drenaje 0.30 0.70 Solución de referencia — 5b (por columna):
Sistema P(Sistema|Sano) P(Sistema|Dañado) Superficial 0.6061 0.5263 Subsuperficial 0.3485 0.1053 Sin drenaje 0.0455 0.3684
Para cada enunciado, identifiquen si es una probabilidad marginal, conjunta o condicional, y en qué tabla del ejercicio (Paso 3, 4, 5a o 5b) ya está calculada:
Solución: (1) marginal — Paso 4. (2) condicional por fila — Paso 5a. (3) conjunta — Paso 3. (4) condicional por columna — Paso 5b.
Retomen su respuesta intuitiva del Paso 2. Ahora que tienen las probabilidades condicionales por fila (Paso 5a), comparen:
| Lotes dañados (número absoluto) | P(Dañado | Sistema) | |
|---|---|---|
| Superficial | 20 (el más alto) | 0.20 |
| Sin drenaje | 14 | 0.70 (la más alta) |
| Subsuperficial | 4 (el más bajo) | 0.08 |
Preguntas de cierre (bitácora / discusión):
Idea clave para cerrar en plenaria: el número absoluto de casos depende de cuántos lotes tienen ese sistema (la probabilidad marginal), mientras que la probabilidad condicional mide el riesgo por lote, independientemente de cuántos lotes existan con ese sistema. Un ingeniero que solo mira conteos absolutos puede tomar decisiones equivocadas; la probabilidad condicional es la que aísla el efecto real del sistema de drenaje.
Este mismo ejercicio, con esta misma tabla de 170 lotes, se puede
reproducir en R con las funciones ya vistas (table(),
margin.table(), prop.table(),
addmargins(), chisq.test()) siguiendo
exactamente los mismos cinco pasos trabajados aquí a mano. Si quieres,
en el siguiente mensaje te preparo esa versión en RMarkdown (incluyendo
la prueba de independencia formal para confirmar si la dependencia entre
sistema de drenaje y estado del cultivo es estadísticamente
significativa).