Base simulada: 500,000 casos

Documento de apoyo para explicación, discusión grupal y preparación del video. Los datos son simulados y no representan estadísticas epidemiológicas reales de Panamá.


1 ANÁLISIS 1 – ANOVA FACTORIAL

1.1 Interacción entre tratamiento y agente toxinológico sobre el biomarcador

1.1.1 1. Propósito del análisis

Pregunta de investigación: ¿El efecto del tratamiento sobre el biomarcador depende del agente toxinológico?

Objetivo estadístico: evaluar simultáneamente el efecto principal del tratamiento, el efecto principal del agente toxinológico y la interacción Tratamiento × Agente sobre Biomarcador_UL.

La interacción es el componente central. Si es significativa, indica que el efecto del tratamiento no es exactamente igual para todos los agentes toxinológicos.

1.1.2 2. Variables del ANOVA factorial

Variable Rol Tipo…escala Interpretación
Biomarcador_UL Respuesta Cuantitativa continua; razón Nivel del biomarcador toxinológico en U/L
Tratamiento Factor fijo Cualitativa nominal Soporte; Antiveneno; Antiveneno + Soporte
Agente Factor fijo Cualitativa nominal Araña; Escorpión; Himenóptero; Ofídico
Tratamiento × Agente Interacción Combinación de factores Evalúa si el efecto del tratamiento cambia según el agente

1.1.3 3. Hipótesis

Efecto de Tratamiento – H₀: las medias del biomarcador son iguales entre los tratamientos. H₁: al menos una media difiere.

Efecto de Agente – H₀: las medias del biomarcador son iguales entre los agentes toxinológicos. H₁: al menos una media difiere.

Interacción Tratamiento × Agente – H₀: no existe interacción; el efecto del tratamiento es independiente del agente. H₁: existe interacción; el efecto del tratamiento depende del agente toxinológico.

1.1.4 4. Estadística descriptiva

Las combinaciones de agente y tratamiento mostraron diferencias claras en las medias del biomarcador. En los cuatro agentes, el grupo con Soporte presentó las medias más elevadas, mientras que Antiveneno + Soporte tendió a presentar las medias más bajas.

Agente Tratamiento n Media DE Mediana Mín. Máx.
Araña Antiveneno 34,983 88.54 21.63 87.63 1.00 206.80
Araña Antiveneno + Soporte 34,566 85.63 21.64 84.88 1.00 213.76
Araña Soporte 29,873 109.36 21.70 108.77 33.85 238.80
Escorpión Antiveneno 44,028 93.70 21.71 92.88 4.31 224.71
Escorpión Antiveneno + Soporte 43,763 83.51 21.71 82.71 1.00 200.19
Escorpión Soporte 37,624 117.51 21.59 116.84 32.27 235.03
Himenóptero Antiveneno 35,041 84.61 21.82 83.82 1.00 224.04
Himenóptero Antiveneno + Soporte 34,949 80.68 21.65 79.87 1.15 215.42
Himenóptero Soporte 30,010 104.32 21.57 103.80 19.14 208.65
Ofídico Antiveneno 61,474 97.47 21.66 96.75 9.37 218.59
Ofídico Antiveneno + Soporte 61,052 85.52 21.64 84.74 1.00 200.61
Ofídico Soporte 52,637 127.56 21.63 126.88 39.24 259.53

1.1.5 5. Magnitud descriptiva de las diferencias

Agente Soporte Antiveneno Antiveneno…Soporte Δ.Soporte.Antiveneno Δ.Soporte.Combinación
Araña 109.36 88.54 85.63 −20.82 −23.73
Escorpión 117.51 93.70 83.51 −23.81 −34.00
Himenóptero 104.32 84.61 80.68 −19.71 −23.64
Ofídico 127.56 97.47 85.52 −30.09 −42.04

Lectura clave: la mayor reducción descriptiva se observó en los casos ofídicos: 127.56 U/L con Soporte frente a 85.52 U/L con Antiveneno + Soporte, una disminución aproximada de 42.04 U/L.

1.1.6 6. Gráfico de interacción

Medias del biomarcador según tratamiento y agente toxinológico.

Medias del biomarcador según tratamiento y agente toxinológico.

Figura 1. Medias del biomarcador según tratamiento y agente toxinológico.

Interpretación visual: las líneas no son paralelas y convergen particularmente bajo Antiveneno + Soporte. Esto sugiere que la magnitud del efecto del tratamiento cambia según el agente. No se observa una interacción de cruce completa; la dirección general se mantiene (Soporte > Antiveneno > Antiveneno + Soporte), pero la magnitud de las diferencias varía. Este patrón puede describirse como una interacción ordinal.

1.1.7 7. Resultados del ANOVA factorial

Fuente gl F p η..parcial
Tratamiento 2 97,933.36 < 0.001 0.2815
Agente 3 8,632.05 < 0.001 0.0492
Tratamiento × Agente 6 1,849.03 < 0.001 0.0217
Residual 499,988

Nota sobre los valores p: Python mostró 0.0 por limitaciones de redondeo numérico. Debe reportarse p < 0.001, no p = 0.000.

1.1.8 8. Interpretación de los efectos

1.1.8.1 8.1. Efecto principal del tratamiento

F(2, 499,988) = 97,933.36; p < 0.001; η²p = 0.2815. Existen diferencias estadísticamente significativas entre tratamientos. El tratamiento es el factor con mayor tamaño de efecto del modelo. Con criterios heurísticos comunes, η²p ≈ 0.28 representa un efecto grande.

1.1.8.2 8.2. Efecto principal del agente toxinológico

F(3, 499,988) = 8,632.05; p < 0.001; η²p = 0.0492. También existen diferencias significativas entre agentes. Su magnitud es mucho menor que la del tratamiento, aunque sigue aportando variación relevante al biomarcador.

1.1.8.3 8.3. Interacción Tratamiento × Agente

F(6, 499,988) = 1,849.03; p < 0.001; η²p = 0.0217. Se rechaza H₀ de ausencia de interacción. En esta base simulada, el efecto del tratamiento sobre el biomarcador depende del agente toxinológico. La interacción es estadísticamente clara, pero su tamaño de efecto es pequeño comparado con el efecto principal del tratamiento.

Mensaje central para la discusión: el tratamiento domina el patrón global; el agente y la interacción modifican ese patrón, pero con magnitudes menores.

1.1.9 9. Importancia del tamaño muestral

Con 500,000 observaciones, el análisis tiene una potencia estadística muy elevada. Por ello, efectos pequeños pueden producir valores p extremadamente bajos. La interpretación no debe basarse únicamente en la significancia estadística: es indispensable considerar η² parcial y la magnitud de las diferencias observadas.

1.1.10 10. Evaluación de supuestos

1.1.10.1 10.1. Independencia

La independencia se sustenta en el diseño de la simulación: cada fila representa un caso diferente generado como observación independiente. No se evalúa mediante Shapiro-Wilk ni Levene; depende de cómo se obtuvieron o generaron los datos.

1.1.10.2 10.2. Homogeneidad de varianzas

Prueba de Levene: estadístico = 0.54824; p = 0.87131. Como p > 0.05, no se rechaza la hipótesis de igualdad de varianzas. No hay evidencia de heterogeneidad de varianzas entre las 12 combinaciones de agente y tratamiento; el supuesto puede considerarse satisfecho.

1.1.10.3 10.3. Normalidad de los residuos

Shapiro-Wilk sobre 5,000 residuos: W = 0.99561; p < 0.001. Formalmente se detecta una desviación estadísticamente significativa de la normalidad, pero W está muy próximo a 1, lo que sugiere una desviación pequeña. Con muestras grandes, Shapiro-Wilk detecta diferencias mínimas y puede resultar significativo aun cuando la distribución sea aproximadamente normal. Dado el gran tamaño muestral y la robustez del ANOVA, este hallazgo no invalida por sí solo el modelo.

QQ-plot original de residuos.

QQ-plot original de residuos.

Figura 2. QQ-plot original de residuos. La escala producida por la línea y = x comprime los cuantiles teóricos, por lo que conviene regenerar el gráfico con scipy.stats.probplot para una evaluación visual más adecuada.

Recomendación práctica: para el informe/video, mostrar el QQ-plot corregido. El resultado de Shapiro debe explicarse junto con W, el tamaño muestral y la robustez del ANOVA, no de forma aislada.

1.1.11 11. Interpretación estadística integrada

El ANOVA factorial evidenció efectos significativos del tratamiento, del agente y de la interacción Tratamiento × Agente sobre Biomarcador_UL. El tratamiento presentó la mayor magnitud de efecto (η²p = 0.2815), seguido por el agente (η²p = 0.0492) y la interacción (η²p = 0.0217). Esto indica que las diferencias del biomarcador se explican principalmente por el tratamiento, aunque la intensidad del efecto terapéutico varía en función del agente toxinológico.

La interacción significativa exige cautela al interpretar los efectos principales de manera aislada. El siguiente paso analítico recomendable es examinar efectos simples o comparaciones post hoc: comparar tratamientos dentro de cada agente y, si es necesario, agentes dentro de cada tratamiento.

1.1.12 12. Interpretación toxinológica

Desde una perspectiva toxinológica, los resultados simulados sugieren que la respuesta del biomarcador frente al tratamiento depende parcialmente de la naturaleza del agente causal. Los mayores valores se observaron bajo soporte exclusivo, mientras que la administración de antiveneno, especialmente combinada con medidas de soporte, se asoció con valores menores del biomarcador.

La reducción fue particularmente marcada en los casos ofídicos y por escorpión. En los casos ofídicos, la media disminuyó de 127.56 U/L con soporte a 85.52 U/L con antiveneno más soporte. Este patrón sería compatible, dentro de la simulación, con una mayor reducción de la respuesta fisiopatológica asociada con la exposición tóxica cuando se aplica el esquema combinado.

Estos datos son simulados. La interpretación toxinológica es únicamente un ejercicio académico y no debe presentarse como evidencia clínica ni epidemiológica sobre eficacia real de tratamientos.

1.1.13 13. Puntos para discutir entre los compañeros

  • ¿Por qué el término de interacción es más importante que limitarse a comparar medias de tratamiento y agente por separado?
  • ¿Por qué p < 0.001 no significa necesariamente que el efecto sea grande? Relacionar la respuesta con n = 500,000 y η² parcial.
  • ¿Qué significa que el tratamiento tenga η²p = 0.2815 y la interacción η²p = 0.0217?
  • ¿Por qué el resultado de Shapiro-Wilk debe interpretarse con cautela en muestras grandes?
  • ¿Qué aporta la prueba de Levene y por qué su p = 0.871 favorece el uso del ANOVA?
  • ¿Cómo explicar el patrón de líneas no paralelas sin confundirlo con una interacción de cruce completa?
  • ¿Qué comparaciones post hoc o efectos simples serían más útiles después de encontrar una interacción significativa?
  • ¿Cómo diferenciar interpretación estadística de interpretación toxinológica?

1.1.14 14. Conclusión formal para el informe

Conclusión: El ANOVA factorial evidenció efectos estadísticamente significativos del tratamiento [F(2, 499988) = 97933.36; p < 0.001; η²p = 0.281], del agente toxinológico [F(3, 499988) = 8632.05; p < 0.001; η²p = 0.049] y de la interacción Tratamiento × Agente [F(6, 499988) = 1849.03; p < 0.001; η²p = 0.022] sobre el biomarcador. En consecuencia, se rechaza la hipótesis nula de ausencia de interacción y se concluye que, dentro de la base simulada, el efecto del tratamiento sobre el biomarcador depende significativamente del agente toxinológico. No obstante, el tratamiento presentó un tamaño de efecto considerablemente mayor que el agente y la interacción, por lo que constituye el principal factor asociado con la variación del biomarcador.

1.1.15 15. Ideas clave para recordar

  • La pregunta principal se responde con la interacción Tratamiento × Agente, no solo con los efectos principales.
  • Interacción significativa: F(6, 499988) = 1849.03; p < 0.001; η²p = 0.0217.
  • Tratamiento = efecto dominante: η²p = 0.2815.
  • Agente = efecto menor: η²p = 0.0492.
  • Levene p = 0.871: homogeneidad de varianzas compatible con el ANOVA.
  • Shapiro p < 0.001 debe contextualizarse: W = 0.99561 y n grande.
  • Con 500,000 casos, tamaño de efecto y relevancia científica son esenciales; no basta con p.
  • Después de una interacción significativa, conviene analizar efectos simples/post hoc.

1.1.16 16. Base metodológica de la asignación

La estructura de este documento sigue la guía de la asignatura “Análisis de una base de datos toxinológica simulada mediante R Markdown o Quarto”, específicamente las indicaciones del Grupo 2 para el ANOVA factorial: pregunta de investigación, identificación de variables, hipótesis, justificación, estadística descriptiva, visualización, evaluación de supuestos, ejecución del modelo, interpretación estadística e interpretación toxinológica.

Link del video: https://drive.google.com/file/d/1bVTvR8gGMmd9Opv_HKPZy1Bvt7juCqkV/view?usp=drive_link


2 ANÁLISIS 2 – GLM BINOMIAL

Base toxinológica simulada, n = 500,000 casos. Los resultados tienen fines exclusivamente académicos y no representan estimaciones clínicas ni epidemiológicas reales de Panamá.

2.0.1 1. Pregunta de investigación

¿Qué factores modifican la probabilidad de presentar un evento adverso?

La variable respuesta es Evento_Adverso, codificada como 0 = no presentó evento adverso y 1 = presentó evento adverso. Por tratarse de una respuesta binaria, el procedimiento apropiado es un modelo lineal generalizado (GLM) con distribución binomial y función de enlace logit, equivalente a una regresión logística.

2.0.2 2. Variables incluidas en el modelo

Variable Rol Tipo Interpretación
Evento_Adverso Respuesta Binaria (0/1) Presencia o ausencia de evento adverso
Agente Explicativa Cualitativa nominal Agente toxinológico
Tratamiento Explicativa Cualitativa nominal Tratamiento administrado
Dosis_mgkg Explicativa Cuantitativa continua Dosis estimada por kg
Edad Explicativa Cuantitativa Edad en años
Tiempo_Atencion_h Explicativa Cuantitativa continua Horas hasta recibir atención

2.0.3 3. Justificación del GLM binomial

El GLM binomial es apropiado porque la respuesta solo puede tomar dos estados. El enlace logit modela el logaritmo de las odds del evento y permite estimar asociaciones ajustadas entre cada predictor y la ocurrencia del evento adverso, manteniendo constantes las demás variables del modelo.

Forma conceptual del modelo: logit[P(Evento_Adverso = 1)] = β0 + β1(Dosis) + β2(Edad) + β3(Tiempo de atención) + efectos de Agente + efectos de Tratamiento.

2.0.4 4. Hipótesis

Hipótesis global:

H0: todos los coeficientes asociados con los predictores son iguales a cero; ninguna variable se asocia con cambios en las odds de evento adverso.

H1: al menos uno de los coeficientes es diferente de cero; al menos un predictor se asocia con cambios en las odds de evento adverso.

Para cada predictor individual, H0: βi = 0, equivalente a OR = 1. La alternativa es βi ≠ 0, equivalente a un OR diferente de 1.

2.0.5 5. Categorías de referencia

La interpretación de las variables categóricas depende de la categoría utilizada como referencia:

Variable Referencia Comparaciones.reportadas
Agente Araña Escorpión, Himenóptero y Ofídico vs Araña
Tratamiento Antiveneno Antiveneno + Soporte y Soporte vs Antiveneno

Por tanto, todos los OR para Agente deben interpretarse respecto a Araña, y los OR para Tratamiento respecto a Antiveneno.

2.0.6 6. Resultado general del modelo

El modelo se ajustó con 500,000 observaciones, 8 grados de libertad del modelo y 499,991 grados de libertad residuales. Convergió en cinco iteraciones mediante IRLS. La función de enlace fue logit y la familia del modelo fue binomial.

Indicador Resultado
Log-Likelihood −222,980 aproximadamente
Deviance 445,950 aproximadamente
Pearson χ² ≈ 500,000
Pseudo R² (Cox-Snell) 0.05568
Número de iteraciones 5

Los valores p mostrados por Python como 0.000 deben reportarse como p < 0.001, no como p = 0.000. Con un tamaño muestral de 500,000 casos, es fundamental interpretar la magnitud de los OR y sus intervalos de confianza, no limitarse a la significancia estadística.

2.0.7 7. Odds ratios ajustados e interpretación

Predictor OR IC95.. p Interpretación.ajustada
Escorpión vs Araña 1.2045 1.1770–1.2327 <0.001 20.5 % mayores odds
Himenóptero vs Araña 0.9007 0.8781–0.9239 <0.001 9.9 % menores odds
Ofídico vs Araña 1.6429 1.6086–1.6781 <0.001 64.3 % mayores odds
Antiveneno + Soporte vs Antiveneno 0.8187 0.8033–0.8344 <0.001 18.1 % menores odds
Soporte vs Antiveneno 1.8057 1.7741–1.8378 <0.001 80.6 % mayores odds
Dosis_mgkg (por 1 mg/kg) 1.5073 1.4947–1.5199 <0.001 50.7 % mayores odds
Edad (por año) 1.0119 1.0115–1.0124 <0.001 1.19 % mayores odds
Tiempo_Atencion_h (por hora) 1.1017 1.0989–1.1046 <0.001 10.2 % mayores odds

2.0.8 8. Interpretación por predictor

Agente: Escorpión

Comparado con Araña, Escorpión presentó OR = 1.2045 (IC95 %: 1.1770–1.2327; p < 0.001). Esto corresponde a aproximadamente 20.5% mayores odds de evento adverso, manteniendo constantes las demás variables.

Agente: Himenóptero

Himenóptero presentó OR = 0.9007 (IC95 %: 0.8781–0.9239; p < 0.001), equivalente a aproximadamente 9.9 % menores odds respecto a Araña, después del ajuste por los demás predictores.

Agente: Ofídico

Ofídico presentó OR = 1.6429 (IC95 %: 1.6086–1.6781; p < 0.001). En la simulación, los casos ofídicos tuvieron aproximadamente 64.3 % mayores odds de evento adverso que los casos asociados con Araña. Este fue el contraste de agente con mayor incremento de odds.

Tratamiento: Antiveneno + Soporte

Frente a Antiveneno solo, Antiveneno + Soporte presentó OR = 0.8187 (IC95 %: 0.8033–0.8344; p < 0.001), equivalente a 18.1 % menores odds de evento adverso.

Tratamiento: Soporte

Soporte presentó OR = 1.8057 (IC95 %: 1.7741–1.8378; p < 0.001), equivalente a aproximadamente 80.6 % mayores odds que Antiveneno, controlando por agente, dosis, edad y tiempo de atención.

Dosis

Por cada incremento de 1 mg/kg en Dosis_mgkg, las odds aumentaron aproximadamente 50.7 % (OR = 1.5073; IC95 %: 1.4947–1.5199; p < 0.001), manteniendo constantes las demás variables.

Edad

Cada año adicional de edad se asoció con un incremento aproximado de 1.19 % en las odds (OR = 1.0119; IC95 %: 1.0115–1.0124; p < 0.001). El efecto por unidad es pequeño, aunque acumulativo a través de varios años.

Tiempo hasta la atención

Cada hora adicional hasta recibir atención se asoció con un aumento aproximado de 10.2 % en las odds de evento adverso (OR = 1.1017; IC95 %: 1.0989–1.1046; p < 0.001).

2.0.9 9. Visualización: eventos adversos según tratamiento

Proporción observada de eventos adversos según tratamiento.

Proporción observada de eventos adversos según tratamiento.

Figura 1. Proporción observada de eventos adversos según tratamiento.

El gráfico muestra una frecuencia cruda aproximada de 16 % para Antiveneno, 14 % para Antiveneno + Soporte y 25–26 % para Soporte. El patrón visual es coherente con los OR ajustados: Soporte presenta mayor ocurrencia de eventos y Antiveneno + Soporte la menor.

Debe diferenciarse entre el gráfico y el GLM: el gráfico resume proporciones observadas sin ajuste, mientras que los OR del modelo son asociaciones ajustadas simultáneamente por agente, dosis, edad, tiempo de atención y tratamiento.

2.0.10 10. Supuestos y diagnóstico del GLM binomial

Aspecto Situación.actual Interpretación
Respuesta binaria Cumplido Evento_Adverso está codificado 0/1.
Independencia Asumida por diseño simulado Cada fila representa un caso simulado independiente.
Convergencia Cumplido El modelo convergió en 5 iteraciones; no hay señal evidente de separación completa.
Normalidad de residuos No requerida No es un supuesto del GLM binomial.
Homogeneidad de varianzas No requerida como en ANOVA La varianza binomial depende de la media.
Linealidad en el logit Pendiente de comprobar Debe evaluarse para Dosis, Edad y Tiempo_Atencion_h.
Multicolinealidad Pendiente de comprobar Conviene calcular VIF.
Observaciones influyentes Pendiente de comprobar Conviene revisar leverage, residuos y medidas de influencia.

La razón aproximada Pearson χ² / df es cercana a 1, por lo que no se observa una discrepancia extraordinaria en la dispersión del modelo. Sin embargo, este indicador no sustituye la evaluación de linealidad del logit, multicolinealidad e influencia.

2.0.11 11. Interpretación del pseudo R²

El pseudo R² de Cox-Snell fue 0.05568. No debe interpretarse como si fuera el R² de una regresión lineal ni afirmarse que el modelo ‘explica exactamente 5.6 % de la varianza’. Puede describirse como un indicador de mejora del ajuste atribuible al conjunto de predictores, útil para caracterizar el modelo pero secundario frente a los OR, IC95 % y diagnóstico.

2.0.12 12. Interpretación toxinológica

Dentro del escenario simulado, el riesgo de presentar eventos adversos se relaciona con componentes propios de la exposición y de la atención. Una mayor dosis se asoció con mayores odds de evento adverso, patrón compatible con una relación dosis-respuesta en la simulación. Un mayor tiempo hasta recibir atención también se asoció con incremento de las odds.

Entre los agentes, Ofídico presentó el mayor incremento frente a la referencia Araña. En el componente terapéutico, Antiveneno + Soporte se asoció con menores odds que Antiveneno, mientras que Soporte presentó las odds más elevadas. Estos resultados pueden discutirse como diferencias simuladas de carga tóxica, agente y manejo, pero no deben interpretarse como evidencia clínica real de eficacia terapéutica ni como datos epidemiológicos de Panamá.

2.0.13 13. Interpretación estadística integrada

El GLM binomial mostró asociaciones estadísticamente significativas entre Evento_Adverso y todos los predictores incluidos (p < 0.001 en los contrastes reportados). Frente a Araña, Ofídico presentó 64.3 % mayores odds y Escorpión 20.5 % mayores odds, mientras que Himenóptero mostró 9.9 % menores odds. Frente a Antiveneno, Antiveneno + Soporte presentó 18.1 % menores odds y Soporte 80.6 % mayores odds. Cada incremento de 1 mg/kg en la dosis se asoció con 50.7 % mayores odds, cada año de edad con 1.19 % mayores odds y cada hora adicional hasta la atención con 10.2 % mayores odds.

Debido al tamaño muestral extremadamente grande, la discusión debe concentrarse en la magnitud de los OR y sus intervalos de confianza, no únicamente en los valores p.

2.0.14 14. Respuesta directa a la pregunta de investigación

Respuesta: En la base simulada, el agente toxinológico, el tratamiento, la dosis, la edad y el tiempo hasta la atención se asociaron significativamente con las odds de presentar un evento adverso. Los mayores incrementos se observaron para Soporte frente a Antiveneno, Ofídico frente a Araña y el aumento de Dosis_mgkg; Antiveneno + Soporte se asoció con menores odds respecto a Antiveneno.

2.0.15 15. Conclusión formal

El GLM binomial identificó asociaciones estadísticamente significativas entre la ocurrencia de eventos adversos y las variables incluidas en el modelo. Los casos ofídicos presentaron mayores odds respecto a Araña (OR = 1.643; IC95 %: 1.609–1.678; p < 0.001), mientras que Soporte presentó mayores odds que Antiveneno (OR = 1.806; IC95 %: 1.774–1.838; p < 0.001). Por el contrario, Antiveneno + Soporte se asoció con menores odds respecto a Antiveneno (OR = 0.819; IC95 %: 0.803–0.834; p < 0.001). La dosis mostró una asociación relevante: cada incremento de 1 mg/kg se relacionó con 50.7 % mayores odds de evento adverso (OR = 1.507; IC95 %: 1.495–1.520; p < 0.001). También se observaron incrementos asociados con edad y mayor tiempo hasta la atención. En conjunto, la ocurrencia del evento adverso en esta simulación está asociada con una combinación de agente, exposición y manejo.

2.0.16 16. Preguntas para discusión entre compañeros

  • ¿Por qué un GLM binomial es más apropiado que una regresión lineal para Evento_Adverso?
  • ¿Qué diferencia existe entre probabilidad y odds?
  • ¿Por qué es indispensable conocer las categorías de referencia antes de interpretar los OR?
  • ¿Qué significa un OR mayor que 1? ¿Y un OR menor que 1?
  • ¿Por qué no debe interpretarse un valor p mostrado como 0.000 como p = 0?
  • ¿Por qué el tamaño muestral de 500,000 obliga a prestar especial atención a la magnitud del efecto?
  • ¿Cuál de los predictores presenta el mayor incremento de odds y bajo qué comparación?
  • ¿Qué diferencia existe entre el gráfico de proporciones crudas y los OR ajustados?
  • ¿Qué diagnósticos faltan antes de afirmar que el modelo está completamente evaluado?
  • ¿Cómo debe limitarse la interpretación toxinológica al tratarse de datos simulados?

Link del video: https://drive.google.com/file/d/1Ab_7p6g034r2NYet7sHIvmN6itfQLhSf/view?usp=drive_link


3 ANÁLISIS 3 – GLM POISSON

Base toxinológica simulada, n = 500,000 casos. Los resultados tienen fines exclusivamente académicos y no representan estimaciones clínicas ni epidemiológicas reales de Panamá.

3.0.1 1. Pregunta de investigación

¿Qué variables explican el número de eventos toxinológicos?

La variable respuesta es Numero_Eventos, una variable cuantitativa discreta de conteo que puede tomar valores enteros no negativos (0, 1, 2, 3, …). Por esta razón, el GLM con distribución de Poisson constituye un modelo inicial apropiado para evaluar cómo diferentes predictores se asocian con el número esperado de eventos.

3.0.2 2. Variables incluidas en el modelo

Variable Rol Tipo Interpretación
Numero_Eventos Respuesta Conteo Número de eventos toxinológicos
Agente Explicativa Cualitativa nominal Agente toxinológico
Tratamiento Explicativa Cualitativa nominal Tratamiento administrado
Dosis_mgkg Explicativa Cuantitativa continua Dosis estimada por kg
Edad Explicativa Cuantitativa Edad en años
Tiempo_Atencion_h Explicativa Cuantitativa continua Horas transcurridas hasta la atención

3.0.3 3. Justificación del GLM Poisson

El GLM Poisson se utiliza cuando la variable respuesta representa un conteo y se desea modelar su media condicional. El modelo emplea una función de enlace logarítmica, por lo que los coeficientes se interpretan de forma multiplicativa después de exponenciarlos.

Forma conceptual: log[E(Numero_Eventos)] = β0 + β1(Dosis) + β2(Edad) + β3(Tiempo de atención) + efectos de Agente + efectos de Tratamiento.

Los coeficientes exponenciados se expresan como IRR (Incidence Rate Ratios). Un IRR > 1 indica un aumento en el número esperado de eventos; un IRR < 1 indica una reducción; e IRR = 1 corresponde a ausencia de asociación.

3.0.4 4. Hipótesis

Para cada predictor:

H0: βi = 0, equivalente a IRR = 1; el predictor no modifica el número esperado de eventos.

H1: βi ≠ 0, equivalente a IRR ≠ 1; el predictor se asocia con cambios en el número esperado de eventos.

3.0.5 5. Categorías de referencia

Variable Referencia Comparaciones
Agente Araña Escorpión, Himenóptero y Ofídico vs Araña
Tratamiento Antiveneno Antiveneno + Soporte y Soporte vs Antiveneno

3.0.6 6. Resultado general del modelo

El modelo Poisson se ajustó con 500,000 observaciones y convergió en cinco iteraciones. El enlace utilizado fue log y el método de estimación fue IRLS.

Indicador Resultado
n 500,000
Df Model 8
Df Residuals 499,991
Log-Likelihood −779,970 aproximadamente
Deviance 897,750 aproximadamente
Pearson χ² 976,000 aproximadamente
Pseudo R² (Cox-Snell) 0.09422
Iteraciones 5

Los valores reportados como 0.000 por el software deben escribirse como p < 0.001. Debido al tamaño muestral, la interpretación debe centrarse en los IRR y sus intervalos de confianza, además del diagnóstico de dispersión.

3.0.7 7. IRR ajustados e interpretación

Predictor IRR IC95.. p Interpretación
Escorpión vs Araña 1.1308 1.1215–1.1401 <0.001 13.1 % más eventos esperados
Himenóptero vs Araña 0.9276 0.9192–0.9360 <0.001 7.2 % menos eventos esperados
Ofídico vs Araña 1.3914 1.3810–1.4018 <0.001 39.1 % más eventos esperados
Antiveneno + Soporte vs Antiveneno 0.9034 0.8974–0.9094 <0.001 9.7 % menos eventos esperados
Soporte vs Antiveneno 1.3556 1.3471–1.3641 <0.001 35.6 % más eventos esperados
Dosis_mgkg (por 1 mg/kg) 1.1980 1.1946–1.2014 <0.001 19.8 % más eventos esperados
Edad (por año) 1.0031 1.0029–1.0032 <0.001 0.31 % más eventos esperados
Tiempo_Atencion_h (por hora) 1.0241 1.0232–1.0251 <0.001 2.41 % más eventos esperados

3.0.8 8. Interpretación por predictor

Escorpión

En comparación con Araña, Escorpión presentó IRR = 1.1308 (IC95 %: 1.1215–1.1401; p < 0.001), lo que corresponde a aproximadamente 13.1 % mayor número esperado de eventos, manteniendo constantes las demás variables.

Himenóptero

Himenóptero presentó IRR = 0.9276 (IC95 %: 0.9192–0.9360; p < 0.001), equivalente a aproximadamente 7.2 % menos eventos esperados que Araña, después del ajuste.

Ofídico

Ofídico presentó IRR = 1.3914 (IC95 %: 1.3810–1.4018; p < 0.001). Los casos ofídicos tuvieron aproximadamente 39.1 % mayor número esperado de eventos que Araña. Fue el mayor incremento entre los contrastes de agente.

Antiveneno + Soporte

Frente a Antiveneno, el esquema combinado presentó IRR = 0.9034 (IC95 %: 0.8974–0.9094; p < 0.001), equivalente a aproximadamente 9.7 % menos eventos esperados.

Soporte

Soporte presentó IRR = 1.3556 (IC95 %: 1.3471–1.3641; p < 0.001), equivalente a aproximadamente 35.6 % más eventos esperados que Antiveneno, controlando por las demás variables.

Dosis

Cada incremento de 1 mg/kg en Dosis_mgkg se asoció con un aumento aproximado de 19.8 % en el número esperado de eventos (IRR = 1.1980; IC95 %: 1.1946–1.2014; p < 0.001).

Edad

Cada año adicional de edad se asoció con aproximadamente 0.31 % más eventos esperados (IRR = 1.0031; IC95 %: 1.0029–1.0032; p < 0.001). El efecto por unidad es pequeño pese a su significancia estadística.

Tiempo hasta la atención

Cada hora adicional antes de recibir atención se asoció con aproximadamente 2.41 % más eventos esperados (IRR = 1.0241; IC95 %: 1.0232–1.0251; p < 0.001).

3.0.9 9. Distribución del número de eventos

Distribución del número de eventos toxinológicos simulados.

Distribución del número de eventos toxinológicos simulados.

Figura 1. Distribución del número de eventos toxinológicos simulados.

La distribución presenta una marcada asimetría positiva. La mayor concentración de observaciones se encuentra en 0 y 1 evento, y la frecuencia disminuye progresivamente a medida que aumenta el conteo. Este patrón es consistente con una variable de conteo y justifica evaluar inicialmente un GLM Poisson en lugar de una regresión lineal convencional.

3.0.10 10. Evaluación de la sobredispersión

Índice de dispersión de Pearson: 1.9526

En un modelo Poisson adecuadamente especificado se espera que la varianza condicional sea aproximadamente igual a la media, por lo que la razón Pearson χ² / grados de libertad debería situarse cerca de 1. El valor de 1.9526 indica que la variabilidad observada es casi el doble de la esperada bajo Poisson.

Conclusión diagnóstica: existe sobredispersión importante.

La sobredispersión puede producir errores estándar demasiado pequeños, intervalos de confianza excesivamente estrechos y valores p más extremos de lo apropiado. Por esta razón, aunque Poisson es un modelo inicial justificable, no debe considerarse el modelo final sin comparar una alternativa más flexible.

3.0.11 11. Conexión metodológica con la binomial negativa

La secuencia lógica del análisis es: variable de conteo → ajuste Poisson → diagnóstico de dispersión → detección de sobredispersión → ajuste de binomial negativa → comparación de modelos, especialmente mediante AIC.

Por tanto, el Análisis 3 no está ‘mal’. Poisson fue correctamente seleccionado como punto de partida por la naturaleza de la respuesta; el diagnóstico posterior demuestra que su supuesto de dispersión no se cumple adecuadamente y justifica avanzar al Análisis 4.

3.0.12 12. Supuestos y diagnóstico

Aspecto Situación Comentario
Variable de conteo Cumplido Numero_Eventos toma valores enteros no negativos.
Independencia Asumida por diseño Cada fila representa un caso simulado independiente.
Enlace log Cumplido Es el enlace utilizado en el GLM Poisson.
Normalidad de la respuesta No requerida Los conteos no deben seguir distribución normal.
Linealidad en log(media) Pendiente de diagnóstico Conviene evaluar la forma funcional de predictores continuos.
Multicolinealidad Pendiente de verificar Puede evaluarse mediante VIF.
Media ≈ varianza No cumplido adecuadamente Pearson/df = 1.9526.
Ausencia de sobredispersión No cumplido Existe sobredispersión importante.

3.0.13 13. Pseudo R²

El pseudo R² de Cox-Snell fue 0.09422. Este indicador no debe interpretarse como un porcentaje directo de varianza explicada, como ocurriría con el R² clásico de una regresión lineal. Puede utilizarse como medida complementaria de ajuste, pero la interpretación principal debe centrarse en IRR, intervalos de confianza y diagnóstico de sobredispersión.

3.0.14 14. Interpretación estadística integrada

El GLM Poisson identificó asociaciones estadísticamente significativas entre el número de eventos y el agente toxinológico, el tratamiento, la dosis, la edad y el tiempo hasta la atención (p < 0.001). En comparación con Araña, los casos ofídicos presentaron 39.1 % más eventos esperados (IRR = 1.391; IC95 %: 1.381–1.402), mientras que Escorpión presentó 13.1 % más eventos (IRR = 1.131; IC95 %: 1.122–1.140). Himenóptero presentó 7.2 % menos eventos esperados (IRR = 0.928; IC95 %: 0.919–0.936). Frente a Antiveneno, Soporte presentó 35.6 % más eventos esperados (IRR = 1.356; IC95 %: 1.347–1.364), mientras que Antiveneno + Soporte presentó 9.7 % menos eventos (IRR = 0.903; IC95 %: 0.897–0.909). Cada incremento de 1 mg/kg de dosis se asoció con 19.8 % más eventos esperados; cada año de edad, con 0.31 % más eventos; y cada hora adicional hasta la atención, con 2.41 % más eventos.

Sin embargo, el índice de dispersión de Pearson fue 1.9526, evidencia de sobredispersión importante. Por tanto, los resultados de Poisson deben considerarse como una caracterización inicial que requiere contraste mediante un modelo binomial negativo.

3.0.15 15. Interpretación toxinológica

Dentro del escenario simulado, la carga de eventos toxinológicos se relacionó con características del agente, la exposición y el manejo. Los casos ofídicos presentaron la mayor tasa esperada de eventos respecto a la referencia Araña, y una mayor dosis mostró una asociación positiva con el número de eventos, compatible con un patrón dosis-respuesta dentro de la simulación. Un mayor tiempo hasta la atención también se asoció con un incremento del conteo esperado. Antiveneno + Soporte se relacionó con menos eventos esperados que Antiveneno, mientras que Soporte se relacionó con más eventos.

Estas asociaciones son exclusivamente académicas porque la base fue simulada. No constituyen estimaciones clínicas reales ni permiten inferir eficacia terapéutica en pacientes reales.

3.0.16 16. Respuesta directa a la pregunta de investigación

Respuesta: En la base simulada, Agente, Tratamiento, Dosis_mgkg, Edad y Tiempo_Atencion_h se asociaron significativamente con el número esperado de eventos. Los mayores incrementos relativos se observaron para Ofídico respecto a Araña, Soporte respecto a Antiveneno y mayores niveles de dosis. No obstante, la sobredispersión observada (Pearson/df = 1.9526) indica que Poisson no representa adecuadamente toda la variabilidad del conteo y justifica evaluar un modelo binomial negativo.

3.0.17 17. Conclusión formal

El GLM Poisson mostró que todas las variables incorporadas estuvieron estadísticamente asociadas con el número de eventos toxinológicos simulados. Los casos ofídicos presentaron 39.1 % más eventos esperados que los asociados con Araña (IRR = 1.391; IC95 %: 1.381–1.402; p < 0.001), y Soporte presentó 35.6 % más eventos que Antiveneno (IRR = 1.356; IC95 %: 1.347–1.364; p < 0.001). Cada aumento de 1 mg/kg en la dosis se relacionó con un incremento de 19.8 % en el número esperado de eventos (IRR = 1.198; IC95 %: 1.195–1.201; p < 0.001). Sin embargo, el índice de dispersión de Pearson fue 1.9526, evidenciando sobredispersión importante. En consecuencia, el modelo Poisson no representa adecuadamente toda la variabilidad de los datos y se justifica evaluar un GLM binomial negativo.

3.0.18 18. Preguntas para discusión entre compañeros

  • ¿Por qué una variable de conteo justifica inicialmente un GLM Poisson?
  • ¿Cuál es la diferencia conceptual entre OR e IRR?
  • ¿Qué significa un IRR mayor que 1? ¿Y menor que 1?
  • ¿Por qué no debe interpretarse el valor p sin considerar la magnitud del IRR?
  • ¿Qué indica la forma asimétrica del histograma?
  • ¿Cuál es el supuesto media-varianza de Poisson?
  • ¿Por qué Pearson/df = 1.9526 representa sobredispersión?
  • ¿Qué consecuencias puede producir la sobredispersión sobre errores estándar e intervalos de confianza?
  • ¿Por qué el hallazgo de sobredispersión no significa que fue incorrecto probar Poisson?
  • ¿Qué resultados debemos comparar en el Análisis 4 para decidir entre Poisson y binomial negativa?

Link del video: https://drive.google.com/file/d/1uaC0PC0LB55UqbqgILizWkyRCYwg9UKu/view?usp=drive_link


4 ANÁLISIS 4 – GLM BINOMIAL NEGATIVA

Base toxinológica simulada, n = 500,000 casos. Los resultados tienen fines exclusivamente académicos y no representan estimaciones clínicas ni epidemiológicas reales de Panamá.

4.0.1 1. Pregunta de investigación

¿Poisson describe adecuadamente el número de eventos observados?

La finalidad de este análisis es comparar el modelo Poisson del análisis anterior con un modelo binomial negativo. La comparación se justifica porque el GLM Poisson presentó sobredispersión importante, con un índice de dispersión de Pearson de 1.9526.

4.0.2 2. Planteamiento de hipótesis

La comparación entre Poisson y binomial negativa debe partir de una hipótesis explícita sobre la dispersión de los datos de conteo. En este análisis, la hipótesis principal se centra en el parámetro de sobredispersión α.

4.0.2.1 2.1. Hipótesis principal: sobredispersión y elección del modelo

Hipótesis nula (H₀): α = 0. No existe sobredispersión relevante. La varianza del número de eventos puede representarse adecuadamente mediante un modelo Poisson y no es necesario incorporar un parámetro adicional de dispersión.

En términos conceptuales, bajo H₀ se espera que la varianza condicional sea aproximadamente igual a la media: Var(Y|X) ≈ E(Y|X).

Hipótesis alternativa (H₁): α > 0. Existe sobredispersión; la varianza es mayor que la esperada bajo Poisson y un modelo binomial negativo resulta más apropiado.

En la binomial negativa, esta situación se representa mediante Var(Y|X) = μ + αμ². Cuando α es claramente mayor que 0, el modelo admite variabilidad adicional respecto a Poisson.

4.0.2.2 2.2. Decisión con los resultados obtenidos

El modelo binomial negativo estimó α = 0.852, con IC95 % aproximadamente 0.844–0.860 y p < 0.001. El parámetro se encuentra claramente por encima de 0, por lo que se rechaza H₀ y se obtiene evidencia a favor de H₁: existe sobredispersión importante y Poisson no representa adecuadamente toda la variabilidad de los conteos.

Esta decisión es coherente con el índice de dispersión de Pearson obtenido en el análisis Poisson (Pearson/df = 1.9526), que ya indicaba casi el doble de variabilidad de la esperada bajo equidispersión.

4.0.2.3 2.3. Hipótesis global de los predictores

De forma complementaria, puede plantearse H₀: β₁ = β₂ = … = β₈ = 0, es decir, Agente, Tratamiento, Dosis_mgkg, Edad y Tiempo_Atencion_h no mejoran el modelo respecto al modelo nulo. La alternativa es que al menos un βᵢ sea distinto de 0.

El modelo reportó LLR p < 0.001, por lo que se rechaza esta hipótesis nula global y se concluye que, en conjunto, los predictores aportan información estadísticamente significativa sobre el número esperado de eventos.

4.0.2.4 2.4. Aclaración sobre el AIC

El AIC no se interpreta mediante H₀ y H₁. Es un criterio de selección de modelos: entre modelos comparables ajustados a los mismos datos, se prefiere el que presenta menor AIC. En este caso, la binomial negativa tuvo un AIC mucho menor que Poisson, lo que refuerza la elección del modelo con sobredispersión.

4.0.3 3. ¿Por qué utilizar una binomial negativa?

Poisson es un punto de partida apropiado para variables de conteo, pero supone que la varianza condicional es aproximadamente igual a la media. Cuando la variabilidad observada supera claramente esa expectativa aparece sobredispersión. La binomial negativa incorpora un parámetro adicional, alpha (α), que permite modelar esa variabilidad extra.

Forma conceptual de la varianza: Var(Y|X) = μ + αμ².

Si α se aproxima a 0, el comportamiento se acerca al modelo Poisson. Valores claramente mayores que 0 indican sobredispersión y favorecen el uso de la binomial negativa.

4.0.4 4. Evidencia previa de sobredispersión

Indicador Resultado Interpretación
Pearson χ² / df (Poisson) 1.9526 Casi el doble de 1; sobredispersión importante
Supuesto Poisson Varianza ≈ media No se cumple adecuadamente
Decisión Ajustar binomial negativa Modelo más flexible para conteos sobredispersos

4.0.5 5. Resultado general del modelo binomial negativo

El modelo se ajustó con 500,000 observaciones mediante máxima verosimilitud y convergió correctamente.

Indicador Resultado
n 500,000
Df Model 8
Df Residuals 499,991
Log-Likelihood −720,080 aproximadamente
LL-Null −731,950 aproximadamente
Pseudo R² 0.01622
LLR p-value < 0.001
Convergencia

El valor LLR p < 0.001 indica que el conjunto de predictores mejora significativamente el ajuste respecto al modelo nulo. El pseudo R² es un indicador complementario y no debe interpretarse como porcentaje directo de varianza explicada.

4.0.6 6. Parámetro de sobredispersión α

α = 0.8520

IC95% ≈ 0.844–0.860; p < 0.001.

El parámetro α es claramente mayor que 0, por lo que confirma la presencia de sobredispersión. Este resultado coincide con el índice de dispersión de Pearson del modelo Poisson y proporciona una justificación formal para preferir la binomial negativa.

α es un parámetro estadístico de dispersión; no es una medida de toxicidad ni una magnitud clínica.

4.0.7 7. Comparación de modelos mediante AIC

Modelo AIC Conclusión
Poisson 1,559,962.38 Peor ajuste relativo
Binomial negativa 1,440,183.29 Mejor ajuste relativo

ΔAIC = 119,779.09

El AIC premia el ajuste y penaliza la complejidad. Valores menores indican mejor equilibrio entre ambos. La reducción de aproximadamente 119,779 unidades es enorme y constituye evidencia contundente a favor de la binomial negativa.

4.0.8 8. Visualización de la comparación Poisson vs binomial negativa

Comparación de AIC entre Poisson y binomial negativa.

Comparación de AIC entre Poisson y binomial negativa.

Figura 1. Comparación de AIC entre Poisson y binomial negativa.

La figura muestra de forma directa que el AIC de la binomial negativa es sustancialmente menor que el de Poisson. Por tanto, la binomial negativa representa mejor los datos de conteo simulados.

4.0.9 9. IRR del modelo binomial negativo

Predictor IRR IC95.. p Interpretación
Escorpión vs Araña 1.1303 1.1176–1.1432 <0.001 13.0 % más eventos esperados
Himenóptero vs Araña 0.9277 0.9164–0.9392 <0.001 7.2 % menos eventos esperados
Ofídico vs Araña 1.3918 1.3773–1.4064 <0.001 39.2 % más eventos esperados
Antiveneno + Soporte vs Antiveneno 0.9039 0.8957–0.9122 <0.001 9.6 % menos eventos esperados
Soporte vs Antiveneno 1.3565 1.3444–1.3688 <0.001 35.7 % más eventos esperados
Dosis_mgkg (por 1 mg/kg) 1.1983 1.1931–1.2035 <0.001 19.8 % más eventos esperados
Edad (por año) 1.0031 1.0029–1.0033 <0.001 0.31 % más eventos esperados
Tiempo_Atencion_h (por hora) 1.0242 1.0228–1.0256 <0.001 2.42 % más eventos esperados

4.0.10 10. Interpretación de los principales predictores

Ofídico

IRR = 1.3918 (IC95 %: 1.3773–1.4064; p < 0.001). Los casos ofídicos presentaron aproximadamente 39.2 % más eventos esperados que los asociados con Araña, manteniendo constantes las demás variables.

Soporte

IRR = 1.3565 (IC95 %: 1.3444–1.3688; p < 0.001). Soporte presentó aproximadamente 35.7 % más eventos esperados que Antiveneno, controlando por agente, dosis, edad y tiempo hasta la atención.

Dosis

IRR = 1.1983 (IC95 %: 1.1931–1.2035; p < 0.001). Cada incremento de 1 mg/kg se asoció con aproximadamente 19.8 % más eventos esperados.

Escorpión

IRR = 1.1303 (IC95 %: 1.1176–1.1432; p < 0.001). Escorpión presentó aproximadamente 13.0 % más eventos esperados que Araña.

Antiveneno + Soporte

IRR = 0.9039 (IC95 %: 0.8957–0.9122; p < 0.001). El esquema combinado se asoció con aproximadamente 9.6 % menos eventos esperados que Antiveneno solo.

Himenóptero

IRR = 0.9277 (IC95 %: 0.9164–0.9392; p < 0.001). Himenóptero presentó aproximadamente 7.2 % menos eventos esperados que Araña.

Edad

IRR = 1.0031. Cada año adicional se asoció con aproximadamente 0.31 % más eventos esperados. El efecto por unidad es pequeño pese a su significancia estadística.

Tiempo hasta la atención

IRR = 1.0242 (IC95 %: 1.0228–1.0256; p < 0.001). Cada hora adicional se asoció con aproximadamente 2.42 % más eventos esperados.

4.0.11 11. Estabilidad de los IRR: Poisson vs binomial negativa

Predictor IRR.Poisson IRR.binomial.negativa
Escorpión 1.1308 1.1303
Himenóptero 0.9276 0.9277
Ofídico 1.3914 1.3918
Antiveneno + Soporte 0.9034 0.9039
Soporte 1.3556 1.3565
Dosis 1.1980 1.1983
Edad 1.0031 1.0031
Tiempo de atención 1.0241 1.0242

Los IRR cambian muy poco entre modelos. Esto indica que la estructura de la media estaba bien captada por Poisson. El problema principal estaba en la varianza: Poisson subestimaba la heterogeneidad, mientras que la binomial negativa la incorpora mediante α.

4.0.12 12. ¿Por qué preferir la binomial negativa si los IRR son similares?

La principal diferencia aparece en la estimación de la incertidumbre. Con sobredispersión, Poisson tiende a producir errores estándar demasiado pequeños. La binomial negativa reconoce la variabilidad adicional, por lo que sus errores estándar son mayores y más realistas. Esto mejora la validez de los intervalos de confianza y de las pruebas de significancia.

4.0.13 13. Comparación conceptual de los modelos

Característica Poisson Binomial.negativa
Variable respuesta Conteo Conteo
Función de enlace Log Log
Relación media-varianza Var ≈ media Var puede ser > media
Sobredispersión No la modela adecuadamente Sí la modela
Pearson/df 1.9526 Motiva el cambio
α No estimado 0.852
AIC 1,559,962.38 1,440,183.29
Modelo preferido No

4.0.14 14. Interpretación toxinológica

Dentro del escenario simulado, el número esperado de eventos se relacionó con características del agente, de la exposición y del manejo. Los casos ofídicos presentaron la mayor tasa esperada de eventos entre los contrastes de agentes; mayores dosis y mayores tiempos hasta la atención se asociaron con incrementos del conteo esperado. Antiveneno + Soporte se asoció con menos eventos esperados que Antiveneno, mientras que Soporte se asoció con más eventos.

La sobredispersión indica que existe heterogeneidad adicional no representada por Poisson. En datos reales, una variabilidad de este tipo podría relacionarse con diferencias individuales, gravedad, comorbilidades, especies, composición del veneno u otros factores no medidos. En esta actividad, sin embargo, se trata de una característica deliberada de la simulación y no de evidencia clínica real.

4.0.15 15. Interpretación estadística integrada

El GLM binomial negativo presentó un ajuste sustancialmente superior al Poisson. El parámetro de dispersión fue α = 0.852 (IC95 %: aproximadamente 0.844–0.860; p < 0.001), confirmando sobredispersión. El AIC disminuyó de 1,559,962.38 en Poisson a 1,440,183.29 en binomial negativa, una reducción de 119,779.09 unidades. Las asociaciones fueron estables: Ofídico presentó aproximadamente 39.2 % más eventos esperados que Araña (IRR = 1.392; IC95 %: 1.377–1.406), Soporte 35.7 % más que Antiveneno (IRR = 1.357; IC95 %: 1.344–1.369), y cada incremento de 1 mg/kg en dosis se asoció con aproximadamente 19.8 % más eventos esperados (IRR = 1.198; IC95 %: 1.193–1.204).

4.0.16 16. Respuesta directa a la pregunta de investigación

Respuesta: No. Poisson no describe adecuadamente el número de eventos observados porque presentó sobredispersión importante (Pearson/df = 1.9526). La binomial negativa estimó α = 0.852 y redujo el AIC de 1,559,962.38 a 1,440,183.29. Por tanto, la binomial negativa representa sustancialmente mejor los datos de conteo simulados y debe preferirse frente a Poisson.

4.0.17 17. Conclusión formal

La comparación entre modelos confirmó que la distribución de Poisson no representa adecuadamente la variabilidad del número de eventos toxinológicos simulados. La sobredispersión detectada previamente fue corroborada mediante un parámetro α = 0.852 (p < 0.001). La binomial negativa presentó un AIC de 1,440,183.29 frente a 1,559,962.38 para Poisson, con una reducción de aproximadamente 119,779 unidades, demostrando un ajuste sustancialmente superior. Los IRR permanecieron muy similares entre ambos modelos, pero la binomial negativa incorpora de manera adecuada la heterogeneidad adicional y proporciona errores estándar más realistas. En consecuencia, el GLM binomial negativo constituye el modelo preferido para analizar el número de eventos en esta base simulada.

4.0.18 18. Preguntas para discusión entre compañeros

  • ¿Cuál es la hipótesis nula sobre α y qué resultado permite rechazarla?
  • ¿Qué significa sobredispersión en un modelo de conteo?
  • ¿Por qué α = 0.852 favorece la binomial negativa?
  • ¿Qué significa que el AIC sea menor?
  • ¿Por qué una diferencia de AIC de casi 120,000 unidades es contundente?
  • ¿Por qué los IRR pueden ser casi idénticos y, aun así, la binomial negativa ser preferible?
  • ¿Qué problema ocasiona Poisson cuando subestima los errores estándar?
  • ¿Cuál es la diferencia entre modelar la media y modelar adecuadamente la varianza?
  • ¿Qué predictores presentan los mayores IRR en la binomial negativa?
  • ¿Por qué α no debe interpretarse como una medida toxinológica?
  • ¿Cuál sería la conclusión directa ante la pregunta “¿Poisson describe adecuadamente los eventos observados?”?

Link del video: https://drive.google.com/file/d/13KLB6q7sVBzzTy5wv-kHL7ePPWkDAcx4/view?usp=drive_link


5 ANÁLISIS 5 – GLMM BINOMIAL

Base toxinológica simulada, n = 500,000 casos. Los resultados son exclusivamente académicos y no representan estimaciones clínicas ni epidemiológicas reales de Panamá.

5.0.1 1. Pregunta de investigación

¿Existe variabilidad entre provincias en la probabilidad de presentar eventos adversos?

La variable respuesta es Evento_Adverso, codificada como 0 = no presentó evento adverso y 1 = presentó evento adverso. El análisis incorpora simultáneamente predictores individuales y un efecto aleatorio para Provincia, por lo que corresponde a un modelo lineal generalizado mixto (GLMM) binomial con enlace logit.

5.0.2 2. Estructura del modelo y variables

Variable Rol Tipo Interpretación
Evento_Adverso Respuesta Binaria (0/1) Presencia o ausencia de evento adverso
Agente Efecto fijo Cualitativa nominal Agente toxinológico
Tratamiento Efecto fijo Cualitativa nominal Tratamiento administrado
Dosis_mgkg Efecto fijo Cuantitativa continua Dosis estimada por kg
Edad Efecto fijo Cuantitativa Edad en años
Tiempo_Atencion_h Efecto fijo Cuantitativa continua Horas hasta recibir atención
Provincia Efecto aleatorio Cualitativa nominal / agrupamiento Captura heterogeneidad territorial no explicada por los efectos fijos

Forma conceptual del modelo: logit[P(Evento_Adverso = 1)] = β0 + β1X1 + … + βkXk + uj, donde uj representa la desviación aleatoria de la provincia j respecto al intercepto general.

5.0.3 3. ¿Por qué utilizar un GLMM binomial?

El GLM binomial convencional del Análisis 2 asume que, una vez incluidos los predictores, todas las observaciones son independientes. Sin embargo, los casos están agrupados por provincia y pueden compartir características territoriales. El GLMM permite reconocer esta estructura jerárquica mediante un intercepto aleatorio por Provincia: (1 | Provincia).

El valor agregado del GLMM no es únicamente volver a estimar los odds ratios, sino cuantificar cuánto de la heterogeneidad residual se encuentra entre provincias y evaluar si las asociaciones individuales se mantienen después de considerar ese agrupamiento.

5.0.4 4. Planteamiento de hipótesis

Hipótesis principal sobre el componente aleatorio provincial:

H0: σ²Provincia = 0. No existe variabilidad residual entre provincias en la propensión a presentar eventos adversos una vez ajustados los efectos fijos.

H1: σ²Provincia > 0. Existe variabilidad residual entre provincias en la propensión a presentar eventos adversos después de ajustar por agente, tratamiento, dosis, edad y tiempo hasta la atención.

Hipótesis para cada efecto fijo: H0: βi = 0 (OR = 1) frente a H1: βi ≠ 0 (OR ≠ 1).

Precisión metodológica: el modelo exploratorio en Python se ajustó mediante BinomialBayesMixedGLM con aproximación variacional bayesiana. Por ello, la salida presenta medias y desviaciones posteriores, no valores p frequentistas para el componente aleatorio. La evidencia de heterogeneidad provincial se interpreta a partir de la distribución posterior de la desviación estándar y del ICC. Para la entrega oficial en R, conviene ajustar glmer() y, si se desea una prueba formal del componente aleatorio, comparar modelos de manera apropiada.

5.0.5 5. Resultado general del GLMM

El modelo se ajustó con los 500,000 casos. Los efectos fijos se estimaron sobre la escala logit y Provincia se incorporó como intercepto aleatorio. La salida de Python reportó una media posterior del logaritmo de la desviación estándar provincial de -1.2580, equivalente a una desviación estándar de 0.284.

Indicador Resultado
Casos 500,000
SD del efecto aleatorio Provincia 0.2842
Intervalo posterior aprox. de SD 0.179–0.453
Varianza provincial 0.0808
ICC aproximado 0.0240 (2.4 %)

5.0.6 6. Interpretación del efecto aleatorio Provincia

La desviación estándar del efecto aleatorio fue 0.2842 en la escala de log-odds, con una varianza aproximada de 0.0808. Esto indica que las provincias presentan diferencias residuales en su intercepto, aun después de considerar los efectos fijos del modelo.

Interpretación intuitiva de la SD: una provincia situada aproximadamente una desviación estándar por encima del promedio tendría un factor de odds territorial cercano a exp(0.284) ≈ 1.33; una provincia una desviación por debajo, exp(-0.284) ≈ 0.75. Esto ilustra la heterogeneidad territorial en la escala del logit, no un efecto causal de la provincia.

5.0.7 7. Coeficiente de correlación intraclase (ICC)

Para un GLMM logístico, el ICC puede aproximarse mediante: ICC = σ²Provincia / (σ²Provincia + π²/3). Con σ²Provincia = 0.0808, se obtuvo ICC ≈ 0.0240.

Interpretación: aproximadamente 2.4 % de la variabilidad residual en la propensión latente a presentar eventos adversos se atribuye a diferencias entre provincias; la mayor parte de la heterogeneidad permanece a nivel individual dentro de las provincias.

No debe afirmarse que “Provincia explica 2.4 % de la probabilidad”. El ICC se refiere al agrupamiento de la variabilidad en una escala latente logística.

5.0.8 8. Eventos adversos observados por provincia

Provincia Casos Eventos Porcentaje
Bocas del Toro 50,029 8,176 16.343 %
Chiriquí 50,044 8,858 17.700 %
Coclé 49,646 14,241 28.685 %
Colón 49,972 8,976 17.962 %
Darién 50,356 9,794 19.450 %
Herrera 50,123 7,147 14.259 %
Los Santos 49,657 9,160 18.447 %
Panamá 49,889 7,047 14.125 %
Panamá Oeste 50,180 9,177 18.288 %
Veraguas 50,104 8,486 16.937 %

La mayor proporción cruda de eventos adversos se observó en Coclé (28.69 %) y la menor en Panamá (14.13 %), una diferencia aproximada de 14.56 puntos porcentuales. Estas proporciones son descriptivas y no ajustadas; no deben interpretarse como efectos causales de vivir en una provincia determinada.

Proporción cruda de eventos adversos por provincia.

Proporción cruda de eventos adversos por provincia.

Figura 1. Proporción cruda de eventos adversos por provincia.

El gráfico evidencia heterogeneidad descriptiva entre provincias. Sin embargo, el GLMM es el análisis apropiado para cuantificar el componente provincial después de ajustar por agente, tratamiento, dosis, edad y tiempo hasta la atención.

5.0.9 9. Efectos fijos: odds ratios ajustados

Predictor OR Intervalo.posterior.aprox..95.. Interpretación
Escorpión vs Araña 1.2074 1.1896–1.2255 20.7 % mayores odds
Himenóptero vs Araña 0.9001 0.8838–0.9167 10.0 % menores odds
Ofídico vs Araña 1.6541 1.6351–1.6734 65.4 % mayores odds
Antiveneno + Soporte vs Antiveneno 0.8161 0.8049–0.8275 18.4 % menores odds
Soporte vs Antiveneno 1.8132 1.7917–1.8350 81.3 % mayores odds
Dosis_mgkg (+1 mg/kg) 1.5161 1.5096–1.5226 51.6 % mayores odds
Edad (+1 año) 1.0120 1.0119–1.0122 1.20 % mayores odds
Tiempo_Atencion_h (+1 h) 1.1031 1.1015–1.1047 10.3 % mayores odds

5.0.10 10. Interpretación de los principales efectos fijos

Agente ofídico

OR = 1.6541. Después de ajustar por tratamiento, dosis, edad, tiempo hasta la atención y heterogeneidad provincial, los casos ofídicos presentaron aproximadamente 65.4 % mayores odds de evento adverso que los casos asociados con Araña.

Escorpión

OR = 1.2074. Los casos asociados con Escorpión presentaron aproximadamente 20.7 % mayores odds que los asociados con Araña, considerando también el agrupamiento por provincia.

Himenóptero

OR = 0.9001. Los casos asociados con Himenóptero presentaron aproximadamente 10.0 % menores odds respecto a Araña.

Antiveneno + Soporte

OR = 0.8161. El tratamiento combinado se asoció con aproximadamente 18.4 % menores odds de evento adverso que Antiveneno solo, después del ajuste individual y provincial.

Soporte

OR = 1.8132. Soporte presentó aproximadamente 81.3 % mayores odds que Antiveneno, siendo uno de los efectos de mayor magnitud del modelo.

Dosis

OR = 1.5161. Cada incremento de 1 mg/kg se asoció con aproximadamente 51.6 % mayores odds de evento adverso, aun después de considerar la variación entre provincias.

Edad

OR = 1.0120. Cada año adicional se asoció con aproximadamente 1.2 % mayores odds; el efecto por unidad es pequeño.

Tiempo hasta la atención

OR = 1.1031. Cada hora adicional hasta recibir atención se asoció con aproximadamente 10.3 % mayores odds de evento adverso.

5.0.11 11. Comparación GLM binomial vs GLMM binomial

Predictor GLM.binomial.OR GLMM.binomial.OR
Escorpión 1.2045 1.2074
Himenóptero 0.9007 0.9001
Ofídico 1.6429 1.6541
Antiveneno + Soporte 0.8187 0.8161
Soporte 1.8057 1.8132
Dosis 1.5073 1.5161
Edad 1.0119 1.0120
Tiempo de atención 1.1017 1.1031

Los OR son prácticamente iguales en ambos modelos. Esto indica que las conclusiones sobre los efectos fijos son estables al incorporar Provincia como efecto aleatorio. La principal información adicional del GLMM es la cuantificación de la heterogeneidad territorial mediante SD, varianza e ICC.

5.0.12 12. Supuestos y aspectos diagnósticos

Aspecto Situación Comentario
Respuesta binaria Cumplido Evento_Adverso está codificado 0/1.
Agrupamiento Cumplido Los casos están agrupados por Provincia.
Independencia entre grupos Asumida por diseño Se asume independencia entre provincias; dentro de provincia se modela correlación mediante el efecto aleatorio.
Distribución del efecto aleatorio Asumida El intercepto aleatorio se modela con distribución aproximadamente normal en la escala logit.
Linealidad en el logit Conviene revisar Para Dosis, Edad y Tiempo_Atencion_h.
Multicolinealidad Conviene revisar Puede evaluarse mediante VIF de los efectos fijos.
Tamaño de grupos Adecuado Cada provincia contiene alrededor de 50,000 casos en la simulación.

5.0.13 13. Interpretación toxinológica y de salud pública

Dentro del escenario simulado, la ocurrencia de eventos adversos no depende exclusivamente de características individuales y de la exposición; también existe cierto grado de heterogeneidad territorial. El ICC de 2.4 % indica que el componente provincial es real en la simulación, aunque modesto frente a la variabilidad individual.

En datos reales, una señal territorial de este tipo podría motivar hipótesis relacionadas con acceso a los servicios, tiempo de traslado, disponibilidad de antivenenos, distribución de agentes toxinológicos, condiciones ambientales o diferencias en capacidad de respuesta sanitaria. Estas posibilidades no pueden inferirse de esta base simulada y deben presentarse solamente como líneas hipotéticas para futuras investigaciones.

5.0.14 14. Respuesta directa a la pregunta de investigación

Respuesta: Sí. El GLMM binomial identificó un componente de variabilidad entre provincias, con SD del efecto aleatorio = 0.2842, varianza = 0.0808 e ICC aproximado = 0.0240. Esto indica que alrededor de 2.4 % de la variabilidad residual en la propensión latente a presentar eventos adversos corresponde al nivel provincial. El efecto existe, pero es relativamente pequeño frente a la heterogeneidad individual.

5.0.15 15. Conclusión formal

El GLMM binomial evidenció heterogeneidad entre provincias en la ocurrencia de eventos adversos dentro de la base simulada. El efecto aleatorio de Provincia presentó una desviación estándar de 0.284 y una varianza estimada de 0.081, con un ICC aproximado de 0.024. Esto indica que aproximadamente 2.4 % de la variabilidad residual latente en la propensión a presentar eventos adversos puede atribuirse al nivel provincial. Los efectos fijos se mantuvieron consistentes con el GLM binomial convencional: los casos ofídicos presentaron aproximadamente 65.4 % mayores odds que Araña (OR = 1.654), Soporte presentó aproximadamente 81.3 % mayores odds que Antiveneno (OR = 1.813), y cada incremento de 1 mg/kg en la dosis se asoció con aproximadamente 51.6 % mayores odds (OR = 1.516). En consecuencia, existe estructura territorial, aunque de magnitud baja, y las principales asociaciones individuales permanecen estables después de considerar el agrupamiento por provincia.

5.0.16 16. Preguntas para discusión entre compañeros

  • ¿Qué diferencia conceptual existe entre un GLM binomial y un GLMM binomial?
  • ¿Qué significa incluir (1 | Provincia) en el modelo?
  • ¿Cuál es la hipótesis nula asociada con el efecto aleatorio provincial?
  • ¿Qué representa una SD provincial de 0.284 en la escala logit?
  • ¿Cómo debe interpretarse un ICC de 0.024?
  • ¿Por qué no es correcto decir que Provincia “explica 2.4 % de la probabilidad”?
  • ¿Por qué las proporciones crudas por provincia no deben confundirse con efectos ajustados?
  • ¿Qué significa que los OR del GLM y del GLMM sean casi iguales?
  • ¿Qué aporta el GLMM aunque las asociaciones fijas cambien muy poco?
  • ¿Por qué debemos distinguir la salida bayesiana exploratoria de Python de la salida frequentista que obtendremos en R?

Link del video: https://drive.google.com/file/d/17v-QoWzdkZr-pNfNSkdzTOeZAscRsYv2/view?usp=drive_link