Introducción

Contexto del estudio

La venómica animal es un campo de investigación en expansión con relevancia evolutiva y biotecnológica. Bases de datos especializadas y curadas como Tox-Prot permiten estudiar cómo ha evolucionado el conocimiento disponible sobre proteínas y péptidos asociados a los venenos.

Kirchhoff et al. (2026) analizaron esta evolución durante 21 años, comparando versiones de Tox-Prot entre 2005 y 2025.

Pregunta de investigación general

¿Cómo han cambiado el crecimiento, la diversidad y la representación de los datos de venenos contenidos en Tox-Prot entre 2005 y 2025, y qué limitaciones o sesgos persisten?

Objetivo general

Analizar cuantitativamente la evolución, diversidad y representación de los datos de venómica curados en Tox-Prot entre 2005 y 2025, identificando tendencias y posibles sesgos en su composición.

Diseño metodológico del estudio

El flujo metodológico resume la obtención y procesamiento de los datos de Tox-Prot, así como los principales bloques analíticos desarrollados en el estudio.

Flujo metodológico del estudio

Datos y estrategia de reproducción

Fuente y unidad de análisis

  • Fuente: repositorio y pipeline de Kirchhoff et al. (2026).
  • Base de datos: UniProt/Tox-Prot.
  • Unidad de análisis: cada entrada de proteína o péptido incluida en los conjuntos venom_tissue.
  • Tox-Prot 2025: 7.418 entradas bajo esta definición.
Detalles sobre la fuente de datos

Los datos y el código utilizados para la reproducción se obtuvieron del repositorio de Kirchhoff et al. (2026). El repositorio contiene el código fuente y la documentación necesarios para reproducir el procesamiento de los datos y los distintos análisis presentados en el estudio.

El flujo incluye la extracción y transformación de los datos de UniProt/Tox-Prot, así como los scripts utilizados para generar los análisis y visualizaciones.

Variables principales

Variable Tipo Utilización
Versión/año de Tox-Prot Categórica ordinal Comparación temporal: 2005, 2015 y 2025
Identificador de proteína Identificadora Distinguir cada entrada
Taxón Categórica nominal Analizar la representación taxonómica
Familia proteica Categórica nominal Etiquetar y comparar agrupamientos
Secuencia de aminoácidos Secuencia biológica Generar las representaciones ProtT5
Fragmento Categórica dicotómica Incluir/excluir secuencias incompletas
Péptido señal Anotación de secuencia Construir variantes maduras
Propéptido Anotación de secuencia Construir variantes activas
Embedding ProtT5* Numérica multivariada Representar computacionalmente las secuencias
Coordenadas UMAP* Numéricas continuas Visualizar el espacio de embeddings
Coeficiente silhouette* Numérica continua Evaluar la separación de las familias

Los embeddings ProtT5, las coordenadas UMAP y el coeficiente silhouette son representaciones o medidas derivadas durante el análisis; no corresponden a variables originales de Tox-Prot.

Procesamiento de los datos

Flujo general: XML de UniProt → TSV → limpieza y preparación → análisis descriptivos / ProtSpace

  • El XML original de UniProt se transformó a formato TSV.
  • El TSV 2025 generado contenía 8.055 entradas y 32 variables antes de los filtros posteriores.
  • Para ProtSpace se prepararon cinco variantes según la eliminación del péptido señal, el propéptido y los fragmentos.
Ver explicación ampliada del procesamiento

Para reproducir los análisis se utilizó el pipeline disponible en el repositorio del estudio. Los datos originales de UniProt en formato XML fueron transformados a un archivo tabular TSV mediante el parser proporcionado por el proyecto.

Posteriormente, los datos fueron limpiados y preparados para los distintos análisis. Para ProtSpace se generaron diferentes versiones de las secuencias según la eliminación del péptido señal, del propéptido y de las entradas clasificadas como fragmentos.

Alcance de nuestra reproducción

No se buscó reproducir exhaustivamente todos los análisis del artículo.

Se reprodujeron resultados descriptivos generales y se seleccionaron dos análisis para profundizar:

  1. Representación taxonómica
  2. ProtSpace: ProtT5 + UMAP + silhouette

Los demás análisis se presentan únicamente como contexto del estudio.

Panorama de los análisis del artículo

Tema analizado Qué se examina principalmente Enfoque
Tendencias generales Evolución global de Tox-Prot Descriptivo/comparativo
Representación taxonómica Órdenes, familias, especies y hábitats Descriptivo/comparativo
Familias proteicas Abundancia y evolución de familias Descriptivo/comparativo
Longitud, evidencia y fragmentos Características de secuencia y evidencia Descriptivo/comparativo
Modificaciones postraduccionales Frecuencia y tipos de PTM Descriptivo/comparativo
Anotaciones funcionales Dosis tóxica y Gene Ontology Descriptivo/comparativo
ProtSpace Relaciones en el espacio de embeddings Multivariado exploratorio

Resultados descriptivos generales

Comparación 2005, 2015 y 2025

  • Entradas: 1.379 → 6.012 → 7.418
  • Aumentó la diversidad de especies, órdenes y familias proteicas.
  • El crecimiento no fue uniforme para todos los indicadores.
~/.local/bin/uv run toxprot analysis summary

Figura. Resumen descriptivo general de la evolución de Tox-Prot entre 2005, 2015 y 2025.

Interpretación ampliada del resumen descriptivo

Entre 2005 y 2025 se observa un crecimiento considerable del conjunto Tox-Prot analizado. Paralelamente aumentaron la diversidad de especies, órdenes taxonómicos y familias proteicas representadas.

Sin embargo, algunos indicadores no siguieron una tendencia estrictamente creciente en términos relativos, como la proporción de entradas clasificadas como fragmentos, las anotaciones de modificaciones postraduccionales y las anotaciones de dosis tóxica.

Análisis seleccionado 1. Representación taxonómica

Pregunta y objetivo

Pregunta

¿Cómo ha cambiado la representación taxonómica de los organismos venenosos incluidos en Tox-Prot entre 2005 y 2025?

Objetivo

Describir y comparar los cambios en los grupos taxonómicos representados, identificando cuáles aumentaron, disminuyeron, aparecieron o desaparecieron.

Variables analizadas

  • Año o versión de Tox-Prot
  • Orden taxonómico
  • Familia taxonómica
  • Especie
  • Número de entradas
Ver clasificación de las variables
Variable Tipo Función
Año o versión Categórica ordinal Comparación temporal
Orden Categórica nominal Agrupación taxonómica
Familia Categórica nominal Comparación a nivel más específico
Especie Categórica nominal Diversidad representada
Número de entradas Numérica discreta Cuantificar representación

Tipo de análisis

Descriptivo y comparativo.

  • Se comparan frecuencias y abundancias entre versiones de Tox-Prot.
  • Se estudian tendencias temporales y cambios de composición.
  • El análisis realizado por los autores tiene finalidad descriptiva y no incorpora contrastes inferenciales para evaluar formalmente las diferencias observadas.
¿Corresponde formular H0 y H1?

No se plantea un contraste formal de hipótesis nula (H0) y alternativa (H1).

Las comparaciones taxonómicas son descriptivas y no se aplica una prueba inferencial para determinar si las diferencias entre años son estadísticamente significativas.

Por ello, formular H0 y H1 como si se hubiese realizado una prueba de significación no sería apropiado.

Procedimiento

  • Comparación temporal de la representación taxonómica.
  • Identificación de los órdenes más representados.
  • Identificación de nuevos órdenes.
  • Visualización mediante tendencias y diagrama alluvial.

Código de reproducción

~/.local/bin/uv run toxprot analysis taxa

Resultados

Tendencias taxonómicas

Diversidad representada

  • Órdenes: 8 → 12 → 18
  • Especies: 257 → 568 → 760
  • Squamata se mantuvo como el orden con mayor representación.
  • También crecieron Araneae, Neogastropoda y Scorpiones.

Figura. Evolución del número de entradas correspondientes a los principales órdenes taxonómicos representados en Tox-Prot durante 2005–2025.

Interpretación de las tendencias temporales

El crecimiento no fue uniforme entre los distintos grupos. Squamata se mantuvo como el orden con mayor representación durante todo el período, pasando de 593 entradas en 2005 a 2.440 en 2025.

Araneae experimentó un incremento marcado alrededor de 2011. Neogastropoda presentó un crecimiento importante durante los primeros años de la década de 2010, mientras que Scorpiones mostró una trayectoria más gradual.

Incorporación de nuevos órdenes

Figura. Evolución de la representación de los órdenes taxonómicos en Tox-Prot entre 2005, 2015 y 2025.

Principales observaciones

  • Se incorporaron nuevos grupos taxonómicos.
  • Entre ellos aparecen Scolopendromorpha, Lepidoptera, Batrachoidiformes, Blenniiformes, Myliobatiformes, Nectiopoda y Phyllodocida.
  • Los cambios no fueron estrictamente acumulativos: Anura aparece en 2015 pero no en 2005 ni 2025.

Interpretación

  • Tox-Prot amplió considerablemente su cobertura taxonómica.
  • La diversificación no fue uniforme.
  • Un número reducido de órdenes continúa concentrando gran parte de las entradas.
  • La frecuencia en Tox-Prot no equivale directamente a abundancia o diversidad en la naturaleza.
  • La composición de la base también refleja el esfuerzo de investigación y la disponibilidad de información.
Interpretación ampliada

El crecimiento de Tox-Prot estuvo acompañado por una ampliación de su cobertura taxonómica, pero esta diversificación no implica una representación equilibrada de los organismos venenosos.

Los resultados muestran una fuerte concentración de entradas en unos pocos órdenes, principalmente Squamata, Araneae, Neogastropoda y Scorpiones.

Por ello, la representación de un grupo en Tox-Prot debe interpretarse como una combinación de diversidad biológica, esfuerzo de investigación, disponibilidad de muestras y grado de caracterización de las proteínas.

Análisis seleccionado 2. ProtSpace

Pregunta y objetivo

Pregunta

¿Los embeddings de ProtT5 permiten observar patrones de agrupamiento entre las principales familias proteicas de Tox-Prot y cómo influye el procesamiento de las secuencias?

Objetivo

Explorar las relaciones entre las principales familias de proteínas de veneno y evaluar cómo cinco variantes de procesamiento afectan su separación.

Flujo del análisis

Flujo del análisis:
Secuencia → ProtT5 → embedding → UMAP → silhouette → comparación de variantes

ProtT5 y embeddings

Idea esencial: ProtT5 transforma cada secuencia de aminoácidos en una representación numérica multidimensional (embedding).

  • No se comparan directamente las secuencias mediante alineamiento.
  • Proteínas cercanas en el espacio de embeddings presentan similitudes captadas por el modelo.
  • Esa proximidad no demuestra por sí sola que compartan la misma función biológica.
¿Qué es un embedding de ProtT5?

Los modelos de lenguaje de proteínas se entrenan con grandes cantidades de secuencias y permiten transformar cada secuencia en una representación numérica de muchas dimensiones.

Esta representación resume patrones presentes en la secuencia y facilita explorar relaciones que podrían no ser evidentes utilizando únicamente la clasificación taxonómica o la nomenclatura tradicional de las familias.

Cinco variantes de procesamiento

Variante Procesamiento
full Secuencia completa
mature Sin péptido señal
mature_clean Sin péptido señal + sin fragmentos
active Sin péptido señal ni propéptido
active_clean Sin péptido señal ni propéptido + sin fragmentos

UMAP

UMAP reduce los embeddings de muchas dimensiones a dos dimensiones para poder visualizarlos.

  • Cada punto representa una proteína.
  • Permite explorar agrupamientos y solapamientos.
  • Tiene una finalidad principalmente exploratoria.
¿Qué hace UMAP y qué no demuestra?

UMAP (Uniform Manifold Approximation and Projection) es una técnica de reducción de dimensionalidad.

La representación bidimensional facilita observar si las proteínas pertenecientes a una misma familia tienden a ocupar regiones similares del espacio.

Sin embargo, UMAP no constituye una prueba estadística. La existencia visual de grupos no demuestra por sí sola diferencias estadísticamente significativas ni equivalencia funcional.

Parámetros utilizados

  • n_neighbors = 50
  • min_dist = 0.5
  • métrica euclídea
  • random_state = 42

Silhouette

Silhouette evalúa cuánto se separan grupos previamente conocidos.

En este análisis las familias proteicas ya funcionan como etiquetas. Silhouette no crea los grupos: cuantifica hasta qué punto las proteínas de una misma familia aparecen próximas y separadas de otras familias.

  • Valores altos → mayor separación
  • Valores próximos a 0 → mayor solapamiento
  • Valores negativos → posible proximidad mayor a otro grupo
¿Corresponde formular H0 y H1?

No.

El coeficiente silhouette se empleó como una medida descriptiva de la separación de los grupos, no como una prueba de hipótesis.

Por tanto, no corresponde interpretar los valores mediante un valor p ni hablar de diferencias estadísticamente significativas entre las cinco variantes.

Procedimiento

  1. Selección de las diez familias proteicas más abundantes de Tox-Prot 2025.
  2. Generación de cinco variantes de las secuencias.
  3. Obtención de representaciones numéricas mediante ProtT5.
  4. Reducción de dimensionalidad mediante UMAP.
  5. Evaluación de las cinco variantes mediante silhouette.
  6. Selección de mature_clean para la visualización final.
  7. Interpretación de la distribución de las familias proteicas.

Código de reproducción

Preparación de las variantes y de los archivos intermedios necesarios para ProtSpace:

~/.local/bin/uv run toxprot analysis protspace prepare

Generación reproducible de la proyección UMAP de la variante mature_clean:

~/.local/bin/uv run toxprot analysis protspace run-umap \
  --variant mature_clean

Generación de la figura PNG a partir del parquetbundle producido por UMAP:

~/.local/bin/uv run python - <<'PY'
from pathlib import Path
import io

import matplotlib.pyplot as plt
import pyarrow.parquet as pq

from src.analysis.protspace.clustering_analyzer import (
    PARQUET_BUNDLE_DELIMITER
)

# ------------------------------------------------------------
# Archivos de entrada y salida
# ------------------------------------------------------------

bundle = Path(
    "data/processed/protspace/"
    "protspace_2025_mature_clean.parquetbundle"
)

out = Path(
    "figures/protspace_2025_mature_clean_umap.png"
)

# ------------------------------------------------------------
# Leer el parquetbundle
# ------------------------------------------------------------

parts = bundle.read_bytes().split(PARQUET_BUNDLE_DELIMITER)

# Parte 0: anotaciones de las proteínas
ann = (
    pq.ParquetFile(io.BytesIO(parts[0]))
    .read()
    .to_pandas()
)

# Parte 2: coordenadas de las proyecciones
coords = (
    pq.ParquetFile(io.BytesIO(parts[2]))
    .read()
    .to_pandas()
)

# ------------------------------------------------------------
# Seleccionar solamente la proyección UMAP
# ------------------------------------------------------------

umap = coords[
    coords["projection_name"].str.contains(
        "UMAP",
        case=False,
        na=False
    )
].copy()

# ------------------------------------------------------------
# Unir coordenadas con anotaciones
# ------------------------------------------------------------

df = umap.merge(
    ann,
    left_on="identifier",
    right_on="protein_id",
    how="inner"
)

# ------------------------------------------------------------
# Conservar únicamente las 10 familias principales
# ------------------------------------------------------------

families = df["Protein families"]

df = df[
    families.notna()
    & (families.astype(str) != "Other")
    & (families.astype(str).str.lower() != "nan")
].copy()

# ------------------------------------------------------------
# Comprobaciones
# ------------------------------------------------------------

print("Proteínas representadas:", len(df))
print(
    "Familias representadas:",
    df["Protein families"].nunique()
)

# ------------------------------------------------------------
# Generar la figura
# ------------------------------------------------------------

fig, ax = plt.subplots(figsize=(10, 8))

for family, group in df.groupby(
    "Protein families",
    sort=False
):
    ax.scatter(
        group["x"],
        group["y"],
        s=12,
        alpha=0.7,
        label=family
    )

ax.set_xlabel("UMAP 1")
ax.set_ylabel("UMAP 2")
ax.set_title(
    "ProtSpace 2025 — mature_clean"
)

ax.legend(
    title="Protein families",
    bbox_to_anchor=(1.02, 1),
    loc="upper left",
    fontsize=8
)

fig.tight_layout()

fig.savefig(
    out,
    dpi=300,
    bbox_inches="tight"
)

plt.close(fig)

print("Figura guardada en:", out)
PY

Cálculo reproducible de los coeficientes silhouette y generación de su figura comparativa:

~/.local/bin/uv run toxprot analysis protspace silhouette

Resultados de ProtSpace

Comparación de silhouette

Variante Artículo Reproducción
full 0.262 0.264
mature 0.397 0.470
mature_clean 0.474 0.546
active 0.382 0.438
active_clean 0.401 0.514

Resultado principal

  • mature_clean fue la mejor variante tanto en el artículo como en nuestra reproducción.
  • full presentó la menor separación en ambos casos.
  • El orden relativo de las cinco variantes se reprodujo.
  • Los valores absolutos no fueron idénticos.

Figura. Comparación de los coeficientes silhouette de las cinco variantes de procesamiento de ProtSpace.

Visualización UMAP de mature_clean

Figura. Proyección UMAP correspondiente a la variante mature_clean.

  • Se muestran 2.554 proteínas pertenecientes a las diez familias principales.
  • Algunas familias forman regiones bien diferenciadas.
  • Otras familias de toxinas peptídicas ocupan regiones más interconectadas.
Interpretación ampliada de ProtSpace

La reproducción confirma que el procesamiento previo de las secuencias influye en la separación observada entre las familias proteicas.

La eliminación del péptido señal incrementó el coeficiente silhouette y la exclusión adicional de fragmentos produjo el valor máximo. mature_clean fue la mejor variante tanto en el artículo como en nuestra reproducción.

La eliminación adicional del propéptido no produjo una mejora respecto a mature_clean, lo que sugiere que eliminar más regiones de una secuencia no necesariamente aumenta la capacidad de separación y puede eliminar información útil.

UMAP y silhouette aportan perspectivas complementarias: UMAP permite explorar visualmente la organización del espacio, mientras que silhouette proporciona una medida cuantitativa de la separación.

Estos resultados tienen carácter exploratorio y no constituyen una prueba inferencial de diferencias entre familias proteicas.

Evaluación de reproducibilidad

¿Qué sí se reprodujo?

  • Las cinco variantes pudieron regenerarse correctamente.
  • Se utilizaron los mismos parámetros UMAP declarados.
  • mature_clean volvió a ser la variante con mayor silhouette.
  • full volvió a ocupar la última posición.
  • Se conservó el mismo orden relativo de las cinco variantes.

¿Qué no fue idéntico?

Variante Artículo Reproducción
full 0.262 0.264
mature 0.397 0.470
mature_clean 0.474 0.546
active 0.382 0.438
active_clean 0.401 0.514

Conclusión de reproducibilidad: el resultado principal fue reproducible a nivel cualitativo y comparativo, pero no numéricamente idéntico.

Investigación de la discrepancia

Para investigar las diferencias se compararon los bundles históricos del repositorio con los bundles regenerados.

Se comprobó que, en las cinco variantes:

  • los identificadores de las proteínas eran los mismos;
  • aparecían en el mismo orden;
  • conservaban las mismas asignaciones de familia;
  • los parámetros UMAP declarados eran los mismos.

Sin embargo, las coordenadas UMAP regeneradas no fueron idénticas a las almacenadas en los bundles históricos.

Los silhouette calculados sobre esos bundles históricos fueron:

Variante Bundle histórico Regeneración actual
full 0.323 0.264
mature 0.474 0.470
mature_clean 0.572 0.546
active 0.412 0.438
active_clean 0.564 0.514

Por tanto, la discrepancia no puede explicarse simplemente por el uso de proteínas diferentes, familias diferentes o parámetros UMAP declarados diferentes.

Con las comprobaciones realizadas no fue posible establecer de manera concluyente la causa exacta. Podría depender de aspectos del entorno computacional o de la implementación utilizada para generar las proyecciones, pero demostrarlo requeriría una investigación adicional.

Discusión crítica

Evaluación estadística del estudio

¿Fueron adecuados los análisis realizados?

En términos generales, los análisis utilizados por Kirchhoff et al. (2026) son adecuados para describir la evolución y composición de Tox-Prot. El estudio utiliza principalmente frecuencias, porcentajes, comparaciones temporales y visualizaciones, junto con un análisis multivariado exploratorio mediante ProtSpace.

Este enfoque permite responder preguntas como:

  • ¿Cuánto creció Tox-Prot?
  • ¿Qué grupos taxonómicos están más representados?
  • ¿Cómo cambiaron las familias proteicas?
  • ¿Qué patrones aparecen en las representaciones multivariadas de las secuencias?

Sin embargo, varios resultados del artículo se interpretan más allá de la mera descripción. En esos casos, habría sido útil incorporar análisis inferenciales o modelos estadísticos adicionales.

Juicio estadístico

Los análisis son adecuados para describir y explorar, pero algunas conclusiones que van más allá de la descripción requieren herramientas estadísticas adicionales.

Fortalezas desde el punto de vista estadístico


Una fortaleza del estudio es que el tipo de análisis elegido coincide con buena parte de sus objetivos descriptivos. Para caracterizar la evolución de una base de datos, los conteos, porcentajes, distribuciones y visualizaciones son herramientas apropiadas.

También resulta adecuado separar diferentes dimensiones del problema —taxonomía, familias proteicas, características de secuencia y anotaciones— en lugar de resumir toda la evolución de Tox-Prot mediante un único indicador.

En ProtSpace, la comparación de cinco variantes de procesamiento mediante el coeficiente silhouette proporciona un criterio cuantitativo para evaluar cuál genera una mayor separación entre las familias proteicas. Por tanto, la selección de mature_clean no depende únicamente de una impresión visual del UMAP.

Estas decisiones fortalecen la coherencia entre las preguntas descriptivas y los análisis utilizados.


Limitaciones y análisis que podrían fortalecer las conclusiones


La principal limitación estadística es que el estudio depende en gran medida de análisis descriptivos. Esto es suficiente para mostrar patrones, pero no siempre permite evaluar formalmente si las diferencias observadas son mayores de lo esperable por variabilidad aleatoria o si las tendencias se mantienen bajo un modelo estadístico.

Algunas preguntas podrían haberse fortalecido con análisis adicionales:

  • Sobrerrepresentación taxonómica: una prueba de chi-cuadrado de bondad de ajuste permitiría comparar formalmente la distribución observada en Tox-Prot con una distribución esperada basada en la diversidad natural.
  • Distribución de longitudes: pruebas como Kolmogorov-Smirnov permitirían evaluar diferencias entre distribuciones completas; Mann-Whitney podría utilizarse si el interés se centra en diferencias de tendencia central sin asumir normalidad.
  • Tendencias temporales: modelos de regresión para datos de conteo, como Poisson o binomial negativa, permitirían estimar tasas de crecimiento e intervalos de confianza.
  • UMAP: un análisis de sensibilidad a distintos valores de n_neighbors y min_dist, así como la comparación con otras técnicas de reducción de dimensionalidad, permitiría evaluar la robustez de los patrones observados.


Precaución en la interpretación de los resultados


Precaución estadística

Las versiones de Tox-Prot correspondientes a 2005, 2015 y 2025 no constituyen muestras independientes, porque la base de datos es acumulativa.

Por ello, no sería apropiado aplicar directamente pruebas de independencia o comparaciones de proporciones tratando los tres cortes temporales como grupos independientes.

Una estrategia más adecuada sería analizar las nuevas entradas añadidas en cada intervalo, por ejemplo:

  • nuevas entradas entre 2005 y 2015;
  • nuevas entradas entre 2015 y 2025.

Esto permitiría estudiar cambios en la composición evitando, al menos parcialmente, el problema de dependencia entre versiones acumulativas.


Pertinencia de los análisis seleccionados


Los dos análisis reproducidos son pertinentes porque responden a preguntas diferentes y complementarias.

El análisis taxonómico permite describir cómo ha cambiado la composición de Tox-Prot y detectar posibles sesgos de representación. Sin embargo, al ser descriptivo, no permite establecer formalmente si la distribución observada difiere significativamente de una distribución esperada.

ProtSpace permite explorar relaciones multivariadas entre proteínas y comparar distintas estrategias de procesamiento mediante silhouette. Este análisis es adecuado como herramienta exploratoria, pero no debe interpretarse como una prueba inferencial de diferencias funcionales entre familias.

Por tanto, los análisis utilizados son apropiados para explorar y describir los patrones principales del estudio, aunque algunas conclusiones podrían fortalecerse mediante pruebas inferenciales, modelos de tendencia y análisis de sensibilidad.


Conclusiones

Conclusión principal

Los análisis de Kirchhoff et al. (2026) son adecuados para describir y explorar la evolución de Tox-Prot, pero algunos no permiten por sí solos realizar inferencias estadísticas sobre los patrones observados.

  • Análisis descriptivos: adecuados para caracterizar el crecimiento, la composición y la representación de Tox-Prot.

  • Representación taxonómica: la sobre- o infrarrepresentación podría evaluarse formalmente mediante una prueba de chi-cuadrado de bondad de ajuste.

  • Tendencias temporales: podrían fortalecerse mediante modelos para datos de conteo, como Poisson o binomial negativa, considerando que Tox-Prot es una base acumulativa.

  • ProtSpace: UMAP y silhouette son pertinentes como herramientas exploratorias y comparativas, pero no constituyen pruebas inferenciales de diferencias funcionales.

  • Robustez: la reproducción conservó el orden relativo de las cinco variantes, aunque no los valores numéricos exactos, lo que apoya la conveniencia de realizar análisis de sensibilidad.

En síntesis: incorporar pruebas inferenciales, modelos de tendencia y análisis de sensibilidad permitiría respaldar con mayor rigor aquellas conclusiones que van más allá de la descripción.