La venómica animal es un campo de investigación en expansión con relevancia evolutiva y biotecnológica. Bases de datos especializadas y curadas como Tox-Prot permiten estudiar cómo ha evolucionado el conocimiento disponible sobre proteínas y péptidos asociados a los venenos.
Kirchhoff et al. (2026) analizaron esta evolución durante 21 años, comparando versiones de Tox-Prot entre 2005 y 2025.
Pregunta general
¿Cómo han cambiado el crecimiento, la diversidad y la representación de los datos de venenos contenidos en Tox-Prot entre 2005 y 2025, y qué limitaciones o sesgos persisten?
Objetivo general
Analizar cuantitativamente la evolución, diversidad y representación de los datos de venómica curados en Tox-Prot entre 2005 y 2025, identificando tendencias y posibles sesgos en su composición.
El flujo metodológico resume la obtención y procesamiento de los datos de Tox-Prot, así como los principales bloques analíticos desarrollados en el estudio.
venom_tissue.Los datos y el código utilizados para la reproducción se obtuvieron del repositorio de Kirchhoff et al. (2026). El repositorio contiene el código fuente y la documentación necesarios para reproducir el procesamiento de los datos y los distintos análisis presentados en el estudio.
El flujo incluye la extracción y transformación de los datos de UniProt/Tox-Prot, así como los scripts utilizados para generar los análisis y visualizaciones.
| Variable | Tipo | Utilización |
|---|---|---|
| Versión/año de Tox-Prot | Categórica ordinal | Comparación temporal: 2005, 2015 y 2025 |
| Identificador de proteína | Identificadora | Distinguir cada entrada |
| Taxón | Categórica nominal | Analizar la representación taxonómica |
| Familia proteica | Categórica nominal | Etiquetar y comparar agrupamientos |
| Secuencia de aminoácidos | Secuencia biológica | Generar las representaciones ProtT5 |
| Fragmento | Categórica dicotómica | Incluir/excluir secuencias incompletas |
| Péptido señal | Anotación de secuencia | Construir variantes maduras |
| Propéptido | Anotación de secuencia | Construir variantes activas |
| Embedding ProtT5* | Numérica multivariada | Representar computacionalmente las secuencias |
| Coordenadas UMAP* | Numéricas continuas | Visualizar el espacio de embeddings |
| Coeficiente silhouette* | Numérica continua | Evaluar la separación de las familias |
Los embeddings ProtT5, las coordenadas UMAP y el coeficiente silhouette son representaciones o medidas derivadas durante el análisis; no corresponden a variables originales de Tox-Prot.
Flujo general: XML de UniProt → TSV → limpieza y preparación → análisis descriptivos / ProtSpace
Para reproducir los análisis se utilizó el pipeline disponible en el repositorio del estudio. Los datos originales de UniProt en formato XML fueron transformados a un archivo tabular TSV mediante el parser proporcionado por el proyecto.
Posteriormente, los datos fueron limpiados y preparados para los distintos análisis. Para ProtSpace se generaron diferentes versiones de las secuencias según la eliminación del péptido señal, del propéptido y de las entradas clasificadas como fragmentos.
No se buscó reproducir exhaustivamente todos los análisis del artículo.
Se reprodujeron resultados descriptivos generales y se seleccionaron dos análisis para profundizar:
Los demás análisis se presentan únicamente como contexto del estudio.
| Tema analizado | Qué se examina principalmente | Enfoque |
|---|---|---|
| Tendencias generales | Evolución global de Tox-Prot | Descriptivo/comparativo |
| Representación taxonómica | Órdenes, familias, especies y hábitats | Descriptivo/comparativo |
| Familias proteicas | Abundancia y evolución de familias | Descriptivo/comparativo |
| Longitud, evidencia y fragmentos | Características de secuencia y evidencia | Descriptivo/comparativo |
| Modificaciones postraduccionales | Frecuencia y tipos de PTM | Descriptivo/comparativo |
| Anotaciones funcionales | Dosis tóxica y Gene Ontology | Descriptivo/comparativo |
| ProtSpace | Relaciones en el espacio de embeddings | Multivariado exploratorio |
~/.local/bin/uv run toxprot analysis summary
Figura. Resumen descriptivo general de la evolución de Tox-Prot entre 2005, 2015 y 2025.
Entre 2005 y 2025 se observa un crecimiento considerable del conjunto Tox-Prot analizado. Paralelamente aumentaron la diversidad de especies, órdenes taxonómicos y familias proteicas representadas.
Sin embargo, algunos indicadores no siguieron una tendencia estrictamente creciente en términos relativos, como la proporción de entradas clasificadas como fragmentos, las anotaciones de modificaciones postraduccionales y las anotaciones de dosis tóxica.
Pregunta
¿Cómo ha cambiado la representación taxonómica de los organismos venenosos incluidos en Tox-Prot entre 2005 y 2025?
Objetivo
Describir y comparar los cambios en los grupos taxonómicos representados, identificando cuáles aumentaron, disminuyeron, aparecieron o desaparecieron.
| Variable | Tipo | Función |
|---|---|---|
| Año o versión | Categórica ordinal | Comparación temporal |
| Orden | Categórica nominal | Agrupación taxonómica |
| Familia | Categórica nominal | Comparación a nivel más específico |
| Especie | Categórica nominal | Diversidad representada |
| Número de entradas | Numérica discreta | Cuantificar representación |
Descriptivo y comparativo.
No se plantea un contraste formal de hipótesis nula (H0) y alternativa (H1).
Las comparaciones taxonómicas son descriptivas y no se aplica una prueba inferencial para determinar si las diferencias entre años son estadísticamente significativas.
Por ello, formular H0 y H1 como si se hubiese realizado una prueba de significación no sería apropiado.
~/.local/bin/uv run toxprot analysis taxa
Diversidad representada
Figura. Evolución del número de entradas correspondientes a los principales órdenes taxonómicos representados en Tox-Prot durante 2005–2025.
El crecimiento no fue uniforme entre los distintos grupos. Squamata se mantuvo como el orden con mayor representación durante todo el período, pasando de 593 entradas en 2005 a 2.440 en 2025.
Araneae experimentó un incremento marcado alrededor de 2011. Neogastropoda presentó un crecimiento importante durante los primeros años de la década de 2010, mientras que Scorpiones mostró una trayectoria más gradual.
Figura. Evolución de la representación de los órdenes taxonómicos en Tox-Prot entre 2005, 2015 y 2025.
Principales observaciones
El crecimiento de Tox-Prot estuvo acompañado por una ampliación de su cobertura taxonómica, pero esta diversificación no implica una representación equilibrada de los organismos venenosos.
Los resultados muestran una fuerte concentración de entradas en unos pocos órdenes, principalmente Squamata, Araneae, Neogastropoda y Scorpiones.
Por ello, la representación de un grupo en Tox-Prot debe interpretarse como una combinación de diversidad biológica, esfuerzo de investigación, disponibilidad de muestras y grado de caracterización de las proteínas.
Pregunta
¿Los embeddings de ProtT5 permiten observar patrones de agrupamiento entre las principales familias proteicas de Tox-Prot y cómo influye el procesamiento de las secuencias?
Objetivo
Explorar las relaciones entre las principales familias de proteínas de veneno y evaluar cómo cinco variantes de procesamiento afectan su separación.
Flujo del análisis:
Secuencia → ProtT5 → embedding → UMAP → silhouette → comparación de
variantes
Idea esencial: ProtT5 transforma cada secuencia de aminoácidos en una representación numérica multidimensional (embedding).
Los modelos de lenguaje de proteínas se entrenan con grandes cantidades de secuencias y permiten transformar cada secuencia en una representación numérica de muchas dimensiones.
Esta representación resume patrones presentes en la secuencia y facilita explorar relaciones que podrían no ser evidentes utilizando únicamente la clasificación taxonómica o la nomenclatura tradicional de las familias.
| Variante | Procesamiento |
|---|---|
full |
Secuencia completa |
mature |
Sin péptido señal |
mature_clean |
Sin péptido señal + sin fragmentos |
active |
Sin péptido señal ni propéptido |
active_clean |
Sin péptido señal ni propéptido + sin fragmentos |
UMAP reduce los embeddings de muchas dimensiones a dos dimensiones para poder visualizarlos.
UMAP (Uniform Manifold Approximation and Projection) es una técnica de reducción de dimensionalidad.
La representación bidimensional facilita observar si las proteínas pertenecientes a una misma familia tienden a ocupar regiones similares del espacio.
Sin embargo, UMAP no constituye una prueba estadística. La existencia visual de grupos no demuestra por sí sola diferencias estadísticamente significativas ni equivalencia funcional.
n_neighbors = 50min_dist = 0.5random_state = 42Silhouette evalúa cuánto se separan grupos previamente conocidos.
En este análisis las familias proteicas ya funcionan como etiquetas. Silhouette no crea los grupos: cuantifica hasta qué punto las proteínas de una misma familia aparecen próximas y separadas de otras familias.
No.
El coeficiente silhouette se empleó como una medida descriptiva de la separación de los grupos, no como una prueba de hipótesis.
Por tanto, no corresponde interpretar los valores mediante un valor p ni hablar de diferencias estadísticamente significativas entre las cinco variantes.
mature_clean para la visualización
final.Preparación de las variantes:
~/.local/bin/uv run toxprot analysis protspace prepare
Regeneración conjunta de las cinco proyecciones:
~/.local/bin/uv run toxprot analysis protspace run-umap
Cálculo de silhouette:
~/.local/bin/uv run toxprot analysis protspace silhouette
| Variante | Artículo | Reproducción |
|---|---|---|
full |
0.262 | 0.264 |
mature |
0.397 | 0.470 |
mature_clean |
0.474 | 0.546 |
active |
0.382 | 0.438 |
active_clean |
0.401 | 0.514 |
Resultado principal
mature_clean fue la mejor variante tanto en el artículo
como en nuestra reproducción.full presentó la menor separación en ambos casos.Figura. Comparación de los coeficientes silhouette de las cinco variantes de procesamiento de ProtSpace.
mature_cleanFigura. Proyección UMAP correspondiente a la
variante mature_clean.
La reproducción confirma que el procesamiento previo de las secuencias influye en la separación observada entre las familias proteicas.
La eliminación del péptido señal incrementó el coeficiente silhouette
y la exclusión adicional de fragmentos produjo el valor máximo.
mature_clean fue la mejor variante tanto en el artículo
como en nuestra reproducción.
La eliminación adicional del propéptido no produjo una mejora
respecto a mature_clean, lo que sugiere que eliminar más
regiones de una secuencia no necesariamente aumenta la capacidad de
separación y puede eliminar información útil.
UMAP y silhouette aportan perspectivas complementarias: UMAP permite explorar visualmente la organización del espacio, mientras que silhouette proporciona una medida cuantitativa de la separación.
Estos resultados tienen carácter exploratorio y no constituyen una prueba inferencial de diferencias entre familias proteicas.
mature_clean volvió a ser la variante con mayor
silhouette.full volvió a ocupar la última posición.| Variante | Artículo | Reproducción |
|---|---|---|
full |
0.262 | 0.264 |
mature |
0.397 | 0.470 |
mature_clean |
0.474 | 0.546 |
active |
0.382 | 0.438 |
active_clean |
0.401 | 0.514 |
Conclusión de reproducibilidad: el resultado principal fue reproducible a nivel cualitativo y comparativo, pero no numéricamente idéntico.
Para investigar las diferencias se compararon los bundles históricos del repositorio con los bundles regenerados.
Se comprobó que, en las cinco variantes:
Sin embargo, las coordenadas UMAP regeneradas no fueron idénticas a las almacenadas en los bundles históricos.
Los silhouette calculados sobre esos bundles históricos fueron:
| Variante | Bundle histórico | Regeneración actual |
|---|---|---|
full |
0.323 | 0.264 |
mature |
0.474 | 0.470 |
mature_clean |
0.572 | 0.546 |
active |
0.412 | 0.438 |
active_clean |
0.564 | 0.514 |
Por tanto, la discrepancia no puede explicarse simplemente por el uso de proteínas diferentes, familias diferentes o parámetros UMAP declarados diferentes.
Con las comprobaciones realizadas no fue posible establecer de manera concluyente la causa exacta. Podría depender de aspectos del entorno computacional o de la implementación utilizada para generar las proyecciones, pero demostrarlo requeriría una investigación adicional.
En términos generales, los análisis utilizados por Kirchhoff et al. (2026) son adecuados para describir la evolución y composición de Tox-Prot. El estudio utiliza principalmente frecuencias, porcentajes, comparaciones temporales y visualizaciones, junto con un análisis multivariado exploratorio mediante ProtSpace.
Este enfoque permite responder preguntas como:
Sin embargo, varios resultados del artículo se interpretan más allá de la mera descripción. En esos casos, habría sido útil incorporar análisis inferenciales o modelos estadísticos adicionales.
Juicio estadístico
Los análisis son adecuados para describir y explorar, pero algunas conclusiones que van más allá de la descripción requieren herramientas estadísticas adicionales.
Una fortaleza del estudio es que el tipo de análisis elegido coincide con buena parte de sus objetivos descriptivos. Para caracterizar la evolución de una base de datos, los conteos, porcentajes, distribuciones y visualizaciones son herramientas apropiadas.
También resulta adecuado separar diferentes dimensiones del problema —taxonomía, familias proteicas, características de secuencia y anotaciones— en lugar de resumir toda la evolución de Tox-Prot mediante un único indicador.
En ProtSpace, la comparación de cinco variantes de procesamiento
mediante el coeficiente silhouette proporciona un criterio cuantitativo
para evaluar cuál genera una mayor separación entre las familias
proteicas. Por tanto, la selección de mature_clean no
depende únicamente de una impresión visual del UMAP.
Estas decisiones fortalecen la coherencia entre las preguntas descriptivas y los análisis utilizados.
La principal limitación estadística es que el estudio depende en gran medida de análisis descriptivos. Esto es suficiente para mostrar patrones, pero no siempre permite evaluar formalmente si las diferencias observadas son mayores de lo esperable por variabilidad aleatoria o si las tendencias se mantienen bajo un modelo estadístico.
Algunas preguntas podrían haberse fortalecido con análisis adicionales:
n_neighbors y min_dist, así como la
comparación con otras técnicas de reducción de dimensionalidad,
permitiría evaluar la robustez de los patrones observados.Precaución estadística
Las versiones de Tox-Prot correspondientes a 2005, 2015 y 2025 no constituyen muestras independientes, porque la base de datos es acumulativa.
Por ello, no sería apropiado aplicar directamente pruebas de independencia o comparaciones de proporciones tratando los tres cortes temporales como grupos independientes.
Una estrategia más adecuada sería analizar las nuevas entradas añadidas en cada intervalo, por ejemplo:
Esto permitiría estudiar cambios en la composición evitando, al menos parcialmente, el problema de dependencia entre versiones acumulativas.
Los dos análisis reproducidos son pertinentes porque responden a preguntas diferentes y complementarias.
El análisis taxonómico permite describir cómo ha cambiado la composición de Tox-Prot y detectar posibles sesgos de representación. Sin embargo, al ser descriptivo, no permite establecer formalmente si la distribución observada difiere significativamente de una distribución esperada.
ProtSpace permite explorar relaciones multivariadas entre proteínas y comparar distintas estrategias de procesamiento mediante silhouette. Este análisis es adecuado como herramienta exploratoria, pero no debe interpretarse como una prueba inferencial de diferencias funcionales entre familias.
Por tanto, los análisis utilizados son apropiados para explorar y describir los patrones principales del estudio, aunque algunas conclusiones podrían fortalecerse mediante pruebas inferenciales, modelos de tendencia y análisis de sensibilidad.
Conclusión principal
Los análisis de Kirchhoff et al. (2026) son adecuados para describir y explorar la evolución de Tox-Prot, pero algunos no permiten por sí solos realizar inferencias estadísticas sobre los patrones observados.
Análisis descriptivos: adecuados para caracterizar el crecimiento, la composición y la representación de Tox-Prot.
Representación taxonómica: la sobre- o infrarrepresentación podría evaluarse formalmente mediante una prueba de chi-cuadrado de bondad de ajuste.
Tendencias temporales: podrían fortalecerse mediante modelos para datos de conteo, como Poisson o binomial negativa, considerando que Tox-Prot es una base acumulativa.
ProtSpace: UMAP y silhouette son pertinentes como herramientas exploratorias y comparativas, pero no constituyen pruebas inferenciales de diferencias funcionales.
Robustez: la reproducción conservó el orden relativo de las cinco variantes, aunque no los valores numéricos exactos, lo que apoya la conveniencia de realizar análisis de sensibilidad.
En síntesis: incorporar pruebas inferenciales, modelos de tendencia y análisis de sensibilidad permitiría respaldar con mayor rigor aquellas conclusiones que van más allá de la descripción.