Evaluación de inferencias pragmáticas en 7 Modelos de Lenguaje Grande : discurso indirecto e ironía.

Introducción

El desarrollo reciente de los Modelos de Lenguaje Grande (LLM) ha transformado la producción y el procesamiento automático del lenguaje. Estos sistemas pueden generar textos coherentes, fluidos y formalmente adecuados, y se utilizan cada vez con mayor frecuencia en ámbitos como la educación, la atención al cliente, la búsqueda de información y la creación de contenido.

Sin embargo, la capacidad de producir lenguaje no necesariamente implica una comprensión precisa de los significados comunicados. Esta diferencia se relaciona con lo que West et al. (2023) denominan la paradoja de la inteligencia artificial generativa: mientras que en los seres humanos la producción lingüística suele considerarse más difícil que la comprensión, los LLM muestran lo contrario.

Algunos estudios han señalado que estos modelos presentan un desempeño desigual entre distintas habilidades lingüísticas (Mahowald et al., 2024; Mitchell, 2021). En general, suelen responder adecuadamente en tareas relacionadas con la gramática y la estructura formal del lenguaje. Sin embargo, experimentan mayores dificultades cuando deben integrar información contextual, reconocer intenciones comunicativas o interpretar contenidos implícitos.

El análisis de estas capacidades exige adoptar una perspectiva diferente. La pragmática estudia cómo los interlocutores construyen e interpretan significados a partir del contenido lingüístico, el contexto, los conocimientos compartidos y las intenciones comunicativas. Dentro de este campo, la inferencia pragmática puede entenderse como el proceso mediante el cual se derivan conclusiones sobre el significado del hablante a partir de lo expresado explícitamente y de la información contextual.

Esta investigación se centra en dos fenómenos que requieren este tipo de procesamiento: el discurso indirecto y la ironía. En ambos casos, el significado comunicado no se obtiene únicamente de la interpretación literal del enunciado, sino de la relación entre este, el contexto y la intención atribuida al hablante.

A pesar de los avances en el desarrollo de los LLM, todavía no existe suficiente claridad sobre su rendimiento al resolver tareas que requieren inferir significados implícitos y no literales. Tampoco se conoce con precisión si los distintos modelos presentan capacidades similares o si su desempeño varía según el fenómeno pragmático evaluado. Esta falta de evidencia comparativa resulta relevante porque el discurso indirecto y la ironía exigen operaciones interpretativas diferentes. El primero requiere reconocer una intención que no se formula de manera explícita, mientras que la segunda suele implicar la identificación de una discrepancia entre el contenido literal, el contexto y la actitud del hablante. Comparar ambos fenómenos puede mostrar si el rendimiento de los modelos depende del tipo de inferencia requerida.

El problema adquiere además una dimensión práctica debido a la incorporación de estos sistemas en situaciones comunicativas reales. Una interpretación inadecuada de significados implícitos puede afectar la confiabilidad de aplicaciones empleadas en educación, asistencia virtual, atención al usuario o recuperación de información. Por esta razón, es necesario contar con evaluaciones que permitan identificar con mayor precisión las capacidades y limitaciones pragmáticas de los modelos.

Desde el punto de vista académico, este análisis también permite vincular la investigación en inteligencia artificial con las ciencias del lenguaje. El comportamiento de los LLM frente a fenómenos pragmáticos ofrece un espacio para examinar hasta qué punto su producción de respuestas plausibles se corresponde con una interpretación adecuada del significado comunicado.

Con lo anterior en mente, está investigación se propone resolver la siguiente pregunta

¿Cuál es el rendimiento de distintos modelos de lenguaje al resolver tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironía?

Para ello, los objetivos que se persiguen son:

Objetivo general: Evaluar comparativamente el rendimiento de distintos modelos de lenguaje en tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironía.

Objetivos específicos:

  1. Determinar el rendimiento de GPT-2, Tk-Instruct 3B, Tk-Instruct 11B, Flan-T5 base, Flan-T5 XL, Flan-T5 XXL y text-davinci-002 en tareas de inferencia pragmática.

  2. Comparar el desempeño de los modelos en las tareas de discurso indirecto y de ironía para identificar posibles diferencias asociadas con el tipo de fenómeno pragmático evaluado.


Metodología


Resultados

Acierto general

En primer lugar se presentan el porcentaje general de acierto de todos los modelos tanto en tareas de discurso indirecto como en ironia

Tabla 1. Porcentaje de acierto general

Resultado Frecuencia Porcentaje
Error 184 58,41%
Acierto 131 41,59%

Como se puede observar, el porcentaje de los modelos frente a tareas pragmáticas es mayoritariamente deficiente. Del total de la muestra, presentó solamente un 41.59% de acierto

Acierto por fenomeno pragmático

PRUEBA ANIMACIÓN


Discusiones y conclusiones

Referencias

R Markdown

This is an R Markdown document. Markdown is a simple formatting syntax for authoring HTML, PDF, and MS Word documents. For more details on using R Markdown see http://rmarkdown.rstudio.com.

When you click the Knit button a document will be generated that includes both content as well as the output of any embedded R code chunks within the document. You can embed an R code chunk like this:

Including Plots

You can also embed plots, for example:

Note that the echo = FALSE parameter was added to the code chunk to prevent printing of the R code that generated the plot.