El desarrollo reciente de los Modelos de Lenguaje Grande (LLM) ha transformado la producción y el procesamiento automático del lenguaje. Estos sistemas pueden generar textos coherentes, fluidos y formalmente adecuados, y se utilizan cada vez con mayor frecuencia en ámbitos como la educación, la atención al cliente, la búsqueda de información y la creación de contenido.
Sin embargo, la capacidad de producir lenguaje no necesariamente implica una comprensión precisa de los significados comunicados. Esta diferencia se relaciona con lo que West et al. (2023) denominan la paradoja de la inteligencia artificial generativa: mientras que en los seres humanos la producción lingüÃstica suele considerarse más difÃcil que la comprensión, los LLM muestran lo contrario.
Algunos estudios han señalado que estos modelos presentan un desempeño desigual entre distintas habilidades lingüÃsticas (Mahowald et al., 2024; Mitchell, 2021). En general, suelen responder adecuadamente en tareas relacionadas con la gramática y la estructura formal del lenguaje. Sin embargo, experimentan mayores dificultades cuando deben integrar información contextual, reconocer intenciones comunicativas o interpretar contenidos implÃcitos.
El análisis de estas capacidades exige adoptar una perspectiva diferente. La pragmática estudia cómo los interlocutores construyen e interpretan significados a partir del contenido lingüÃstico, el contexto, los conocimientos compartidos y las intenciones comunicativas. Dentro de este campo, la inferencia pragmática puede entenderse como el proceso mediante el cual se derivan conclusiones sobre el significado del hablante a partir de lo expresado explÃcitamente y de la información contextual.
Esta investigación se centra en dos fenómenos que requieren este tipo de procesamiento: el discurso indirecto y la ironÃa. En ambos casos, el significado comunicado no se obtiene únicamente de la interpretación literal del enunciado, sino de la relación entre este, el contexto y la intención atribuida al hablante.
A pesar de los avances en el desarrollo de los LLM, todavÃa no existe suficiente claridad sobre su rendimiento al resolver tareas que requieren inferir significados implÃcitos y no literales. Tampoco se conoce con precisión si los distintos modelos presentan capacidades similares o si su desempeño varÃa según el fenómeno pragmático evaluado. Esta falta de evidencia comparativa resulta relevante porque el discurso indirecto y la ironÃa exigen operaciones interpretativas diferentes. El primero requiere reconocer una intención que no se formula de manera explÃcita, mientras que la segunda suele implicar la identificación de una discrepancia entre el contenido literal, el contexto y la actitud del hablante. Comparar ambos fenómenos puede mostrar si el rendimiento de los modelos depende del tipo de inferencia requerida.
El problema adquiere además una dimensión práctica debido a la incorporación de estos sistemas en situaciones comunicativas reales. Una interpretación inadecuada de significados implÃcitos puede afectar la confiabilidad de aplicaciones empleadas en educación, asistencia virtual, atención al usuario o recuperación de información. Por esta razón, es necesario contar con evaluaciones que permitan identificar con mayor precisión las capacidades y limitaciones pragmáticas de los modelos.
Desde el punto de vista académico, este análisis también permite vincular la investigación en inteligencia artificial con las ciencias del lenguaje. El comportamiento de los LLM frente a fenómenos pragmáticos ofrece un espacio para examinar hasta qué punto su producción de respuestas plausibles se corresponde con una interpretación adecuada del significado comunicado.
Con lo anterior en mente, está investigación se propone resolver la siguiente pregunta
¿Cuál es el rendimiento de distintos modelos de lenguaje al resolver tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironÃa?
Para ello, los objetivos que se persiguen son:
Objetivo general: Evaluar comparativamente el rendimiento de distintos modelos de lenguaje en tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironÃa.
Objetivos especÃficos:
Determinar el rendimiento de GPT-2, Tk-Instruct 3B, Tk-Instruct 11B, Flan-T5 base, Flan-T5 XL, Flan-T5 XXL y text-davinci-002 en tareas de inferencia pragmática.
Comparar el desempeño de los modelos en las tareas de discurso indirecto y de ironÃa para identificar posibles diferencias asociadas con el tipo de fenómeno pragmático evaluado.
Acierto general
En primer lugar se presentan el porcentaje general de acierto de todos los modelos tanto en tareas de discurso indirecto como en ironia
Tabla 1. Porcentaje de acierto general
| Resultado | Frecuencia | Porcentaje |
|---|---|---|
| Error | 184 | 58,41% |
| Acierto | 131 | 41,59% |
Como se puede observar, el porcentaje de los modelos frente a tareas pragmáticas es mayoritariamente deficiente. Del total de la muestra, presentó solamente un 41.59% de acierto
Acierto por fenomeno pragmático
PRUEBA ANIMACIÓN
This is an R Markdown document. Markdown is a simple formatting syntax for authoring HTML, PDF, and MS Word documents. For more details on using R Markdown see http://rmarkdown.rstudio.com.
When you click the Knit button a document will be generated that includes both content as well as the output of any embedded R code chunks within the document. You can embed an R code chunk like this:
You can also embed plots, for example:
Note that the echo = FALSE parameter was added to the
code chunk to prevent printing of the R code that generated the
plot.