Evaluación de inferencias pragmáticas en 7 Modelos de Lenguaje Grande : discurso indirecto e ironía.

Introducción

El desarrollo reciente de los Modelos de Lenguaje Grande (LLM) ha transformado la producción y el procesamiento automático del lenguaje. Estos sistemas pueden generar textos coherentes, fluidos y formalmente adecuados, y se utilizan cada vez con mayor frecuencia en ámbitos como la educación, la atención al cliente, la búsqueda de información y la creación de contenido.

Sin embargo, la capacidad de producir lenguaje no necesariamente implica una comprensión precisa de los significados comunicados. Esta diferencia se relaciona con lo que West et al. (2023) denominan la paradoja de la inteligencia artificial generativa: mientras que en los seres humanos la producción lingüística suele considerarse más difícil que la comprensión, en los LLM se evidencia el caso opuesto.

Algunos estudios han señalado que estos modelos presentan un desempeño desigual entre distintas habilidades lingüísticas (Mahowald et al., 2024; Mitchell, 2021). En general, suelen responder adecuadamente en tareas relacionadas con la gramática y la estructura formal del lenguaje. Sin embargo, experimentan mayores dificultades cuando deben integrar información contextual, reconocer intenciones comunicativas o interpretar contenidos implícitos.

El análisis de estas capacidades exige adoptar una perspectiva diferente. La pragmática estudia cómo los interlocutores construyen e interpretan significados a partir del contenido lingüístico, el contexto, los conocimientos compartidos y las intenciones comunicativas. Dentro de este campo, la inferencia pragmática puede entenderse como el proceso mediante el cual se derivan conclusiones sobre el significado del hablante a partir de lo expresado explícitamente y de la información contextual. Esta investigación se centra en dos fenómenos que requieren este tipo de procesamiento: el discurso indirecto y la ironía.

A pesar de los avances en el desarrollo de los LLM, todavía no existe suficiente claridad sobre su rendimiento al resolver tareas que requieren inferir significados implícitos y no literales. Tampoco se conoce con precisión si los distintos modelos presentan capacidades similares o si su desempeño varía según el fenómeno pragmático evaluado. Esta falta de evidencia comparativa resulta relevante porque el discurso indirecto y la ironía exigen operaciones interpretativas diferentes. El primero requiere reconocer una intención que no se formula de manera explícita, mientras que la segunda suele implicar la identificación de una discrepancia entre el contenido literal, el contexto y la actitud del hablante. Comparar ambos fenómenos puede mostrar si el rendimiento de los modelos depende del tipo de inferencia requerida.

El problema adquiere además una dimensión práctica debido a la incorporación de estos sistemas en situaciones comunicativas reales. Una interpretación inadecuada de significados implícitos puede afectar la confiabilidad de aplicaciones empleadas en educación, asistencia virtual, atención al usuario o recuperación de información. Por esta razón, es necesario contar con evaluaciones que permitan identificar con mayor precisión las capacidades y limitaciones pragmáticas de los modelos.

Desde el punto de vista académico, este análisis también permite vincular la investigación en inteligencia artificial con las ciencias del lenguaje. El comportamiento de los LLM frente a fenómenos pragmáticos ofrece un espacio para examinar hasta qué punto su producción de respuestas plausibles se corresponde con una interpretación adecuada del significado comunicado.

Con lo anterior en mente, está investigación se propone resolver la siguiente pregunta

¿Cuál es el rendimiento de distintos modelos de lenguaje al resolver tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironía?

Para ello, los objetivos que se persiguen son:

Objetivo general: Evaluar comparativamente el rendimiento de distintos modelos de lenguaje en tareas que requieren realizar inferencias pragmáticas relacionadas con el discurso indirecto y la ironía.

Objetivos específicos:

  1. Determinar el rendimiento de GPT-2, Tk-Instruct 3B, Tk-Instruct 11B, Flan-T5 base, Flan-T5 XL, Flan-T5 XXL y text-davinci-002 en tareas de inferencia pragmática.

  2. Comparar el desempeño de los modelos en las tareas de discurso indirecto y de ironía para identificar posibles diferencias asociadas con el tipo de fenómeno pragmático evaluado.

Metodología

Para los propósitos de este trabajo, se optará por un enfoque metodológico cuantitativo. Así, se realizará un estudio descriptivo correlacional. La base de datos empleada no cuenta actualmente con una denominación oficial, debido a que fue construida específicamente para el desarrollo del artículo A fine-grained comparison of pragmatic language understanding in humans and language models (Hu et al., 2023). En dicho estudio se evalúan diversos fenómenos pragmáticos en siete LLM y en participantes humanos. La base de datos completa se encuentra disponible en un repositorio virtual asociado al trabajo original.1

Para los propósitos de la presente investigación, construimos una base de datos a partir de los datos obtenidos por Hu et al. (2023). En particular, se seleccionaron únicamente las tareas y los resultados correspondientes a los fenómenos pragmáticos de discurso indirecto e ironía. Asimismo, se consideraron exclusivamente los datos asociados al desempeño de los LLM, excluyendo los resultados obtenidos a partir de participantes humanos. La base de datos usada para el análisis estadístico se encuentra alojada en una hoja de cálculo de Google.2

Para este caso en específico, el universo de estudio se compone de 315 observaciones; obtenidas a partir de evaluar a 7 LLM en 20 tareas de discurso indirecto y 25 tareas relacionadas con ironía. En el Anexo 1 se encuentra un ejemplo de cómo se estructuran las tareas. Los modelos evaluados pertenecen a tres familias de modelos de lenguaje ampliamente utilizadas. La familia GPT, desarrollada por OpenAI, incluyó los modelos GPT-2 y text-davinci-002. La familia T0-Tk-Instruct, desarrollada por BigScience, incluyó las variantes Tk-Instruct (3B) y Tk-Instruct (11B). La familia Flan-T5, desarrollada por Google Research, incluyó las variantes Flan-T5 (base), Flan-T5 (XL) y Flan-T5 (XXL).

Por su parte, las variables analizadas son las siguientes:

NOMBRE DESCRIPCIÓN TIPO DEPENDENCIA JUSTIFICACIÓN
Acierto Evalúa el acierto y la comprensión del sentido pragmático de la tarea. Categórica nominal [Correcto- incorrecto] Dependiente Variable principal del estudio. Refleja el rendimiento de los modelos en las tareas evaluadas.
Fenómeno pragmático

Discurso indirecto: Reproducción de las palabras o pensamientos de otro hablante adaptadas al sistema de referencias deícticas y al punto de vista del narrador.

Ironía: uso de la lengua en que se expresa un contenido semántico distinto del significado literal del enunciado.

Categórica nominal Independiente Permite identificar las fortalezas y debilidades de los modelos según el fenómeno pragmático evaluado.
Familia del modelo

Agrupa modelos con una arquitectura o entrenamiento similar, que comparten características fundamentales.

  • GPT: modelos Transformer decoder-only entrenados para predecir el siguiente token y generar texto.

  • Flan-T5: modelos Transformer encoder-decoder que reformulan las tareas como transformaciones de texto a texto.

  • T0-Tk-Instruct: modelos ajustados mediante entrenamiento con instrucciones humanas para mejorar el seguimiento de órdenes y la resolución de tareas.

Categórica nominal Independiente Permite evaluar si la familia del LLM influye en el rendimiento en tareas pragmáticas.
Opción seleccionada

Determina si la respuesta del modelo fue correcta o incorrecta y, en caso de error, identifica el mecanismo de fallo. Las categorías son:

  • CorrectNonLiteral: respuesta correcta, identifica el sentido pragmático del enunciado.

  • IncorrectLiteral: interpreta literalmente el enunciado.

  • IncorrectLexicalOverlap: elige un distractor con vocabulario compartido.

  • IncorrectAssociate: elige un distractor relacionado pero pragmáticamente incorrecto.

  • IncorrectNonSequitur: elige una opción sin relación lógica.

Categórica nominal Independiente Clasifica los errores y sesgos específicos para analizar los procesos pragmáticos de los LLMs.
Porcentaje asignado de elección hecha Indica la probabilidad otorgada por el modelo a la respuesta seleccionada. Continua cuantitativa Independiente Permite estimar la confianza asociada a la elección del modelo y analizar la solidez de sus respuestas frente a distractores pragmáticos.

Resultados

En primer lugar se presentan el porcentaje general de acierto de todos los modelos tanto en tareas de discurso indirecto como en ironia

Tabla 1. Porcentaje de acierto general

Resultado Frecuencia Porcentaje
Error 184 58,41%
Acierto 131 41,59%

Como se puede observar, el porcentaje de los modelos frente a tareas pragmáticas es mayoritariamente deficiente. Del total de la muestra, presentó solamente un 41.59% de acierto

Acierto por fenómeno pragmático

Gráfico 1. Porcentaje de acierto por fenómeno pragmático

Ahora bien, el análisis detallado del rendimiento en función del fenómeno pragmático específico permite una comprensión más profunda de las diferencias entre las tareas evaluadas. Como se observa, los modelos analizados presentan un desempeño considerablemente inferior al enfrentarse a tareas relacionadas con la ironía. En comparación con el discurso indirecto, la ironía registra un porcentaje de aciertos 17,71 puntos porcentuales menor, lo que evidencia una mayor dificultad de los modelos para resolver este tipo de inferencias pragmáticas. 

Familia del modelo

Gráfico 2. Porcentaje de acierto por familia del modelo

Por otro lado, no se evidencian diferencias significativas de rendimiento entre las distintas familias de modelos analizadas. En términos generales, todas las arquitecturas presentan un desempeño bajo en las tareas evaluadas. No obstante, se observa una ligera ventaja en los modelos pertenecientes a la familia GPT, con un porcentaje de aciertos del 44,44 %. Este resultado supera levemente el rendimiento de la familia T0-TK-Instruct, que obtuvo un 40 %, y de la familia Flan-T5, con un 40,74 %.

Estos resultados podrían sugerir que la arquitectura Transformer decoder-only, basada en la predicción del siguiente token más probable, presenta una ligera ventaja frente a otras configuraciones arquitectónicas en tareas que requieren la identificación de mensajes no literales.

Distribución estadística asignada a la opción seleccionada

Con el propósito de caracterizar la distribución de las probabilidades obtenidas, se realizó un análisis descriptivo de los porcentajes asignados a cada respuesta. Previamente, la base de datos fue sometida a un proceso de depuración. Se identificaron y excluyeron 27 registros con valores superiores al 100%, al considerarse inconsistentes con la interpretación de una probabilidad. Los valores se calcularon únicamente sobre los valores válidos, obteniéndose una muestra final de 288 observaciones.

La Tabla 2. presenta los principales hallazgos de la variable analizada, incluyendo el número de observaciones, los valores mínimo y máximo, la media, la mediana y la desviación estándar. Estos indicadores permiten describir la tendencia central, la dispersión y el rango de las probabilidades registradas y proporcionan una visión general de su comportamiento antes de realizar análisis posteriores.

Tabla 2. Estadísticos de la opción seleccionada

N Mínimo Máximo Media Mediana Desviación estándar
288 1,20 99,26 13,12 9,57 13,04

Gráfico 3. Gráfico de la distribución estadística de la opción seleccionada

Tanto la gráfica 3 como la tabla 2 evidencian que los porcentajes asignados por los modelos a la respuesta seleccionada se concentran principalmente en valores bajos. La media fue de 13.12%, mientras que la mediana alcanzó el 9.57%, lo que indica que al menos la mitad de las respuestas seleccionadas recibió una probabilidad inferior al 10%. La diferencia entre ambas medidas sugiere una distribución asimétrica hacia valores altos, debido a un número reducido de observaciones con probabilidades elevadas. Asimismo, el amplio rango de valores (1.20%–99.26%) y la desviación estándar de 13.03% evidencian una notable variabilidad en la probabilidad asignada a la respuesta elegida, lo que refleja que el grado de certeza con el que los modelos realizan su selección difiere considerablemente entre las tareas analizadas.

Frecuencia del tipo de opción de respuesta seleccionada

Con el objetivo de identificar los patrones de respuesta de los modelos, se realizó un análisis de frecuencia de la variable categórica Opción seleccionada. Esta variable permite observar la proporción de respuestas correctas y los principales mecanismos de error presentes en las tareas de comprensión pragmática. A diferencia del análisis de probabilidades asignadas, que permite evaluar el grado de confianza asociado a cada respuesta, la distribución de frecuencias permite caracterizar las tendencias generales de elección de los modelos. Los resultados pueden graficarse de la siguiente manera:

Gráfico 4. Porcentaje del tipo de opción de respuesta seleccionada

La distribución de la variable opción seleccionada evidencia que los modelos presentan dos patrones principales de respuesta. Por un lado, la categoría IncorrectLiteral concentra la mayor proporción de respuestas (45,71%), lo que indica que el error más frecuente consiste en interpretar los enunciados desde su significado literal, sin identificar la intención pragmática subyacente. Este resultado sugiere una limitación en la capacidad de los modelos para realizar inferencias contextuales, especialmente en situaciones donde el significado comunicado difiere de la interpretación superficial del enunciado.

Por otro lado, la categoría CorrectNonLiteral representa el 41,59% de las respuestas, mostrando que una proporción considerable de los modelos logra identificar correctamente el sentido pragmático de las tareas evaluadas. La cercanía entre las respuestas correctas y los errores literales indica que el desempeño pragmático de los modelos se encuentra en un punto donde pueden resolver una parte importante de las tareas, pero todavía presentan una tendencia significativa a privilegiar interpretaciones basadas en el significado explícito.

Las demás categorías de error presentan frecuencias reducidas (IncorrectAssociate: 4,76%; IncorrectNonSequitur: 3,81%; IncorrectLexicalOverlap: 2,86%; IncorrectAssociative: 1,27%). Esto indica que los fallos no se deben principalmente a elecciones aleatorias o a asociaciones superficiales con elementos aislados del texto, sino a una estrategia de interpretación predominantemente literal. En conjunto, los resultados sugieren que la principal dificultad de los modelos evaluados se relaciona con la comprensión del contenido implícito y la capacidad de integrar información contextual para construir interpretaciones pragmáticas adecuadas.

Discusiones y conclusiones

Los resultados obtenidos permiten responder a la pregunta de investigación planteada, evidenciando que el rendimiento de los siete LLM evaluados en tareas de inferencia pragmática es, en términos generales, deficiente. El porcentaje de acierto global (41,59 %) confirma que, a pesar de la capacidad de estos sistemas para producir lenguaje fluido y formalmente adecuado, su desempeño se ve limitado cuando la tarea exige ir más allá del contenido explícito del enunciado. Este hallazgo respalda empíricamente la paradoja señalada por West et al. (2023). De esta manera, la producción lingüística de los LLM no está acompañada de una comprensión proporcional del significado.

En relación con el primer objetivo específico, los siete modelos analizados mostraron un rendimiento bajo y relativamente homogéneo, sin diferencias sustanciales entre familias arquitectónicas. Si bien la familia GPT presentó una ligera ventaja (44,44 % de aciertos) frente a Flan-T5 (40,74 %) y T0-Tk-Instruct (40 %), la magnitud de esta diferencia es reducida y no permite afirmar que el tipo de arquitectura o de entrenamiento constituya, por sí solo, un factor determinante para la resolución de tareas pragmáticas. Esto sugiere que las limitaciones observadas no son exclusivas de un enfoque de modelado particular, sino que podrían constituir una dificultad transversal a los distintos paradigmas de entrenamiento de LLM evaluados. Sin embargo, la ventaja observada en la familia GPT permite plantear que la arquitectura Transformer decoder-only, basada en la predicción del siguiente token más probable, presenta una leve ventaja frente a otras configuraciones arquitectónicas.

Respecto al segundo objetivo específico, sí se identificaron diferencias relevantes asociadas al fenómeno pragmático evaluado. Las tareas de ironía presentaron un desempeño considerablemente inferior al del discurso indirecto (17,71 puntos porcentuales menos), lo que indica que no todas las inferencias pragmáticas representan el mismo nivel de dificultad para los modelos. Mientras que el discurso indirecto exige reconocer que el discurso de otro hablante debe reinterpretarse ajustando el sistema de referencias distinto en lugar de tomarse en su forma literal original, la ironía requiere identificar una discrepancia entre el contenido literal, el contexto y la actitud del hablante, una operación interpretativa más compleja que parece exceder las capacidades actuales de los sistemas evaluados.

El análisis del tipo de error cometido refuerza esta interpretación. La categoría IncorrectLiteral concentró la mayor proporción de respuestas erróneas (45,71 %), muy por encima de otros mecanismos de fallo como la asociación superficial o la elección sin relación lógica con el enunciado. Esto indica que, cuando los modelos se equivocan, no lo hacen de manera aleatoria, sino que tienden sistemáticamente a privilegiar la interpretación literal del enunciado por sobre su sentido pragmático. En otras palabras, los LLM analizados parecen operar con una estrategia de procesamiento que prioriza la superficie lingüística del texto, sin integrar de manera consistente el contexto y la intención del hablante necesarios para derivar significados implícitos.

Por otra parte, el análisis de las probabilidades asignadas a la respuesta seleccionada aporta un matiz importante a estos resultados. La media (13,12 %) y, especialmente, la mediana (9,57 %) de dichas probabilidades fueron bajas, lo que sugiere que, incluso cuando los modelos seleccionan la opción correcta, lo hacen con un grado de certeza reducido. Esto indicaría que el éxito de los modelos en varias de las tareas podría no reflejar necesariamente una comprensión pragmática robusta, sino, en algunos casos, un proceso de selección poco decidido entre las alternativas disponibles.

En conjunto, estos hallazgos evidencian que los LLM evaluados presentan limitaciones importantes para realizar inferencias pragmáticas, especialmente en tareas que involucran ironía. Esta limitación tiene implicaciones prácticas relevantes, dado que estos modelos son utilizados cada vez con mayor frecuencia en contextos comunicativos reales, en los que una interpretación inadecuada de mensajes no literales podría afectar la calidad y confiabilidad de sus respuestas.

Cabe señalar algunas limitaciones del presente estudio. En primer lugar, los modelos evaluados corresponden a versiones desarrolladas hasta 2023, por lo que los resultados no son necesariamente extrapolables al desempeño de arquitecturas más recientes, que podrían presentar mejoras en el procesamiento de información contextual. En segundo lugar, el análisis se limitó a dos fenómenos pragmáticos específicos, por lo que no es posible generalizar estas conclusiones a otros tipos de inferencia pragmática.

Como líneas futuras de investigación, se recomienda replicar este análisis con modelos de lenguaje más recientes, con el fin de evaluar si los avances arquitectónicos y de entrenamiento han contribuido a reducir la brecha entre comprensión literal y pragmática. Asimismo, sería pertinente ampliar el análisis a otros fenómenos pragmáticos. Finalmente, futuros estudios podrían profundizar en la relación entre el nivel de confianza expresado por los modelos y la corrección de sus respuestas, con el propósito de comprender mejor los mecanismos internos que subyacen a sus errores de interpretación pragmática.

Referencias

Hu, J., Floyd, S., Jouravlev, O., Fedorenko, E., & Gibson, E. (2023). A fine-grained comparison of pragmatic language understanding in humans and language models. In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 4194–4213). Association for Computational Linguistics.

Mahowald, K., Ivanova, A. A., Blank, I. A., Kanwisher, N., Tenenbaum, J. B., & Fedorenko, E. (2024). Dissociating language and thought in large language models. Trends In Cognitive Sciences28(6), 517-540.https://doi.org/10.1016/j.tics.2024.01.011

Mitchell, M. (2021). Why AI is Harder Than We Think (Versión 2). arXiv. https://doi.org/10.48550/ARXIV.2104.12871

West, P., Lu, X., Dziri, N., Brahman, F., Li, L., Hwang, J. D., Jiang, L., Fisher, J., Ravichander, A., Chandu, K., Newman, B., Koh, P. W., Ettinger, A., & Choi, Y. (2023). The Generative AI Paradox: “What It Can Create, It May Not Understand” (Versión 1). arXiv.https://doi.org/10.48550/ARXIV.2311.00059

Anexos

Anexo 1.

Task: You will read short stories that describe everyday situations. Each story will be followed by a multiple-choice question. Read each story and choose the best answer. Your task is to decide what the character in the story is trying to convey. The answer options are 1, 2, 3, or 4.

Scenario: Paul has to go to an interview and he’s running late. While he’s cleaning his shoes he says to his wife, Jane, “I want to wear that blue shirt, but it’s very creased”. What might he be trying to convey? Options:

  1. He wants his wife to iron his shirt.

  2. He is unhappy that his shirt is wrinkled.

  3. He got this shirt on sale.

  4. He got his shoes on sale.


  1. Repositorio con la base de datos original aquí↩︎

  2. Base de datos modificada aquí.↩︎