Skip to main content
QUICK REVIEW

[论文解读] FLUTE: Figurative Language Understanding through Textual Explanations

Tuhin Chakrabarty, Arkadiy Saakyan|arXiv (Cornell University)|May 24, 2022
Natural Language Processing Techniques被引用 7
一句话总结

FLUTE 是一个包含 9,000 个样本的新基准,用于隐喻语言理解,它将字面意义和隐喻意义的句子对与蕴含/矛盾标签以及自由形式的文本解释配对。该研究采用模型在环(model-in-the-loop)框架,结合 GPT-3 和人工标注者(众包工作者与专家)来实现高质量数据收集的规模化,并表明在 FLUTE 上微调 T5 模型可显著提升解释质量,优于在 e-SNLI 上微调,从而推动构建真正理解隐喻语言的模型。

ABSTRACT

Figurative language understanding has been recently framed as a recognizing textual entailment (RTE) task (a.k.a. natural language inference, or NLI). However, similar to classical RTE/NLI datasets, the current benchmarks suffer from spurious correlations and annotation artifacts. To tackle this problem, work on NLI has built explanation-based datasets such as e-SNLI, allowing us to probe whether language models are right for the right reasons.Yet no such data exists for figurative language, making it harder to assess genuine understanding of such expressions. To address this issue, we release FLUTE, a dataset of 9,000 figurative NLI instances with explanations, spanning four categories: Sarcasm, Simile, Metaphor, and Idioms. We collect the data through a model-in-the-loop framework based on GPT-3, crowd workers, and expert annotators. We show how utilizing GPT-3 in conjunction with human annotators (novices and experts) can aid in scaling up the creation of datasets even for such complex linguistic phenomena as figurative language. The baseline performance of the T5 model fine-tuned on FLUTE shows that our dataset can bring us a step closer to developing models that understand figurative language through textual explanations.

研究动机与目标

  • 为解决缺乏基于解释的隐喻语言理解基准的问题,该问题阻碍了对模型是否超越偶然相关性进行泛化能力的评估。
  • 开发一个可扩展的、高质量的隐喻自然语言推理(NLI)实例数据集,附带自然语言解释,以支持真正的模型可解释性。
  • 评估在带有解释锚定的隐喻语言数据上进行训练,是否能相比现有 NLI 基准提升模型性能和解释质量。
  • 展示使用 GPT-3 和人工在环验证的模型在环框架在构建复杂语言数据集方面的有效性。

提出的方法

  • 采用模型在环框架,利用少样本提示(few-shot prompting)的 GPT-3 生成多样化的字面意义和隐喻意义的句子对,从而减少人工工作量。
  • 众包工作者对字面意义句子进行最小程度的修改,将其转换为讽刺形式,同时保持语义连贯性。
  • 专家标注者对 GPT-3 的输出进行验证和优化,确保其准确性、一致性和语言质量。
  • 每个实例均包含一个基于隐喻表达的蕴含/矛盾判断的自然语言解释。
  • 数据集以 <字面意义, 隐喻意义> 句子对的形式组织,附带标签(蕴含/矛盾)和解释,涵盖讽刺、明喻、隐喻和习语。
  • 使用 e-SNLI 和 FLUTE 数据联合微调 T5 模型,同时进行标签预测和解释生成,以进行对比。

实验结果

研究问题

  • RQ1模型在环框架能否有效规模化创建高质量、带有解释锚定的隐喻语言数据集?
  • RQ2在 FLUTE 上微调是否能带来比在 e-SNLI 上微调更高质量的解释,用于隐喻语言理解?
  • RQ3在 FLUTE 上训练的模型在多大程度上展现出比基线模型更稳健、更忠实的隐喻表达推理能力?
  • RQ4在连贯性和相关性方面,与在通用 NLI 数据上训练的模型相比,基于 FLUTE 微调的模型生成的解释有何差异?

主要发现

  • 在 FLUTE 上微调的 T5 模型生成的文本解释质量显著高于在 e-SNLI 上微调的同一模型,该结论通过自动评估和人工评估均得到验证。
  • FLUTE 通过将解释直接与隐喻表达关联,使得对模型推理过程的评估比标准 NLI 基准更加可靠。
  • 结合 GPT-3 与专家验证的人工输入的模型在环方法,成功实现了高质量、多样化且复杂的隐喻语言实例的规模化构建。
  • 该数据集表明,基于带有解释锚定的隐喻语言数据训练的模型,更能有效应对分布外(out-of-distribution)和对抗性样本。
  • FLUTE 在性能上优于现有基准(如 Big-bench 和 IMPLI),因为它确保非蕴含样本是与隐喻意义矛盾,而不仅仅是字面部分。
  • 人工评估确认,基于 FLUTE 微调的模型生成的解释比在通用 NLI 数据上训练的模型生成的解释更具忠实度和上下文相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。