Skip to main content
QUICK REVIEW

[论文解读] CommonGen: A Constrained Text Generation Challenge for Generative Commonsense Reasoning

Bill Yuchen Lin, Wangchunshu Zhou|arXiv (Cornell University)|Nov 9, 2019
Topic Modeling被引用 5
一句话总结

本文提出了CommonGen,一项受限文本生成任务,用于评估模型从给定概念集合生成合乎常理、富含常识的句子的能力,要求具备关系推理与组合泛化能力。尽管最先进的模型如T5的SPICE得分达到31.00,但与人类表现(52.43)相比仍有显著差距,凸显了自然语言处理中生成式常识推理的挑战。

ABSTRACT

Recently, large-scale pre-trained language models have demonstrated impressive performance on several commonsense-reasoning benchmark datasets. However, building machines with commonsense to compose realistically plausible sentences remains challenging. In this paper, we present a constrained text generation task, CommonGen associated with a benchmark dataset, to explicitly test machines for the ability of generative commonsense reasoning. Given a set of common concepts (e.g., {dog, frisbee, catch, throw}); the task is to generate a coherent sentence describing an everyday scenario using these concepts (e.g., "a man throws a frisbee and his dog catches it"). The CommonGen task is challenging because it inherently requires 1) relational reasoning with background commonsense knowledge, and 2) compositional generalization ability to work on unseen concept combinations. Our dataset, constructed through a combination of crowdsourced and existing caption corpora, consists of 79k commonsense descriptions over 35k unique concept-sets. Experiments show that there is a large gap between state-of-the-art text generation models (e.g., T5) and human performance. Furthermore, we demonstrate that the learned generative commonsense reasoning capability can be transferred to improve downstream tasks such as CommonsenseQA by generating additional context.

研究动机与目标

  • 为解决现有判别式常识任务之外,缺乏评估文本生成中生成式常识推理能力的基准任务的问题。
  • 设计一项受限生成任务,要求模型使用给定的一组常见概念,组合生成语法正确且合乎常理的句子。
  • 在两个核心挑战上评估模型:对常识知识的关系推理能力,以及对未见过的概念组合的组合泛化能力。
  • 通过受控众包方式构建一个大规模、高质量的数据集,包含77,449个句子和35,141个独特的概念集合。
  • 证明成功的生成式常识模型可通过生成有用的上下文情境,提升下游任务的性能。

提出的方法

  • CommonGen任务被形式化为一个文本生成问题,即模型将一个无序的概念集合映射为一个连贯的、日常情境下的句子。
  • 数据集通过结合现有图像字幕语料库与受控众包的混合方法构建,以确保多样性和常识合理性。
  • 使用标准预训练架构(如T5、BART、GPT-2和UniLM)在CommonGen数据集上微调模型,采用束搜索解码,并在开发集上进行超参数调优。
  • 评估采用自动指标(ROUGE、BLEU、METEOR、CIDEr、SPICE)和人工标注,以评估事实性和常识合理性。
  • 迁移学习研究表明,经过CommonGen训练的模型可通过生成相关背景情境,提升下游常识问答任务的性能。
  • 标注界面包含词性提示,以提高标注速度,同时保持句子的多样性和自然性。

实验结果

研究问题

  • RQ1最先进的文本生成模型在受限于使用给定概念集合时,能否生成合乎常理、富含常识的句子?
  • RQ2当前模型在未见过的概念组合上,其在文本生成中的关系推理与组合泛化能力达到何种程度?
  • RQ3生成式模型在CommonGen任务上的表现与人类在事实性和常识合理性方面的表现相比如何?
  • RQ4生成富含常识的上下文情境的能力是否能提升常识推理任务中的下游性能?
  • RQ5当前模型在生成符合常识的句子时,其主要失败模式是什么?

主要发现

  • 表现最佳的模型T5-Large的SPICE得分为31.00,远低于人类的52.43分,表明在生成式常识推理方面仍存在巨大差距。
  • 最先进模型频繁生成不合常理的句子,如“a dog throws a frisbee”(狗扔飞盘)或“giving a massage to a table”(给桌子按摩),显示出关系推理能力薄弱。
  • 在CommonGen上训练的模型展现出迁移能力,当用于生成上下文背景时,可提升下游常识问答任务的性能。
  • 该数据集包含77,449个句子,覆盖35,141个独特的概念集合,且对关系与组合挑战有强烈强调。
  • ConceptNet上一跳与两跳关系的频率分析表明,许多概念集合需要多跳常识推理,从而增加了任务难度。
  • 人工评估确认,人类标注的句子在合乎常理性和语境连贯性方面显著优于模型生成结果,尤其在处理施事-动作-受事角色关系方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。