Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Knowledge-Enhanced Commonsense Question Answering via Knowledge-to-Text Transformation

Ning Bian, Xianpei Han|arXiv (Cornell University)|Jan 4, 2021
Topic Modeling参考文献 42被引用 6
一句话总结

本文提出了一种知识到文本的转换框架,用于基准测试知识增强的常识问答(CQA),将常识知识图谱中的结构化知识转化为自然语言文本,以与机器阅读理解(MRC)模型集成。该方法在CommonsenseQA上实现了最先进性能,并揭示当前模型仅利用了外部知识的一小部分潜力,强调上下文敏感的知识选择、异质性知识使用以及常识丰富的语言模型是未来的关键研究方向。

ABSTRACT

A fundamental ability of humans is to utilize commonsense knowledge in language understanding and question answering. In recent years, many knowledge-enhanced Commonsense Question Answering (CQA) approaches have been proposed. However, it remains unclear: (1) How far can we get by exploiting external knowledge for CQA? (2) How much potential of knowledge has been exploited in current CQA models? (3) Which are the most promising directions for future CQA? To answer these questions, we benchmark knowledge-enhanced CQA by conducting extensive experiments on multiple standard CQA datasets using a simple and effective knowledge-to-text transformation framework. Experiments show that: (1) Our knowledge-to-text framework is effective and achieves state-of-the-art performance on CommonsenseQA dataset, providing a simple and strong knowledge-enhanced baseline for CQA; (2) The potential of knowledge is still far from being fully exploited in CQA -- there is a significant performance gap from current models to our models with golden knowledge; and (3) Context-sensitive knowledge selection, heterogeneous knowledge exploitation, and commonsense-rich language models are promising CQA directions.

研究动机与目标

  • 评估当前知识增强的CQA模型在利用外部常识知识方面的有效性。
  • 识别现有模型在知识利用方面的局限性,特别是知识选择与整合方面的不足。
  • 通过知识到文本的转换,建立一种简单、可泛化且性能强劲的知识增强CQA基线。
  • 研究使用真实世界知识的模型与使用理想(完美)知识的模型之间的性能差距。
  • 通过识别最具前景的研究方向,为未来研究提供指导。

提出的方法

  • 利用问题上下文从常识知识图谱(CKG)中检索相关事实。
  • 使用三种方法将结构化的知识三元组转换为自然语言描述:基于模板的方法、基于重述的方法和基于检索的方法。
  • 将文本化后的知识与原始问题及答案候选一起整合到机器阅读理解(MRC)框架中。
  • 使用预训练的MRC模型(例如,BERT、RoBERTa)基于问题和增强后的文本知识预测答案。
  • 在多个标准CQA数据集上应用统一框架,以确保公平且可泛化的基准测试。
  • 在三种知识条件下评估模型性能:真实世界检索到的知识、有噪声的知识和理想知识(完美事实)。

实验结果

研究问题

  • RQ1当前最先进知识增强的CQA模型在外部知识中利用了多少潜力?
  • RQ2与现有知识集成方法相比,知识到文本的转换在多大程度上提升了CQA性能?
  • RQ3知识增强CQA的主要失败模式是什么,它们与知识质量和选择有何关联?
  • RQ4在知识集成的各个组件中——上下文敏感的选择、异质性知识的使用,或语言模型容量——哪一个对性能影响最大?
  • RQ5一个简单的知识到文本框架能否作为知识增强CQA的强而通用的基线?

主要发现

  • 知识到文本的框架在CommonsenseQA数据集上实现了最先进性能,为知识增强CQA建立了强大且简洁的基线。
  • 使用真实世界检索知识的模型与使用理想知识的模型之间存在显著的性能差距,表明当前模型仅部分利用了可用知识。
  • 超过70%的模型错误归因于噪声或无关知识,凸显了上下文敏感知识选择的迫切需求。
  • 结构化知识与自然语言之间的异质性仍是主要瓶颈,即使简单的知识到文本转换也优于复杂的模型(如GNN和基于注意力的方法)。
  • 当前的大规模语言模型(如BERT和XLNet)仅编码了有限的常识知识,表明开发常识丰富的语言模型是未来极具前景的方向。
  • 异质性知识的利用——即使用来自ConceptNet和Wikipedia等多样化知识源——在提升CQA性能方面展现出巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。