Skip to main content
QUICK REVIEW

[论文解读] Cracking the Contextual Commonsense Code: Understanding Commonsense Reasoning Aptitude of Deep Contextual Representations

Jeff Da, Jungo Kasai|arXiv (Cornell University)|Oct 2, 2019
Topic Modeling参考文献 29被引用 13
一句话总结

本文通过在CSLB语义规范数据集上进行属性分类,探究了BERT编码常识知识的能力,揭示了其在视觉和感知属性方面存在不足。为此,本文提出了两种方法——基于属性缺陷选择数据的隐式微调,以及显式整合知识图嵌入,以提升常识推理能力,在使用极少数据的情况下,将MCScript 2.0上的准确率提升至85.5%,最高实现2%的准确率增益。

ABSTRACT

Pretrained deep contextual representations have advanced the state-of-the-art on various commonsense NLP tasks, but we lack a concrete understanding of the capability of these models. Thus, we investigate and challenge several aspects of BERT's commonsense representation abilities. First, we probe BERT's ability to classify various object attributes, demonstrating that BERT shows a strong ability in encoding various commonsense features in its embedding space, but is still deficient in many areas. Next, we show that, by augmenting BERT's pretraining data with additional data related to the deficient attributes, we are able to improve performance on a downstream commonsense reasoning task while using a minimal amount of data. Finally, we develop a method of fine-tuning knowledge graphs embeddings alongside BERT and show the continued importance of explicit knowledge graphs.

研究动机与目标

  • 评估BERT在编码与上下文相关的常识属性方面,相较于非上下文嵌入(如GloVe)的表现如何。
  • 识别BERT表征中仍存在缺陷的具体常识属性类型,特别是视觉和感知属性。
  • 通过数据增强与知识增强策略,解决上述缺陷,提升BERT在下游常识推理任务中的表现。
  • 评估结合隐式(基于数据)与显式(知识图)方法在增强上下文表征方面的有效性。

提出的方法

  • 使用逻辑回归分类器探测BERT的上下文表征,通过CSLB语义规范数据集中的(对象,属性)对进行预测,其中样本格式为[CLS] c_prefix noun c_affix adj. c_postfix [SEP]。
  • 基于BERT在特定属性上表现较差的结果,从RACE数据集中选择最小数据子集进行隐式微调,以更少的数据提升下游推理性能。
  • 在BERT微调过程中整合预训练的知识图嵌入(ConceptNet、WebChild、ATOMIC),显式注入缺失的常识知识。
  • 将基于RACE子集的隐式微调与显式知识图嵌入相结合,以利用两者在推理性能上的互补优势。
  • 利用逻辑分类器的属性匹配得分,量化嵌入对特定常识特征的编码能力,对比GloVe与BERT在597个属性上的表现。
  • 在MCScript 2.0常识推理基准上评估下游性能,将属性探测结果与实际推理性能提升关联。

实验结果

研究问题

  • RQ1BERT嵌入在多大程度上编码了视觉、感知和功能属性等常识属性?
  • RQ2哪些类型的常识属性在BERT的上下文表征中表示不足?
  • RQ3基于RACE数据集中缺陷驱动的最小子集对BERT进行微调,能否提升下游常识推理的准确率?
  • RQ4整合显式知识图嵌入(如ConceptNet、ATOMIC)是否能进一步提升BERT的推理性能?
  • RQ5结合隐式数据微调与显式知识图嵌入,能否在常识推理中实现协同增益?

主要发现

  • BERT在属性分类任务上显著优于GloVe,但在视觉和感知属性上仍表现不足,表明其常识编码仍存在持久性缺陷。
  • 基于属性缺陷选择的RACE最小子集进行微调,可在MCScript 2.0上实现2%的准确率提升,性能与使用完整RACE数据集相当。
  • 整合知识图嵌入可使下游准确率最高提升1.2个百分点,其中ConceptNet带来的增益最大(83.3% vs. 82.1%无KB时)。
  • 将RACE子集微调与所有知识图嵌入结合后,MCScript 2.0上的准确率达到最高值85.5%,表明两者具有互补性。
  • 知识图嵌入带来的提升与数据微调不同,二者结合可实现+1%的绝对准确率提升。
  • 语义规范任务(CSLB)在识别表征缺陷属性方面有效,基于该分析选择数据可实现高性能下游结果,且所需数据量极少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。