Skip to main content
QUICK REVIEW

[论文解读] A Hybrid Neural Network Model for Commonsense Reasoning

Pengcheng He, Xiaodong Liu|arXiv (Cornell University)|Jul 27, 2019
Topic Modeling参考文献 29被引用 7
一句话总结

该论文提出了一种混合神经网络(HNN)模型,通过共享的基于BERT的上下文编码器,将掩码语言模型(MLM)与语义相似度模型(SSM)相结合,以提升常识推理能力。HNN在三个基准测试中达到最先进性能:WNLI上为89.0%,WSC上为75.1%,PDP60上为90.0%,表明两种组件具有互补性,并通过使用排序损失的多任务学习联合提升性能。

ABSTRACT

This paper proposes a hybrid neural network (HNN) model for commonsense reasoning. An HNN consists of two component models, a masked language model and a semantic similarity model, which share a BERT-based contextual encoder but use different model-specific input and output layers. HNN obtains new state-of-the-art results on three classic commonsense reasoning tasks, pushing the WNLI benchmark to 89%, the Winograd Schema Challenge (WSC) benchmark to 75.1%, and the PDP60 benchmark to 90.0%. An ablation study shows that language models and semantic similarity models are complementary approaches to commonsense reasoning, and HNN effectively combines the strengths of both. The code and pre-trained models will be publicly available at https://github.com/namisan/mt-dnn.

研究动机与目标

  • 通过结合语言建模与语义相似度方法,提升自然语言理解中的常识推理能力。
  • 解决Winograd模式与代词消歧任务中的指代消解挑战,这些任务需要超越表面文本的隐含常识知识。
  • 探究掩码语言模型与语义相似度模型在常识推理中是否具有互补性。
  • 开发一种混合模型,通过共享BERT编码器的多任务学习,利用两种模型的归纳偏置。
  • 验证排序损失目标在提升模型在各类推理任务中泛化能力方面的有效性。

提出的方法

  • HNN模型整合了两个组件模型:掩码语言模型(MLM)与深度语义相似度模型(SSM),二者共享一个基于BERT的上下文编码器。
  • 每个组件模型使用针对其特定任务定制的输入与输出层:MLM在代词替换后预测下一个词的概率,而SSM计算代词与候选先行词表示之间的余弦相似度。
  • 最终预测通过加权融合策略结合两个模型的得分得到。
  • 训练过程分为两个阶段:首先在大规模原始文本上预训练BERT编码器,随后在WSCR数据集上进行多任务微调。
  • 引入排序损失以优化正确与错误先行词之间的相对顺序,从而提升泛化能力,超越二元分类。
  • 对最后六个训练周期的模型进行集成,进一步提升性能,尤其在WNLI基准上表现显著。

实验结果

研究问题

  • RQ1掩码语言模型与语义相似度模型在常识推理任务中是否具有互补性?
  • RQ2结合两种方法的混合模型是否能在常识推理基准上超越单一模型?
  • RQ3在训练中引入排序损失是否能提升指代消解任务的性能?
  • RQ4常识推理任务更适合表述为排序问题还是二元分类问题?
  • RQ5在最终预测中,集成多个模型检查点带来的性能增益有多大?

主要发现

  • HNN模型在WNLI基准上达到89.0%的新最先进准确率,较先前方法提升5.4个百分点。
  • 在WSC基准上,HNN达到75.1%的准确率,显著优于先前模型。
  • HNN在PDP60基准上取得90.0%的准确率,表明其在代词消歧任务上具有强大的泛化能力。
  • 消融实验表明,若移除MLM或SSM任一组件,性能均出现显著下降,证实二者具有互补作用。
  • 排序损失在WNLI、WSCR与WSC上均提升性能,其中WNLI的增益最大(提升2.3个百分点)。
  • 排序设定在HNN模型上始终比分类设定高出约2.5%的准确率,表明排序是该任务更有效的建模范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。