Skip to main content
QUICK REVIEW

[论文解读] Modelling Interaction of Sentence Pair with coupled-LSTMs

Pengfei Liu, Xipeng Qiu|arXiv (Cornell University)|May 18, 2016
Topic Modeling参考文献 20被引用 13
一句话总结

该论文提出耦合LSTM(C-LSTM),一种深度神经网络架构,通过两个相互依赖的LSTM实现句子对之间强而双向的交互,支持上下文、词级和短语级语义匹配。在两个大规模数据集上的实验表明,C-LSTMs在文本匹配任务中优于当前最先进方法,在Yahoo QA数据集上达到78.5% P@1(5),并在RTE和MQA基准测试中超越先前模型。

ABSTRACT

Recently, there is rising interest in modelling the interactions of two sentences with deep neural networks. However, most of the existing methods encode two sequences with separate encoders, in which a sentence is encoded with little or no information from the other sentence. In this paper, we propose a deep architecture to model the strong interaction of sentence pair with two coupled-LSTMs. Specifically, we introduce two coupled ways to model the interdependences of two LSTMs, coupling the local contextualized interactions of two sentences. We then aggregate these interactions and use a dynamic pooling to select the most informative features. Experiments on two very large datasets demonstrate the efficacy of our proposed architecture and its superiority to state-of-the-art methods.

研究动机与目标

  • 解决现有神经网络模型在句子对匹配任务中交互作用微弱或半强的局限性。
  • 开发一种深度架构,实现在词级与短语级上两句话之间的双向上下文交互。
  • 提升在大规模文本匹配任务(如文本蕴涵与问答)中的性能表现。
  • 通过堆叠耦合LSTM层构建更深网络架构,同时避免过拟合与梯度消失问题。
  • 通过可视化网络中学习到的交互模式,提升模型的可解释性。

提出的方法

  • 提出两种耦合LSTM机制:松散耦合(LC-LSTM)与紧密耦合(TC-LSTM),其中每个LSTM的隐藏状态均依赖于两句话的输入。
  • 使用四种方向变体(前向-前向、前向-后向、后向-前向、后向-后向)以捕捉双向上下文交互。
  • 通过拼接聚合四个方向的输出,并应用动态池化以选择最具信息量的特征。
  • 堆叠多层耦合LSTM以建模不同抽象层次上的多粒度交互。
  • 使用全连接层后接Softmax输出层,计算最终匹配得分。
  • 采用反向传播算法,以交叉熵损失函数进行端到端训练。

实验结果

研究问题

  • RQ1具有相互依赖LSTM的深度神经网络架构是否能比独立编码器更有效地建模句子对之间更强、更具上下文意义的交互?
  • RQ2与基于注意力机制或相似度矩阵的方法相比,两个LSTM之间的耦合机制在语义匹配任务中的性能表现如何?
  • RQ3堆叠多层耦合LSTM是否能提升大规模文本匹配基准测试的性能?
  • RQ4不同的耦合策略(松散与紧密)以及方向变体如何影响模型的准确率与泛化能力?
  • RQ5模型是否能学习到句子对中词语与短语之间可解释且有意义的交互模式?

主要发现

  • 所提出的耦合LSTM模型在Yahoo! QA数据集上达到78.5% P@1(5),显著优于次优方法(使用三层TC-LSTM时为77.0%)。
  • 在SNLI文本蕴涵数据集上,模型准确率达到86.1%,较之前SOTA高出1.2个百分点。
  • 在MQA任务中,LC-LSTM优于TC-LSTM,可能归因于参数更少,且在小规模语料上过拟合风险更低。
  • 堆叠三层LC-LSTM达到最佳性能,更深的堆叠未带来显著增益,表明模型已趋于收敛。
  • 可视化结果表明,网络中的单个神经元能够学习到句子间词语与短语之间有意义的局部交互模式。
  • 该模型对称的架构避免了非对称注意力模型中存在的顺序敏感性问题,提升了鲁棒性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。