Skip to main content
QUICK REVIEW

[论文解读] Neural Paraphrase Identification of Questions with Noisy Pretraining

Gaurav Singh Tomar, Thyago S.P.C. Duque|arXiv (Cornell University)|Apr 15, 2017
Topic Modeling参考文献 21被引用 9
一句话总结

本文提出了一种简单而有效的神经方法,用于问题释义识别,采用字符n-gram嵌入和大规模自动收集的释义语料库上的噪声预训练。通过用字符n-gram表示替换词嵌入,并在Paralex上完成全模型预训练后微调Quora数据集,该方法实现了最先进性能,优于复杂架构,展示了任务特定、噪声预训练的强大能力。

ABSTRACT

We present a solution to the problem of paraphrase identification of questions. We focus on a recent dataset of question pairs annotated with binary paraphrase labels and show that a variant of the decomposable attention model (Parikh et al., 2016) results in accurate performance on this task, while being far simpler than many competing neural architectures. Furthermore, when the model is pretrained on a noisy dataset of automatically collected question paraphrases, it obtains the best reported performance on the dataset.

研究动机与目标

  • 通过比现有模型更简单的神经架构,提升问题释义识别性能。
  • 探究字符n-gram嵌入在此任务中是否优于词嵌入。
  • 评估在大规模、噪声、领域内释义语料库(Paralex)上进行预训练,对在较小规模、人工标注数据集(Quora)上性能提升的影响。
  • 确定在噪声数据上进行全模型预训练是否优于仅预训练嵌入层。

提出的方法

  • 模型采用可分解注意力架构(DecAtt),并基于字符n-gram嵌入之和的修改输入表示,而非词嵌入。
  • 对每个输入序列应用大小为c的上下文窗口,以形成局部短语表示。
  • 模型执行三个步骤:注意(使用前馈网络计算短语对之间的注意力分数)、比较(计算相似性向量)和聚合(使用另一个前馈网络预测二元释义标签)。
  • 模型在Paralex数据集上进行预训练——一个大规模、自动收集的释义语料库——之后在Quora数据集上进行微调。
  • 对于短词,模型回退使用完整单词本身作为输入,每个单词添加边界标记。
  • 最终模型中应用了自注意力机制,显著提升了性能,尤其在捕捉长距离依赖方面。

实验结果

研究问题

  • RQ1用字符n-gram嵌入替换词嵌入是否能提升问题释义识别的性能?
  • RQ2在大规模、噪声、领域内释义语料库(Paralex)上预训练整个模型,是否能提升在较小规模、人工标注数据集(Quora)上的性能?
  • RQ3全模型预训练是否比仅预训练嵌入层更有效?
  • RQ4随着Quora训练数据量的增加,模型性能如何变化,特别是在结合噪声预训练时?

主要发现

  • 基于字符n-gram的模型(DecAtt char)即使无任何预训练,也优于使用GloVe嵌入的词基模型,表明字符级表示的优越性。
  • 在Paralex上仅预训练字符n-gram嵌入(DecAtt paralex-char)相比非预训练基线,性能显著提升。
  • 表现最佳的模型pt-DecAtt char,即在Paralex上预训练所有模型参数,实现在Quora数据集上的最先进性能,优于更复杂的架构如BiMPM。
  • 当训练数据有限时,噪声预训练带来的增益更大,如图1的对数尺度对比所示,突显了昂贵的人工标注与更便宜的噪声预训练之间的权衡。
  • 预训练模型能有效利用自注意力机制,相比未预训练模型(常完全跳过自注意力),在捕捉长距离依赖方面表现更优。
  • 示例显示,最佳模型能捕捉涉及词序和拼写变化的细微释义,但仍难以处理高度复杂的释义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。