Skip to main content
QUICK REVIEW

[论文解读] PAWS: Paraphrase Adversaries from Word Scrambling

Yuan Zhang, Jason Baldridge|arXiv (Cornell University)|Apr 1, 2019
Topic Modeling参考文献 32被引用 14
一句话总结

该论文提出了PAWS,一个包含108,463对高词汇重叠句子对的新释义识别数据集,这些句子对经过精心设计,旨在挑战模型对词序和句法结构的敏感度。该数据集通过受控的词语乱序和回译生成,并经人工评分员验证。当将其纳入训练时,显著提升了最先进模型的性能——在具有挑战性的句子对上,准确率从不足40%提升至85%,证明了其在推动自然语言处理模型上下文和结构理解能力方面的有效性。

ABSTRACT

Existing paraphrase identification datasets lack sentence pairs that have high lexical overlap without being paraphrases. Models trained on such data fail to distinguish pairs like flights from New York to Florida and flights from Florida to New York. This paper introduces PAWS (Paraphrase Adversaries from Word Scrambling), a new dataset with 108,463 well-formed paraphrase and non-paraphrase pairs with high lexical overlap. Challenging pairs are generated by controlled word swapping and back translation, followed by fluency and paraphrase judgments by human raters. State-of-the-art models trained on existing datasets have dismal performance on PAWS (<40% accuracy); however, including PAWS training data for these models improves their accuracy to 85% while maintaining performance on existing tasks. In contrast, models that do not capture non-local contextual information fail even with PAWS training examples. As such, PAWS provides an effective instrument for driving further progress on models that better exploit structure, context, and pairwise comparisons.

研究动机与目标

  • 解决现有释义数据集中缺乏高词汇重叠的非释义句子对的问题,此类问题导致模型错误地将语义不同的句子分类为释义句。
  • 构建一个诊断性基准,有效衡量模型捕捉非局部上下文和句法依赖关系的能力。
  • 开发一个可扩展的、经人工标注的数据集,在保持高词汇重叠的同时,平衡释义与非释义标签。
  • 证明在训练中引入PAWS可显著提升模型在真实世界释义识别任务中的鲁棒性,且不会降低其在现有基准上的性能。

提出的方法

  • 通过在Quora和Wikipedia的句子上应用受控的词语乱序,生成句子对,同时保持语法正确性和语义合理性。
  • 利用回译生成额外的释义和非释义变体,以增加句法结构的多样性与覆盖范围。
  • 进行两阶段人工标注:第一阶段评估流畅性与释义等价性;第二阶段应用基于规则的重组,以平衡正负样本标签。
  • 以Quora问题对(QQP)语料库为基础进行预训练和微调,PAWS则用作诊断和辅助训练集。
  • 在QQP和PAWS上训练并评估多种模型(包括BERT、DIIN、BiLSTM和BOW),以比较性能并分析泛化能力和鲁棒性。
  • 使用PAWS测试集的AUC分数评估模型性能,并分析学习曲线,以确定获得最佳性能增益所需的PAWS样本数量。

实验结果

研究问题

  • RQ1一个具有高词汇重叠但语义相反的句子对数据集,能否有效暴露最先进释义模型的弱点?
  • RQ2与现有数据集相比,在训练中引入PAWS在多大程度上能提升模型在具有挑战性的释义识别任务中的准确率?
  • RQ3模型在PAWS上的表现与模型架构的复杂度以及捕捉非局部上下文的能力之间有何关联?
  • RQ4在某一领域(如Quora)上训练的模型能否有效泛化到另一领域(如Wikipedia)?跨领域数据是否能提升领域内性能?
  • RQ5达到显著性能增益所需的最少PAWS样本数量是多少?性能是否会随着数据量增加而持续提升?

主要发现

  • 仅在QQP上微调的模型在PAWS上的准确率低于40%,表明其在区分语义不同但词汇高度相似的句子对方面存在严重失败。
  • 在QQP和PAWS上同时微调BERT后,其在PAWS上的准确率提升至85%,同时在QQP上保持高性能,证明了PAWS作为训练和诊断资源的有效性。
  • 学习曲线显示,随着训练样本数量的增加,模型在PAWS上的表现持续提升,且即使使用12,000个PAWS样本,BERT和DIIN模型仍未达到收敛。
  • 跨领域训练(如Quora + Wikipedia PAWS)带来显著性能提升:在两个领域上训练的DIIN模型在Wikipedia PAWS上的AUC达到93.8%,相比仅在Quora上训练的模型提升了12.1个百分点。
  • BERT在准确率上优于DIIN,但计算成本较高;DIIN仅含590,000个参数,性能具有竞争力,更适合低延迟、资源受限的环境。
  • 如BOW和基础注意力机制模型即使在PAWS训练数据上也未能提升性能,证实了PAWS能有效衡量模型对句法结构和上下文的敏感度,而不仅仅是词汇重叠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。