Skip to main content
QUICK REVIEW

[论文解读] Fake Sentence Detection as a Training Task for Sentence Encoding

Viresh Ranjan, Hee Young Kwon|arXiv (Cornell University)|Aug 11, 2018
Topic Modeling参考文献 13被引用 4
一句话总结

本文提出将虚假句子检测作为句子编码器的一种新型无监督预训练任务,通过词语乱序或删除等方式对句子进行破坏,生成虚假变体;模型学习区分真实与虚假句子,在仅使用100万句数据、训练时间不足20小时的情况下,性能可与在6400万句数据上训练的Skipthought模型相媲美。

ABSTRACT

Sentence encoders are typically trained on language modeling tasks with large unlabeled datasets. While these encoders achieve state-of-the-art results on many sentence-level tasks, they are difficult to train with long training cycles. We introduce fake sentence detection as a new training task for learning sentence encoders. We automatically generate fake sentences by corrupting original sentences from a source collection and train the encoders to produce representations that are effective at detecting fake sentences. This binary classification task turns to be quite efficient for training sentence encoders. We compare a basic BiLSTM encoder trained on this task with a strong sentence encoding models (Skipthought and FastSent) trained on a language modeling task. We find that the BiLSTM trains much faster on fake sentence detection (20 hours instead of weeks) using smaller amounts of data (1M instead of 64M sentences). Further analysis shows the learned representations capture many syntactic and semantic properties expected from good sentence representations.

研究动机与目标

  • 解决现有基于语言建模的无监督句子编码方法存在的训练时间长、计算成本高的问题。
  • 探究是否可通过判别性二分类任务(即检测虚假句子)获得有效句子表征,且所需数据更少、收敛更快。
  • 评估虚假句子检测是否能捕捉与当前最先进模型相当或更优的句法与语义特性,而后者通常在大规模语言建模上进行训练。
  • 在减少对大规模数据集和长时间训练周期依赖的同时,保持或提升下游句级任务的性能。

提出的方法

  • 通过两种数据扰动技术生成虚假句子:词语乱序(随机交换两个词语)和词语删除(随机移除一个词语)。
  • 构建一个二分类数据集,其中每个样本为原始真实句子或由其衍生的被破坏版本(即虚假句子)。
  • 使用基于BiLSTM的句子编码器,通过在编码表示上添加三层前馈网络,预测输入句子是否为真实句子。
  • 采用单层BiLSTM,隐藏状态维度为2048,并使用预训练的300维GloVe词向量作为词表示。
  • 使用SGD训练15个周期,批量大小为64,在单张GPU上训练时间不足20小时即实现收敛。
  • 在下游任务(包括自然语言推理、图像-标题检索,以及句法与语义性质的探针任务)上评估学习到的表征性能。

实验结果

研究问题

  • RQ1基于检测小规模、受控的句子扰动(即虚假句子)的二分类任务,能否作为句子编码器的有效无监督预训练目标?
  • RQ2在下游句级任务上,基于虚假句子检测训练的BiLSTM模型与Skipthought、FastSent等强基线模型相比表现如何?
  • RQ3通过虚假句子检测学习到的表征在多大程度上能捕捉句子的句法与语义特性?
  • RQ4与在6400万句数据上训练的模型相比,该方法能否在显著减少数据量(100万句)和训练时间(20小时)的前提下取得具有竞争力的结果?

主要发现

  • 在七个自然语言推理任务中的五个,以及COCO数据集上的图像-标题检索任务中,基于虚假句子检测训练的BiLSTM模型表现优于在6400万句数据上训练的Skipthought模型。
  • 虚假句子检测的词语乱序与词语删除变体在十项探针任务中的六项上准确率高于Skipthought,尤其在词语内容(WC)、词对乱序(BShift)和语义异常检测(SOMO)任务上提升显著。
  • 与需数周训练时间的Skipthought相比,该方法将训练时间缩短至单张GPU上不足20小时,且仅使用100万句数据,而非6400万句。
  • 在句法探针任务(如树深度,TreeDepth)中,词语乱序方法表现优于Skipthought,优势明显。
  • 虚假句子检测学习到的表征对语义与句法扰动更敏感,体现在对乱序词对和语义异常的检测准确率更高。
  • 即使仅在小规模数据子集(100万句)上训练,该模型在多个评估设置中仍优于在完整BookCorpus数据集上训练的Skipthought,展现出优异的数据效率与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。