Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Sentence Representations Using Sequence Consistency

Siddhartha Brahma|arXiv (Cornell University)|Aug 10, 2018
Topic Modeling参考文献 21被引用 6
一句话总结

本文提出 ConsSent,一种通过训练句子编码器来区分一致句与扰动句序列的无监督方法,以学习句子表征。通过在六类词粒度扰动和成对合并约束下强制实现序列一致性,ConsSent 在迁移学习和语言探针任务上达到最先进性能,优于所有无监督和有监督基线模型,集成模型在 SentEval 基准上的平均得分为 84.7。

ABSTRACT

Computing universal distributed representations of sentences is a fundamental task in natural language processing. We propose ConsSent, a simple yet surprisingly powerful unsupervised method to learn such representations by enforcing consistency constraints on sequences of tokens. We consider two classes of such constraints -- sequences that form a sentence and between two sequences that form a sentence when merged. We learn sentence encoders by training them to distinguish between consistent and inconsistent examples, the latter being generated by randomly perturbing consistent examples in six different ways. Extensive evaluation on several transfer learning and linguistic probing tasks shows improved performance over strong unsupervised and supervised baselines, substantially surpassing them in several cases. Our best results are achieved by training sentence encoders in a multitask setting and by an ensemble of encoders trained on the individual tasks.

研究动机与目标

  • 开发一种简单但有效的无监督方法,用于学习无需外部标签的通用句子表征。
  • 通过在词元序列及其扰动版本上施加一致性约束,提升句子表征质量。
  • 评估多任务训练和模型集成在学习鲁棒句子编码器方面的有效性。
  • 在迁移学习和语言探针任务上,将性能与强大的无监督和有监督基线进行基准对比。

提出的方法

  • 该方法训练一个句子编码器,以区分一致句子与六类扰动版本:删除、置换、插入、替换,以及两种形式的句子对合并(连续与非连续划分)。
  • 一致性定义为:若一个序列构成有效句子,则其为一致;若将两个序列合并后形成有效句子,则二者一致。
  • 对 BillionWord 语料库中的句子应用扰动,生成负样本(不一致),而原始句子作为正样本。
  • 在多个一致性任务(如序列一致性、成对一致性)上分别训练多个句子编码器,并通过多任务学习或模型集成进行结合。
  • 最终模型采用神经网络编码器(如 BiLSTM)与对比学习目标,以最大化正样本对的一致性,最小化负样本对的一致性。
  • 通过 SentEval 基准在 20 项下游任务(包括迁移学习和语言探针任务)上评估性能。

实验结果

研究问题

  • RQ1通过在词元序列及其扰动版本上施加一致性约束,能否改进无监督句子表征学习?
  • RQ2在单个序列和成对序列上同时训练一致性任务,如何影响所学句子表征的质量?
  • RQ3多任务训练和模型集成在无监督句子表征学习中,相较于单任务训练,能在多大程度上提升性能?
  • RQ4所提出方法在迁移学习和语言探针基准上,与强有监督和无监督基线相比表现如何?

主要发现

  • ConsSent 模型的集成在 SentEval 基准上取得了 84.7 的平均得分,显著优于最佳单模型(ConsSent-R(2) 的 81.9)和现有无监督方法。
  • 在多任务设置下训练的 ConsSent-MT(3) 取得了 82.4 的平均得分,较 QuickThoughts 提升近 7 分,且在自然语言推理和机器翻译任务上超越了有监督基线。
  • 在单个序列上训练的模型(如 ConsSent-D、ConsSent-R)始终优于在成对序列上训练的模型(如 ConsSent-C、ConsSent-N),表明无配对一致性具有更强的归纳偏差。
  • 最佳单模型 ConsSent-R(2) 取得了 81.9 的平均得分,而 ConsSent-D(5) 在 10 项语言探针任务中的 5 项上表现最佳。
  • 语言建模目标基线表现较差,平均得分低于 60,凸显了仅使用语言模型预训练在句子表征学习中的局限性。
  • ConsSent-R(2) 和集成模型在大多数任务上的平均得分高于有监督的 Seq2Tree 模型,证明了所提无监督方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。