Skip to main content
QUICK REVIEW

[论文解读] Multi-view Sentence Representation Learning

Shuai Tang, Virginia R. de|arXiv (Cornell University)|May 18, 2018
Topic Modeling参考文献 49被引用 5
一句话总结

本文提出了一种多视角句子表示学习框架,通过对比学习联合训练一个RNN编码器和一个词向量平均线性编码器,利用余弦相似度最大化相邻句子表示的一致性。该方法在提升单个视角性能和集成表示方面均表现优异,在下游任务中超越了现有无监督模型,展现出强大的迁移能力。

ABSTRACT

Multi-view learning can provide self-supervision when different views are available of the same data. The distributional hypothesis provides another form of useful self-supervision from adjacent sentences which are plentiful in large unlabelled corpora. Motivated by the asymmetry in the two hemispheres of the human brain as well as the observation that different learning architectures tend to emphasise different aspects of sentence meaning, we create a unified multi-view sentence representation learning framework, in which, one view encodes the input sentence with a Recurrent Neural Network (RNN), and the other view encodes it with a simple linear model, and the training objective is to maximise the agreement specified by the adjacent context information between two views. We show that, after training, the vectors produced from our multi-view training provide improved representations over the single-view training, and the combination of different views gives further representational improvement and demonstrates solid transferability on standard downstream tasks.

研究动机与目标

  • 开发一个统一的多视角学习框架,利用不同的神经网络架构以提升句子表示学习效果。
  • 通过最大化未标注语料中相邻句子表示的一致性,利用分布假设(distributional hypothesis)。
  • 探究不对称处理机制(受大脑左半球序列处理与右半球并行处理启发)是否能提升表示质量。
  • 评估所学表示在无监督与有监督NLP任务中的迁移能力与泛化性能。
  • 确定融合不同视角的表示是否优于单视角训练的性能表现。

提出的方法

  • 该框架采用两种不同视角:一种是双向RNN编码器(f),另一种是线性词向量平均编码器(g)。
  • 训练目标为最大化两个视角中相邻句子表示之间的余弦相似度,定义为 $ a_{ij} = \cos(\mathbf{z}_i^f, \mathbf{z}_j^g) + \cos(\mathbf{z}_i^g, \mathbf{z}_j^f) $。
  • 模型在大规模未标注语料上端到端训练,采用对比学习策略,使相邻句子对的表示具有高一致性。
  • 在余弦相似度计算中使用经过后处理和归一化的表示 $ \hat{\mathbf{z}} $,以稳定训练过程。
  • 该框架无需多个数据源,仅通过同一输入的不同处理路径实现多视角学习。
  • 融合两个视角的表示以提升泛化能力,并捕捉句子语义的互补特性。

实验结果

研究问题

  • RQ1将基于RNN的编码器与线性词向量平均编码器结合,能否通过多视角学习提升句子表示质量?
  • RQ2在相邻句子上最大化两个不同视角的一致性,是否能带来优于单视角训练的表示性能?
  • RQ3在下游任务中,两种不同视角的集成表示与单个视角相比表现如何?
  • RQ4所提出的框架是否在标准评估基准上超越现有无监督句子表示模型?
  • RQ5受大脑偏侧化启发的信息处理功能不对称性,是否有利于学习多样化句子表示?

主要发现

  • 与单视角基线相比,多视角训练框架显著提升了RNN编码器与线性编码器的性能。
  • 两个视角表示的集成优于任一视角单独使用,证明了互补学习的有效性。
  • 在无监督评估任务(如句子相似度与文本蕴涵)中,该模型优于现有无监督迁移学习模型。
  • 在有监督下游任务中,该模型性能与最佳无监督模型相当或更优,表明其具备强大的迁移能力。
  • 公式(2)中定义的一致性函数($ a_{ij} = \cos(\mathbf{z}_i^f, \mathbf{z}_j^g) + \cos(\mathbf{z}_i^g, \mathbf{z}_j^f) $)优于鼓励自一致性的方法,因其可防止某一视角在训练中占主导地位。
  • 实证结果支持了这一假设:序列处理(RNN)与并行处理(线性)模式在学习丰富句子表示方面具有互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。