Skip to main content
QUICK REVIEW

[论文解读] "The Sum of Its Parts": Joint Learning of Word and Phrase Representations with Autoencoders

Rémi Lebret, Ronan Collobert|arXiv (Cornell University)|Jun 18, 2015
Topic Modeling参考文献 27被引用 6
一句话总结

本文提出一种联合学习框架,利用自编码器同时通过平均方法训练词向量及其组合短语表示。通过利用词共现统计信息并结合低秩近似与随机优化,该模型能够从短语级向量中重建出原始词向量,在一项新颖的短语检索任务上达到最先进性能,同时在标准词向量评估基准上也保持了具有竞争力的结果。

ABSTRACT

Recently, there has been a lot of effort to represent words in continuous vector spaces. Those representations have been shown to capture both semantic and syntactic information about words. However, distributed representations of phrases remain a challenge. We introduce a novel model that jointly learns word vector representations and their summation. Word representations are learnt using the word co-occurrence statistical information. To embed sequences of words (i.e. phrases) with different sizes into a common semantic space, we propose to average word vector representations. In contrast with previous methods which reported a posteriori some compositionality aspects by simple summation, we simultaneously train words to sum, while keeping the maximum information from the original vectors. We evaluate the quality of the word representations on several classical word evaluation tasks, and we introduce a novel task to evaluate the quality of the phrase representations. While our distributed representations compete with other methods of learning word representations on word evaluations, we show that they give better performance on the phrase evaluation. Such representations of phrases could be interesting for many tasks in natural language processing.

研究动机与目标

  • 开发一个统一模型,联合学习分布式词向量表示及其组合短语表示。
  • 通过训练词向量在共享语义空间中具有有意义的可加性,来提升短语表示的质量。
  • 在无需重新训练的情况下,仅利用共现统计信息,实现对新短语表示的高效推理。
  • 在一项新颖任务上评估短语表示:从短语向量中检索其组成词。
  • 证明联合训练的表示能够比标准词嵌入模型更好地捕捉复杂线性子结构。

提出的方法

  • 利用词共现矩阵的低秩近似来从无标注文本中学习初始词向量表示。
  • 采用随机优化过程,在同时训练词向量的同时,学习从其平均向量表示中重建原始词向量。
  • 通过对其组成词的向量表示进行平均,形成短语表示,从而实现可变长度短语在统一语义空间中的嵌入。
  • 使用自编码器架构,强制要求短语向量能够重建原始词向量,从而学习有意义的组合结构。
  • 模型支持两种推理模式:(1) 对已知词向量进行平均;(2) 使用基于共现统计信息学习到的编码函数,对未见词或短语进行推理。
  • 通过利用预先计算的共现计数,该框架能够实现高效且低内存的新型短语表示推理。

实验结果

研究问题

  • RQ1联合训练词向量与短语表示是否能提升短语级语义向量的质量?
  • RQ2从平均后的短语向量中学习重建词向量,是否能产生比标准词嵌入模型更优的组合表示?
  • RQ3该模型能否仅利用共现统计信息,泛化到新短语和未见词?
  • RQ4在词级与短语级评估任务上,该模型的性能与当前最先进方法相比如何?
  • RQ5不同的推理策略——向量平均与基于共现的编码——是否会产生不同但有意义的短语表示?

主要发现

  • 该模型在标准词相似度与类比任务上表现具有竞争力,表明联合训练能够保持高质量的词向量表示。
  • 在一项新颖的短语评估任务——从短语向量中检索其组成词——上,该模型显著优于当前最先进方法(如GloVe与word2vec)。
  • 该模型在长句短语上仍保持强劲性能,而GloVe因依赖成对共现比率,随短语长度增加而性能下降。
  • 两种推理策略——向量平均与基于共现的编码——生成了不同但有意义的短语表示,分别捕捉了不同语义方面(如实体相似性与信息量)。
  • 该模型能够仅利用词共现计数,实现高效且低内存的新型短语表示推理,而无需重新训练整个系统。
  • 学习到的编码函数可通过在大规模语料中统计上下文词的共现次数,有效表示未见词与短语。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。