Skip to main content
QUICK REVIEW

[论文解读] Improving Multilingual Sentence Embedding using Bi-directional Dual Encoder with Additive Margin Softmax

Yinfei Yang, Gustavo Hernández Ábrego|arXiv (Cornell University)|Feb 22, 2019
Topic Modeling参考文献 27被引用 11
一句话总结

该论文提出一种具有加法边缘Softmax的双向双编码器模型,以提升多语言句子嵌入在双语语料检索中的性能。通过在嵌入空间中为正样本对(翻译对)与负样本对(非翻译对)施加边缘约束,该方法在UN平行语料库上达到最先进性能(P@1 > 86%),并在BUCC数据挖掘任务上取得新的最先进结果(F1最高达97.24%),当结合BERT重排序时表现更优。

ABSTRACT

In this paper, we present an approach to learn multilingual sentence embeddings using a bi-directional dual-encoder with additive margin softmax. The embeddings are able to achieve state-of-the-art results on the United Nations (UN) parallel corpus retrieval task. In all the languages tested, the system achieves P@1 of 86% or higher. We use pairs retrieved by our approach to train NMT models that achieve similar performance to models trained on gold pairs. We explore simple document-level embeddings constructed by averaging our sentence embeddings. On the UN document-level retrieval task, document embeddings achieve around 97% on P@1 for all experimented language pairs. Lastly, we evaluate the proposed model on the BUCC mining task. The learned embeddings with raw cosine similarity scores achieve competitive results compared to current state-of-the-art models, and with a second-stage scorer we achieve a new state-of-the-art level on this task.

研究动机与目标

  • 通过一种新颖的训练目标,提升多语言句子嵌入质量,以优化双语语料检索。
  • 通过边缘约束稳定嵌入空间,减少无监督双语语料挖掘中的噪声匹配。
  • 从单语网络数据中挖掘高质量平行语料,用于训练NMT模型。
  • 通过简单平均法将句子级嵌入扩展为文档级表示。
  • 通过两阶段方法结合BERT重排序,提升在BUCC基准上的双语语料挖掘性能。

提出的方法

  • 采用双向双编码器架构,将源语言和目标语言句子映射到共享的多语言嵌入空间。
  • 应用加法边缘Softmax,强制在嵌入空间中为正样本对(翻译对)与负样本对(非翻译对)设置最小角度边缘。
  • 在两个方向(从源到目标和从目标到源)均施加边缘,以提升对称性与泛化能力。
  • 采用简化的单向边缘公式(公式10),在保持性能的同时降低计算开销。
  • 通过模型生成的句子级嵌入进行平均,构建文档嵌入。
  • 使用微调后的多语言BERT模型作为第二阶段评分器,基于上下文相似性对候选对进行重排序。

实验结果

研究问题

  • RQ1具有加法边缘Softmax的双向双编码器能否提升多语言句子嵌入在双语语料检索中的质量?
  • RQ2基于边缘的训练目标是否能使真实翻译对在嵌入空间中形成更紧凑、更易分离的聚类?
  • RQ3所生成的句子嵌入能否在UN平行语料库检索任务上达到最先进性能?
  • RQ4由句子嵌入平均得到的文档级嵌入能否在文档级双语语料挖掘任务中达到或超越最先进水平?
  • RQ5原始嵌入与BERT重排序结合能否在BUCC双语语料挖掘基准上实现新的最先进结果?

主要发现

  • 该模型在所有测试语言的UN平行语料库上均实现P@1 ≥ 86%,证明其达到最先进性能。
  • 使用该方法挖掘的平行语料训练的NMT模型,其性能与使用标准双语语料训练的模型相当或更优。
  • 通过平均句子嵌入构建的文档级嵌入在UN文档级检索任务上达到约97%的P@1。
  • 模型原始余弦相似度得分在BUCC任务上表现具有竞争力,F1分数范围为84.6至89.2。
  • 结合BERT重排序后,该模型在BUCC任务上达到新的最先进水平,F1分数范围为93.38(ru-en)至97.24(de-en)。
  • 失败案例分析显示,模型在语义相似但数字或实体不同的句子对上表现不佳,而BERT评分器能有效纠正此类错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。