Skip to main content
QUICK REVIEW

[论文解读] Learning Bilingual Sentence Embeddings via Autoencoding and Computing Similarities with a Multilayer Perceptron

Yunsu Kim, Hendrik Rosendahl|arXiv (Cornell University)|Jun 5, 2019
Topic Modeling参考文献 42被引用 4
一句话总结

该论文提出了一种联合训练框架,结合自编码与神经机器翻译,仅使用平行语料和单语语料即可学习双语句子嵌入,无需引入中间语言。通过在这些嵌入上训练多层感知机(MLP),计算句子对之间的相似度,该方法在单一模型下实现了句子对齐恢复和WMT 2018平行语料库过滤任务中的优异性能。

ABSTRACT

We propose a novel model architecture and training algorithm to learn bilingual sentence embeddings from a combination of parallel and monolingual data. Our method connects autoencoding and neural machine translation to force the source and target sentence embeddings to share the same space without the help of a pivot language or an additional transformation. We train a multilayer perceptron on top of the sentence embeddings to extract good bilingual sentence pairs from nonparallel or noisy parallel data. Our approach shows promising performance on sentence alignment recovery and the WMT 2018 parallel corpus filtering tasks with only a single model.

研究动机与目标

  • 开发一种统一的、端到端的方法,仅使用目标语种对的平行语料和单语语料,学习双语句子嵌入。
  • 消除对中间语言或N元平行语料的依赖,这些资源往往不可用或不切实际。
  • 通过在句子嵌入上训练可学习的相似度度量(MLP),提升平行语料库挖掘与过滤的性能。
  • 评估并比较不同相似度度量方法(余弦相似度、MLP)在下游任务中进行双语句子匹配的表现。
  • 探究负样本质量对MLP相似度学习训练的影响。

提出的方法

  • 训练一个共享解码器目标的序列到序列NMT模型,同时处理源语句和目标语句,实现双语句子嵌入的联合学习。
  • 集成一个自编码器模块,用于重建源语句和目标语句,强制在共享嵌入空间中保持语义一致性。
  • 使用多层感知机(MLP)作为可微分的相似度函数,预测某对源-目标句子是否对齐。
  • 在正样本(平行)和负样本(非平行或低质量)句子对的组合上训练MLP,以学习细微的相似度差异。
  • 通过联合目标函数端到端优化整个系统:NMT损失用于翻译任务,自编码损失用于重建任务。
  • 利用来自噪声平行语料库(如ParaCrawl)的评分并排序的句子对,构建不同质量等级的负样本集合用于MLP训练。

实验结果

研究问题

  • RQ1能否仅使用平行语料和单语语料,无需中间语言,通过单一模型联合学习双语句子嵌入?
  • RQ2多层感知机作为可学习的相似度度量方法,在匹配源语句和目标语句嵌入方面效果如何?
  • RQ3MLP相似度模型的负样本训练中,最优的负样本程度为何?
  • RQ4在过滤噪声平行语料库时,MLP相似度与余弦相似度等简单度量方法相比表现如何?
  • RQ5通过自编码集成单语语料是否能提升双语句子嵌入的质量,从而改善下游任务表现?

主要发现

  • 所提方法在WMT 2018平行语料库过滤任务中表现具有竞争力,性能与依赖复杂翻译和语言模型组合的系统相当或更优。
  • MLP相似度模型在过滤任务中优于余弦相似度,尤其在区分中等质量句子对方面表现更优,且支持批量计算,效率极高。
  • 适度的负样本程度——即从噪声平行语料库中选取得分最差的60%样本——可使MLP性能达到最佳,有效平衡了对可接受与低质量句子对的区分能力。
  • 随机采样的负样本表现出意外的优异性能,表明中等平均负样本程度是关键因素,显式排序可能并非必要。
  • 该模型在句子对齐恢复任务中表现强劲,表明共享嵌入空间能有效捕捉双语语义对应关系。
  • 将自编码与NMT结合,强制源语句和目标语句嵌入在共享空间中对齐,提升了模型鲁棒性,且无需额外的转换或中间语言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。