[论文解读] Loss in Translation: Learning Bilingual Word Mapping with a Retrieval Criterion
该论文提出RCSLS,一种新颖的端到端训练目标,直接优化双语词向量对齐的CSLS检索标准,取代传统的平方损失。通过使用凸松弛和投影次梯度下降,RCSLS在词翻译基准上取得最先进性能,尤其在英语-中文等远距离语言对上表现优异,在NN标准下比正交Procrustes方法提升最高达+6.1%,在CSLS标准下提升最高达+3.5%。
Continuous word representations learned separately on distinct languages can be aligned so that their words become comparable in a common space. Existing works typically solve a least-square regression problem to learn a rotation aligning a small bilingual lexicon, and use a retrieval criterion for inference. In this paper, we propose an unified formulation that directly optimizes a retrieval criterion in an end-to-end fashion. Our experiments on standard benchmarks show that our approach outperforms the state of the art on word translation, with the biggest improvements observed for distant language pairs such as English-Chinese.
研究动机与目标
- 解决双语词映射中训练损失(平方损失)与推理标准(如CSLS)不一致的问题。
- 通过直接优化基于检索的目标而非依赖CSLS或ISF等后处理修正,提升词翻译性能。
- 实现端到端学习,将无监督词表示扩展至种子词典之外。
- 探究去除正交性约束是否能提升对齐质量。
- 在标准双语词翻译基准上实现最先进性能。
提出的方法
- 将CSLS标准进行凸松弛,作为可微分的训练目标,用于端到端优化。
- 使用投影次梯度下降优化松弛后的CSLS目标,实现高效训练。
- 提出统一框架,在训练过程中直接优化检索性能,消除推理阶段修正的需要。
- 利用单语数据中的无监督词表示,提升对未见词的泛化能力。
- 用面向检索的损失替代标准平方损失,使其更契合下游推理目标。
- 证明在新准则下训练的非正交映射可优于正交映射。
实验结果
研究问题
- RQ1与使用平方损失并辅以后处理修正相比,能否在训练期间直接优化CSLS检索标准以提升双语词对齐性能?
- RQ2将无监督词表示引入训练目标是否能增强对未见词的泛化能力?
- RQ3正交性约束对高质量双语词向量对齐是否必不可少?
- RQ4所提方法在标准基准上与MUSE和BabylonPartners等最先进方法相比表现如何?
- RQ5对检索标准进行端到端优化是否能在NN和CSLS推理标准下均带来更好性能?
主要发现
- RCSLS在28种语言对上达到最先进性能,当在相同词典上训练时,平均准确率相比MUSE提升+3.5%。
- 在完整的MUSE训练集上,RCSLS在NN标准下相比Procrustes方法提升+6.1%,在CSLS标准下提升+2.9%。
- 在英语-中文对上达到65.2%的准确率,显著优于先前方法。
- 通过RCSLS学习到的非正交映射优于正交映射,挑战了正交性为必需的假设。
- 该方法在词类比和相似性任务上影响极小,保持了对齐向量的语义质量。
- 在NN标准下的性能差距更大,表明RCSLS在点积空间中隐式学习到了CSLS度量的特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。