Skip to main content
QUICK REVIEW

[论文解读] Modelling Latent Translations for Cross-Lingual Transfer

Edoardo Maria Ponti, Julia Kreutzer|arXiv (Cornell University)|Jul 23, 2021
Topic Modeling参考文献 52被引用 10
一句话总结

本文提出了一种统一的潜在翻译模型,将神经机器翻译视为潜在变量以改善跨语言迁移,通过最小风险训练和多种翻译的蒙特卡洛采样实现端到端微调。与标准翻译方法相比,该方法在准确率上最高提升2.7个百分点,尤其在海地克里奥尔语等低资源语言上表现显著。

ABSTRACT

While achieving state-of-the-art results in multiple tasks and languages, translation-based cross-lingual transfer is often overlooked in favour of massively multilingual pre-trained encoders. Arguably, this is due to its main limitations: 1) translation errors percolating to the classification phase and 2) the insufficient expressiveness of the maximum-likelihood translation. To remedy this, we propose a new technique that integrates both steps of the traditional pipeline (translation and classification) into a single model, by treating the intermediate translations as a latent random variable. As a result, 1) the neural machine translation system can be fine-tuned with a variant of Minimum Risk Training where the reward is the accuracy of the downstream task classifier. Moreover, 2) multiple samples can be drawn to approximate the expected loss across all possible translations during inference. We evaluate our novel latent translation-based model on a series of multilingual NLU tasks, including commonsense reasoning, paraphrase identification, and natural language inference. We report gains for both zero-shot and few-shot learning setups, up to 2.7 accuracy points on average, which are even more prominent for low-resource languages (e.g., Haitian Creole). Finally, we carry out in-depth analyses comparing different underlying NMT models and assessing the impact of alternative translations on the downstream performance.

研究动机与目标

  • 解决传统基于翻译的跨语言迁移方法中存在的翻译错误累积问题,以及仅使用最高似然翻译的局限性。
  • 克服下游分类器缺乏反馈以改进特定自然语言理解任务翻译质量的问题。
  • 通过使用预训练模型初始化翻译器与分类器,实现样本高效的零样本和少样本迁移。
  • 研究翻译质量与模型选择对多语言自然语言理解基准下游性能的影响。
  • 探索除1-best翻译外的其他翻译是否可通过蒙特卡洛采样提升集成分类性能。

提出的方法

  • 将中间翻译视为潜在随机变量,将翻译与分类组件整合为单一端到端模型。
  • 采用最小风险训练(MRT)的变体,将下游分类损失反向传播至神经机器翻译(NMT)系统,实现任务特定的微调。
  • 使用蒙特卡洛采样从潜在分布中采样多个翻译,以近似期望损失并提升鲁棒性。
  • 设计一种与任意预训练NMT和分类器对兼容的通用微调方案,避免词汇不匹配问题。
  • 利用预训练模型同时初始化翻译器与分类器,实现无需完整微调的零样本和少样本学习。
  • 使用源自分类器性能的梯度信号优化NMT系统,而非仅依赖BLEU等自动指标。

实验结果

研究问题

  • RQ1与标准流水线方法相比,将翻译与分类整合为单一潜在变量模型是否能提升跨语言迁移性能?
  • RQ2通过下游分类器的反馈微调NMT系统,是否能提升特定任务的翻译质量?
  • RQ3与仅依赖1-best翻译相比,采样多个翻译在多大程度上能提升分类准确率?
  • RQ4在多语言自然语言理解任务中,翻译质量(以BLEU衡量)与下游性能增益之间是否存在相关性?
  • RQ5k-best翻译的内部排序是否与其对集成预测准确率的贡献相关?

主要发现

  • 所提方法在标准翻译迁移方法基础上,平均准确率最高提升2.7个百分点,低资源语言(如海地克里奥尔语)的提升最高达5.6个百分点。
  • 性能提升在低资源设置下最为显著,表明具有强大的零样本和少样本泛化能力。
  • 低质量翻译(如海地克里奥尔语的BLEU仅为12.6)从多采样中获益更多,准确率提升约5个百分点。
  • k-best翻译的排序与其对集成准确率的贡献之间无强相关性,表明低排序翻译可纠正高排序翻译的错误。
  • 翻译的内部排序(如对数概率)无法预测下游性能,因为低排序翻译有时能做出正确预测,而高排序翻译则失败。
  • 翻译质量(BLEU)是性能增益的强预测因子,而多语言覆盖范围和模型选择(如MarianMT与mBART及Google Cloud)对下游结果有显著影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。