Skip to main content
QUICK REVIEW

[论文解读] On the Limitations of Cross-lingual Encoders as Exposed by Reference-Free Machine Translation Evaluation

Wei Zhao, Goran Glavašš|arXiv (Cornell University)|May 3, 2020
Topic Modeling参考文献 55被引用 4
一句话总结

本文研究了使用跨语言编码器(如 M-BERT 和 LASER)进行无参考句法机器翻译(MT)评估,识别出其主要局限性:互译文本之间的语义不匹配,以及无法惩罚‘翻译体’——即逐字、低质量的翻译。作者提出了两种改进方法:跨语言向量空间重对齐,以及与目标语言侧语言模型相结合,使段落级别的相关性比基于参考的 BLEU 提高了 5.7 分。

ABSTRACT

Evaluation of cross-lingual encoders is usually performed either via zero-shot cross-lingual transfer in supervised downstream tasks or via unsupervised cross-lingual textual similarity. In this paper, we concern ourselves with reference-free machine translation (MT) evaluation where we directly compare source texts to (sometimes low-quality) system translations, which represents a natural adversarial setup for multilingual encoders. Reference-free evaluation holds the promise of web-scale comparison of MT systems. We systematically investigate a range of metrics based on state-of-the-art cross-lingual semantic representations obtained with pretrained M-BERT and LASER. We find that they perform poorly as semantic encoders for reference-free MT evaluation and identify their two key limitations, namely, (a) a semantic mismatch between representations of mutual translations and, more prominently, (b) the inability to punish "translationese", i.e., low-quality literal translations. We propose two partial remedies: (1) post-hoc re-alignment of the vector spaces and (2) coupling of semantic-similarity based metrics with target-side language modeling. In segment-level MT evaluation, our best metric surpasses reference-based BLEU by 5.7 correlation points.

研究动机与目标

  • 评估跨语言编码器在无参考 MT 评估中的有效性,采用绕过人工参考的对抗性设置。
  • 识别最先进的多语言编码器在源译与系统译文之间语义相似性任务中的固有缺陷。
  • 解决当前度量方法无法检测‘翻译体’——即逐字、不自然的翻译——的问题,此类问题在 MT 输出中普遍存在。
  • 通过引入后处理对齐和与目标语言侧语言模型的集成,改进无参考 MT 评估。
  • 证明无参考度量方法在与人工判断的相关性上可超越基于参考的 BLEU。

提出的方法

  • 本文基于 M-BERT 和 LASER 的跨语言语义表征,使用词移动距离(WMD)和余弦相似度评估无参考 MT 度量。
  • 提出一种弱监督的跨语言重映射步骤(CLP),以重新对齐向量空间,减少互译文本之间的语义不匹配。
  • 该方法应用无监督映射(UMD)对齐多语言嵌入,提升跨语言间的语义对应性。
  • 将跨语言相似度得分与目标语言侧语言模型(LM)结合,以惩罚不自然、类似‘翻译体’的输出。
  • 采用 WMT17 和 WMT18 数据集,结合人工判断(DA 分数)评估与人工质量估计的相关性。
  • 表现最佳的度量方法 Mover-2 + CLP(M-BERT) ⊕ LM 整合了重对齐与语言模型,提升了鲁棒性。

实验结果

研究问题

  • RQ1M-BERT 和 LASER 等跨语言编码器能否在无参考 MT 评估中有效充当语义编码器?
  • RQ2为何最先进的跨语言度量方法在无参考设置下与人工判断的相关性不佳?
  • RQ3向量空间重对齐在多大程度上能减少多语言编码器中互译文本之间的语义不匹配?
  • RQ4目标语言侧语言模型能否检测并惩罚系统译文中的‘翻译体’?
  • RQ5将跨语言相似度与语言模型结合,是否能在与人工判断的相关性上超越基于参考的度量方法(如 BLEU)?

主要发现

  • M-BERT 和 LASER 等跨语言编码器在无参考 MT 评估中表现不佳,主要由于互译文本之间存在语义不匹配。
  • 无法检测‘翻译体’——即逐字、逐词的翻译——是主要失效模式,尤其在 M-BERT 中更为明显。
  • 后处理的跨语言重对齐(CLP)显著减少了语义不匹配,并提升了与人工判断的相关性。
  • 将跨语言相似度与目标语言侧语言模型(LM)结合,能有效惩罚不自然的翻译,提升性能。
  • 表现最佳的度量方法 Mover-2 + CLP(M-BERT) ⊕ LM 在与人工段落级判断的相关性上,比基于参考的 BLEU 高出 5.7 分。
  • 即使仅使用 1,000 组平行语句,基于 M-BERT 的度量方法也优于基线模型,且性能在数据量增加至一定规模后迅速趋于稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。