Skip to main content
QUICK REVIEW

[论文解读] RoBLEURT Submission for the WMT2021 Metrics Task

Yu Wan, Dayiheng Liu|arXiv (Cornell University)|Apr 28, 2022
Speech Recognition and Synthesis被引用 7
一句话总结

该论文提出 RoBLEURT,一种通过结合包含源语言的建模与仅参考文本的建模、在合成数据上进行持续预训练,以及通过重打分实现数据去噪的鲁棒性训练指标模型,从而提升自动机器翻译评估性能。该模型在 WMT2020 基准测试中,于 10 个英语到其他语言的语料对中的 8 个实现了最先进(SOTA)的人工判断相关性。

ABSTRACT

In this paper, we present our submission to Shared Metrics Task: RoBLEURT (Robustly Optimizing the training of BLEURT). After investigating the recent advances of trainable metrics, we conclude several aspects of vital importance to obtain a well-performed metric model by: 1) jointly leveraging the advantages of source-included model and reference-only model, 2) continuously pre-training the model with massive synthetic data pairs, and 3) fine-tuning the model with data denoising strategy. Experimental results show that our model reaching state-of-the-art correlations with the WMT2020 human annotations upon 8 out of 10 to-English language pairs.

研究动机与目标

  • 开发一种鲁棒且高性能的机器翻译评估指标模型,使其在低资源和高资源语言对之间均具有良好的泛化能力。
  • 解决基于 N-gram 的指标在捕捉语义一致性和改写能力方面的局限性。
  • 通过结合多语言与单语言建模策略,提升与人工判断的相关性。
  • 通过在合成数据上进行持续预训练,并使用去噪的真实世界数据进行微调,增强模型鲁棒性。
  • 探究包含源语言和不包含源语言的模型组合是否能提升整体性能。

提出的方法

  • 该模型以 RoBERTa-large 作为基础编码器,包含两个独立变体:RoBLEURT- Src(包含源输入)和 RoBLEURT- NoSrc(仅包含假设句和参考句)。
  • RoBLEURT- Src 的输入格式使用特殊标记将输入组织为 [src] [hyp] [ref],而 RoBLEURT- NoSrc 使用修改后的格式以处理多输入。
  • 模型在 [CLS] 标记的表示上使用线性回归头,预测一个反映语义一致性的标量分数。
  • 它利用从强翻译系统生成的大量合成数据对,进行持续预训练,以提升泛化能力。
  • 在微调阶段,使用强基线指标对 2018–2019 年的噪声 WMT 数据进行重打分,再用于模型训练。
  • 通过加权平均组合模型输出,以利用包含源语言和不包含源语言配置的优势。

实验结果

研究问题

  • RQ1将包含源语言的建模与仅参考文本的建模相结合,是否能提升在多样化语言对上的性能?
  • RQ2在合成数据上进行持续预训练是否能增强可训练机器翻译指标的鲁棒性与泛化能力?
  • RQ3使用强基线对数据进行重打分以实现去噪,在提升微调性能方面有多有效?
  • RQ4在低资源和高资源设置下,模型组合是否优于单个模型?
  • RQ5基于 RoBERTa 且使用微调检查点(如 XNLI)的模型是否能超越标准 BERT 基础的指标模型?

主要发现

  • 使用 RoBERTa-large-xnli 检查点的 RoBLEURT- Src 在 cs-en、de-en、ja-en、ru-en 和 zh-en 上分别取得 14.1、47.9、28.7、11.7 和 14.9 的 Kendall tau 相关系数。
  • 相较于 RoBERTa-base,使用 RoBERTa-large 可提升性能,而进一步使用微调后的 RoBERTa-large-xnli 检查点可获得额外增益。
  • 在训练中去除噪声 WMT 数据会损害性能,但通过重打分并重新引入这些数据可带来显著提升。
  • RoBLEURT- Src 与 RoBLEURT- NoSrc 的模型组合在性能上优于单个模型,尤其在低资源设置下表现更优。
  • 完整流程(包括合成数据预训练与去噪)在 WMT2020 基准测试的 10 个语料对中,有 8 个实现了最先进相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。