[论文解读] Zero-Shot Translation Quality Estimation with Explicit Cross-Lingual Patterns
该论文提出了一种零样本翻译质量评估(QE)方法,通过整合显式的跨语言模式——词对齐掩码和生成得分(困惑度)——来减少逐标记不匹配错误,从而改进 BERTScore。该方法在性能上可与有监督的 QE 模型相媲美,在 WMT 2020 QE 共享任务的六种翻译方向中,有两项优于有监督模型。
This paper describes our submission of the WMT 2020 Shared Task on Sentence Level Direct Assessment, Quality Estimation (QE). In this study, we empirically reveal the \ extit{mismatching issue} when directly adopting BERTScore to QE. Specifically, there exist lots of mismatching errors between the source sentence and translated candidate sentence with token pairwise similarity. In response to this issue, we propose to expose explicit cross-lingual patterns, \ extit{e.g.} word alignments and generation score, to our proposed zero-shot models. Experiments show that our proposed QE model with explicit cross-lingual patterns could alleviate the mismatching issue, thereby improving the performance. Encouragingly, our zero-shot QE method could achieve comparable performance with supervised QE method, and even outperforms the supervised counterpart on 2 out of 6 directions. We expect our work could shed light on the zero-shot QE model improvement.
研究动机与目标
- 为解决基于 BERTScore 的零样本 QE 中因缺乏跨语言引导而导致的源语言和目标语言标记错误对齐问题。
- 在无需人工标注参考译文或微调的情况下,提升零样本 QE 的性能。
- 探究显式的跨语言信号(如词对齐和生成得分)是否能提高无参考译文 QE 的鲁棒性和准确性。
- 证明在引入跨语言模式后,简单的、未经微调的 BERTScore 基干模型也能取得具有竞争力的结果。
提出的方法
- 采用多语言 BERT 和 XLM 将源句和翻译句嵌入到共享语义空间中,以实现跨语言比较。
- 应用贪心匹配策略,基于上下文嵌入的点积相似度,将源语言标记与最相似的目标语言标记对齐。
- 引入基于 GIZA++ 生成的词对齐结果的跨语言对齐掩码,以指导标记匹配并减少不匹配错误。
- 利用预训练的跨语言模型对强制解码的目标标记生成的得分(困惑度)来加权相似度得分。
- 通过加权融合的方式将对齐掩码和困惑度得分与 BERTScore 结合,以提升匹配准确性。
- 在 WMT 2020 QE 共享任务中,使用皮尔逊相关系数和肯德尔相关系数与直接评估(DA)得分进行评估。
实验结果
研究问题
- RQ1在使用 BERTScore 时,显式的跨语言模式是否能缓解零样本 QE 中的逐标记不匹配问题?
- RQ2整合词对齐和生成得分是否能提高预测 QE 得分与人类直接评估(DA)得分之间的相关性?
- RQ3在某些翻译方向上,无需微调的零样本 QE 模型是否能超越有监督基线?
- RQ4该方法在多样化的语言对,尤其是低资源语言对上的有效性如何?
主要发现
- 在同时采用对齐掩码和困惑度得分时,该方法在 en-de 方向上达到皮尔逊相关系数 0.099,在 en-zh 方向上达到 0.189,在 ru-en 方向上达到 0.332,优于这些方向上的基线 BERTScore。
- 在 ru-en 方向上,模型达到 0.332 的皮尔逊相关系数,超过了同一测试集上有监督基线的 0.146。
- 该模型在六种翻译方向中的两项(ru-en 和 si-en)上优于有监督基线,展示了强大的零样本泛化能力。
- 仅整合困惑度得分便在大多数方向上提升了性能,其中在 en-de 方向上达到最高的皮尔逊相关系数 0.105,在 ro-en 方向上达到 0.439。
- 消融实验证实,对齐掩码和困惑度得分对性能提升均有独立贡献,联合使用效果最佳。
- 该方法显著减少了不匹配错误——例如,准确地将俄语标记 'Назва' 对齐为 'named' 而非 'The'——这在定性示例中得到了验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。