[论文解读] Embarrassingly Easy Document-Level MT Metrics: How to Convert Any Pretrained Metric Into a Document-Level Metric
本文提出一种简单方法,通过引入前文句子的上下文信息,将预训练的句子级机器翻译(MT)评估指标——BERTScore、Prism、COMET 和 COMET-QE——扩展为文档级指标。通过在嵌入阶段输入多个前文句子作为上下文,该方法在话语现象上的评估相关性最高提升6.1%,在排除低质量参考译文的情况下,85%的测试场景中优于句子级版本。
We hypothesize that existing sentence-level machine translation (MT) metrics become less effective when the human reference contains ambiguities. To verify this hypothesis, we present a very simple method for extending pretrained metrics to incorporate context at the document level. We apply our method to three popular metrics, BERTScore, Prism, and COMET, and to the reference free metric COMET-QE. We evaluate the extended metrics on the WMT 2021 metrics shared task using the provided MQM annotations. Our results show that the extended metrics outperform their sentence-level counterparts in about 85% of the tested conditions, when excluding results on low-quality human references. Additionally, we show that our document-level extension of COMET-QE dramatically improves its accuracy on discourse phenomena tasks, outperforming a dedicated baseline by up to 6.1%. Our experimental results support our initial hypothesis and show that a simple extension of the metrics permits them to take advantage of context to resolve ambiguities in the reference.
研究动机与目标
- 探究当人类参考译文包含歧义时,预训练MT评估指标是否仍保持有效性。
- 开发一种最小化、可泛化的通用方法,将任意预训练的句子级指标扩展至文档级。
- 评估文档级上下文是否能提升与人类MT评估的一致性,尤其在话语现象方面。
- 评估参考上下文相较于假设上下文在减少错误传播方面是否更有效。
- 证明文档级指标更能反映人类评估实践中对完整文档上下文的考量。
提出的方法
- 通过在嵌入阶段将目标句子及其前两句话作为上下文输入模型,扩展预训练MT指标。
- 对于BERTScore和Prism,使用基于BERT的模型生成的上下文嵌入,结合上下文计算句子级得分。
- 对于COMET和COMET-QE,以相同方式引入源句上下文,同时保持原始指标架构不变。
- 采用与原始句子级指标相同的评分机制,但使用上下文感知的表示。
- 将该方法应用于四种指标:BERTScore、Prism、COMET 和 COMET-QE,覆盖 WMT 2021 的多种语言对与领域。
- 通过消融实验,分别使用参考上下文和假设上下文,评估系统级与MQM人类判断的相关性。
实验结果
研究问题
- RQ1引入文档级上下文是否能提升预训练MT指标与人类判断的相关性?
- RQ2在文档级指标性能方面,参考上下文是否比假设上下文更有效?
- RQ3为提升指标性能,最佳上下文长度(如一两句)是多少?
- RQ4文档级指标在多大程度上解决了人类参考译文中的歧义问题?
- RQ5COMET-QE的文档级扩展是否能提升在话语特异性任务(如代词指代消解和词义消歧)上的表现?
主要发现
- 在排除低质量参考译文的情况下,四种指标的文档级扩展在85%的测试条件下优于其句子级版本,尤其在 Zh→En 新闻领域表现显著。
- COMET-QE的文档级扩展在话语现象上的表现相比句子级版本最高提升6.1%,表明其在消解参考译文歧义方面具有更强能力。
- 使用参考上下文而非假设上下文能获得更优性能,因为假设上下文包含更多错误,易导致错误传播并降低指标可靠性。
- 将上下文从一句增加到两句通常能提升相关性,但在低质量参考译文(如 Zh→En 新闻)上性能反而下降。
- 该方法在所有语言对(En→De、Zh→En、En→Ru)和领域(TED演讲、新闻)中均表现出一致改进,尤其在话语敏感任务中增益更明显。
- 结果支持如下假设:参考句常包含歧义,需依赖文档级上下文才能澄清,而当前指标在缺乏上下文时无法捕捉此类信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。