[论文解读] Adam Mickiewicz University at WMT 2022: NER-Assisted and Quality-Aware Neural Machine Translation
本论文展示了亚当·密茨凯维奇大学在乌克兰语↔捷克语神经机器翻译任务中的顶尖系统,该系统利用命名实体识别(NER)辅助的源语言因子、噪声后翻译、文档级建模、模型集成以及基于质量感知的最小贝叶斯风险重排序解码。该系统在WMT 2022共享任务测试集上取得了最先进水平的COMET得分,两个翻译方向均排名第一。
This paper presents Adam Mickiewicz University's (AMU) submissions to the constrained track of the WMT 2022 General MT Task. We participated in the Ukrainian $\leftrightarrow$ Czech translation directions. The systems are a weighted ensemble of four models based on the Transformer (big) architecture. The models use source factors to utilize the information about named entities present in the input. Each of the models in the ensemble was trained using only the data provided by the shared task organizers. A noisy back-translation technique was used to augment the training corpora. One of the models in the ensemble is a document-level model, trained on parallel and synthetic longer sequences. During the sentence-level decoding process, the ensemble generated the n-best list. The n-best list was merged with the n-best list generated by a single document-level model which translated multiple sentences at a time. Finally, existing quality estimation models and minimum Bayes risk decoding were used to rerank the n-best list so that the best hypothesis was chosen according to the COMET evaluation metric. According to the automatic evaluation results, our systems rank first in both translation directions.
研究动机与目标
- 针对乌克兰语与捷克语这两种关系密切的斯拉夫语系之间的低资源神经机器翻译问题。
- 通过在源输入中引入命名实体识别(NER)信息作为源语言因子,提升翻译质量。
- 通过在单语语料库上使用噪声后翻译进行数据增强,提升低资源翻译性能。
- 通过在更长序列上训练文档级模型,提升文本连贯性与一致性。
- 通过结合n-best列表(来自模型集成与文档级模型)并进行基于COMET的重排序,优化输出质量。
提出的方法
- 使用独立的源语与目标语词汇表,分别训练了四个Transformer(big)模型,每个模型使用32,000个子词单元。
- 应用NER源语言因子(拼接或求和)以改善命名实体的翻译,使用预训练的NER模型对输入文本进行处理。
- 采用带有Gumbel噪声的噪声后翻译,从单语语料库中生成合成平行数据。
- 在最长可达250个子词标记的序列上训练文档级模型,以捕捉长距离依赖关系。
- 通过加权平均方法,结合来自句级集成模型与文档级模型的n-best假设。
- 利用质量估计模型与最小贝叶斯风险解码,基于COMET得分对n-best列表进行重排序。
实验结果
研究问题
- RQ1NER辅助的源语言因子是否能显著提升低资源乌克兰语↔捷克语机器翻译中的命名实体翻译?
- RQ2在仅有限平行数据可用的情况下,噪声后翻译在提升翻译质量方面的有效性如何?
- RQ3文档级建模是否能在低资源设置下提升文本连贯性与整体翻译质量?
- RQ4基于COMET的重排序质量感知解码是否能优于标准的束搜索解码?
- RQ5在资源受限的低资源场景下,多种机器翻译增强技术的综合影响如何?
主要发现
- 在乌克兰语→捷克语测试集上,最终系统的COMET得分为1.0488,相较于基线(0.8315)相对提升了26.13%。
- 在捷克语→乌克兰语方向,系统取得了0.9944的COMET得分,相较于基线(0.8008)相对提升了24.18%。
- 质量感知解码方法带来了最大的COMET得分提升,尽管其略微降低了BLEU得分,表明流畅性与语义质量之间存在权衡。
- NER源语言因子改善了命名实体的翻译,但由于COMET指标对实体错误不敏感,这一改进在COMET得分中未完全体现。
- 即使采用句级解码,文档级模型的COMET得分为0.8942,表明长上下文建模在解码阶段仍具有显著价值。
- 统计显著性检验确认,最终提交结果在两个翻译方向上均显著优于基线(p < 0.05)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。