Skip to main content
QUICK REVIEW

[论文解读] MTet: Multi-domain Translation for English and Vietnamese

Chinh Ngo, Trieu H. Trinh|arXiv (Cornell University)|Oct 11, 2022
Natural Language Processing Techniques被引用 8
一句话总结

本论文介绍了MTet,这是目前公开可用的最大的英越语并行语料库,涵盖420万个高质量句子对,覆盖多种领域,包括此前代表性不足的技术领域,如法律和生物医学。作者还发布了EnViT5,这是首个针对英越语的预训练Transformer模型。该模型在MTet和phoMT数据上微调后,实现了SOTA性能,BLEU分数最高提升2分,同时参数量仅为先前模型的1.6倍。

ABSTRACT

We introduce MTet, the largest publicly available parallel corpus for English-Vietnamese translation. MTet consists of 4.2M high-quality training sentence pairs and a multi-domain test set refined by the Vietnamese research community. Combining with previous works on English-Vietnamese translation, we grow the existing parallel dataset to 6.2M sentence pairs. We also release the first pretrained model EnViT5 for English and Vietnamese languages. Combining both resources, our model significantly outperforms previous state-of-the-art results by up to 2 points in translation BLEU score, while being 1.6 times smaller.

研究动机与目标

  • 通过构建大规模、多领域的并行语料库,解决低资源语言对(尤其是英越语)高质量并行数据稀缺的问题。
  • 通过结合精心筛选的高质量数据与新发布的预训练模型,提升英越语神经机器翻译性能。
  • 证明多领域训练数据能显著增强模型在多样化领域中的泛化能力和性能表现。
  • 提供一个公开可用的高质量基准语料库和模型,推动低资源机器翻译领域的研究与应用。

提出的方法

  • MTet语料库通过整合OPUS中多个现有并行语料库(包括TED演讲、维基百科、OpenSubtitles和CCAlign)并进行质量筛选构建,筛选过程使用基础Transformer模型确保数据质量。
  • 通过众包方式获取人工标注的多领域测试集,并由专家交叉核对,确保在四个不同领域中的语言和领域特定准确性。
  • 开发了专为英越语翻译设计的新预训练编码器-解码器模型EnViT5,该模型在大规模非对齐单语文本上进行单语预训练,随后在MTet和phoMT数据集上进行微调。
  • 在包含620万句对(MTet + phoMT)的联合训练集上对模型进行微调,利用数据增强和领域多样性提升模型鲁棒性。
  • 通过对比单领域与多领域训练数据的性能,在相同模型架构和训练设置下,隔离分析领域多样性的影响。
  • 进行时间预算分析,比较自监督预训练与有监督数据扩展的效率,通过单位训练时间与数据量下的BLEU提升指标进行评估。

实验结果

研究问题

  • RQ1与单领域数据相比,在多样化多领域并行语料库上进行训练是否能显著提升英越语机器翻译的泛化能力与性能?
  • RQ2当在更大规模、高质量数据集(如MTet)上微调时,新预训练的多语言模型(EnViT5)是否能超越现有SOTA模型?
  • RQ3在多领域测试集上,与仅在单一领域(如法律或TED演讲)训练的模型相比,多领域数据训练的模型性能如何?
  • RQ4在低资源语言对中,通过有监督数据收集扩展数据与自监督预训练相比,哪种方式在提升翻译性能方面更具效率?
  • RQ5在低资源翻译任务中,包含高质量、技术领域数据(如生物医学和法律文本)在多大程度上能提升模型性能?

主要发现

  • MTet语料库包含420万个高质量、多领域的句子对,显著覆盖了法律和生物医学等技术领域,这些领域在现有语料库中常被忽略。
  • 在MTet和phoMT(总计620万句对)上微调后,EnViT5-base模型在英越语翻译任务中达到45.47的新SOTA BLEU分数,相比之前SOTA提升2分。
  • 与之前SOTA模型相比,该模型的参数量减少1.6倍(275M对比448M,如mBART),同时保持或提升性能,实现更快的推理速度。
  • 多领域数据训练显著提升模型泛化能力,30万句对的多领域训练集在所有测试领域(包括法律领域)的表现均优于仅使用TED演讲或仅使用法律文本的纯单领域数据集。
  • 在非对齐双语数据上进行预训练的收益随数据量增加而递减,需多达1000倍的数据量和2000倍的训练时间,才能在目标BLEU分数34时达到有监督数据扩展的性能水平。
  • 本研究证实,高质量、精心筛选的数据收集方式比大规模自动化爬取更有效、更高效,尤其在优先考虑领域多样性时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。