[论文解读] Lite Training Strategies for Portuguese-English and English-Portuguese Translation
本论文提出了一套轻量级训练策略,用于在单张8GB游戏显卡上实现葡萄牙语-英语及英语-葡萄牙语的神经机器翻译,利用在英语或葡萄牙语语料上预训练的微调T5模型。通过调整分词器以处理葡萄牙语重音符号,实现了具有竞争力的性能——在en-pt任务上与Google翻译相当,在WMT19生物医学任务上超越了当前最先进系统,且仅使用了极少的硬件资源和开源模型与数据。
Despite the widespread adoption of deep learning for machine translation, it is still expensive to develop high-quality translation models. In this work, we investigate the use of pre-trained models, such as T5 for Portuguese-English and English-Portuguese translation tasks using low-cost hardware. We explore the use of Portuguese and English pre-trained language models and propose an adaptation of the English tokenizer to represent Portuguese characters, such as diaeresis, acute and grave accents. We compare our models to the Google Translate API and MarianMT on a subset of the ParaCrawl dataset, as well as to the winning submission to the WMT19 Biomedical Translation Shared Task. We also describe our submission to the WMT20 Biomedical Translation Shared Task. Our results show that our models have a competitive performance to state-of-the-art models while being trained on modest hardware (a single 8GB gaming GPU for nine days). Our data, models and code are available at https://github.com/unicamp-dl/Lite-T5-Translation.
研究动机与目标
- 使用低成本、消费级硬件开发高质量的葡萄牙语-英语和英语-葡萄牙语神经机器翻译系统。
- 解决在仅基于英语语料预训练的模型中处理葡萄牙语特有字符(如变音符号、波浪号)的挑战。
- 评估基于T5的模型在平行语料上微调后的性能,比较在英语和葡萄牙语上预训练的效果。
- 为研究人员和小型实验室提供公开可用、高效且可复现的翻译系统。
- 在标准数据集上与商业系统(如Google翻译)和最先进模型进行性能基准测试。
提出的方法
- 对在英语或葡萄牙语单语语料上预训练的T5-base模型进行微调,用于序列到序列的翻译任务。
- 通过预处理和后处理策略,将原始英语分词器适配以表示葡萄牙语特有字符(如ã、ç、á)。
- 采用T5的文本到文本框架,将翻译任务重新表述为文本生成问题。
- 在单张NVIDIA RTX 2070显卡(8GB)和32GB内存上训练九天,使用ParaCrawl和WMT数据集。
- 应用序列长度调整(TSL和SSL)以提升长序列翻译任务的性能。
- 使用SacreBLEU在ParaCrawl 99k测试集和官方WMT测试集上评估模型。
实验结果
研究问题
- RQ1在葡萄牙语-英语和英语-葡萄牙语翻译任务中,是否在葡萄牙语上预训练的T5模型能比在英语上预训练的模型取得更好的翻译质量?
- RQ2在不重新训练的前提下,通过适配英语分词器以处理葡萄牙语重音符号,是否能显著提升翻译性能?
- RQ3使用单张消费级GPU(8GB)是否能生成与使用多张高端GPU训练的系统相媲美的翻译模型?
- RQ4我们的系统在标准基准数据集上的性能与Google翻译及其他最先进模型相比如何?
- RQ5在长篇生物医学文本上,增加源语言和目标语言序列长度在多大程度上能提升翻译质量?
主要发现
- 在WMT19生物医学pt-en任务中,葡萄牙语预训练的T5模型取得了46.51的BLEU分数,优于英语预训练模型(45.89),并在en-pt任务中与获胜提交(45.62 vs. 48.18)表现相当。
- 在ParaCrawl 99k测试集上,葡萄牙语预训练模型在pt-en任务中取得46.35 BLEU,在en-pt任务中取得45.44 BLEU,与Google翻译在en-pt任务中的表现(51.20和45.17)相近,且在pt-en任务中表现更优。
- 将目标和源序列长度增加至TSL=256、SSL=256后,en-pt的BLEU分数提升至49.06,较基础模型提升了+9.75。
- 分词器适配在无需重新训练的情况下显著提升了翻译质量,使基于英语预训练的模型能够有效处理葡萄牙语文本。
- 本系统仅使用单张8GB显卡,就在WMT19上达到了最先进性能,而WMT19的获胜系统则使用了四张V100显卡。
- 在WMT20上,该模型在pt-en任务中比获胜团队低2.17 BLEU,但比基线高出4.48 BLEU,表明葡萄牙语预训练具有巨大潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。