[论文解读] BigTranslate: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages
BigTranslate 通过三阶段训练将 LLaMA-13B 语言模型扩展为支持 102 种语言的多语言翻译模型:在中文单语数据上继续预训练,随后在大规模多语言平行语料库上继续预训练,并使用多语言翻译指令进行指令微调。该模型在 GPT-4 评估下性能与 Google Translate 和 OpenAI 的 ChatGPT 相当,在 8 个语言对上优于 ChatGPT。
Large language models (LLMs) demonstrate promising translation performance among various natural languages. However, many LLMs especially the open-sourced ones, such as BLOOM and LLaMA, are English-dominant and support only dozens of natural languages, making the potential of LLMs on language translation less explored. In this work, we present BigTranslate which adapts LLaMA that covers only 20 languages and enhances it with multilingual translation capability on more than 100 languages. BigTranslate is built upon LLaMA-13B and it is optimized in three steps. First, we continue training LLaMA with massive Chinese monolingual data. Second, we continue training the model with a large-scale parallel dataset that covers 102 natural languages. Third, we instruct-tune the foundation model with multilingual translation instructions, leading to our BigTranslate model. The preliminary experiments on multilingual translation show that BigTranslate performs comparably with ChatGPT and Google Translate in many languages and even outperforms ChatGPT in 8 language pairs. We release the BigTranslate model and hope it can advance the research progress.
研究动机与目标
- 扩展以英语为主导的 LLM(如 LLaMA)的多语言翻译能力,这些模型最初仅支持 20 种语言。
- 使单一 LLM 能够在超过 100 种自然语言之间实现高质量翻译,包括低资源语言。
- 通过结合单语、双语语料和指令微调的三阶段训练流程提升翻译质量。
- 使用自动指标和 GPT-4 作为类人评估者,对模型性能进行评估,与 SOTA 系统(如 Google Translate 和 ChatGPT)进行对比。
提出的方法
- 在大规模中文单语文本上继续预训练 LLaMA-13B,以增强其对中文的理解能力。
- 在涵盖 102 种自然语言的大型平行语料库上进一步进行继续预训练,并采用课程学习策略以提升多语言泛化能力。
- 使用多样化的多语言翻译指令进行指令微调,使模型与零样本翻译任务对齐,并提升零样本泛化能力。
- 使用 GPT-4 作为类人评判者,通过基于提示的评分系统(0–5 分)评估翻译的语义相似性和风格一致性。
- 采用平衡的评估设置,包含 70 个语言对和标准化提示,以确保模型间可靠比较。
- 通过 GitHub 发布模型,以促进开放研究和社区采用。
实验结果
研究问题
- RQ1一个最初仅支持 20 种语言的大型语言模型能否被有效扩展以支持超过 100 种语言的翻译?
- RQ2微调后的基于 LLM 的翻译器在多种语言对上的性能与 Google Translate 和 ChatGPT 等商业系统相比如何?
- RQ3在低资源环境下,指令微调在多大程度上能提升零样本多语言翻译能力?
- RQ4使用双语语料进行多语言预训练是否能有效实现从高资源语言到低资源语言的知识迁移?
主要发现
- 在 GPT-4 评估下,BigTranslate 在多种语言上的翻译质量与 Google Translate 和 OpenAI 的 ChatGPT 相当。
- 在 70 个语言对中的 28 个(占 40%)中,BigTranslate 获得 GPT-4 评分高于 3.5,表明翻译质量良好或优秀。
- 在 GPT-4 评估下,BigTranslate 在 8 个语言对上优于 ChatGPT,表明其在特定多语言场景下表现更优。
- 在许多语言对中,BigTranslate 与 Google Translate 的性能差距显著缩小,表明其具备强大的竞争力。
- BigTranslate 在藏语、蒙古语等低资源语言上表现出色,表明其能有效实现从高资源语言到低资源语言的知识迁移。
- 三阶段训练流程(单语、双语、指令微调)被证明能有效扩展 LLaMA 模型原有的多语言翻译能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。