[论文解读] Cross-Lingual Supervision improves Large Language Models Pre-training
本文表明,在编码器-解码器大型语言模型(LLMs)的预训练过程中整合跨语言监督机器翻译(MT)目标,可显著提升多种语言在开放生成和封闭生成任务中的少样本学习性能。通过使用多臂赌博机的自动化课程学习方法,动态优化训练过程中MT与自监督语言建模数据的混合比例,该方法在无需昂贵网格搜索的情况下实现了优越性能,优于静态数据采样策略和SOTA基线模型,在翻译和问答基准测试中表现更佳。
The recent rapid progress in pre-training Large Language Models has relied on using self-supervised language modeling objectives like next token prediction or span corruption. On the other hand, Machine Translation Systems are mostly trained using cross-lingual supervision that requires aligned data between source and target languages. We demonstrate that pre-training Large Language Models on a mixture of a self-supervised Language Modeling objective and the supervised Machine Translation objective, therefore including cross-lingual parallel data during pre-training, yields models with better in-context learning abilities. As pre-training is a very resource-intensive process and a grid search on the best mixing ratio between the two objectives is prohibitively expensive, we propose a simple yet effective strategy to learn it during pre-training.
研究动机与目标
- 探究在LLM预训练期间引入平行跨语言数据是否能提升开放和封闭生成设置下的少样本学习能力。
- 解决在自监督语言建模与监督MT目标之间确定最优混合比例的挑战,该比例通过网格搜索调优计算成本过高。
- 开发并评估一种动态、自动化的预训练期间并行数据使用调度策略,避免超参数搜索,并优于静态采样策略。
- 评估跨语言监督带来的增益是否源于多语言数据量的增加,还是对齐平行句对的特定结构。
- 评估跨语言监督对低资源语言的影响,并与强大的MT和LLM基线模型进行性能比较。
提出的方法
- 在自监督语言建模(如下一个词预测)和监督机器翻译目标的混合数据上预训练编码器-解码器LLM,使用平行单语句对。
- 引入一种基于多臂赌博机的自动化课程学习动态数据采样策略,以学习每个训练步骤中应使用的并行MT数据比例。
- 将该方法应用于12亿和38亿参数的模型,每项实验在256个TPUv4核心上训练5天,以确保足够的规模。
- 使用少样本学习进行评估,区分封闭生成(同语言输入/输出)和开放生成(跨语言输入/输出)。
- 与强大的基线模型(包括M2M-124、GPT-3、XGLM和微调后的mT5模型)进行对比,使用BLEU和TyDi QA与XTyDi QA上的F1等标准指标。
- 进行消融研究,以隔离使用MT数据与语言建模目标相比仅增加非英语数据量的影响。

实验结果
研究问题
- RQ1在LLM预训练期间整合跨语言监督数据是否能提升多语言机器翻译和问答任务中的少样本学习性能?
- RQ2当平衡自监督语言建模与监督MT目标时,动态自动化课程学习策略是否能优于静态数据采样策略?
- RQ3观察到的性能增益是源于多语言数据量的增加,还是对齐平行句对的特定结构?
- RQ4在高资源与低资源语言对之间,性能提升在开放生成与封闭生成设置下的差异如何?
- RQ5跨语言监督带来的性能增益是否随模型规模增加而提升?与SOTA MT和LLM模型相比表现如何?
主要发现
- 采用自动化课程学习的所提方法在多语言机器翻译任务中达到SOTA性能,优于M2M-124及其他基线模型,在多个语言对上表现更优,例如在38亿参数模型的开放生成模式下,Fr→En达到47.6 BLEU,Sw→En达到40.3 BLEU。
- 在封闭生成设置中,38亿参数模型在En→Ru任务上达到41.2 BLEU,在En→Sw任务上达到35.0 BLEU,显著优于67亿参数的GPT-3和75亿参数的XGLM模型。
- 采用自动化课程学习的模型优于Kale等人(2021)的静态数据采样基线,表明动态调度并行数据可提升性能,且无需超参数调优。
- 消融研究显示,将MT数据与语言建模目标结合使用时,TyDi QA和翻译任务的性能显著下降,而仅使用单语数据则表现更优,表明平行数据的结构至关重要,而不仅仅是数据量。
- 在低资源语言(如My和Ta)上,模型因训练数据不足而表现不佳,但在Bg→En、Hi→En和Zh→En任务上,模型优于其他系统,展现出强大的零样本泛化能力。
- 结果表明,跨语言监督通过增强多语言能力超越了简单的数据增强,尤其在需要跨语言泛化的开放生成设置中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。