[论文解读] Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE
本文提出Vega v2,一个60亿参数的语言模型,通过自进化学习实现高效预训练,并结合基于知识蒸馏的提示迁移方法进行下游适应,从而在8项SuperGLUE任务中的4项上达到最先进性能。该模型甚至超越了5400亿参数的PaLM模型,表明参数效率与智能知识提取可超越单纯的规模扩展。
This technical report briefly describes our JDExplore d-team's Vega v2 submission on the SuperGLUE leaderboard. SuperGLUE is more challenging than the widely used general language understanding evaluation (GLUE) benchmark, containing eight difficult language understanding tasks, including question answering, natural language inference, word sense disambiguation, coreference resolution, and reasoning. [Method] Instead of arbitrarily increasing the size of a pretrained language model (PLM), our aim is to 1) fully extract knowledge from the input pretraining data given a certain parameter budget, e.g., 6B, and 2) effectively transfer this knowledge to downstream tasks. To achieve goal 1), we propose self-evolution learning for PLMs to wisely predict the informative tokens that should be masked, and supervise the masked language modeling (MLM) process with rectified smooth labels. For goal 2), we leverage the prompt transfer technique to improve the low-resource tasks by transferring the knowledge from the foundation model and related downstream tasks to the target task. [Results] According to our submission record (Oct. 2022), with our optimized pretraining and fine-tuning strategies, our 6B Vega method achieved new state-of-the-art performance on 4/8 tasks, sitting atop the SuperGLUE leaderboard on Oct. 8, 2022, with an average score of 91.3.
研究动机与目标
- 在固定参数预算(60亿参数)内,提升预训练语言模型(PLM)预训练的效率与效果。
- 通过自问机制识别并掩码信息丰富的标记,提升预训练数据中的知识提取能力。
- 采用基于知识蒸馏的提示迁移方法,提升下游任务(尤其是低资源任务)的适应性能。
- 证明参数高效、最大化知识提取的策略可超越PaLM等大规模模型。
- 建立一种无需任意扩大模型规模的高效、高性能PLM训练与微调框架。
提出的方法
- 提出自进化学习:模型通过自问识别掩码任务中的困难且信息丰富的标记。
- 使用校正平滑标签监督掩码语言建模(MLM)过程,提升训练稳定性和知识保留能力。
- 采用基于知识蒸馏的提示迁移方法,将基础模型及相关下游任务的知识迁移至低资源目标任务。
- 采用仅编码器的Transformer主干网络,使用解耦注意力机制,针对60亿参数进行优化:24层,4096隐藏层尺寸,16384前馈网络尺寸,32头注意力。
- 在高资源任务上采用对抗性与归纳微调,在所有阶段均使用AdamW优化器进行全参数微调。
- 利用提示迁移提升在低资源任务(如CB、COPA、WSC)上的鲁棒性与性能。
实验结果
研究问题
- RQ1一个60亿参数的语言模型是否能在不扩展至5400亿参数的情况下,在SuperGLUE上实现最先进性能?
- RQ2自进化学习如何通过识别用于掩码的信息丰富标记来提升预训练期间的知识提取?
- RQ3基于知识蒸馏的提示迁移在低资源SuperGLUE任务上的性能提升程度如何?
- RQ4优化预训练与微调策略是否能优于单纯增加模型规模?
- RQ5校正平滑标签能否提升掩码语言建模在知识提取中的有效性?
主要发现
- 截至2022年10月8日,Vega v2在SuperGLUE排行榜上取得了91.3的平均分新SOTA,总排名首位。
- 该模型在8项任务中的4项上达到SOTA:CB(98.6%)、COPA(99.2%)、RTE(62.4%)和WSC(93.9%),显著优于官方SuperGLUE基线。
- 尽管仅拥有60亿参数,Vega v2的平均分(91.3)仍超过5400亿参数的PaLM模型(90.4),证明其卓越的参数效率。
- 自进化学习机制增强了模型从预训练数据中提取信息模式的能力,提升了知识利用效率。
- 提示迁移策略有效缓解了过拟合,并显著提升了CB、COPA和WSC等低资源任务的性能。
- 结果表明,智能预训练与针对性下游适应可超越单纯模型规模扩展,挑战了‘更大模型总是更好’的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。