Skip to main content
QUICK REVIEW

[论文解读] Transcending Scaling Laws with 0.1% Extra Compute

Yi Tay, Jason Lee|arXiv (Cornell University)|Oct 20, 2022
Topic Modeling被引用 6
一句话总结

本文提出UL2R,一种通过仅使用0.1%额外计算资源的去噪目标混合继续预训练大语言模型的方法。通过使用UL2目标微调PaLM,所得到的U-PaLM模型显著改善了缩放规律,在5400亿参数规模下实现2倍计算效率提升,并在较小规模(如620亿和80亿参数)下解锁了新兴能力,尤其在具有挑战性的BIG-Bench任务中表现优异。

ABSTRACT

Scaling language models improves performance but comes with significant computational costs. This paper proposes UL2R, a method that substantially improves existing language models and their scaling curves with a relatively tiny amount of extra compute. The key idea is to continue training a state-of-the-art large language model (e.g., PaLM) on a few more steps with UL2's mixture-of-denoiser objective. We show that, with almost negligible extra computational costs and no new sources of data, we are able to substantially improve the scaling properties of large language models on downstream metrics. In this paper, we continue training PaLM with UL2R, introducing a new set of models at 8B, 62B, and 540B scale which we call U-PaLM. Impressively, at 540B scale, we show an approximately 2x computational savings rate where U-PaLM achieves the same performance as the final PaLM 540B model at around half its computational budget (i.e., saving $\sim$4.4 million TPUv4 hours). We further show that this improved scaling curve leads to 'emergent abilities' on challenging BIG-Bench tasks -- for instance, U-PaLM does much better than PaLM on some tasks or demonstrates better quality at much smaller scale (62B as opposed to 540B). Overall, we show that U-PaLM outperforms PaLM on many few-shot setups, i.e., English NLP tasks (e.g., commonsense reasoning, question answering), reasoning tasks with chain-of-thought (e.g., GSM8K), multilingual tasks (MGSM, TydiQA), MMLU and challenging BIG-Bench tasks. Finally, we provide qualitative examples showing the new capabilities of U-PaLM for single and multi-span infilling.

研究动机与目标

  • 以极低的额外计算成本改善大语言模型的缩放规律。
  • 在不增加模型大小或数据量的前提下,使大语言模型具备新兴能力。
  • 仅通过少量额外训练,扩展PaLM的功能,引入如多跨度填空等新型提示模式。
  • 证明多样化的预训练目标可带来超越标准因果语言建模的性能提升与新能力。

提出的方法

  • 使用UL2的去噪器混合目标继续预训练最先进的因果语言模型(PaLM),该目标结合了前缀语言建模与跨度损坏(填空)任务。
  • 在推理过程中使用特定模式的标记符([NLU]、[NLG]、[S2S])控制模型行为,实现不同提示模式。
  • 采用多种去噪目标联合训练:R-去噪器(跨度损坏)、X-去噪器(不同跨度模式的跨度损坏)和S-去噪器(前缀语言建模)。
  • 在推理过程中引入额外的ID标记符用于填空,使模型能够在一个提示中填充多个跨度。
  • 以极低的额外FLOPs(约原始训练的0.1%)将UL2目标应用于PaLM检查点,保留原始模型权重,无需新增数据。
  • 通过在预训练阶段整合PrefixLM与跨度损坏目标,实现双向注意力与填空能力。

实验结果

研究问题

  • RQ1少量额外计算是否能显著改善大语言模型的缩放行为?
  • RQ2去噪目标的混合是否能在原本在小规模下无性能增益的模型中解锁新兴能力?
  • RQ3持续预训练使用如填空与前缀建模等多样化目标,是否能提升在自然语言处理、推理与多语言任务中的少样本下游性能?
  • RQ4单个模型是否能通过仅使用模式标记符与额外ID标记符,在不改变架构的前提下支持多种提示模式(如填空、NLU、NLG)?
  • RQ5在仅使用极少计算资源的前提下,训练为因果语言建模的模型能在多大程度上被增强以支持双向与多跨度生成?

主要发现

  • U-PaLM在约一半计算预算下达到PaLM 540B的性能水平,节省约440万TPUv4小时。
  • 在5400亿参数规模下,U-PaLM实现2倍计算效率提升,即每FLOP性能翻倍。
  • 在新兴BIG-Bench任务中,U-PaLM在620亿与80亿参数规模下表现出显著性能提升,而PaLM在此类任务中表现差或完全无效。
  • 在常识推理、问答、思维链推理(如GSM8K)、多语言任务(MGSM、TydiQA)以及MMLU上,U-PaLM均优于PaLM。
  • 模型支持多跨度填空与模式控制提示(如[S2S]、[NLU]、[NLG]),实现多样化且可控的生成,且无需架构变更。
  • 定性示例显示,U-PaLM能正确填充多个跨度,并在复杂或开放式提示中生成更准确、更多样化的输出,优于PaLM。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。