[论文解读] HyperTuning: Toward Adapting Large Language Models without Back-propagation
HyperTuning 引入了一种新颖的范式,通过使用超模型(hypermodel)从少量示例中以单次前向传播生成特定任务的参数更新(例如软前缀或LoRA适配器),实现在无需反向传播的情况下微调大型语言模型。该方法在未见过的任务上实现了强大的零样本性能,并在使用超模型生成的参数作为初始化时,提升了下游PEFT微调的效果,展示了通往高效、无反向传播模型微调的有前景路径。
Fine-tuning large language models for different tasks can be costly and inefficient, and even methods that reduce the number of tuned parameters still require full gradient-based optimization. We propose HyperTuning, a novel approach to model adaptation that uses a hypermodel to generate task-specific parameters for a fixed downstream model. We demonstrate a simple setup for hypertuning with HyperT5, a T5-based hypermodel that produces soft prefixes or LoRA parameters for a frozen T5 model from few-shot examples. We train HyperT5 in two stages: first, hyperpretraining with a modified conditional language modeling objective that trains a hypermodel to generate parameters; second, multi-task fine-tuning (MTF) on a large number of diverse language tasks. We evaluate HyperT5 on P3, MetaICL and Super-NaturalInstructions datasets, and show that it can effectively generate parameters for unseen tasks. Moreover, we show that using hypermodel-generated parameters as initializations for further parameter-efficient fine-tuning improves performance. HyperTuning can thus be a flexible and efficient way to leverage large language models for diverse downstream applications.
研究动机与目标
- 为解决大型语言模型微调过程中反向传播带来的高计算成本问题。
- 探究是否可通过一个独立的超模型在不需对主模型计算梯度的情况下,生成有效的参数更新。
- 评估超模型生成的参数是否可作为后续参数高效微调的更优初始化。
- 展示使用超预训练和多任务微调的两阶段训练流程在超模型训练中的可行性。
提出的方法
- 训练一个超模型(HyperT5),用于为冻结的基于T5的下游模型生成特定任务的PEFT参数(如软前缀或LoRA矩阵)。
- 首先使用改进的条件语言建模范式对超模型进行超预训练,以从少量示例中生成有效的PEFT参数。
- 随后在1,000多个语言任务的多样化数据集上进行多任务微调(MTF),以提升泛化能力和迁移能力。
- 推理阶段,超模型仅需输入少量少样本示例,即可在单次前向传播中输出PEFT参数。
- 生成的参数用于微调冻结的T5模型,且无需对主模型进行任何反向传播。
- 进一步评估超模型生成的参数作为标准PEFT方法(如前缀微调和LoRA)初始化的效果。
实验结果
研究问题
- RQ1超模型是否能在不依赖主语言模型反向传播的情况下,为未见过的下游任务生成有效的PEFT参数?
- RQ2两阶段训练流程(即超预训练后接多任务微调)是否能提升超模型的泛化能力和性能表现?
- RQ3超模型生成的参数是否可作为比随机初始化或共享MTF参数更优的初始化,用于后续的PEFT微调?
- RQ4在零样本和少样本基准测试中,超微调模型的性能与标准PEFT和全量微调相比如何?
主要发现
- 在P3未见任务上,使用超模型生成参数进行前缀微调,HyperT5平均准确率达到75.2%,优于随机初始化和共享MTF初始化。
- 当用作PEFT的初始化时,超模型生成的参数可实现更快收敛和更高性能,在P3任务上LoRA微调的平均准确率达到75.0%。
- 超模型生成的初始化在训练初期即展现出显著更高的性能,并在整个训练过程中保持优势。
- 在Super-NaturalInstructions和MetaICL基准测试中,HyperT5成功为未见任务生成有效的PEFT参数,展现出强大的零样本泛化能力。
- 两阶段训练流程(即超预训练后接多任务微调)被证明能有效提升超模型在多样化下游任务上的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。