Skip to main content
QUICK REVIEW

[论文解读] LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin

Shihan Dou, Enyu Zhou|arXiv (Cornell University)|Dec 15, 2023
Topic Modeling被引用 7
一句话总结

LoRAMoE 是一种面向大型语言模型的专家混合(MoE)风格插件,通过基于 LoRA 的专家实现下游任务微调与世界知识保留的分离。通过冻结主干模型并应用局部平衡约束,将数据路由至特定任务或知识保留型专家,LoRAMoE 即使在使用海量指令微调数据的情况下也能防止参数化知识遗忘,同时提升下游性能。

ABSTRACT

Supervised fine-tuning (SFT) is a crucial step for large language models (LLMs), enabling them to align with human instructions and enhance their capabilities in downstream tasks. Increasing instruction data substantially is a direct solution to align the model with a broader range of downstream tasks or notably improve its performance on a specific task. However, we find that large-scale increases in instruction data can damage the world knowledge previously stored in LLMs. To address this challenge, we propose LoRAMoE, a novelty framework that introduces several low-rank adapters (LoRA) and integrates them by using a router network, like a plugin version of Mixture of Experts (MoE). It freezes the backbone model and forces a portion of LoRAs to focus on leveraging world knowledge to solve downstream tasks, to alleviate world knowledge-edge forgetting. Experimental results show that, as the instruction data increases, LoRAMoE can significantly improve the ability to process downstream tasks, while maintaining the world knowledge stored in the LLM.

研究动机与目标

  • 解决在增加监督微调(SFT)数据以适应下游任务时,大型语言模型(LLMs)出现的参数化知识遗忘问题。
  • 在不重新训练主干模型的前提下,保留预训练的世界知识,同时提升在新指令数据上的性能。
  • 设计一种基于插件的 MoE 架构,利用低秩适应(LoRA)将任务特定适应与知识保留解耦。
  • 引入局部平衡约束,确保在专用组(任务 vs. 知识)内专家使用保持平衡,并防止路由器过度集中于少数专家。
  • 实现端到端、与数据类型无关的推理,且在部署时无需预先知晓输入数据类型。

提出的方法

  • 在 LLM 的每个前馈层中集成多个基于 LoRA 的专家,形成类似 MoE 的架构,并配备用于动态路由的路由器。
  • 在训练期间冻结主干 LLM 参数,以完整保留所有预训练的世界知识。
  • 应用局部平衡约束,将专家划分为两组:一组用于下游任务适应,另一组用于将世界知识与人类指令对齐。
  • 使用路由器机制根据输入特征将 token 路由至专家,约束条件确保每组内专家之间的注意力分配保持平衡。
  • 端到端训练 LoRA 适配器与路由器,同时保持主模型权重冻结,实现高效的参数高效微调。
  • 在每个专家网络中利用低秩适应(LoRA)技术,尽管专家数量增加,仍能将额外计算成本最小化。

实验结果

研究问题

  • RQ1增加监督微调数据量是否会导致大型语言模型中参数化世界知识的显著遗忘?
  • RQ2基于 MoE 的插件架构能否在提升下游指令遵循任务性能的同时保留世界知识?
  • RQ3局部平衡约束在防止专家过度使用并确保知识类与任务特定专家之间使用平衡方面的有效性如何?
  • RQ4所提出的 LoRAMoE 插件能否实现端到端、与输入数据类型无关的推理,且无需在部署前预知数据类型?
  • RQ5当指令数据规模扩大时,LoRAMoE 在保持世界知识方面相较于标准 SFT 和其他 PEFT 方法的优越程度如何?

主要发现

  • 增加监督微调数据会导致闭卷问答基准测试(如 TriviaQA、Natural Questions)性能显著下降,表明存在参数化知识遗忘现象。
  • 即使将微调数据从 10 万条增至 300 万条,LoRAMoE 仍能成功维持世界知识性能,CBQA 基准测试中无明显下降。
  • 在 WSC(Winograd 模式挑战)推理过程中,LoRAMoE 的路由器平均将约 45% 的注意力分配给知识保留专家组,表明世界知识被积极利用。
  • LoRAMoE 在多种指令数据类型上均提升了下游任务性能,展现出更强的多任务能力,且未损害知识保留效果。
  • 局部平衡约束有效防止了路由器在每组内对少数专家的偏好,确保了专家使用的稳定与均衡。
  • LoRAMoE 实现了端到端、与数据类型无关的推理,消除了部署时对输入数据类型预先分类的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。