Skip to main content
QUICK REVIEW

[論文レビュー] LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin

Shihan Dou, Enyu Zhou|arXiv (Cornell University)|Dec 15, 2023
Topic Modeling被引用数 7
ひとこと要約

LoRAMoE は、LoRA を用いたエキスパートを用いて、下流タスクの適応と世界知識の保持を分離する Mixture-of-Experts (MoE) スタイルのプラグインである。バックボーンモデルを固定し、タスク固有のエキスパートまたは知識保持エキスパートにデータをルーティングする局所的バランス制約を適用することにより、LoRAMoE は膨大な指令微調整データを用いてもパrametricな知識の忘却を防ぎ、下流タスクのパフォーマンスを向上させる。

ABSTRACT

Supervised fine-tuning (SFT) is a crucial step for large language models (LLMs), enabling them to align with human instructions and enhance their capabilities in downstream tasks. Increasing instruction data substantially is a direct solution to align the model with a broader range of downstream tasks or notably improve its performance on a specific task. However, we find that large-scale increases in instruction data can damage the world knowledge previously stored in LLMs. To address this challenge, we propose LoRAMoE, a novelty framework that introduces several low-rank adapters (LoRA) and integrates them by using a router network, like a plugin version of Mixture of Experts (MoE). It freezes the backbone model and forces a portion of LoRAs to focus on leveraging world knowledge to solve downstream tasks, to alleviate world knowledge-edge forgetting. Experimental results show that, as the instruction data increases, LoRAMoE can significantly improve the ability to process downstream tasks, while maintaining the world knowledge stored in the LLM.

研究の動機と目的

  • 下流タスクのための教師あり微調整(SFT)データを増加させる際、大規模言語モデル(LLM)におけるパrametricな知識の忘却問題に対処すること。
  • バックボーンモデルを再訓練せずに、事前学習済みの世界知識を保持しつつ、新しい命令データに対するパフォーマンスを向上させること。
  • 低ランク微調整(LoRA)を用いて、タスク固有の適応と知識保持を分離するプラグインベースの MoE アーキテクチャを設計すること。
  • 専用のグループ(タスク vs. 知識)内でエキスパートの利用が均等になるように保証するため、局所的バランス制約を導入すること。
  • デプロイ時に入力データタイプの事前知識が不要なエンドツーエンドの、データタイプに依存しない推論を可能にすること。

提案手法

  • 各フィードフォワード層に複数の LoRA を用いたエキスパートを統合し、ルーターを備えた MoE スタイルのアーキテクチャを構築する。
  • 訓練中にバックボーン LLM のパラメータを固定することで、すべての事前学習済みの世界知識を保持する。
  • エキスパートを2つの明確なグループにグループ化する局所的バランス制約を適用する:1つは下流タスクの適応用、もう1つは世界知識と人間の命令の整合性を保つため。
  • 入力の特徴に基づいてトークンをエキスパートにルーティングするルーター機構を用い、各グループ内でのエキスパート間の注目が均等になるように制約を課す。
  • メインモデルの重みを固定したまま、LoRA アダプタとルーターをエンドツーエンドで訓練することで、効率的なパラメータ効率的微調整を実現する。
  • エキスパート数の増加にもかかわらず、追加の計算コストを最小限に抑えるために、各エキスパートネットワークで低ランク微調整(LoRA)を活用する。

実験結果

リサーチクエスチョン

  • RQ1教師あり微調整データの量を増加させると、LLM においてパrametricな世界知識が顕著に忘却されるか?
  • RQ2MoE ベースのプラグインアーキテクチャは、世界知識を保持しつつ、下流の命令従いタスクのパフォーマンスを向上させられるか?
  • RQ3局所的バランス制約は、知識系エキスパートとタスク固有エキスパートの両方でエキスパートの過剰利用を防ぎ、利用のバランスを保つのにどの程度効果的か?
  • RQ4提案された LoRAMoE プラグインは、入力データタイプの事前知識がなくてもエンドツーエンドの推論を可能にできるか?
  • RQ5LoRAMoE は、指令データをスケーリングするにあたり、世界知識を保持しながら、標準的な SFT や他の PEFT 方法をどの程度上回るか?

主な発見

  • 教師あり微調整データの増加により、クローズドブックQAベンチマーク(例:TriviaQA、Natural Questions)におけるパフォーマンスが顕著に低下し、パrametricな知識の忘却が示された。
  • LoRAMoE は、微調整データを 10万件から 300万件に増加させても、CBQA ベンチマークで顕著な低下が認められず、世界知識のパフォーマンスを効果的に維持した。
  • WSC(Winograd Schema Challenge)推論時、LoRAMoE のルーターは平均して約 45% の注目を知識保持エキスパートグループに割り当てており、世界知識の活用が明確に示された。
  • LoRAMoE は、多様な命令データタイプにおいて下流タスクのパフォーマンスを向上させ、知識保持を損なうことなくマルチタスク能力を強化した。
  • 局所的バランス制約は、各グループ内での少数のエキスパートへのルーターの偏りを効果的に防止し、安定的かつ均等なエキスパート利用を確保した。
  • LoRAMoE は、入力データタイプの事前分類が不要なエンドツーエンドの、データタイプに依存しない推論を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。