Skip to main content
QUICK REVIEW

[논문 리뷰] LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin

Shihan Dou, Enyu Zhou|arXiv (Cornell University)|2023. 12. 15.
Topic Modeling인용 수 7
한 줄 요약

LoRAMoE는 대규모 언어 모델에 대한 Mixture-of-Experts (MoE)-스타일 플러그인으로, LoRA 기반 전문가를 사용하여 최종 작업 적응과 세계 지식 유지를 분리한다. 배경 모델을 동결하고, 데이터를 작업 전용 전문가 또는 지식 보존 전문가로 라우팅하기 위해 局소적 균형 제약 조건을 적용함으로써, LoRAMoE는 막대한 지시 미세조정 데이터를 사용할 때조차도 매개변수 기반 지식 유실을 방지하면서 동시에 최종 작업 성능을 향상시킨다.

ABSTRACT

Supervised fine-tuning (SFT) is a crucial step for large language models (LLMs), enabling them to align with human instructions and enhance their capabilities in downstream tasks. Increasing instruction data substantially is a direct solution to align the model with a broader range of downstream tasks or notably improve its performance on a specific task. However, we find that large-scale increases in instruction data can damage the world knowledge previously stored in LLMs. To address this challenge, we propose LoRAMoE, a novelty framework that introduces several low-rank adapters (LoRA) and integrates them by using a router network, like a plugin version of Mixture of Experts (MoE). It freezes the backbone model and forces a portion of LoRAs to focus on leveraging world knowledge to solve downstream tasks, to alleviate world knowledge-edge forgetting. Experimental results show that, as the instruction data increases, LoRAMoE can significantly improve the ability to process downstream tasks, while maintaining the world knowledge stored in the LLM.

연구 동기 및 목표

  • 최종 작업을 위한 지도 미세조정(SFT) 데이터를 늘릴 때 대규모 언어 모델(LLM)에서 발생하는 매개변수 기반 지식 유실 문제를 해결한다.
  • 배경 모델을 재학습하지 않고도 새로운 지시 데이터에서 성능을 향상시키면서 사전 훈련된 세계 지식을 유지한다.
  • 저랭크 미세조정(LoRA)을 사용하여 작업 전용 적응과 지식 유지 간의 분리를 구현하는 플러그인 기반 MoE 아키텍처를 설계한다.
  • 특정 그룹(작업 vs. 지식) 내 전문가의 균형 잡힌 이용을 보장하고 라우터의 집중을 방지하기 위해 국소적 균형 제약 조건을 도입한다.
  • 배포 시 입력 데이터 유형에 대한 사전 지식이 필요 없이 엔드 투 엔드, 데이터 유형 무관의 추론을 가능하게 한다.

제안 방법

  • 모든 피드포워드 레이어에 다수의 LoRA 기반 전문가를 통합하여 라우터를 갖춘 MoE 스타일 아키텍처를 구성한다.
  • 훈련 중 배경 LLM 파라미터를 동결하여 모든 사전 훈련된 세계 지식을 유지한다.
  • 전문가를 두 가지 별도의 집합으로 그룹화하는 국소적 균형 제약 조건을 적용한다: 하나는 최종 작업 적응을 위한 것이고, 다른 하나는 인간 지시와 세계 지식을 일치시키기 위한 것이다.
  • 입력 특성에 따라 토큰을 전문가로 라우팅하는 라우터 메커니즘을 사용하며, 각 그룹 내 전문가 간의 균형 잡힌 주의를 보장하는 제약 조건을 적용한다.
  • 메인 모델 가중치를 동결한 채 LoRA 어댑터와 라우터를 엔드 투 엔드로 동시에 훈련하여 효율적인 매개변수 효율적 미세조정을 가능하게 한다.
  • 전문가 수가 증가함에도 불구하고 추가 계산 비용을 최소화하기 위해 각 전문가 네트워크에서 저랭크 미세조정(LoRA)을 활용한다.

실험 결과

연구 질문

  • RQ1지시 미세조정 데이터의 양을 늘릴수록 대규모 언어 모델에서 매개변수 기반 세계 지식이 유실되는가?
  • RQ2MoE 기반 플러그인 아키텍처는 최종 지시 수행 작업에서 성능을 향상시키는 동시에 세계 지식을 유지할 수 있는가?
  • RQ3국소적 균형 제약 조건은 지식 전문가와 작업 전용 전문가 간의 전문가 과도 이용을 방지하고 균형 잡힌 이용을 보장하는 데 얼마나 효과적인가?
  • RQ4제안된 LoRAMoE 플러그인은 입력 데이터 유형에 대한 사전 지식 없이도 엔드 투 엔드 추론을 가능하게 하는가?
  • RQ5LoRAMoE는 지시 데이터 확장에 따라 표준 SFT 및 기타 PEFT 방법에 비해 세계 지식 유지 능력에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • 지시 미세조정 데이터의 양을 늘릴수록 닫힌 책 질문 응답 벤치마크(예: TriviaQA, Natural Questions)에서 성능 저하가 심각하게 발생함을 확인하여 매개변수 기반 지식 유실이 발생함을 시사한다.
  • LoRAMoE는 10만 건에서 300만 건으로 증가한 미세조정 데이터를 사용할 때조차도 CBQA 벤치마크에서 성능 저하가 없이 세계 지식 성능을 유지함을 입증하였다.
  • WSC(윈오그라드 스키마 챌린지) 추론 중 평균적으로 약 45%의 주의가 지식 보존 전문가 그룹에 할당됨을 확인하여 세계 지식 활용이 활발히 이루어지고 있음을 보여준다.
  • LoRAMoE는 다양한 지시 데이터 유형에서 최종 작업 성능을 향상시켜 다중 작업 능력을 향상시키며 지식 유지 능력을 손상시키지 않았다.
  • 국소적 균형 제약 조건은 각 그룹 내 일부 전문가에 대한 라우터의 편향을 효과적으로 방지하여 안정적이고 균형 잡힌 전문가 이용을 보장한다.
  • LoRAMoE는 입력 데이터 유형에 대한 사전 분류 없이도 엔드 투 엔드, 데이터 유형 무관의 추론을 가능하게 하여 디플로이먼트 시의 복잡성을 제거한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.