Skip to main content
QUICK REVIEW

[논문 리뷰] A Closer Look into Mixture-of-Experts in Large Language Models

Ka Man Lo, Zeyu Huang|arXiv (Cornell University)|2024. 06. 26.
Computational and Text Analysis Methods인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델에서 믹스처 오브 익스퍼트(MoE)에 대한 종합적인 실험 분석을 제공하며, Mixtral 8x7B, DeepSeekMoE, Grok-1 세 가지 모델의 파라미터 및 행동적 특성에 대해 분석한다. 연구 결과에 따르면 뉴런은 미세한 전문가 역할을 하며, 라우터는 출력 노름이 높은 전문가를 선호하고, 전문가의 다양성은 깊이가 증가함에 따라 증가하지만 최종 레이어는 이질적인 경향을 보인다. 이러한 발견들은 초기 학습에서의 학습 전략이 전문가 다양성을 향상시키며, 라우터 설계 및 전문가 할당 전략에 대한 통찰을 제공한다.

ABSTRACT

Mixture-of-experts (MoE) is gaining increasing attention due to its unique properties and remarkable performance, especially for language tasks. By sparsely activating a subset of parameters for each token, MoE architecture could increase the model size without sacrificing computational efficiency, achieving a better trade-off between performance and training costs. However, the underlying mechanism of MoE still lacks further exploration, and its modularization degree remains questionable. In this paper, we make an initial attempt to understand the inner workings of MoE-based large language models. Concretely, we comprehensively study the parametric and behavioral features of three popular MoE-based models and reveal some intriguing observations, including 1) Neurons act like fine-grained experts; 2) The router of MoE usually selects experts with larger output norms; 3) The expert diversity increases as the layer increases, while the last layer is an outlier, which is further validated by an initial experiment. Based on the observations, we also provide suggestions for a broad spectrum of MoE practitioners, such as router design and expert allocation. We hope this work could shed light on future research on the MoE framework and other modular architectures. Code is available at https://github.com/kamanphoebe/Look-into-MoEs.

연구 동기 및 목표

  • MoE 기반 LLM이 이질적인 전문가 특화를 통해 진정으로 모듈화되었는지 여부를 조사하기 위해.
  • 최근 MoE 모델의 전문가에 대한 파rametric 및 행동적 특성 분석을 통해 파라미터 상관관계, 라우팅 행동, 출력 유사도를 집중적으로 분석하기 위해.
  • MoE 모델에서 전문가 다양성과 특화에 영향을 미치는 아키텍처적 및 학습 수준의 요인을 규명하기 위해.
  • 실험적 관찰 기반으로 라우터 설계, 전문가 할당 및 학습 전략에 실질적인 통찰을 제공하기 위해.

제안 방법

  • 공개된 가중치를 활용해 최근 MoE 모델 세 종류—Mixtral 8x7B, DeepSeekMoE, Grok-1—에 대한 실험적 분석을 수행하였다.
  • 다양한 입력에 걸쳐 가중치 행렬과 출력 특징 벡터 간의 코사인 유사도를 계산하여 전문가 파라미터 유사도를 산정하였다.
  • 게이트 점수와 전문가 출력 노름, 활성화 패턴 간의 상관관계를 분석하여 라우터 행동을 검토하였다.
  • 뉴런 수준의 활성화 히트맵을 시각화하고 분석하여 미세한 전문가 행동과 전문가 간 유사도를 평가하였다.
  • 특히, Mixtral(업사이클링 가능)과 DeepSeek 및 Grok-1(초기화부터 학습)의 다른 학습 방식을 비교함으로써 전문가 상관관계에 미치는 영향을 평가하였다.
  • 노름 기반 라우팅 감시 및 상관관계 측정을 통해 라우팅 효율성과 전문가의 독창성을 평가하였다.
Figure 5: Intermediate state values of Mixtral experts. The top $k$ experts are shown on top of each heat map. Each number in the vertical axis refers to an expert index while the horizontal axis represents the number of neurons.
Figure 5: Intermediate state values of Mixtral experts. The top $k$ experts are shown on top of each heat map. Each number in the vertical axis refers to an expert index while the horizontal axis represents the number of neurons.

실험 결과

연구 질문

  • RQ1MoE 기반 LLM의 전문가들이 파라미터와 행동에서 의미 있는 이질성을 보이는가, 아니면 높은 상관관계를 보이는가?
  • RQ2MoE 모델의 라우터는 전문가를 어떻게 선택하는가, 그리고 출력 노름이 높은 전문가를 선호하는가?
  • RQ3전문가 다양성은 모델의 깊이에 따라 어떻게 변화하는가, 그리고 왜 최종 레이어에서는 유사도 추세가 뒤집히는가?
  • RQ4초기 학습과 특수화된 초기화 방식 간의 영향을 고려할 때, 전문가 다양성과 상관관계에 어떤 정도의 영향을 미치는가?
  • RQ5전문가 간의 가중치 행렬 유사도는 출력 특징 유사도를 대체로 잘 반영할 수 있는가?

주요 결과

  • 피드포워드 네트워크 내 뉴런은 미세한 전문가 역할을 하며, 게이트 임bed딩과 게이트 프로젝션 행렬 간의 활성화 패턴이 상관관계를 보이며 뉴런 수준의 특화가 일어나고 있음을 시사한다.
  • Mixtral 8x7B와 DeepSeekMoE의 라우터는 항상 출력 노름이 높은 전문가를 선택하는 경향이 있어, 노름 기반 라우팅 전략이 강력하고 효과적인 전략임을 입증한다.
  • 전문가 유사도는 레이어 깊이가 증가함에 따라 감소하여 다양성이 증가하는 것으로 나타났지만, 최종 레이어에서는 급격한 유사도 증가로 인해 이질적인 경향을 보이며 계층에서 이례적인 존재로 나타났다.
  • 전문가 가중치 행렬 간의 유사도 측정값이 토큰별 평균 출력 유사도와 강하게 상관관계를 보이며, 출력 수준 평가를 대체로 효율적으로 수행할 수 있음을 시사한다.
  • 초기 학습 방식으로 학습된 모델들(예: DeepSeekMoE, Grok-1)은 Mixtral에 비해 전문가 파라미터와 행동 간 상관관계가 약한 편이었으며, 이는 초기 학습이 전문가 다양성을 더 잘 촉진할 수 있음을 시사한다.
  • Mixtral에서 관찰된 강한 파라미터 및 행동 상관관계는, 기본 모델에서 업사이클링한 특수한 초기화 전략을 사용해 학습된 결과일 가능성이 높으며, 초기화부터 학습한 것이 아님을 암시한다.
A Closer Look into Mixture-of-Experts in Large Language Models

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.