Skip to main content
QUICK REVIEW

[논문 리뷰] Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy

Pingzhi Li, Zhenyu Zhang|arXiv (Cornell University)|2023. 10. 02.
Domain Adaptation and Few-Shot LearningComputer Science인용 수 3
한 줄 요약

이 논문은 처음으로 라우팅 정책 유도 전문가 통합을 통해 희박한 믹스처 오브 전문가(SMoE)를 융합한 다음, 낮은 랭크와 구조적 희박성을 사용하여 융합된 전문가를 압축하는 새로운 프레임워크인 MC-SMoE를 제안한다. 활성화 빈도와 라우팅 유사성을 활용하여 M-SMoE는 부정확성과 메모리 사용을 줄이며, 8개 벤치마크에서 성능 저하가 거의 없이 최대 80%의 메모리 절감과 20%의 FLOPs 절감을 달성한다.

ABSTRACT

Sparsely activated Mixture-of-Experts (SMoE) has shown promise to scale up the learning capacity of neural networks, however, they have issues like (a) High Memory Usage, due to duplication of the network layers into multiple copies as experts; and (b) Redundancy in Experts, as common learning-based routing policies suffer from representational collapse. Therefore, vanilla SMoE models are memory inefficient and non-scalable, especially for resource-constrained downstream scenarios. In this paper, we ask: Can we craft a compact SMoE model by consolidating expert information? What is the best recipe to merge multiple experts into fewer but more knowledgeable experts? Our pilot investigation reveals that conventional model merging methods fail to be effective in such expert merging for SMoE. The potential reasons are: (1) redundant information overshadows critical experts; (2) appropriate neuron permutation for each expert is missing to bring all of them in alignment. To address this, we propose M-SMoE, which leverages routing statistics to guide expert merging. Specifically, it starts with neuron permutation alignment for experts; then, dominant experts and their "group members" are formed; lastly, every expert group is merged into a single expert by utilizing each expert's activation frequency as their weight for merging, thus diminishing the impact of insignificant experts. Moreover, we observed that our proposed merging promotes a low dimensionality in the merged expert's weight space, naturally paving the way for additional compression. Hence, our final method, MC-SMoE (i.e., Merge, then Compress SMoE), further decomposes the merged experts into low-rank and structural sparse alternatives. Extensive experiments across 8 benchmarks validate the effectiveness of MC-SMoE. For instance, our MC-SMoE achieves up to 80% memory and a 20% FLOPs reduction, with virtually no loss in performance.

연구 동기 및 목표

  • 자원 제약이 있는 배포 환경에서 희박한 믹스처 오브 전문가(SMoE) 모델의 높은 메모리 사용과 전문가의 부정확성 문제를 해결하기 위해.
  • 성능 저하 없이 전문가 정보를 더 적은 수의 더 지능적인 전문가로 효과적으로 통합할 수 있는지 조사하기 위해.
  • 기존의 모델 융합 기법보다 SMoE 환경에서 더 우수한 성능을 보이는 융합 전략을 개발하기 위해.
  • 융합된 전문가가 본질적으로 더 압축 가능성이 있는지 탐색하여 추가적인 효율성 향상을 도모하기 위해.

제안 방법

  • M-SMoE는 라우팅 통계를 사용하여 전문가 융합을 유도한다: 먼저 전역 순열을 통해 전문가 간의 뉴런을 정렬하여 기능의 대응을 보장한다.
  • 라우팅 정책 유사성을 기반으로 주도 전문가와 그 '그룹 구성원'을 식별하여 전문가 그룹을 형성한다.
  • 각 그룹 내 전문가들은 활성화 빈도를 가중치로 사용하여 평균화 방식으로 융합하여, 덜 중요한 전문가의 영향을 감소시킨다.
  • 융합된 전문가들이 더 낮은 차원의 가중치 공간에 존재하는 것으로 나타나, 추가적인 압축이 가능하다.
  • MC-SMoE는 융합된 전문가에 대해 낮은 랭크와 구조적 희박성을 적용하여 추가로 파라미터와 FLOPs 절감을 달성한다.
  • 이 방법은 스위치-베이스-32 SMoE 모델을 사용하여 8개의 NLP 벤치마크에서 종단 간(end-to-end)으로 평가되었다.

실험 결과

연구 질문

  • RQ1SMoE에서 전문가 정보를 성능 손실 없이 더 적은 수의 더 지능적인 전문가로 효과적으로 통합할 수 있는가?
  • RQ2기존의 모델 융합 기법이 SMoE 환경에서 실패하는 이유는 무엇이며, 핵심적인 실패 원인은 무엇인가?
  • RQ3라우팅 정책는 어떻게 활용되어 전문가 융합을 유도하고, 부정확성 있는 전문가와 주도 전문가를 식별할 수 있는가?
  • RQ4전문가 융합이 본질적으로 더 낮은 차원의 가중치 공간을 만들어내는가? 이는 추가적인 압축 가능성을 제공하는가?
  • RQ5융합과 압축 중 어느 것이 메모리 및 FLOPs 효율성 향상에 더 기여하는가?

주요 결과

  • MC-SMoE는 스위치-베이스-32 SMoE 모델에서 8개의 벤치마크 전반에서 최대 80%의 메모리 절감과 20%의 FLOPs 절감을 달성하면서도 성능 저하가 거의 없이 성과를 내었다.
  • 모든 작업에서 C-SMoE(압축 전용)보다 M-SMoE가 더 우수한 성능을 보이며, 성능 유지 측면에서 융합이 압축보다 더 효과적임을 입증했다.
  • 빈도 가중 융합은 일률적 및 페셔 가중 융합보다 일관되게 우수하며, 평균적으로 각 작업에서 1.5–2%의 정확도 향상을 보였다.
  • M-SMoE에서 융합된 전문가들은 낮은 내재 차원성을 보이며, 낮은 랭크와 구조적 희박성에 의한 효과적인 후행 압축이 가능했다.
  • 후행 SMoE 레이어에서 더 높은 압축 가능성이 나타났으며, 히트맵 시각화에서 남은 파라미터의 분포를 통해 이를 확인할 수 있었다.
  • 제거 분석 결과, 빈도 인식 융합이 부정확한 전문가를 억제하여 핵심 지식이 가려지는 것을 방지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.