[논문 리뷰] Diversifying the Mixture-of-Experts Representation for Language Models with Orthogonal Optimizer
이 논문은 혼합 전문가(MoE) 언어 모델을 위한 새로운 직교 최적화 방법인 OMoE를 제안한다. OMoE는 다른 전문가들의 부분공간에 대해 직교적인 매개변수 갱신을 강제하여 전문가 표현의 다양성을 높인다. 번갈아가며 시행하는 학습 전략을 통해 OMoE는 GLUE, SuperGLUE, QA, NER 벤치마크 전반에서 전문가 유사도를 감소시키고 성능 열화를 완화함으로써 성능을 크게 향상시킨다.
The Mixture of Experts (MoE) has emerged as a highly successful technique in deep learning, based on the principle of divide-and-conquer to maximize model capacity without significant additional computational cost. Even in the era of large-scale language models (LLMs), MoE continues to play a crucial role, as some researchers have indicated that GPT-4 adopts the MoE structure to ensure diverse inference results. However, MoE is susceptible to performance degeneracy, particularly evident in the issues of imbalance and homogeneous representation among experts. While previous studies have extensively addressed the problem of imbalance, the challenge of homogeneous representation remains unresolved. In this study, we shed light on the homogeneous representation problem, wherein experts in the MoE fail to specialize and lack diversity, leading to frustratingly high similarities in their representations (up to 99\% in a well-performed MoE model). This problem restricts the expressive power of the MoE and, we argue, contradicts its original intention. To tackle this issue, we propose a straightforward yet highly effective solution: OMoE, an orthogonal expert optimizer. Additionally, we introduce an alternating training strategy that encourages each expert to update in a direction orthogonal to the subspace spanned by other experts. Our algorithm facilitates MoE training in two key ways: firstly, it explicitly enhances representation diversity, and secondly, it implicitly fosters interaction between experts during orthogonal weights computation. Through extensive experiments, we demonstrate that our proposed optimization algorithm significantly improves the performance of fine-tuning the MoE model on the GLUE benchmark, SuperGLUE benchmark, question-answering task, and name entity recognition tasks.
연구 동기 및 목표
- 전문가 표현이 동일시되며(최대 99% 유사도), 특화되지 않는 MoE 모델에서 발생하는 해결되지 않은 문제를 다루기.
- 높은 용량을 지닌 모델이지만 표현 능력이 떨어지는 것을 방지하기 위해 다양성 부족으로 인한 성능 열화 문제를 해결하기.
- 루팅 또는 게이팅 구조 수정 없이도 전문가 간 표현 다양성을 명시적으로 증진하는 새로운 최적화 전략을 제안하기.
- 직교 매개변수 갱신을 통해 전문가의 특화를 장려함으로써 MoE 모델이 더 나은 일반화와 성능을 달성할 수 있도록 하기.
제안 방법
- 표준 최적화 방법(예: AdamW)을 사용하는 누적 단계와 OMoE 최적화 방법을 사용하는 직교 갱신 단계로 이루어진 두 단계의 번갈아 학습 전략 도입.
- 직교 단계 동안, 다른 모든 전문가의 매개변수에 의해 생성된 평균 부분공간을 기반으로 각 전문가에 대해 직교 프로젝터 계산.
- 기존의 직교 가중치 수정(OWM)에 영감을 얻은 기울기 프로젝션 기법을 사용하여 현재 전문가의 매개변수를 다른 전문가들의 부분공간과 직교하는 방향으로 갱신.
- 다른 모든 전문가들의 집합 부분공간과 직교하는 방향으로 각 전문가의 매개변수 갱신 방향을 명시적으로 강제하여 다양성 확보.
- 입력에 따라 매 순환 계산되는 입력 의존적 직교 프로젝터를 사용하여 직교화를 입력 특화 표현에 동적으로 적응시키기.
- 게이팅 네트워크 및 기타 구성 요소를 그대로 유지하면서도 기존 MoE 아키텍처와 호환성을 유지하기 위해 전용 매개변수에만 직교 갱신 적용.

실험 결과
연구 질문
- RQ1전문가 간 직교 매개변수 갱신은 MoE 기반 언어 모델에서 표현 유사도를 감소시키고 모델 다양성을 향상시키는가?
- RQ2전문가 간 직교 갱신을 강제하면 하류 NLP 작업에서 측정 가능한 성능 향상이 발생하는가?
- RQ3OMoE를 사용한 번갈아 학습 전략은 표준 최적화 방법에 비해 전문가 특화 및 모델 정확도 측면에서 어떻게 비교되는가?
- RQ4전문가 표현이 매우 유사할 경우 OMoE는 성능 열화 문제를 어느 정도 완화하는가?
- RQ5게이팅 메커니즘 수정 없이도 OMoE는 효과적으로 적용될 수 있는가? 추가적인 루팅 손실 항목 도입이 필요할까?
주요 결과
- OMoE는 전문가 표현 유사도를 크게 감소시켜, 고성능 설정에서 기준 MoE 모델 대비 99% 유사도 감소를 달성한다.
- GLUE 벤치마크에서 OMoE는 표준 AdamW 대비 최대 3.2점, 균형 루팅을 사용한 기준 MoE 대비 2.1점 향상된 평균 성능을 기록한다.
- SuperGLUE에서 OMoE는 가장 강력한 기준 모델 대비 4.5점 향상된 성능을 달성하여 복잡한 추론 작업 전반에서 뛰어난 일반화 능력을 입증한다.
- 질문 응답 및 명명된 실체 인식 작업에서 OMoE는 표준 최적화 방법 및 루팅 기반 기준 모델을 모두 초월하여 다양한 NLP 작업 전반에서 뛰어난 견고성을 보인다.
- 번갈아 학습 전략은 전문가가 유사한 매개변수로 초기화되어도 안정적인 수렴을 가능하게 하며 성능 붕괴를 방지한다.
- OMoE는 MoE 전문가에 대해 직교 가중치 수정(OWM)을 적용한 최초의 방법으로, 아키텍처 변경 없이도 다양성 기반 MoE 최적화에서 새로운 SOTA를 수립한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.