[논문 리뷰] Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts
이 논문은 이미지 전체를 전달하는 방식—즉, 개별 패치가 아니라 전용 전문가에게—Vision Transformers (ViTs) 내에서 전문화된 전문가에게 라우팅하는 스파arsed Mixture-of-Experts (MoE) 아키텍처인 Mobile V-MoEs를 제안한다. 이는 조건부 계산을 효율적으로 가능하게 한다. 의미적 슈퍼클래스를 사용해 라우터 학습을 안정화함으로써, 이 방법은 효율성 대비 성능의 최신 기준을 달성하며, ViT-Tiny의 경우 ImageNet-1k에서 밀도 있는 ViTs보다 3.39% 높고, 더 작은 54M FLOP 모델의 경우 4.66% 높은 성능을 기록한다.
Sparse Mixture-of-Experts models (MoEs) have recently gained popularity due to their ability to decouple model size from inference efficiency by only activating a small subset of the model parameters for any given input token. As such, sparse MoEs have enabled unprecedented scalability, resulting in tremendous successes across domains such as natural language processing and computer vision. In this work, we instead explore the use of sparse MoEs to scale-down Vision Transformers (ViTs) to make them more attractive for resource-constrained vision applications. To this end, we propose a simplified and mobile-friendly MoE design where entire images rather than individual patches are routed to the experts. We also propose a stable MoE training procedure that uses super-class information to guide the router. We empirically show that our sparse Mobile Vision MoEs (V-MoEs) can achieve a better trade-off between performance and efficiency than the corresponding dense ViTs. For example, for the ViT-Tiny model, our Mobile V-MoE outperforms its dense counterpart by 3.39% on ImageNet-1k. For an even smaller ViT variant with only 54M FLOPs inference cost, our MoE achieves an improvement of 4.66%.
연구 동기 및 목표
- 자원 제약이 있는 비전 응용 분야에서 Vision Transformers (ViTs)를 규모 축소함으로써 성능 대비 효율성의 균형을 향상시키기 위해.
- 기존의 스파arsed MoE 설계에서 개별 패치를 라우팅하는 방식이 초래하는 비효율성, 즉 추론 시 많은 전문가를 로드해야 하는 문제를 해결하기 위해.
- 의미적 슈퍼클래스를 활용해 라우터 학습을 유도하고 전문가 붕괴를 방지함으로써, 소규모 모델에서 MoE 학습을 안정화하기 위해.
- 이미지 수준의 라우팅이 소규모 ViT 모델에서 패치 수준의 라우팅보다 효율성과 정확도 측면에서 더 우수하다는 것을 입증하기 위해.
제안 방법
- 단일 라우터가 개별 패치가 아니라 전체 입력 이미지를 전문가에게 할당하는 모바일 친화적인 MoE 설계를 제안한다.
- softmax 기반의 라우팅 함수를 사용하며, 여기서는 이미지당 E개의 전문가 중 k개만 활성화된다.
- 라우터 학습을 안정화시키기 위해 의미적 슈퍼클래스를 지도 신호로 사용하는 안정적인 학습 절차를 도입한다.
- L개의 MoE-ViT 레이어와 그 다음에 밀도 있는 ViT 레이어를 조합한 하이브리드 아키텍처를 사용하여, 선택적 계산을 가능하게 하면서도 모델 용량을 유지한다.
- 전문가 불균형을 방지하기 위해 슈퍼클래스 예측에 보조 손실을 적용하여 로드 밸런싱을 수행한다.
- 라우터를 모델의 나머지 부분과 함께 엔드 투 엔드로 학습하지만, 수렴을 향상시키고 붕괴를 방지하기 위해 슈퍼클래스 지도를 활용한다.

실험 결과
연구 질문
- RQ1자원 제약이 있는 모바일 비전 응용 분야에서 ViTs를 규모 축소하기 위해 스파arsed MoEs가 효과적으로 사용될 수 있는가?
- RQ2소규모 ViT 모델에서 이미지 수준의 라우팅이 패치 수준의 라우팅보다 추론 효율성과 정확도 측면에서 뛰어나게 되는가?
- RQ3의미적 슈퍼클래스 지도가 소규모 모델에서 MoE 학습을 안정화시키고 전문가 붕괴를 방지할 수 있는가?
- RQ4소규모 ViT 모델에 최적화된 MoE 하이퍼파라미터(예: 전문가 수, MoE 레이어 깊이, top-k 라우팅)의 최적 구성은 무엇인가?
- RQ5Mobile V-MoEs의 성능 대비 효율성 균형은 밀도 있는 ViTs와 표준 MoE-ViTs에 비해 어떻게 비교되는가?
주요 결과
- ViT-Tiny (12×192)의 경우, Mobile V-MoE는 ImageNet-1k에서 밀도 있는 ViT 기준보다 top-1 정확도가 3.39% 높다.
- 오직 54M FLOPs만을 사용하는 더 작은 ViT 변형 모델의 경우, Mobile V-MoE는 밀도 있는 대안보다 4.66% 높은 정확도를 달성한다.
- 최적의 전문가 수 E는 10이며, 이를 초과하면 성능이 정체되고 라우터 정확도가 감소한다. 이는 분류 곤란도 증가하기 때문이다.
- L=2개의 MoE 레이어에서 최고의 성능이 달성되며, 더 깊은 MoE 사용은 특징 정보가 덜 명확해져 라우터 정확도를 떨어뜨린다.
- 의미적 슈퍼클래스를 사용한 이미지 수준의 라우팅은 엔드 투 엔드 학습된 라우팅과 무작위 슈퍼클래스 기반 베이스라인을 모두 능가하며, 특히 FLOPs 효율성 측면에서 뚜렷한 우월성을 보인다.
- 이미지당 k=1 또는 k=2개의 전문가를 사용할 경우, FLOPs 대비 성능 향상이 가장 크며, k가 더 높아지면 수익 감소 현상이 나타난다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.