[論文レビュー] Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts
本論文は、画像の全体を処理単位としてルーティングする、スパースなMixture-of-Experts(MoE)アーキテクチャ「Mobile V-MoEs」を提案する。このアーキテクチャは、ビジョントランスフォーマー(ViTs)内の専門的エキスパートに、個々のパッチではなく画像全体をルーティングすることで、効率的な条件付き計算を実現する。意味的スーパークラスを用いてルーターの訓練を安定化させることで、効率性と性能のトレードオフにおいて最先端の結果を達成し、ViT-TinyではImageNet-1kで3.39%、54M FLOPのより小さなモデルでは4.66%の性能向上を達成した。
Sparse Mixture-of-Experts models (MoEs) have recently gained popularity due to their ability to decouple model size from inference efficiency by only activating a small subset of the model parameters for any given input token. As such, sparse MoEs have enabled unprecedented scalability, resulting in tremendous successes across domains such as natural language processing and computer vision. In this work, we instead explore the use of sparse MoEs to scale-down Vision Transformers (ViTs) to make them more attractive for resource-constrained vision applications. To this end, we propose a simplified and mobile-friendly MoE design where entire images rather than individual patches are routed to the experts. We also propose a stable MoE training procedure that uses super-class information to guide the router. We empirically show that our sparse Mobile Vision MoEs (V-MoEs) can achieve a better trade-off between performance and efficiency than the corresponding dense ViTs. For example, for the ViT-Tiny model, our Mobile V-MoE outperforms its dense counterpart by 3.39% on ImageNet-1k. For an even smaller ViT variant with only 54M FLOPs inference cost, our MoE achieves an improvement of 4.66%.
研究の動機と目的
- リソース制限のあるビジョンアプリケーション向けに、ビジョントランスフォーマー(ViTs)をスケーリングダウンすることで、性能と効率性のトレードオフを改善すること。
- 個々のパッチをルーティングする従来のスパースMoE設計の非効率性を是正すること。これは、1回の推論で多数のエキスパートをロードする必要があるためである。
- 意味的スーパークラスを活用してルーター学習を誘導することで、小規模モデルにおけるMoE訓練の安定化を図り、エキスパートの崩壊を防ぐこと。
- 画像単位のルーティングが、小規模なViTモデルにおいてパッチ単位のルーティングよりも、効率性と精度の両面で優れていることを実証すること。
提案手法
- 1つのルーターが個々のパッチではなく、入力画像全体をエキスパートに割り当てる、モバイルフレンドリーなMoE設計を提案する。
- トップ-k選択を伴うソフトマックスベースのルーティング関数を用い、1枚の画像に対してE個のエキスパートのうちk個のみが活性化される。
- 意味的スーパークラスを監視信号として用いる安定した訓練手順を導入し、ルーターの訓練不安定性を低減する。
- L個のMoE-ViT層とその後に続く密度的ViT層を組み合わせたハイブリッドアーキテクチャを採用することで、選択的計算を実現しながらも、モデル容量を維持する。
- スーパークラス予測に対する補助損失を用いて負荷バランスを実現し、訓練中にエキスパートの偏りを防ぐ。
- ルーターをモデル全体と同時にエンドツーエンドで訓練するが、収束性の向上と崩壊の防止を図るため、スーパークラスの監視信号を用いる。

実験結果
リサーチクエスチョン
- RQ1リソース制限のあるモバイルビジョンアプリケーション向けに、スパースMoEを効果的に用いてViTをスケーリングダウンできるか?
- RQ2小規模なViTモデルにおいて、画像単位のルーティングがパッチ単位のルーティングを上回る推論効率性と精度を達成できるか?
- RQ3意味的スーパークラスの監視によって、小規模モデルにおけるMoE訓練が安定化し、エキスパートの崩壊が防げるか?
- RQ4小規模なViTモデルにおけるMoEハイパーパrameter(例:エキスパート数、MoE層の深さ、トップ-kルーティング)の最適な設定は何か?
- RQ5Mobile V-MoEsの性能と効率性のトレードオフは、密度的ViTや標準的なMoE-ViTsと比較してどうなるか?
主な発見
- ViT-Tiny(12×192)では、Mobile V-MoEが密度的ViTベースラインをImageNet-1kのトップ-1精度で3.39%上回った。
- 54M FLOPsのより小さなViTバージョンでは、Mobile V-MoEが密度的対応モデルを4.66%上回った。
- 最適なエキスパート数Eは10であり、それ以上になると性能が頭打ちになり、分類の難易度上昇に伴いルーターの精度が低下する。
- L=2のMoE層が最良のモデル性能を達成した。これは、より深いMoEの使用が、情報量の少ない特徴に起因してルーター精度を低下させるためである。
- 意味的スーパークラスを用いた画像単位のルーティングは、エンドツーエンドで学習されたルーティングやランダムスーパークラスベースラインを上回り、特にFLOPs効率性の観点で顕著な優位性を示した。
- 1枚の画像に対してk=1またはk=2のエキスパートを用いることで、FLOPsに比して最も高い性能向上が得られ、kが高くなると利得が減少する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。