[論文レビュー] Rethinking Token-Mixing MLP for MLP-based Vision Backbone
本稿では、純粋なMLPビジョンバックボーンにおける標準的なトークン混合MLPの代替手段として、空間不変かつチャネル特化型の巡回チャネル特化型(CCS)トークン混合MLPを提案する。巡回重み構造とグループ別チャネル特化型演算を活用することで、CCSはパラメータ数を最大90%まで削減し、MLP-MixerではImageNet1Kのトップ1精度を77.2%から79.8%へ、ResMLPでは79.8%から80.6%へ向上させる。パラメータ数とFLOPsを減らしながらも、性能を維持している。
In the past decade, we have witnessed rapid progress in the machine vision backbone. By introducing the inductive bias from the image processing, convolution neural network (CNN) has achieved excellent performance in numerous computer vision tasks and has been established as \emph{de facto} backbone. In recent years, inspired by the great success achieved by Transformer in NLP tasks, vision Transformer models emerge. Using much less inductive bias, they have achieved promising performance in computer vision tasks compared with their CNN counterparts. More recently, researchers investigate using the pure-MLP architecture to build the vision backbone to further reduce the inductive bias, achieving good performance. The pure-MLP backbone is built upon channel-mixing MLPs to fuse the channels and token-mixing MLPs for communications between patches. In this paper, we re-think the design of the token-mixing MLP. We discover that token-mixing MLPs in existing MLP-based backbones are spatial-specific, and thus it is sensitive to spatial translation. Meanwhile, the channel-agnostic property of the existing token-mixing MLPs limits their capability in mixing tokens. To overcome those limitations, we propose an improved structure termed as Circulant Channel-Specific (CCS) token-mixing MLP, which is spatial-invariant and channel-specific. It takes fewer parameters but achieves higher classification accuracy on ImageNet1K benchmark.
研究の動機と目的
- 純粋なMLPビジョンバックボーンにおける既存のトークン混合MLPの空間的感度とチャネルに依存しない制限を解消すること。
- 空間的平行移動に対してより高いロバスト性を確保するとともに、チャネル特化型混合によって特徴表現を強化すること。
- パラメータ数を減らすことで、トークン混合MLP層のパラメータ数を削減すること。
- 従来のMLPベースのモデルと比較して、より少ないパラメータ数とFLOPsでImageNet1Kの精度を向上させること。
- 巡回構造とグループ別チャネル特化型演算が、ビジョントランスフォーマーに類似したアーキテクチャで効果を発揮することを示すこと。
提案手法
- 空間不変性を達成するために、標準的な全結合層を巡回重み行列に置き換える巡回チャネル特化型(CCS)トークン混合MLPを提案する。
- チャネルをグループに分割し、各グループに固有の巡回行列を適用することで、チャネル特化型混合を実装し、表現力の向上を図る。
- 巡回行列の行列ベクトル積を効率的に計算するために、高速フーリエ変換(FFT)を活用する。
- 各グループのチャネルが独立してトークン混合を受けるグループ別設計を導入し、より洗練されたパターン符号化を可能にする。
- MLP-MixerおよびResMLPにおける標準的なトークン混合MLPを、提案されたCCSモジュールに置き換えることで、性能と効率を評価する。
- モデル容量とパラメータ数のトレードオフを制御するためのハイパーパrameter G(グループ数)を導入する。
実験結果
リサーチクエスチョン
- RQ1標準的なトークン混合MLPの空間特化型設計が、空間的平行移動に対してモデルのロバスト性にどのように影響を与えるか?
- RQ2既存のトークン混合MLPのチャネルに依存しない性質が、ビジョンバックボーンにおける特徴表現にどの程度制限を及えるか?
- RQ3巡回重み構造が、パラメータ数を削減しつつ、トークン混合MLPにおける空間不変性を実現できるか?
- RQ4チャネル特化型混合が、純粋なMLPビジョンアーキテクチャにおける性能向上に寄与するか?
- RQ5提案されたCCSモジュールは、パラメータ数とFLOPsを減らしながら、標準的なトークン混合MLPを上回る精度を達成できるか?
主な発見
- MLP-Mixer-B/16におけるベースラインのトークン混合MLPをCCSに置き換えると、ImageNet1Kのトップ1精度が77.2%から79.8%に向上し、パラメータ数はわずか5700万にとどまる。
- ResMLP-36では、CCSモジュールの導入によりトップ1精度が79.8%から80.6%に向上し、パラメータ数は4400万から4300万に削減された。
- G=8のグループ数が、精度とパラメータ効率の最良のバランスを実現し、トップ1精度80.6%、パラメータ数4300万を達成した。
- Gを8より大きくすると、精度に飽和が見られるが、パラメータ数は4300万から4600万に増加し、効果の逓減が顕著になった。
- CCSは、パラメータ数とFLOPsを減らしながら、S²-MLP-wideおよびS²-MLP-deepと同等またはそれ以上の性能を達成した。
- 巡回構造によりFFTを用いた効率的な計算が可能であるが、パッチ数が少ない場合(例:N=196)にはその恩恵がやや顕著でない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。