[論文レビュー] RepMLPNet: Hierarchical Vision MLP with Re-parameterized Locality
RepMLPNetは、再パラメータ化技術「局所性インジェクション」を用いて、学習された局所的インダクティブバイアスを完全結合(FC)層に統合する、階層的ビジョンMLPアーキテクチャを提案する。これにより、画像認識で優れた性能を発揮し、初めてCityscapesのセマンティックセグメンテーションへのスムーズな転移が可能となり、5×5畳み込みによる置換で77.12 mIoUを達成した。
Compared to convolutional layers, fully-connected (FC) layers are better at modeling the long-range dependencies but worse at capturing the local patterns, hence usually less favored for image recognition. In this paper, we propose a methodology, Locality Injection, to incorporate local priors into an FC layer via merging the trained parameters of a parallel conv kernel into the FC kernel. Locality Injection can be viewed as a novel Structural Re-parameterization method since it equivalently converts the structures via transforming the parameters. Based on that, we propose a multi-layer-perceptron (MLP) block named RepMLP Block, which uses three FC layers to extract features, and a novel architecture named RepMLPNet. The hierarchical design distinguishes RepMLPNet from the other concurrently proposed vision MLPs. As it produces feature maps of different levels, it qualifies as a backbone model for downstream tasks like semantic segmentation. Our results reveal that 1) Locality Injection is a general methodology for MLP models; 2) RepMLPNet has favorable accuracy-efficiency trade-off compared to the other MLPs; 3) RepMLPNet is the first MLP that seamlessly transfer to Cityscapes semantic segmentation. The code and models are available at https://github.com/DingXiaoH/RepMLP.
研究の動機と目的
- 標準的なMLPに局所的インダクティブバイアスが欠如しているため、小規模データセットや下流タスクでの性能が制限されることに対処する。
- 推論速度に影響を与えることなく、完全結合層に局所性を統合する手法を開発する。
- セマンティックセグメンテーションのような密度予測タスクのための強力なバックボーンとして機能できる階層的MLPアーキテクチャを設計する。
- ドメイン特徴抽出のための効率的でデータに強い学習を可能にし、大規模データセットや蒸留に依存しない標準的な最適化法と増強法を用いる。
提案手法
- 局所性インジェクションを提案:訓練済み畳み込みカーネルをFC層重みに統合することで、局所的インダクティブバイアスを注入する構造的再パラメータ化手法。
- RepMLPブロックを導入:グローバルパーセプトロン、チャネル別パーセプトロン、局所畳み込みを組み合わせたマルチブランチモジュールで、バッチ正則化を用いて残差結合を実現。
- トレーニング時における三本の構造(FC + 畳み込み + BN)を、同等のパrameter変換により、推論時における単一の三FC構造に再パラメータ化する。
- 高解像度タスク(例:Cityscapes)向けに、パッチベースの推論戦略を採用。標準的な埋め込み層の代わりに3×3または5×5畳み込みを用いて、パッチ間のコンテキストを保持する。
- 蒸留や特別な技術に依存せず、標準的なデータ増強法とトレーニングプロトコルを適用する。
- 複数のRepMLPブロックを組み合わせた階層的RepMLPNetを設計し、セグメンテーションバックボーンに適したマルチスケール特徴マップを生成する。
実験結果
リサーチクエスチョン
- RQ1推論コストを増加させることなく、完全結合層に局所的インダクティブバイアスを効果的に統合できるか?
- RQ2大規模データや蒸留に依存せずに、小規模データセットや下流の密度予測タスクで優れた性能を発揮できる視覚MLPは構築可能か?
- RQ3FC層に局所性を統合しつつ、グローバルモデリング能力を保持できる再パラメータ化手法は存在するか?
- RQ4MLPベースのバックボーンは、Cityscapesのような高解像度セマンティックセグメンテーションタスクに成功裏に転移可能か?
- RQ5提案された局所性インジェクション手法は、異なるMLPアーキテクチャやデータセットに一般化可能か?
主な発見
- 局所性インジェクションにより、CIFAR-100でわずか216パラメータ増加でResMLPの精度が9.51%向上し、小規模データセットでも有効性が示された。
- RepMLPNetは、標準的なImageNet事前学習を用いてCityscapes検証セットで76.27 mIoUを達成し、MLPバックボーンがこのタスクに成功裏に転移した初の事例となった。
- 3×3ダウンサンプリング層を5×5畳み込みに置き換えることで、mIoUは77.12に上昇し、FLOPの増加は無視できるほど小さく、パッチ間通信の向上が確認された。
- RepMLPNet-D256から局所パーセプトロンを削除すると、ImageNetでの精度が2.15%低下し、統合された局所性の重要性が裏付けられた。
- 同時期のMLPと比較して、精度と効率のトレードオフが良好で、蒸留を必要とせず、学習コストも低かった。
- 階層的設計により、複数スケールの特徴マップが得られ、UperNetのようなセグメンテーションフレームワークのバックボーンとして実用的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。