Skip to main content
QUICK REVIEW

[論文レビュー] An Image Patch is a Wave: Phase-Aware Vision MLP

Yehui Tang, Kai Han|arXiv (Cornell University)|Nov 24, 2021
Advanced Neural Network Applications参考文献 43被引用数 5
ひとこと要約

この論文では、各画像パッチを動的位相変調を用いた波として表現することで、トークン集約を向上させる新しいビジョンMLPアーキテクチャ、Wave-MLPを提案する。入力の意味的特徴に適応する学習可能な位相項を導入することで、Wave-MLPは、同等のFLOPsを要する他のMLPおよびTransformerと比較して、画像分類、物体検出、セマンティックセグメンテーションの各タスクで最先端の性能を達成した。

ABSTRACT

In the field of computer vision, recent works show that a pure MLP architecture mainly stacked by fully-connected layers can achieve competing performance with CNN and transformer. An input image of vision MLP is usually split into multiple tokens (patches), while the existing MLP models directly aggregate them with fixed weights, neglecting the varying semantic information of tokens from different images. To dynamically aggregate tokens, we propose to represent each token as a wave function with two parts, amplitude and phase. Amplitude is the original feature and the phase term is a complex value changing according to the semantic contents of input images. Introducing the phase term can dynamically modulate the relationship between tokens and fixed weights in MLP. Based on the wave-like token representation, we establish a novel Wave-MLP architecture for vision tasks. Extensive experiments demonstrate that the proposed Wave-MLP is superior to the state-of-the-art MLP architectures on various vision tasks such as image classification, object detection and semantic segmentation. The source code is available at https://github.com/huawei-noah/CV-Backbones/tree/master/wavemlp_pytorch and https://gitee.com/mindspore/models/tree/master/research/cv/wave_mlp.

研究の動機と目的

  • 入力間の異なる意味的コンテンツに適応できない固定重みのトークン混合の限界を解消すること。
  • 波動力学にインspiredされた位相変調を導入することで、画像トークン間の動的情報集約を向上させること。
  • 既存のMLPおよびTransformerバックボーンを凌駕する、軽量で効率的なアーキテクチャを設計すること。
  • 位相に依存する集約を可能にすることで、物体検出やセマンティックセグメンテーションのような密度予測タスクにおけるMLPの有効な利用を可能にすること。

提案手法

  • 各画像パッチは、実数値の振幅(元の特徴)と単位複素数値の位相を持つ複素数値の波として表現される。
  • 入力の意味的特徴に基づいて、深さ方向畳み込みやチャネル方向全結合層などの単純な演算を用いて、各トークンごとに動的に位相値を生成する学習可能な位相推定モジュールが導入される。
  • 位相に依存するトークン混合モジュール(PATM)は、トークン間の位相差が相互作用の強度を調整する重み付き集約を計算する。
  • 位相変調により、類似した意味的コンテンツを持つトークン同士が集約過程で互いに強化され、特徴表現が向上する。
  • 階層的特徴学習のため、位相に依存するトークン混合とチャネル混合MLPブロックを交互に適用するWave-MLPアーキテクチャが構築される。
  • 局所的なウィンドウベースの集約に制限することで、密度予測タスクとの互換性を確保し、グローバル接続を回避する。

実験結果

リサーチクエスチョン

  • RQ1固定重み集約を超えて、動的位相変調がビジョンMLPにおけるトークン相互作用を改善できるか?
  • RQ2位相ベースの変調は、画像分類、物体検出、セマンティックセグメンテーションの各タスクにどのように影響を与えるか?
  • RQ3正確性と効率性の観点から、位相推定の最適な定式化は何か?
  • RQ4密度予測タスクにおいて、局所的ウィンドウベースの集約とグローバル集約の性能はどのように比較されるか?

主な発見

  • Wave-MLP-Sは、4.5G FLOPsでImageNetでトップ1正解率82.6%を達成し、同等の計算量下でSwin-T(81.3%)を上回った。
  • セマンティックセグメンテーションにおいて、Wave-MLP-Sは44.4%のmIoUを達成し、PVT-Tiny(39.8%)を4.6ポイント上回った。
  • アブレーションスタディの結果、位相情報の削除によりトップ1正解率が78.8%に低下し、位相情報の重要性が裏付けられた。
  • チャネル全結合を用いた位相推定は、ベースラインと比較して1.8%の正解率向上を達成し、深さ方向畳み込みや恒等写像投影を上回った。
  • ウィンドウサイズ7は、グローバル集約と同等の性能を達成したが、パラメータ数を大幅に削減でき、密度予測タスクでの利用が可能になった。
  • 可視化結果から、類似した意味的コンテンツ(例:家)を持つトークンは、小さい位相差を示し、強い相互強化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。