Skip to main content
QUICK REVIEW

[論文レビュー] DynaMixer: A Vision MLP Architecture with Dynamic Mixing

Ziyu Wang, Wenhao Jiang|arXiv (Cornell University)|Jan 28, 2022
Advanced Neural Network Applications被引用数 14
ひとこと要約

DynaMixerは、入力コンテンツに応じて混合行列を動的に生成するビジョンMLPアーキテクチャを提案する。次元削減とマルチセグメント融合を用いることで、効率性とロバスト性を向上させる。ImageNet-1Kでは97Mパラメータで84.3%のトップ1精度を達成し、26Mパラメータでは82.7%を記録。既存のMLPベースのモデルを上回る性能を発揮する。

ABSTRACT

Recently, MLP-like vision models have achieved promising performances on mainstream visual recognition tasks. In contrast with vision transformers and CNNs, the success of MLP-like models shows that simple information fusion operations among tokens and channels can yield a good representation power for deep recognition models. However, existing MLP-like models fuse tokens through static fusion operations, lacking adaptability to the contents of the tokens to be mixed. Thus, customary information fusion procedures are not effective enough. To this end, this paper presents an efficient MLP-like network architecture, dubbed DynaMixer, resorting to dynamic information fusion. Critically, we propose a procedure, on which the DynaMixer model relies, to dynamically generate mixing matrices by leveraging the contents of all the tokens to be mixed. To reduce the time complexity and improve the robustness, a dimensionality reduction technique and a multi-segment fusion mechanism are adopted. Our proposed DynaMixer model (97M parameters) achieves 84.3\% top-1 accuracy on the ImageNet-1K dataset without extra training data, performing favorably against the state-of-the-art vision MLP models. When the number of parameters is reduced to 26M, it still achieves 82.7\% top-1 accuracy, surpassing the existing MLP-like models with a similar capacity. The code is available at \url{https://github.com/ziyuwwang/DynaMixer}.

研究の動機と目的

  • 既存のMLPベースのビジョンモデルにおける固定混合行列の限界を是正すること。これには、入力コンテンツへの適応性が欠如していることが含まれる。
  • 画像トークン間の動的でコンテンツに依存する情報統合を可能にすることで、ビジョン認識における表現力の向上を図ること。
  • 混合プロセスにおける次元削減とマルチセグメント統合を通じて、計算コストの低減とロバスト性の向上を図ること。
  • 追加のトレーニングデータなしで、ImageNet-1KにおけるMLPに類似したモデルとしての最先端性能を達成すること。
  • アブレーションスタディおよび下流タスクにおける転移学習を通じて、動的混合の有効性を検証すること。

提案手法

  • DynaMixerは、統合対象のすべてのトークンの特徴を活用するコンテンツに依存するメカニズムを用いて、動的に混合行列を生成する。
  • 線形投影層により入力特徴の次元を低減し、計算コストを削減する。実験ではd=1であっても有効であることが示された。
  • トークン混合は行方向および列方向に別々に実行され、各セグメントが独立して処理されることでロバスト性が向上する。
  • 最終的な表現は、行混合、列混合、チャネル混合の成分の重み付き和であり、融合に学習可能な再重み付けが施されている。
  • 動的混合中にロバスト性と効率性を高めるために、マルチセグメント統合メカニズムを採用している。
  • 行混合と列混合の操作間でパラメータ共有を検討し、モデルサイズを小さくしつつ精度の低下を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1入力コンテンツに応じて適応する動的混合行列は、MLPベースのビジョンモデルにおける性能向上に寄与するか?
  • RQ2混合機構における特徴次元をどれほど低減できるか、性能劣化なしに?
  • RQ3マルチセグメント統合は、トークン混合におけるロバスト性と効率性を向上させるか?
  • RQ4DynaMixerは、精度およびパラメータ効率の観点から、最先端のMLPベースのモデルと比べてどのように差をつけるか?
  • RQ5各構成要素(行混合、列混合、チャネル混合、再重み付け)が最終的な性能に果たす寄与度はどの程度か?

主な発見

  • DynaMixerは97MパラメータでImageNet-1Kで84.3%のトップ1精度を達成し、MLPベースのモデルにおいて新たなSOTAを樹立した。
  • 26Mパラメータでのみ、82.7%のトップ1精度を達成し、同程度のサイズの他のMLPに類似したモデルを上回った。
  • 特徴次元をd=1にまで低減しても82.4%のトップ1精度を達成し、低次元投影でも十分な情報を保持でき、効果的な混合が可能であることを示した。
  • アブレーションスタディにより、行混合、列混合、チャネル混合、再重み付けのすべての構成要素が不可欠であることが確認された。いずれかを削除すると顕著な性能低下が生じた。
  • 行混合と列混合の間でパラメータを共有することで、モデルサイズを23Mパラメータにまで削減し、精度はわずか0.5%低下に抑え、高い性能を維持した。
  • 下流のCIFAR-10およびCIFAR-100データセットでは、DynaMixer-Sがそれぞれ98.2%および88.6%のトップ1精度を達成し、同サイズのViPおよびViTを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。